人工知能は実際のデータセットを「放棄」するのか?

現在、人工知能技術は、顔認識、音声認識、仮想デジタルヒューマンなど、私たちの日常生活のあらゆる側面に応用されています。

しかし、よくある問題として、研究者が機械学習モデルをトレーニングして特定のタスク（画像分類など）を実行したい場合、大量のトレーニングデータを使用する必要があることが多いのですが、このデータ（セット）を入手するのは必ずしも簡単ではないということがあります。

たとえば、研究者が自動運転車用のコンピュータービジョンモデルをトレーニングする場合、実際のデータには高速道路を走る人間と犬のサンプルが含まれていない可能性があります。そのようなデータに遭遇すると、モデルは何をすべきか分からなくなり、不要な結果につながる可能性があります。

さらに、既存のデータを使用してデータセットを生成するには、数百万ドルの費用がかかる可能性があります。

さらに、最良のデータセットであっても、モデルのパフォーマンスに悪影響を与えるバイアスが含まれていることがよくあります。

では、データセットの取得と使用には非常にコストがかかるため、モデルのパフォーマンスを確保しながら、人工的に合成されたデータをトレーニングに使用することは可能でしょうか?

最近、マサチューセッツ工科大学 (MIT) の研究チームによる調査で、合成データでトレーニングされた画像分類機械学習モデルは、実際のデータでトレーニングされたモデルと同等か、それ以上の性能を発揮できることが示されました。

関連研究論文のタイトルは「マルチビュー表現学習のためのデータソースとしての生成モデル」は、ICLR 2022の会議論文として発表されました。

実際のデータに失われない

この特定の機械学習モデルは、生成モデルと呼ばれます。データセットと比較すると、保存や共有に必要なメモリが大幅に少なく、プライバシーや使用権に関する問題を回避できるだけでなく、従来のデータセットに存在する偏見や人種や性別の問題も発生しません。

論文によると、トレーニングプロセス中、生成モデルはまず特定のオブジェクト（車や猫など）を含む数百万枚の画像を取得し、次に車や猫の外観を学習し、最後に類似のオブジェクトを生成します。

簡単に言えば、研究者たちは事前にトレーニングされた生成モデルを使用して、モデルトレーニングデータセット内の画像に基づいて、ユニークでリアルな画像の大規模なストリームを出力しました。

（ソース： Pixabay

研究者らは、生成モデルを実際のデータでトレーニングすると、実際のデータとほとんど区別がつかない合成データを生成できると述べている。

さらに、生成モデルはトレーニングデータに基づいてさらに拡張できます。

生成モデルを車の画像でトレーニングすると、さまざまな状況で車がどのように見えるかを「想像」し、さまざまな色、サイズ、状態の車の画像を出力できます。

生成モデルの多くの利点の 1 つは、理論的には無限の数のサンプルを作成できることです。

これを基に、研究者たちはサンプル数がモデルのパフォーマンスにどのように影響するかを解明しようとした。結果は、場合によっては、固有のサンプルの数を増やすと、さらなる改善につながることを示しています。

そして、彼らの意見では、生成モデルの最も素晴らしい点は、オンラインリポジトリでそれらを見つけて使用することができ、モデルに介入することなく優れたパフォーマンスを得られることです。

しかし、生成モデルにはいくつかの欠点もあります。たとえば、場合によっては、生成モデルによってソースデータが明らかになり、プライバシーのリスクが生じる可能性があり、適切に監査されない場合は、トレーニングに使用されたデータセットのバイアスが増幅される可能性があります。

生成AIはトレンドか？

有効なデータの不足とサンプリングの偏りは、機械学習の開発における主要なボトルネックとなっています。

近年、この問題を解決するために、Generative AI が人工知能分野で注目のトピックの 1 つとなり、業界からも大きな期待が寄せられています。

ガートナーは昨年末、2022年の重要な戦略的テクノロジートレンドを発表し、生成AIを「最も魅力的で強力な人工知能テクノロジーの1つ」と呼んだ。

ガートナーによれば、生成 AI は、現在の 1% 未満から 2025 年までに生成されるデータ全体の 10% を占めると予想されています。

図 | ガートナーの2022年の重要な戦略的テクノロジートレンド（出典：ガートナー公式サイト

2020年、ガートナーが発表した「人工知能のハイプ・サイクル2020」において、生成AIが新たな技術のホットスポットとして初めて提案されました。

最新の「人工知能のハイプ・サイクル 2021」レポートでは、生成 AI は 2 ～ 5 年で成熟するテクノロジーとして登場しています。

（ソース：ガートナーの人工知能ハイプサイクル、2021年

生成 AI の画期的な点は、既存のデータ (画像、テキストなど) から学習し、新しい類似のオリジナルデータを生成できることです。つまり、判断だけでなく創造も可能であり、自動プログラミング、医薬品開発、視覚芸術、社会的交流、商業サービスなどに活用できるのです。

しかし、生成 AI は、さまざまな否定的なニュースを生み出すことが多いディープフェイクなどの詐欺、不正行為、政治的噂、個人情報の詐称などに悪用される可能性もあります。

そこで疑問になるのが、十分に優れた生成モデルがある場合でも、実際のデータセットは必要なのか、ということです。

<<: GPT-3の良き「パートナー」：この方法はモデルの劣化を軽減し、出力をより自然にします

>>: 人工知能は学習を通じて人類を自然災害から救うことができます。

Amazon SageMaker を使用した機械学習モデルのトレーニングとデプロイ

ブログ

エッジ AI で建物のシステム障害を回避

ブログ

人工知能は実際のデータセットを「放棄」するのか?

実際のデータに失われない

生成AIはトレンドか？

Amazon SageMaker を使用した機械学習モデルのトレーニングとデプロイ

MIT の FrameDiff ツールがリリースされ、AI を使用してタンパク質構造を設計し、医療開発の促進に役立てられるようになりました。

あなたは人工知能（AI）を本当に理解していますか？将来、人工知能によって多くの人が失業することになるのでしょうか？

成功する機械学習チームを構築するための 4 つのステップ

WeChat、サードパーティのエコシステムに統合するインテリジェント会話システム「Xiaowei」を発表

人工知能の時代において、中国語と英語のどちらがAIの母国語になるのでしょうか？

エッジ AI で建物のシステム障害を回避

推薦する

ロボットと人工知能の違いは何でしょうか?

ChatGPT と ReactJS を統合してよりスマートな会話型インターフェースを実現

新しいソートアルゴリズムの発明から始まる

初心者向けガイド: Numpy、Keras、PyTorch を使用した単純な線形回帰

無人バスは無人タクシーよりも信頼性が高いでしょうか?

ビジョンから現実へ: ヘルスケアにおける AI の台頭

2023年の人工知能の進歩を、大きなモデルだけでなく考察する記事

OpenAI のセキュリティ脆弱性が明らかに: ChatGPT の制限は一般的でない言語を使用することで簡単に回避可能

英国は「国家AI研究リソース」としてGPUを購入するために1億3000万ドルを費やす計画だと報じられている。

画像解析アプリケーション向けの大規模サンプルフィルタリングソリューション

Twitter が名前を X に変更し、マスク氏が X の世界を爆発させた! AIから宇宙探査まで、ユニバーサルアプリが形になりつつある