AIに「子犬」を認識させますか? Facebookは変化を感知できるAIを構築

AIに「子犬」を認識させますか? Facebookは変化を感知できるAIを構築

[[389144]]

今まで見たことのない犬種や色であっても、私たちは一目見てその犬を認識することができます。

周囲の環境の変化を感知する能力は、人間が生まれながらに持っている能力です。

しかし、人工知能システムの場合は違います。たとえSOTAレベルに達し、人間にはできない無数のタスクを完了できたとしても、人間にとっては簡単なことでも人工知能にはできないことがまだたくさんあります。たとえば、ゴールデンレトリバーに正面、横、前、後ろと角度を変えるように頼んだ場合、人工知能はそれを認識するのに苦労するかもしれません。

ディープラーニング モデルは、ピクセルとラベル間の統計パターンを解釈するのに優れていますが、多くの潜在的な自然な変動を持つオブジェクトを正しく識別するのは困難です。

あれは道路を除雪している除雪車ですか?それともスクールバスがひっくり返ったのでしょうか?

上記の画像は、MA Alcorn らによる「Strike(with)a pose: Neural networks are easily fooled by strange poses of familiar objects」に基づいており、バスを除雪車と誤分類するディープ ニューラル ネットワークを示しています。

人間はすぐに判断できますが、色、サイズ、視点などの要素が状況を複雑にし、AI モデルによる予測が難しくなります。

Facebook AI は、従来のソリューションでは大きな限界がある自然の変化をより適切に捉える方法、つまり「分離」と呼ばれるプロセスを模索してきました。また、私たちは最近、同変シフト演算子の概念も提案しました。これは、最も一般的な変換をシミュレートすることで、モデルがオブジェクトがどのように変化するかを理解できるようにする代替ソリューションの概念実証です。

現在、この分野における Facebook AI の取り組みは主に理論的なものですが、ディープラーニング モデル、特にコンピューター ビジョンには大きな可能性があります。解釈可能性と精度が向上し、小さなデータセットでトレーニングした場合でもパフォーマンスが向上し、一般化機能が向上します。 Facebook AI は、これらの貢献によりコンピューター ビジョンがさらに進歩し、視覚世界の複雑さをより深く理解できるようになることを期待しています。

現在の方法の限界

現在の分離手法では、モデル内の各要素をモデルの内部表現の個別のサブスペースにエンコードすることにより、モデル内のオブジェクトの基本的な変換を学習しようとします。

たとえば、分離により、犬の画像のデータセットがポーズ、色、品種のサブスペースにエンコードされる可能性があります。

このアプローチは、単一の MNIST 数字や椅子のような単一のオブジェクトなど、固定されたデータセット内のバリエーションを識別するのに適していますが、複数のカテゴリにまたがる分離のパフォーマンスは低いことがわかりました。

三角形や四角形など、複数の回転した形状を想像してください。分離モデルは、オブジェクトの形状と方向という 2 つの変動要因を 2 つの変動要因に分離しようとします。

下の図は、従来の分離処理では、複数の形状のデータセット全体を単独で回転させることはできないことを示しています。強調表示された形状は回転すると予想されますが、分離の失敗により、形状は固定されたままになります。

もつれを解くと、一連の多数の変換におけるもう 1 つの問題である位相的欠陥も発生します。トポロジカル欠陥は、ディープラーニング モデルの重要な特性である連続性に違反します。継続性がなければ、ディープラーニング モデルがデータ内のパターンを効果的に学習することが難しくなる可能性があります。

正三角形の回転を想像してください。 120 度回転した正三角形は元の三角形と区別がつかず、方向空間では同じ表現になります。ただし、三角形の頂点の 1 つに微小な点を追加すると、表現が識別可能になり、連続性が損なわれます。近くの画像は、より遠くにある画像にマッピングされます。 Facebook AI の研究では、位相欠陥は非対称形状やその他の多くの一般的な変形にも現れることが示されました。

等分散演算子を使用して変動係数を明らかにする

群論と呼ばれる数学の分野があり、同変演算子の応用について多くのことを教えてくれます。変動要因を直感的に理解する方法は、それらを一連の変換としてモデル化することであることが示されています。たとえば、三角形の回転にはグループ構造があり、90 度の回転と 30 度の回転を組み合わせると 120 度の回転が生成されます。

Facebook AI はこれらのアイデアを使用して、従来の分離の欠点を特定し、分離のための等分散演算子をトレーニングする方法を決定しました。我々はシフト演算子と呼ばれる同変演算子を提案します。これは、回転、平行移動、再スケーリングなどの一般的な変換のグループ構造を模倣したブロックを持つマトリックスです。次に、元の画像とその変換に基づいて AI モデルがトレーニングされます。

<<:  オックスフォード大学の科学人気記事、数分でわかる「機械学習とは何か」

>>:  アルゴリズム・ステーブルコインの流行が再び到来。このトレンドをリードするのはどれでしょうか?

ブログ    
ブログ    
ブログ    
ブログ    
ブログ    
ブログ    

推薦する

アンドリュー・ン氏がチューリングトリオに加わり、サム・アルトマン氏を非難: AI規制は「規制がないよりはまし」、ルカン氏はそれを歓迎

ほんの数日前、ベンジオ氏と他の有力者グループは、人工知能が人類の運命を危険にさらす可能性があるという...

ハッカーがAIとMLを駆使して企業を狙う方法

サイバーセキュリティは AI と ML の進歩の恩恵を受けています。今日のセキュリティ チームは、疑...

ちょっとした機械学習でウェブサイトを高速化

私の人生の 73% は、Web パフォーマンスについて考えています。低スペックの電話で 60 FPS...

コンピューターにビデオの字幕を認識させる

馬文華氏は、中国科学院自動化研究所でパターン認識と人工知能の博士号を取得しました。主に画像認識、ター...

優秀なプログラマーが開発効率を上げるために知っておくべき32のアルゴリズム

検索アルゴリズム - 指定された開始点から指定された終了点までのパスを計算するグラフ検索アルゴリズム...

Google ドキュメントでテキスト要約を自動的に生成できるようになりました。

私たちの多くは、毎日たくさんのファイルを処理する必要があります。新しい文書を受け取ったとき、通常は、...

C++ kmp アルゴリズム テンプレート コード解釈

C++ プログラミング言語でのテンプレートの適用は、比較的複雑な適用技術です。今日は、C++ kmp...

今後のAIの5大発展トレンドとは?2024年は「意味のある人工知能時代」の到来を告げる

生成型人工知能の出現により、人間と人工知能の距離は徐々に縮まっています。これまで関連技術にあまり注意...

世界で最も引用率の高い中国の AI ジャーナルではどのような研究が行われていますか?

[[410109]]人工知能(AI)研究に関しては、中国が現在最もホットな国です。清華大学人工知能...

人工知能は研究をどのように変えているのでしょうか?

人工知能 (AI) は研究プロセスにおいてますます重要な役割を果たしています。 AI ベースのアルゴ...

5分間の技術講演 | GPT-4——マルチモーダル大規模モデルの新機能と利点

パート01 GPT-3.5との違い1.1 GPT-4が入力できる単語数は25,000語に大幅に増加写...

人工知能は教育の新たな発展を促進し、これら3つの分野に大きな影響を与えます。

今年の流行語について聞かれたら、「人工知能」という言葉は誰もが知っていると思います。人工知能は多くの...

...

LSTMとトランスフォーマーの利点を組み合わせることで、DeepMindの強化学習エージェントはデータ効率を向上させます

[[423163]]近年、マルチエージェント強化学習は飛躍的な進歩を遂げています。例えば、Deep...

...