注意を注入すると精度が 30% 向上します。 Google が最新の多目的「ダイナミック カットアウト」モデルをリリース

注意を注入すると精度が 30% 向上します。 Google が最新の多目的「ダイナミック カットアウト」モデルをリリース

[[437774]]

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載しています。転載の際は出典元にご連絡ください。

画像の最初のフレームと境界のヒントだけで、ビデオ内のオブジェクトを「切り取り」その軌跡を追跡できます。

上記はGoogleの最新の研究結果です。

この方法は、ビデオに注目メカニズムを導入することで、教師なし学習を使用した従来のマルチターゲットセグメンテーションおよび追跡方法の欠点の一部をうまく解決します。

今では、より多様で視覚的に複雑なビデオに一般化できるだけでなく、より長いビデオシーケンスも処理できるようになりました。

実験では、以前のモデルと比較して、Google の新しい方法により、MOVi データセットの mIoU が約 30%直接改善されることも判明しました。

「ダイナミックカットアウト」の注目メカニズムの紹介

この方法はSAVi (Slot Attention for Video) と呼ばれます。

これまでの教師なしオブジェクトセグメンテーションおよび追跡方法の最大の問題は、非常に単純なビデオにしか適用できないことです。

より複雑な視覚効果を持つビデオを処理するために、SAVi は弱教師あり学習を使用します。

(1)オプティカルフロー予測を訓練目標とし、注意メカニズムを導入する。

(2)セグメンテーションのガイダンスを提供するために、最初のフレーム(通常はセグメンテーションされるフレーム、またはオブジェクト上の単一点の座標)に初期ヒントを与えます。

具体的には、常微分方程式に対する「予測子-修正子」アプローチにヒントを得て、SAVi は可視ビデオ フレームごとに予測と修正の手順を実行します。

他のオブジェクトとの相互作用を含む、時間の経過に伴うビデオ オブジェクトの状態を記述するために、SAVi はオプティカル フロー予測を行うときにスロット間の自己注意を使用します。

スロットとは、ビデオ内の異なる色で区別されるオブジェクトのことです。

修正フェーズでは、入力とのスロット正規化クロスアテンションを使用して、スロット表現セットを修正 (更新) します。

次に、予測子の出力を使用して時間の経過とともに補正子を初期化し、モデルが最終的に時間の経過とともに一貫した方法でオブジェクトを追跡できるようにします。

△ SAViモデルアーキテクチャ図

トレーニング中、各ビデオは 6 つの 6 フレームのサブシーケンスに分割され、最初のフレームはキュー信号を受信し、フレームごとに 2 ラウンドのスロット アテンションを受け取ります。

完全に教師なしのビデオセグメンテーションでは、研究者らはバッチサイズ 64 で 100,000 ステップのトレーニングを行いました。

プロンプトがなくても、簡単なビデオセグメンテーションとトラッキングを実行できます。

CATER データセットでは、テストにより、SAVi アーキテクチャが教師なしオブジェクト表現学習に完全に適用可能であることが示されています。

オプティカルフロー条件の監視下で、SAVi は MOVi データセットで 72.1% mIoU を達成しました。これは、ベースライン モデル CRW および T-VOS よりもそれぞれ約 30% と 20% 高い値です

SAVi は MOVi++ データセットで 45.9% の mIoU スコアを達成しました。これは T-VOS よりわずかに高く、CRW より 5% 低い値です。

さらに、最初のフレームに重心の形でヒントを与えることは、境界ボックスよりもわずかに優れていることがわかりますが、その差は大きくありません。

ヒントがなくても、この方法では Sketchy データセットなどの単純なテクスチャを使用していくつかの動的なシーンをセグメント化できることは注目に値します。

ただし、SAVi を複雑な現実世界のビデオに完全に適用するには、克服すべき課題がまだいくつかあります。

1. 使用されるトレーニング方法では、トレーニング中に時間フロー情報が利用可能であると想定していますが、実際のビデオではそうではありません。

2. この研究はいくつかの単純な物体の基本的な動きを扱っていますが、現実はこれよりもはるかに複雑です

最後に、著者らは、SAVi はセグメンテーションと追跡において依然として優れたパフォーマンスを発揮し、最初のフレームでヒントを提供するという実践は、関連するさまざまな半教師あり手法にもつながる可能性があると述べました

論文の宛先:
https://arxiv.org/abs.2111.12594

<<:  AIがKing of GloryやStarCraftをプレイしています...その背後にあるテクノロジーを理解していないのですか?ゲームAIのレビューはこちら

>>:  将来、人工知能によって一般の人々は職を失うことになるのでしょうか?マスク氏の答えを見てください。

ブログ    
ブログ    

推薦する

電源なしで形を変えるソフトロボット「ロールボット」

海外メディアの報道によると、ハーバード大学ジョン・A・ポールソン工学・応用科学大学院(SEAS)とカ...

人工知能とモノのインターネットはどこへ向かうのでしょうか?

モノのインターネットは私たちの日常生活を再構築するのに役立つテクノロジーですが、IoT がその可能性...

...

9月9日がまたやってきました。重陽の節句にスマートテクノロジーについてお話しましょう。

[[428874]]現代では、社会の発展と時代の進歩に伴い、伝統と現代の衝突、古典と革新の融合が、...

NLP を上手に使いこなすには、適切な「武器」が必要です。GLUE で 1 位にランクされている武器をご存知ですか?

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...

2020年に人工知能はどのように発展するでしょうか?知っておくべき6つのトレンド

過去1年を振り返ると、人工知能の発展は繁栄し、多彩なものであったと言えます。人工知能が3回連続で政府...

AI向けに構築されたコンピューターに最適なアクセサリと外部コンポーネント

[[435844]]人工知能用に構築されたコンピュータ システムに最適なアクセサリとコンポーネントは...

顔認識技術を乱用しないでください

[[415783]]最高人民法院は最近、「顔認識技術を用いた個人情報処理に関する民事訴訟における法律...

ボストンスポットのミニバージョンを実現するための 3000 行のコード: 殺せないゴキブリになりたい!

ボストンのロボット犬はしばらく前から販売されているが、価格は少々魅力的ではない。インターネット上には...

...

...

強化学習とゲーム理論を活用して、EAのテストAIは賢いものになった

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...

OpenAIがテキストから動画を生成するAIジェネレーター「Sora」をリリース

OpenAI が Sora をリリースし、テキストからビデオへの AI コンテンツ生成競争に参入。 ...

ディープラーニングを超える新しいAIプログラミング言語Genについて1つの記事で学びましょう

AI の急速な発展は多くの人々の学習意欲をかき立てていますが、初心者にとっては大量の手動プログラミン...