1.4GB 未満のビデオ メモリで 10,000 フレームのビデオをセグメント化します。コードは現在オープン ソースです。

1.4GB 未満のビデオ メモリで 10,000 フレームのビデオをセグメント化します。コードは現在オープン ソースです。

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載しています。転載の際は出典元にご連絡ください。

なあ、藤原千花はなんで急に「高温レッドバージョン」になったんだ?

この大きな紫色の手はサノスの生まれ変わりなのでしょうか? ?

上記の効果が単にオブジェクトの後処理による色付けだと考えているなら、あなたは AI に騙されています。

これらの奇妙な色は、実際にはビデオ オブジェクトのセグメンテーションを表しています。

しかし、u1s1、この効果は一見すると本当にわかりにくいです。

可愛い女の子の髪が舞い散ったり、

または、タオルの形状が変わり、物体が互いに遮られることがあります。

AI によるターゲットのセグメンテーションは、まるで色が「溶接」されているかのようにシームレスであると言えます。

この方法は、オブジェクトを高精度にセグメント化できるだけでなく、 10,000 フレームを超えるビデオを処理することもできます。

さらに、セグメンテーション効果は常に同じレベルに保たれ、ビデオの後半部分は依然としてスムーズで繊細です。

さらに驚くべきことは、この方法では高い GPU 要件が必要ないことです。

研究者らは、実験中、この方法では1.4GBを超える GPU メモリが消費されることはなかったと述べています。

現在のアテンション メカニズムに基づく同様の方法では、一般的な消費者向けグラフィック カードでは 1 分を超えるビデオを処理することすらできないことに注意してください。

これは、イリノイ大学アーバナ・シャンペーン校の学者によって最近提案された、長時間ビデオ オブジェクト分割方法XMemです。

ECCV 2022に承認され、コードはオープンソース化されました。

このような滑らかな効果は、Reddit で多くのネットユーザーを魅了し、人気は 800 を超えました。

ネットユーザーは冗談を言っている。

なぜ手を紫色に塗るのですか?

サノスがコンピュータービジョンを趣味としているかどうか知っている人はいますか?

人間の記憶を模倣する

既存のビデオ オブジェクト セグメンテーション方法は多数ありますが、処理速度が遅かったり、GPU に対する要件が高かったり、精度が十分でなかったりします。

本論文で提案する方法は、上記3つの側面を考慮していると言えます。

長い動画内のオブジェクトを素早くセグメント化できるだけでなく、フレームレートは 20FPS に達し、通常の GPU でも完了できます。

特別なのは、人間の記憶パターンにインスピレーションを得ていることです。

1968年、心理学者のアトキンソンとシフリンはアトキンソン-シフリン記憶モデルを提唱しました。

このモデルでは、人間の記憶は瞬間記憶、短期記憶、長期記憶の 3 つのモードに分けられると考えられています。

研究者らは上記のモデルを参考に、AIフレームワークを3つのメモリモードに分割しました。彼らです:

  • リアルタイムで更新される瞬時メモリ
  • 高解像度のワーキングメモリ
  • 高密度の長期記憶。

このうち一時メモリは、画像内の画像情報を記録するためにフレームごとに 1 回更新されます。

作業メモリは一時メモリから画像情報を収集し、r フレームごとに更新されます。

作業記憶が飽和すると、圧縮されて長期記憶に移されます。

長期記憶が飽和状態になると、古くなった特徴は時間の経過とともに忘れ去られます。通常、これは数千のフレームを処理した後に発生します。

こうすることで、時間の経過とともに GPU メモリが不足することがなくなります。

通常、ビデオ内のオブジェクトのセグメンテーションは、最初のフレームに画像とオブジェクト マスクを指定して実行され、その後、モデルが関連するオブジェクトを追跡し、後続のフレームに対応するマスクを生成します。

具体的には、XMem が 1 つのフレームを処理するプロセスは次のとおりです。

AI フレームワーク全体は、3 つのエンドツーエンドの畳み込みネットワークで構成されています。

クエリ エンコーダーは、クエリ固有の画像機能を追跡および抽出するために使用されます。

デコーダーは、メモリ読み取りステップの出力を取得してオブジェクト マスクを生成する役割を担います。

値エンコーダーは、画像とターゲット マスクを組み合わせて、新しいメモリ機能を抽出します。

最終値エンコーダーによって抽出された特徴値は作業メモリに追加されます。

実験結果から判断すると、この方法は短いビデオと長いビデオの両方で SOTA を達成しました。

長いビデオを処理する場合、フレーム数が増えても XMem のパフォーマンスは低下しません。

研究チーム

著者の一人は中国人のHo Kei (Rex) Chengです。

彼は香港科技大学で修士号を取得し、現在はイリノイ大学アーバナ・シャンペーン校で博士課程に在籍しています。

彼の研究分野はコンピュータービジョンです。

彼の論文のいくつかは、CVPR、NeurIPS、ECCV などのトップカンファレンスで採択されています。

もう一人の著者は Alexander G. Schwing です。

彼は現在、イリノイ大学アーバナ・シャンペーン校の助教授であり、ETHチューリッヒで博士号を取得しています。

彼の研究対象には機械学習とコンピュータービジョンが含まれます。

論文の宛先:
https://arxiv.org/abs/2207.07115

GitHub:
https://github.com/hkchengrex/XMem

<<:  気温を下げて干ばつを緩和するブラックテクノロジーが多数存在します。人工降雨の謎とは?

>>:  農業ロボットは好機を迎え、10億ドル規模のビジネスになりつつある

ブログ    
ブログ    
ブログ    
ブログ    

推薦する

...

画期的なニューラルネットワークが量子AI研究への道を開く可能性

海外メディアの報道によると、イタリアの研究者らは最近、量子コンピュータ上で特殊なアルゴリズムを実行す...

...

自動運転は飛躍的な進歩を遂げており、マスク氏は年内にL5レベルの自動運転が実現すると発言した。

自動運転技術は、世界中の大手自動車メーカーの主要な研究開発方向となっています。現在、多くの自動車メー...

Google の最新画像処理ソフトウェア Imagen 2 がリリースされ、実機テストでは DALL·E 3 や Midjourney に勝利しました。

質問: 下の画像は AI によって生成された画像ですか、それとも写真ですか?この質問をしなければ、ほ...

AI + スマート交通が全体のアップグレードと調整を実現

[[353150]]人工知能は、人間のように知覚、認識、決定、実行できる人工プログラムまたはシステム...

言語学における人工知能技術の応用

1990年代初頭、中国の著名な学者である周海中氏は、人工知能技術がさまざまな分野で広く使用され、予想...

私の国のロボット産業には隠れた懸念があります。すべての関係者が協力して高品質の開発を推進します

近年、我が国のロボット産業は急速な発展傾向を示していますが、一方で、中核技術の弱さや粗利益率の低下な...

GPT-X に基づく製品コピーライティングと画像生成の実践

I. はじめに1. 2022年末に人気が高まったOpenAIとAIGC 2022年はAIの歴史におい...

...

マスク氏の「超高速鉄道」の夢は米国で打ち砕かれる!スタースタートアップ企業が破産を発表、10年間受注ゼロ

突然、花形「超高速鉄道」企業ハイパーループ・ワンが倒産し、従業員の大半を解雇し、12月31日に完全に...

...

中国の顔認識技術が世界を震撼させている! (顔認証調査報告書を添付します)

顔認識は皆さんもよくご存知だと思います。過去2年間、顔認識技術の急速な発展に伴い、「顔スキャン」は徐...

人工知能が高等教育を支援する:変化と持続

[[434825]]人工知能が教育に浸透する中で、我々は「静をもって動を制御する」という決意を持ち、...