動画は徐々にテキストや画像を超え、最も広く利用されているメディア形式になったと言えます。また、ユーザーの閲覧時間の大部分を占めるため、動画の理解は特に重要です。 大手インターネット企業やトップクラスの大学が、SOTA ビデオ理解モデルとアルゴリズムの研究に知恵を絞って競い合っています。 Google、Facebook、Open-MM Labなどが独自のキラー兵器を発売した後、Facebook AIはPySlowFastを発売してから1年後にPyTorchVideoで戦場に復帰しました。 公式サイト: https://pytorchvideo.org/ 今日は、PyTorchVideo がどのようなコード ベースであるか、また、オープン ソースの日に GitHub トレンド リストでどのようにランク付けされたかを見ていきます。 PyTorchVideoはどこでも使えるここにいる他の人たちとは異なり、ビデオ コード理解フレームワークは独自のフレームワークにのみ執着しており、他のコード ベースに移行することはできません。 PyTorchVideo は、torchvision などの基本コード ライブラリと同様に、「どこでも使用できます」。 PyTorchVideo は、ビデオ理解タスクで使用できるだけでなく、他のタスクのコード ライブラリとしても使用できます。 Facebook の AI ラボの重役たちは、独自の PySlowFast コード ベースで PyTorchVideo をシームレスに使用しただけでなく、Classy Vision や PyTorch Lightening などのフレームワークにもシームレスに挿入しました。 PyTorchVideo は、恵まれた環境で誕生しました。PyTorch Lightning-Flash のビデオ理解ライブラリとして直接使用され、デフォルトで基本ライブラリとして使用されました。 FiftyOne プロジェクトでは、オープンソース コミュニティの人々が Lightning-Flash を使用して、ビデオのアクション カテゴリを直接表示できるビデオ閲覧ツールボックスを作成しました。 51: https://medium.com/pytorch/ushering-in-the-new-age-of-video-understanding-with-pytorch-1d85078e8015 PyTorchVideoは何でもできるさらに驚くべきことは、PyTorchVideo は「何でもできる」ということです。ビデオ分類やアクション検出などのタスクで SOTA 結果を達成しただけではありません。 このAIは、LeCun氏のお気に入りの自己教師あり学習や、オーディオイベント検出などのさまざまな奇妙なタスクを「少しだけ理解」しています。 PyTorchVideo の SlowFast モデルに基づくアクション監視 PyTorchVideoは携帯電話でも再生可能さらに驚くべきことは、PyTorchVideo がモバイル アクセラレーションの最適化もオープンソース化しており、ステップ バイ ステップのチュートリアルを提供しているだけでなく、ビデオ モデルのコア カーネルを段階的に最適化し、アクセラレーションを量子化していることです。 数倍の高速化を経て、モバイルデバイス上でリアルタイムに動作します。公式はAndroidとiOSモバイル端末向けのオープンソースコードも直接リリースしており、SOTAビデオモデルを携帯電話に直接インストールして楽しむことができます。 PyTorchVideo は、Samsung Galaxy S10 スマートフォンで実行される X3D モデルを高速化し、8 倍の速度で実行し、1 秒間のビデオを約 130 ミリ秒で処理します。 PyTorchVideoとはPyTorchVideo の正体は、さまざまなコード ベース、さまざまな SOTA ビデオ モデル、オープン ソース ビデオ モデルに対応できるビデオ理解用の機械学習ライブラリです。 さらに、さまざまな基本的なビデオ アルゴリズム、ビデオ データ操作、さまざまな一般的なビデオ データ セット、ビデオ拡張、ビデオ モデルの高速化と量子化、およびその他のフルスタックのビデオ関連コンテンツも含まれます。 PyTorchVideoの遊び方まずそれを潰します。
その後、公式チュートリアルを閲覧して実験してみたところ、PyTorchVideo でビデオ モデルをトレーニングするには、わずか数行しかかからないことがわかりました。
では、オープンソースのトレーニング モデル ライブラリから直接モデルを使用するとどのような効果があるのでしょうか?
公式モデルライブラリは非常に豊富で、ただただ驚嘆するばかりです。 キネティクス-400
サムシングサムシングV2
ジェスチャーゲーム
アヴァ(V2.2)
PyTorchVideo を搭載した Lightning Flash でも、ビデオの分類には 3 行しかかかりません。
公式ブログによると、PyTorchVideo は、ICCV、ICML などに最近登場した Facebook の人工知能研究所の成果を含む、多数のビデオ モデルをオープンソース化している。
MultiScale Vision Transform もその中にあるようです。興味のある友人は調べてみてください。 |
<<: スタンフォード大学の中国人博士、フェイフェイ・リー氏は、スライドモデルを提案し、NVIDIAと共同で汎用人工知能を研究した。
>>: 2021 年の人工知能の 4 つのビジネス アプリケーション
この記事はLeiphone.comから転載したものです。転載する場合は、Leiphone.com公式...
[[198229]]転移学習転移学習とは、ある問題で訓練したモデルを、簡単な調整で新しい問題に適した...
LLM アーキテクチャに固有のメモリ制限により、生成は遅く、コストがかかります。この点に関して、多く...
有名な作曲家スティーブン・シュワルツはピアノの鍵盤に色を見ました。伝説の歌手トーリ・エイモスは彼女の...
博士号取得のために勉強するべきか、しないべきか、それが問題だ。 [[354586]]博士号を取得すべ...
画像処理技術の急速な発展に伴い、画像認識技術が生まれ、発展し、徐々に人工知能分野の重要な部分となり、...
通常、画像処理ソフトウェアには、画像にぼかし効果を加えるための「ぼかし」フィルターが用意されています...
こんにちは、皆さん。私は Luga です。今日は、人工知能 (AI) エコシステムに関連するテクノロ...
12月18日、Businessinsiderによると、大規模なAIモデルは現在、人間の介入なしに完全...
LEACH プロトコルについてはあまり知られていないかもしれません。このプロトコルの説明は、低電力適...
オラクルが市場調査会社ウェイクフィールド・リサーチおよびニューヨークに拠点を置く小売コンサルティング...
Chen Danqi のチームは、新しい LLMコンテキスト ウィンドウ拡張メソッドをリリースしまし...