一言で言えば、ハルクに VR メガネをかけさせるのです。 4K品質。 パンダのファンタジーの旅 これは、あらゆる素晴らしいアイデアを実現できる ByteDance の最新 AI ビデオ生成モデル、 MagicVideo-V2です。 4K、8Kの超高解像度をサポートするだけでなく、さまざまな描画スタイルも簡単に保持できます。 △左から油絵風、サイバー風、デザイン風評価結果は、Gen-2、Pika、既存のAIビデオ生成ツールの結果を上回りました。 その結果、オンラインになってから24時間以内に大きな注目を集めました。たとえば、1つのツイートの閲覧回数は20万回近くに達しました。 多くのネットユーザーがその効果に驚き、 「ランウェイやピカよりもいい」とコメントする人もいた。 「ランウェイやピカよりもいい」研究者たちは実際に効果の比較を行った。出場者は、 MagicVideo-V2 、StabilityAIのSVD-XT 、新たな潜在的プレーヤーPika1.0 、RunwayのGen-2です。 ラウンド 1: 光と影の効果。
(左から右へ: 右上が MagicVideo-V2、SVD-XT、Pika、右下が Gen-2、以下同様) MagicVideo-V2、Gen-2、Pika のいずれも、明瞭な光と影があることがわかります。しかし、Pika は旅行者向けではないようですし、MagicVideo-V2 の色調はより豊かです。 第2ラウンド:状況プロットの表現。
このラウンドでは、MagicVideo-V2 と Gen-2 が明らかに優れています。 SVD-XT が提示する中景の構成は、その古さを反映してはいるものの、表現力が十分ではありません。 第3ラウンド: リアリズム。
今回はその対比がさらに顕著です。 MagicVideo-V2とSVD-XTは文章の意味を完全に反映しますが、MagicVideo-V2は子供の足の動きを詳細に見ることができます。 さらに、研究者らは、最先端の方法とMagicVideo-V2を1対1で人間に評価させました。 結果は、MagicVideo-V2 が他の方法よりもパフォーマンスが優れていると人々が考えていることを示しました。
どうやってそれを達成するのでしょうか?簡単に言えば、MagicVideo-V2 は、テキストから画像へのモデル、ビデオ モーション ジェネレーター、参照画像埋め込みモジュール、および補間モジュールを統合したビデオ生成パイプラインです。 まず、T2I モジュールがテキストに基づいて 1024×1024 の画像を生成します。次に、I2V モジュールが静止画像をアニメーション化して 600×600×32 フレームのシーケンスを生成します。次に、V2V モジュールを使用してビデオ コンテンツを強化および改善します。最後に、補間モジュールを使用してシーケンスを 94 フレームに拡張します。 このようにして、高い忠実度と時間的連続性が保証されます。 しかし、早くも2022年11月に、ByteDanceはMagicVideo V1バージョンをリリースしました。 しかし、当時は効率性が重視され、1 枚の GPU カードで 256 x 256 解像度のビデオを生成することができました。 参考リンク: |
>>: ブロックチェーン技術を活用してディープフェイク動画の脅威に対抗する方法
スタイル転送は最近人工知能の分野で注目されている研究テーマであり、Synced でも多くの関連研究が...
[[418456]]この記事は、Lee Hongyi によるチーム スタディ ブック「LeeML-...
[[237673]]画像出典: Visual Chinaワクチンは良いビジネスなのか、それとも生命...
翻訳者 |李睿レビュー | Chonglou今日、大規模言語モデル (LLM) は、言語生成から画像...
私の国の量子コンピューティングは新たな進歩をもたらしました。 USTC公式ウェブサイトからのニュース...
Chat GPTが普及して以来、さまざまなAIツールが次々と登場しました。AIの出現により、多くの...
人工知能技術の発展により、GPT-4に代表される大規模言語モデルはその強力な機能で社会に大きな影響を...
インターネット企業の中で、Google は間違いなく勝者であり、方向性をリードする企業です。同社の技...
大規模言語モデル (LLM) は、さまざまな言語タスクで優れたパフォーマンスを発揮するにもかかわらず...
より強力な AI エージェントを構築するにはどうすればよいでしょうか?答えは、彼らに完全で現実的な世...
インテリジェントインダストリー4.0の急速な発展に伴い、ますます多くの業界でロボットが手作業に代わる...
[[392763]]コンセプト簡単に言うと、再帰とは、毎回異なる変数を渡しながら、自身を呼び出すメ...
6月22日午前5時50分、国家気象センターの気象予報センターはAIを活用し、広東省の多くの地域で対...
偽の動画や画像の拡散に対する懸念は世界中で高まっており、Adobe もその懸念を共有していると述べて...
クラウド コンピューティングの自然な仲間は、ソフトウェア対応のサービス アウトソーシングと電子商取引...