AI 生成ビデオにもう一つ大きな爆弾があるのでしょうか?アリ・エモはレオがラップし、ガオ・チチアンが法律を広めるなど、素晴らしいデビューを果たした。

執筆者 | Yifeng

2月中、ソラは当然のAIスターとなり、彼が公開した2つのAIビデオは数え切れないほどの注目を集めました。 2月末に、私たちを驚かせる別のビデオ世代の「出場者」が現れるとは予想していませんでした。

それがアリババの新しいビデオ生成フレームワーク、EMO（Emote Portrait Alive）です。 EMO は拡散モデルに基づいており、画像と音声のみを提供することで表現力豊かなポートレート動画を生成できます。公開されたビデオから判断すると、EMO はポートレートの動き、唇の形、表情の生成に優れており、Sora と同じ豊かな「プレイアビリティ」を示し、あらゆる種類の想像力豊かで創造的なビデオを多数完成させることができます。

エモ感あふれる肖像画は、歌ったり、セリフを話したり、さらにはラップをしたりすることもできます。サンプルビデオでは、EMOの多様な生成能力と優れた実装効果が紹介されており、アリババチームによる「公式アクティビティ」も多数含まれています。

EMO を使えば、モナリザがただ神秘的に微笑むだけでなく、人気曲「花」を心を込めて歌ったり、蔡旭坤が早口を披露してエミネムに匹敵する「ラップの神」になったり、悪役の高其強が心機一転して法学教育チームに参加したりと、あらゆる動画が想像力に満ちていると言わざるを得ません。

1. 歌うことにこだわれば、誰もが歌手になれる

写真に描かれた AI によって生成されたモナリザは、神秘的で静かな山々に囲まれており、遠くには果てしなく広がる緑の植物と道路が広がっています。こんなに美しい景色に囲まれて、モナ・リザはマイリー・サイラスの「Flowers」を歌わずにはいられませんでした。モナ・リザが恍惚とした表情で歌うとき、彼女は自信に満ちた笑顔を見せるだけでなく、ときどき目を閉じて歌に完全に没頭し、聴く人に非常にリアルな視聴覚体験を与えます。

ソラのビデオでパリの街を歩く革ジャンの女性も、EMO生成効果を体験しました。この動画では、「そらさん」が自然に首を動かすだけでなく、力を入れたときの眉毛の動きや呼吸の感じにもとても驚かされます。さらに、EMOはイヤリングの揺れやサングラスの映り込みまでもリアルに再現しています。

2. 2次元から3次元まで、複数の言語を歌える

動画では、銀髪と緑の瞳を持つ繊細な少女が太陽に向かって、寧一卓のカバーバージョン「Melody」を歌い、中国語と英語を自然かつスムーズに切り替えている。このビデオを動かす画像も AI によって生成されていますが、全体的な効果は本物の美しいアンカーのようなものであることは特筆に値します。

写真の「兄弟」レスリー・チャンはイーソンの曲「Unconditional」を歌っている。一部のネットユーザーは、この動画はEMOが広東語を話すときに生成する唇の動きが十分に自然ではないことを明らかにしていると考えている。この動画を見ると、音と映像がずれているように感じるのではないでしょうか。もちろん、この動画での兄弟の喜びとポジティブな感情は、「Unconditional」の歌詞の感情的なトーンとは矛盾しており、それが私たちが「何かがおかしい」と感じる理由の1つかもしれません。

3. ラップの神様のように、欠点を一切残さずに速く話す

動画では、まだおじさんになっていないハンサムなバージョンの「レオ」が、エミネムの「GODZILLA」を歌っている。運転中の映像から判断すると、肖像画のキャラクターの表情がラップのリズムと自然に調和しており、途中の休止時の表情も非常に伝染性がある。

以下のビデオは

過去は歌のようなもの

クンクンに「ラップ神」を歌ってもらうことほど抽象的な行為はない。どういうわけか、両方のラップ例ではエミネムの曲が選ばれており、これもアリババチームが自分たちのスキルを披露するための方法なのかもしれません。

4. 対話も成り立ち、悪人に対する法律の普及も夢ではない

このビデオでは、2008年の映画「ダークナイト」のジョッカーの有名なセリフ「なぜそんなに深刻なんだ？その顔に笑顔を浮かべよう」が使われ、2019年版のジョッカーを動かしている。ピエロの顔のペイントは筋肉の動きに合わせて自然に動きます。

このビデオは、強兄弟と「無法者張三」を結びつけています。動画では、高其強さんが「緊急ヘッジ」の概念をみんなに説明しています。どうやら、高其強兄さんは飢え死にしそうな時、魚を食べるだけでなく、パンダや金色の猿も食べるそうです。

動画ソース: https://humanaigc.github.io/emote-portrait-alive/

<<: GPT をゼロから構築するための 60 行のコード!最も完全な実践ガイドはここにあります

>>: 「概念のドリフト」問題と闘おう！ Google が新しい時間認識フレームワークをリリース: 画像認識精度が 15% 向上

Midjourneyの隠されたスキルをアンロックする：プロンプトを変更すると、4つの正方形のグリッドが「分裂」します

AI 生成ビデオにもう一つ大きな爆弾があるのでしょうか?アリ・エモはレオがラップし、ガオ・チチアンが法律を広めるなど、素晴らしいデビューを果たした。

1. 歌うことにこだわれば、誰もが歌手になれる

2. 2次元から3次元まで、複数の言語を歌える

3. ラップの神様のように、欠点を一切残さずに速く話す

4. 対話も成り立ち、悪人に対する法律の普及も夢ではない

Midjourneyの隠されたスキルをアンロックする：プロンプトを変更すると、4つの正方形のグリッドが「分裂」します

筋肉の震えもはっきりと見えます！ 3D人体モデル自動生成アルゴリズム、第一著者北京大学チューリングクラス

物流における人工知能の重要な役割

ボストン・ダイナミクスが伝染病と戦うために犬を派遣：頭にはiPad、背中にはトランシーバー、価格性能比は本当に大丈夫なのか？

大規模モデルのトレーニングコストがほぼ半分に削減されます。シンガポール国立大学の最新の最適化ツールが現在使用されています

MIT、「上級数学」ソルバーの強化版をリリース：7つのコースの正解率は81%

OpenAIがMicrosoftに反旗を翻す！アルトマン氏が「ChatGPTのカスタマイズ」を企む。AI市場の未来はまた変わるのか？

海雲捷迅2018ビッグデータ博覧会ツアー——2018ビッグデータ博覧会人工知能世界大会決勝戦が終了

AI を使って亡くなった愛する人を「復活」させることができるとしたら、そうしたいですか?

推薦する

顔を変える技術の悪用に対抗するため、Googleはディープフェイクと戦うための大規模なデータセットを公開

OpenAI: ChatGPTはクローラープロトコルに準拠し、ウェブサイトは無料での使用を拒否できる

単一画像超解像におけるディープラーニングの応用: SRCNN、知覚損失、SRResNet

機械学習を実装するには？

製造業に人工知能を適用するにはどうすればよいでしょうか?

年次指数レポートではAIが「産業化」しているが、より優れた指標とテストが必要とされている

単純なアルゴリズム問題からO(1)が何を意味するかを説明する

1800億パラメータ、世界最高峰のオープンソース大型モデルFalconが正式発表！ Crush LLaMA 2、GPT-4に近いパフォーマンス

マシンビジョンは人工知能を複数の業界に根付かせる

「AI as a Service」は、業界における人工知能の応用シナリオです。

世界初の電動ロボットが「宙返り」を練習し、ボストン・ダイナミクス・アトラスに挑戦！コーヒーアートも作れます。