声を上げてください! MakeItTalkの魔法でモナリザと会話できる

声を上げてください! MakeItTalkの魔法でモナリザと会話できる

最近、マサチューセッツ大学アマースト校のヤン・チョウ博士とそのチームは、「MakeItTalk」と呼ばれる深い構造を持つ新しい方法を提案しました。音声信号とポートレート画像を入力として与えると、モデルは話者の知覚の音声アニメーション グラフを生成します。

誰もが表現力豊かなアニメーションを望んでいます!

フェイシャルアニメーションは、映画制作、ビデオストリーミング、コンピューターゲーム、仮想アバターなど、多くの分野で重要な技術です。

数多くの技術的成果があるにもかかわらず、リアルな顔のアニメーションを作成することは、コンピューター グラフィックスにおいて依然として課題となっています。

まず、顔の表情全体には顔全体のすべての部分の相互関係が含まれており、高次元のマルチイメージでは顔の​​ダイナミクスが支配的であり、その中でも頭の姿勢が最も重要であるため、顔の動きと発話の調整は困難な作業です。

第二に、話し手はそれぞれ話し方が異なり、唇を一貫してコントロールするだけでは話し手の性格を理解するだけでなく、さまざまな個性を表現することもできます。

上記の問題に対処するために、Yang Zhou 博士と彼のチームは、「MakeItTalk」と呼ばれる深い構造を持つ新しい方法を提案しました。

これは、入力としてオーディオと顔の画像のみを必要とする、深いアーキテクチャを備えた新しい方法で、プログラムはリアルな「トーキングヘッドアニメーション」を出力します。

次に、MakeItTalk がどのようにして写真を「話させる」のかを見てみましょう。

声を上げてください!魔法の MakeItTalk とは何ですか?

MakeItTalk は、顔の特徴、顎、頭の姿勢、眉毛、鼻を認識し、音刺激によって唇を変化させることができる、新しいディープラーニングベースのアーキテクチャです。

このモデルは LSTM と CNN に基づいており、話者の口調や内容に合わせて表情や頭の動きを変化させることができます。

[[347123]]

基本的に、MakeItTalk は入力オーディオ信号からコンテンツとスピーカーを分離し、結果として得られる抽象表現から対応するアニメーションを抽出します。

唇と隣接する顔との調整も特に重要です。話者の情報は、表情豊かな頭部アニメーションを生成するために必要な他の表情や頭部の動きを取得するために使用されます。

MakeItTalk モデルは、リアルな人間の顔の会話画像と非リアルな漫画の会話画像の両方を生成できます。

音+画像=「話す」? MakeItTalk はどのようにそれを実現するのでしょうか?

次の図は、リアルな話し手を生成するための完全な方法とアプローチを示しています。

(1)音声クリップと単一の顔画像を使用して、音声と連動した話者認識ヘッドアニメーションを作成できます。

(2)トレーニング段階では、市販の顔検出器を使用して入力ビデオを前処理し、マーカーを抽出します。入力オーディオから基本モデルをトレーニングして、音声コンテンツをアニメーションとマーカーに正確に抽出します。

(3)高精度な動きを得るために、入力音声信号の内容と話者の埋め込みを分離してランドマークの推定を行う。この目的のために、音声変換ニューラル ネットワークを使用して音声コンテンツを抽出し、音声コンテンツを検出します。

(4)内容は話者に依存せず、唇と隣接部分の共通の動きを捉えており、発話内容は動きの特徴と話者の頭部の動きの残りの部分を変調している。

(5)誰がその単語を発したか、つまり話者のアイデンティティに応じて、目、鼻、頭が動くにつれて唇の大きさと形が広がります。

(6)最後に、変換された画像を生成するために、MakeItTalkはラベルから画像を合成するための2つのアルゴリズムを使用します。

キャンバス アートやベクター アートなどの非フォトリアリスティックな画像の場合、ドロネー三角形分割に基づいた特定の歪み方法が適用されます。

リアルな画像の場合、自然な顔を直接変換する画像間変換ネットワーク(pix2pix と同じ)を構築します。

最後に、すべての画像フレームとオーディオがミックスされ、ヘッドアニメーションが生成されます。

著者について

このプロジェクトの作者は、上海交通大学で電子工学の学士号を取得し、その後ジョージア工科大学で修士号を取得し、現在はマサチューセッツ大学アマースト校のコンピュータグラフィックス科学研究グループでコンピュータサイエンスの博士課程に在籍しています。

[[347127]]

著者のホームページのアバターも様式化されている

Yang Zhou はコンピューターグラフィックスと機械学習の分野で働いています。主に、ディープラーニング技術を使用して、アーティスト、スタイリスト、アニメーターがより良いデザインを作成できるようにすることに重点を置いています。

デザインに AI 遺伝子も追加したい場合は、Yang Zhou の論文リストが間違いなく良い選択です。アニメーション生成とマルチモーダルディープラーニングに関する研究は数多くあります。

<<:  この履歴書はAIの助けを借りて作成されたことが判明しました。 !

>>:  本番環境のMLを再現できない場合は、ワークフローに問題がある可能性があります。

ブログ    
ブログ    
ブログ    
ブログ    

推薦する

将来のAIの世界における興味深い仕事

現在、人工知能 (AI) システムは反復的で非創造的なタスクを実行するのが得意ですが、スクリプトから...

...

AIのおかげで、これら5つの業界の求人需要は大幅な成長傾向を示すだろう

編集者注: 人工知能と人間の仕事は、今日多くの人が話題にしているトピックであり、議論の焦点は主に、人...

ChatGPTは個人のカスタマイズをサポートします!長いプロンプトに別れを告げ、まずは自己紹介をしましょう

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...

AI が公共安全活動を支援する独創的な方法

翻訳者 | 劉涛レビュー | Chonglouソフトウェア技術の発展は確かに大きな進歩を遂げました。...

ディープラーニングにも欠陥があり、同質のAIスタートアップ間の競争は熾烈になるだろう

[[186262]]この人工知能の波は急速に到来し、画像認識、音声認識、自動運転など、多くの難題を次...

人間とコンピュータのインタラクションにおける状況認識

狭義の人間とコンピュータの相互作用(ヒューマン・コンピュータ・インタラクション)であろうと、広義の人...

...

...

VGG畳み込みニューラルネットワークモデル分析

1: VGGの紹介とモデル構造VGGはVisual Geometry Groupの略で、オックスフォ...

2D ガール ジェネレーター、駆動可能なニューラル ネットワーク... 2019 年の優れた機械学習プロジェクト 17 選

2019 年のベスト オープンソース プロジェクトを選択するために、Medium のネットユーザーが...

Douyinのユーザーは皆、地元の方言を話しています。2つの重要な技術が、地元の方言を「理解」するのに役立ちます。

国慶節の連休中、Douyinの「方言一つで故郷の出身者と証明」というアクティビティが全国のネットユー...

GPT-4 はハイブリッド大規模モデルを使用しますか?研究により、MoE+命令チューニングにより大規模モデルのパフォーマンスが向上することが証明された

GPT-4 の登場以来、優れた言語理解、生成、論理的推論など、その強力な創発能力に人々は驚嘆してきま...

調査によると、AIツールは企業の従業員が年間約400時間を節約するのに役立つことがわかった

7月10日、人材分析・計画会社Visierは、英国、米国、カナダ、ドイツの250社以上の企業の従業員...