何が起こっているのか? アリは新しい仕事を思いついたようです—— MotionShop では、他のシーンやキャラクターを変更することなく、ビデオ内のキャラクターを 3D 画像に置き換えることができます。 たとえば、移民労働者のピグレットは太極拳を練習しています。 これを見て、待ちきれない人もいるでしょう。現在、ModelScope コミュニティで試用できます。 HuggingFace で手配したらどうかと提案する人もいましたが、そうしないと中国語がわからない人はどうなるのでしょうか? しかし、アリババが最近、多くの派手なことをやっていることは認めざるを得ません。 無料トライアルありMotionShop は現在無料トライアルが利用可能で、わずか 3 つのステップで完了します。 ビデオをアップロードし、対象オブジェクトを決定し、置き換える仮想オブジェクトを選択します。 しかし、実際にテストしてみると、いくつか注意すべき点があることがわかりました。 まず、15 秒以内のビデオをアップロードします。文字が完全で、編集できないことを確認してください。 つまり、ショット全体を 1 回の撮影で撮影する必要があり、レンズを切り替えることはできません。 次に人物を置き換えることを選択すると、オブジェクトが自動的に選択され、それがターゲット オブジェクトと一致するかどうかが確認されます。 現在、交換可能なアバターは 4 つだけです。 最後に、行列の待ち時間がかなり長いです...おそらく試す人が多すぎるからでしょう。 どうやってそれを達成するのでしょうか?アリババの研究チームは、動画内のキャラクターを3Dの人物に置き換えるフレームワークを提案した。 フレームワーク全体は 2 つの部分で構成されます。 1. 背景ビデオシーケンスを抽出および修復するためのビデオ処理パイプライン。 2. 3D キャラクター ビデオのシーケンスを生成するためのポーズ推定およびレンダリング パイプライン。 2つのパイプラインを並列に実行し、高性能レイトレーシングレンダラーTIDEを使用することで、プロセス全体を 7つのステップに分かれています。 最初のステップは文字の検出です。テキスト情報と既存のクローズドセット検出器のトランスフォーマーベースの融合を使用して、ゼロショットのオブジェクト検出を実現します。最終的なターゲット領域は、優位性選択法によって決定されました。 2 番目のステップはセグメンテーションと追跡です。ターゲットの検出に成功した後、SAM モデルの改良とアップグレードであるビデオ オブジェクトのセグメンテーションと追跡方法を使用して、ターゲット領域をピクセル レベルで追跡します。 ステップ3、修復。ビデオの残りの領域は修復されます。これには、損傷したフロー フィールドを復元するための再帰フロー完了メソッドの使用と、画像ドメインとフィーチャ ドメインの両方でのデュアル ドメイン伝播メソッドの使用による、グローバルおよびローカルの時間的一貫性の向上が含まれます。 4番目のステップは姿勢の推定です。姿勢推定法 CVFFS は、安定した人間の姿勢を推定するために使用されます。 SMPL 人体モデルは、3 次元の人体を表現するために使用されます。 ステップ 5: 3D キャラクターを生成します。推定された形状とポーズを選択した 3D モデルに再投影します。 ステップ 6: より自然でリアルな視覚効果を実現するために、さらに光の処理とレンダリングを実行し、3D モデルを元のビデオとより統合します。たとえば、TIDE エンジンを使用して新しい 3D モデルをレンダリングします。精密なマテリアル システムと組み合わせられ、モーション ブラー、時間的アンチエイリアシング、時間的ノイズ除去などのアルゴリズムによってサポートされます。 最後に、レンダリングされたイメージが元のビデオと合成され、最終的なビデオが生成されます。 興味のある方は以下のリンクをクリックしてください: https://modelscope.cn/studios/Damo_XR_Lab/motionshop/summary |
<<: OpenAIのアルトマン氏、ニューヨークタイムズの訴訟に反応: AIはニュース出版社からのトレーニングデータを必要としない
>>: 中国科学院は、プログラマーがバグを見つけるのを助けるために大きなモデルを使用し、102の論文を分析し、これらの解決策をまとめた。
モデル| https://huggingface.co/ByteDance/SDXL-Lightni...
[[412443]]現在の人工知能研究コミュニティでは、データ中心の方法が絶対的に優勢であり、その...
Windows XP ユーザーは、現在の XP が 2001 年にリリースされた XP よりも遅いこ...
イベント紹介ロイター通信によると、ウクライナ政府省庁は土曜日、クリアビューAIの顔認識技術の使用を開...
近年、教師あり学習によるディープラーニングも大きな成功を収めています。画像分類から言語翻訳まで、その...
大規模言語モデルは推論できますか?出現したさまざまな能力の源は何でしょうか?少し前に、LeCun 氏...
11月16日、Microsoft Ignite 2023カンファレンスが本日開幕しました。NVIDI...
かつて私たちは、コンピューターがどれだけ強力であっても、未来を予測するには不十分であると考えていまし...
[[406948]]人間が意思決定を行うプロセスは、複雑で恣意的であるように見えることもあります。そ...
11月29日、海外メディアの報道によると、マイクロソフトは最近、機械学習モデルを.NETアプリケーシ...
この記事はLeiphone.comから転載したものです。転載する場合は、Leiphone.com公式...
海外メディアの報道によると、インターネットには数十億枚の写真が溢れており、その多くは放置されたアカウ...
[[350210]]今日、私たちが建物について語るとき、それは単なる外殻を意味するのではなく、さま...
人工知能 (AI) には、従来のエンジニアリング システムからヘルスケア、芸術やエンターテイメントの...