Apple、たった1文で写真をレタッチできる新AIモデルMGIEを披露

Apple、たった1文で写真をレタッチできる新AIモデルMGIEを披露

2月8日、マイクロソフトの急速な発展と比較すると、AppleのAI分野における展開ははるかに控えめであるように思われるが、これはAppleがこの分野で成果を上げていないことを意味するものではない。 Appleは最近、自然言語の指示に基づいて画像を編集できる「MGIE」と呼ばれる新しいオープンソースの人工知能モデルをリリースした。

画像出典: VentureBeat および Midjourney

MGIE の正式名称は MLLM ガイド付き画像編集であり、マルチモーダル大規模言語モデル (MLLM) を使用してユーザーの指示を解釈し、ピクセルレベルの操作を実行します。 MGIE は、ユーザーが指定した自然言語コマンドを理解し、Photoshop スタイルの変更、写真のグローバル最適化、ローカル編集などの操作を実行できます。

Appleとカリフォルニア大学サンタバーバラ校の研究者は協力し、人工知能研究のトップカンファレンスの1つである2024年国際学習表現会議(ICLR)でMGIE関連の研究成果を発表する予定です。

MGIE を紹介する前に、まず MLLM を紹介したいと思います。 MLLM は、テキストと画像を同時に処理できる強力な AI モデルであり、指示ベースの画像編集機能を強化します。 MLLM はクロスモーダル理解と視覚知覚応答生成において優れた能力を示していますが、画像編集タスクではまだ広く使用されていません。

MGIE は、2 つの方法で MLLM を画像編集プロセスに統合します。まず、MLLM を使用して、ユーザー入力から表現指示を導き出します。説明は簡潔で、編集プロセスに関する明確なガイダンスを提供します。

たとえば、入力が「空をもっと青くする」である場合、MGIE は「空の領域の彩度を 20% 上げる」という命令を生成できます。

次に、MLLM を使用して、望ましい編集の潜在的な表現である視覚的な想像力を生成します。この表現は編集の本質を捉えており、ピクセルレベルの操作をガイドするために使用できます。 MGIE は、命令推論、視覚的想像力、画像編集モジュールを共同で最適化するための新しいエンドツーエンドのトレーニング スキームを採用しています。

MGIE は、単純な色調整から複雑なオブジェクト操作まで、幅広い編集状況に対応できます。モデルは、ユーザーの好みに応じてグローバル編集とローカル編集を実行することもできます。 MGIE の機能と特徴の一部を以下に示します。

  • 指示ベースの表現編集: MGIE は簡潔で明確な指示を生成し、編集プロセスを効果的にガイドします。これにより、編集の品質が向上するだけでなく、全体的なユーザー エクスペリエンスも向上します。
  • Photoshop スタイルの変更: MGIE は、切り抜き、サイズ変更、回転、反転、フィルターの追加など、一般的な Photoshop スタイルの編集を実行できます。モデルでは、背景の変更、オブジェクトの追加や削除、画像のブレンドなど、より高度な編集を適用することもできます。
  • グローバル写真最適化: MGIE は、明るさ、コントラスト、鮮明度、色バランスなど、写真の全体的な品質を最適化できます。このモデルでは、スケッチ、絵画、漫画などの芸術的な効果も適用できます。
  • ローカル編集: MGIE は、顔、目、髪、衣服、アクセサリーなど、画像内の特定の領域またはオブジェクトを編集できます。モデルでは、形状、サイズ、色、テクスチャ、スタイルなど、これらの領域またはオブジェクトのプロパティを変更することもできます。

MGIE は GitHub 上のオープンソース プロジェクトであり、ユーザーはコード、データ、事前トレーニング済みモデルを見つけることができます。このプロジェクトでは、MGIE を使用してさまざまな編集タスクを実行する方法を示すデモ ノートブックも提供されます。

<<: 

>>:  今日から彼は、黄仁訓院士です!米国工学アカデミーの2024年会員リストが発表され、清華大学の黄一東氏らが外国人会員に選出される

ブログ    
ブログ    
ブログ    

推薦する

ベンジオ、ヒントン、張亜琴らAI界の巨人たちが新たな共同書簡を発表! AIは危険すぎるので、再配置する必要がある

AI リスク管理は、AI 大手企業によって再び議題に挙げられています。ちょうど今、ベンジオ、ヒントン...

AIシミュレーターが物理シミュレーションで新たなSOTAを達成!

機械学習により、コンピュータグラフィックス(CG)シミュレーションがよりリアルになります。この方法は...

公共の場での顔認識は全面的に禁止される可能性があります。ちょうど今、欧州議会はAI規制を強化することを決定した

[[427521]]昨日、欧州議会はAI生体認証技術に基づく大規模な監視の全面禁止を求める決議を可決...

...

...

ビッグデータマイニング機械学習人工知能ベン図戦争

半期会議がもうすぐ開かれますが、上司はみんなでしっかり計画を立てるように言いました。私たちの将来の方...

データは今日のビジネスに競争上の優位性をもたらすことができるのでしょうか?

データは今やさまざまな産業に統合され、世界市場のハイライトとなっています。現在の経済成長はデータと切...

シンプルな人工ニューラル ネットワークをゼロから構築する: 1 つの隠れ層

[51CTO.com クイック翻訳] 前回の記事「人工ニューラルネットワークをゼロから構築する(パー...

AIによる創薬は2024年までに急成長すると予想

1月7日の最大のニュースの一つは、Google DeepMindの創設者デミス・ハサビス氏が率いるG...

将来的にはAIを5Gネットワ​​ーク解析に活用できる

現在、5G に関するブログやベンダーの論文が数多くあり、新しいメディア伝送からギガビット速度、モバイ...

人工知能は人間を管理することを学んでいます。将来、人工知能は人間の世界を支配するのでしょうか?

人間は自分たちが偉大だと思っているが、個々の人間は非常に弱い。人類は素晴らしい文明を築き上げましたが...

北京ソフトウェア協会が「人工知能委員会」の設立準備を進め、アジアインフォテクノロジーズの欧陽葉博士が委員長に選出される

10月26日、中国科学技術協会社会サービスセンターの支援を受けて、北京ソフトウェア情報サービス協会(...

金融ビジネスイノベーションを実現する自社開発グラフデータベースに基づくナレッジグラフ実装

人工知能の急速な発展に伴い、ナレッジグラフの実装と商業化の可能性は継続的に強化され、社内のデータ分析...

水中ロボットが極地でその能力を披露

水中ロボットが極地でその能力を披露[[439571]]科学研究員らが甲板上で展​​開準備を進めている...