清華大学の卒業生は大きな貢献をしました！ Google、14のタスクで初の大規模一般医療モデルSOTAをリリース

この記事はAI新メディアQuantum Bit（公開アカウントID：QbitAI）より許可を得て転載しています。転載の際は出典元にご連絡ください。

世界初の大規模総合医療モデルが正式リリース：

Google Research と DeepMind が共同で作成したマルチモーダル生成モデルであるMed-PaLM Mは、臨床言語、画像、ゲノミクスを理解します。

Med-PaLM M は、すべてのタスクに同じモデル重みセットが使用されている場合、14 のテストタスクで既存の SOTA 結果に近づくか、それを上回ります。

臨床医は、実際の胸部X線写真246枚のうち、最大40.50%のケースで、Med-PaLM Mによって生成されたレポートが専門の放射線科医によるレポートよりも受け入れられやすいことを示しており、Med-PaLM Mは単なる「紙上の話」ではなく、近い将来に臨床現場で使用できることを示しています。

Google も独自の評価を出しています。

これは、一般医療用人工知能の歴史における画期的な出来事です。

では、Med-PaLM M とは何でしょうか?

世界初の大規模総合医療モデルが登場

Med-PaLM M について正式に学ぶ前に、まず Google が独自に構築したマルチモーダル医療テストベンチマークMultiMedBenchについて簡単に紹介しましょう。

Google によれば、MultiMedBench が登場する以前は、市場にはこのような包括的なマルチモーダル医療ベンチマークは存在しなかったという。

このベンチマークは、12 個のオープンソースデータセットと 14 個の個別タスクで構成されており、一般的なバイオメディカル AI がさまざまな臨床タスクを実行する能力を測定します。

12 のデータセットは、6 つの生物医学データモダリティ(テキスト、放射線学 (CT、MRI、X 線)、病理学、皮膚科学、マンモグラフィー、ゲノミクス)をカバーし、14 のタスクは 5 つのタイプ(質問回答、レポート生成と要約、視覚的な質問回答、医療画像分類、ゲノム変異呼び出し) をカバーします。

Med-PaLM M は、その上で微調整されています。

「M」という名前がマルチモダリティの略語であるように、Med-PaLM Mは、GoogleがこれまでリリースしてきたMed-PaLM、Med-PaLM-2などの大型医療モデルと比較して、汎用的な医療AIです。さまざまな医療の質問に答えるだけでなく、フィルムを直接見てゲノムを理解することもできます。

その基本アーキテクチャは PaLM-E (マルチモーダル言語モデル)であり、ViT 事前トレーニング済みモデルをビジュアルエンコーダーとして使用し、具体的には次の 3 つの組み合わせを実装します。

-PaLM 8B+ViT 4B(PaLM-E 12B)
-PaLM 62B+ViT 22B（PaLM-E 84B）
-PaLM 540B+ViT 22B（PaLM-E 562B）

MultiMedBench を通じて PaLM-E モデルを微調整し、それをバイオメディカル領域に適合させることで、Med-PaLM M が誕生しました。実装の詳細は次のとおりです。

（１）データセットと前処理に関しては、MultiMedBench内のすべての画像は224×224×3にサイズ変更され、元のアスペクト比を維持するために必要に応じてパディングが使用されました。

（２）Googleの目標は、統一されたモデルアーキテクチャとモデルパラメータを使用して、マルチモーダル入力による複数のタスクを実行する汎用バイオメディカルAIモデルをトレーニングすることである。これを実現するために、彼らは Med-PaLM M に、さまざまなタスクに固有の指示と、プレーンテキストの「一回限りの例」を提供しました。

以下に示す胸部 X 線画像の解釈と皮膚病変の分類のタスクに示されているように、指示は「あなたは非常に有能な放射線科助手です」で始まり、書面によるプロンプトのような雰囲気を持っています。

（３）訓練プロセス中に、著者らはPaLM-Eをエンドツーエンドで微調整した。マルチモーダルタスクでは、画像タグがテキストタグとインターリーブされ、PALM-E モデルへのマルチモーダルコンテキスト入力が形成されます。すべての微調整タスクでは、マルチモーダルコンテキスト入力は最大 1 つの画像で構成されますが、Med-PaLM M は推論中に複数の画像を含む入力を処理できます。

14のタスクはSOTAに近いかそれを超えており、臨床的には放射線科医の40%を上回っています。

パフォーマンス評価フェーズでは、著者らは主に Med-PaLM M の「オールラウンダー」（つまりジェネラリスト）機能、緊急対応機能、および放射線レポート生成の品質（実際の放射線科医との比較）をテストしました。

結果は次のようになります:

（１）特殊なSOTAモデルやバイオメディカルファインチューニングを行わない一般化モデル（PaLM-E 84B）と比較すると、Med-PaLM Mのパフォーマンスは、MultiMedBench上のすべてのタスク、データセット、指標の組み合わせ（合計14項目）においてSOTAに近いかそれを上回っています。

この結果は、タスク固有のカスタマイズなしで、同じモデルの重みセットを使用して達成されることに注意することが重要です。

（２）尺度実験では、Med-PaLM Mの３つの異なる尺度が様々なタスクに対して異なる効果を示した。
一見すると、純粋な言語タスクやチューニングを必要とするマルチモーダルタスクでは、モデルが大きいほど良いのですが、画像分類や胸部 X 線レポート生成タスクでは、84B の方が 562B よりもパフォーマンスが優れています。

（３）ゼロサンプル連鎖推論能力が発現する。 Med-PaLM M は、トレーニングを受けていない胸部 X 線画像でも結核を検出でき、その精度は、このタイプのデータセットに特化して最適化された最先端の結果に匹敵します。

しかし、提出された具体的な報告書には依然として具体的な誤りが含まれており、依然としていくつかの欠陥があることが示されました。

（4）放射線レポート生成テストでは、80BパラメータのMed-PaLM Mは、放射線科医が作成したレポート（臨床医が採用）よりも優れたレポートが平均40.50％ありましたが、12Bと562Bではそれぞれ平均34.05％と32.00％でした。

さらに、省略率とエラー率のテストでは、Med-PaLM M 12B および 84B モデルのレポートあたりの平均省略率が 0.12 で最も低く、次いで 562B モデルが 0.13 であることが示されました。この結果は、MIMIC-CXR に関する人間の放射線科医によるベースラインレポートと比較できます。

実用化にはどれくらい時間がかかりますか?

人類史上初の大規模総合医療モデルであるMed-PaLM Mが実用化されるまでにどれくらいの時間がかかるのかは、誰もが気になるところでしょう。

これはマイルストーンとして「自称」されているが（主に、さまざまな生物医学的タスクで SOTA に近づくかそれを超えるために一連のモデル重みに依存しているため）、Google は、対処すべき制限がまだ多くあることも指摘した。

たとえば、高品質のテストベンチマークが不足しています。グーグルは、高品質のベンチマークだけが関連分野の進歩を大きく促進できるため、これがこれまでの一般的なバイオメディカルAIの開発における重要なボトルネックであると述べた。

しかし、現在の MultiMedBench には、単一のデータセットのサイズが限られている、モードとタスクの多様性が限られている(トランスクリプトミクスやプロテオミクスの欠如など)などの問題がまだ残っています。

たとえば、マルチモーダル AI モデルのスケーリングも困難です。

言語領域では、この操作によりパフォーマンスと緊急対応能力が大幅に向上します。しかし、Med-PaLM M に関する予備実験では、医療データの不足により、生物医学タスクの分野におけるマルチモーダル一般化モデルではこれがそれほど単純ではないことが示されました。

著者について

現在、Google は Med-PaLM M 論文のみを公開しています。

共著者は 2 人おり、そのうちの 1 人は Tao Tu という名前です。

彼は北京理工大学（2010年）で学士号を取得し、清華大学で修士号、米国コロンビア大学で博士号を取得しました。いずれも医療工学の分野です。私は Google でソフトウェアエンジニアとして約 2 年間働いています。

論文アドレス: https://arxiv.org/abs/2307.14334

<<: 韓国の常温超伝導体の著者が論文撤回を要求！論文には欠陥があり、改善された後、通常のジャーナルに移されました

>>: 北京大学のチームは、より強力な一般化とより高い生成品質を備えたDiffusionでDragGANをアップグレードしました。クリックするだけで「地面から山が立ち上がる」

清華大学の卒業生は大きな貢献をしました！ Google、14のタスクで初の大規模一般医療モデルSOTAをリリース

世界初の大規模総合医療モデルが登場

14のタスクはSOTAに近いかそれを超えており、臨床的には放射線科医の40%を上回っています。

実用化にはどれくらい時間がかかりますか?

著者について

最高速度：250fps！リアルタイムの高性能車線検出アルゴリズムLaneATT

人工知能は飛躍の準備ができており、セキュリティは機会と課題に直面している

Google Brain エンジニアの講演: TensorFlow とディープラーニング

焦点: 注目すべき 6 つのスマートセキュリティトレンド

機械学習で最もよく使われる最適化の1つ - 勾配降下法最適化アルゴリズムのレビュー

九張雲吉DataCanvasマルチモーダル大規模モデルプラットフォームの実践と思考

Pythonアルゴリズムの一般的なテクニックと組み込みライブラリ

私の国は、送電線の加熱を検出するために初めてAI技術を大規模に使用しました。

PromptAppGPT メジャーアップデート！ AIアシスタントの開発と運用のハードルはゼロ：AutoGPTはわずか数十行のコードで実装可能

推薦する

チーターモバイルの第3四半期のツール事業は中国で月間アクティブユーザー数が1億7100万人に達し、過去最高を記録

アルゴリズムは難しい、プログラミングは簡単ではない、プログラマーの苦労を誰が理解できるだろうか?

深セン大学教授が顔検出ライブラリをオープンソース化、顔検出速度は最大1500FPS以上

なぜ人工知能には欠陥があるのでしょうか?

90年代以降の世代初登場！何凱明と孫建のチームが未来科学賞を受賞し、ResNetは18万回引用された。

コンピュータビジョンにおけるステレオビジョンと奥行き知覚の例

データによると、ChatGPTのトラフィックは8月末から増加し始めており、これは主に新学期の始まりによるものである。

機械学習および予測アプリケーション用の 50 を超える API。どれを選びますか?

グラフなしの ICLR'24 のための新しいアイデア! LaneSegNet: 車線セグメンテーションを考慮したマップ学習

人工知能とビッグデータの隠れた危険性とは何でしょうか?

自動運転マップ構築モデルを1つの記事で理解する

Redis Chat (1): ナレッジグラフの構築

トマシュ・トゥングズ: AI 組織が直面する 4 つの戦略的課題

ハリバートンのチーフデータサイエンティスト兼テクニカルフェローがエネルギー業界における AI アプリケーションの現状について語る