清華大学の卒業生は大きな貢献をしました! Google、14のタスクで初の大規模一般医療モデルSOTAをリリース

清華大学の卒業生は大きな貢献をしました! Google、14のタスクで初の大規模一般医療モデルSOTAをリリース

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載しています。転載の際は出典元にご連絡ください。

世界初の大規模総合医療モデルが正式リリース:

Google Research と DeepMind が共同で作成したマルチモーダル生成モデルであるMed-PaLM Mは、臨床言語、画像、ゲノミクスを理解します。

Med-PaLM M は、すべてのタスクに同じモデル重みセットが使用されている場合、14 のテスト タスクで既存の SOTA 結果に近づくか、それを上回ります。

臨床医は、実際の胸部X線写真246枚のうち、最大40.50%のケースで、Med-PaLM Mによって生成されたレポートが専門の放射線科医によるレポートよりも受け入れられやすいことを示しており、Med-PaLM Mは単なる「紙上の話」ではなく、近い将来に臨床現場で使用できることを示しています。

Google も独自の評価を出しています。

これは、一般医療用人工知能の歴史における画期的な出来事です。

では、Med-PaLM M とは何でしょうか?

世界初の大規模総合医療モデルが登場

Med-PaLM M について正式に学ぶ前に、まず Google が独自に構築したマルチモーダル医療テスト ベンチマークMultiMedBenchについて簡単に紹介しましょう。

Google によれば、MultiMedBench が登場する以前は、市場にはこのような包括的なマルチモーダル医療ベンチマークは存在しなかったという。

このベンチマークは、12 個のオープンソース データセットと 14 個の個別タスクで構成されており、一般的なバイオメディカル AI がさまざまな臨床タスクを実行する能力を測定します。

12 のデータセットは、6 つの生物医学データ モダリティ(テキスト、放射線学 (CT、MRI、X 線)、病理学、皮膚科学、マンモグラフィー、ゲノミクス)をカバーし、14 のタスクは 5 つのタイプ(質問回答、レポート生成と要約、視覚的な質問回答、医療画像分類、ゲノム変異呼び出し) をカバーします


Med-PaLM M は、その上で微調整されています。

「M」という名前がマルチモダリティの略語であるように、Med-PaLM Mは、GoogleがこれまでリリースしてきたMed-PaLM、Med-PaLM-2などの大型医療モデルと比較して、汎用的な医療AIです。さまざまな医療の質問に答えるだけでなく、フィルムを直接見てゲノムを理解することもできます。

その基本アーキテクチャは PaLM-E (マルチモーダル言語モデル)であり、ViT 事前トレーニング済みモデルをビジュアルエンコーダーとして使用し、具体的には次の 3 つの組み合わせを実装します。

-PaLM 8B+ViT 4B(PaLM-E 12B)
-PaLM 62B+ViT 22B(PaLM-E 84B)
-PaLM 540B+ViT 22B(PaLM-E 562B)

MultiMedBench を通じて PaLM-E モデルを微調整し、それをバイオメディカル領域に適合させることで、Med-PaLM M が誕生しました。実装の詳細は次のとおりです。

(1)データセットと前処理に関しては、MultiMedBench内のすべての画像は224×224×3にサイズ変更され、元のアスペクト比を維持するために必要に応じてパディングが使用されました。

(2)Googleの目標は、統一されたモデルアーキテクチャとモデルパラメータを使用して、マルチモーダル入力による複数のタスクを実行する汎用バイオメディカルAIモデルをトレーニングすることである。これを実現するために、彼らは Med-PaLM M に、さまざまなタスクに固有の指示と、プレーンテキストの「一回限りの例」を提供しました。

以下に示す胸部 X 線画像の解釈と皮膚病変の分類のタスクに示されているように、指示は「あなたは非常に有能な放射線科助手です」で始まり、書面によるプロンプトのような雰囲気を持っています。

(3)訓練プロセス中に、著者らはPaLM-Eをエンドツーエンドで微調整した。マルチモーダル タスクでは、画像タグがテキスト タグとインターリーブされ、PALM-E モデルへのマルチモーダル コンテキスト入力が形成されます。すべての微調整タスクでは、マルチモーダル コンテキスト入力は最大 1 つの画像で構成されますが、Med-PaLM M は推論中に複数の画像を含む入力を処理できます。

14のタスクはSOTAに近いかそれを超えており、臨床的には放射線科医の40%を上回っています。

パフォーマンス評価フェーズでは、著者らは主に Med-PaLM M の「オールラウンダー」 (つまりジェネラリスト)機能、緊急対応機能、および放射線レポート生成の品質(実際の放射線科医との比較)をテストしました。

結果は次のようになります:

(1)特殊なSOTAモデルやバイオメディカルファインチューニングを行わない一般化モデル(PaLM-E 84B)と比較すると、Med-PaLM Mのパフォーマンスは、MultiMedBench上のすべてのタスク、データセット、指標の組み合わせ(合計14項目)においてSOTAに近いかそれを上回っています。

この結果は、タスク固有のカスタマイズなしで、同じモデルの重みセットを使用して達成されることに注意することが重要です。

(2)尺度実験では、Med-PaLM Mの3つの異なる尺度が様々なタスクに対して異なる効果を示した。
一見すると、純粋な言語タスクやチューニングを必要とするマルチモーダル タスクでは、モデルが大きいほど良いのですが、画像分類や胸部 X 線レポート生成タスクでは、84B の方が 562B よりもパフォーマンスが優れています。

(3)ゼロサンプル連鎖推論能力が発現する。 Med-PaLM M は、トレーニングを受けていない胸部 X 線画像でも結核を検出でき、その精度は、このタイプのデータセットに特化して最適化された最先端の結果に匹敵します。

しかし、提出された具体的な報告書には依然として具体的な誤りが含まれており、依然としていくつかの欠陥があることが示されました。

(4)放射線レポート生成テストでは、80BパラメータのMed-PaLM Mは、放射線科医が作成したレポート(臨床医が採用)よりも優れたレポートが平均40.50%ありましたが、12Bと562Bではそれぞれ平均34.05%と32.00%でした。

さらに、省略率とエラー率のテストでは、Med-PaLM M 12B および 84B モデルのレポートあたりの平均省略率が 0.12 で最も低く、次いで 562B モデルが 0.13 であることが示されました。この結果は、MIMIC-CXR に関する人間の放射線科医によるベースライン レポートと比較できます。

実用化にはどれくらい時間がかかりますか?

人類史上初の大規模総合医療モデルであるMed-PaLM Mが実用化されるまでにどれくらいの時間がかかるのかは、誰もが気になるところでしょう。

これはマイルストーンとして「自称」されているが(主に、さまざまな生物医学的タスクで SOTA に近づくかそれを超えるために一連のモデル重みに依存しているため) 、Google は、対処すべき制限がまだ多くあることも指摘した。

たとえば、高品質のテストベンチマークが不足しています。グーグルは、高品質のベンチマークだけが関連分野の進歩を大きく促進できるため、これがこれまでの一般的なバイオメディカルAIの開発における重要なボトルネックであると述べた。

しかし、現在の MultiMedBench には、単一のデータセットのサイズが限られている、モードとタスクの多様性が限られている(トランスクリプトミクスやプロテオミクスの欠如など)などの問題がまだ残っています。

たとえば、マルチモーダル AI モデルのスケーリングも困難です。

言語領域では、この操作によりパフォーマンスと緊急対応能力が大幅に向上します。しかし、Med-PaLM M に関する予備実験では、医療データの不足により、生物医学タスクの分野におけるマルチモーダル一般化モデルではこれがそれほど単純ではないことが示されました。

著者について

現在、Google は Med-PaLM M 論文のみを公開しています。

共著者は 2 人おり、そのうちの 1 人は Tao Tu という名前です。

彼は北京理工大学(2010年)で学士号を取得し、清華大学で修士号、米国コロンビア大学で博士号を取得しました。いずれも医療工学の分野です。私は Google でソフトウェア エンジニアとして約 2 年間働いています。

論文アドレス: https://arxiv.org/abs/2307.14334

<<:  韓国の常温超伝導体の著者が論文撤回を要求!論文には欠陥があり、改善された後、通常のジャーナルに移されました

>>:  北京大学のチームは、より強力な一般化とより高い生成品質を備えたDiffusionでDragGANをアップグレードしました。クリックするだけで「地面から山が立ち上がる」

推薦する

1つのモデルで8つの視覚タスクを処理し、1つの文で画像と動画を生成できます。

[[437247]]この記事はAI新メディアQuantum Bit(公開アカウントID:QbitA...

...

リアルすぎて怖い! Gen-2 の壮大なアップデート、手作りの 4K ハリウッド大作、Midjourney の夢の連携、CEO: クリエイティブ ソフトウェアの時代は終わった

動画生成AIが狂った!ランウェイとミッドジャーニーは、それぞれが究極の技を駆使して激しい戦いを繰り広...

PyTorch を学ぶには?簡単すぎる

多くの友人から、PyTorch の学習方法を尋ねられました。長期間の練習を経て、初心者が知っておく必...

VB.NET 暗号化アルゴリズムの基本概念の分析

プログラミング言語の場合、その機能性を評価する上で最も重要な要素の 1 つはセキュリティ評価です。 ...

PyTorch と TensorFlow で画像分類モデルをトレーニングする方法

導入画像分類は、コンピューター ビジョンの最も重要なアプリケーションの 1 つです。その応用範囲は、...

...

...

MIT、ビデオ遅延防止に新たなAI技術を採用

動画の途切れや解像度の低さは視聴者の視聴体験を著しく低下させ、広告主の利益にも悪影響を及ぼします。現...

PaddlePaddle をベースに構築された産業グレードの ICNET アプリケーションの予測速度は、TensorFlow を 20% 上回ります。

導入ICNET について話すとき、リアルタイム アプリケーションにおける画像セマンティック セグメン...

...

あなたは人工知能についてどれくらい知っていますか?普通の人として、私たちはもっと多くのことを知る能力を持っているのでしょうか?

それはとても神秘的で、本当にハイエンドで、急速に発展しています!それは私たちの周りにあり、あなたは気...

データは1/5000に縮小されたが、モデルの精度は2倍に。Googleの新しい「蒸留法」が人気に

[[441258]]この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI...

AGI(汎用人工知能)は数年のうちに実現されるでしょうか? 3つのテクノロジー大手が判決を下す

2011年、Google DeepMindの共同創設者であるシェーン・レッグは、2028年までにAI...

将来、ロボットは手術を支援し、反復作業をより効率的に実行できるようになるかもしれない。

人々は人工知能の急速な発展と、さまざまな業界でのその応用事例を目撃してきました。ヘルスケアは、AI、...