MindSporeが再び躍進: タンパク質構造の予測、トレーニング、推論の全プロセスがオープンソース化され、バイオメディカルの発展を促進

MindSporeが再び躍進: タンパク質構造の予測、トレーニング、推論の全プロセスがオープンソース化され、バイオメディカルの発展を促進

最近、 MindSporeは、北京大学生物医学フロンティアイノベーションセンター( BIOPIC )化学分子工学学院の昌平研究室、深圳湾研究所のGao Yiqin教授の研究グループ、およびPengcheng研究室のChen Jieチームと共同で、フルシナリオAIフレームワークMindSporeに基づいてAlphaFold2タンパク質構造トレーニングを実装しました2021年11月の推論ツールのリリースに続き、このトレーニングは、国内のAIフレームワークが強力なAI for Scienceの基盤となるソフトウェア機能を備えていることを意味し、関連する科学研究者に新しい選択肢も提供します。この共同作業は、Pengcheng Cloud Brain II Ascend AIクラスターに基づいて実行され、シングルステップ反復パフォーマンスが60%以上向上し、 TMスコア85ポイント(国際的に権威のある評価データセットCASP14 )になりました。関連するトレーニング コードはMindSporeコミュニティでオープン ソース化されており、 OpenLコミュニティでもオープン ソース化され、定期的に拡張およびメンテナンスされます。

T1052-D1予測構造 (左) CASP14 87 ターゲット TM スコア比較 (右)

タンパク質構造予測とは、タンパク質の機能構造と立体配座を得るプロセスです。この問題は、半世紀近くにわたって「 21世紀の生物物理学」における最も重要なテーマの 1 つとして注目されてきました。これまで、タンパク質の立体配座の数が膨大で、計算プロセスが複雑だったため、 AIによるタンパク質構造の予測には大きな進歩がありませんでした。タンパク質の空間構造を取得する方法は、依然として主にクライオ電子顕微鏡やX線などの実験技術に基づいています。単一のタンパク質の観察コストは数ヶ月と数百万人民元に上ります。 AlphaFold2が登場するまで、この問題は新たな希望をもたらしました。 AlphaFold2 は、実験に近い精度でCASP14タンパク質の空間構造予測コンテストでトップとなり、この成果はNature 誌で「前例のない進歩」と称賛されました。

2021年7月DeepMindはAlphaFold2の推論コードのオープンソース化を発表しました。盛思と高易群の研究チームはそれをいち早く再現・最適化し、同年11月には盛思MindSporeをベースにした推論ツールをオープンソース化し、前年比で2~3倍の効率向上を実現しました。オープンソースの範囲は推論に限定されているため、関係する専門家はこれに基づいて最適化することができず、多くのチームがトレーニング プロセスの再現に積極的に取り組んでいます。 AlphaFold2モデル自体には、大量のメモリ要件、面倒なデータ処理、複雑な制御コンパイルなどの特性があり、基本的なAIフレームワークに大きな課題をもたらします。

最近、 MindSporeはGao Yiqinの研究グループおよびPengcheng LaboratoryのChen Jieのチームと協力し、AlphaFold2のトレーニングを完全に完了しました。 Ascend基本ソフトウェアおよびハードウェアプラットフォームを採用した後、混合精度でシングルステップ反復時間が20秒から12秒に短縮され、パフォーマンスが60%以上向上しました。 MindSpore のメモリ再利用機能を利用することでトレーニング シーケンスの長さが384から512に増加します。

トレーニング結果をできるだけ客観的に評価するために、 MindSpore はAlphaFold2論文の付録に記載されている87 個の検証セットを選択して検証を行いました。平均TM スコアは85ポイントに達し、これは基本的にAlphaFold2と同じです。

MindSporeのタンパク質構造予測トレーニングと推論のサポートは、国内のAIソフトウェアとハ​​ードウェアのギャップを埋めます。 MindSpore はAlphaFold2に近いトレーニング精度に基づいて、アルゴリズム、スケール、ソフトウェアおよびハードウェア サポートの分野で改善を続け、同僚が使用できるように共有トレーニング データセットを公開する予定です。 MindSpore は、モデルの精度をさらに向上させ、アプリケーション シナリオを拡大するために、より多くの学術および産業パートナーと連携したいと考えています。

コードオープンソースパス:

https://gitee.com/mindspore/mindscience/tree/dev/MindSPONGE/mindsponge/fold

マインドスポア:

gitee : https://gitee.com/mindspore/mindspore

GitHub : https://github.com/mindspore-ai/mindspore



<<:  電気自動車や自動運転の普及にはエネルギー補給技術の限界を乗り越えなければならない

>>:  データ センターはリモート ワークプレイスをどのようにサポートできるでしょうか?

ブログ    

推薦する

聞いてください、トランスフォーマーはサポートベクターマシンです

Transformer は、学界で議論を巻き起こしたサポート ベクター マシン (SVM) の新しい...

レポート:データセンターは人工知能を生成するサーバーを冷却するために大量の水を消費している

ChatGPT のような生成 AI モデルが大量のエネルギーを消費することはよく知られていますが、そ...

世界動物の日: 動物保護と機械学習が出会うとき

動物を愛し、動物保護に尽力する世界中の人々にとって、今日は特別な日、「世界動物の日」です。毎年10月...

5GとAIの強力な組み合わせは、どのような新たな機会をもたらすのでしょうか?

[[261281]]新興技術への投資家として、私は既存の市場を改善したり、新しい市場を創出したりで...

米空軍の最高データ・AI責任者が語るAI運用の主導と戦略的優位性

AI は、米国が戦争を戦い、脅威を監視し、国防を維持する方法を含め、ほぼすべてのことを行う方法を変え...

AIが高度な数学の核心を突破、微分方程式と不定積分を1秒以内に解き、その性能はMatlabをはるかに上回る

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...

ディープラーニングで構造化データを処理するにはどうすればよいですか?

この投稿では、ディープラーニングのあまり知られていない応用分野である構造化データに焦点を当てます。こ...

ディープラーニング技術に関する珍しいガイド

[[207922]]データ前処理(この部分は原著者が書いたものではなく、個人的な理解と関連内容に基づ...

複数の都市が共同で人工知能コンピューティングネットワークを点灯し、人工知能産業の発展を促進する

Huawei Connect 2021では、中国科学技術情報研究所(CITI)、AITISA(新世代...

LSTM ニューラルネットワークを使用して株価の動向を予測する

[[434750]] Python 中国語コミュニティ (ID: python-china) LST...

画像認識のためのトップ 5 プログラミング言語

この間、ゴミの分別に関するミニプログラムやアプリの登場により、画像認識が再び人々の注目を集めています...

自動運転車は未来の社会で老後の暮らしをどう変えるのか?

フロリダ州中部にある、約12万5000人の住民を抱えるザ・ビレッジの退職者コミュニティには、約750...

なぜ人工知能は第四次産業革命と呼ばれるのでしょうか?

[[234940]]過去2年間、世界のIT大手は人工知能の分野で展開してきました。GoogleはD...

...