マイクロソフトは、兆パラメータのAIモデルのトレーニングに必要なGPUを4,000から800に削減しました。

マイクロソフトは、兆パラメータのAIモデルのトレーニングに必要なGPUを4,000から800に削減しました。

この記事はLeiphone.comから転載したものです。転載する場合は、Leiphone.com公式サイトにアクセスして許可を申請してください。

マイクロソフトは本日、数兆個のパラメータ(予測の根拠となるモデル内の変数)を含む AI モデルをトレーニングする新しい方法を導入する DeepSpeed ライブラリの更新バージョンをリリースしました。 Microsoft によれば、3D 並列処理と呼ばれるこのテクノロジは、さまざまなワークロードのニーズに適応でき、特に電力を大量に消費する非常に大規模なモデルの効率をバランスさせることができるという。

[[341739]]

数十億のパラメータを持つ単一の大規模 AI モデルにより、さまざまな困難な領域で大きな進歩が可能になりました。研究によると、AI が優れたパフォーマンスを発揮できるのは、言語、文法、知識、概念、文脈のニュアンスを理解できるためであり、スピーチを要約したり、リアルタイムのゲーム チャットで不適切な単語を除外したり、複雑な法的文書を解析したり、さらには GitHub を検索してコードを生成することも可能になります。

しかし、モデルのトレーニングには大量のコンピューティング リソースが必要です。 2018年のOpenAIの分析によると、大規模なAIトレーニングに必要なコンピューティング能力は2012年から2018年にかけて30万倍に増加し、およそ3.5か月ごとに倍増し、ムーアの法則のペースをはるかに上回っています。

強化された DeepSpeed は、データ並列トレーニング、モデル並列トレーニング、パイプライン並列トレーニングという 3 つの技術を活用して、「兆スケール」のモデル トレーニングを可能にします。

1兆パラメータのモデルをトレーニングするには、少なくとも400個のNvidiaの最新A100 GPU(それぞれ最大40GBのメモリを搭載)が必要であり、Microsoftは50%の効率で稼働する4,000個のA100が必要で、トレーニングを完了するには約100日かかると見積もっています。これは、1万枚以上のグラフィックカードを搭載した、マイクロソフトとOpenAIが共同設計したAIスーパーコンピューターにはかないません。これほどの大規模環境では、高い計算効率を達成することは困難です。

DeepSpeed は、大規模なモデルを 4 つのパイプライン ステージに分割し、さらに小さなコンポーネント (レイヤー) に分割します。各パイプライン ステージのレイヤーは、実際のトレーニングを実行する 4 つの「ワーカー」にさらに分割されます。各パイプラインは 2 つの並列データ インスタンス間で複製され、ワー​​カーはマルチ GPU システムにマップされます。 Microsoft によれば、これらおよびその他のパフォーマンスの改善により、1 兆パラメータの AI モデルのトレーニングに必要な Nvidia V100 GPU をわずか 800 個に削減できるという。

DeepSpeed の最新バージョンには、GPU とそのホスト CPU 上のコンピューティング リソースとメモリ リソースを活用して、単一の V100 で最大 130 億のパラメータを持つモデルをトレーニングする ZeRO-Offload テクノロジーも含まれています。マイクロソフトは、これは最先端のものより 10 倍強力であり、データ サイエンティストはより少ないコンピューティング リソースを使用してトレーナーをトレーニングできると主張しています。

「これら(DeepSpeed の新技術)は、極めて高い計算、メモリ、通信効率を提供し、数十億から数兆のパラメータを持つモデルのトレーニングをサポートします」と Microsoft はブログ投稿で述べています。「これらの技術により、極めて長い入力シーケンスも可能になり、単一の GPU、数千の GPU を備えたハイエンド クラスター、または非常に低速のイーサネット ネットワークを備えたローエンド クラスターを備えたハードウェア システムのパワーが解放されます。当社は、ディープラーニング トレーニングの速度と規模の限界を押し広げながら、急速に革新を続けます。」

<<:  企業がAI対応データベースを使用してAI導入を加速する方法

>>:  役立つ情報 | 115 行のコードで数独パーサーを作成する方法を段階的に説明します。

ブログ    
ブログ    
ブログ    

推薦する

Orange3 の探索: データ マイニングと機械学習の新しい世界を開きます。

Orange3 は、豊富なデータ処理、分析、モデリング機能を提供する強力なオープンソースのデータ視...

...

PyTorch チームが「すべてを分割」モデルを書き直し、元の実装より 8 倍高速化

今年初めから現在に至るまで、生成AIは急速に発展してきました。しかし、多くの場合、特に PyTorc...

...

時代の流れに乗り、華麗に変革を遂げる UiPath RPA が上海ノキアベルの新たな航海をサポートします。

上海ノキアベル株式会社(以下、「ノキアベル」)は、ノキアグループと中国保利集団の子会社である華新郵電...

陳作寧院士:人工知能モデルとアルゴリズムの7つの発展傾向

新しいものに直面したとき、あなたはそれに適応しますか、学びますか、拒否しますか、それとも無視しますか...

仕事の未来: 2030 年までに消滅する仕事はどれでしょうか?

[[397136]]自動化と人工知能が急速に進歩する時代において、2030年までに仕事は消滅するで...

「自由に眠る」にはヘッドバンドを着けるだけ | Nature サブ出版物

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...

...

5G自動運転はどのようなものになるのでしょうか?韓国のテストではこの結果が出た

自動運転と5Gの産業発展は大きな注目を集めており、韓国企業は最近、両者を組み合わせた効果を模索してい...

人工知能の未来は人類にとって何を意味するのでしょうか?

人工知能(AI)について多くの人が最初に尋ねる質問は、「それは良いものか、悪いものか?」です。答えは...

DFSアルゴリズムは5つの島の問題を克服する

[[429450]]この記事はWeChatの公開アカウント「labuladong」から転載したもので...

Hiveテクノロジーイノベーションカンファレンスは、ドローン技術の進化とビジネスモデルの革命をリードします

2018年1月23日、北京ハイブアグロテック株式会社(以下、ハイブロボティクス)は、JDグループ本社...