OpenAI は機械学習をサポートするために k8s を 7,500 ノードに拡張

OpenAI は機械学習をサポートするために k8s を 7,500 ノードに拡張

GPT-3、CLIP、DALL+などの大規模モデルのニーズや、ニューラル言語モデルに似たスケーリング法則に関する小規模で迅速な反復研究のニーズを満たすために、OpenAIはインフラストラクチャk8sクラスターを7,500ノードに拡張しました。

説明によると、大規模な機械学習ジョブの場合、ノードは通常 1 つのポッドによって占有され、OpenAI によって展開されたクラスターは二分帯域幅を備えているため、ノード数が多くてもスケジューラへの負荷は比較的低く、新しいタスクが一度に数百のポッドを作成する場合にのみスケジューリング負荷が発生します。

さらに、OpenAIは、エイリアスベースのIPアドレスへの切り替えによる多数のノードのネットワーク問題の解決、負荷を分散するために専用ノードにetcdとAPIサーバーを展開すること、PrometheusとGrafanaを使用して指標を収集する際にOOM問題を特定すること、クラスターのヘルスチェックを設計すること、チーム間でクラスターリソースを合理的に割り当てることなど、k8sクラスターの拡張における重要な作業についても詳しく説明しました。

しかし、OpenAIは、大規模環境でのPrometheusの内蔵TSDBストレージエンジンの圧縮速度が遅く、WAL(書き込み事前記録)の再起動に時間がかかる、クラスターを拡張すると各ポッドに一定量の帯域幅が必要であると計算されるためネットワーク帯域幅の圧迫が生じるなど、k8sクラスターの拡張時に解決すべき問題がまだいくつかあるとも指摘している。ただし、まだ改善の余地は大きいものの、k8s は優れたスケーラビリティにより研究ニーズを満たすことができます。

この記事はOSCHINAから転載したものです

この記事のタイトル: OpenAI が機械学習をサポートするために k8s を 7500 ノードに拡張

この記事のアドレス: https://www.oschina.net/news/127949/openai-scale-k8s-7500

<<:  AIと機械学習でデータセンターを強化

>>:  人工知能がデジタル変革の課題に対処できる 5 つの分野

ブログ    
ブログ    

推薦する

...

人々は長い間、運転免許試験に悩まされてきました。自動運転は、その苦しみを緩和できるのでしょうか?

運転するには運転免許証を持っていることが前提条件であり、運転免許証を取得するには運転免許試験を受ける...

...

人工知能産業の急速な発展により、2021年以降、人工知能セキュリティの市場スペースは巨大になるでしょう。

[[439966]]人工知能は、人間の意識と思考の情報処理をシミュレートできるコンピュータ サイエ...

...

画像内のテキストを心配する必要はありません。TextDiffuserは高品質のテキストレンダリングを提供します。

近年、テキストから画像への変換の分野は、特に AIGC (人工知能生成コンテンツ) の時代において大...

...

企業向け人工知能アプリケーション開発ガイド

AI アプリケーション開発プロセスを詳しく調べ始める場合、まずこれらのプロジェクトが通常のアプリケー...

モザイクでも止められない!これらのAIアルゴリズムはワンクリックで高解像度を実現できます

ぼやけた写真が好きな人はいません。本当の顔を復元したいという衝動にかられたことはありませんか? AI...

音声分析:自動運転車の鍵となる技術

サプライチェーン管理、製造業務、モビリティサービス、画像およびビデオ分析、音声分析の進歩により、次世...

アルゴリズムの知識を学ばずに Java 開発を学ぶことは可能ですか?

まず、Java開発の分野でさらに進歩したい場合、または付加価値の高い仕事に就きたい場合は、Java開...

ディープラーニング思考

[[195107]]機械学習ルーチンほとんどの機械学習アルゴリズム(ディープラーニングを含む)は、実...

マイクロソフト、Nvidia が 5300 億の NLP モデル「Megatron-Turing」をリリース、価格は A100 で 4480 台

[[428336]]この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI...

AIの海のサイレンソング:テンセントAIラボの大規模モデルの幻覚問題の概要

大規模言語モデルは、多くの下流タスクで驚くべき能力を発揮してきましたが、使用時にはまだいくつかの問題...

人工知能が将来の経済と社会に与える影響を理解する方法

[[353152]]人工知能は新興の破壊的技術として、科学技術革命と産業変化によって蓄積された膨大な...