Quantum Sea

OCP APAC 2026 | AIクラスターの公開設計、400Gの構成から800G液冷への拡張

異なる淡青の経路が透明な枠を通り、一つのまとまりをつくる抽象アート

AIの計算基盤をつくるとき、アクセラレーターの型番が決まっても、まだ設計は終わりません。計算機同士の接続、データを置くストレージ、ジョブを動かす管理サーバー。それぞれを、実際に配線して運用できる一つの構成へまとめる必要があります。

その手がかりになるのが、OCPのOpen Cluster Designs for AIです。2026年8月のOCP APAC Summitでは、BroadcomのBhaskar Chinni氏が、公開済みの400G・空冷構成と、開発中の800G・液冷構成を紹介しました。部品の組み合わせだけでなく、ラックへの配置や管理系まで含めて、AIクラスターをどう組み立てるかを示す取り組みです。[1・2]

計算機の一覧を、組み立てられる設計へ

ここでいうリファレンスアーキテクチャーは、構成を検討する際の参照設計です。資料では、計算、ネットワーク、ストレージ、接続トポロジー、管理基盤を、その対象に挙げています。XPUはAIアクセラレーターを広く指す呼び名で、特定の製品名ではありません。[2]

設計図には、どのラックに機器を収め、どのポートを結び、どのケーブルや光部品を使うかという情報が登場します。部品表に加えて、電力、設置面積、重量の見積もりも扱います。調達する側と設置する側が、同じ構成を見ながら話を進められる粒度です。[2]

AIの学習では、計算機を増やすほど、その間を行き来するデータや、保存するチェックポイントも増えます。計算の量に対して通信やストレージが足りなければ、速いアクセラレーターも待つことになります。資料が目指しているのは、こうした比率をそろえた、バランスのよいクラスターです。機器を2倍にすれば必ず処理が2倍速くなる、という性能保証ではありません。

五つのネットワークには、違う役割がある

公開済みの400G設計を読むうえで分かりやすいのが、ネットワークを役割ごとに分けている点です。資料には、XPU同士のスケールアウト、CPU側のスケールアウト、ストレージ、インバンド管理、アウトオブバンド管理という五つのネットワークが描かれています。[2]

XPU側は分散したAI計算の通信を、ストレージ側は学習データや計算結果の出し入れを受け持ちます。CPU側にも、前処理などの仕事と、それに応じた通信があります。同じクラスターの中でも、流れるデータと、求められる性能が少しずつ違います。

管理用の接続も一種類ではありません。インバンド管理は通常のシステム接続を通して運用するための経路で、アウトオブバンド管理は、機器の専用管理ポートなどを使う別系統の経路です。後者には、サーバーだけでなく、スイッチや電源分配装置の管理も含まれています。計算を行う経路が不調なときにも、状態を調べたり復旧したりする手段を考えておくわけです。[2]

これは、すべてのAI基盤で必ず五つを物理的に分離しなければならない、という決まりではありません。資料でも機器を共用する構成に触れ、次の800G設計では一部を統合する方向を示しています。大切なのは、統合する場合も、それぞれの通信が担う役割を見失わないことです。

ジョブを動かすまでの準備も、設計に含める

計算ノードの外側には、ヘッドエンドと呼ばれる管理・制御側の機器群があります。監視、ジョブのスケジューラー、一時的なデータ置き場に加え、OSイメージ、コード、コンテナーを用意する仕組みも配置されています。[2]

利用者がコードを用意し、実行環境を整え、ジョブを投入して、結果を取り出す。この流れを支える機器も必要です。アクセラレーターだけを並べた図では見えにくい部分ですが、実際に使える計算基盤にするには欠かせません。

公開設計を読むときも、計算ノードの台数と同じくらい、管理サーバーや一時領域がどこにあり、どのネットワークへつながるのかを見ると、運用時の姿を想像しやすくなります。

800Gへの拡張では、冷却と運用も変わる

発表時点で、400G・空冷のOPG-128は2026年1月に公開済みでした。OPGはOpen Pod Groupの略で、末尾の数字は含まれるXPU数を表します。一方、800G・液冷のOPG-576は、同年2月に開発を始めた構成として紹介されています。[2]

800G案では、576基のXPUを含むグループに対して、計算機とネットワークの液冷ラック、列の端に置くCDUが描かれています。CDUは冷却液の循環や熱交換を担う装置です。接続速度を上げるだけでなく、高密度になった機器の熱を、施設側へどう渡すかも構成の一部になっています。[2]

管理側の構成も広がっています。資料は推論やエージェント型AIの利用を挙げ、障害が起きた際に、性能が予測可能な形で段階的に低下することを目標にしています。故障しないことだけでなく、一部が止まったときに何を続けられるかまで、設計の視野に入っています。

ただし、ここで示された800G構成は開発中のプレビューです。図にも変更を見込む旨が添えられており、完成版の仕様や、そのまま導入できる確定済みの部品表として読む段階ではありません。

公開設計のよさは、速い機器を見つけるだけでなく、その周囲に必要なものまで一緒に考えられることです。計算、通信、保存、冷却、運用をつなげて見ると、AIクラスターを動かし続けるための条件が見えてきます。

発表企業の事業を知る

Broadcomが手がける半導体とインフラソフトウェアの事業については、cyclewaveにまとめています。

参考資料

2026年9月27日確認。800G構成の開発状況は、2026年8月の講演資料に基づきます。

[1]Open Compute Project「2026 OCP APAC Summit」発表一覧

[2]Bhaskar Chinni/Broadcom「Open cluster designs for AI: Blueprints for open-source AI infrastructure」公式掲載スライド。設計の範囲と用語はpp.3–6、公開・開発状況はpp.7–8、400G構成はpp.11–19、800G構成と今後の方向はpp.21–24。

コメント

コメントを残す

メールアドレスが公開されることはありません。 ※ が付いている欄は必須項目です