Quantum Sea

OCP APAC 2026 | AI通信の混雑に早く応えるSONiC、経路制御とパケットトリミング

厚みのある淡い青灰色の流れが細い先端へ絞られ、先へ伸びる様子で早い混雑通知を表した概念画像。

GPUの計算が速くても、通信の一部が遅れると、AIの処理全体を終えるまでの時間が延びます。大きなデータが短時間に集中する場面では、回線の速さに加えて、どの経路を通り、混雑をどれほど早く知れるかが大切になります。

2026年8月のOCP APAC SummitでMicrosoftとBroadcomが紹介したのは、ネットワークスイッチを動かすソフトウェアSONiCを、AI向けの大規模な通信基盤へ対応させる取り組みです。経路情報を扱うBGPの拡張から、送信元が経路を指定するSRv6、混雑を早く伝えるパケットトリミング、細かな統計収集までをつなげて見ていきます。[1・2]

少数の大きな通信が、同じ経路へ重なる

発表が対象とするAIの学習通信には、少数の大きなフロー、短時間に通信が集中するバースト、遅い側の通信時間であるテールレイテンシーへの敏感さという特徴があります。経路の振り分けに使える通信の違いも少なく、大きなフローが同じリンクへ重なると、混雑しやすくなります。[2]

等しいコストの経路へ通信を振り分けるECMPでも、このような条件では負荷がうまく分散しないと説明されています。経路が複数あることと、実際の通信が均等に流れることは別の問題です。資料の課題設定は、こうしたAI通信の性質を前提にしています。[2]

接続が増えれば、BGPにも処理能力が要る

資料では、1ポートあたり100Gbps、スイッチ全体で51.2Tbpsの構成を、複数のネットワーク面へ分けて導入したとしています。接続先が増えると、経路情報を交換するBGPの接続数も増えます。多数のポートを備えるハードウェアを用意すると同時に、それを制御するソフトウェアも拡張する必要があります。[2]

そこで示されたのが、経路制御ソフトウェアFRRを10.0.1へ更新し、約20件のパッチを加えるSONiCの改善です。512のBGPセッション、約1,000の経路、次の転送先である512のネクストホップを扱う構成が紹介されています。単一ポートの切断・復帰に関する発表結果は、データ転送の停止が0.1秒未満、経路情報の収束が約5秒です。異なる二つの時間を、同じ「復旧時間」としてまとめないことが大切です。[2]

SRv6で、送信元から通る経路を指定する

通信の経路選択には、IPv6を使うセグメントルーティングのSRv6が挙げられています。資料の構成では、送信元のネットワークインターフェースカード(NIC)が、経路を表す短い識別子uSIDの列をパケットへ入れます。途中のスイッチが順に処理し、宛先のNICが受け取る仕組みです。[2]

これにより、送信元が指定した経路をたどらせます。資料では、識別子の列が合わない場合はパケットを破棄する、厳密なソースルーティングを説明しています。経路を指定する仕組みそのものが混雑を自動で解決するわけではなく、どの経路を選ぶかと、途中で起きた混雑へどう応えるかを組み合わせる設計です。[2]

パケットを短くして、混雑の知らせを先へ送る

パケットトリミングは、混雑時に対象のパケットを短くし、宛先へ送る仕組みです。受信側のNICは、正常に受け取れなかったことを伝えるNACKを送信元へ返します。送信元は、その知らせを受けてパケットを再送し、送る速度を落とします。大きなデータを運び続ける代わりに、小さくしたパケットを早い通知につなげます。[2]

資料の図では、通信の種類やヘッダー、サイズでトリミングの対象を選び、通常のデータ用とは別に、優先度の高い待ち行列と専用バッファーへ入れています。多数の送信元から一か所へ通信が集中するインキャストに対応するため、短くしたパケットをためる領域の容量も検討項目です。[2]

発表では、優先度ごとに通信を一時停止するPFCや、パケットに混雑を知らせる印を付けるECNだけでは、このバースト性の高い通信に十分すばやく対応しにくいと説明しています。特にPFCの停止が周囲へ広がると、処理完了までの時間が延びる点を挙げています。PFCやECNがあらゆるネットワークで使えないという意味ではなく、ここで想定する通信に、より早いフィードバックを求める議論です。[2]

ミリ秒単位の観測を、運用のデータへつなぐ

短い混雑を調べるには、観測の間隔も細かくする必要があります。そこで紹介された高頻度ストリーミングテレメトリー(HFST)は、スイッチの統計をミリ秒単位で収集するための仕組みです。ASICがIPFIX形式で計測情報を送り、SONiC側のCounter Syncdが受け取って読み解きます。[2]

受信した情報は、登録済みのIPFIXテンプレートに従って解析します。対応するテンプレートがなければ、そのメッセージは破棄されます。得られたカウンターは手元のデータベースへ保存でき、OpenTelemetry形式へ変換して収集・処理の仕組みへ渡すこともできます。細かく測るだけでなく、正しく解釈して保存するところまでを一つの経路として考えています。[2]

実装の報告と、次に取り組む範囲を分けて読む

発表は、BGPの拡張結果と、SRv6・トリミング・テレメトリーの設計を並べて紹介しています。設計資料へのリンクもありますが、これだけで、すべてのSONiC製品や導入先に同じ機能がそろっているとは判断できません。利用するASICやNIC、ソフトウェアの実装を合わせて見る必要があります。[2]

今後の取り組みとしては、アクセラレーター同士を密に結ぶスケールアップ向けEthernetも挙げられています。今回の大規模なスケールアウト網を支える改善と、その先の検討範囲は分けて捉えたいところです。経路を制御し、混雑を早く伝え、その状態を細かく観測する。SONiCの役割は、この三つをハードウェアと運用の間でつなぐことにあります。[2]

MicrosoftとBroadcomについて

発表に登壇したMicrosoftとBroadcomの事業全体は、cyclewaveの企業解説で紹介しています。

参考資料

2026年8月の発表資料をもとに構成。性能値と課題は、資料で示された構成・通信条件に関する説明です。

  1. Open Compute Project「2026 OCP APAC Summit」 — 公式イベント・発表資料一覧。
  2. Microsoft・Broadcom「How SONiC Powers the World’s Largest AI Infrastructure」 — Guohan Lu、Mehak Mahajan。pp.4〜11:AI通信、BGP、SRv6、パケットトリミング、HFST。pp.12〜14:設計資料と今後の取り組み。

コメント

コメントを残す

メールアドレスが公開されることはありません。 ※ が付いている欄は必須項目です