投稿者: SB

  • OCP APAC 2026 | CPLDの更新失敗と誤警報を減らす、Metaの共通レジスター提案

    OCP APAC 2026 | CPLDの更新失敗と誤警報を減らす、Metaの共通レジスター提案

    サーバーの電源が入らないとき、原因はCPUや電源装置だけにあるとは限りません。起動の順番を整えたり、異常を見張ったりする小さな制御回路が、システム全体の動きを左右することもあります。

    その一つがCPLD(Complex Programmable Logic Device)です。2026年8月のOCP APAC SummitでMetaが示したのは、機種ごとに分かれていたCPLDの開発・機能要件を共通化する枠組みでした。ファームウェア更新からの復旧、異常情報の読み方、診断の仕組みをそろえようとする提案です。[1・2]

    簡単にまとめると?

    • Metaは、機種ごとに異なるCPLDの更新・故障情報・診断の仕組みを共通化する案を示しています。
    • 更新データの検証と予備領域からの起動を組み合わせ、異常の検出と復旧を別々に備えます。
    • 発表時点では共通仕様のドラフトを議論する段階で、採択済みのOCP標準ではありません。

    機種ごとの違いが、復旧を難しくする

    CPLDは、用途に応じた論理回路を実装できるデバイスです。Metaの資料では、サーバーやスイッチ、GPUラックの電源投入順序、故障監視、ファームウェア更新、安全に関わる制御を担うものとして登場します。[2]

    発表では、更新が途中で失敗して現地での復旧が必要になった例、管理用のI²Cバスが応答しなくなった例、正常な状態が故障として扱われた例が挙げられています。これらはMetaが紹介した事例で、データセンター全体の一般的な故障率を示す統計ではありません。[2]

    背景として指摘されたのが、40を超える設計の間で、レジスター配置、故障を表すビット、バージョンの表し方、通信のタイムアウトや復旧経路が共通になっていないことでした。同じ種類の異常でも、機種が変わるたびに読み取り側の作り込みが必要になります。[2]

    書き込みの確認と、起動できる予備領域を分けて備える

    更新の失敗に対しては、三段階の保護が示されています。転送したデータをページ単位のCRCで確認すること、書き込み後のイメージ全体をハッシュで検証すること、主領域で起動できなければ予備領域から起動することです。資料の構成例では、ページ単位の転送は128バイトとされています。[2]

    CRCとハッシュの検証は、書き込むデータの異常を見つけるためのものです。一方、二つの起動領域を用意する仕組みは、主領域に問題が残っても復旧へ進めるための備えです。異常を検出することと、異常のあとに動き直せることは別の役割を持ちます。

    この例では、検証や起動先の切り替えをCPLD内部で行い、管理バスへの依存を抑えます。予備側から起動したあとで、サーバー管理用のBMCが主領域を遠隔で修復する構成です。Metaは、ODMとCPLDベンダーと共同で開発・検証した方式として説明しています。[2]

    異常の概要を、どの機種でも同じ場所から読む

    もう一つの柱が、共通レジスターヘッダーの提案です。レジスターは、制御状態や異常情報などをソフトウェアから読み書きするための領域です。機種ごとに場所が違うと、基本的な正常・異常の判定まで個別対応になります。

    資料では、アドレス0x00〜0x1Fを共通部分とし、バージョン、状態、故障の概要などを同じ位置で読める案を示しています。機種固有の情報はその後ろに分けます。共通化によって固有機能を消すのではなく、最初の入口をそろえる考え方です。[2]

    故障情報も二段階です。まず電源シーケンス、電源、温度、冷却、CPU/SoC、クロックの六つの分類から概要を読み、その後、どの電源系統や領域に問題があるかを機種固有の情報で追います。BMCは「概要を読む→分類を知る→必要な詳細を読む」という流れを共通にできます。[2]

    診断の本体を共有し、機種の違いはルールで持つ

    Metaが示す診断の構成は、共通レジスターを読む診断エンジンと、機種ごとのルールセットを分けるものです。ルール側にはコマンド、故障パターン、対処手順を持たせます。新しい機種ごとに診断ツールを一から作るのではなく、共通の仕組みに必要な違いを渡す方向です。[2]

    開発要件の確認には、仕様とRTLの対応を調べるAIによるコードレビューも紹介されています。五つの設計から141件の指摘を得たという数値は、このレビューでの検出結果です。すべてが実運用の故障だったことや、AIだけで設計の安全性を保証できることを意味しません。[2]

    OCP仕様に向けた、まだ議論中の枠組み

    発表時点では、共通仕様に向けたドラフトのレビューを呼びかける段階でした。資料上の計画は、2026年後半に作業部会と最初のコミュニティレビュー、2027年に初期OCP仕様を目指すというものです。完成・採択済みの標準とは区別して読む必要があります。[2]

    この提案の要点は、機器の性能を直接引き上げることより、更新と診断を機種の違いで途切れさせないことにあります。正常に起動すること、故障を正しく知らせること、遠隔で戻れること。その土台を共通の約束事として整える、運用を見据えた設計です。

    企業の事業もあわせて読む

    Metaの広告事業とAI投資の全体像は、cyclewaveの企業解説で整理しています。

    cyclewaveでMetaの企業解説を読む

    参考資料

    2026年9月27日確認。計画・提案の状態は講演資料の時点を示します。

    [1]Open Compute Project「2026 OCP APAC Summit」発表一覧

    [2]Meta「From 40+ Fragmented CPLDs to a Common Standard」公式掲載スライド。問題と共通要件はpp.4–7、更新保護はp.8、レジスターと診断はpp.9–11、AIレビューと提案日程はpp.12–13。

  • OCP APAC 2026 | CPCが提案するUQDの相互運用性、接続寸法と試験条件をそろえる

    OCP APAC 2026 | CPCが提案するUQDの相互運用性、接続寸法と試験条件をそろえる

    液冷の配管をつなぐ部品を、複数のメーカーから選べる。調達の自由度が広がる一方で、実際に組み合わせたときに、同じように流れ、同じ条件で使い続けられるかは別の確認が必要です。

    2026年8月のOCP APAC SummitでCPCが取り上げたのは、クイックディスコネクト(QD)の相互運用性と適格性評価です。形が合うことから一歩進み、部品の試験、組立て、保管、運用まで、何を共通の条件として確かめるかが主題でした。[1・2]

    簡単にまとめると?

    • UQDは液冷継手の接続寸法や性能要件をそろえますが、実際の冷却液や装置との適合確認は別に必要です。
    • CPCは、輸送・保管から洗浄、組立て、運用まで、部品の一生を通した評価を提案しています。
    • 合格範囲と測り方を共有する呼びかけであり、完成済みの新しい認証制度を示した発表ではありません。

    UQDがそろえるものと、実装で残るもの

    QDは、冷却液の流路を着脱するための継手です。OCPのUniversal Quick Disconnect(UQD)仕様は、プラグとソケットの接続寸法や性能要件を定めています。異なる供給元の製品を組み合わせるための土台ですが、「UQDという名前なら、どんな冷却液や装置でも無条件に使える」という意味ではありません。[3]

    CPCの発表では、機械的な条件、流れに関する条件、仕様の解釈がそろわないことを課題に挙げています。部品単体で確認した条件と、サーバーやラックに組み込んだときの要求が違えば、同じ試験結果でも判断が分かれます。資料には複数の試験回路が並び、試験の組み方そのものを比較する必要が示されていました。[2]

    適格性評価は、使い始める前から始まる

    適格性評価は、部品が意図した用途と条件に適しているかを、試験や確認によって判断することです。今回の資料は、製造・輸送・保管、組立てと試験、運用中の監視と交換、最後の撤去までを、一続きのライフサイクルとして捉えています。[2]

    使い始める前にも、問題の入口はあります。製造のばらつき、流路に残った異物、保管中の液体の滞留に伴う材料の不適合、想定していない洗浄方法などです。資料は、ろ過せずにフラッシングする例や、QDの弁に異物が影響する例を挙げています。新しい部品だから、運用初期の故障要因がないとは限りません。[2]

    ここから分かるのは、接続後の漏れだけを確認しても、評価の全体にはならないということです。たとえば部品の保管条件と装置側の洗浄手順が食い違っていれば、部品の図面に問題がなくても、組み上がった流路の状態は変わります。これは発表で挙げられた要因から読み取れる、統合時の注意点です。

    共通にしたいのは、合格の境界と測り方

    発表が求めるのは、すべてのメーカーの設計を一つにすることではありません。許容する性能の範囲と、その範囲を確かめる方法を共有することです。

    資料では、要求事項を上限・下限まで明確にすること、試験と検証を調和させること、試験設備の違いを解消することを提案しています。数値が一つ載っているだけでは、その値をどんな条件で測り、どこまでを合格とするのかは伝わりません。部品の供給元、装置を組む側、使う側が同じ境界を読めるようにする必要があります。[2]

    その対象はUQDだけに閉じていません。ブラインドメイト型を含むQD群や、コールドプレート、マニホールド、ポンプ、ろ過、冷却液まで、冷却回路を構成する要素を横断して議論する方向です。個別の仕様を積み重ねるだけでなく、隣り合う部品の間で、確認条件をつなぐ取り組みと言えます。[2]

    標準部品を選ぶことと、組み合わせを確かめること

    今回の発表は、共通の評価枠組みを作り、既存の液冷要求事項を更新していこうという呼びかけです。ここで示された方針が、そのまま完成済みの新しい適合認証制度になったわけではありません。

    液冷設備を選ぶときには、部品が準拠する仕様と版、適用する冷却液や温度・圧力の条件、組み合わせの試験範囲を別々に読む。それに加えて、輸送・保管から初期洗浄までの引き継ぎをそろえる。複数メーカーを使える利点を現場で生かすには、接続口だけでなく、評価の前提もつながっていることが大切です。

    企業の事業もあわせて読む

    CPCを傘下に持つDoverの全体像は、cyclewaveの企業解説で整理しています。

    cyclewaveでDoverの企業解説を読む

    参考資料

    2026年9月27日確認。公式掲載スライドをもとに構成しています。

    [1]Open Compute Project「2026 OCP APAC Summit」発表一覧

    [2]CPC「Maximizing Impact Through Best Practices – DLC Qualification & Interoperability」公式掲載スライド。ライフサイクルと初期故障要因はpp.4–6、相互運用性・試験条件・共同検討はpp.7–10。イベント一覧では「Accelerating Liquid Cooling Deployment Through UQD Interoperability and Qualification Frameworks」と掲載。

    [3]Open Compute Project「Universal Quick Disconnect(UQD)Specification Revision 1.0」。UQDの定義と接続・性能要件。

  • OCP APAC 2026 | 二相DLCで変わる、流量配分と圧力損失の設計

    OCP APAC 2026 | 二相DLCで変わる、流量配分と圧力損失の設計

    たとえば、液体で冷やすチップの発熱が増え、冷却液を沸騰させて熱を運ぶ方式を検討するとします。液体が蒸気へ変わるときには、多くの熱を受け取れます。ただ、その変化は冷やしやすさだけでなく、配管の中の流れ方にも関わります。

    OCP APAC 2026の公開資料「Technical Challenges and Key Considerations in Transitioning from Single-Phase to Two-Phase DLC」は、単相から二相へ移る直接液冷(DLC)の設計課題を扱っています。注目したいのは、熱を受け取る量だけでなく、液体と蒸気が混ざった流れをどう配り、圧力をどう管理するかです。[1]

    簡単にまとめると?

    • 二相DLCは、冷却液が蒸発するときに吸収する熱も使ってチップを冷やします。
    • 蒸気が増えると流れにくくなり、熱の大きい側へ液体が届きにくくなる場合があります。
    • 単相との比較やシステム全体の実験検証は、今後の課題として残っています。

    液体の温度上昇に加えて、蒸発するときの熱を使う

    チップの熱を受け取る板状の部品が、コールドプレートです。単相の直接液冷では、内部を流れる冷却液を液体のまま使い、温度の上昇によって熱を運びます。二相では液体の一部を沸騰させ、液体から蒸気へ変わるときに吸収する蒸発潜熱も利用します。[1]

    資料は、二相冷却によって熱の受け渡しや温度の均一さを改善できる可能性、必要な流量やポンプ動力を抑えられる可能性を挙げています。ただし、これは方式の利点としての説明です。特定の装置で、同じ条件の単相冷却より何割優れていたというシステム全体の実証ではありません。[1]

    熱が大きい経路に、自然と多く流れるとは限らない

    二相の流れでは、液体と蒸気の割合も変わります。資料の乾き度は、気液混合物の質量のうち、蒸気が占める割合を表す値です。流れながら熱を受け取ると、この割合が変わり、圧力損失にも影響します。圧力損失は、流れに伴って入口から出口へ圧力が下がることです。[1]

    複数のコールドプレートを直列につないだ構成例では、下流へ進むにつれて蒸気の割合が増え、各プレートの圧力損失や冷却の状態がそろわなくなる課題を示しています。上流と下流を同じ液体の条件として扱うだけでは、十分ではありません。[1]

    並列に分ければ解決するとも限りません。資料の800 Wと300 Wの熱負荷を並べた例では、熱負荷の大きい側に少ない流量、小さい側に多い流量を示す矢印があります。高い熱負荷で蒸気の割合が増え、流れにくくなると、必要な側へ十分な液体が届かなくなる場合があるのです。この図は流量の偏りを説明する構成例であり、すべての並列回路で同じ配分になるという測定結果ではありません。[1]

    さらに、気泡が逆向きに動いたり、流れが周期的に揺れたりする流動不安定も課題になります。資料は過去の研究とAVCの実験例を示し、入口の流れを絞る部材、広げた出口流路、液体を分配するマニホールドの設計などを対策の候補に挙げています。必要な総流量とともに、各流路へどのように配るかを設計する必要があります。[1]

    低い圧力の冷媒でも、設備の条件が緩くなるとは限らない

    冷媒を選ぶと、装置が受ける圧力だけでなく、圧力が下がったときの温度条件も変わります。ここで関わるのが飽和温度です。液体と蒸気が共存できる温度で、圧力に応じて変わります。資料は、この関係が建物側の冷却水の温度条件にまで影響すると説明しています。[1]

    資料の仮定したシステムでは、飽和温度50℃から圧力が100 kPa下がった場合を比べています。低圧側の冷媒R1233zdの例では飽和温度が37℃へ、中圧側のR1234yfの例では46℃へ下がります。これは圧力と温度の関係を示す比較図で、装置の実測性能を比べた値ではありません。[1]

    同じ圧力低下でも、温度への影響は同じではありません。資料は、低圧側では機械的に受ける圧力を抑えられる一方、圧力損失による温度変化に敏感になり、設備水の温度条件が厳しくなると整理しています。中圧側では、その影響を抑えやすい反面、より高い圧力に耐える機械設計が必要になります。どちらが使いやすいかは、冷媒だけでなく冷却回路と設備側の条件を合わせて考える部分です。[1]

    冷媒どうしの比較と、単相・二相の比較を分ける

    資料には、同じコールドプレートと同じ一次側の条件を使い、R134aとR1233zd(E)を比較した実験もあります。ここで比べているのは、二相冷却に使う冷媒の違いです。先ほどの仮定したシステム図とは冷媒の組み合わせも異なり、単相と二相の優劣を直接示す実験ではありません。[1]

    冷媒の選択では、潜熱や密度に加え、接触するホース、継手、コールドプレート、ポンプの材料との適合性も個別に確かめる必要があります。安全面や環境面の条件も含め、熱の物性値一つで決められるものではありません。[1]

    発表の最後に残されているのは、同じ設備水条件で単相と二相を比べること、流動不安定を評価する解析手法、システム全体での実験検証です。二相冷却の可能性を活かすには、沸騰によって熱を受け取れることに加え、必要な流れを安定して届けられることまで確かめていく。その道筋を示した資料といえます。[1]

    実験例を紹介しているAVCの事業全体については、cyclewaveの企業解説にまとめています。

    参考資料

  • OCP APAC 2026 | 基板と部品の熱を見積もる、材料構成と方向別の熱伝導率

    OCP APAC 2026 | 基板と部品の熱を見積もる、材料構成と方向別の熱伝導率

    たとえば、まだ部品メーカーから詳しい熱のデータが届いていない段階で、基板上のどこが熱くなるかを調べたいとします。部品の形や配置がわかっていても、中の材料をどう置き換えて計算するかで、予測する温度は変わります。

    OCP APAC 2026の公開資料「From Material Composition to Effective Thermal Conductivity」は、材料の構成から有効熱伝導率を求め、基板や部品の熱シミュレーションに使う方法を紹介しています。複数の材料が混ざる構造を、熱の伝わりやすさを表す値に置き換える考え方です。ただし、同じ材料でも、熱が流れる方向によって扱いが変わります。[1]

    簡単にまとめると?

    • 材料の構成と熱が流れる方向から有効熱伝導率を求め、基板や部品の計算モデルを作ります。
    • 示された温度の変化は計算モデルを変えた結果で、実機の冷却性能が改善した実験ではありません。
    • 詳しい熱データが少ない初期設計向けの方法で、複雑な2.5D・3Dチップレットへの適用は未検証です。

    熱が材料を順に通るか、並んだ経路を通るか

    PCB(プリント基板)は、銅などの導体と絶縁材料を重ねた構造です。そこに部品を実装したものがPCBAです。資料は、基板自体の熱の流れと、実装する部品内部の熱の流れを分けてモデル化しています。[1]

    材料を一つずつ通り抜ける方向では、それぞれの材料による熱抵抗、つまり熱の流れにくさが積み重なります。一方、異なる材料の経路が並び、両端の温度差が同じなら、各経路を通る熱を足し合わせます。資料はこの直列・並列の考え方から、材料の熱伝導率と体積の割合を使って、構造全体の有効熱伝導率を求めています。材料の割合だけでなく、熱の通り道を決めることが出発点です。[1]

    基板の面内と厚さ方向を、同じ値にしない

    基板では、層に沿う面内方向と、層を横切る厚さ方向を区別します。資料の例は、FR4という絶縁材料と銅からなり、厚さ2.34 mm、導体層が12層ある基板です。各層の厚さと銅が占める割合を入れると、次の有効熱伝導率になります。[1]

    熱が流れる方向この基板例の有効熱伝導率
    層に沿う面内方向64.2 W/(m·K)
    層を横切る厚さ方向0.36 W/(m·K)

    同じ基板でも、方向によって大きく異なります。この値は、資料の層構成と銅の割合から求めた例です。すべての基板へそのまま使える定数ではありません。[1]

    資料は、各層の銅の割合を設定したモデルと、有効熱伝導率へ置き換えたモデルを比較しています。掲載された部品温度は、ほぼ同じ計算結果になりました。ただし、実測との差がなくなったわけではありません。たとえばダイオードは、実測99.8℃に対し、どちらのモデルも114.9℃です。ここで確かめているのは、主に基板のモデルを置き換えても計算結果が近いことです。[1]

    部品の材料構成を入れると、予測はどう変わるか

    部品側の例では、ダイオードを構成する樹脂、金属の支持部、半導体などの材料を使います。資料は、質量と密度から体積の割合を求め、直列モデルとして有効熱伝導率を0.96 W/(m·K)としています。[1]

    この比較では、実測99.8℃に対し、エポキシを参照した0.7 W/(m·K)の設定で予測温度は110℃、材料構成から求めた設定で103℃でした。資料の表に示された実測との偏差は、10%から3%になっています。これは計算に入れる熱のモデルを変えた結果であり、部品を交換して実機の温度が下がった実験ではありません。直前の基板モデル比較とも、別の比較として読む必要があります。[1]

    すべての部品で、実測への近さが改善したわけでもありません。電流を制御する半導体のMOSFETでは、熱の流れを抵抗で表す2Rモデルと、材料構成によるモデルを比較しています。掲載された4個のMOSFETについて、実測との偏差は2Rモデルが8〜11%、有効熱伝導率を使うモデルが12〜15%でした。たとえば1個目は、実測78.5℃に対し、それぞれ84.7℃と88.1℃です。材料の情報から見積もれることと、より正確に予測できることは、分けて評価する必要があります。[1]

    詳細なデータが届く前の、初期設計に使う

    この方法の位置づけは、部品メーカーの詳しい熱データが限られている初期設計で、材料の情報を使って検討を進めることです。形状が比較的単純な構造を想定しており、内部の熱経路が複雑な2.5D・3Dチップレットへの適用は、資料でも未検証とされています。[1]

    また、掲載された温度比較だけでは、周囲温度、風量、各部品の発熱量、測定手順の全条件は確認できません。数値を別の装置の性能保証に広げず、まず方向別の熱の流れと材料の構成を整理し、得られた予測を実測と照らしていく。そのためのモデルの作り方として読むと、資料の使いどころが見えてきます。

    共著者が所属するMicrosoftの事業全体については、cyclewaveの企業解説で整理しています。

    参考資料

  • OCP APAC 2026 | 800 V電源の入力設計、過渡電圧の許容時間とプリチャージ

    OCP APAC 2026 | 800 V電源の入力設計、過渡電圧の許容時間とプリチャージ

    たとえば、800 Vの直流配電につながるラックへ、電源ユニットを追加するとします。名目の入力電圧が合っていても、接続した瞬間の電流や、運転中に電圧が変動したときの振る舞いまで考える必要があります。

    OCP APAC 2026の公開資料「LVDC Power Distribution and Its Interface with Rack Power Systems」は、LVDC(Low Voltage Direct Current、低電圧直流)の配電と、ラック側の電源との接続を扱っています。ここでは、そのうち電源の入力部分に注目します。電圧だけでなく時間を含めた動作範囲と、起動時の電流制御を組み合わせる考え方です。[1]

    簡単にまとめると?

    • 800 V電源の入力設計は、電圧の範囲だけでなく、変動が続く時間と保護動作を組み合わせて考えます。
    • 接続直後の突入電流を抑えるプリチャージと、その後の起動電流を制御する回路は、役割が異なります。
    • 資料には未確定の時間・サージ条件が残り、図の値を製品の設定値や共通の保証性能にはできません。

    800 Vを、ラックのどこまで運ぶか

    資料には、800 VをラックのDC-DCパワーシェルフで54 Vへ下げてから配る構成と、800 Vのバスバーで各サーバー側へ送り、PDB(Power Distribution Board、電力分配基板)を用いる構成が示されています。バスバーは、大きな電流を運ぶ導体です。後者では、高い電圧を受ける部分が、計算機に近い場所まで入ってきます。[1]

    どちらも、最終的には半導体に必要な低い電圧へ変換します。ただし、800 Vを受ける場所が変われば、その入力部に必要な保護や起動の設計も重要になります。資料はPDB側の低背化、高密度化、冷却も課題に挙げています。以下では、特定製品の性能ではなく、この接続部分の設計を見ていきます。[1]

    入力電圧の範囲に「続く時間」を加える

    電源の入力条件は、通常の電圧範囲だけでは表しきれません。資料は、電圧が一時的に変化したときに、保護機能を作動させず運転を続ける領域も分けて説明しています。こうした短い時間の変化を、過渡現象と呼びます。[1]

    資料の動作区分想定する役割
    Continuous Operation保護停止せず、継続して電力変換できる範囲
    Transient 1過渡変化の後、複数の電源が電流の分担を落ち着かせるための一時運転
    Transient 2離れたラックでの故障に伴う短い変動の間も、一時的に運転を続ける領域
    Transient 3サージや電圧途絶に備え、変換器を損傷させず停止するための条件
    資料[1]8ページの説明を整理。確定した共通規格や、すべての電源が備える保証性能を示す表ではありません。

    資料はTransient 1を数十ミリ秒、Transient 2を数百マイクロ秒程度の領域として説明しています。一方で、図には時間などの未確定項目を示す「TBD」が残り、Transient 3のサージ・電圧途絶条件も未確定です。数値をそのまま製品の設定値にするのではなく、電圧の大きさと、その状態が続く時間を組で考えるための整理として読むのが適切です。[1]

    たとえば、電圧が通常範囲から短時間外れた場合でも、すぐに停止する設計と、決めた時間だけ運転を保つ設計では、ほかの電源や保護装置との組み合わせ方が変わります。反対に、運転を保てない変動では、変換器を安全に止めるための時間が必要になります。資料は後者を、電力供給を短時間維持するホールドアップ時間と結び付けています。[1]

    変換回路の手前で、入力を整える

    資料の一般化した電源構成図では、入力コネクター、電磁ノイズを抑えるEMIフィルター、HSC(Hot Swap Controller Circuit、ホットスワップ制御回路)、電源電圧の変動を抑えるデカップリングコンデンサーの先に、主電源と待機電源の変換回路が置かれています。HSCは、電源をつないだ際の電流を制御する部分です。[1]

    同じページのコネクター概念図には、主な電力を運ぶ端子のほか、プリチャージや接続検知・電圧検知に関わる接点も描かれています。入力の設計には、電力変換回路だけでなく、コネクターから制御回路までの連携が含まれます。この図は概念図であり、特定コネクターの寸法や配線手順を示すものではありません。[1]

    最初の突入電流と、その後の立ち上げを分ける

    電源を接続した直後に、一時的に電流が流れ込む現象を突入電流と呼びます。資料は、HSCがあっても、配線や基板、半導体、保護部品に存在する寄生容量によって最初の突入が生じると説明しています。寄生容量は、部品や配線に付随して生じる、電荷を蓄える性質です。[1]

    この最初の電流を抑えるために使うのが、プリチャージ抵抗です。資料の起動波形では、接続直後の突入電流をI2として示し、プリチャージ抵抗で制限します。その後にHSCが制御する電流I1の段階があり、起動を終えると定格に制御された電流I3へ移ります。I1・I2・I3は図中の電流の呼び名で、数字の順に発生するわけではありません。[1]

    この図には電流値や各段階の具体的な時間がなく、途中の細かな区間の動作も説明されていません。読み取れるのは、接続直後の突入を抑える仕組みと、その後の起動電流を制御する仕組みを、分けて用意するという関係です。

    短い変動を受け止める役割を、電源系統の中で分担する

    入力部だけで、すべての変動を扱うわけではありません。資料は、コンデンサー、スーパーキャパシター、ラック列や配電側の蓄電設備を、応答する時間の違いに応じて配置する考え方も示しています。チップに近い電圧変動の抑制と、電力系統側の長めの変動への対応では、受け持つ役割が異なります。[1]

    800 Vの配電からラック側の電源までを見るときは、定常時の電圧や電力に加えて、どの変動をどの時間まで受け入れ、接続時の電流をどの回路で抑えるかを追うと、設計のつながりが見えてきます。電源の入口は、電圧を変換する前から、配電側と計算機側の動作をつないでいます。

    資料の共著企業のうち、デルタ電子の会社全体については、cyclewaveの企業記事で紹介しています。

    参考資料

    1. Peter Barbosa、Rudy Wang(Delta Electronics)、Aurelio Rodriguez Echevarria(AMD)、LVDC Power Distribution and Its Interface with Rack Power Systems(OCP APAC 2026公開スライド)。ラック側の構成:6〜7ページ、動作領域:8ページ、入力部と起動:9〜10ページ、蓄電の役割分担:11〜12ページ。著者名・所属は表紙表記に基づきます。
    2. OCP APAC 2026公式プログラム・公開資料一覧。本記事は掲載PDFに基づきます。PDFの作成・更新日は2026年9月2日(UTC)で、8月11〜12日の会場投影版と同一かは確認できていません。
  • OCP APAC 2026 | SSTの小型化を支える高周波変圧器と、絶縁・放熱の設計

    OCP APAC 2026 | SSTの小型化を支える高周波変圧器と、絶縁・放熱の設計

    大きな電力を扱う変圧器を小さくできれば、AIデータセンターの電源設備にも余裕が生まれます。ただ、小型化するほど、内部の絶縁を保ち、発生した熱を外へ逃がす設計が重要になります。

    OCP APAC 2026の公開資料で、Delta Electronics(デルタ電子)が取り上げたのが、SST(Solid-State Transformer、ソリッドステート変圧器)です。高周波変圧器とパワー半導体による電力変換を組み合わせ、中圧の交流から直流へ電力を供給する構成を説明しています。部品を小さくする技術と、電源設備として使うための条件を、一緒に見ていきます。[1]

    簡単にまとめると?

    • SSTは半導体の変換回路と高周波変圧器を組み合わせ、磁気部品の小型化を図ります。
    • 小型化には、絶縁を保つ構造と熱を外へ逃がす構造の両立が必要です。
    • 資料の効率比較は特定の構成例で、設備や負荷が違っても同じ効果が出るとは限りません。

    高周波化で磁気部品を小さくする

    一般的な電力用変圧器は、商用周波数の交流を受け、巻線と磁心によって電圧を変えます。SSTでは、その前後に半導体の電力変換回路を置き、変圧器をより高い周波数で動かします。資料は、これによって磁気部品の小型化を進められると説明しています。[1]

    高周波変圧器は、入力側と出力側を電気的に絶縁しながら電力を渡す部分です。変換回路の制御には、電圧や電流を調整する役割もあります。資料の構成例では、SSTが中圧交流を800 V直流へ変換し、その先の別のDC-DC変換器が、サーバーや半導体に必要な電圧まで下げます。SSTだけでチップの電源電圧まで変換する図ではありません。[1]

    複数の変換モジュールをどう組み合わせるか

    資料は、SSTの代表的な回路構成としてISOP(入力直列・出力並列)と、MMC(モジュラー・マルチレベル・コンバーター)を用いる構成を並べています。ISOPの図では、交流を直流に変える段と、変圧器を含む絶縁型DC-DC段を持ったモジュールが複数並びます。入力を直列につなぎ、出力を並列にまとめる構成です。[1]

    一方、MMC側の図では、交流から共通の中圧直流バスを作り、そこから複数の絶縁型変換回路へ電力を渡しています。資料は、この共通バスを利用した接続や制御の選択肢、変圧器の部分放電に関わるストレスを抑える点を挙げています。その半面、AC-DC段のサブモジュール数が増える課題も示しています。[1]

    両方に共通する課題は、直流部分の電圧を支えるDCリンクコンデンサーが大きくなることです。磁心だけを小さくしても、SST全体が同じ割合で小さくなるとは限りません。変圧器、半導体、コンデンサーを含む構成として考える必要があります。

    密度を上げるほど、絶縁と熱の逃げ道が問われる

    高周波変圧器では、磁心の材料と巻線の作り方が重要です。資料は、PCB(プリント基板)を用いた巻線による高密度化とともに、交流での巻線損失が大電力化の制約になることを示しています。小さく収まる形だけでなく、そこで生じる損失も見なければなりません。[1]

    絶縁には、空間を隔てる空間距離と、絶縁物の表面に沿った沿面距離の確保が関わります。資料は、これらの要求を満たし、絶縁の一部で局所的に生じる「部分放電」を起こさない設計を課題に挙げています。部品を近づけて詰め込むだけでは、小型化は成立しません。[1]

    同じページでは、電力密度を高めると放熱に使える表面積が小さくなり、熱設計が難しくなる関係も示しています。高い変換効率と、扱いやすい温度は別の確認項目です。絶縁を保つ構造と、熱を外へ運ぶ構造を両立させるところに、SSTの設計の難しさがあります。[1]

    故障時の保護と、負荷変動への対応を分けて考える

    半導体で電流を制御できることは、故障時の設計にも関わります。資料は、直流バスの短絡に対してSSTが電流を制御し、遮断器を動作させる構成を説明しています。また、ラックへ向かう分岐回路には、半導体遮断器による素早い保護を挙げています。SSTの制御と、故障箇所を切り離す遮断器を組み合わせる考え方です。[1]

    通常運転中の急な負荷変動には、別の役割分担があります。資料のESS(エネルギー貯蔵システム)との協調例では、蓄電側が変動分を支え、SSTは電力系統から受け取る電力を滑らかにする役割を担います。[1]

    掲載された400 Vバスの波形例では、キャパシタートレーを停止した後にバス電圧の揺れが大きくなり、資料はSSTの応答の遅さと結び付けています。これは、その構成での協調の必要性を示す例です。あらゆるSSTの応答性能や、800 V設備での挙動をそのまま示すものではありません。[1]

    性能の数値は、構成例と開発目標を分けて読む

    資料は、1.2 MWのSSTを用いる構成例について、従来の変圧器とAC-DC変換器の組み合わせと比較しています。次の値は、この資料に掲載された比較です。[1]

    比較項目変圧器+AC-DC変換器SST
    重量5.8 t4 t
    設置面積4.96 m²3.39 m²
    50%負荷時の効率95.5%97.5%
    出典:資料[1]18ページ。1.2 MWの構成例。効率の差は2パーセントポイントです。

    このページには、入力電圧や冷却条件など、比較を再現するための条件がそろっていません。表の効率は比較対象の電力変換部分の値で、電力系統からチップまでの総合効率とも異なります。設備や負荷率が変わっても同じ効果が出る、と読むことはできません。

    さらに資料は、電力密度400〜1,000 kW/m³、効率98.5%超を、今後の目標として掲げています。先ほどの構成例の値と混ぜず、高い電圧に対応するSiC(炭化ケイ素)半導体、熱を伝えやすい絶縁材料、損失の小さい磁性材料、変換回路と制御の改良に結び付けて示しています。[1]

    SSTを見るときは、小さな高周波変圧器だけでなく、周囲のコンデンサーや絶縁構造、熱の逃げ道、保護と蓄電の分担まで追うと、設備としての姿が見えてきます。小型化や効率の数値を、その成立条件と一緒に読むことが大切です。

    デルタ電子の会社全体については、cyclewaveの企業記事で紹介しています。

    参考資料

    1. Delta Electronics, Enabling Scalable AI Data Centers Through Solid-State Transformer Technology(OCP APAC 2026公開スライド)。構成と高周波化:4〜5・9・11ページ、磁気部品と絶縁・放熱:12〜13ページ、保護と蓄電協調:15〜17ページ、構成例の比較と目標:18〜19ページ。
    2. OCP APAC 2026公式プログラム・公開資料一覧。本記事は掲載PDFに基づきます。PDFの作成・更新日は2026年9月2日(UTC)で、8月11〜12日の会場投影版と同一かは確認できていません。
  • OCP APAC 2026 | MicrosoftのMaia・Cobalt・Boost DPU、推論・CPU処理・I/Oを分担

    OCP APAC 2026 | MicrosoftのMaia・Cobalt・Boost DPU、推論・CPU処理・I/Oを分担

    たとえば、AIが必要なデータを探し、外部の処理を呼び出し、その結果を使って答えを作るとします。モデルの推論を速くするだけでなく、データを取り出す処理や、次の仕事へ進める処理にも時間がかかります。AI基盤を考えるときは、どの計算器が速いかと一緒に、どの仕事をどこへ任せるかを見る必要があります。

    2026 OCP APAC Summitの公式一覧に掲載されたMicrosoftの資料は、半導体からサーバー、ネットワーク、データセンターまでを一緒に設計する考え方を示しています。その中から、推論向けのMaia 200、CPUのCobalt 200、データ処理向けのBoost DPUという、役割の異なる三つに注目します。[1・2]

    簡単にまとめると?

    • Microsoftは、推論・CPU処理・データ入出力を、役割の異なる半導体へ分担する設計を示しています。
    • Boost DPUは、ストレージやネットワークの基盤処理をホストCPUから引き受けます。
    • 三つの性能指標は対象が異なり、改善率を組み合わせてサービス全体の高速化とは評価できません。

    AIの処理が変わると、待ち時間の場所も変わる

    資料は「ボトルネックは移り続ける」という見出しで、モデルの規模、計算能力、メモリー、ストレージを並べています。モデルを動かすには演算だけでなく、必要なデータを保持し、読み書きする能力も要るからです。グラフは異なる指標の伸びを2019年基準で示したもので、線同士の差を、そのまま実際の処理時間の差として読むことはできません。[1]

    さらに資料は、AIエージェントの処理を背景に、CPUとGPUの役割へ目を向けています。たとえば、複数の処理を進める順番や結果の受け渡しを整える時間が長ければ、推論部分だけを速くしても、全体の待ち時間は同じ割合では短くなりません。どこが処理の進行を妨げているかによって、強化したい部分も変わります。

    Maia、Cobalt、Boost DPUで見る三つの役割

    Microsoftは、対象となる処理に応じて自社の半導体を紹介しています。資料と同社の補足記事に沿うと、役割は次のように整理できます。これは製品群の役割分担であり、三つを同じサーバーへ搭載する配線図ではありません。[1・3]

    半導体資料で示す主な対象注目する点
    Maia 200AIモデルの推論処理するモデルとチップを合わせて設計し、費用や電力あたりの推論処理を考える
    Cobalt 200クラウド向けのCPU処理、AIエージェントに関わる処理複数の仕事の並行処理と進行管理、呼び出しの待ち時間を考える
    Boost DPUストレージやネットワークの基盤処理ホストCPUから専用の半導体へ処理を移す

    Maia 200は、推論を担うアクセラレーターとして位置づけられています。資料が挙げるのは、チップとモデルの協調設計です。チップ単体の演算能力だけで評価を終えず、動かすモデルと組み合わせて、電力や費用に対してどれだけ推論を進められるかを見ます。[1]

    Cobalt 200はCPUです。補足記事では、並行処理や、複数の処理の進行をまとめるオーケストレーションに向けた設計と説明されています。モデルの推論を担う部分と、仕事を進めるCPU側の処理を分けて考えると、AI基盤に求める性能を捉えやすくなります。[1・3]

    Boost DPUは、CPUが担っていた基盤処理を引き受ける

    DPU(Data Processing Unit)は、ここではデータの入出力に関わる処理を受け持つ専用プロセッサーです。MicrosoftはBoost DPUについて、ストレージやネットワークの基盤処理をホストCPUから移す、オフロードの役割を説明しています。OCP資料でも、クラウドのストレージ処理が主な対象として挙がっています。[1・3]

    この役割は、アプリケーションの計算を速くすることとは分けて考えられます。たとえば、CPUがアプリケーションとデータ入出力の両方を担っているなら、入出力側の仕事を別の処理器へ移すことで、CPUに任せる仕事の範囲が変わります。ここでいうI/Oは、データの入力と出力のことです。効果を見る際には、移した処理の速さだけでなく、CPU側と合わせた待ち時間や消費電力を確認します。

    違う性能指標を、一つの倍率にまとめない

    資料に出てくる性能指標も、三つで異なります。Maia 200では費用・電力あたりの推論性能、Cobalt 200ではエージェント呼び出しの遅延や一定時間に処理できる量、Boost DPUではストレージ処理の性能と電力です。対象の仕事が違うため、それぞれの改善率を足したり掛けたりして、AIサービス全体の高速化を求めることはできません。[1]

    掲載スライドだけでは、比較した構成や測定条件の詳細までは分かりません。この記事では改善率を一般的な性能値として使わず、何を測る指標なのかに注目しています。推論の処理量、呼び出しの待ち時間、入出力の負荷を分けて見ることで、必要な改善を選びやすくなります。

    処理の分担を、サーバーと施設の設計へつなぐ

    資料の全体図では、半導体、プラットフォーム、ネットワーク、データセンターの協調設計を重ね、その周囲にセキュリティと持続可能性を置いています。処理を専用化する方針を、部品一つの効率で終わらせず、組み合わせたシステムとして考える構成です。電力や冷却も同じ資料で扱われています。[1]

    AI基盤を選ぶときは、「最も速いチップはどれか」に加え、「推論、CPU処理、データ入出力のどこに時間を使っているか」を確かめる。Maia、Cobalt、Boost DPUの役割を並べると、専用の半導体を作る意味が、仕事の分担として見えてきます。その分担をソフトウェアやサーバー構成までつなげることが、今回の資料を読む一つの軸になります。

    Microsoftの事業を知る

    Azureを含むMicrosoft全体の事業は、cyclewaveの企業解説にまとめています。

    参考資料

    公式一覧から公開された18ページのPDFと、Microsoftの補足記事をもとに構成しました。PDFの作成日は2026年9月8日です。開催当日の版との同一性は未確認のため、公開資料に示された設計として紹介しています。

    [1]Gohar Waqar、Sushant Gupta(Microsoft)「From Silicon to Systems: Driving Innovation for Azure Compute & AI」。8ページ:処理の制約、10–14ページ:全体設計と各半導体の役割・評価指標、15–18ページ:セキュリティ、電力・冷却、ネットワーク、協調設計。

    [2]Open Compute Project「2026 OCP APAC Summit」。講演と公開資料の公式案内。

    [3]Microsoft「From Silicon to Systems: Bending the Cost and Complexity Curves of AI」(2026年8月)。Cobaltの並行処理・オーケストレーションと、Boost DPUへの基盤処理のオフロードを補足。

  • OCP Korea 2026 | Stäubliの液冷配管設計、大口径QDとEPDMホースをつなぐ

    OCP Korea 2026 | Stäubliの液冷配管設計、大口径QDとEPDMホースをつなぐ

    たとえば、液冷ラックを新しい機種へ入れ替えるとします。必要な冷却液の流量が変わっても、施設の配管をすべて作り直すのではなく、交換する範囲を区切っておけたら、次の構成へ移りやすくなります。その境目をつくる部品の一つが、配管を着脱するクイックディスコネクト(QD)です。

    2026 OCP Korea Tech Dayの公式一覧に掲載されたStäubli(ストーブリ)の資料は、大口径QDからホースの材質、曲げ方、端末の固定方式までを並べ、液冷設備のモジュール化を考えています。ここでは、接続部品を単体で選ぶだけでは見えにくい、その組み合わせに目を向けます。[1・2]

    簡単にまとめると?

    • 液冷配管のモジュール化では、QDを付けるだけでなく、交換時に外す範囲と設備側に残す範囲を決めます。
    • 同じEPDMホースでも、口径や架橋方法、曲げ半径が異なるため、材料名だけでは選べません。
    • 必要な流量、ホースの取り回し、端末の固定までを一つの流路として設計することが大切です。

    どこで外すかを、配管全体から決める

    資料の図は、施設側の冷却水系、冷却液分配装置のCDU、ラック、各サーバーを含む冷却系統の全体像を示しています。ラック内で冷却液を分けるマニホールドだけでなく、施設配管からラックへ分岐する場所にも、交換や接続の境界があります。[1]

    その分岐部の説明では、流量を調整する部品、ホースを接続する部品、ラック側で着脱する部品を分けています。ホース端部を固定する継手と、着脱時の液だれを抑える「drip-less connector」は、それぞれ担う役割が違います。接続できる形をそろえることに加え、どの部分を外し、どの部分を設備側に残すかを考える構成です。[1]

    大口径QDの反対側にも、接続の仕様がある

    QDというと、二つの部品を着脱する面に目が向きます。ただ、その反対側ではホースや配管へ接続しなければなりません。資料にあるStäubliのTDUシリーズには、ねじ接続、ホースを差し込むホースバーブ、90度に曲がった端部、クランプで接続するTri-Clampなど、複数のホース側インターフェースが示されています。[1]

    たとえば、掲載表では直線のホースバーブをTDU24は25mm、TDU50は50mmと記載し、90度曲がりの選択肢はTDU24に示す一方、TDU50の欄は「-」です。シリーズの大きさだけを替えれば、同じ取り回しをそのまま使えるとは限りません。端部の寸法、向き、シールの方式を合わせて見る必要があります。これらは掲載版に示された選択肢で、現行の全構成を網羅する一覧ではありません。[1]

    ラック電力に応じてQDの大きさや個数を変える推奨例もあります。ただ、そこで示された電力区分だけでは、冷却液の条件や許容される圧力損失までは分かりません。製品名と個数を、どの設備にも当てはまる冷却能力へ読み替えず、実際の流量と流路の条件につなげて読むことが大切です。[1]

    EPDMという材料名の、もう一段先を見る

    ホースの節では、過酸化物架橋EPDMホースが取り上げられています。EPDMはエチレンプロピレンジエンゴムのことで、過酸化物架橋は、過酸化物を使ってゴムの分子同士をつなぐ処理です。材料名だけでなく、その作り方まで仕様に含まれている点が、この節の手がかりになります。[1]

    ここで気をつけたいのは、同じシリーズ名でも口径によって条件が変わることです。資料に引用されたカタログの一つは、内層について1インチ以下は過酸化物架橋、1インチを超えるサイズは硫黄架橋と区別しています。見出しに「過酸化物架橋EPDM」とあっても、そのページに登場する全口径へ一律には広げられません。[1]

    また、ホースの内層と、QD内部のシールは別の部品です。どちらにEPDMの表記があっても、同じ仕様が一式に適用されるという意味にはなりません。冷却液に触れる部分を分けて、材料と使用条件を確かめる必要があります。[1]

    曲げられる半径が、置ける場所を変える

    ホースは柔らかく見えても、どれだけ小さく曲げてよいかには製品ごとの条件があります。最小曲げ半径は、その取り回しを考えるための寸法です。資料の比較表は、口径、内層の材料、圧力の表示と、この半径を並べています。[1]

    表を見ると、同じ1インチ、150PSI、過酸化物架橋EPDMという表示の行でも、最小曲げ半径はそろっていません。材料と圧力の二つが同じだけでは、同じ場所に収まるホースを選べない、ということです。この表は複数のカタログ値を並べたもので、同じ条件で曲げ試験をした結果や、製品全体の優劣を示すものではありません。[1]

    たとえば、接続部のすぐ横でホースを曲げたい配置なら、ホース自体の曲げ半径に加えて、直線の端部を使うか、曲がった端部を使うかも関わります。接続部とホースを別々に選んでから配置を決めるより、必要な空間を一緒に考えるほうが、組み合わせの違いを見つけやすくなります。

    端末の固定まで含めて、交換できる流路にする

    最後に扱われるホースアダプターには、金属の筒を締めて固定するかしめ、クランプ、ねじ込み、専用の組み合わせでクランプを使わず保持する方式が並びます。これは、ホースを端末へ固定する方法の違いです。QDの着脱面とは別に、その手前にも適合を確認する接続があることが分かります。[1]

    液冷設備をモジュール化するには、外せる部品を加えるだけでなく、外す境界、通したい流量、ホースの材質と曲げ方、端末の固定を一つの流路として考えます。大口径QDとホースを組み合わせる設計は、いまのラックへ冷却液を届けると同時に、次の交換で何を残し、何を替えるかを決める設計でもあります。

    Stäubliの事業を知る

    流体の接続部品を扱うStäubliの事業全体は、cyclewaveの企業解説にまとめています。

    参考資料

    公開されている21ページのPDFをもとに構成しました。表紙は2026年、PDFの作成日とフッターは2026年9月1日です。8月21日の開催当日に使われた版との同一性は未確認で、当日の発言や新製品の発売を示す資料としては扱っていません。

    [1]Stäubli Korea「Quick disconnector for data center liquid cooling」。資料内題名「AI 데이터센터 액체냉각 모듈화 인프라를 위한 QD」(AIデータセンターの液冷インフラをモジュール化するためのQD)。5–7ページ:配管と接続の境界、11–13ページ:大口径接続とホース側の仕様、14–17ページ:ホース材・曲げ半径・端末固定。

    [2]Open Compute Project「2026 OCP Korea Tech Day」。開催日、登壇者、公開資料の公式案内。

  • OCP APAC 2026 | AI通信の混雑に早く応えるSONiC、経路制御とパケットトリミング

    OCP APAC 2026 | AI通信の混雑に早く応えるSONiC、経路制御とパケットトリミング

    GPUの計算が速くても、通信の一部が遅れると、AIの処理全体を終えるまでの時間が延びます。大きなデータが短時間に集中する場面では、回線の速さに加えて、どの経路を通り、混雑をどれほど早く知れるかが大切になります。

    2026年8月のOCP APAC SummitでMicrosoftとBroadcomが紹介したのは、ネットワークスイッチを動かすソフトウェアSONiCを、AI向けの大規模な通信基盤へ対応させる取り組みです。経路情報を扱うBGPの拡張から、送信元が経路を指定するSRv6、混雑を早く伝えるパケットトリミング、細かな統計収集までをつなげて見ていきます。[1・2]

    簡単にまとめると?

    • SONiCでは、AI通信に合わせて経路制御、混雑の通知、細かな観測を組み合わせます。
    • パケットトリミングは混雑時のパケットを短くし、再送と送信速度の調整へつなげます。
    • 発表された機能が使えるかは、ASICやNIC、ソフトウェアの実装によって異なります。

    少数の大きな通信が、同じ経路へ重なる

    発表が対象とするAIの学習通信には、少数の大きなフロー、短時間に通信が集中するバースト、遅い側の通信時間であるテールレイテンシーへの敏感さという特徴があります。経路の振り分けに使える通信の違いも少なく、大きなフローが同じリンクへ重なると、混雑しやすくなります。[2]

    等しいコストの経路へ通信を振り分けるECMPでも、このような条件では負荷がうまく分散しないと説明されています。経路が複数あることと、実際の通信が均等に流れることは別の問題です。資料の課題設定は、こうしたAI通信の性質を前提にしています。[2]

    接続が増えれば、BGPにも処理能力が要る

    資料では、1ポートあたり100Gbps、スイッチ全体で51.2Tbpsの構成を、複数のネットワーク面へ分けて導入したとしています。接続先が増えると、経路情報を交換するBGPの接続数も増えます。多数のポートを備えるハードウェアを用意すると同時に、それを制御するソフトウェアも拡張する必要があります。[2]

    そこで示されたのが、経路制御ソフトウェアFRRを10.0.1へ更新し、約20件のパッチを加えるSONiCの改善です。512のBGPセッション、約1,000の経路、次の転送先である512のネクストホップを扱う構成が紹介されています。単一ポートの切断・復帰に関する発表結果は、データ転送の停止が0.1秒未満、経路情報の収束が約5秒です。異なる二つの時間を、同じ「復旧時間」としてまとめないことが大切です。[2]

    SRv6で、送信元から通る経路を指定する

    通信の経路選択には、IPv6を使うセグメントルーティングのSRv6が挙げられています。資料の構成では、送信元のネットワークインターフェースカード(NIC)が、経路を表す短い識別子uSIDの列をパケットへ入れます。途中のスイッチが順に処理し、宛先のNICが受け取る仕組みです。[2]

    これにより、送信元が指定した経路をたどらせます。資料では、識別子の列が合わない場合はパケットを破棄する、厳密なソースルーティングを説明しています。経路を指定する仕組みそのものが混雑を自動で解決するわけではなく、どの経路を選ぶかと、途中で起きた混雑へどう応えるかを組み合わせる設計です。[2]

    パケットを短くして、混雑の知らせを先へ送る

    パケットトリミングは、混雑時に対象のパケットを短くし、宛先へ送る仕組みです。受信側のNICは、正常に受け取れなかったことを伝えるNACKを送信元へ返します。送信元は、その知らせを受けてパケットを再送し、送る速度を落とします。大きなデータを運び続ける代わりに、小さくしたパケットを早い通知につなげます。[2]

    資料の図では、通信の種類やヘッダー、サイズでトリミングの対象を選び、通常のデータ用とは別に、優先度の高い待ち行列と専用バッファーへ入れています。多数の送信元から一か所へ通信が集中するインキャストに対応するため、短くしたパケットをためる領域の容量も検討項目です。[2]

    発表では、優先度ごとに通信を一時停止するPFCや、パケットに混雑を知らせる印を付けるECNだけでは、このバースト性の高い通信に十分すばやく対応しにくいと説明しています。特にPFCの停止が周囲へ広がると、処理完了までの時間が延びる点を挙げています。PFCやECNがあらゆるネットワークで使えないという意味ではなく、ここで想定する通信に、より早いフィードバックを求める議論です。[2]

    ミリ秒単位の観測を、運用のデータへつなぐ

    短い混雑を調べるには、観測の間隔も細かくする必要があります。そこで紹介された高頻度ストリーミングテレメトリー(HFST)は、スイッチの統計をミリ秒単位で収集するための仕組みです。ASICがIPFIX形式で計測情報を送り、SONiC側のCounter Syncdが受け取って読み解きます。[2]

    受信した情報は、登録済みのIPFIXテンプレートに従って解析します。対応するテンプレートがなければ、そのメッセージは破棄されます。得られたカウンターは手元のデータベースへ保存でき、OpenTelemetry形式へ変換して収集・処理の仕組みへ渡すこともできます。細かく測るだけでなく、正しく解釈して保存するところまでを一つの経路として考えています。[2]

    実装の報告と、次に取り組む範囲を分けて読む

    発表は、BGPの拡張結果と、SRv6・トリミング・テレメトリーの設計を並べて紹介しています。設計資料へのリンクもありますが、これだけで、すべてのSONiC製品や導入先に同じ機能がそろっているとは判断できません。利用するASICやNIC、ソフトウェアの実装を合わせて見る必要があります。[2]

    今後の取り組みとしては、アクセラレーター同士を密に結ぶスケールアップ向けEthernetも挙げられています。今回の大規模なスケールアウト網を支える改善と、その先の検討範囲は分けて捉えたいところです。経路を制御し、混雑を早く伝え、その状態を細かく観測する。SONiCの役割は、この三つをハードウェアと運用の間でつなぐことにあります。[2]

    MicrosoftとBroadcomについて

    発表に登壇したMicrosoftとBroadcomの事業全体は、cyclewaveの企業解説で紹介しています。

    参考資料

    2026年8月の発表資料をもとに構成。性能値と課題は、資料で示された構成・通信条件に関する説明です。

    1. Open Compute Project「2026 OCP APAC Summit」 — 公式イベント・発表資料一覧。
    2. Microsoft・Broadcom「How SONiC Powers the World’s Largest AI Infrastructure」 — Guohan Lu、Mehak Mahajan。pp.4〜11:AI通信、BGP、SRv6、パケットトリミング、HFST。pp.12〜14:設計資料と今後の取り組み。
  • OCP APAC 2026 | GoogleとBroadcomのSONiC検証、AVSとTH6 BCMSIMをつなぐ

    OCP APAC 2026 | GoogleとBroadcomのSONiC検証、AVSとTH6 BCMSIMをつなぐ

    新しいネットワークスイッチを使うには、チップだけでなく、それを動かすソフトウェアも準備する必要があります。ところが実機が届くまで検証を始められないと、不具合の発見も後ろへずれてしまいます。

    この待ち時間を減らすために、GoogleとBroadcomが紹介したのが、Alpine Virtual Switch(AVS)とTH6向けBCMSIMを組み合わせる検証環境です。ネットワークOSのSONiCと、スイッチチップの動作モデルをつなぎ、実機の到着前からソフトウェアの組み合わせを確かめます。講演では、Googleが最初のTH6実機サンプルを受け取る前に、約40件の異なる問題を特定して解決したと報告しています。[1]

    簡単にまとめると?

    • AVSとTH6 BCMSIMをつなぎ、実機が届く前からSONiCとスイッチのソフトウェアを検証します。
    • 動作モデルの細かさと設定を検証目的に合わせ、ソフトウェア間の不整合を早く見つける設計です。
    • 仮想環境での検証は、実機の発熱・電力・信号品質まで再現した証拠ではありません。

    実機の数に、検証の数を縛られないようにする

    講演が挙げる課題は、スイッチが高価で、開発者と自動テストが同じ試験設備を共有しやすいことです。接続できる台数が限られれば、大きなネットワーク構成も試しにくくなります。新しいチップでは、そもそも実機がまだ用意できない段階から、ソフトウェアの開発が進みます。[1]

    AVSは、SONiCのソフトウェア群をコンテナ化し、パケットを転送するデータプレーンの実装を差し替えられる仮想スイッチです。複数のAVSをつなぐ際には、Kubernetes上でネットワークを再現するKNE(Kubernetes Network Emulation)を使う「Aktive」が配置を受け持ちます。1台の動作と、複数台を結んだ構成を、段階を分けて検証できる形です。[1]

    何を再現するかで、モデルを選ぶ

    仮想スイッチといっても、実機のどこまでをソフトウェアで表すかは同じではありません。資料は、AVSに組み合わせる選択肢を三つの層に分けています。[1]

    • VPPは、高速なソフトウェアのパケット処理エンジンです。チップや、その制御用SDKのモデルは持ちません。
    • Luciusは、SAI(Switch Abstraction Interface)の層でスイッチの動作を表します。SAIは、SONiC側からスイッチを制御するための共通インターフェースで、LuciusはSONiCの機能を素早く確かめる用途に位置づけられています。
    • BCMSIMは、チップ内部の制御情報を読み書きするレジスターの動作まで扱うデバイスモデルです。その上で、実機向けのBroadcom SDKとSAIを動かします。

    SDKは、ソフトウェアからチップを扱うためのライブラリーなどをまとめたものです。BCMSIMを使うと、SONiCの機能だけでなく、SAI、SDK、チップの動作モデルへと続く組み合わせを確認できます。検証したい層に応じて、処理の速さや規模と、モデルが扱う詳細さを選ぶ考え方です。資料には、この三方式を同じ条件で測った性能比較は示されていません。[1]

    仮想ポートをつなぎ、実機と設定をそろえる

    今回の構成では、TH6の動作モデルと仮想ネットワークインターフェースの間に「BCMSIM vBridge」を置きます。モデル側と外側で使うメッセージを橋渡しし、パケットの送受信や、リンクが切れて戻る変化をやり取りします。CPU向けのパケットには別の仲介層があり、ポートごとの統計も観測します。[1]

    もう一つ大切なのが、AVSと実機側の設定をそろえることです。資料では、SONiCのconfig_db.jsonやBroadcomのbcmsim-config.ymlを例に挙げています。同じ問題を仮想環境で追いたくても、設定が違えば、動作の違いがどこから来たのか切り分けにくくなります。モデルを用意するだけでなく、再現に必要な条件を合わせるところまでが検証環境の設計です。[1]

    約40件の問題を、最初の実機より前に解決

    講演で報告された約40件は、SAI・SDKとネットワークOSの設定に関する問題です。Googleが最初のTH6実機サンプルを受け取る前に特定・解決した件数であり、チップの物理的な欠陥を40件見つけた、という意味ではありません。[1]

    こうした検証は、コードを取り込む前の自動テストにも組み込めます。資料では、クラウド上で数時間ごと、または重要度に応じて毎晩、AVSとTH6 BCMSIMを使う自動処理を走らせる取り組みを説明しています。変更のたびに実機の順番を待たず、ソフトウェアの不整合を早めに見つける狙いです。[1]

    GoogleのAVS環境をBroadcom側の仮想マシンで立ち上げる試みも、単発の実験として報告されています。同じ環境を共有し続けられれば、問題を説明し直す往復を減らせる可能性があります。ただし、継続運用による短縮効果は、今回の資料では測定結果として示されていません。[1]

    仮想環境で前倒しできる範囲を、はっきりさせる

    BCMSIMは、資料ではASICの「デジタルツイン」と呼ばれています。ここで示されているのは、チップの動作モデルを使い、設計からSDK、SAI、SONiCへと検証をつなぐ仕組みです。実機の発熱、電力、信号品質、実効的な転送性能まで、すべて同じように再現できることを示すものではありません。[1]

    検証のうち、実機を待たずに進められる部分を増やす。実機が届いたら、物理環境でしか確かめられない部分に向き合う。AVSとBCMSIMの組み合わせは、その順序を組み直し、ソフトウェアの問題を早い段階で減らしておくための取り組みです。

    発表に登場する企業を知る

    Broadcomの半導体・基盤ソフト事業と、Googleの親会社Alphabetの事業全体は、cyclewaveの企業解説にまとめています。

    参考資料

    [1]Google・Broadcom「Accelerate fabric validation with Alpine VS and BCMSIM」。2026 OCP APAC Summitの公開スライド。3–5ページ:検証設備の課題とAVS・Aktive、7–11ページ:モデルの層と接続・設定、12–14ページ:適用例と報告結果。公式一覧では「Accelerate cloud scale validation with AVS and TH6 BCMSIM」として掲載。

    [2]Open Compute Project「2026 OCP APAC Summit」。開催日・登壇者・公開資料の案内。記事は公開スライドをもとに構成しています。