Quantum Sea

タグ: OCP APAC 2026

  • OCP APAC 2026 | PhisonのΔPBAエントロピー提案、SSDの物理配置を測る

    OCP APAC 2026 | PhisonのΔPBAエントロピー提案、SSDの物理配置を測る

    SSDでは、パソコンやサーバーから見えるデータの並びと、実際に記録された場所の並びは同じとは限りません。書き換えを重ねたあと、その違いを一つの数値で見られるでしょうか。

    2026年のOCP APAC Summitに公式掲載された資料で、Phison Electronics(群聯電子)のAndrew Lin氏は、SSD内部の配置を読む「ΔPBAエントロピー」を提案しました。SSDのデータそのものの乱雑さを測る話ではありません。論理アドレスが隣り合うデータについて、物理的な保存先がどのように変わるかを調べる方法です。[1・2・5]

    隣のデータは、SSDの中でも隣にある?

    ホストが指定するLBA(Logical Block Address、論理ブロックアドレス)は、読み書きする場所を表す番号です。一方、発表資料のPBA(Physical Block Address、物理アドレス)は、SSD内の保存先を表します。両者の対応はFTL(Flash Translation Layer)という変換の仕組みが管理します。データを書き直すと、同じLBAでも別の物理位置を指すことがあります。[2・3]

    Lin氏の指標は、隣り合うLBAの物理アドレスの差をΔPBA=PBA(i+1)−PBA(i)として記録します。たとえばLBAを順にたどったとき、PBAも毎回1ずつ増えれば、差はすべて「+1」。保存先の飛び方が不規則になれば、差として現れる値もさまざまになります。[2]

    飛び先の「種類」がどれほど散らばるか

    次に、ΔPBAの各値が何回出たかを数えます。その出現割合にShannonの情報エントロピーを適用したものが、今回のHです。式で書けば H=−Σp(k)log₂p(k)。Hは、差の種類だけでなく、その出現割合の偏りも表します。一種類だけなら0で、同じ種類数なら均等に現れるときに最も大きくなります。単位は情報量のbitで、熱や消費電力の単位ではありません。[2]

    資料にある小さな例では、五つのLBAの間にある四つの差がすべて「+1」ならHは0。四つがそれぞれ異なる値ならHは2bitになります。Boltzmannの式は「配置の候補が増えるほど散らばる」という発想の入口ですが、SSDの評価値として実際に計算しているのは、この差分の頻度分布から求める情報量です。[2]

    ここには大切な限界があります。Hは差の大きさをそのまま足す値ではありません。仮に差がいつも「+100」でも、一種類しか現れなければHは0です。低いHだけで「データが必ず隣接している」とは言えず、高いHだけで読み取りの遅さや製品寿命を決めることもできません。これは発表資料の式から分かる、指標の読み方です。[2]

    TRIMで値が下がるのは、数え方にもよる

    TRIMは、不要になった論理ブロックをSSDに知らせる操作です。NVMeではdeallocate(割り当て解除)として扱われます。通知した瞬間にデータの物理配置がきれいに並び直る、という意味ではありません。[2・3]

    発表資料の例は、TRIMされたLBAをまたぐ二組の差を計算せず、両方を同じ「TRIM」という分類に入れます。先ほどの四組を数える枠はそのままにすると、Hは2bitから1.5bitへ下がります。ここで起きたのは数える対象と分類の変更です。この例だけを、SSDが物理的に整理された証拠として読まないほうが正確です。

    一方、資料の別ページは「隣り合う有効なLBA」を測ると説明しています。TRIMをまたぐ組を飛ばすのか、「TRIM」分類として数えるのか。その方法と分母をそろえなければ、二つのHを比べることはできません。[2]

    書き込みの負担を、この数値だけでは決められない

    SSDは、使わなくなった領域を再利用するためにガベージコレクション(GC)を行います。その過程で、ホストが書いた量よりも多くのデータが記録媒体へ書かれることがあります。WAF(Write Amplification Factor、書き込み増幅率)は、記録媒体への総書き込み量をホストからの書き込み量で割った比です。[3・4]

    Lin氏はHを、先のGC負担を見積もるファームウェア向けの手がかりにしたいと考えています。ただし、資料のシミュレーションでも、SSDの構成や余剰領域を変えるとHがほぼ同じでもWAFは変わります。資料ではGCによる再配置をHに対して中立と扱うモデルも示しますが、実際のPBA対応が変わる装置でどう見えるかは、測定時点や実装をそろえて検証する必要があります。HをWAFの換算表のようには使えません。[2・4]

    ドライブ全体の数値より、乱れが集まる場所を見る

    資料の後半では、ドライブ全体の差分分布から求めたHが小さくても、一部の領域にばらつきが集まる例を示しています。全域の集約値だけでは、GCを先に行いたい場所を見逃すかもしれません。そこで提案されるのが、論理アドレスの範囲を区切って計算する領域別のHです。どの範囲を切り出すか、実際のファームウェアが何を動かしたかも一緒に見ることが大切になります。[2]

    発表は「GetEntropy」という値をコントローラーから取得し、実機トレースで共同検証することも呼びかけています。2026年9月時点で、この発表資料だけからOCPやNVMeが採択した共通の標準指標だとは言えません。もし将来、SSDの状態表示にこうした数値が現れたら、差分の定義、TRIMの数え方、領域の切り方、WAFとの実測関係を一緒に確かめる。その読み方まで含めて、今回の提案は興味深いと思います。[2]

    Phisonの事業を知る

    この発表を行ったPhison Electronics(群聯電子)は、NANDフラッシュを制御するコントローラーを設計し、SSDやモジュールも手がけています。cyclewaveでは、製品構成と在庫、利益と現金の動きから会社全体を見ています。

    参考資料

    2026年9月26日確認。本文は公開スライドを中心に構成しました。講演動画の発言や質疑は確認していません。資料のシミュレーションは、特定条件での発表者の結果として扱っています。

    [1]Open Compute Project「2026 OCP APAC Summit」発表一覧。演題、登壇者、資料への導線。

    [2]Andrew Lin「Applying Thermodynamics to Storage: Defining Entropy Metrics for Next-Gen SSDs」公式掲載スライド。全18頁。指標の定義はpp.3–7、モデルとシミュレーションはpp.9–15、提案はp.16。

    [3]NVM Express「NVMe Namespaces」。ホストから見えるLBA、deallocateとTRIM、GCの説明。

    [4]NVM Express「Overcoming the Write Amplification Problem with NVM Express Flexible Data Placement」。WAFの定義と物理配置・GCの関係。

    [5]群聯電子「公司概況」。Phison Electronicsの正式名称を確認。

  • OCP APAC 2026 | Microsoftのラック台数の見積もり、CPU利用率の分布から電力を読む

    OCP APAC 2026 | Microsoftのラック台数の見積もり、CPU利用率の分布から電力を読む

    たとえば、ラックにまだ空きがあるのに、電力の上限が気になってサーバーを追加できない場面を考えてみます。一台ずつの最大消費電力を足せば慎重に見積もれますが、実際には全台が同じ強さで動き続けるとは限りません。反対に、平均値だけで台数を決めると、負荷が重なったときの余裕を見落とします。

    2026年8月のOCP APAC SummitでMicrosoftが示したのは、実際に動くサーバー群の利用率と消費電力の分布から、ラックへの搭載台数を見積もる考え方です。最大性能を測る試験から少し視点を変え、「普段はどんな負荷で動き、ときどきどこまで電力が増えるのか」を計画に持ち込みます。[1・2]

    一台分の電力を、どの負荷で決めるか

    講演では、ラックや電力区画に収めるノード数を elevation と呼んでいます。ここでいうノードは、電力を見積もる単位となるサーバーです。台数を少なく抑えすぎれば、同じサーバー数により多くのラックや床面積が必要になります。多く詰め込みすぎれば、電力を抑えるための性能制限が働き、利用者の仮想マシンに影響するおそれがあります。[2]

    その間を探る手がかりが、利用率に対して電力がどう変わるかを表すロードラインです。ただし、試験用の負荷で描いた曲線が、実際のクラウドと同じ形になるとは限りません。資料の比較例では、従来のベンチマークは低い利用率では実フリートより電力が小さく、高い利用率では逆に大きくなっていました。曲線上の一点だけを選ぶと、選んだ負荷によって余裕を大きく見積もったり、小さく見積もったりします。[2]

    CPUの平均利用率が同じでも、中の動きは違う

    フリートとは、運用中のサーバー群のことです。資料にある複数のフリートでは、CPU利用率の分布も、利用率に対する電力の曲線も異なります。立ち上がり途中のフリートと、運用が進んだフリートでは、よく現れる利用率の範囲さえ変わります。CPUだけでなく、メモリーやその他の部品が使う電力も、ノード全体の見積もりに含める必要があります。[2]

    もう一つの違いは、CPU内部の負荷の偏りです。論理プロセッサー(LP)は、この資料ではハードウェアスレッドを指します。たとえば、少数のLPが忙しく残りが休んでいる状態と、全LPがほどほどに動く状態では、平均利用率が同じでも内訳は違います。資料の実測例も、LPごとの利用率が均一ではないことを示しています。平均を一つ読むだけでは、この違いが消えてしまいます。[2]

    平均と偏りを、電力予測の入力にする

    Microsoftは対象の「Fleet A」で、LP全体の平均利用率、利用率の偏りを示すジニ係数、平均動作周波数、周波数のばらつきを示す変動係数の四つを使い、ブレードの電力を予測しました。報告された決定係数R²は約0.97、平均絶対誤差(MAE)は約18Wです。[2]

    R²は、観測された電力のばらつきをモデルがどれだけ説明できたかを見る指標です。MAEは、予測と実測の差の絶対値を平均したもの。したがって、この結果を「すべての予測が18W以内に収まる」「どのサーバーでも97%の精度が出る」と読むことはできません。対象フリートで、平均に加えて負荷の偏りを持ち込む意味があった、と受け止めるのが自然です。

    実際のフリートに近い負荷を、試験でも作る

    モデルで傾向をつかんだら、試験用の負荷も現実に近づけます。発表の最初の試作は、整数演算とメモリー負荷を組み合わせ、LPごとに動く時間と休む時間を変えるものでした。ディスクとネットワークにも軽い負荷を加え、CPUだけを一様に動かす試験から一歩進めています。[2]

    二つ目の試作では、圧縮、暗号処理、キーバリュー処理、グラフ処理、メモリーアクセスを混ぜました。資料の比較図では、三つのフリートに対する電力曲線が初回の試作からさらに近づいています。ただし、二つ目にはその時点でI/O負荷がなく、発表者も完全な一致とはしていません。これは公開クラウドの負荷を再現するための概念実証であり、完成した汎用ベンチマークの紹介ではありません。[2]

    台数の増加例には、電力超過の条件が付く

    搭載台数の図では、Fleet Aの利用率分布とノード間の違いを使い、利用率50%のベンチマーク値を基準にする従来の方法と比べています。たとえばラックの電力枠が20kWの場合、電力が枠を超える確率の目標を1%とした例では、22台から28台へ増える計算です。同じ20kWでも、超過確率の目標を0.01%にすると26台になります。[2]

    ここで変わったのは、ラックが供給できる電力ではなく、負荷の分布と許容する超過確率を踏まえた台数の見積もりです。図は単純化した例で、28台ならどの環境でも安全という設置指針ではありません。また、この確率を、そのまま年間の停止時間やサービスの障害率へ換算することもできません。

    ラックの外側と、これからの負荷も含めて考える

    実際の計画には、曜日や季節、地域、特定顧客の使い方が関わります。ラック単体に余裕があっても、列やデータセンター全体の電力枠が先に制約になることもあります。AI処理が増えれば、これまで観測した分布がそのまま続くとも限りません。資料は、こうした複雑さと、性能制限をどこまで許容できるかを未解決の条件として挙げています。[2]

    発表の呼びかけは、事業者の運用データをそのまま公開せずに、共通の用語、検証手順、匿名化した根拠の示し方をOCPコミュニティで作ろう、というものでした。電力計画を平均一つで済ませず、普段の負荷とまれな大きな負荷を一緒に読む。そのために、テレメトリーと試験をつなごうとする提案です。[2]

    Microsoftの事業をもう少し知る

    今回の発表を行ったMicrosoftは、Azureだけでなく、業務ソフトやWindowsなども展開しています。会社全体の事業と設備投資については、cyclewaveの企業解説にまとめています。

    参考資料

    2026年9月26日確認。公式スライド全24ページと、グラフ・試作条件を照合しました。講演動画の音声・質疑は確認対象に含めていません。

    [1]Open Compute Project「2026 OCP APAC Summit」発表一覧。演題・登壇者・公式資料への導線。

    [2]Microsoft「Telemetry-Driven Power Estimation for Rack-Level Provisioning in Public Cloud Data Centers」公式掲載スライド。課題とロードラインはpp.2–6、実フリートはpp.7–11、モデルはpp.12–13、試作はpp.14–19、搭載台数例と条件はpp.20–22。

  • OCP APAC 2026 | GPUクラスタの健全性を計算・通信・熱・ストレージで測るOCRP案

    OCP APAC 2026 | GPUクラスタの健全性を計算・通信・熱・ストレージで測るOCRP案

    GPUクラスタがベンチマークで速く動いても、長い学習ジョブを安定して走らせられるかは別の問いです。GPUの演算性能が高くても、通信が途切れたり、冷却に余裕がなくなったり、途中の状態を保存するストレージが遅れたりすれば、仕事全体に影響します。速さと、動かし続けられる状態は、分けて確かめたいところです。

    2026年8月のOCP APAC Summitで、Factryzeの創業者Akash Borate氏は、GPUクラスタの健全性(cluster health)を共通の方法で測る案を紹介しました。発表資料は、その構想を「Open Cluster Reliability – OCRP」と呼びます。これは発表者による提案で、OCPが批准した規格や、導入済みの認証制度として紹介されたものではありません。[1・2]

    速さを測ることと、運用を続けられるかは別

    MLPerfなどの性能ベンチマークは、決められた条件で計算をどれだけ速く進められるかを示します。発表者が別の軸として挙げるのは、長い運転の間もクラスタが仕事を続けられる状態か、というreadiness(継続運用に向けた準備状況)です。性能試験を置き換えるのではなく、その結果だけでは見えにくい運用中の変化を補う考え方です。[2]

    GPUやサーバーが出す温度、エラー、通信状態の記録は、すでにさまざまな道具で読めます。ただ、どの信号を、どんな負荷の下で、いつ測れば「健全」と言えるのか。そこが運用者ごとに違うと、別のクラスタの結果をそのまま比べられません。同氏は、測定値だけでなく試験方法と結果の書き方までそろえる必要があると提案します。[2]

    一つの通信エラーから、四つの領域を見る

    資料では、複数GPUの集団通信に使うNCCLでタイムアウトが出る場面を例にします。画面に見えるのは通信のエラーでも、それだけで故障した場所は決まりません。資料の図は、原因を調べる候補を次の四領域に分けています。[2・3]

    • 計算:同じ負荷でのGPU間の活動量のばらつきや、ECC(誤り訂正)で訂正されたメモリーエラーの推移。
    • ネットワーク:通信リンクのビット誤り率(BER)や、リンク断・復帰の回数。
    • 熱:GPUと高帯域メモリー(HBM)の温度、冷却液の供給側と戻り側の温度差。
    • ストレージ:計算の途中状態を保存するチェックポイントの書き込み時間や、I/Oの遅れ。

    これらは故障箇所を自動で特定する答えではなく、どこを調べるかを絞る手がかりです。たとえば温度や通信エラーの変化を見るときも、負荷や装置構成が違えば同じ値を単純には比べられません。[2]

    何を測るかに加え、方法とタイミングをそろえる

    OCRP案は、信号・試験方法・測定の頻度や契機・結果票を一続きで定めようとします。カウンターや温度を読み取る受動的な観測と、基準となる負荷をかける能動的な試験は役割が違います。資料はGPUの状態監視・診断に使うNVIDIA DCGMや、NCCLの集団通信試験などを例に挙げます。ただし、これらは発表資料に挙がる候補であり、共通の試験一式として採用済みではありません。[2・4]

    いつ測るかも大切です。運用中に継続して読む信号、予定を決めて行う能動試験、部品交換やファームウェア更新の後の再確認、運用開始前の受入試験を分ける。資料に載る試験周期は構想を示す例で、すべてのGPUクラスタに適用する推奨周期ではありません。[2]

    結果票は、まだ採点基準が決まった規格ではない

    発表資料の結果票には、対象ノード、測定時刻、試験名、四領域それぞれの状態、全体の判定が並びます。例では計算と熱がBASELINE、ネットワークがWARNING、ストレージがALERTで、全体がAMBERです。ただし、スライド自身が試案の見本(strawman example)と記し、「測定であって認証ではない」と区別しています。この色や語を、確定した合否基準として使うことはできません。[2]

    実際に注意や異常の境界を決めるには、機器、負荷、観測期間をそろえた故障記録が要ります。登壇者も、運用者が匿名化した故障データを持ち寄り、試験や閾値を共同で整えるよう呼びかけています。資料に載る故障率曲線や個別の数値を、別の現場の共通基準へそのまま移す段階ではありません。[2]

    「このクラスタは健全です」という一語より、何を、どんな負荷で、いつ測り、四領域の結果をどう残したか。その条件が見えれば、引き渡し前と運用中の状態も読み比べやすくなります。速さの数字に、続けて使うための測定を重ねる。OCRP案は、その共通の読み方をつくろうとする提案です。

    参考資料

    2026年9月24日確認。本文は公開スライドと公式技術文書をもとにしています。発表動画の発言・質疑は確認対象に含めていません。スライドの故障率・割合・閾値は原データや条件を別途照合できていないため、一般的な統計や推奨値として引用していません。

    [1]Open Compute Project「2026 OCP APAC Summit」発表一覧。演題、登壇者、資料掲載。

    [2]Akash Borate「Benchmarking GPU Cluster Health: Towards an Open Standard for AI Infra Readiness」公式掲載スライド。全16頁。評価の軸はpp.3–7、OCRP案はpp.8–12、追加信号表はpp.15–16。

    [3]NVIDIA「Overview of NCCL」。GPU間の集団通信に使うライブラリの説明。

    [4]NVIDIA「Data Center GPU Manager Documentation」。GPUの状態監視・診断に使うDCGMの説明。

  • OCP APAC 2026 | MicrosoftのPCIeカセット案、アクセラレータ交換とホストの境界

    OCP APAC 2026 | MicrosoftのPCIeカセット案、アクセラレータ交換とホストの境界

    GPUを新しい世代に替えるたび、サーバーの筐体や電源、冷却まで設計し直すのでは、更新の負担が大きくなります。そんな負担を減らすには、交換する部分の形だけでなく、どこまでを交換し、どこからを使い続けるかを決めておく必要があります。

    2026年8月のOCP APAC Summitで、Microsoftはアクセラレータを「PCIeカセット」という交換単位にまとめる設計案を示しました。狙いは、GPUなどの種類が変わっても、ホスト側の再設計をできるだけ抑えること。現時点では、発表資料で示された構想です。[1・2]

    カセットとホストの間に、境界を引く

    この案では、アクセラレータごとに変わりやすい形状、固定方法、熱の逃がし方、制御信号をカセット側の設計範囲に置きます。一方のホスト側には、筐体、ホストプロセッサーモジュール(HPM)、管理・制御を担うDC-SCM、電力供給や保守の仕組みを残し、可能な範囲で使い続けます。DC-SCMは、OCPが仕様を定めるサーバーの管理・セキュリティ・制御用モジュールです。[2・3]

    カセットは、単なる「GPUを入れる箱」ではありません。発表資料は、現場交換可能ユニット(Field Replaceable Unit、FRU)として捉え、差し込む経路、重さ、固定具まで検討対象に挙げています。PCIeの接続に加えて、電源コネクターの電流容量、冷却、サイドバンドの制御信号、状態を伝えるテレメトリーも境界をまたぎます。ホットプラグや出力制御を扱うなら、その対応範囲も合わせて決めなければなりません。[2]

    冷却と電力は、境界をまたいで決まる

    液冷なら、カセット内のコールドプレートだけを決めても足りません。接続先のCDU(冷却液分配装置)と合わせて、流量、圧力、冷却液の種類、漏れの検知を考える必要があります。空冷なら、ヒートシンクやファンだけでなく、筐体内で使える風量や音響条件が関わります。電力も同様です。新しいアクセラレータが要求する電流や瞬間的な電力変動を、ホストの配線と電源が受け止められるかを確認します。[2]

    つまり、カセットを交換できる形にしても、ホストの冷却能力や給電の余裕を超えれば、ホスト側の変更は避けられません。資料も、インターフェースの選び方がホストへ複雑さを持ち込み、電力と冷却の境界調整を後回しにすると再利用が難しくなると振り返っています。[2]

    「差し替え可能」を実現するために残る仕事

    資料の次の課題は、カセットの寸法や重量だけではありません。熱・電力の許容範囲、制御インターフェース、侵入検知、ホットプラグ、保守の手順まで含めた共通の接点を、早い段階で定義することです。新しいカセットを差し込むたびに何を再評価するかも、そこで明らかになります。[2]

    発表の図には「OCP Cassette Specificationに準拠」と書かれていますが、末尾はカセットの形状や電力範囲をこれから検討する呼びかけです。この一枚の図だけで、批准済みの仕様や、異なるメーカーの製品をそのまま挿し替えられる互換性があるとは言えません。市場投入までの時間を短くするという狙いも、発表内で削減率が実測されたわけではありません。[2]

    この提案が教えてくれるのは、交換性を部品の形だけで判断しないことです。機械、電力、冷却、制御、保守の接点を一緒に決め、ホストが使い続けられる条件を明確にする。その境界が見えて初めて、新しいアクセラレータを迎える準備ができます。

    Microsoftの事業や収益の仕組みは、cyclewaveの企業解説にまとめています。

    参考資料

    2026年9月26日確認。本文は公開スライドを中心に構成しています。発表動画の発言・質疑は確認対象に含めていません。

    [1]Open Compute Project「2026 OCP APAC Summit」発表一覧。演題、登壇者、資料と動画の掲載。

    [2]George Asirvatharaj、Hardik Shah、Niharica Sohal「Modular PCIe Cassette Architecture for Scalable AI Systems」公式掲載スライド。全13頁。課題と構成はpp.5–6、カセットとホストの条件はpp.7–9、残る課題と提案はpp.10–11。

    [3]Open Compute Project「DC-SCM 2.2 Specification」。DC-SCMとHPMの用語と役割の確認。

  • OCP APAC 2026 | メモリーエラーが出ても、原因はDIMMとは限らない

    OCP APAC 2026 | メモリーエラーが出ても、原因はDIMMとは限らない

    サーバーに「メモリーエラー」と表示されると、DIMMを交換したくなります。でも、その表示が教えてくれるのは、まずメモリーを通る処理で異常が見えたということです。原因までDIMMにあると決まったわけではありません。

    2026年8月のOCP APAC Summitで、EverpureのMeeta Saggi氏は、メモリーエラーを装置全体の状態を知る手がかりとして読む方法を示しました。エラーが記録された場所と、壊れた場所を分けて考える。単純ですが、不要な交換を避け、原因に合った対応を選ぶための大切な一歩です。[1・2]

    エラーを報告した場所と、原因の場所

    DIMMは、サーバーで使うメモリーモジュールです。訂正できたエラーはCE(Correctable Error)、訂正できなかったエラーはUE(Uncorrectable Error)として記録されます。これらは対処の重要な信号ですが、件数だけでDIMMの故障を確定できません。[2]

    信号はCPUのメモリーコントローラー、パッケージ内の接続、基板上の配線やコネクター、DIMMのスロットを通ります。また、PCIe機器で生じたpoison(不正なデータ)がDMA経由でシステムメモリーに伝わり、後から観測される例もあります。見えているエラーを追うには、この経路全体を候補として残す必要があります。もちろん、DIMM自体が故障している場合もあります。[2]

    エラーの回数だけでは、原因を絞れない

    発表資料は、訂正可能エラーが多い場面でも、弱いメモリーセル、信号線の異常、接続部の不安定さなど、異なる原因を考えられると示します。同じ件数でも、起きた場所や時間の並び方が違えば、必要な点検も変わります。資料の故障割合を描いた図は説明用と明記され、実測の発生率ではありません。[2]

    具体例には、DQデータ線の異常、BIOS/RASの設定不備でシステム管理モード(SMM)の処理負荷が増えて遅延が大きくなるケース、PCIe機器から伝わった不正なデータがメモリー上で観測されるケースが挙げられます。これらは「DIMMを替えれば直る」と早合点しないための診断例であり、どの機器でも同じ原因の割合で起きるという統計ではありません。[2]

    記録、分析、対応を別の段階にする

    発表では、OCPのHardware Fault ManagementとRAS APIの枠組みを使い、流れを四つに分けます。まずCPU、メモリー、周辺機器がエラーを報告し、収集側が履歴を残す。分析器は新しい記録だけでなく、同じ報告元の過去の記録も合わせて見て、考えられる故障と対応を提案する。最後に、運用側のポリシーがその提案を受け入れるか決めます。[2・3]

    共通のエラー記録はCPER(Common Platform Error Record)、提案する対応を表す記述子はCPAD(Common Platform Action Descriptor)です。CPADは「自動的にDIMMを交換せよ」という命令ではありません。資料の図でも、分析器の出した提案をポリシー層が検証してから、部品交換、修復、設定変更などの対応につなげます。[2・3]

    共通の記録形式があっても、診断は続く

    OCPが公開したRAS API v0.9は、CPERとCPADを扱うためのインターフェースやデータ構造を示す中間版です。通信に使う下位の仕組みを一つに固定せず、部品ごとの実装や分析方法に余地を残しています。この仕様があることと、すべてのサーバーで高精度な原因推定が実現済みであることは別です。[3]

    メモリーエラーを見たら、まずCE/UEの種類、発生箇所、時刻、繰り返し方を確認し、ほかの機器や設定の記録と合わせて見る。DIMMは重要な候補の一つとして残しながら、交換だけを最初の答えにしない。発表が伝えるのは、メモリーを「犯人」ではなく、原因を探すための信号源として使う考え方です。[2]

    Everpure(旧Pure Storage)の事業や収益の仕組みは、cyclewaveの企業解説にまとめています。

    参考資料

    2026年9月24日確認。本文は公開スライドとOCPのRAS API文書を照合しています。発表動画の発言・質疑は確認対象に含めていません。

    [1]Open Compute Project「2026 OCP APAC Summit」発表一覧。演題、登壇者、資料掲載。

    [2]Meeta Saggi「Memory Errors as System Signals – Don’t shoot the messenger」公式掲載スライド。全13頁。原因候補と説明用の割合図はpp.4–7、CPER/CPADの流れはpp.8–9。

    [3]Open Compute Project「RAS API Specification Version 0.9」。2025年12月の中間版。対象範囲はpp.8–10、CPER/CPADの構造はpp.16–23。

  • OCP APAC 2026 | UL Solutionsの単相浸漬冷却試験、樹脂の変形と冷却液の絶縁性

    OCP APAC 2026 | UL Solutionsの単相浸漬冷却試験、樹脂の変形と冷却液の絶縁性

    サーバーを液体に浸して冷やすとき、冷却液が触れるのは発熱する部品だけではありません。ケーブルの被覆、樹脂の部品、基板の材料も、同じ液体の中で長く過ごします。よく冷える液体を選んでも、周囲の材料が変形したり、液体の電気的な性質が変わったりすれば、運用は難しくなります。

    2026年8月のOCP APAC Summitで、UL SolutionsのJulie Shih氏は単相浸漬冷却(single-phase immersion cooling)に使う材料と冷却液の適合性を調べた試験を紹介しました。「単相」は、ここでは冷却液を沸騰させて熱を運ぶ方式ではなく、液体のまま使うことを指します。コールドプレートの内部だけに液体を通す直接液冷とも、触れる部材の範囲が違います。[1・2]

    液体を一つ選んでも、相性は決まらない

    発表では、ポリカーボネート(PC)、PA66、PBT、EPDMといった樹脂・エラストマー、エポキシとPPOの基板材料を、炭化水素系、合成エステル系、配合油の三種類の冷却液と組み合わせました。80℃と105℃で4、8、12週間、液体を流さない静置浸漬で変化を調べています。これは材料と液体の組み合わせを比べる試験で、すべての樹脂や市販冷却液を順位づけする試験ではありません。[2]

    樹脂やゴムなら外観、寸法、引張強さなど。基板の積層材なら、それに電気的な特性も加えます。液体自体についても、浸す前後で絶縁に関わる性質を確かめます。冷却液だけのカタログ値を読んでも、実際の組み合わせの変化は分からないためです。[2]

    目に見える変化と、強さの変化は同じではない

    試験では、PCは合成エステルでひび割れが、エステル油では変色と端の剥がれが見られました。PA66は色の変化に加えて、高温・長い浸漬で引張強さが落ちました。EPDMは炭化水素系の液体では膨らみ、合成エステルでは縮んで硬くなる傾向を示します。同じ「液体に浸す」でも、材料と液体の組み合わせによって変化の仕方が違います。[2]

    変色は気づきやすい一方、色だけで機能を判定することはできません。寸法が変われば接続部の位置や密着にも影響し得ますし、引張強さの低下は部材の耐久性を考える手がかりになります。ただし、今回の試験片で見られた変化から、すべての完成機器の寿命を計算することはできません。

    冷却液の絶縁性も、部材を浸した後に測る

    基板の積層材では、105℃での試験では、PPO系の絶縁破壊に対する強さが、エポキシ系より大きく低下しました。冷却液側でも、材料を浸した後の絶縁破壊電圧(BDV)を測っています。BDVは、一定の試験条件で液体が電気的に破れるまでの電圧を示す値です。炭化水素系の液体では、比較対象のエステル系より低下が大きい組み合わせが示されました。[2]

    もう一つの誘電正接(Df)は、交流信号に対する損失の目安です。発表では、エポキシやPPOの積層材を浸した後の冷却液のDfが、液種と測定周波数によって異なる変化を示しました。高周波の信号品質を考えるときの注意点ですが、測定は室温で行われています。80℃や105℃の浸漬条件と、電気特性を測った温度を同一視しないことも大切です。[2]

    実機の判断には、液体の流れも含む評価が要る

    この研究は材料の相性を考える入口になりますが、発表者自身が静置浸漬という限界を示しています。実際の装置では液体が流れ、温度も変動し、部品には力がかかります。長期の実機運転や、すべての製品の安全性を、この12週間の試験だけで証明したものではありません。[2]

    発表資料はUL 62368-1に材料適合性に関わる要求がある一方、今回のような適合性を調べる詳細な試験方法をそこだけで指定しているわけではない、と説明します。材料、冷却液、温度、期間、流れをどうそろえて評価するか。発表者は評価基準のさらなる整備を課題に挙げています。OCPは2026年6月に部品と冷却液の適合性を調べるガイダンスを公開していますが、それ自体が合否の閾値や認証を定める文書ではありません。[2・3]

    単相浸漬冷却を選ぶ際に見たいのは、液体単体の性能だけではありません。どの部材を、どの液体に、どの条件で浸すかを組み合わせて確かめる。冷却の設計と材料の試験を、一つの表に並べて考える必要があります。

    UL Solutionsの事業を知る

    今回登壇したUL Solutionsは、試験・検査・認証と関連ソフトウェアを提供する企業です。事業の構成や、認証後も続くサービスの仕組みは、cyclewaveでまとめています。

    参考資料

    2026年9月24日確認。本文は公開スライドの試験条件と発表者が示した限界に沿ってまとめています。発表動画の発言・質疑は確認対象に含めていません。

    [1]Open Compute Project「2026 OCP APAC Summit」発表一覧。演題、登壇者、資料掲載。

    [2]Julie Shih「Material Compatibility, Reliability, and Safety Risks in Single-Phase Immersion Cooling」公式掲載スライド。全13頁。試験条件はpp.3–4、材料・冷却液の結果はpp.5–9、限界はpp.10–11。

    [3]Open Compute Project「Server Component Immersion Material Compatibility Testing, v1.5」。2026年6月公開。評価ガイダンスの対象と、合否・認証を定めない範囲はpp.6–8。

  • OCP APAC 2026 | Microsoftの電力テレメトリー提案、単位と測定範囲をそろえる

    OCP APAC 2026 | Microsoftの電力テレメトリー提案、単位と測定範囲をそろえる

    同じ「100」という電力値でも、二つのサーバーで意味が同じとは限りません。片方は100ワット、もう片方は100ミリワットかもしれません。CPUだけを測った値と、装置全体を測った値かもしれません。数値を並べる前に、何を、どの単位で、どの範囲から測ったかをそろえる必要があります。

    2026年8月のOCP APAC Summitで、MicrosoftのSmitha Kashyap C氏らは、異なる機器から集める電力テレメトリーに共通の意味を持たせる案を発表しました。センサーを一種類に統一する話ではありません。機器ごとの値を、あとから比べて使える形へ写すための設計です。[1・2]

    名前が似ていても、測っている量を確かめる

    電力テレメトリーは、CPU、メモリー、SSD、電源装置などから運用中に得る測定値です。原資料は、メーカーごとに項目名や単位、電力上限の定義が異なるため、機種を増やすたびに集計用の変換が必要になると説明します。[2]

    ここでは名称だけをそろえても足りません。電力はある時点や短い区間の消費の速さで、単位はワット(W)。エネルギーは時間を通じて使った量で、単位はジュール(J)です。資料の例にある「cpu_power」と「package_energy」は、名前だけで同じ指標とはみなせません。測定範囲もCPUのコア、パッケージ、サーバー全体で違います。[2]

    元データ、意味づけ、使う側の三層

    発表は仕組みを三層に分けます。第一層はCPU内部のカウンター、ファームウェアのセンサー、NVMeのログなど、機器が実際に出す値。第二層は、その値に共通の項目名、単位、対象範囲、閾値、版を与える意味づけのスキーマ。第三層は、監視画面、分析、ジョブ配置など、値を使う側です。[2]

    たとえば「pkg_energy_j」なら、パッケージのエネルギーをジュールで表す項目だと分かります。資料のSSD例は1秒間の平均電力です。単位と測定対象の範囲をそろえることは比較の土台ですが、実測値を読み比べるなら時刻や平均化期間も要ります。発表の第二層の要素表には、その時間条件を表す独立項目は示されていません。また、異機種の写像表は提案の見本です。対応する各社の元データが同じ範囲を測り、同じセンサーとして実装されていることまで証明するものではありません。[2]

    集める経路と、値の意味は別

    機器の中からOSが読むインバンドの値もあれば、管理用の経路を通るサイドバンドの値もあります。発表はRedfishやPLDM/MCTPなど既存の管理・伝送の仕組みとの接続を示します。しかし、値を運べることと、その値が同じ測定対象・単位を指すことは別です。どの経路で受け取っても、第二層で意味を確かめる必要があります。[2]

    同じ定義で値を集められれば、異機種をまたぐ監視や、電力の余裕を見たジョブ配置を考えやすくなります。資料は仕事ごとの消費エネルギー推定や炭素排出の集計も将来の利用先に挙げています。ただし、共通スキーマの提案だけで、個々の仕事の消費量が正確に測れると実証したわけではありません。計測の時間間隔、共用部の電力、推定方法は別に検証が要ります。[2]

    提案の図と、承認された仕様を分ける

    スライドは第二層を「OCP Semantic Schema」と呼び、共通のフィールドへ写す考えを示しています。これは今回の発表で示された構想として読むのが正確です。例示された版名や異機種の対応表を、そのままOCPが批准した仕様や全メーカーの実装済み対応表として扱うことはできません。[2]

    電力の見える化は、センサーを増やすだけでは進みません。どこから来た値で、何を測り、いつの値なのか。その意味に加えて時刻や平均化期間も確かめられれば、異なるサーバーの値を継続して読み比べやすくなります。

    Microsoftの事業や収益の仕組みは、cyclewaveの企業解説にまとめています。

    参考資料

    2026年9月24日確認。本文は公開スライドの三層案と例示をもとにしています。発表動画の発言・質疑は確認対象に含めていません。

    [1]Open Compute Project「2026 OCP APAC Summit」発表一覧。演題、登壇者、資料掲載。

    [2]Smitha Kashyap C、Chockalingam A、Prateek Gupta「Standardizing Power Telemetry Semantics for Energy Efficient, Hyperscale Datacenter Operations」公式掲載スライド。全15頁。課題はpp.3–4、三層案と写像例はpp.5–11、想定用途はpp.12–13。

  • OCP APAC 2026 | UALink 2.0の4仕様――接続網内計算からチップレットまで

    OCP APAC 2026 | UALink 2.0の4仕様――接続網内計算からチップレットまで

    AI向けのアクセラレータを増やすと、チップ同士がやり取りする量も増えます。速い計算機を並べるだけでは足りず、同じ仕事に参加するチップをどうつなぎ、どう管理するかが問われます。

    2026年8月のOCP APAC Summitで、UALink ConsortiumのKurtis Bowman氏は、アクセラレータ間をつなぐUltra Accelerator Link(UALink)の更新を紹介しました。発表の中心は「2.0」という一つの数字よりも、通信の共通部分、信号の通り道、運用管理、チップレットへの組み込みを分けて定めたことにあります。[1・2]

    UALinkが受け持つ範囲

    UALinkは、AI計算に使うアクセラレータ同士を近い範囲で結ぶスケールアップ接続の規格です。発表資料は、PCIe、CXL、Ethernetを置き換える万能な配線とは位置づけず、それぞれを補うものとしています。ラック間のネットワークや、CPUと周辺機器の接続まで、すべてをUALinkに読み替えることはできません。[2]

    今回紹介されたのはCommon 2.0、200G Data Link and Physical Layers(DL/PL)2.0、Manageability 1.0、Chiplet仕様の四つです。共通部分、信号の通り道、運用管理、チップレットを別の仕様として見ると、製品発表で「UALink対応」と書かれたときにも意味を確かめやすくなります。[2・3]

    Common 2.0は、アクセラレータ間の通信と計算

    Common 2.0は、アクセラレータ間の通信に共通する部分を扱います。新たに示されたIn-Network Computeは、計算の一部を接続網の中で進め、やり取りの待ち時間や転送量を減らすことを狙うものです。複数のアクセラレータが分担して学習・推論を進める際に、データの受け渡しだけでなく、その途中でできる処理にも目を向けています。[2・3]

    ただし、公開スライドは狙いと仕様の位置づけを説明する資料です。どの演算を、どの装置で、どれだけ速くしたかという実測結果まで、この発表だけで確定できるわけではありません。性能の比較は、実装と測定条件が示された資料で確かめる必要があります。[2]

    DL/PL 2.0は、信号を運ぶ部分を独立させる

    Data Link Layer(データリンク層)とPhysical Layer(物理層)は、隣り合う装置間でデータを渡す手順と、そのための信号・接続を扱います。UALinkの200G DL/PL 2.0は、この部分をCommon仕様から切り分けました。発表側は、将来、信号方式や速度を変えるときに、ほかの仕様まで同時に作り直さずに進めやすくなると説明します。[2・3]

    ここでの「200G」は仕様の名称と対象速度を示す言葉です。装置全体の実効速度や、異なるメーカーの機器を混ぜたときの性能を、その数字だけからは判断できません。

    Manageability 1.0は、つながった装置を見渡すために

    多くのアクセラレータとスイッチを一緒に動かすには、通信路の定義だけでなく、状態を知り、設定を変える方法も要ります。Manageability 1.0は、UALinkシステムの制御面・管理面を扱い、gNMI、YANG、SAI、Redfishなどの既存の仕組みを使う方向を示しています。[2・3]

    管理用の仕様が公開されたことと、製品同士がすでに問題なく相互運用できることは別です。製品を比べる際は、使える管理機能の範囲と、組み合わせ試験の結果を分けて見るのがよさそうです。

    Chiplet仕様は、チップの内側へ接続を持ち込む

    Chiplet仕様は、複数の小さな半導体ダイを一つのSoCとして組み合わせる際に、UALinkをどう組み込むかを定めます。インターフェース、形状、フロー制御、管理が対象です。発表スライドでは「Chiplet 1.0」と記されていますが、2026年9月24日に確認したConsortiumの公開一覧ではChiplet 1.01が掲載されています。資料を読むときは、発表時の版と現在配布される版を区別したいところです。[2・3]

    同一覧はUCIe 3.0への準拠も説明しています。ただし、チップ内で規格を組み込めることから、完成したサーバーやクラスタ全体の採用状況までは読み取れません。[3]

    仕様の公開と、使える製品は別の段階

    発表資料のロードマップは、適合性・相互運用の取り組み「Compliance 1.0」を2026年第4四半期に示しています。実験室での評価は2027年初頭、本番導入は同年後半に進める計画です。これは2026年9月時点では将来の予定です。仕様が公開・批准されたという話を、製品が量産され、相互運用が実証済みだという話へ置き換えないようにします。[2]

    これから「UALink 2.0対応」の製品を見るなら、四つのうちどの仕様のどの版に対応するか、実際に試した機器の組み合わせは何か、性能はどの条件で測ったかを確認したいところです。通信、管理、チップへの組み込みを分けて読むことが、この発表のいちばん役立つ入口になります。

    参考資料

    2026年9月24日確認。本文は公開スライドとConsortiumの公開仕様一覧をもとにしています。発表動画の発言・質疑は確認対象に含めていません。

    [1]Open Compute Project「2026 OCP APAC Summit」発表一覧。演題、登壇者、資料掲載。

    [2]Kurtis Bowman「UALink 2.0 Specification Update: Advancing Accelerator Interconnect Technology for AI Workloads」公式掲載スライド。全15頁。仕様の役割はpp.4・7–11、ロードマップと評価計画はpp.12–13。

    [3]UALink Consortium「Specifications」。Common 2.0、200G DL/PL 2.0、Manageability 1.0、Chiplet 1.01の公開一覧。

  • OCP APAC 2026 | フィルターの詰まりと気泡を、冷却の余力から考える

    OCP APAC 2026 | フィルターの詰まりと気泡を、冷却の余力から考える

    液冷の配管で、水や冷却液が流れている。ポンプの表示も正常。それでも、チップの温度に余裕がなくなることがあります。流れの途中にあるフィルターや配管の細くなる場所が、少しずつ条件を変えているかもしれません。

    OCP APAC Summit 2026でCooler MasterのRay Hsieh氏は、フィルターの詰まりと、縮径部での気泡を一つの設計課題として取り上げました。どちらも冷却液を動かすために使える圧力の余裕に関係します。発表の試算を、運用中に何を測り、どう判断するかの手がかりとして読みます。[1・2]

    CDUは、二つの水路を分けている

    液体対液体のCDUでは、建物側の水と、チップを冷やす機器側の冷却液が熱交換器を挟んで流れます。熱は移しても液体は混ぜません。機器側にはポンプ、フィルター、分配管、コールドプレートがあります。フィルターは細い流路や継手へ異物が届くのを防ぐ一方、自身も流れの抵抗になります。OCPのCDU試験方法も、フィルターを流路制限と部品損傷から守る工程として扱います。[2・3]

    フィルターの差圧だけでは、交換時期を決めにくい

    フィルターに汚れがたまると、前後の圧力差が増えます。そこでポンプが回転を上げ、設定した差圧を保とうとする制御もあります。ただ、発表者の流路モデルでは、その補償をしてもコールドプレートへ届く流量が下がりました。ポンプの制御位置や配管構成によって結果は変わるため、すべてのCDUで同じ動きになると考えるべきではありません。[2]

    大切なのは、フィルター単体の差圧を、冷却の結果へつなげることです。流量が減れば、コールドプレートの熱抵抗や、チップ温度の余裕が変わります。発表のグラフでは、汚れの進行に応じて温度余裕が減る例が示されていますが、交換点を決める温度の数値は説明用のモデルです。別の設備へそのまま持ち込む値ではありません。

    現場では、フィルター前後の差圧だけでなく、流量、ポンプの回転数と電力、冷却液の温度、供給側と戻り側の温度を合わせて見る。差圧を流量や粘度の変化から切り分ければ、フィルターの詰まりが本当に進んでいるのか、見分けやすくなります。OCPのProject Deschutes仕様にも、温度・圧力・流量・ポンプの回転と電力を監視する項目があります。[2・4]

    配管が細くなる場所では、別の余裕が減る

    配管の径を急に細くすると、同じ流量を通すために液体は速く進みます。速くなる場所では局所的な静圧が下がり、溶け込んでいた気体が泡になったり、条件が厳しければ液体そのものが蒸発するキャビテーションにつながったりします。発表者は前者を、温かい冷却液で先に検討すべき現象として挙げています。ただし、発生の順序は溶存ガス量、温度、圧力、液体の種類で変わります。[2]

    気泡ができると、配管の高い場所へ集まり、ポンプの音や流量の揺れ、コールドプレートの熱の運び方に影響しえます。発表資料は、急な縮径より緩やかな形状を選ぶこと、充填時に空気を抜くこと、圧力が低くなる場所を確認することを勧めています。これは安全を保証する寸法の一覧ではなく、図面から点検を始める順序です。

    まず一本の流路として計算し、実測で確かめる

    発表者の提案は、ポンプの特性曲線、配管やフィルターの抵抗、冷却液の温度を一つの流路モデルに置き、詰まりと縮径の両方を試算するものです。最初から複雑な流体シミュレーションへ進むのではなく、通常の運転点をメーカーの曲線と実測で合わせ、そこから温度と局所圧力の余裕を見ます。必要な場所だけ詳細な解析へ進む。資料の5℃や20%といった境界値は、この進め方を説明する例示であり、共通の運用基準ではありません。[2]

    フィルターの交換を急ぐべきか、泡が生まれやすい継手を直すべきか。二つを別々の警報として見るより、流れ・温度・圧力を一緒に追うほうが、冷却の余力がどこで失われているかをつかめます。液冷の能力を長く保つには、設計時の余裕と、運転後の測り方をつなげることが欠かせません。

    Cooler Masterの事業全体と収益のしくみは、cyclewaveの企業記事で整理しています。

    参考資料

    2026年9月23日確認。本文は公開スライドとOCPの一次資料をもとにしています。講演動画の発言・質疑は確認対象に含めていません。スライドの数値や図は発表者の例示モデルを含み、個別CDUの保証値ではありません。

    [1]Open Compute Project:2026 OCP APAC Summit 発表一覧。発表名・登壇者。

    [2]Ray Hsieh「CDU Filter Health & Reducer-Induced Bubble Formation」公式掲載スライド。pp.3–16、流路モデル、センサー、縮径部と気泡、運用手順。

    [3]Open Compute Project:Liquid-to-Liquid CDU Test Methodology & Performance Rating。2024年8月、フィルターの役割・保守。

    [4]Open Compute Project:Project Deschutes Data Center Facilities Specification。2025年7月、フィルターと監視項目の設計例。

  • OCP APAC 2026 | Broadcomが示すCPO、光をスイッチのそばへ置く理由

    OCP APAC 2026 | Broadcomが示すCPO、光をスイッチのそばへ置く理由

    AIの計算機を大きくすると、チップを増やすだけでは済みません。離れたチップへデータを渡す線も増え、その線が使う電力や、途中で止まる可能性が効いてきます。光ファイバーは距離を伸ばしやすい一方、光と電気を変換する装置をどこに置くかが設計の分かれ目です。

    OCP APAC Summit 2026でBroadcomのBhaskar Chinni氏が紹介したCPOは、光を電気信号の出発点に近づける方法です。発表はスイッチの実装からラック間の接続へ話を広げています。ここでは、SUE-Tのような通信手順ではなく、光の変換部を置く場所と、そこから生まれる利点・保守上の課題を見ます。[1・2]

    光の変換部を、どこへ置くか

    一般的な着脱式の光モジュールでは、スイッチの半導体から出た高速の電気信号が基板を通り、前面のモジュールで光に変わります。CPO(Co-Packaged Optics)では、光に変える小さなエンジンを、スイッチの半導体と同じパッケージの近くに収めます。基板を走る高速の電気信号を短くできるのが狙いです。[2・3]

    発表の図には、光エンジンを基板上に置く方式も並びます。こちらは半導体の近くには置けますが、同じパッケージに収めるCPOとは別の配置です。「光を使う」だけで一括りにせず、電気で進む区間がどれほど残るかを比べると、設計の違いが見えてきます。

    省電力の数字は、どこを比べている?

    Broadcomの資料は、同社CPO構成の光学部分の電力が、信号を整える回路を持つ着脱式モジュールとの比較で65%少ないという結果を示します。これは特定の比較条件における光学部分の値です。スイッチ全体やデータセンター全体の消費電力が65%減る、という意味ではありません。[2・4]

    変換部を近づけると、長い電気配線を補う回路を減らせる余地があります。ただし、実際の電力は光源、冷却、接続距離、採用する信号方式にも左右されます。比較表を読むなら、モジュールだけの値なのか、スイッチや冷却を含む値なのか、境界を先に確かめたいところです。

    止まりにくさにも、測った範囲がある

    資料はMetaの評価を引き、400Gbps相当ポートの稼働時間を合計した100万ポート時間で、短い接続断であるリンクフラップを観測しなかったと示します。複数のポートの時間を積み上げた数値であり、一本の接続が100万時間動き続けたという意味ではありません。測定対象もBroadcomの特定世代・環境です。すべてのCPO製品で同じ故障率を保証するデータではありません。[2・4]

    この違いは保守でも重要です。前面の光モジュールなら、故障した単位を抜いて交換できます。CPOでは光エンジンが半導体のパッケージに近いため、交換の単位が大きくなりやすい。Broadcomは外付けで交換可能な光源や、ラック側のブラインドメイト接続も示しますが、光源を交換できることと、光エンジンそのものを現場で交換できることは別です。

    ラックの外まで光を伸ばすとき

    発表後半は、銅線で届く範囲に計算機を集める構成から、光で複数のラックをつなぐ構成へ進みます。OCI-MSAの公開仕様には、NRZ信号を複数の波長に分け、一つのファイバーで双方向に運ぶ物理層が記されています。これは接続の土台をそろえる試みです。仕様書があることだけで、異なるメーカーの完成品すべてが接続できると確認されたわけではありません。[2・5]

    Broadcomが描くラック例には、光ファイバーの分岐、電源のバスバー、液冷の出入口、着脱時に位置を合わせてつなぐ光コネクターが同居します。光へ置き換えて終わりではなく、電気、熱、交換作業まで含めてラックを組み直す発想です。図は設計例として読み、掲載された規模を稼働中の導入実績とは扱いません。

    CPOが問いかけるのは、光が銅より常に優れているか、という単純な比較ではありません。速い電気信号をどこまで運び、どこで光に変え、故障したときに何を交換するか。距離と電力、保守の境界を一緒に決めることが、次のAIネットワークの設計につながります。

    Broadcomの事業全体と収益のしくみは、cyclewaveの企業記事で整理しています。

    参考資料

    2026年9月23日確認。本文は公開スライドと各団体の一次資料をもとにしています。講演動画の発言・質疑は確認対象に含めていません。性能値は記載された構成・測定範囲に限ります。

    [1]Open Compute Project:2026 OCP APAC Summit 発表一覧。発表名・登壇者。

    [2]Bhaskar Chinni「Open Ethernet AI Fabrics Enabled by Co-Packaged Optics」公式掲載スライド。pp.3–12、配置、省電力・評価値、OCI-MSA、ラック構成例。

    [3]Broadcom:Co-Packaged Optics。着脱式、基板上、同一パッケージの配置と電気信号区間の説明。

    [4]Broadcom:MetaでのCPO評価に関する発表。2025年10月1日。光学電力の比較と100万ポート時間の観測範囲。

    [5]OCI-MSA:200G Optical Compute Interconnect Line Interface Specification v1.0。2026年3月11日。NRZ、波長分割、双方向ファイバーの物理層。