タグ: Microsoft

  • MicrosoftのPCIeカセット案、アクセラレータ交換後もホストを使い続けるための条件

    MicrosoftのPCIeカセット案、アクセラレータ交換後もホストを使い続けるための条件

    GPUを新しい世代に替えるたび、サーバーの筐体や電源、冷却まで設計し直すのでは、更新の負担が大きくなります。そんな負担を減らすには、交換する部分の形だけでなく、どこまでを交換し、どこからを使い続けるかを決めておく必要があります。

    2026年8月のOCP APAC Summitで、Microsoftはアクセラレータを「PCIeカセット」という交換単位にまとめる設計案を示しました。狙いは、GPUなどの種類が変わっても、ホスト側の再設計をできるだけ抑えること。現時点では、発表資料で示された構想です。[1・2]

    簡単にまとめると?

    • MicrosoftのPCIeカセット案は、アクセラレータ側を交換単位にまとめ、ホストの再設計を抑える構想です。
    • 交換性を成立させるには、形状だけでなく電力・冷却・制御・保守の接点をそろえる必要があります。
    • 発表図だけで仕様の批准や他社製品との互換性が確認されたとは言えません。

    カセットとホストの間に、境界を引く

    この案では、アクセラレータごとに変わりやすい形状、固定方法、熱の逃がし方、制御信号をカセット側の設計範囲に置きます。一方のホスト側には、筐体、ホストプロセッサーモジュール(HPM)、管理・制御を担うDC-SCM、電力供給や保守の仕組みを残し、可能な範囲で使い続けます。DC-SCMは、OCPが仕様を定めるサーバーの管理・セキュリティ・制御用モジュールです。[2・3]

    カセットは、単なる「GPUを入れる箱」ではありません。発表資料は、現場交換可能ユニット(Field Replaceable Unit、FRU)として捉え、差し込む経路、重さ、固定具まで検討対象に挙げています。PCIeの接続に加えて、電源コネクターの電流容量、冷却、サイドバンドの制御信号、状態を伝えるテレメトリーも境界をまたぎます。ホットプラグや出力制御を扱うなら、その対応範囲も合わせて決めなければなりません。[2]

    冷却と電力は、境界をまたいで決まる

    液冷なら、カセット内のコールドプレートだけを決めても足りません。接続先のCDU(冷却液分配装置)と合わせて、流量、圧力、冷却液の種類、漏れの検知を考える必要があります。空冷なら、ヒートシンクやファンだけでなく、筐体内で使える風量や音響条件が関わります。電力も同様です。新しいアクセラレータが要求する電流や瞬間的な電力変動を、ホストの配線と電源が受け止められるかを確認します。[2]

    つまり、カセットを交換できる形にしても、ホストの冷却能力や給電の余裕を超えれば、ホスト側の変更は避けられません。資料も、インターフェースの選び方がホストへ複雑さを持ち込み、電力と冷却の境界調整を後回しにすると再利用が難しくなると振り返っています。[2]

    「差し替え可能」を実現するために残る仕事

    資料の次の課題は、カセットの寸法や重量だけではありません。熱・電力の許容範囲、制御インターフェース、侵入検知、ホットプラグ、保守の手順まで含めた共通の接点を、早い段階で定義することです。新しいカセットを差し込むたびに何を再評価するかも、そこで明らかになります。[2]

    発表の図には「OCP Cassette Specificationに準拠」と書かれていますが、末尾はカセットの形状や電力範囲をこれから検討する呼びかけです。この一枚の図だけで、批准済みの仕様や、異なるメーカーの製品をそのまま挿し替えられる互換性があるとは言えません。市場投入までの時間を短くするという狙いも、発表内で削減率が実測されたわけではありません。[2]

    この提案が教えてくれるのは、交換性を部品の形だけで判断しないことです。機械、電力、冷却、制御、保守の接点を一緒に決め、ホストが使い続けられる条件を明確にする。その境界が見えて初めて、新しいアクセラレータを迎える準備ができます。

    Microsoftの事業や収益の仕組みは、cyclewaveの企業解説にまとめています。

    参考資料

    2026年9月26日確認。本文は公開スライドを中心に構成しています。発表動画の発言・質疑は確認対象に含めていません。

    [1]Open Compute Project「2026 OCP APAC Summit」発表一覧。演題、登壇者、資料と動画の掲載。

    [2]George Asirvatharaj、Hardik Shah、Niharica Sohal「Modular PCIe Cassette Architecture for Scalable AI Systems」公式掲載スライド。全13頁。課題と構成はpp.5–6、カセットとホストの条件はpp.7–9、残る課題と提案はpp.10–11。

    [3]Open Compute Project「DC-SCM 2.2 Specification」。DC-SCMとHPMの用語と役割の確認。

  • Microsoftの電力テレメトリー提案、単位と測定範囲をそろえる

    Microsoftの電力テレメトリー提案、単位と測定範囲をそろえる

    同じ「100」という電力値でも、二つのサーバーで意味が同じとは限りません。片方は100ワット、もう片方は100ミリワットかもしれません。CPUだけを測った値と、装置全体を測った値かもしれません。数値を並べる前に、何を、どの単位で、どの範囲から測ったかをそろえる必要があります。

    2026年8月のOCP APAC Summitで、MicrosoftのSmitha Kashyap C氏らは、異なる機器から集める電力テレメトリーに共通の意味を持たせる案を発表しました。センサーを一種類に統一する話ではありません。機器ごとの値を、あとから比べて使える形へ写すための設計です。[1・2]

    簡単にまとめると?

    • Microsoftの案は、機器ごとの電力測定値に共通の項目名・単位・対象範囲を与える仕組みです。
    • 電力とエネルギーを区別し、値を比べる際は測定時刻や平均化期間も確かめます。
    • 示された共通スキーマや対応表は提案であり、OCPの批准済み仕様や全社の実装済み対応表ではありません。

    名前が似ていても、測っている量を確かめる

    電力テレメトリーは、CPU、メモリー、SSD、電源装置などから運用中に得る測定値です。原資料は、メーカーごとに項目名や単位、電力上限の定義が異なるため、機種を増やすたびに集計用の変換が必要になると説明します。[2]

    ここでは名称だけをそろえても足りません。電力はある時点や短い区間の消費の速さで、単位はワット(W)。エネルギーは時間を通じて使った量で、単位はジュール(J)です。資料の例にある「cpu_power」と「package_energy」は、名前だけで同じ指標とはみなせません。測定範囲もCPUのコア、パッケージ、サーバー全体で違います。[2]

    元データ、意味づけ、使う側の三層

    発表は仕組みを三層に分けます。第一層はCPU内部のカウンター、ファームウェアのセンサー、NVMeのログなど、機器が実際に出す値。第二層は、その値に共通の項目名、単位、対象範囲、閾値、版を与える意味づけのスキーマ。第三層は、監視画面、分析、ジョブ配置など、値を使う側です。[2]

    たとえば「pkg_energy_j」なら、パッケージのエネルギーをジュールで表す項目だと分かります。資料のSSD例は1秒間の平均電力です。単位と測定対象の範囲をそろえることは比較の土台ですが、実測値を読み比べるなら時刻や平均化期間も要ります。発表の第二層の要素表には、その時間条件を表す独立項目は示されていません。また、異機種の写像表は提案の見本です。対応する各社の元データが同じ範囲を測り、同じセンサーとして実装されていることまで証明するものではありません。[2]

    集める経路と、値の意味は別

    機器の中からOSが読むインバンドの値もあれば、管理用の経路を通るサイドバンドの値もあります。発表はRedfishやPLDM/MCTPなど既存の管理・伝送の仕組みとの接続を示します。しかし、値を運べることと、その値が同じ測定対象・単位を指すことは別です。どの経路で受け取っても、第二層で意味を確かめる必要があります。[2]

    同じ定義で値を集められれば、異機種をまたぐ監視や、電力の余裕を見たジョブ配置を考えやすくなります。資料は仕事ごとの消費エネルギー推定や炭素排出の集計も将来の利用先に挙げています。ただし、共通スキーマの提案だけで、個々の仕事の消費量が正確に測れると実証したわけではありません。計測の時間間隔、共用部の電力、推定方法は別に検証が要ります。[2]

    提案の図と、承認された仕様を分ける

    スライドは第二層を「OCP Semantic Schema」と呼び、共通のフィールドへ写す考えを示しています。これは今回の発表で示された構想として読むのが正確です。例示された版名や異機種の対応表を、そのままOCPが批准した仕様や全メーカーの実装済み対応表として扱うことはできません。[2]

    電力の見える化は、センサーを増やすだけでは進みません。どこから来た値で、何を測り、いつの値なのか。その意味に加えて時刻や平均化期間も確かめられれば、異なるサーバーの値を継続して読み比べやすくなります。

    Microsoftの事業や収益の仕組みは、cyclewaveの企業解説にまとめています。

    参考資料

    2026年9月24日確認。本文は公開スライドの三層案と例示をもとにしています。発表動画の発言・質疑は確認対象に含めていません。

    [1]Open Compute Project「2026 OCP APAC Summit」発表一覧。演題、登壇者、資料掲載。

    [2]Smitha Kashyap C、Chockalingam A、Prateek Gupta「Standardizing Power Telemetry Semantics for Energy Efficient, Hyperscale Datacenter Operations」公式掲載スライド。全15頁。課題はpp.3–4、三層案と写像例はpp.5–11、想定用途はpp.12–13。