データセンターで使うディスクは、同じように見えても、機種やファームウェア、使われ方が違います。故障の前に現れる兆候も一つではありません。すべてに同じ閾値を当てはめると、見逃す異常と、故障ではないのに拾ってしまう変化の両方が生まれます。
Microsoftが紹介したAFPD(Azure Failure Prediction and Detection)のディスク向けの仕組みは、こうした違いを前提にしています。機種と故障種別に合わせた予測モデルを用意し、その予測を確かめてから、保守へつなぐ構成です。[1・2・3]
ディスクの内側と、周囲の動きを合わせて読む
手がかりは、ディスクが持つ健康状態の情報だけではありません。資料ではSMARTなどの内部テレメトリーに加え、システム側のI/Oやイベント、エラーログ、温度や湿度などの環境情報を合わせています。テレメトリーは、運用中の状態を継続して集めた計測情報です。[2]
単発の値を見るだけでなく、前回からの差分や変化の傾向、一定期間をまとめた統計量を特徴量にします。たとえばエラーの増え方を扱うには、その時点の件数だけでは足りません。いつ、どのように変わってきたかを、モデルが比較できる形に整える必要があります。[2]
さらに、ディスクが完全に利用不能になった後の記録だけで学習するのではなく、本番の故障検知やシステムログから、より早い段階の不具合をラベルに使います。故障を知らせる時点を、利用者への影響が出る前へ近づける考え方です。[2]
機種と故障種別の組合せに、モデルを用意する
この仕組みの軸は、ドライブの機種 × 故障種別ごとにモデルを持つことです。機種が変われば使える信号も変わり、故障の種類が変われば、重視する特徴や判定の閾値も変わります。[2]
そのため、一つの大きなモデルの成績だけで運用を判断するのではなく、それぞれのモデルを学習し、検証し、更新できる構成にしています。ある故障を拾うルールが有効でも、それだけで別の故障まで見つかるとは限らないからです。
正解率だけで、使える予測とは決めない
故障がまれなデータでは、多くを「正常」と答えるだけでも、全体の正解率は高く見えます。運用で知りたいのは、故障と判断したものがどれだけ本当だったか、そして実際の故障をどれだけ拾えたかです。
前者が適合率に当たる指標、後者が再現率(Recall)です。資料はHITを「検知したうち実際に正しかった割合」と定義し、HITと再現率が閾値を満たすかを、本番導入の判断に使っています。見逃しを減らすことと、不要な対応を増やさないことを、両方確かめるためです。[2]
学習段階の受入基準として、正解率90%超、適合率75%超、再現率70%超、F1スコア70%超も示されています。これらはモデルを受け入れる基準であり、すべての機種で達成した実績値ではありません。[2]
予測だけを動かしてから、保守へつなぐ
本番へ広く展開する前には、予測を日次で評価しながら、実際の運用操作は起こさない検証段階を置きます。過去の故障結果と照らし合わせ、HITと再現率が基準を下回れば、学習や特徴量の見直しへ戻ります。[2]
導入後も、少数の対象で先に動かすカナリア展開などを使い、段階的に適用します。誤検知や見逃しを追い、ハードウェアやファームウェアの変化によって予測が合わなくなれば再学習する。モデルは作って終わりではなく、運用に合わせて保つ対象です。[2]
生成AIの説明と、設備を動かす判断を分ける
発表の後半では、既知の故障を捉えるルール、機械学習モデル、原因分析を助けるAIエージェントを重ねる構成へ話が広がります。大規模言語モデル(LLM)は、証拠をまとめたり、原因の候補や対応案を整理したりする役割です。[2]
ここで明示されているのは、LLMの出力だけを根拠に、設備群への操作を実行しないという境界です。不可逆な操作には、定めた方針による承認や人の確認を必要とし、実行の根拠、確信度、結果を残します。[2]
新しい自動対応も、過去データによる評価、操作をしない観察運転、限定した本番適用という順に進めます。予測を当てる技術と、予測に基づいて安全に動く技術は、つながっていても同じではありません。[2]
故障を早く知る価値を、運用で確かめる
AFPDのディスク向け発表から見えてくるのは、予測モデルだけを高度化する設計ではありません。機種ごとの信号を整え、見逃しと誤検知を確かめ、影響の小さい範囲から保守へつなぐ。その連続した手順が、予測を使えるものにします。
故障の兆候を早く知れれば、対応を選ぶ時間ができます。その時間を役立てるには、どの予測を、どの条件で、どの操作へつなぐかまで決めておくことが大切です。
Microsoftの事業をもう少し知る
Azureを含むクラウド、業務ソフト、Windowsなど、Microsoft全体の事業についてはcyclewaveの企業解説にまとめています。
参考資料
2026年9月27日確認。講演の公開スライドをもとに構成しています。
[1]Open Compute Project:2026 OCP APAC Summit 公式セッション一覧
[2]Microsoft:AFPD Disk Failure Prediction and Detection and AI Transformation(講演スライド)
[3]Microsoft:Azure Failure Prediction & Detection の概要(2025年11月4日)

コメントを残す