Quantum Sea

OCP Korea 2026 | AIの会話を速く続ける、KVキャッシュの置き方

二枚の半透明の淡青の面が重なり、重なった部分に光が集まる抽象画

長い会話を続けるAIでは、次の一語を出すたびに、少し前の文脈を参照します。そのための中間状態がKVキャッシュです。会話が増えれば、この状態も増えます。GPUの速いメモリーにすべてを置けないとき、何を外へ出し、いつ戻すのでしょうか。

OCP Korea Tech DayでFADUのAndy Kim氏が示したのは、GPUのHBM、CPUのDRAM、サーバー内のNVMe SSD、共有ストレージを一続きの階層として考える方法です。発表資料は性能を実測した完成構成の報告ではなく、公開されている推論ソフトウェアや他社の構想を踏まえた設計の見取り図です。[1・2]

会話が伸びると、何が増えるのか

最初に入力文を読む段階をprefill、続けて一語ずつ生成する段階をdecodeと呼びます。prefillで作ったKVキャッシュを、decodeは使いながら増やします。キャッシュがなければ同じ文脈の計算をやり直すことになるため、保存は時間を節約します。その代わり、メモリーを使います。[2]

発表資料の計算例では、特定の32Bモデル、FP16、3万2千トークンの文脈を仮定すると、1系列のKVが約8GiBになります。同じ長さを8系列同時に扱う単純計算では約64GiBです。これはそのモデルと精度を置いた概算で、すべてのモデルに共通する容量ではありません。量子化や共有、キャッシュ管理の仕方で変わります。[2]

保存が得になるのは、読み戻すほうが速いとき

同じシステムの指示文や同じ資料が、別の質問でも繰り返し使われることがあります。その先頭部分に対応するKVを残しておけば、次の要求では同じ部分のprefillを省けます。ただし、遠くに保存したものを探し、運び、GPUで再び使える形にする時間が必要です。[2]

発表が示す判断はシンプルです。「読み戻しと調整にかかる時間」が「もう一度計算する時間」より短いとき、再利用が有利になります。短い入力や遅い転送経路では、保存したほうが必ず速いとは限りません。GPUメモリーの節約量だけでなく、最初の一語までの時間や、一語ずつ出る間隔も合わせて測る必要があります。[2]

GPUの外へ出すための二つの仕組み

資料は、推論エンジンvLLMと、KVの外部保存を支えるLMCacheを例にしています。vLLMは文脈を小さなブロックで管理し、同じ先頭部分に対応する完成済みブロックを見つけると再利用します。KV Connectorは、別の実行環境や外部の保存先とKVをやりとりするための接点です。ブロックの一致判定と、外への転送は別の仕事です。[2・3]

LMCacheの説明では、GPU側のブロックを外部キャッシュ用のchunkにまとめ、CPUメモリーやローカルSSDなどへ置きます。資料に出る256トークンのchunkは設定例で、固定の単位ではありません。また、chunkの容量もモデルやKVの精度によって変わります。保存先を増やすだけでは速くならず、どのchunkを残し、どれを先に読み込むかが重要です。[2・4]

共有ストレージは「すぐ使えるGPUメモリー」ではない

一台のサーバー内に置いたKVは近くて取り出しやすい一方、別のサーバーとの再利用範囲は狭くなります。共有の層へ広げれば多くの要求で使い回せる余地が生まれますが、転送と位置管理は難しくなります。prefillとdecodeを別のworker群に分ける場合には、KVの受け渡しそのものが要求の経路に加わります。[2]

発表はNVIDIAのCMXを、GPUメモリーと汎用共有ストレージの間に置くG3.5という構想例として紹介しています。CMXはNVIDIAが公表した別の仕組みで、FADUの製品ではありません。発表資料も、NVIDIAの性能主張や内部実装をこの発表で検証したものではないと断っています。SSD上のKVをdecode前に近い層へ移すという考え方は参考になりますが、効果は実際の転送経路と負荷で確かめる必要があります。[2・5]

KVキャッシュは、AIが覚えた知識そのものではなく、特定のモデルが再計算を省くために持つ中間状態です。速く続けたい会話には近い層を、繰り返し使う文脈には共有できる層を選ぶ。その境目は、容量だけでなく再計算と読み戻しのどちらが早いかで決まります。

発表したFADUが企業として手がける事業は、cyclewaveの企業記事にまとめています。

参考資料

2026年9月23日確認。本文はOCP公式掲載の9ページのスライドと、資料中で参照される各プロジェクトの公式文書を照合しています。スライドの表紙には「PREVIEW」とあり、講演中の実測や質疑応答は根拠に含めていません。

  1. Open Compute Project「2026 OCP Korea Tech Day」 — 登壇情報と公式資料へのリンク。
  2. Andy Kim(FADU)「KV Cache Tiering for LLM Inference: From GPU Memory to Shared Storage」 — pp.2–8。計算例・再利用条件・階層構成。
  3. vLLM「Automatic Prefix Caching」 — 完成済みブロックの識別と再利用。
  4. LMCache「Configuring LMCache」 — chunk sizeが設定可能であること。
  5. NVIDIA「Introducing NVIDIA BlueField-4-Powered CMX Context Memory Storage Platform」 — NVIDIA側のCMX構想。発表者自身の測定結果ではない。

コメント

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です