大規模MoEモデルGLM5.1をNVIDIA H200 1ノードで使える速度に

株式会社フィックスターズが提供する「オープンウェイトLLM GLM5.1のパフォーマンス最適化実践」は、大規模MoEモデルを限られたハードウェアで快適に運用するための、実践的なホワイトペーパーです。

本書が取り組む課題

総パラメータ数754Bの大規模MoEモデルGLM5.1は、NVIDIA H200を8枚積んだ1ノードに「載せる」ことはできても、そのままでは実用的な応答速度が出ません。原因はモデルサイズそのものではなく、KVキャッシュに割ける残りメモリの枯渇にあります。GPUを増やしても並列化戦略を誤れば収容能力は増えません。本書ではこの課題に取り組み、ハードウェアリソースから最大限の応答性能と収容能力を引き出しました。

本書の特徴
  • アーキテクチャに踏み込んだ最適化:MLA・DSA・疎なMoEというGLM5.1の特性を理解した上での、DP Attention導入によるKVキャッシュ容量の拡大
  • 収容能力を引き上げる施策:KVキャッシュを考慮したリクエストルーティングと、CPUキャッシュオフロードによるPrefill再計算の回避
  • 実ワークロードに基づく定量評価:コーディングエージェントの実セッションから生成したベンチマークで「ベンチでは速いが実運用では遅い」の乖離を排除
  • 明快な成果とハードウェア選定への示唆:P90 TTFTを59秒から3.8秒(約1/15)へ短縮。B200環境との比較検証から、大規模MoEモデルの推論基盤選定に役立つ知見も紹介
こんな方におすすめ
  • オンプレミス/自社環境で、最新のオープンウェイトLLMをセキュアに運用したい方
  • 限られたGPUノードで、同時接続数(収容能力)を最大化したい方
  • 大規模MoEモデルの推論基盤やGPU・量子化フォーマットの選定を検討している方
資料ダウンロード