大規模MoEモデルGLM5.1をNVIDIA H200 1ノードで使える速度に
株式会社フィックスターズが
本書が取り組む課題
総パラメータ数754Bの
本書の特徴
- アーキテクチャに踏み込んだ最適化:MLA・DSA・疎なMoEというGLM5.1の特性を理解した上での、DP Attention導入によるKVキャッシュ容量の拡大
- 収容能力を引き上げる施策:KVキャッシュを考慮したリクエストルーティングと、CPUキャッシュオフロードによるPrefill再計算の回避
- 実ワークロードに基づく定量評価:コーディングエージェントの実セッションから生成したベンチマークで「ベンチでは速いが実運用では遅い」の乖離を排除
- 明快な成果とハードウェア選定への示唆:P90 TTFTを59秒から3.8秒(約1/15)へ短縮。B200環境との比較検証から、大規模MoEモデルの推論基盤選定に役立つ知見も紹介
こんな方におすすめ
- オンプレミス/自社環境で、最新のオープンウェイトLLMをセキュアに運用したい方
- 限られたGPUノードで、同時接続数(収容能力)を最大化したい方
- 大規模MoEモデルの推論基盤やGPU・量子化フォーマットの選定を検討している方