vLLM Team
ホーム
vLLM x Novita AI:Chord、Kimi K2.x 向けのより高速な INT4 MoE。H200 で最大 1.3 倍、未調整の B300 で 2.15 倍の向上
Novita AIがChordをオープンソース化、W4A16 MoE CUDAカーネル群。公開されているHummingと比較し、層ごとの実測でH200ではレイテンシ最大1.33倍削減、未チューニングのB300では最大2.15倍削減。

GB300 NVL72でKimi-K3最速のDSparkをどう訓練したか
vLLMがSpeculatorsトレーニングライブラリを2.8兆パラメータのKimi K3対応に拡張:4ビット量子化ターゲットモデルに5層・50億パラメータのDSparkドラフトモデルを組み合わせ、数学推論の単一ストリーム対話性が約110から約435 tok/s/userに向上、同時実行時に同じ対話性で出力スループットが最大約3.5倍、初回トークン中央値は100ミリ秒のみ増加。
