vLLM Team

ホーム

推論LLMパフォーマンス

折线图:Kimi K3 在数学推理负载上,使用与不使用 DSpark 投机器时的输出吞吐与交互性对比,DSpark 曲线整体更高更靠右上

GB300 NVL72でKimi-K3最速のDSparkをどう訓練したか

vLLMがSpeculatorsトレーニングライブラリを2.8兆パラメータのKimi K3対応に拡張:4ビット量子化ターゲットモデルに5層・50億パラメータのDSparkドラフトモデルを組み合わせ、数学推論の単一ストリーム対話性が約110から約435 tok/s/userに向上、同時実行時に同じ対話性で出力スループットが最大約3.5倍、初回トークン中央値は100ミリ秒のみ増加。