
vLLM x Novita AI:Chord、Kimi K2.x 向けのより高速な INT4 MoE。H200 で最大 1.3 倍、未調整の B300 で 2.15 倍の向上
Novita AIがChordをオープンソース化、W4A16 MoE CUDAカーネル群。公開されているHummingと比較し、層ごとの実測でH200ではレイテンシ最大1.33倍削減、未チューニングのB300では最大2.15倍削減。
もっと見る GPU カーネル
ホーム
Novita AIがChordをオープンソース化、W4A16 MoE CUDAカーネル群。公開されているHummingと比較し、層ごとの実測でH200ではレイテンシ最大1.33倍削減、未チューニングのB300では最大2.15倍削減。

NVIDIA は Rust ネイティブのカーネルプログラミングを二つの路線に分けた。SIMT はスレッド単位の制御を残し、Tile はスレッドマッピングをコンパイラに任せる。どちらのプロジェクトもまだ初期段階だが、境界線はすでに引かれている。