
vLLM x Novita AI:Chord,为 Kimi K2.x 打造的更快 INT4 MoE。在 H200 上最高提升 1.3 倍,在未调优的 B300 上提升 2.15 倍
Novita AI 开源了 Chord,一套 W4A16 MoE CUDA 内核。与公开的 Humming 相比,逐层实测在 H200 上延迟最多降低 1.33 倍,在未调优的 B300 上最多降低 2.15 倍。
更多 GPU 内核
首页
Novita AI 开源了 Chord,一套 W4A16 MoE CUDA 内核。与公开的 Humming 相比,逐层实测在 H200 上延迟最多降低 1.33 倍,在未调优的 B300 上最多降低 2.15 倍。

NVIDIA 把 Rust 原生 kernel 编程分成两条路线:SIMT 保留线程级控制,Tile 让编译器决定线程映射;两个项目都还早,但边界已经画清楚。