パフォーマンス

もっと見る パフォーマンス

ホーム

推論LLMパフォーマンス

折线图:Kimi K3 在数学推理负载上,使用与不使用 DSpark 投机器时的输出吞吐与交互性对比,DSpark 曲线整体更高更靠右上

GB300 NVL72でKimi-K3最速のDSparkをどう訓練したか

vLLMがSpeculatorsトレーニングライブラリを2.8兆パラメータのKimi K3対応に拡張:4ビット量子化ターゲットモデルに5層・50億パラメータのDSparkドラフトモデルを組み合わせ、数学推論の単一ストリーム対話性が約110から約435 tok/s/userに向上、同時実行時に同じ対話性で出力スループットが最大約3.5倍、初回トークン中央値は100ミリ秒のみ増加。

バックエンドパフォーマンステスト

手绘风格的示意图:标题「API Performance Testing: How to Design Realistic Tests」,左侧一群火柴人标着 Real Users,蓝色箭头汇入中间写着 API 的服务器方块,方块右侧伸箭头指向 CPU、Memory、Response time、Error rate 四个小图表,下方另有一条箭头指向一个 Database 圆柱

API 性能テスト:リアルに即したテストを設計する方法

性能テストは、インターフェースにやたらと大量のリクエストを送ることではない。著者はまず、負荷、ストレス、耐久、スパイク、キャパシティ、スケーラビリティの6種類のテストがそれぞれ何に答えるのかを説明し、次に現実に即したシナリオをどう設計するかに重点を置いて、ユーザーパスから業務量をもとにRPSを逆算するアルゴリズム、外部サービスをモックするかどうか、環境とデータベースをどう構成すべきかに至るまで解説している。

開発ツールオープンソースパフォーマンスrust

同じリンカで2つのベンチマークが正反対の結論:Wild作者が項目ごとに分解して自分で確認

Moldが最近リンカベンチマークを更新し、初めてWildを対象に含めた。このベンチマークではWildはMoldよりかなり遅く、8月4日の前回リリース時にWildが最新で公表したベンチマーク結果とは逆である。

バックエンドGoパフォーマンス

Go 1.27 で 80 バイト以内の割り当てが 20~30% 高速化、代償は icache

Go 1.27 で 80 バイト以下の割り当てがより高速なメモリ割り当てに。こうした割り当ては最大 20~30% 高速になり、割り当ての多いプログラムは最大 1% 高速に。Go ランタイムは特定サイズの割り当てに特化した関数を導入することで、これらの割り当ての性能を向上させた。

バックエンドCloudflare数学パフォーマンス

内存占用曲线在切换哈希环当天出现陡降的示意图

Cloudflare は構造体を1つとパラメータを1つ変えただけで、100TB のメモリを回収した

Pingoraの一貫性ハッシュがメモリを6GBも消費:機能の組み合わせでハッシュリングが数十枚になり、サーバーあたり10万のハッシュポイントは数学的にすでに収穫逓減。Cloudflareはu16インデックスと90%のハッシュ削減で100TBのRAMを節約し、デュアルリングの並行移行でキャッシュ雪崩を回避。

読み込み中…もっと見る