推論

もっと見る 推論

ホーム

AI推論LLM

Qwen 模型玩 Doom 的截图:屏幕上显示游戏画面与模型在每一步选择的动作,用于说明 System One 模型能在低延迟下实时做决策

Jevが構造化出力を再び面白くする

著者は、Jevの価値は主にモデル自体ではなく推論戦略にある可能性があると考えている。返信をchoiceフィールドに事前入力し、制約されたトークンを1つだけ生成すれば、どのLLMでも「秘密のレシピ」の大部分を得られる——彼はQwen2.5-1.5Bで2〜3倍の高速化を試し出した。

推論LLMパフォーマンス

折线图:Kimi K3 在数学推理负载上,使用与不使用 DSpark 投机器时的输出吞吐与交互性对比,DSpark 曲线整体更高更靠右上

GB300 NVL72でKimi-K3最速のDSparkをどう訓練したか

vLLMがSpeculatorsトレーニングライブラリを2.8兆パラメータのKimi K3対応に拡張:4ビット量子化ターゲットモデルに5層・50億パラメータのDSparkドラフトモデルを組み合わせ、数学推論の単一ストリーム対話性が約110から約435 tok/s/userに向上、同時実行時に同じ対話性で出力スループットが最大約3.5倍、初回トークン中央値は100ミリ秒のみ増加。

評価推論LLM

IBM 开源项目 ALTK-Evolve 的题图:深蓝色猫头鹰标志(两只眼睛是青色循环箭头),右侧写着 IBM · OPEN SOURCE / ALTK-Evolve / On-the-Job Learning for AI Agents,以及「智能体从自身经验中学习,无需重训、无需标注」

あなたのエージェントは今回満点で合格したが、次回もそうなるだろうか?

IBM Researchがエージェントの「一貫性」を診断:GPT-4.1のReActエージェントはAppWorldで平均77.4%合格だが、5回すべて合格したタスクは53.0%のみで、24.4ポイントの差。彼らは1回のサンプリングで覆りやすい意思決定点を見つけ、一貫性基準を生成し、差を12.0ポイントまで削減、平均精度は落ちなかった。

AI開発ツール評価推論LLM

深色底上的可靠性图:一条曲线明显低于对角线,标注「置信度 0.9 以上、实际正确率 88%」

Jev はテキストを生成せず、確率だけを出力する。「ひとつの判断」を API にした製品が解こうとしている問題を、実際に試してみた

TypeSafe AI の Jev は、モデルの出力を文字列から確率付きの型付き判断に置き換え、その確率は「キャリブレーション済み」だと主張している。この前提を裏付ける証拠は誰も出していない——そこで我々は、確定した答えのある229件の主張を用意し、通常の LLM の確信度が自動化に使えるのかを測った。