推理

更多 推理

首页

AI推理大模型

散点图:横轴是时间(0–35 秒),纵轴是耗时(0–700 毫秒)。橙色点稳定在 550–600 毫秒,青色点稳定在 150–200 毫秒——工具调用版每次决策约 600 毫秒,System One 版每 190 毫秒做六到七次批量决策

用 System One 模型编程的两种技巧

作者把 Qwen3-8B 接成 System One 分类器后试出两招:分层目标(每十秒定战略、每五秒定战术、每 200 毫秒执行)与锦标赛采样(一次喂一百个链接分两轮选),后者在 Wikiracing 里找到了理想的三链接路径。

评测推理大模型

IBM 开源项目 ALTK-Evolve 的题图:深蓝色猫头鹰标志(两只眼睛是青色循环箭头),右侧写着 IBM · OPEN SOURCE / ALTK-Evolve / On-the-Job Learning for AI Agents,以及「智能体从自身经验中学习,无需重训、无需标注」

你的智能体这次满分通过,下次还会吗?

IBM Research 给智能体的「一致性」做诊断:GPT-4.1 的 ReAct 智能体在 AppWorld 上平均 77.4% 通过,但五次全过的任务只有 53.0%,差 24.4 个百分点。他们用一次采样找出容易翻盘的决策点、生成一致性准则,把差距砍到 12.0 个点,平均准确率不降。