
他说自己比 Jev 早一年,论文和 229 道题都对不上
Nandakishor Mukkunnoth 说他在 2025 年 3 月就做出了 Jev 那套非自回归决策模型,为此写了一篇很长的 文章。我读了他引的两篇论文,也把他 2026 年的模型拿 229 道细粒度题跑了一遍,看到的和这个故事不太一样。
更多 评测
首页
Nandakishor Mukkunnoth 说他在 2025 年 3 月就做出了 Jev 那套非自回归决策模型,为此写了一篇很长的 文章。我读了他引的两篇论文,也把他 2026 年的模型拿 229 道细粒度题跑了一遍,看到的和这个故事不太一样。
作者在 Zstd 实现评测上测了 26 个测试/验证提示条件加 4 个 skill:几乎没有一个超额表现,Default 反而高于平均。agent 会把技术用成表面功夫,证明无关性质、拿随机输入撞同一批错误路径,甚至把同一处 bug 写进两份「差分」实现。

MilleMiglia 用 C++ 开源实例生成器填补中间英里物流的基准空白,让跨配送中心的接力运输优化不再受制于专有数据。

Google Research 让教师用生成式 UI 为任意 STEM 主题生成互动模拟,已发布 30 多个经教师审核的模块,12 名教师的平均评分是 8 分(满分 10 分)。

Honeycomb Canvas 把遥测、GitHub、Linear 和 Slack 串成一个闭环,并用它开发自身的调查 agent,在用户之前发现问题。

IBM Research 给智能体的「一致性」做诊断:GPT-4.1 的 ReAct 智能体在 AppWorld 上平均 77.4% 通过,但五次全过的任务只有 53.0%,差 24.4 个百分点。他们用一次采样找出容易翻盘的决策点、生成一致性准则,把差距砍到 12.0 个点,平均准确率不降。

内部政策机器人演示时答得滴水不漏,上线后却依据已被取代的旧政策给出自信答案,而且没有任何信号能告诉你退化始于何时;这篇文章讲的是怎么为它建一道回归门禁。

674 行 SQL 模式库让 Claude 在 3100 万行 DuckDB 上的 4.6 万次查询平均 2-3 秒返回结果。

GPT-6 Astra 发布后,作者把注意力从「模型有多强」转到一个更容易被忽略的问题:我们到底怎么知道模型在变强?基准会饱和、会用代理指标、真值来源复杂、评分方法也会变,文章给出一套看分数时该问的五个问题。
19 个「模型 × 推理档位」打循环赛:Codex Astra 全胜居首,Grok 系 43 分钟只发 6 批命令、一个战斗单位都没出,Claude Fable 唯一在认真运营攀科技。作者结论是没有任何 agent 打出初学者水平。

英语 a/an 取决于读音而非字母:unicorn 用 a、hour 用 an。作者用 cmudict 对比首音与首字母规则,从 32,455 个词里挑出例外,最终用一段 25 行的 Python 规则解决。

作者连续几天抓取 HN 前 60 名做逆向分析:公开公式基本准确,但首页有 20% 的文章被降权;标题含 NSA 一律乘 0.4;评论多于票数且达到 40 条会触发「争议」惩罚,让文章瞬间从首页消失。

TypeSafe 把 AI 决策嵌入代码控制流,实时应用延迟仅 150ms,大数据处理成本降至百分之一。

十个真实场景、66 道有确定答案的题,外加 229 道核对题,三条对比臂。准确率只差几个点,时间差十倍,而概率的用法完全不同。
176 组配对实验、四款模型、两个基准:规划对弱模型是精度脚手架、对强模型是省钱工具;让被裁剪的上下文可恢复几乎没人用;预定义工具只对 bash 弱的模型有明显收益(+15.0%),bash 强的模型只给 bash 更便宜。

TypeSafe AI 的 Jev 把模型输出从字符串换成带概率的类型化判断,还声称概率是「校准」过的。这个前提没有人给过证据——我们拿 229 条有确定答案的声明,量了普通 LLM 的置信度到底能不能用来做自动化。