智能体用测试与验证技术的水平到底如何?
作者在 Zstd 实现评测上测了 26 个测试/验证提示条件加 4 个 skill:几乎没有一个超额表现,Default 反而高于平均。agent 会把技术用成表面功夫,证明无关性质、拿随机输入撞同一批错误路径,甚至把同一处 bug 写进两份「差分」实现。
作者在 Zstd 实现评测上测了 26 个测试/验证提示条件加 4 个 skill:几乎没有一个超额表现,Default 反而高于平均。agent 会把技术用成表面功夫,证明无关性质、拿随机输入撞同一批错误路径,甚至把同一处 bug 写进两份「差分」实现。
Dan Luu 说他从 2025 年初就见到人们用 LLM 时把脑子关掉。他的结论很直接:如果 LLM 强到「关掉大脑」也能产出平均水平的软件,公司为什么不直接让 LLM 循环跑、把那个人裁掉?