
为什么 AI 编程助手会重复固定错误:谁来接收结果?
记下错误和从错误里学到东西是两回事;六家 agent memory 系统里四家公开了带否定判决的反馈输入,而 Mnemoverse 自己公布的测量显示这个信号几乎从未被调用。
更多 大模型
首页
记下错误和从错误里学到东西是两回事;六家 agent memory 系统里四家公开了带否定判决的反馈输入,而 Mnemoverse 自己公布的测量显示这个信号几乎从未被调用。

模型不会自己执行任何东西,它只回一个结构化的工具调用请求,你的代码去运行真正的函数、再把结果交回去让模型作答;这篇从零把这个四步循环拆开讲。

GPT-6 Astra 发布后,作者把注意力从「模型有多强」转到一个更容易被忽略的问题:我们到底怎么知道模型在变强?基准会饱和、会用代理指标、真值来源复杂、评分方法也会变,文章给出一套看分数时该问的五个问题。

作者主张,用 AI 写博客、研究报告、备忘录这类有实质内容的文本,即使给足要点与上下文、事后又亲自编辑,也几乎永远不该做:写作本身就是思考,AI 的文字在难以察觉处含糊出错,不标明还失礼且误导人。
Dan Luu 说他从 2025 年初就见到人们用 LLM 时把脑子关掉。他的结论很直接:如果 LLM 强到「关掉大脑」也能产出平均水平的软件,公司为什么不直接让 LLM 循环跑、把那个人裁掉?
19 个「模型 × 推理档位」打循环赛:Codex Astra 全胜居首,Grok 系 43 分钟只发 6 批命令、一个战斗单位都没出,Claude Fable 唯一在认真运营攀科技。作者结论是没有任何 agent 打出初学者水平。
Bend 2 的 demo 要用 58 行声明「定律」、442 行写证明。作者用形式验证领域的 SPARK 重做同一程序,只需写明不变量,GNATprove 一次通过 12 项检查。
Gowers 赞同「我们正面临危机」,但不同意「概念理解高于解题」是唯一正确态度:他把数学家的动机看成一条谱系,并逐条比较「模型全面超越人类」与「国际协议限制发布」两种未来的得失。
作者说自己每天七成以上时间在处理 AI,工作乐趣已被剥夺。他批评 AI 公司一边呼吁监管一边扩张,安全行业把资源投给漏洞发现而非打补丁,而「人在环路里」正退化成橡皮图章。

基于 Qwen3.8 27B 的三值权重模型把体积压到 5.9GB(每权重 1.76 有效比特),综合基准保留 98.2%,在 RTX 5090 上跑到 143 token/秒,并按 Apache 2.0 发布。

作者用同一组虚构的活动信息反复要求 ChatGPT 换风格,从包豪斯做到孔版印刷、朋克小志与日式极简,证明 AI 海报的雷同是提示词的问题,而不是能力的问题。

两条规则防止 LLM 把文章变成 Velveeta 奶酪:禁用其建议的措辞,也别信它对初稿的夸奖。

让大模型直接写界面 JSON,它会编出不存在的组件、自己编文案,写坏了还得等结果回来才知道。json-render 换了个办法,把搭界面拆成两批有限的选项,模型只挑,代码负责拼。

2026年6款本地AI模型盘点:数据不出设备即可运行,兼顾隐私与离线能力。

TypeSafe 把 AI 决策嵌入代码控制流,实时应用延迟仅 150ms,大数据处理成本降至百分之一。

十个真实场景、66 道有确定答案的题,外加 229 道核对题,三条对比臂。准确率只差几个点,时间差十倍,而概率的用法完全不同。
AI SRE 与编码助手营销框架分化:前者多被定位为取代 SRE,后者则被包装成工程师的增强工具。

Jev 不写文章,只做判断。把它想成一套选择题加判断题,你出题,它交答题卡并标出把握。这篇讲清它能干什么、为什么便宜,以及那个概率为什么不能直接当正确率用。
Adam Langley 用 Lean 写了一个 Zstandard 解压器,把类型级不变量写成类型签名,再让 LLM 去补证明体, 并记下它在哪些步骤上真的省了事。

人工智能大幅缩短了其设计时间;它只会变得更快
176 组配对实验、四款模型、两个基准:规划对弱模型是精度脚手架、对强模型是省钱工具;让被裁剪的上下文可恢复几乎没人用;预定义工具只对 bash 弱的模型有明显收益(+15.0%),bash 强的模型只给 bash 更便宜。

你显然可以直接证明事情。
堆溢出和SSO配置错误导致OpenAI内部仓库被攻破

TypeSafe AI 的 Jev 把模型输出从字符串换成带概率的类型化判断,还声称概率是「校准」过的。这个前提没有人给过证据——我们拿 229 条有确定答案的声明,量了普通 LLM 的置信度到底能不能用来做自动化。