为什么我认为你几乎永远不该用 AI 写任何有实质内容的东西

作者主张,用 AI 写博客、研究报告、备忘录这类有实质内容的文本,即使给足要点与上下文、事后又亲自编辑,也几乎永远不该做:写作本身就是思考,AI 的文字在难以察觉处含糊出错,不标明还失礼且误导人。

中文
复制
一张黑白抖动噪点风格的插画:一个人伏在桌前,右侧一台笔记本电脑的屏幕发亮

我认为,你几乎永远不该用 AI 来写作,也就是不该让 AI 去做你在一页纸上敲下文字时所做的那件事,无论是写博客文章、研究报告、备忘录、一封用心写的邮件、一部小说,还是任何其他旨在传达一个想法、一个论证、一份分析或其他有实质内容的1思考的文本。即使你给 AI 提供了非常详细的要点、口述的想法或其他上下文,即使你事后编辑了 AI 写出的文字2,我的看法依然如此。

我这么认为,理由有三:(1) 写作过程是思考过程不可或缺的一部分;(2) AI 写出来的东西含糊,而且错得很难被发现;(3) 用 AI 写作却不标明这事,既失礼又误导人。下面我会详细展开,先说几句铺垫。

你可能已经知道,我并不反 AI。研究与写作流程里还有很多环节,用 AI 都很合理,比如转录音频、分析数据、检索信息、头脑风暴、给草稿提反馈。我也认为,用 AI 做逐行编辑和文字校对,或者把某一段改写得更清楚、更紧凑,都没问题,只要每一处改动都由人有意地接受或拒绝。我反对的只是用 AI 来写正文。3

确实,用 AI 写作有不少好处。比如比自己写省力得多,也快得多。所以要判定它整体上是坏事,它的坏处就得足够大。你可能已经猜到了,我认为它确实足够大。

最后要说的是,我只是在就当下存在的、以及我预期在不久的将来会存在的 AI 模型提出主张。将来大概会出现某些模型,好到可以把写作交给它们(不过到那时候,更合理的做法也许是把整个研究或写作流程端到端地交出去,因为除了写,它们还得承担全部或大部分的思考)。

写作过程就是思考过程

做任何研究的目的是就重要问题形成准确的看法,然后再把这些看法传达给读者。在我看来,做到这一点最好的办法之一就是通过写作

Paul Graham 写过4

写关于某件事的东西,即使是你很熟悉的事,通常也会让你发现,你对它的了解并不像你以为的那么深。把想法变成文字是一场严峻的考验。[…] 最终出现在一篇文章里的想法,有一半是你在写它的过程中才想到的。这正说明了我为什么要写。

在 Patrick McKenzie 的播客的一期节目里,Clara Collier 说:

当我在写有实质内容的东西时,写作过程里没有任何一个环节是我不在思考、不在改变想法的。从列提纲,到把它变成文字,再到写出一个句子,都是如此。我常常会有这样的经历:我想把一份提纲变成成稿,正在琢磨一个过渡句,但它就是接不顺,然后我意识到,哦,这个过渡之所以不顺,是因为这两点本来就不该放在一起。我在这里想做的事本身就是错的。而如果我把提纲喂给一个 LLM,它不会停下来想一想,这份提纲可能本身就有问题。[…]

Patrick 回应说:

我完全同意写作过程就是思考过程,而且我认为现在我们有了实证:当你造出一台会写作的机器,思考就作为副作用直接 冒出来 了。但在写多页篇幅的东西时,即便你有一个很强的论点,强迫自己把它写成句子和段落、把论证结构化,这个过程会让你看到论证里的漏洞在哪里。它会让你看到自己的研究在哪里做得不够。它还会把这样的事情翻出来:哦,其实有某个东西和我想要说的结论是矛盾的。作为一个还算讲道德的人,我想我会承认存在反驳意见,或者不得不补一句,说完全站得住的结论比我所谓的「想写的」那个结论要小。

我基本同意这些看法。写东西的时候,我必须先知道我想说什么,也就是说,我必须去思考证据和论证,最终形成一些看法。所以写作会逼我去做这些事,而它们对任何写作或研究项目来说都是必需的。任何这类项目,总得有人把整件事装在脑子里——所有的证据、考量、论证,以及它们之间如何相互咬合。用 AI 写作,让人更容易躲开这些必需的思考。

AI 写的文字含糊,而且错得很难被发现

我写东西的时候,会对具体的用词和措辞做大量微小的决定。这些微小的决定加在一起,构成了整篇文字的清晰与准确。

举个例子。如果我让 Claude Fable 5「写一小段文字,介绍 AI 芯片走私这个问题」,这个话题已经被写过、也被大量报道过,它给出的是:

自 2022 年 10 月起,美国限制向中国出口先进 AI 芯片,意在拖慢中国在 AI 前沿的进展。但出口管制的效力取决于执行,而 AI 芯片体积小巧、价值极高,又经由盘根错节的全球供应链销售——这些性质让它们既值得走私,也便于走私。各种转运网络把受管制的 GPU 经新加坡、马来西亚、阿联酋等地的中间商转手,用空壳公司和伪造的单据把它们运进中国。对其规模的估计差异很大,从每年数万颗到或许十万颗以上高端芯片不等,而即使按低端估计,其算力也足以对训练和部署有能力的 AI 系统产生影响。与此同时,负责监管这一数千亿美元贸易的美国工业与安全局(BIS),其预算和人员编制更适合应对一个远为更小的问题。因此,芯片走私有可能在不知不觉中掏空美国 AI 政策的核心支柱之一。

这段写得不算糟,甚至可以说相当合理,但这是我会写的写法吗?不是。事实上,Claude 做了许多我认为微妙地错误或糟糕的选择:

  • Claude 写道「出口管制的效力取决于执行」,但这是什么意思?它要么说了一句废话(当然,不执行或执行不力的政策效果更差),要么什么也没说。5
  • Claude 写道 AI 芯片「体积小巧」,这没错,但通常被走私的是 AI 服务器,而服务器并不小巧。不过更重要的是,这一点其实无关紧要,因为 AI 芯片走私很少靠藏匿货物来混过海关;通常只是把产品重新标记成别的货物,然后,可以说,光明正大地运出去。
  • Claude 写道,AI 芯片「经由盘根错节的全球供应链销售」,这让它们「既值得走私,也便于走私」。这是什么意思?是说走私者更容易从美国以外的公司买到芯片吗?(直到不久前,走私者似乎都能相当轻松地从总部位于美国的公司采购到 AI 芯片。)是说走私者在马来西亚这类国家大量采购 AI 芯片时更不引人注意吗?(我认为这个说法更接近实情。)还是别的什么?
  • Claude 写道,对走私规模的估计「差异很大,从每年数万颗到或许十万颗以上高端芯片不等」。这话字面上没错,但那些低端估计几乎肯定是错的,真实数字大概更接近 Claude 提到的上限,也就是数十万颗。6 所以这句话是误导性的。另外,Claude 没有说明是哪一年,而走私量自 2022 年 10 月以来波动很大;Claude 也没有说明什么算「高端」芯片(听上去像是一种手工打造、只卖给沙特王室成员和贵族遗孀的奢侈品)。
  • Claude 写道,「即使按低端估计,其算力也足以对训练和部署有能力的 AI 系统产生影响」。这句话没有任何信息量。从某种意义上说,哪怕只有一颗 AI 芯片,对训练和部署 AI 系统也「有影响」,不管这个系统有没有能力。(而且,什么叫「有能力的 AI 系统」?为什么少量算力对「有能力的」AI 系统的影响,会比对一个不行的 AI 系统更大?要说的话,你可能会觉得反过来才成立:更弱的 AI 系统反而更能从少量算力中获益。)
  • Claude 写道,工业与安全局(BIS)「负责监管这一数千亿美元的贸易」。这里更好的做法是直接把数字写出来。
  • Claude 写道,BIS「的预算和人员编制更适合应对一个远为更小的问题」。第一,我们知道 BIS 的预算和人员编制,所以更好的做法是给出这些数字并交代其背景。第二,一个问题「更小」是什么意思?是说它不那么重要,还是说解决它需要的力气更少,还是别的?真正重要的难道不是给 BIS 更多资源很可能会大幅改善执法效果,而不是 BIS 目前的资源规模更适合另一个问题吗?
  • Claude 的最后一句,说芯片走私「有可能在不知不觉中掏空美国 AI 政策的核心支柱之一」,纯属没有信息量的掌声灯

一篇文章里有一两处这样的问题,也许无关紧要,但以我的经验,AI 写的文字里这类不必要的含糊和微妙错误的表述非常密集。要注意,即使你给 AI 提供大量上下文,比如书面笔记和提纲,这个问题依然存在。7

类似地,Eric Schwitzgebel 写道

人类专家思考的方式和 LLM 不同,也 更好。他们的用词,哪怕是很细微的用词,也反映出他们自己可能都没有意识到的敏感度。一般而言,专家写出的文字,比语言模型的输出更能贴合他所专长的领域。[…] 你也许会这样反驳:我当然会在发出之前读一遍 LLM 的输出,如果不认可每一个字,我就不会发这封邮件,更不会投这篇文章!所以,这个反驳继续说,你确实思考了文中表达的想法。这段文字反映了你作为专家的最佳判断——甚至比你的最佳判断还要好一些:你的专家判断加上 LLM 的专业知识。我的回答是:一边读一边点头,和_真正有产出地生成_一段文字,在认知上有巨大的差别。原因有两个。第一,文字一旦落到页面上,人就很容易被动地接受了那个差不多合适的词,而不会像我们从头生成文字时那样,以同样费力而主动的方式去斟酌用词。第二,正如我上面提到的,我怀疑人类,即便是专家,也并不能很好地觉察到塑造用词的所有因素,也就是他所敏感的那些东西。你会换一种稍微不同的说法,而即使你不知道这一点、也不知道为什么,被送出和被接收到的都是不同的信号。

我同意这个说法。但实际情况比这还要糟得多!AI 不仅会写出不必要的含糊、微妙错误的文字,而且写得几乎最大限度地有说服力!如果 AI 并不真的「知道」你让它写的那件事,它通常不会停下来告诉你它不知道,而是写一些含糊到足以成真、却毫无意义的话,或者写一些听起来是真的、但实际上不是、或者未必是的话。人当然也常常出错、也常常含糊,但我认为我们出错和含糊的方式通常不那么有说服力,也更容易被察觉。

要像我前面分析 AI 芯片走私那段文字那样,读一遍 AI 写的文本并挑出所有小毛病,需要花很大的力气。如果我对 AI 芯片走私了解不多,我大概看不出我列出的那些问题中的大部分,除非我在这段文字上想了很久。但如果这段文字是我自己写的,我就不可能不注意到自己在哪里糊涂。

用 AI 写作却不标明,既失礼又误导

有时候我写一段文字,是打算给别人读的。比如我想把它发到网上,或者发给同事征求意见,或者作为邮件发出去,或者投给出版方。当我发布或分享一段文字时,读到它的人多半会期待我在写的东西上花过心思,尤其是期待这段文字代表的是_我的_想法。或者至少他们应该这样期待,而我也希望他们这样期待。这是读者与作者之间的隐性契约:读者付出自己的注意力,作者则以某种有价值的东西回报,比如信息或娱乐。

在 Patrick McKenzie 播客的同一期节目里,Clara Collier 还说:

也许我这么说有点矫情,但一个 LLM 能写出的那种我的文章,永远都会缺一些我能补上的东西。这同样不是说——有很多领域模型比我懂得多。但任何人任何时候都可以去问 Claude。如果他们读的是我写的东西,或者是我作为编辑选择放到他们面前的东西,那是因为存在一份隐性契约。我提供给他们的是别处拿不到的东西。这比直接去问模型更值得他们花时间。也正因如此,我不会直接用 LLM 生成的文字——或者即使我用,我也会希望在你为它花时间之前,非常清楚地告诉你那是什么。

我上面写到的那些,关于微妙错误和含糊的内容,以及关于当一篇文字由 AI 写成时,你根本无从知道作者是否花了很多心思——所有这些都是对那份契约的违背。所以当我读到一段文字、发现它全部或部分由 AI 写成时,我对这段文字和这位作者的信任会立刻下降,而且我认为这种下降是理性的。

基于以上所有理由,我认为,当你宣传由 AI 写成的文字,或者把一份由 AI 写成的草稿发给别人时,你的行为是失礼的。我觉得这有点像把一份写得很潦草的草稿发给别人,同时隐瞒它其实很潦草这个事实。而除非你把 AI 写出的内容清楚地标出来,你就在误导读者,因为读者会期待你的文字是_你的_文字,是仔细想过的,具体地代表着_你的_看法。

当然,只要把文字标注为 AI 所写,或者实质上是 AI 所写,你就能避开失礼和误导这两个问题。不过我猜大多数人并不愿意这么做。

就没有例外吗?

问:如果我把 AI 写出的内容_清楚地标注出来_,难道不能把它放进文章里吗?答:可以,在我看来基本没问题。比如,有时我可能只是对某件事做浅层的了解,某条信息依靠 Claude 提供,然后我会写「Claude Fable 5 告诉我,情况是这样的」这类句子。8 当不值得为那一条说法花大量时间去核实时,这样做可以有用。要紧的是把输出清楚地标为 AI 所写,这样读者可以自行决定要不要给它打折。

问:那我把整篇都这么处理,不就行了?答:我认为,用 AI 来写_整篇_有实质内容的文字,几乎永远不是好主意,即使它被标为 AI 所写,至少在你打算给别人读的时候是这样。原因有两个:第一,结果很可能比你亲笔写差得多;第二,如果你标明是 AI 所写,人们(正确地)不会读。我认为,即使唯一的读者是你自己,用 AI 写东西往往也是错的,因为这么做会让你失去前面两节里说的那些好处。

问:我母语不是英语,用英语写作很吃力,我可以用 AI 来写英文吗?答:有时有人主张这是可以接受的,甚至包括不披露。基于上面提到的所有理由,我不同意。我认为,把用母语写成的文本交给 AI 翻译是可以接受的,但即便如此,我觉得还是披露更好。总体而言,我的感觉是,AI 在翻译时比在从要点笔记起稿时更能保持清晰与精确。

问:如果事关重大,比如要写与 AI 有关的政策备忘录,用 AI 加速这些必要的写作非常重要也很有价值,那又如何?答:我不认为用 AI 写作真的能让我快多少。或者说,我认为在实践中,它之所以能提速,靠的是牺牲质量,而我认为不应该在边际上牺牲质量。比如,华盛顿早已被几乎没人读的报告和议题简报淹没;真正稀缺、也真正对决策者有帮助的,是关于重要议题的更准确、更有想法的分析。

Footnotes

  1. 我认为,在某些情况下,用 AI 写主要是起协调或事务作用的短文本是可以的。比如你在公司工作,需要反复写一些很短、非常程式化的邮件,用 AI 起草、发出前稍作编辑,看起来是没问题的。

  2. 这里可能有一两个例外。比如,如果你自己对 AI 写出的文字做了极为严格的核查和大量编辑,那也许可以。但也许并不行,而且这样做看起来并不比从头自己写更省力或更快。我认为在实践中,这样写作之所以能提速,靠的还是牺牲质量。

  3. 我赞成用 AI 做头脑风暴和分析,而这两件事同样需要费力的思考,这算不算自相矛盾?我不确定,但我认为,只要你同时也让自己的看法经受用文字写下这一关的检验,用 AI 做这些事大概没问题。

  4. 他后来在一篇专门谈 AI 的文章里又重新讨论了这一论证。

  5. 这句话还有别的解读方式,不过我认为它们都不对。比如,你可以把「出口管制的效力取决于执行」理解为:如果我们能以某种方式量化一套整体出口管制制度有多好、其执行有多好,那么存在一个点,过了这个点,除非执行变好,制度本身就无法再改进。但我认为这不成立,因为多半总还有别的办法改进出口管制,比如调整出口政策。

  6. 好吧,这部分要怪我自己:2023 年 10 月我低估了未来 AI 芯片走私的规模,而那可能进了 Fable 的训练数据。我认为那份报告里有很多东西是对的,包括对 AI 芯片走私机理的描述和我的政策建议,但对问题规模的预测大概差了一个数量级。要记得,当时我们能依据的只有一篇很不起眼的路透社报道,讲的是深圳小规模的黑市活动。

  7. 比如,我有时用 Claude 总结会议记录,以便和同事分享。即使我用一个仔细写过的提示,里面包含了几条我自己写的会议要点作为示例,Claude 也能拿到完整的会议记录,它仍然会引入微妙的含糊和错误。(顺便说,这些错误里有相当一部分似乎是因为 Claude 不太明白这些要点是给谁看的、他们应该知道什么、不知道什么,尽管我试图提供这些上下文。)

  8. 作为加分项,说明是哪个具体模型产出的输出似乎也不错。

来源: Erich Grunewald's Blog← 返回首页