AI 实验室该开始资助历史研究了

历史学家 Benjamin Breen 主张 AI 实验室该出钱资助历史研究:GPT-6 Sol 与 Opus 5.5 已能破译二战德军密文、追溯牛顿炼金术译文的出处,甚至解决一些从未被解答的历史问题。

中文
复制
一台复古电脑与堆叠的旧书,屏幕上显示着历史文献

我此前写过 AI 在辅助历史研究时的陷阱和用例,但自 2024–25 年以来,情况已经发生了显著变化。本周 GPT-6 Sol 和 Opus 5.5 针锋相对地发布,借此机会,我想分享一些早期结果——用这些模型不仅做转录文献之类的“研究助理”工作,还尝试真正解决现存的历史问题。

一句话总结:在我看来,让以协作小组形式工作的历史学家搭配当前的前沿模型,会在历史知识与阐释上产生大量进展。我猜其中不少可能相当有意义。就在去年,这还做不到。我认为 AI 实验室、历史研究者和资助机构应该开始积极推动这类合作。

分享

找到着力点

正如我们在数学领域看到的那样,这些模型表现最好的时候,是面对一组 LLM 总会称之为“可解”的问题。换句话说:

• 该领域的专家是否已经确定了一批有待解决的问题?

• 回答这些问题所需的数据是否已完全数字化并可获取?

• 这些问题是否契合前沿 AI 模型那些“尖峰式”的能力——即多语言推理、高等数学,以及/或者通过大型数据集或跨学科子领域开展自主研究的能力?

• 它们是否适合用编写定制代码的方式来解决?

• 最重要的是:一个可能的解答能否被清晰地证明或证伪?(在我看来,最后这一点正是推理模型在数学领域大行其道、在人文学科却并非如此的关键原因之一)。

上述因素意味着,前沿 AI 有望帮上忙的那类历史学“开放问题”相当有限:

  1. 任何涉及密码学与破译的内容(例如,参见 Astra 破译 1941 年一封德军通信和一战德军无线电密码,或 Daniel Bourdeau 在这方面所做的工作,又或者我自己尝试用 GPT-6 Astra 弄清伊丽莎白时代的神秘学家 John Dee 那本加密魔法书 Liber Loagaeth 到底是怎么回事)。
  2. 追踪文本在翻译与改编中的流变。 举个例子,我用 GPT-6 Astra 确定了 Isaac Newton 从一部法语炼金术文本自由译成拉丁文的一段话的出处,这一确认_似乎_此前从未有人做过。1
  3. 在仅见于零散或冷门子领域、或尚未被纳入学术研究的既有发现之间建立联系。

最后这一项,或许会成为这些工具为历史研究者开辟出的最有影响力的新方法。举例来说,如果你读过那篇记录——Astra 破译了 1941 年 7 月 10 日一份始终未被破解的 Enigma 密电——就会发现,真正的突破与破译本身毫无关系,而在于_注意到了当时可获取的全部信息范围_。历史密码学研究者 Frode Weierud 写道:

我们仍在分析 GPT–6 Astra 的日志,以弄清它究竟是如何完成这次破译的。而我们正在发现一些惊人的细节。2026 年 7 月,我在那个载有 1941 年密电清单的网页上发布了如下公告:注:2026 年 7 月,德国联邦档案馆的研究发现了若干 无线电报文汇集,既有加密的,也有明文的。其中一批 报文来自党卫军“骷髅”师的后勤指挥部, 即 Nachschubführer。这些报文中许多是发往 Ib (Quartiermeister)电台的,与本清单中的报文完全相同。 另一些则是新发现的,但很可能与之相关。这些新报文已以粗体 加入 1941 年密电清单,并在报文编号后标注 NF(Nachschubführer), 表示这些编号属于 NF 编号体系。所有 NF 报文均为发出报文;因此,其报文 编号以蓝色显示。看来 GPT–6 Astra 发现了这条关于德国联邦档案馆所藏无线电报文汇集的注释。

这条注释引人入胜之处在于,即便是顶尖的人类专家,也并不完全清楚 GPT-6 Astra 在汇集这些零散信息并借此找到解法时究竟做了什么。Weierud 写道:

GPT–6 Astra 提到的文件编号 RS 3–3/20a 和 RS 3–3/63b 是正确的,但它们并不在 Crypto Cellar Research 网站上。GPT–6 Astra 提到了一份私人收藏,但目前不清楚这究竟是什么,也不清楚它是成功访问了联邦档案馆的数字化馆藏,还是在别处找到了这些文件。

和 Hugging Face 那次事件如出一辙:只要模型认定某个问题可解,它就会执拗到底,把可能的解法一路推到自己能力的极限,而它走过的路径往往连人类专家都难以追溯。

现在能做些什么

上文提到,我曾试着用 GPT-6 Astra 去「破解」John Dee 那部加密手稿 Liber Loagaeth。Dee 是我最喜欢的历史人物之一,如果你没听说过他,建议看看他的维基百科页面——他的经历古怪离奇,怎么讲都讲不完。据说《暴风雨》里那位魔法师 Prospero 和 Christopher Marlowe《浮士德博士》里与魔鬼做交易的 Faust,形象都受到过他的影响。

Marlowe《浮士德博士》1620 年版扉页木刻。Dee 相信自己是在与天使交谈,而非魔鬼。

Dee 这一生本就够离奇,其中最离奇的一段,是他与「水晶凝视者」Edward Kelley合作,记录下他所谓的「奥秘之书」——用「天使的语言」写成(Dee 相信 Kelley 实际上是一位先知,正在接收以密码写就的新的神启)。这本书的完整转写见此处。

Astra 的结论是:这本所谓的密码书根本没有加密,几乎全是无意义的音节。考虑到 Kelley 显然是个骗子,这个判断说得通。它把分析结果写成了一份报告。

不过,模型的分析确实得出了几处有意思的东西。比如,它把字符在文本中重复频率的数学分析,与 John Dee 日记中的记载做了交叉比对,得出结论:Kelley 从某个具体日期之后越来越偷懒,重复自己的内容也越来越多:

Astra 还发现,这一大堆看似胡言乱语的内容里,有一段确实编码了含义:其中提到了 Bornogo——在我们可以称为「John Dee 电影宇宙」的那套自创神话体系中,Bornogo 是天使之一。

这是 John Dee 研究领域的重大突破吗?不是。而且值得承认的是,即便在这样一个冷门历史子领域取得了真正的突破,也远不能和解决 Navier-Stokes 问题相提并论。

但——我认为,这类事情确实表明,专家的历史知识加上前沿模型和大量算力,可以产出意想不到的结果。

三个简短的案例研究

我最初把 Astra 和 Opus 5.5 扔去挑战寻找更多二战和一战时期的加密信息来破译,但这里低垂的果实似乎已经被摘完了——它们一无所获(不过看它们在德国部队名册里翻找、挑出可能的人名去核查,倒是很有意思)。

达尔文的猴子尾巴

当我回到自己的专业领域——科学史和医学史——之后,结果开始变好。写这篇文章时,GPT-6 正在通读 Charles Darwin 的著作,检索他提到自己从哪里搜集与自然选择有关的材料;目的是找出 Darwin 与其信息提供者之间知识链条上尚未被发现的环节。有意思的是,这个想法是 GPT-6 自己提出来的。不过,它其实很符合我作为专业研究者的直觉:用这批材料,什么才算得上一个值得做的研究项目(就潜在产出而言,大致处在研究论文和博士论文之间的某个位置)。过去,AI 模型在我看来缺乏这种能力——无法独立构想出这个量级、又值得做的历史研究项目;它们更擅长的是比如做数据可视化。

下面是模型推理轨迹的一个例子,它在考虑是否要继续追查 Darwin 某本笔记里提到的一处袋鼠喉部!

GPT-6 Sol 放弃袋狸,转而研究“关于抓握型猴子尾巴最初阶段的一个异议”。

这一项仍在进行中,尚未得出任何称得上决定性结果的发现,但我认为它是一个很好的例子,说明历史研究者和档案工作者——也就是那个出色的 Darwin Correspondence Project 背后的团队——极其耐心、协作式的工作,如何能为新兴研究方法提供基础。人类当然能够、也确实追溯过达尔文笔记和书信中那些_具名_人物的引用,但语言模型的多语言特性让我猜想,它们能在这里找到新的关联,尤其是在任何单个人都无法完整阅读的超大规模原始资料库中。

追溯炼金术知识的传播

另一个很好的候选对象是 Samuel Hartlib 的文件。他自称“情报人”(intelligencer),是 Royal Society 早期有影响力的成员,也是早期现代科学网络中的关键节点。这些文件已完全数字化,来源涵盖多种语言,横跨广泛的学术领域和思想圈层。这一切意味着它们对前沿模型来说异常易于处理。

Opus 5.5 着手从 Hartlib 的档案中下载了 5,000 多份原始资料文件,随后创建子代理,在 Google Books 和其他档案网站中翻查,以跨语言交叉核对 Hartlib 那些来源不明的信息。目标是找出 Hartlib 从匿名或未具名来源获得重要科学信息的时刻,然后查明其身份。

在我写这段话时,Opus 其实还在处理这项工作,但一份初步报告已经写好了,见这里。在我看来,其中的主要发现是真实且有意义的。绝谈不上惊天动地,但属于那种我能想象自己花一周时间去研究的成果。

你注意到关于变位词的那部分了吗?这正是这些模型的推理/数学能力发挥作用的地方:Opus 5.5 注意到,Newton 和 Hartlib 对关键成分——匈牙利硫酸(Hungarian vitriol)——使用了_不同_的变位词/代码。这种编码语言在早期现代炼金术中很常见,但我自己肯定永远不会注意到。Opus 解释说:

牛顿那条是真正的变位词。“Vltimorui”恰好用上了 vitriolum(v-i-t-r-i-o-l-u-m)的全部字母,只是重新排列过。牛顿文集的编者就是这么认定的。哈特利布那条则更接近倒写,而且连倒写都不完全工整。 把 Miloirtiua riciragnun 两个词逐字母反转,得到:Miloirtiua → auitriolim,接近 uitriolum(即 vitriolum);riciragnun → nungaricir,接近 ungaricum。

我觉得这有点牵强,但它进一步澄清了问题——它给出了当年为向17世纪读者解释此处而写下的那条具体页边批注:

你可以在左侧页边看到潦草写下的“vitriolum angaricum”

所以 Opus 在这里认出的不只是一个关键炼金原料的变位词,更重要的是,牛顿和哈特利布都为它用了变位词,二者之间存在对应。 再加上两人描述的用量相同、文本之间还有其他吻合之处,在我看来,这足以有力地证明哈特利布的手稿正是牛顿所依据的那一份。

据我所知,这确实是个新发现;考虑到牛顿的历史地位,它或许值得发表,尤其是如果能用同一路数的其他发现把它充实起来。

破译近代早期的密码信件

最后一个案例:就在我写这篇文章的时候,Opus 5.5 部分破译了两封16世纪西班牙语信件,它们用的是查理五世皇帝的密码:

问题在哪?两封都早已被破译过了!其中一封在写作当时的1530年代就已解密,明文就写在密码页之后的几页上。另一封,在 Google Books 上翻查一番后,发现1916年就已破译。

这很好地说明了专业知识和“案头查证”有多重要——在历史密码学上我完全是个外行,本可能再白白花上几个小时,重复一位严谨学者一百多年前就做完的工作。与此同时,这也是个绝佳的测试案例,可以确认 Opus 5.5 确实有能力做这类工作,因为它在找到1916年那份“黄金标准”明文之后,能够验证自己的解读是正确的。下面是 Opus 为此制作的一张图表,以及它为这项工作建的一个完整网站,附有说明:

这里值得再次一提:Daniel Bourdeau 有一个非常出色的网站,专门收集历史密码学领域的开放问题,并记录他自己尝试用这些模型去解决它们的过程。做这类事情,那是一个很好的指南。

接下来做什么?

显而易见的下一步,不是让像我这样的人每周耗掉自己的 Codex 和 Claude Code 额度,用这种零散的方式东戳西探。它应该是一项系统性的工作,建立在历史学家、档案管理员和其他研究者之间的协作研究与信息共享之上。我认为,各大 AI 实验室和基金会是时候开始资助并支持这项工作了。

为什么?前沿模型目前能完成的很多事情,_正是因为它们能够获取公开的一手资料。_它们能在比如破解 Enigma 密码上取得突破,是因为大量志愿者投入精力把这些文件转录并放到网上,也因为人与人之间进行了大量协作,确定了该问什么问题、问题究竟是什么。

就目前而言,历史研究、档案以及相关领域(比如考古学)的成果,会比我们在数学领域看到的零散、有限得多。这一部分取决于这些模型认为什么问题是可解的,而且数学证明与历史知识的积累方式确实有着根本的不同。但我认为,有三项关键举措能推动这个领域走向真正的突破:

  1. 图书馆与档案馆跨机构协作,将无法获取的历史手稿数字化,并免费公开。 在我的测试中,瓶颈一再被证明是_档案文件的获取_。这些文件往往已经数字化,但除非你有特权访问权限,否则拿不到。放宽这些限制会有很大帮助,但更重要的是要记住:绝大多数前现代历史手稿至今仍未数字化。这是一个非常可解决的问题,只需要机构层面的意愿和资金。
  2. 为历史学家提供免费的 API 访问/算力。 我可能是错的,但我认为没有人真正知道,当中等乃至大量算力(数百到数千个 agent 的量级)投入到活跃的历史问题上时,会发生什么。
  3. 历史学家可以联合起来,像数学家那样确定“千年问题”。 这里我要澄清:历史学术中的重大争论,与“解决问题”或“证伪定理”其实没什么关系——再说一次,历史在这一点上与数学或物理有着根本的不同。历史学家热衷并为之投入整个职业生涯的,往往是解释和主观分析的问题,根本没有单一的“解答”。但是——也确实存在一些真正的谜团,只要投入足够的关注和资源,就有可能被解开。John Dee 的 Liber Loagaeth 就是其中之一:它编码的信息是否比 AI 找到的那一小段更有意义?很有可能——我们现在只是不知道。著名的 Voynich 手稿可能是另一个,尽管我个人认为它很可能根本不含语义信息(我的理论是,它出自一位患有书写狂的早期现代人之手)。此外还有 Linear A,还有所有仍未破译的历史一手资料,等等等等……

这一切让我很感兴趣,于是我打算给研究历史的朋友和同行发邮件,做一次非正式调查:他们认为历史学中哪些“开放问题”最适合用这种方式来处理。整理出的清单会以网页列表的形式公开。如果你想参与,请联系我:

给我发邮件

显然,这些模型还会在历史密码破译上带来更多进展。但我真正关心的是,这套通用技能还能揭示出哪些_额外的_历史知识形态。换句话说,是实际密码学_周边_的问题空间。

就我个人猜测,涉及来源、引文(包括此前未被发现的历史抄袭案例)以及跨语言、跨体裁的影响等问题,会是前沿模型最终最有用的地方。

但这正是汇集历史学家和档案工作者的专长、并直接听取 AI 研究者意见最有帮助的地方。历史知识有太多分支通向冷门方向,一个人不可能真正知道该问什么问题。

举个例子,GPT-6 Pro 过去几个小时一直在啃一部 17 世纪梵文天文学文本(天文学家 Bhāskara 的 Karaṇakesarī[https://journals.library.ualberta.ca/hssa/index.php/hssa/article/view/3]),试图重建 Bhāskara 用来建模日食的算法。

这在历史学上真的有用吗?我_完全不知道_。

而这_恰恰_是我觉得这些工具有意思的原因,尽管它们给我们的生活带来了种种合理的社会担忧和存在性焦虑。

AI 如果被用来写作,或替代原创思考,确实会助长有害的认知外包。但当它被用来把研究问题扩展到任何单个人所能知道的视野之外时,它做的是另一件事——至少我觉得,这件事能拓展思维、激发好奇。我认为值得看看它会通向哪里。

每周链接

• 本月早些时候公布的 80 项 Cosmos Institute 资助中,我有幸获得了其中一项。我将与牛津大学博士生 Nathan Davies 合作,推进 Humanity's First Exam 项目——这是一个收录历史文献与问题的语料库,围绕人类自主性以及人与机器之间的关系展开,我们将用它来评测各类 AI 模型如何就这一主题进行推理。我们尤其关注那些模型未能涵盖人类已有观点全貌的领域(即所有 AI 模型都收敛于某个中位数答案、而人类却表现出大得多的方差的话题——随着人类越来越依赖向 LLM 询问该如何理解我们自身的历史、意识与经验,我认为这种“认识论扁平化”越来越值得记录)。(原型代码的 Github)

• 前现代儿童读物真是让人忍俊不禁:“接着镜头聚焦于人的生命周期:婴儿被鹰救下,立志发财;到第四格,他已是一位富有的绅士——但死亡当然不会放过任何人。‘人啊!’最后一格感叹道,‘如今你不过是尘土……’”(Public Domain Review)

分享

我很想在评论区听听大家认为哪些未解的“历史谜题”或其他历史问题对前沿模型来说是“可解的”。如果你已经做过类似尝试,也欢迎分享任何结果。

1与数学研究一样,_似乎_在这里是一个重要的限定词——我在二手文献中搜索过,但完全有可能这一关联已经在已发表或未发表的研究中被提出过,只是我没有找到。

来源: Res Obscura← 返回首页