用游戏评测模型

Google 推出 Kaggle Game Arena,用经典游戏公开评测 AI 模型——因为传统基准已经被现代模型刷满,区分不出高低。文章说明它怎么设计、为什么选游戏。

中文
复制
插画:棋盘与游戏手柄摆在一起,旁边是评测分数

图片由 Annie Ruygt 提供

我最近提出,未来不属于模型无关——与其为模型的灵活性做工程,不如选定一个适合你项目的模型,围绕它来构建。如果你认同这一点,那就得承认,全面的模型评估变得有多重要。

基准测试几乎无法告诉我们模型在真实场景中会如何表现,尤其是在长上下文下,或者当你指望它拿捏住定义 UX 的那种语气和感觉时。即便是最好的评估流水线,最后往往也落脚于主观的并排输出对比。谈不上严谨,更重要的是,无聊得要死。

能不能把模型评估游戏化?当然可以。而且不只是因为这回终于能有点乐子。Google 这周就给我撑了腰,它宣布了 Kaggle Game Arena——一个公开平台,让我们看 AI 模型在各种经典游戏里一决高下。引用 Google 的话:“当前的 AI 基准测试已经跟不上现代模型的步伐……很难判断在互联网数据上训练的模型究竟是在真正解决问题,还是只是在回忆它们已经见过的答案。”

模型在阅读理解测试里称王称霸,或者数学题拿满分时,我们会关注。可当它们连和虚拟角色进行一段简单对话都做不到,或者在游戏环境里把一个战略决策搞得一塌糊涂时,我们就安慰自己说反正我们也不是在做游戏,然后患上战略性的短期失忆。 就像我跟我妈说过一千遍的那样,游戏非常擅长考验大脑,是时候在模型评估上认真对待这件事了。

游戏为什么不会说谎

游戏提供了基准测试给不了的东西——“一个清晰、无歧义的成败信号”。它们让我们看到模型在动态环境中的可观察行为,而这种环境,单靠 prompt engineering 去模拟会极其困难(也极其枯燥)。

游戏能逼着模型展示我们真正在意的能力:策略推理、长期规划,以及在与对手或协作者互动时的动态适应。

像素画遇上有效的模型评估——跑在 Fly.io 上的 AI Town

AI Town 是 a16z-infra 做的一个出色项目,灵感来自那篇烧脑的论文《Generative Agents: Interactive Simulacra of Human Behavior》。这是一座渲染精美的小镇,里面住着一群有 AI 大脑和精心设计人格的小人,他们过着自己的生活,彼此互动,也与环境互动。角色需要记住过去的对话、维持人际关系、对新情况做出动态反应,并且在做这一切的同时保持人设不崩。

你去找找看,还有没有比这更有意思的对话模型评估方式。

我把项目 fork 了一份,让你在 Fly Machines 上启动自己的 AI Town 变得简单到离谱。一个部署脚本就能帮你把一切配好,还内置了一些成本和性能优化,并标配我们那个顺手的 scale to zero 功能(所以只为实际运行的时间付费)。这样一来,分享给团队、朋友和你妈都很容易。

目前这个 fork 的状态是:测试任何 OpenAI 兼容的服务、Together.ai 上的任何模型,甚至自定义 embedding 模型,都尽可能简单。只要在 secrets 里设好对应的 API key 就行。

像 AI Town 这样的游戏,让我们得以窥见模型在提示词之外究竟如何思考、适应和行为。你会越过性能指标,开始理解一个模型的性格、怪癖、长处和短处;这些因素最终都会塑造你项目的用户体验。

来源: Fly.io← 返回首页