Hemapriya Kanagala

ホーム

AI評価LLM

题图:深蓝背景上金色与蓝色光带穿过一块带数字的浅色网格,白色大写标题「当 AI 超出我们用来衡量它的测试时会怎样」,底部署名 Hemapriya Kanagala

AIが、それを測るために使っているテストを超えてしまったら、何が起こるのか?

GPT-6 Astraの公開後、著者は「モデルがどれだけ強いか」から、より見落とされがちな問題へと目を向けた。モデルが強くなっていることを、私たちは一体どうやって知るのか。ベンチマークは飽和し、代理指標が使われ、真値の出所は複雑で、採点方法も変わる。記事はスコアを見るときに問うべき5つの問いを提示する。