ゲームをモデル評価に使う
Google が Kaggle Game Arena を公開した。古典的なゲームで AI モデルを公開評価する取り組みで、従来のベンチマークが現代のモデルに飽和して差がつかなくなったことが背景にある。
日本語
コピー

画像提供:Annie Ruygt
最近こう書いた。未来はモデル非依存ではない——モデルの柔軟性のために設計するより、プロジェクトに合うモデルを一つ選んで、それに合わせて作るほうがいい。この考えに賛成なら、包括的なモデル評価がいかに重要になるかも認めざるを得ない。
ベンチマークは、モデルが実際の場面でどう振る舞うかをほとんど教えてくれない。ましてや長いコンテキストを扱うときや、UX を定義するあの語調や感触をモデルに期待するときはなおさらだ。どんなに優れた評価パイプラインでも、最後は主観的な並列出力の比較に行き着く。厳密とは言い難いし、何より退屈で仕方がない。
モデル評価をゲーム化できないか?もちろんできる。しかも、単に少し楽しくなるからという理由だけではない。今週 Google が後押ししてくれた。Kaggle Game Arena の発表だ——AI モデルがさまざまな古典ゲームで競い合うのを公開で見られるプラットフォームである。Google の言葉を借りれば、「現在の AI ベンチマークは現代のモデルに追いついていない……インターネットのデータで訓練されたモデルが、本当に問題を解いているのか、それとも見たことのある答えを思い出しているだけなのか、判断するのは難しい」。
モデルが読解テストで圧勝したり、数学の問題で満点を取ったりすれば、私たちは注目する。だが、仮想キャラクターと簡単な会話すらできなかったり、ゲーム環境で戦略的な判断を盛大にしくじったりすると、「うちはゲームを作っているわけじゃないし」と自分に言い聞かせて、都合よく忘れることにしている。 母に千回言ったとおり、ゲームは脳を試すのがとても得意だ。そろそろモデル評価でも本気で取り組むべきである。
ゲームは嘘をつかない
ゲームはベンチマークにないものを与えてくれる——「明確で曖昧さのない成功と失敗のシグナル」だ。動的な環境でのモデルの観察可能な振る舞いが見える。プロンプトエンジニアリングだけでそういう環境を再現するのは極めて難しい(そして極めて退屈だ)。
ゲームは、私たちが本当に気にしている能力をモデルに晒す。戦略的推論、長期的な計画、そして対戦相手や協力者と関わりながら動的に適応する力だ。
ピクセルアートと有効なモデル評価の出会い——Fly.io で動く AI Town
AI Town は a16z-infra による優れたプロジェクトで、あの頭を抱える論文「Generative Agents: Interactive Simulacra of Human Behavior」に着想を得ている。美しく描かれた小さな町があり、AI の脳と入念に設計された人格を持つ住人たちが暮らし、互いに、そして環境と関わりながら生活している。キャラクターは過去の会話を覚え、人間関係を維持し、新しい状況に動的に対応し、しかもそのすべてを人格を崩さずにやらなければならない。
これ以上に面白い対話モデルの評価方法が、他にあるだろうか。
プロジェクトを fork したので、Fly Machines 上で自分の AI Town を立ち上げるのは信じられないほど簡単になった。デプロイスクリプトがすべてを設定し、コストとパフォーマンスの最適化も組み込み済みで、おなじみの scale to zero も標準装備(つまり実際に動いている時間にだけ課金される)。チームや友人、そして母に共有するのも簡単だ。
現時点のこの fork では、OpenAI 互換のサービス、Together.ai 上のあらゆるモデル、さらにはカスタム embedding モデルのテストまで、できる限り簡単にできる。secrets に対応する API key を設定するだけでいい。
AI Town のようなゲームは、モデルがプロンプトの外でどう考え、適応し、振る舞うかを垣間見せてくれる。パフォーマンス指標を超えて、そのモデルの性格、癖、長所、短所が見えてくる。これらの要素は最終的に、あなたのプロジェクトのユーザー体験を形作る。