評価

もっと見る 評価

ホーム

AI評価LLMオープンソース

深色底封面,写着 One year early, or a different thing,右侧标注 2025.03 的论文是嵌入加 PPO、2026.09 才是大家在争的那套架构

「Jevより1年早い」という主張は、論文と229問の結果と噛み合わない

Nandakishor Mukkunnothは2025年3月にJevの非自己回帰意思決定モデルを作り、それについて長い記事を書いたと述べている。私は彼が引用した2本の論文を読み、彼の2026年のモデルを229問の細粒度問題で走らせたが、見えたものはこの話とは少し違っていた。

AI コーディング評価LLM

エージェント向けテスト・検証技術の水準は実際どうなのか?

著者はZstd実装の評価で26のテスト/検証プロンプト条件と4つのskillを試したが、ほぼどれも平均を上回らず、Defaultの方が平均より高かった。agentは技術を表面的に使い、無関係な性質を証明し、ランダム入力で同じエラーパスにぶつかり、同じバグを2つの「差分」実装に書き込むことさえある。

評価推論LLM

IBM 开源项目 ALTK-Evolve 的题图:深蓝色猫头鹰标志(两只眼睛是青色循环箭头),右侧写着 IBM · OPEN SOURCE / ALTK-Evolve / On-the-Job Learning for AI Agents,以及「智能体从自身经验中学习,无需重训、无需标注」

あなたのエージェントは今回満点で合格したが、次回もそうなるだろうか?

IBM Researchがエージェントの「一貫性」を診断:GPT-4.1のReActエージェントはAppWorldで平均77.4%合格だが、5回すべて合格したタスクは53.0%のみで、24.4ポイントの差。彼らは1回のサンプリングで覆りやすい意思決定点を見つけ、一貫性基準を生成し、差を12.0ポイントまで削減、平均精度は落ちなかった。

AI評価LLM

题图:深蓝背景上金色与蓝色光带穿过一块带数字的浅色网格,白色大写标题「当 AI 超出我们用来衡量它的测试时会怎样」,底部署名 Hemapriya Kanagala

AIが、それを測るために使っているテストを超えてしまったら、何が起こるのか?

GPT-6 Astraの公開後、著者は「モデルがどれだけ強いか」から、より見落とされがちな問題へと目を向けた。モデルが強くなっていることを、私たちは一体どうやって知るのか。ベンチマークは飽和し、代理指標が使われ、真値の出所は複雑で、採点方法も変わる。記事はスコアを見るときに問うべき5つの問いを提示する。

AI コーディング開発ツール評価LLM

コーディングエージェントのハーネスを分解して検証:コンテキスト管理の価値の大半は「ウィンドウを溢れさせないこと」

176組のペア実験、4モデル、2ベンチマーク:計画は弱いモデルには精度の足場、強いモデルにはコスト削減ツール。切り詰められたコンテキストを復元可能にすることはほとんど使われていない。事前定義ツールはbashが弱いモデルにのみ明確な利益をもたらし(+15.0%)、bashが強いモデルにはbashをより安く提供するだけ。

AI開発ツール評価推論LLM

深色底上的可靠性图:一条曲线明显低于对角线,标注「置信度 0.9 以上、实际正确率 88%」

Jev はテキストを生成せず、確率だけを出力する。「ひとつの判断」を API にした製品が解こうとしている問題を、実際に試してみた

TypeSafe AI の Jev は、モデルの出力を文字列から確率付きの型付き判断に置き換え、その確率は「キャリブレーション済み」だと主張している。この前提を裏付ける証拠は誰も出していない——そこで我々は、確定した答えのある229件の主張を用意し、通常の LLM の確信度が自動化に使えるのかを測った。