
「Jevより1年早い」という主張は、論文と229問の結果と噛み合わない
Nandakishor Mukkunnothは2025年3月にJevの非自己回帰意思決定モデルを作り、それについて長い記事を書いたと述べている。私は彼が引用した2本の論文を読み、彼の2026年のモデルを229問の細粒度問題で走らせたが、見えたものはこの話とは少し違っていた。
もっと見る 評価
ホーム
Nandakishor Mukkunnothは2025年3月にJevの非自己回帰意思決定モデルを作り、それについて長い記事を書いたと述べている。私は彼が引用した2本の論文を読み、彼の2026年のモデルを229問の細粒度問題で走らせたが、見えたものはこの話とは少し違っていた。
著者はZstd実装の評価で26のテスト/検証プロンプト条件と4つのskillを試したが、ほぼどれも平均を上回らず、Defaultの方が平均より高かった。agentは技術を表面的に使い、無関係な性質を証明し、ランダム入力で同じエラーパスにぶつかり、同じバグを2つの「差分」実装に書き込むことさえある。

MilleMiglia は C++ のオープンなインスタンス生成器で中距離物流のベンチマーク空白を埋め、 独自データに縛られずに跨拠点のリレー輸送を最適化できるようにする。

Google Research は教師が生成 UI で任意の STEM トピックのインタラクティブシミュレーションを生成できるようにし、教師が審査した 30 以上のモジュールを公開、12 名の教師の平均評価は 10 点満点中 8 点。

Honeycomb Canvas はテレメトリ、GitHub、Linear、Slack を一つのループにつなぎ、それを使って自社の調査エージェントを開発し、ユーザーより先に問題を発見する。

IBM Researchがエージェントの「一貫性」を診断:GPT-4.1のReActエージェントはAppWorldで平均77.4%合格だが、5回すべて合格したタスクは53.0%のみで、24.4ポイントの差。彼らは1回のサンプリングで覆りやすい意思決定点を見つけ、一貫性基準を生成し、差を12.0ポイントまで削減、平均精度は落ちなかった。

社内ポリシーボットはデモでは完璧に答えたのに、本番稼働後はすでに置き換えられた旧ポリシーに基づいて自信満々に回答し、いつ劣化が始まったかを知らせるシグナルも一切ない。この記事では、そのための回帰ゲートの作り方を解説する。

674行のSQLパターンライブラリにより、Claudeは3100万行のDuckDB上で4.6万回のクエリを平均2〜3秒で返す。

GPT-6 Astraの公開後、著者は「モデルがどれだけ強いか」から、より見落とされがちな問題へと目を向けた。モデルが強くなっていることを、私たちは一体どうやって知るのか。ベンチマークは飽和し、代理指標が使われ、真値の出所は複雑で、採点方法も変わる。記事はスコアを見るときに問うべき5つの問いを提示する。
「モデル × 推論設定」19 構成の総当たり戦。Codex Astra が全勝で首位、Grok 系は 43 分でコマンド 6 バッチのみ・戦闘ユニットゼロ、Claude Fable だけが経済とテックを真面目に回した。著者の結論は、初心者レベルを超えた agent は皆無。

英語の a/an は文字ではなく音で決まる。unicorn は a、hour は an。著者は cmudict で初音と頭文字の規則を比較し、32,455 語から例外を抽出、最終的に 25 行の Python ルールに落とし込んだ。

著者は数日間 HN の上位 60 記事を追跡して逆解析した。公開式はほぼ正確だが、フロントページの 20% はペナルティを受け、タイトルに NSA があると 0.4 倍、コメントが票より多く 40 件に達すると「論争」判定で一瞬で消える。

TypeSafeはAIの意思決定をコードの制御フローに組み込み、リアルタイム適用の遅延はわずか150ms、ビッグデータ処理コストを100分の1に削減。

10の実シナリオ、確定的な答えを持つ66問、さらに229の検証問題、3つの比較アーム。精度差はわずか数ポイント、時間差は10倍、そして確率の使い方はまったく異なる。
176組のペア実験、4モデル、2ベンチマーク:計画は弱いモデルには精度の足場、強いモデルにはコスト削減ツール。切り詰められたコンテキストを復元可能にすることはほとんど使われていない。事前定義ツールはbashが弱いモデルにのみ明確な利益をもたらし(+15.0%)、bashが強いモデルにはbashをより安く提供するだけ。

TypeSafe AI の Jev は、モデルの出力を文字列から確率付きの型付き判断に置き換え、その確率は「キャリブレーション済み」だと主張している。この前提を裏付ける証拠は誰も出していない——そこで我々は、確定した答えのある229件の主張を用意し、通常の LLM の確信度が自動化に使えるのかを測った。