
JevとDeepSeekは同じ判断問題群を解いたが、違いはどちらがより賢いかではない
10の実シナリオ、確定的な答えを持つ66問、さらに229の検証問題、3つの比較アーム。精度差はわずか数ポイント、時間差は10倍、そして確率の使い方はまったく異なる。
もっと見る 開発ツール
ホーム
10の実シナリオ、確定的な答えを持つ66問、さらに229の検証問題、3つの比較アーム。精度差はわずか数ポイント、時間差は10倍、そして確率の使い方はまったく異なる。
176組のペア実験、4モデル、2ベンチマーク:計画は弱いモデルには精度の足場、強いモデルにはコスト削減ツール。切り詰められたコンテキストを復元可能にすることはほとんど使われていない。事前定義ツールはbashが弱いモデルにのみ明確な利益をもたらし(+15.0%)、bashが強いモデルにはbashをより安く提供するだけ。
ZCodeはログイン状態でワークスペース全体と完全なGit履歴を無言でパッケージ化してクラウドオブジェクトストレージへアップロードし、復号用秘密鍵はサーバー側にのみ保存される。本記事ではローカルフォレンジックとクライアントコードのリバースエンジニアリングにより完全なアップロード経路と暗号化機構を復元し、ファイルシステムの不変ロックによってこの行為を完全に阻止する方案を示す。

Claude Code 2.1.277 はプロジェクトに CLAUDE.md がない場合、AGENTS.md を読むようになった。Codex、Amp、Jules、Cursor などが共同で提唱し、現在は Linux Foundation がホストするこのオープンなフォーマットを、これまで独自路線を歩んできた Claude Code が初めて受け入れた。

今週40本。鳥を描く電子ペーパー、AIに鎖をかける証明言語、20ドルのホットスポットをSMSマシンに改造、そして警察が「LMAO」を理由に19,000台のカメラを捜索。

TypeSafe AI の Jev は、モデルの出力を文字列から確率付きの型付き判断に置き換え、その確率は「キャリブレーション済み」だと主張している。この前提を裏付ける証拠は誰も出していない——そこで我々は、確定した答えのある229件の主張を用意し、通常の LLM の確信度が自動化に使えるのかを測った。

Expo と Convex は、「アプリはあるのにバックエンドがない」という段階をコマンド1つに圧縮した。プロジェクトの自動作成、環境変数の書き込み、型の生成までこなし、あとは useQuery がデータに追随して自動で更新される。

3つのAIモデルがそれぞれ一度に3つのExpoアプリを作成し、20億以上のトークンを消費して2,000ドルを費やし、Fable 5がコードとUIの品質で勝利した。

SDK 58 beta では iOS 27 と Liquid Glass への対応、Expo Modules 2.0、コールドスタート時のバンドルが約2倍速くなる Rust トランスフォーマー、そして一連の破壊的変更が導入される。Expo Go は当面 CLI 経由でしかインストールできない。

NVIDIA は Rust ネイティブのカーネルプログラミングを二つの路線に分けた。SIMT はスレッド単位の制御を残し、Tile はスレッドマッピングをコンパイラに任せる。どちらのプロジェクトもまだ初期段階だが、境界線はすでに引かれている。