LLM

もっと見る LLM

ホーム

エージェントメモリAI エージェント開発ツールLLM

题图:Mnemoverse 的深色封面卡,左上角是 Mnemoverse 标志,中间标题写着 Repeating Fixed Mistakes: Who Takes an Outcome?,下面一行列出 Cognee、Letta、Mem0、Supermemory、Zep 与 Mnemoverse,左下角是 mnemoverse.com/docs

なぜAIコーディングアシスタントは同じミスを繰り返すのか:結果を受け取るのは誰なのか?

エラーを記録することとエラーから学ぶことは別物だ。6つのagent memoryシステムのうち4つは否定的な判定を含むフィードバック入力を公開しているが、Mnemoverse自身が公表した測定ではこのシグナルはほとんど呼び出されていない。

AI エージェントLLMMCPツール呼び出し

题图:一张「工具调用循环」流程图,四个方框依次是「你发出问题,连同工具定义」「模型判断需要工具并提出请求」「你的代码运行真正的函数」「把结果发回,让模型据此作答」,中间一行写着「模型是大脑,代码是手」

AIはどのようにAPIを呼び出すのか?ツール呼び出しをゼロから解説

モデルは何も自分で実行せず、構造化されたツール呼び出しリクエストを返すだけです。あなたのコードが実際の関数を実行し、その結果をモデルに返して回答させます。この記事では、この4ステップのループをゼロから分解して解説します。

AI評価LLM

题图:深蓝背景上金色与蓝色光带穿过一块带数字的浅色网格,白色大写标题「当 AI 超出我们用来衡量它的测试时会怎样」,底部署名 Hemapriya Kanagala

AIが、それを測るために使っているテストを超えてしまったら、何が起こるのか?

GPT-6 Astraの公開後、著者は「モデルがどれだけ強いか」から、より見落とされがちな問題へと目を向けた。モデルが強くなっていることを、私たちは一体どうやって知るのか。ベンチマークは飽和し、代理指標が使われ、真値の出所は複雑で、採点方法も変わる。記事はスコアを見るときに問うべき5つの問いを提示する。

AILLM執筆

一张黑白抖动噪点风格的插画:一个人伏在桌前,右侧一台笔记本电脑的屏幕发亮

実質的な中身のあるものを AI に書かせるべきではないと私がほぼ常に考える理由

AI にブログ記事、リサーチレポート、メモのような実質的な内容のテキストを書かせるのは、十分な要点と文脈を与え、後から自分で編集したとしても、ほぼ決してすべきではないと著者は主張する。書くこと自体が思考であり、AI の文章は気づきにくいところで曖昧に誤り、明示しなければ失礼かつ人を誤導するからだ。

AILLMセキュリティ

みんな正気を失っている

著者は毎日の 7 割以上を AI 対応に費やし、仕事の楽しみを失ったと書く。規制を求める一方で拡大を続ける AI 企業、脆弱性の発見に資源を投じるセキュリティ業界、「ループに入った人間」のゴム印化を批判する。

AILLM執筆

How To Write With An LLM 的题图

LLMで書く方法

LLMが記事をベルビータチーズに変えないための2つのルール:提案された言い回しは使わず、初稿への褒め言葉も信じない。

AI開発ツールフロントエンドLLM

深色底封面,写着 Let it choose, not write,右侧标注两批选择分别是成员与位置,并写明每个选项都由应用提供、模型只负责挑选

AIにUIを作らせるが、選択問題だけをやらせる

大規模モデルにUIのJSONを直接書かせると、存在しないコンポーネントをでっち上げたり、勝手に文言を作ったり、壊れたとしても結果が返ってくるまで分からない。json-renderは発想を変え、UI構築を2つの有限な選択肢に分解し、モデルは選ぶだけ、コードが組み立てる。

AILLM

深色底封面,左侧写着「An AI that returns answers, not paragraphs」,右侧是三张 mini 答题卡,分别标注 Choice 0.82、Score 3.4/5、Noul 0.93

作文を書かないAIは、採点マシンである

Jevは記事を書かず、判断だけを行う。選択問題と正誤問題のセットだと考えてほしい。あなたが出題し、Jevが解答用紙を提出して確信度を示す。この記事では、Jevに何ができるのか、なぜ安いのか、そしてその確率をなぜそのまま正答率として使えないのかを説明する。

AI コーディング開発ツール評価LLM

コーディングエージェントのハーネスを分解して検証:コンテキスト管理の価値の大半は「ウィンドウを溢れさせないこと」

176組のペア実験、4モデル、2ベンチマーク:計画は弱いモデルには精度の足場、強いモデルにはコスト削減ツール。切り詰められたコンテキストを復元可能にすることはほとんど使われていない。事前定義ツールはbashが弱いモデルにのみ明確な利益をもたらし(+15.0%)、bashが強いモデルにはbashをより安く提供するだけ。

AI開発ツール評価推論LLM

深色底上的可靠性图:一条曲线明显低于对角线,标注「置信度 0.9 以上、实际正确率 88%」

Jev はテキストを生成せず、確率だけを出力する。「ひとつの判断」を API にした製品が解こうとしている問題を、実際に試してみた

TypeSafe AI の Jev は、モデルの出力を文字列から確率付きの型付き判断に置き換え、その確率は「キャリブレーション済み」だと主張している。この前提を裏付ける証拠は誰も出していない——そこで我々は、確定した答えのある229件の主張を用意し、通常の LLM の確信度が自動化に使えるのかを測った。