LLM

もっと見る LLM

ホーム

AI評価LLMオープンソース

深色底封面,写着 One year early, or a different thing,右侧标注 2025.03 的论文是嵌入加 PPO、2026.09 才是大家在争的那套架构

「Jevより1年早い」という主張は、論文と229問の結果と噛み合わない

Nandakishor Mukkunnothは2025年3月にJevの非自己回帰意思決定モデルを作り、それについて長い記事を書いたと述べている。私は彼が引用した2本の論文を読み、彼の2026年のモデルを229問の細粒度問題で走らせたが、見えたものはこの話とは少し違っていた。

AI コーディング評価LLM

エージェント向けテスト・検証技術の水準は実際どうなのか?

著者はZstd実装の評価で26のテスト/検証プロンプト条件と4つのskillを試したが、ほぼどれも平均を上回らず、Defaultの方が平均より高かった。agentは技術を表面的に使い、無関係な性質を証明し、ランダム入力で同じエラーパスにぶつかり、同じバグを2つの「差分」実装に書き込むことさえある。

AILLM科学

题图:Software Crisis 的 LLMentalist 一文配图,把聊天机器人与灵媒冷读的套路并列对照

LLMentalist効果:チャットベースのLLMが霊媒詐欺の手口を再現する仕組み

作者はLLMの「知能」は統計的な錯覚であり、その仕組みは霊媒のコールドリーディング詐欺と同源だと考える。観客の自己選別、場面の前提設定、確認的な陳述による主観的検証の誘発であり、RLHFは口調でしか順位付けできないため、モデルをバーナム的陳述を生成する機械へと最適化してしまったのだ。

AI推論LLM

Qwen 模型玩 Doom 的截图:屏幕上显示游戏画面与模型在每一步选择的动作,用于说明 System One 模型能在低延迟下实时做决策

Jevが構造化出力を再び面白くする

著者は、Jevの価値は主にモデル自体ではなく推論戦略にある可能性があると考えている。返信をchoiceフィールドに事前入力し、制約されたトークンを1つだけ生成すれば、どのLLMでも「秘密のレシピ」の大部分を得られる——彼はQwen2.5-1.5Bで2〜3倍の高速化を試し出した。

AI コーディング開発ツールLLM

Mistral AI 博客题图:深色背景上的 Mistral 品牌图形,用于《Modernizing complex legacy code with AI agents》一文

AIエージェントで複雑なレガシーコードをモダナイズ

Mistralが欧州のエネルギー事業者による40,000行のFortran 77からC++への移行を支援:まず数値一致性検証台を構築し、100以上のagentでドキュメントを補完し、最終的に「人間が操作するコーディング—テスト—レビューagentワークフロー」という中間路線に落ち着かせ、完全自律ではなかった。

開発ツールフロントエンドLLM

Hugging Face 博客题图:Workflow1111 工作流画布的宣传图,标题写着 Rebuilding AUTOMATIC1111 with Gradio Workflow

Gradio Workflow で AUTOMATIC1111 を再構築する

Hugging Face は AUTOMATIC1111 のほとんどの機能を同じ Gradio ワークフローキャンバス上に再構築しました。11 本のメディアパイプライン、73 個のノードで、テキストから画像生成、高解像度修復、画像から画像生成、プロンプトマトリクス、VLM 逆推論、検出からマスクへの変換、アノテーター、PNG Info、画像から動画への変換をカバーし、各出力ノードは自動的に REST エンドポイントと MCP ツールにもなります。

推論LLMパフォーマンス

折线图:Kimi K3 在数学推理负载上,使用与不使用 DSpark 投机器时的输出吞吐与交互性对比,DSpark 曲线整体更高更靠右上

GB300 NVL72でKimi-K3最速のDSparkをどう訓練したか

vLLMがSpeculatorsトレーニングライブラリを2.8兆パラメータのKimi K3対応に拡張:4ビット量子化ターゲットモデルに5層・50億パラメータのDSparkドラフトモデルを組み合わせ、数学推論の単一ストリーム対話性が約110から約435 tok/s/userに向上、同時実行時に同じ対話性で出力スループットが最大約3.5倍、初回トークン中央値は100ミリ秒のみ増加。

フロントエンドインフラLLM

题图:一条直播流被分发成多路语言的示意图,画面与翻译后的音轨同步

1本のライブストリーム、80言語:MoQベースのリアルタイムAI翻訳

Fishjam が MoQ(Media over QUIC)でリアルタイム AI 翻訳を実現:80 以上の言語をオンデマンド生成、ある言語のトラックを購読することがそのリクエストになり、シグナリングもバックエンドも不要;遅延はクライアント側のバッファリングで再生クロックを揃えて解決し、言語を切り替えても映像には触れない。

評価推論LLM

IBM 开源项目 ALTK-Evolve 的题图:深蓝色猫头鹰标志(两只眼睛是青色循环箭头),右侧写着 IBM · OPEN SOURCE / ALTK-Evolve / On-the-Job Learning for AI Agents,以及「智能体从自身经验中学习,无需重训、无需标注」

あなたのエージェントは今回満点で合格したが、次回もそうなるだろうか?

IBM Researchがエージェントの「一貫性」を診断:GPT-4.1のReActエージェントはAppWorldで平均77.4%合格だが、5回すべて合格したタスクは53.0%のみで、24.4ポイントの差。彼らは1回のサンプリングで覆りやすい意思決定点を見つけ、一貫性基準を生成し、差を12.0ポイントまで削減、平均精度は落ちなかった。

開発ツールLLMセキュリティ

题图:彩色代码行的虚化特写,像是抓取脚本与页面选择器的片段

これまでデータを取得するにはプログラマーが必要だったが、今は一言で済む。

かつて素人スクレイパーを阻んでいた技術的障壁は、たまたま大規模言語モデルが最も得意とする種類のタスクにそれぞれ対応している。長年防御に携わってきた人物がそれらを一つずつ分解し、どの壁がどこで崩れたのか、そして防御がなぜ形骸化している可能性があるのかを説明する。

LLMプライバシーセキュリティ

题图:深绿底色卡片,标题 Hosting Untrusted, AI-Generated HTML,右上角一把挂锁,下方三枚标签 Identity、Origin、Capability

信頼できないAI生成HTMLをホストするための3つのセキュリティ境界

自己完結型のHTML成果物はモデルによって生成され、顧客データプラットフォーム上でホストされるため、プラットフォームは作者を信頼できないものと見なさなければならない。なぜなら、プロンプトインジェクションによって生成ページのスクリプトが閲覧者のブラウザで実行される可能性があるからである。

読み込み中…もっと見る