
像物理学家一样剪枝 LLM:把块删除当成 Ising 优化问题
整块删掉 transformer block 最省事,挑哪些块却是多体问题。Multiverse Computing 把它写成二元优化,用 Ising 的低能态对应高分模型,Llama-3.3-70B 砍半深度仍保住 MMLU 76.9。
更多 大模型
首页
整块删掉 transformer block 最省事,挑哪些块却是多体问题。Multiverse Computing 把它写成二元优化,用 Ising 的低能态对应高分模型,Llama-3.3-70B 砍半深度仍保住 MMLU 76.9。

Nandakishor Mukkunnoth 说他在 2025 年 3 月就做出了 Jev 那套非自回归决策模型,为此写了一篇很长的 文章。我读了他引的两篇论文,也把他 2026 年的模型拿 229 道细粒度题跑了一遍,看到的和这个故事不太一样。
作者在 Zstd 实现评测上测了 26 个测试/验证提示条件加 4 个 skill:几乎没有一个超额表现,Default 反而高于平均。agent 会把技术用成表面功夫,证明无关性质、拿随机输入撞同一批错误路径,甚至把同一处 bug 写进两份「差分」实现。

Gemini 3.8 Live 与 Extended Thinking 发布,语音交互支持复杂推理、实时视觉与后台任务而不打断对话。

Novita AI 开源了 Chord,一套 W4A16 MoE CUDA 内核。与公开的 Humming 相比,逐层实测在 H200 上延迟最多降低 1.33 倍,在未调优的 B300 上最多降低 2.15 倍。

作者认为 LLM 的「智能」是一种统计学错觉,机制与灵媒的冷读骗局同源:观众自我筛选、场景预设、用确认式陈述引发主观验证,而 RLHF 因为只能按语气排序,等于把模型优化成了生成巴纳姆式陈述的机器。

Mistral已完成30亿欧元D轮融资,由三星电子领投,投后估值超过210亿欧元。这是欧洲科技公司有史以来规模最大的股权融资。

作者认为 Jev 的价值可能主要在推理策略而非模型本身:把回复预填成 choice 字段、再只生成一个受约束的 token,任何 LLM 都能拿到大部分「秘密配方」——他用 Qwen2.5-1.5B 试出了 2 到 3 倍加速。

Google Research 提出 Retrieve-for-Train,用强化学习训练轻量级扩散模型,绕过推理期思考预算,单次前向即可生成连贯的 fan-out 搜索结果。

Google Research 让教师用生成式 UI 为任意 STEM 主题生成互动模拟,已发布 30 多个经教师审核的模块,12 名教师的平均评分是 8 分(满分 10 分)。

AsyncGRPOTrainer 只训练并同步 rank-1 LoRA adapter,跨 HF Jobs 走 Storage Bucket 而不是 NCCL,500 步训练从 3 小时 27 分压到 53 分。

作者把 Qwen3-8B 接成 System One 分类器后试出两招:分层目标(每十秒定战略、每五秒定战术、每 200 毫秒执行)与锦标赛采样(一次喂一百个链接分两轮选),后者在 Wikiracing 里找到了理想的三链接路径。

Mistral 帮一家欧洲能源运营商把 40,000 行 Fortran 77 迁移到 C++:先建数值一致性校验台,再用一百多个 agent 补文档,最后落定「人操作编码—测试—评审 agent 工作流」的中间路线,而不是完全自主。

Hugging Face 把 AUTOMATIC1111 的大部分功能重建成了同一张 Gradio 工作流画布:11 条媒体流水线、73 个节点,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测转遮罩、标注器、PNG Info 与图转视频;每个输出节点还自动变成 REST 端点与 MCP 工具。

ChatGPT Admin Console 的 Analytics 将 Work 和 Codex 的使用量、成本与任务洞察汇总,帮管理员看清 AI 究竟用在哪。

vLLM 把 Speculators 训练库扩展到支持 2.8 万亿参数的 Kimi K3:用 4 位量化的目标模型配一个五层、50 亿参数的 DSpark 草稿模型,数学推理单流交互性从约 110 提到约 435 tok/s/user,并发下相同交互性时输出吞吐最高约 3.5 倍,首 token 中位数只涨 100 毫秒。

ChatGPT 广告测试 Sponsored Agents,用户可点击广告与商家赞助的 agent 对话,并新增 HubSpot 与 Shopify 集成。

OpenAI 推出 Astra for Law,GPT‑6 Astra 在 Vals AI 法律检索基准上通过率 54.0%,较网页搜索版提升 40%。

Fishjam 用 MoQ(Media over QUIC)做实时 AI 翻译:80 多种语言按需生成,订阅某个语言的轨道就等于发起那次请求,没有信令也没有后端;延迟靠客户端缓冲对齐播放时钟解决,切换语言不碰视频。

IBM Research 给智能体的「一致性」做诊断:GPT-4.1 的 ReAct 智能体在 AppWorld 上平均 77.4% 通过,但五次全过的任务只有 53.0%,差 24.4 个百分点。他们用一次采样找出容易翻盘的决策点、生成一致性准则,把差距砍到 12.0 个点,平均准确率不降。

内部政策机器人演示时答得滴水不漏,上线后却依据已被取代的旧政策给出自信答案,而且没有任何信号能告诉你退化始于何时;这篇文章讲的是怎么为它建一道回归门禁。

过去挡住业余抓取者的那几道技术门槛,恰好都对应着大语言模型最擅长的一类任务;一位长期做防御的人把它们逐个拆开,说明哪一道倒在哪里,以及防御为什么可能已经沦为摆设。

自包含的 HTML 交付物由模型生成并托管在客户数据平台上,平台必须假定作者不可信,因为提示词注入能让生成页面的脚本在查看者浏览器里执行。

674 行 SQL 模式库让 Claude 在 3100 万行 DuckDB 上的 4.6 万次查询平均 2-3 秒返回结果。