UT Austin 研究:编码智能体上下文压缩可能让运行更慢
UT Austin 对编码智能体中的上下文压缩做了一项研究,在 SWE-bench Verified 和 Terminal-Bench 上跑了近 35,000 次智能体运行,分别改变压缩方式、触发时机和压缩比例三个变量。
UT Austin 对编码智能体中的上下文压缩做了一项研究,在 SWE-bench Verified 和 Terminal-Bench 上跑了近 35,000 次智能体运行,分别改变压缩方式、触发时机和压缩比例三个变量。
斯坦福 2026 秋季新课 CME 295《Transformers & Large Language Models》已开课,由双胞胎兄弟 @afshinea 与 @shervinea 主讲,9 讲覆盖 Transformer 架构、RoPE、LoRA 微调、RLHF/GRPO 训练、Flash Attention、MCP 与 AI Agent、扩散语言模型。
Epoch AI 基于 OpenAI 2026 年 9 月发布的内部数据整理发现,OpenAI 研究人员的编码智能体使用量约每月翻倍。按 API 价格计价,中位数研究员的日均编码智能体支出从 2026 年 1 月的不足 1 美元升至 8 月中旬的 601 美元,第 90 百分位研究员同期超过 7000 美元。
Demis Hassabis 为团队用 AI 加速科学与医学、造福社会的工作影响力感到自豪。过去一周左右,Google 用 AlphaGenome Atlas 绘制了人类基因组全部 9B 种单字母遗传变化并向研究者开放,还推出迄今最准确的全球天气 AI 模型 WeatherNext 3,并发布开放获取的 AI & Economy ATLAS。
Yann LeCun 认为 AI 的进展反而让系统神经科学变得更有意思,因为当前 AI 在物理直觉、常识、世界模型、规划/推理、动机/驱动力和情感等方面都还没有特别好的解法。他表示,现在我们或许已经拥有实现并检验认知架构的工具。
LangChain 的编程智能体成本连续第二个月显著下降。Harrison Chase 给出的三步做法是:用 LangSmith 追踪全部用量实现成本可见性、通过 LLM gateway 设置用户级成本上限、并借助其开源云智能体框架 OpenSWE 做模型路由来优化 harness。第三方 harness 优化难度更大,相关长文将后续发布。
斯坦福在线课程 MS&E 319「高效生成式语言模型」开课,聚焦从预训练、架构、推理到后训练的效率设计,已公开前四节课程讲义。授课教师为 Amin Karbasi、Anay Mehrotra、Amin Saberi 和 Grigoris Velegkas 四人。
太空算力初创企业一苇宇航自2025年7月至今完成四轮融资,最近一轮为超亿元天使轮系列融资,投资方包括北京市空天基金、浩瀚深度、世纪金源等。公司成立于2025年2月,主攻高性能太空算力载荷,产品分极宇、登云、天衍和太空算力服务平台四条线,登云面向大模型推理。其第一台太空服务器由三大运营商之一购买,已拿下规模化商业订单。
Build A Reasoning Model (From Scratch) 系列第 6 讲由 Sebastian Raschka 讲解用 GRPO 做可验证奖励的强化学习(RLVR),这是该系列首次真正更新模型权重。
Replit CEO Amjad Masad 提出,通用模型可在运行中训练自己的"替代品"——更小、更专一的领域模型,类似即时编译器在动态执行时按需生成优化机器码。他认为这类专用模型更便宜、更不易受提示词注入攻击,危害也更小,因为能力更有限。Masad 称当前关于递归自我改进的讨论很多,但"模型训练自己的替代品"这一方向却少有人关注。
Replit CEO Amjad Masad 提出"模型训练自己的替代者":通用模型在执行任务时发现用例有限,可像即时编译器一样当场训练出更垂直的小模型。这类模型更便宜、更不易被提示词注入攻击,也因能力更弱而更少危害,但通用智能体本身存在缺陷与失控风险。
Cohere 推出开源机器翻译模型 North Small Translate,称其为 1T 参数以下全球最佳。该模型权重与流程均对外开放,并由 Cohere 本地化负责人 Tom Kocmi 出镜讲解。
Anthropic 强化学习方向技术负责人 Nicholas Marwell 和 Sholto Douglas 在播客访谈中表示,蒸馏无法把前沿继续向前推进,只能复制当前前沿,而真正进入下一代前沿需要巨额前期资本投入,因此他们反对模型蒸馏。
作者在 WorkBuddy 模型面板观察到匿名模型 Space-Bunny,倍率 0.03x 且限时折扣,9 月 23 日上线后登顶 OpenRouter 与 OpenCode 调用量榜首,截至 10 月 2 日仍无人认领。
CMU 秋季课程 11-768《AI Agents》第 12 讲讲义公开,主题为强化学习系统(RL Systems),由 @gneubig 主讲,聚焦如何在真实多 GPU 集群上跑通 LLM Agent 的 RL 训练。
亚马逊与杜克大学研究发现,大模型后训练中每条 rollout 只保留一个 token 的梯度信号(占比约0.025%),学生模型推理能力反而显著提升。基于 Qwen3 的9组教师—学生配置及代码推理、Llama 系列、PPO-based RLVR 验证中均复现该现象,仅监督一到两个分歧最大的 token 即可匹配甚至超过全信号训练。极稀疏监督仅更新约10%网络参数,其机制仍待解释。
Supabase 完成 1.5 亿美元融资,估值达 106.5 亿美元,Y Combinator 发推祝贺。目前有超过 1300 万开发者将 Supabase 用作应用后端,每月新增超 100 万用户和 400 万个数据库。新建数据库中 70% 由智能体或 AI 驱动工具创建。
Stanford AI Lab 与 Joachim Baumann 发布 SWE-chat v2,包含来自真实开发者的 23 万条 prompt、覆盖 1.8 万次会话,已上线 HuggingFace。该数据集记录人类与 AI 编程智能体的真实交互,v2 在上一版基础上规模进一步扩大,团队将在 COLM 会议上介绍相关工作。
Stanford AI Lab 分享了一场关于语言模型 tokenization 的演讲,题为《Tokenizer 迷思与如何破除它们》,相关预印本即将发布。演讲由 Rylan Schaeffer 主讲,聚焦 tokenization 中一些有趣且可能出人意料的特性,并公开征集反馈。
BEA 发布的新版各州 Q2 GDP 数据全部放在一张无文本层的图表中,LlamaParse 的 agentic parsing 层级默认可理解这类文档并忠实记录数据,把该页面还原成一张 52 行表格。
微调 NVIDIA Nemotron 3.5 ASR 后,沙特 Najdi 和 Hijazi 方言的词错误率从 55% 降至 30%——支持阿拉伯语不等于能听懂当地方言。NVIDIA 发布新教程,讲解如何将该模型适配到其他方言和语言。
Wells Fargo 的 Freddy Lecue 将在 AI Engineer New York 分享面向数十亿笔银行交易训练欺诈检测基础模型的工程经验。该分享定于 10 月 12–14 日在纽约举行。
一篇博客详解前沿文生图模型的后训练流程,涵盖 rubric 奖励的构建方式与完整离线评测方案。文章还给出可视化前后对比,展示作者发现并捕获的奖励攻击(reward hacking)失效模式。
LMArena 研究指出人类偏好奖励对后训练图像模型必要但不充分,模型仍会奖励好看却丢细节或引入无关内容的输出,因此提出复合奖励:约 560 万对人工投票训练的 Bradley-Terry 奖励模型、由视觉语言模型评估自动生成提示词清单的忠实度奖励、约束奖励与反奖励黑客评分奖励。
a16z发布90页报告《STATE OF MARKETS》,测算Alphabet、亚马逊、Meta、微软和甲骨文五家科技巨头合计资本开支将从2024年的2410亿美元增至2025年的4160亿美元,2026年接近7770亿美元,2027年起预计每年超一万亿美元。
前微软合伙人 Ramez Naam 发表长文质疑递归自我改进(RSI)引发智能爆炸的判断,认为当前回路强度仅为起飞门槛的 10% 到 20%,需再增强 5 到 10 倍。
CoreWeave 新服务借助 NVIDIA Dynamo 中的 ModelExpress 和 Router,将 RL 后训练中的模型权重重载速度提升至基线的 15 倍,并把停机时间降到最低。该结果在 CoreWeave 与 NVIDIA、You.com 合作后训练 Nemotron 3.5 Lightning 时取得。
Elastic 委托 Forrester Consulting 开展 Total Economic Impact 研究,基于金融科技、电信等五个行业企业访谈构建了一个营收 $10 billion、服务 25 million 客户的复合企业模型。
Epoch AI 测算,2025–27 年出货的 HBM 硬件最多可支撑约 3000 万至 1.7 亿个并发前沿模型智能体,按每周 168 小时不间断运行折算,相当于约 1.4 亿至 7.2 亿名全职员工的工作时长。
AI基础设施投资升温推高英伟达、博通、AMD股价,员工手中未归属RSU价值暴涨,Levels.fyi称之为“硅手铐”。一名博通员工称自己的RSU价值已超600万美元,英伟达员工2023年获得的48.8万美元股权包如今价值超220万美元,博通员工6.6万美元RSU涨至约26.5万美元。英伟达离职率从2023年的5.3%降至2025年的2.5%,博通去年全球自愿离职率为6.2%。
Fireworks AI 指出,rollout 贡献了 RL 训练的大部分算力开销,但把 rollout 与训练拆分到不同引擎会带来数值不一致,在 MoE 模型中甚至可能把 token 路由到不同的专家。Fireworks 表示其两套引擎为协同构建,因此训练既快又保持一致。
Halluminate 正在构建强化学习环境与基准,让 AI 模型掌握编程之外的知识工作,首个落地领域为金融。团队不足 10 人,已与 5 家美国头部闭源 AI 实验室中的 4 家合作,并完成 3000 万美元 A 轮融资。其路径从浏览器智能体测试延伸到金融建模等训练环境,并强调更好的验证机制比更多训练任务更关键,未来目标是构建 AI 智能体团队协作的模拟公司。
LangChain 上周推出 LangSmith Fine-Tuning 和 smithtune CLI,可将智能体自身的轨迹转化为微调模型,无需手工搭建训练流程。官方称,已有的 trace 记录了智能体的良好表现,这些信号现在可以直接作为训练数据使用。推文附有 @jakebroekhuizen 的简短演示。
Stack Overflow 回顾历年开发者调查数据,AI 工具使用率从 2023 年的 44% 升至 2024 年 62%、2025 年 79%,近半数受访者每天使用。
Google DeepMind 提出给合成蛋白加上类似数字身份证的水印,帮助 DNA 实验室核验合成蛋白来源并保持序列数据库准确。随着相关请求规模不断扩大,验证设计是否来自带内置防护的 AI,将帮助实验室实现自动化并强化生物安全。
Google DeepMind 发布 SynthID Bio 水印方法系列,专为 AI 生成的生物设计打造。该技术首次实现直接将不可感知的签名嵌入蛋白质序列,且不影响其生物功能。
NVIDIA 对 Nemotron 进行微调,以提升其对沙特阿拉伯语方言的自动语音识别能力,并探索出一条可迁移至其他语言的路径。多语言模型即便在通用基准上表现良好,面对区域方言和本地录音条件时仍可能不达标,而沙特阿拉伯语正是这一问题的典型例子。
Fulcrum 团队的 Echo 模型最终训练全部通过 Fireworks 的无服务器训练 API 完成,使用 Kimi K3 的 LoRA(rank 32)。其公开的技术说明涵盖"persona post-training"方法,并将总训练成本控制在 $4.5k。
Google 发布 Gemini 4 Argon,目前仅通过 Fairwind 计划对少量网络安全合作伙伴开放,后续先向付费 API 用户和 Google AI Ultra 订阅者开放。
Modal 在首届 Runtime 大会宣布 VM Sandboxes,为 AI 智能体提供完整 Linux 计算机,已在 Linear、Legora、Snorkel 用于编码智能体与评测,并同步推出同主机隔离的 Sandbox Sidecars。