微软亚洲研究院开源 Agent Lightning v1.0:约 3500 行的智能体 RL 框架
微软亚洲研究院开源 Agent Lightning v1.0,一个约 3500 行的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一套 agent harness 直接参与训练,只需把模型端点指向其 LLM 代理即可接入。
微软亚洲研究院开源 Agent Lightning v1.0,一个约 3500 行的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一套 agent harness 直接参与训练,只需把模型端点指向其 LLM 代理即可接入。
文章系统梳理了 LLM RL 中训推不一致(TIM)的根源,从 IS、TIS、IcePop 等截断重要性采样方法讲到 SC(score centering)算法。
扎克伯格的 Biohub 宣布与美国能源部(DOE)和美国国立卫生研究院(NIH)合作,投入 18 亿美元建设生物数据集,供研究人员用 AI 模型寻找预防和治疗疾病的新方法。
Datawhale 十月组队学习开放报名,共 11 门课程,首次开设围绕 JEV Cookbook 的共学课程,讲解 Choice / Score / Noul 三种核心问题原语。课程覆盖 LLM 专题、Agent 专题、具身智能专题和 AI Infra 专题,其中 LLM 算法与系统教程按推理优化、性能优化、后训练优化三个方向分设。各学习时间重叠,每人限报 1 门,报名后需本周内扫码进群。
前亚马逊 Rufus 项目创始成员判断,5年后手机上的购物 App 会消失,入口交给能自己完成搜索、比较、下单的购物 Agent。亚马逊 Rufus 2023 年启动时仅七八人、约两个月做出演示版本,团队后扩至数百人;其公式为 Agent = 强模型 + 上下文 + 多步执行。
Moët Hennessy 正将 AI 用于解决酿酒过程中一个长期存在的顽固问题。另据消息,新兴云厂商 Lambda 正在融资 40 亿美元。
2026年诺贝尔化学奖授予 Henri Kagan 和 Kenso Soai,表彰他们在不对称有机合成中发现非线性效应与自催化作用。Kagan 证明异手性催化剂配对会失活、实现手性放大,Soai 则发现 Soai 反应:起点仅 0.00005% 的手性偏差经三轮自催化放大至 99.5% 以上。
继无人机、路由器和逆变器、机器人之后,FCC 正考虑把光收发器纳入限制清单,路透社报道的禁令草案一度令中际旭创股价跌 10%、Coherent 涨 17%。FCC 的网络安全逻辑成立,但其8月14日生效的组件规则只覆盖 Covered List 企业,并不包含最大中国光模块厂商。中国厂商主导模块与激光器环节,中段仍依赖西方供应商,而底层材料美国短期内难以摆脱依赖。
Mistral 4 仅用 3,800 块 Grace Blackwell 就达到 GPT-6 Astra 72% 的智能水平,后者使用超过 100,000 块 Grace Blackwell。按"每 GPU 智能"计算,Grok 4.7 约用 200,000 块 GPU,Claude Opus 5.5 约用 500,000 块 Trainium2,凸显 Mistral AI 团队的效率优势。
Mistral 发布旗舰模型 Mistral Large 4 公开预览版,采用 MoE 架构、总参数 1 万亿、每次推理激活 490 亿参数,支持 100 万 Token 上下文窗口,权重计划 10 月 27 日开放。派拉蒙天空之舞以约 1100 亿美元完成对华纳兄弟探索的收购,合并后更名 Skydance。月之暗面完成最后一轮私募融资,估值约 500 亿美元,拟明年第一季度在香港 IPO。
培生已同意收购 AI 原生技能平台 Workera,交易金额未披露,预计 2026 年下半年完成交割。Workera 结合代理式 AI、心理测量学和自适应评估衡量员工技能,已验证超 1 亿项技能,收入接近 100% 同比增长,客户包括 ServiceNow、埃森哲和美国太空军。交易完成后 Workera 将并入培生企业学习与技能部门,其 CEO Kian Katanforoosh 加入培生。
OpenAI 从一个未发布内部前沿模型公开了 722 篇数学手稿,归入 372 个结果族,来自约 4000 个研究问题的评测,平均每个结果约消耗 3 小时 ChatGPT Pro 推理算力,同时发布论文、证明工件与部分推理摘要,模型本身仍未公开。
汇总了 OpenAI 内部数学模型的稿件规模与算力投入,以及 Mistral、Google 等多个同期发布的对照信息。
OpenAI 将内部前沿模型产出的数学成果放到 GitHub 仓库 openai/math,共 722 篇论文、归为 372 个族,涉及约 4000 道问题,平均每个结果消耗约 3 小时 ChatGPT Pro 的思考算力。
至简动力强化学习负责人冯宗宝在 IROS 2026 介绍,其团队让机器人单机自主值守两台 CNC 机床,在工件与卡盘间隙仅 0.5 毫米的条件下完成抓取、上料、插入、取件与放置,精密插入任务成功率达 100%,训练仅用 600 条真实机器人轨迹。
Sumanth 构建的数据分析 Agent 采用三层职责分离架构:Qwen(经 Vercel AI Gateway 调用)只负责理解问题、生成只读 SELECT 并解释结果。
Epoch AI 发布 InnovationEval 评测,用一篇已发表的在线策略自蒸馏(SDPO)论文作基准,测试 AI 能否独立提出有同等效果的新后训练算法。
OpenAI 发布了 722 篇由 AI 撰写的数学论文,成果已打包上传至 GitHub 仓库,但这些声明尚未得到外部数学家证实。平均每道难题的解法消耗 ChatGPT Pro 深度思考约三小时算力,OpenAI 同步给出大量 Lean 代码用于机器核验证明,并开源技术细节与模型推理过程。
OpenAI 将内部未发布模型产出的 722 篇数学论文归成 372 组结果,全部放在 GitHub 仓库 openai/math 公开。该模型从 8 月 28 日开始训练,能力比已发布的 GPT-6 Astra 更强且尚未对外开放;约 160 篇主要结论附带 Lean 形式化证明,其余论文尚未形式化,OpenAI 承认其中可能有错并保留修订历史。
抵押贷款服务软件公司 Valon 完成 1.5 亿美元 D 轮融资,估值 23 亿美元;开始卖软件六个月内签约额超 2 亿美元。该公司把联邦和州监管规则转成代码,自营服务商的效率达到行业约 3 倍,目前美国一家大型服务商正将 400 万笔贷款迁移到其平台,约占市场近 10%。
OpenAI 发布 722 篇由一款未公开内部前沿模型产出的数学论文,称这些结果解决或推进了数百个未解问题。该模型被输入约 4000 道题,每个结果平均消耗约三小时 ChatGPT Pro 级算力。OpenAI 表示曾咨询普林斯顿高等研究院数学与人工智能独立顾问组,并参考其公开建议决定发布方式,结果已上传至 github.com/openai/math。
Fireworks 的 AI 开发者教育负责人用纯 SFT、公开数据集和两个简单技巧,在 Fireworks 上微调出一个 9B Jev-style 决策分类器,无需前沿实验室级别的预算。完整训练配方已开源,可自行训练同类模型。
小米发现只以通过测试为目标的模型会添加未被要求的代码并让错误静默通过,于是将每项测试结果乘以质量清单评分来修正。结果 MiMo-V2.6-Pro RL 在 Artificial Analysis 的 Intelligence Index 上以 46 分领先开源权重模型。
NVIDIA Megatron Core 支持比特级确定性预训练,让大规模预训练更易调试、验证和可复现地恢复。在数千块 GPU 上训练万亿参数模型时,多维并行、低精度计算和分布式检查点会让故障复现与修复验证变难,比特级确定性可应对这一问题。
作者推荐开源项目 Overmind,认为应通过挖掘 agent traces 中的知识来掌控自己的智能栈。Overmind 能从代码和 traces 构建上下文图、整理训练与评估数据集、评估提示词和模型,并训练出用户自己拥有的更小专用模型。项目地址为 github.com/overmind-core/。
一项新论文提出 Harness-Aware Distillation,用同一教师模型分别在带与不带 harness 信息下作答,训练学生模型偏好带 harness 时选择的动作,并用过滤器剔除与 harness 记录矛盾的配对,全程不使用任务奖励或成功标签。
Firecrawl 在 Alexandria 上线梦幻体育数据,让 ChatGPT 或 Claude 接入球员与球队数据、梦幻分析、新闻和赔率等数百万数据点。用户可通过 Firecrawl 插件用 100 倍于以往的研究量来构建阵容。
Google Research 与 Google Health 发布研究,展示 Google Earth AI 结合卫星影像、移动性数据与基础模型(AlphaEarth Foundations、Population Dynamics Foundation Model),并配合 Geospatial Reasoning 智能体原型,帮助公共卫生机构预测疾病暴发。
NVIDIA 2026 电信 AI 调研显示,89% 受访者认为开源模型和软件对其 AI 战略重要,66% 表示公司正在积极使用 AI,高于去年的 49%。
Mercor 等数据公司正以时薪低至 45 美元起的零工,雇人编写评分细则、标准答案和推理轨迹来训练 AI,部分项目任务量骤减、时薪下调 8 美元,劳动者还被 Insightful 软件逐秒监控。Mercor 由三名 19 岁创始人于 2023 年创办,去年估值达 100 亿美元,每周约 3 万名专业人士在其平台工作,OpenAI 和 Anthropic 都曾是客户。
第十三届百度奖学金申报通道将于2026年10月8日23:59(北京时间)关闭,面向全球高校华人在校本科生、硕士和博士生,提供20万元科研奖金。重点研究方向包括大语言模型、多模态理解与生成、AI系统与基础设施、机器学习等,获奖者可与百度科学家交流并优先对接百度AIDU顶尖人才计划。
作者卡兹克解读 A16Z 第七版《Top 100 消费级 AI 应用》与 9 月底更新的《市场状况 II》两份报告,整理出其中的反常识数据。
Epoch AI 将半导体从国际投入产出表的宽泛电子类别中拆分出来,测算各国对芯片供应链冲击的暴露程度。2022 年每 1000 美元中国最终需求为半导体生产商带来 15.2 美元收入,是美国的 2.7 倍(美国为 5.7 美元)。在台湾供应中断叠加中西脱钩的模拟情景中,中国先进处理器价格上涨 17 倍、实际国民总支出下降 3%,美国则约为 20% 涨幅和 0.6% 降幅。
Google DeepMind 发布开源嵌入模型 EmbeddingGemma 2,基于 Gemma 4,把文本、代码、图像、视频、音频映射到同一 768 维空间,文本路径为 270M 参数,支持 8K token 上下文,代码检索较初代提升 14%。
a16z 的 Top 100 Consumer AI Apps 分析显示,AI 支出前 1% 的用户月均花费 903 美元,已超过后 50% 用户的总和,而后者的中位数支出仅 25 美元。
Geoffrey Hinton、Yoshua Bengio、Andrew Barto、Jakub Pachocki 等22位作者发布论文《What if automating AI R&D triggers an intelligence explosion?
Hugging Face 的 Clement Delangue 介绍,团队在不改动 harness 和训练代码的前提下,把 Claude Code、Codex。
邮件服务商正用机器学习取代固定规则来判定发件人声誉,模型会同时分析正文措辞、链接与附件特征、发送频率突增,并结合历史发件行为和收件人实时互动做出整体判断,因此上下文比单个关键词更重要。
a16z 领投 Conway Research 首轮融资,核心产品为 Underdog,金额未公布,参投方包括 Khosla Ventures、Hummingbird、Anthropic 与 Menlo Ventures 联手设立的 Anthology Fund,个人投资人含 Naval Ravikant、Noam Brown、Logan Kilpatrick。
一篇题为《Scaling Trajectories for Complex Tasks through Recursive Self-Rewrite》的论文已在 Hugging Face 上线,提出用递归自改写来扩展复杂任务的性能轨迹。论文页面已公开,具体方法与结果细节以原文为准。
法律 AI 公司 Harvey 联合创始人兼总裁 Gabe Pereyra 在 Sequoia Capital 的“Own Your Intelligence”活动上,介绍了应用公司在资金、算力不及基础模型公司时建立研究能力的方法:先建评测标准与训练数据,再与外部研究团队合作完成后训练,最后搭建模型部署基础设施。