Microsoft Research 与 Broad Institute 合作项目 Ex Vivo 如何用 AI 推进精准肿瘤学
Microsoft Research 与 Broad Institute 合作推出 Project Ex Vivo,并获 Dana-Farber Cancer Institute 支持,利用 AI 更好地理解癌细胞状态,以推进精准肿瘤学。项目详情已发布于 Signal Magazine。
Microsoft Research 与 Broad Institute 合作推出 Project Ex Vivo,并获 Dana-Farber Cancer Institute 支持,利用 AI 更好地理解癌细胞状态,以推进精准肿瘤学。项目详情已发布于 Signal Magazine。
Berkeley AI Research 的 Peter Bartlett 将于 2026 年 7 月 28 日在 ICM2026 作全会报告,题目为《Modern Machine Learning Methods。
Jerry Liu 与 HazyResearch 等合作者提出一种闭式(closed-form)方法,可将事实直接写入面向 Transformer 的 MLP,无需梯度下降或训练,相关工作已被 COLM 2026 接收。该研究指出 MLP 在语言模型中承担事实存储功能,并给出可直接存储事实的 MLP 构造配方。
METR 的 Parker 与 Tom 联合 7 位经济学家发布论文《The Economics of Recursive Self-Improvement》,用一系列简单模型刻画 AI 如何加速 AI 研发。
Tatsunori Hashimoto 称 Gigatoken 速度极快,让他(有望)不必再等待 tokenization,并认为训练前无需等待 tokenization 是一种范式转变。他指出,即便是 tokenizer 这类成熟组件,只要贴近硬件、用状态机实现,仍有数量级的提升空间。
蚂蚁集团孵化的蚂蚁灵波刚发布第二代具身基础模型,首席科学家沈宇军在本期访谈中介绍了这次发布的 Depth、Vision、VLA、Video、World、VA 2.0 六个模型及其关系。
Microsoft Research 公开致谢数据集创建者、社区贡献者、维护者与合作伙伴,称他们持续推动这项工作。该团队同时开放征集额外语言支持,以用于下一个版本的发布。
PazaBench V2 通过扩展语言、地域和数据集覆盖,为面向历史上服务不足语言的语音技术研究提供更可靠的基础。Microsoft Research 称,可靠的基准对推进包容性 AI 至关重要。
Qdrant 发布增量嵌入更新教程,提供一套从第一天就能部署的流水线,检测文本数据变更并只重新嵌入改动的分块:未变的分块保持不动、文本移动时复用向量、新增与删除同步处理。
METR 提出用"支出视界"(expenditure horizon)量化 AI 智能体的优化能力,即 AI 与人类在同等预算下效率持平的美元成本。在 NanoGPT speedrun 的实测中,人力边际上每提升 1% 性能约需 2500 美元人力成本,而初步智能体优化跑在花费超 1 万美元后,估计支出视界仅为 0–3000 美元。
微软研究院推出 Aurora 1.5,将开放预测能力进一步扩展,同时发布 Flint 重定义可视化、FlowDAgger 加速自适应。此外,AI 智能体攻破了 Rowhammer 防御,内存技术正在重塑对话式 AI。
GPT-5.6 模型家族包含三种尺寸,每种尺寸提供大约五到六档推理努力设置。文章以 DeepSeek-R1 的 RLVR 训练方法为基础,讲解如何开发具备多种努力模式的推理模型,其中 OpenAI o1 让基于 LLM 的推理模型概念流行起来。
Jim Fan 介绍 RoboTTT,将机器人模型原生扩展到 8000 个时间步的上下文,约 5 分钟的肌肉记忆,推理成本保持恒定,比 SOTA 推进三个数量级。
宾夕法尼亚大学 Edgar Dobriban 借助 GPT-5.6 Sol Pro 推翻了统计学界二十年来的猜想:Benjamini-Hochberg 方法对相关双侧高斯检验并不普遍控制错误发现率(FDR)。
苏度科技联合创始人兼CEO韩铮在硅谷101播客中称,公司走软硬件协同设计的上下分层路线,上层负责规划与环境理解、下层负责物体操作,并以Sim-to-Real为核心训练范式。其零样本通用抓取单次成功率接近100%,节目中另有片段提到98%。他预测,被硅谷主流冷落的"上下分层"路线将重新回到主流。
NVIDIA GEAR Lab 发布 RoboTTT,将机器人策略的视觉运动上下文扩展到 8K 时间步,远超当前 SOTA,且推理延迟保持恒定。凭上下文中的数分钟经验,机器人可单次模仿人类视频演示、在部署中自我改进、从扰动中恢复,并完成 5 分钟 10 阶段装配流程。
Microsoft AI Futures 团队在 Nature Health 发表新论文,审查了覆盖 109 个国家的 170 万次对话,发现 Copilot 对本国卫生系统信心较低的人群尤其有价值。团队称这是 AI 为全球服务不足人群提供支持的进一步证据。
Arm CEO Rene Haas 在 AI 数据中心争论中指出,当年反对美国制造业外流至中国的阵营,如今若在本土阻挠 AI 工厂生态,可能重蹈覆辙。Tae Kim 称 AI 终将到来,问题在于美国是否要留下相关岗位与制造生态。
Epoch AI 估算,向免费聊天机器人发送 100 词提示词生成回复约耗 0.6 Wh 电,比微波炉运行 10 秒还少。AI 目前仅占美国年用电量的百分之几,低于空调(12%)和照明(8%),但数据中心电力需求大约每年翻一番。
Qdrant 发布批量上传数据指南,针对大规模写入密集和稀疏向量时的内存、磁盘与搜索可用性问题给出配置策略。指南基于 Qdrant v1.19 引入的 memory 设置,提供三条路径:将密集向量设为 cold 存盘、上传前建好 payload 索引、以及用 TurboQuant 量化在 RAM 中保留压缩副本,其中 BITS4 为默认最接近全精度、BITS1 压缩最高。
李飞飞团队在 BEHAVIOR 数据集相关工作中致谢 Simovation 提供模拟环境下的高质量 JoyLo 遥操作数据,并说明 BEHAVIOR 构建于 NVIDIA Omniverse 之上,感谢 NVIDIA 的持续支持。
英灵殿创始人 Odin 投身 AI for Science 创业,已融资数千万美元,想造"全模态分子世界模型"和"通用科学人工智能",做一台"新时代科学发现的蒸汽机"。他高中辍学后自学考上浙大,修过药学和物理,曾进 David Baker 实验室又选择离开。团队约 30 人,短期内坚决不做药物管线。
Stanford AI Lab 在 ICML 2026 最后一天推荐 "Scale Dependent Data Duplication"。
斯坦福 AI 实验室提出 Distill to Detect(D2D),将疑似有偏见的微调模型与其基座模型之间的差异蒸馏进一个小型 cartridge,把隐藏偏好放大到生成文本中,使现有审计方法能识别原本无法搜索的偏见信号。该方法针对只在某个未知话题上显现的隐蔽偏见,论文见 arXiv 2607.01208。
论文《Internal Data Repetition Destroys Language Models》在 ICML 2026 的 Foundations of Deep Generative Models 研讨会上进行口头报告,并获该研讨会亚军奖。
Aurora 1.5 为 Aurora 基础模型新增 22 个变量、逐小时时间分辨率与概率集合预报,面向真实场景的天气、气候和能源应用。该版本由 Microsoft Research 发布。
Mistral AI 展示了一套完全在仿真中训练的方案:覆盖 6000 个场景、约 40 万条轨迹,其前缀缓存(prefix-caching)配方将训练 token 用量减少 22 倍,把原本数月的训练压缩到数天。在线强化学习(CISPO)进一步提升了成功率。
Anthropic 在 Q2 2026 的 RSI 博客称其贡献者日均合并代码量是 2021-2024 年的 8 倍。基于 Cobb-Douglas 与 CES 生产函数建模,Thomas Kwa 推断仅凭编程智能体带来的研究员提效就超过 2 倍:Cobb-Douglas 在 β=0.5 下给出约 2.83 倍,CES 均质代码情形为 [2.75, 2.91]。
Hugging Face 发布 Training Agents 2 直播教程,讲解如何用模型蒸馏训练自定义智能体。该教程以直播形式进行,附有 x.com 直播链接。
伯克利 EPIC Data Lab 提出,推理价格已从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1,部分厂商低于 $0.10,年均降幅中位数近 50 倍,近乎免费的智能正在到来。
Lilian Weng 发布新文章,探讨 harness 工程如何推动 AI 自我改进。她认为 harness 工程或将朝自我改进方向演进并实现自动研究,而更聪明的模型又会让 harness 保持简单;即便许多 harness 改进最终被内化进核心模型,明确目标与上下文的需求也不会消失。
字节跳动 Seed 发布超长程评测集 EdgeBench,包含 134 个真实任务,横跨科学、复杂软件工程、白领知识工作、算法优化、前沿数学和数字游戏六大领域,每个任务支持 Agent 持续工作至少 12 小时,部分延长实验超过 72 小时。
斯坦福 AI Lab 分享的研究《Internal Data Repetition Destroys Language Models》量化了预训练数据去重后残留重复的代价:最坏情况下可浪费高达 33% 的算力(FLOPs),且最坏情况的重复结构可由模型规模预测。
Claude Fable 5 在用户的留存分析中未经提示便自动使用了倾向得分匹配,将用户按活跃度对齐后再做同类比较。用户称 Fable 5 在各类任务中的判断力均有提升,包括在 Cowork 中撰写邮件和文档、在 Claude Code 中调试复杂错误。
李继刚把书架比作大脑的训练语料,指出多数人对选书毫无门槛:畅销榜推什么读什么,等于拿互联网噪声训练自己的神经网络。他认为"多"不是好指标,关键是你允许谁的思想进入你的权重,每读一本平庸的书都是在用平庸覆盖本可形成的结构、占用梯度更新方向。
Mira Murati 表示 Bridgewater 利用其金融专业知识,与 Thinking Machines 的 Tinker API 合作微调了一个模型,帮助其分析师专注于重要工作。她称这是"专家改进 AI,AI 赋能专家"。
Stanford AI Lab 提出 Freeform Preference Learning,让标注者用自然语言描述偏好轴,并据此学习条件奖励、提取更优策略。该方法针对机器人反馈中单一偏好会掩盖信息的问题——如同样的两条轨迹,一条掉了餐具、一条掉了盘子,只问一个偏好无法体现差异。相关博客与论文已公开(arXiv 2606.32027)。
Stanford AI Lab 提出 QuasiMoTTo,通过改用相关采样而非独立并行采样来扩展推理算力,减少重复求解带来的浪费。该方法在测试时扩展中实现同等性能、样本量减少 25-47%,并将 RL 训练步数减少 50%;相关样本覆盖度更高,边际上仍是 LLM 的精确采样,且可并行生成。
Epoch AI 追踪各时点 ECI 得分最高的模型及其在榜首的持续时间,结果显示 GPT-4 领先的时间远超其他任何模型。ECI 会随时间小幅波动,但很少足以大幅改变模型排名,且这一回顾性视角未计入模型发布后 ECI 估计值的变化。
B站大语言模型团队将在 ACL 2026 展示 FATE 系列成果 SABER 与 CASTER,并现场开放「B-UP 顶尖技术人才项目」校招与实习岗位投递。SABER 提出可切换、受 Token 预算约束的混合思考训练范式,实验显示 FastThink 模式在 MATH、GSM8K、MBPP 及逻辑推理任务上推理长度减少 65%~80% 同时保持甚至提升准确率。