美团 GeoRA:为 RLVR 设计的 LoRA,获 ACL 2026 杰出论文
美团履约技术团队与北京大学提出 GeoRA,一种为 RLVR 显式对齐更新几何的低秩适配方法,已被 ACL 2026 接收为杰出论文(全球 18 篇入选)。
美团履约技术团队与北京大学提出 GeoRA,一种为 RLVR 显式对齐更新几何的低秩适配方法,已被 ACL 2026 接收为杰出论文(全球 18 篇入选)。
美团在 MTGR 基础上提出统一推荐基座大模型 MTFM,首次实现外卖多个主要业务的统一精排模型,相关成果已被 KDD 2026 收录。MTFM 以异构 Tokenizer 与动态掩码实现多场景特征免对齐,通过混合注意力与 Target Scale-Up 提升 Scaling 能力,单样本计算量达 192 GFLOPs。美团外卖多业务订单量提升 2.06%~6.68%,在线推理成本降低 24%。
论文发现,在整仓库迁移任务上,同一模型和相同 effort 设置下把 Codex 换成 HERMES harness 后,GPT-5.6 Sol 的成功率从 6.5% 升到 31.0%,收益来自 harness 本身。
Google 提出 CI 内的程序修复智能体 FlowAgent,针对提交前测试失败运行 ReAct 式生成-验证循环,并在代码审查工具中展示修复建议,其前置与后置两道弃权过滤器会拦下薄弱建议。对 195 个真实故障的人工评审显示,67.18% 的修复正确。Google 全公司上线后,它在 295,508 次变更上给出建议,开发者预览 65,069 次、采纳 28,554 次。
中科大、香港科技大学与阿里巴巴研究者发布 PEARL 论文,针对 Agentic RL 中 Rollout 占端到端时间 81.8% 的 GPU 调度瓶颈,提出动态调整 GPU 角色与 Prefill–Decode 配置的弹性方案。
哈工大(深圳)iLearn-Lab 与新加坡国立大学 LV-Lab 提出免训练 2-bit KV Cache 量化框架 QuantWM,通过量化敏感性感知聚类(QSAC)和主子空间注意力补偿(PSAC)改善视频世界模型的时序闪烁与画质下降。
JetBrains 的 Human-AI eXperience 团队与隆德大学研究者合作,提出一套审查 AI 生成代码的概念框架,核心观点是审查 AI 生成代码的关键问题是"信任校准",而非传统的 diff 比对。
DepthART 将单目深度基础模型压缩到 6.0M 参数:用抗偏置数据采样从约 4400 万张候选图像筛出约 170 万张均衡数据,再以 Depth Anything V2-L 伪深度蒸馏到 TinyViM+DPT。
NanoGPT 训练纪录被刷新至 39.9 秒,比此前的 67.6 秒缩短 27.7 秒。该方案不再优化 matmul 或增加算子,而是逐 flop 判断价值。
METR 开发并部署了一个基础的实时逐动作监控器,用 LLM judge 在智能体每次动作执行前审查,超过阈值即转人工审核并暂停评测,专注识别可能造成现实危害或试图绕过监控的行为。
腾讯混元(Hunyuan)将经典临界批次规模理论扩展到在线 LLM 强化学习,在 GRPO 和 PPO 上发现,重调学习率可在一定批次规模范围内保持每条回复的学习效果。在固定硬件下,扩大批次规模使 PPO 生成阶段吞吐最高提升 2.29 倍,其最佳 GRPO 配置则以少 29% 的时间达到相同验证目标。
腾讯混元(Hunyuan)将经典临界批大小理论扩展至在线 LLM 强化学习,在 GRPO 和 PPO 上发现,重新调整学习率可在一定批大小范围内保持每个响应的学习效果。在固定硬件上,扩大批大小使 PPO 生成阶段吞吐量最高提升 2.29×,最佳 GRPO 配置以少 29% 的时间达到相同验证目标。
Microsoft Research 新研究显示,将 AI 推理从机器人本体移出可提升任务成功率、提高效率,并支撑更先进的物理 AI 工作负载。该结论指向机器人硬件与智能增长不匹配的问题,即算力从机器人端外移是可行路径。
微软研究发现,将物理 AI 推理从机器人板载 GPU 卸载到边缘或云端 GPU,可显著提升移动操作任务的成功率、响应速度与电池续航。测试显示,较轻 GPU 下建图与规划最多变慢 383%,导航障碍及时检测下降 30%,VLA 模型准确率下降 50%;用树莓派 5 替代板载 GPU 后,Jetson Thor 一类板载 GPU 曾使续航最多减少 160%。
NVIDIA 联合 SGLang 团队推出 SWE-Serve,用于评测推理服务软件变更:AI 编程智能体的补丁能通过测试,却可能在服务器加载真实模型并处理请求时失败。该基准包含 53 个任务,要求检查完整服务链路,包括系统能否通过公开接口返回正确结果。
字节跳动安全研究团队与香港城市大学联合研究的 TWIST 被 ACM CCS 2026 接收,该方案用密钥将输入 Token 与模型权重映射到同一变换空间,使云端可沿用标准推理流程处理混淆态数据。
SemiAnalysis 分析了 DeepSeek 式 Engram 多 token 查表嵌入的协同设计思路:每个 token 只访问地址依赖 token ID 的少量嵌入行,运行时可在前层计算时从 host DRAM 预取,使嵌入表无需常驻 HBM。
微软研究院的 Garnet 获最佳论文奖,这是一个面向现代应用与云服务的新一代缓存存储层,可在无需修改任何应用的前提下带来数量级更高的性能与效率。Garnet 已作为开源软件开放使用。
Niklas Muennighoff 等人提出 Prefix Sliding,一种面向高效测试时扩展的简单快速方法,让 LLM 在长推理轨迹中“遗忘”部分前缀。该方法针对原生全注意力在长任务上 OOM、而压缩又会丢失关键细节的问题,效果可同时超过两者。
SemiAnalysis 发布 AgentX 1.0,称其为全球首个完全开源、100 万上下文的多轮智能体编码推理基准,Apache 2.0 许可,数据集与全栈工具投入超 300 万美元。
LlamaIndex 推出 ExtractBench,用 1950 年代监管文件、手填税表及经传真阈值化、复印机色调曲线、传感器噪声和手机拍摄退化的页面测试了 14 个文档抽取系统。
LlamaIndex 发布文档抽取基准 ExtractBench,覆盖 370 份企业文档、14 个系统,最难的测试是长列表完整性:26,725 行的无主财产清单、8,624 条债权人矩阵、3,063 项持仓的 13F。
微软研究院(MSR)牵头的 AI Foundations for Power Grids 研讨会已获 NeurIPS 2026 接收,正在征稿,截止 8 月 29 日。征稿方向包括 benchmark、模型训练、可靠性、基础模型与真实部署。
Epoch 与 METR 发布 MirrorCode 基准,用于评估 AI 完成长时程编程任务的能力,Claude Opus 4.7 用 14 小时、251 美元推理成本解决了一项 METR 和 Epoch 估计人类需 2 至 17 周完成的任务,25 个目标程序中有 8 个始终未达 100% 通过阈值。
YC Paper Club 举办 Kernels/Chips 专场,分享了 ParallelKittens、"Intelligence Per Watt:衡量本地 AI 的智能效率"等论文,以及关于自动化系统研究与 AI 推理异构硬件的分享。下一场主题为机器人。
李飞飞介绍斯坦福 SVL 与 NVIDIA Robotics 合作的机器人学习测试时训练工作 RoboTTT,把机器人模型原生扩展到 8000 个 timestep 上下文,相当于 5 分钟的肌肉记忆,且推理成本恒定。
微软研究院提出一种新方法,可在开发者编写密码学代码的过程中同步验证代码,并在实现与演进过程中兼顾速度与适应性。密码学代码支撑着现代计算系统的关键防护,该方法的细节尚未在公开信息中展开。
B站搜索团队提出特征选择算法LeAP,将离散的特征打乱转化为端到端可学习的门控网络,并引入基于特征打散差异的自适应梯度去偏正则。该算法已被ECML-PKDD 2026录用,在Criteo、Avazu、ML-1M、AliCCP等公开数据集上达到SOTA水平。
Sebastian Raschka 发布 2026 年 1 月至 5 月的 LLM 研究论文精选清单,涵盖架构与模型设计、高效训练与扩展、推理效率与 KV Cache、稀疏注意力与长上下文、推理与测试时计算、强化学习与 RLVR、智能体系统与工具使用、编码智能体与软件工程、扩散语言模型、模型评测与基准十大类。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生监督下辅助患者诊疗的“三方协作”模式。
Google DeepMind 发布论文提出 Decoupled DiLoCo 分布式训练架构,将训练任务拆分为相互解耦的计算岛屿并采用异步数据流,使单点硬件故障不中断其他部分。
伯克利 AI 研究博客提出 GRASP,一种针对学习动力学(世界模型)的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、直接向状态迭代注入随机性以探索,并重塑梯度让动作获得清晰信号同时避开高维视觉模型中的状态输入梯度。
NVIDIA 联合 Berkeley、Stanford 和 CMU 开源了 CaP-X,采用 MIT 许可证,代码、论文与项目主页均已公开。论文编号为 arXiv:2603.22435。
METR 用 Claude Code 和 Codex 分别测试 Opus 4.5 与 GPT-5 的时间跨度,发现两者均未显著优于其默认脚手架 ReAct 和 Triframe:Opus 4.5 用 Claude Code 仅在 50.7% 的 bootstrap 采样中胜过 ReAct,GPT-5 用 Codex 胜过 Triframe 的比例仅 14.5%。
Jina AI 公开了 jzip 的 C 实现代码与配套论文,前者托管在 GitHub 的 jina-ai/jzip-c 仓库,后者发布于 jina.ai 的 embedding-comp 页面。两条链接均通过推文直接给出,供开发者查阅实现细节与压缩方法。
SWE-fficiency 旨在评估语言模型能否在真实工作负载上加速真实 GitHub 仓库,包含跨 9 个数据科学、ML 和 HPC 仓库的 498 个优化任务,每个任务都配有真实工作负载。现有智能体难以达到专家级优化水平。