AgentWorld 基准评测多智能体协作:最强模型团队仅完成 52.0% 任务
OpenAgents 联合哥伦比亚大学、宾夕法尼亚大学等高校构建多智能体协作评测基准 AgentWorld,让 3 至 20 个智能体在 MMORPG 沙盒中分工完成 100 个人工设计任务及 100 个增强变体。
OpenAgents 联合哥伦比亚大学、宾夕法尼亚大学等高校构建多智能体协作评测基准 AgentWorld,让 3 至 20 个智能体在 MMORPG 沙盒中分工完成 100 个人工设计任务及 100 个增强变体。
研究者构建了多智能体协作评测基准 AgentWorld,让 LLM 驱动的智能体在 MMORPG 沙盒中分工完成制作、采集、战斗等长时程任务。
NVIDIA 发布论文 VERA,把基准轨迹转成 9000 多个可重启沙箱并附带 rubric 评分,只保留能运行且可依据可观察证据评分的环境。系统同时更新模型权重和 harness,harness 改动需通过自测并在开发集上至少提升 5 分才保留,模型 checkpoint 若得分下降超过 20% 则被拒绝。
中科大、香港科技大学与阿里巴巴研究者发布 PEARL 论文,针对 Agentic RL 中 Rollout 占端到端时间 81.8% 的 GPU 调度瓶颈,提出动态调整 GPU 角色与 Prefill–Decode 配置的弹性方案。
哈工大(深圳)iLearn-Lab 与新加坡国立大学 LV-Lab 提出免训练 2-bit KV Cache 量化框架 QuantWM,通过量化敏感性感知聚类(QSAC)和主子空间注意力补偿(PSAC)改善视频世界模型的时序闪烁与画质下降。
一项新论文提出 Harness-Aware Distillation,用同一教师模型分别在带与不带 harness 信息下作答,训练学生模型偏好带 harness 时选择的动作,并用过滤器剔除与 harness 记录矛盾的配对,全程不使用任务奖励或成功标签。
Google DeepMind 发布开源嵌入模型 EmbeddingGemma 2,基于 Gemma 4,把文本、代码、图像、视频、音频映射到同一 768 维空间,文本路径为 270M 参数,支持 8K token 上下文,代码检索较初代提升 14%。
一项名为 SelfSearch 的研究让 AI 智能体基于此前自我修改的记录来改写自己的指令、工具与流程,编码智能体借此在 DeepSeek V4 Flash 上以 4.03 美元的搜索成本解出 Terminal-Bench 2.1 的 82.0% 任务,无需搜索期间的任务奖励。
EditHero 是一个面向长程部件级 3D 编辑与 Vibe Modeling 的基准,论文已在 Hugging Face Papers 发布(编号 2610.02)。该基准聚焦长时程、部件粒度的 3D 编辑任务,具体指标与数据未在原文披露。
论文提出 Adaptive Reward Routing,面向音视频联合扩散模型做动态多奖励优化,方法基于前向过程 RL(Forward-Process RL)。论文已发布在 Hugging Face Papers(编号 2609.37)。
arXiv 于 10 月 1 日宣布新投稿限制,每位实际提交者每自然月最多提交 2 篇论文,适用于计算机科学、数学、物理等全部学科分类,即便被拒也占用当月额度。
中国科学技术大学与新加坡国立大学团队提出 PALU(Prefix-Aware Localized Unlearning,前缀感知局部遗忘),从时序与词表两个维度做局部化约束:只干预敏感片段最前面的 N 个词元,且只对冻结参考模型选出的 Top-K logit 做局部熵最大化,并用 KL 散度约束非敏感词元分布。
arXiv 获得 Simons Foundation International、Siegel Family Endowment 和 XTX Markets 三家慈善机构共 1720 万美元投资。arXiv 官方发文致谢,更多详情见 arXiv 博客。
vivo BlueImage Lab 提出妆容迁移框架 ART,通过两阶段训练把监督信号从合成伪目标逐步锚定到真实参考图像,解决复杂妆容迁移中的细节丢失与身份漂移问题。该方法在 MT、LADN、MT-Wild、MF2K 四个测试集上 MSimG 全部第一,MF2K 艺术妆测试集 MSimG 达 9.22,并发布首个 2K 妆容数据集 MF2K(8,573 张 2048×2048 人像)。
mem0 发布 DolphinBench 基准测试,配套上线官网、排行榜与数据集,并开放运行与提交入口,代码仓库和论文同步公开。
腾讯混元发布 WebCraftBench,让智能体实际操作运行中的网页应用,通过覆盖率引导探索发现未被触达的页面,再对美观度、可用性及是否满足原始需求打分。在 197 组人工校验样本上,该评测与人类偏好的一致率为 85.3%。
腾讯混元联合清华、北大提出网页生成评测基准 WebCraftBench,把软件测试方法引入评测:用智能体真实操作网页,结合代码覆盖率与美观度、易用性、需求符合度三维打分。基准含 369 条真实需求、5,088 条验收标准,覆盖 17 个前沿模型生成的 6,273 个应用,在 197 组人类偏好对比中一致率达 85.3%。
分享了一篇 arxiv 论文(编号 2609.14858)。原文未提供更多细节,暂无模型、参数或评测信息可述。
Jina AI 推出 OCR 模型 jina-ocr-v1,已在 Hugging Face 上线可直接使用,并同步放出技术报告与模型博客。官方同时向用户征集使用反馈。
Perplexity 开放检索模型评测申请,开发者可通过 Google 表单提交公开可用的 Hugging Face 检索模型参与评估,包含评测方法与结果的完整技术报告已发布在 arXiv(2609.08887)。
小米正式发布通用表格数据基础大模型 Xiaomi-TabLDM,以单一预训练模型、统一默认配置直接适配不同表格数据集,无需针对每个任务重新训练、调参或集成即可完成分类与回归预测。
浙江大学 AiXM 课题组、vivo BlueImage Lab 与之江实验室提出轻量级扩散模型 TinySR,用于真实世界图像超分辨率。它通过深度剪枝、动态块间激活、扩张-腐蚀策略、VAE 轻量化、移除时间与提示模块及 pre-caching 优化推理,相比教师模型 TSD-SR 最高提速 5.68 倍、参数量减少 83%、MACs 降低 84%。
Mistral 的内容审核模型把审核政策当作自然语言问题输入,直接返回校准后的评分,并在同一接口中同时处理文本和图像。完整技术报告已发布在 arXiv(2607.25857)。
Jina AI 发布 v3.5 重排序模型(reranker),同步公开博客、arXiv 论文(2607.18152)及 HuggingFace 模型页。
Jina AI 推出 jina-reranker-v3.5,保持 0.6B 参数规模和 LBNL 列表式架构,专门解决垂直领域适配、结构化记录逻辑识别和长列表显存爆炸三大工程痛点。
YC Paper Club 举办 Kernels/Chips 专场,分享了 ParallelKittens、"Intelligence Per Watt:衡量本地 AI 的智能效率"等论文,以及关于自动化系统研究与 AI 推理异构硬件的分享。下一场主题为机器人。
在 ICML 2026 论文《Truthfulness Does Not Scale Like Reasoning》中,研究者发现 LLM 预测其他模型会说什么的准确率高于预测事实真相,且模型犯错时会"一起犯错",因此通过多次采样投票无法恢复真相。Pass@k 与自一致性在数学和代码等有验证器的领域有效,但在没有验证器的领域中无法扩展真实性。论文将在首尔 ICML 2026 会议上报告。
斯坦福 AI Lab 分享的研究《Internal Data Repetition Destroys Language Models》量化了预训练数据去重后残留重复的代价:最坏情况下可浪费高达 33% 的算力(FLOPs),且最坏情况的重复结构可由模型规模预测。
Stanford AI Lab 提出 Freeform Preference Learning,让标注者用自然语言描述偏好轴,并据此学习条件奖励、提取更优策略。该方法针对机器人反馈中单一偏好会掩盖信息的问题——如同样的两条轨迹,一条掉了餐具、一条掉了盘子,只问一个偏好无法体现差异。相关博客与论文已公开(arXiv 2606.32027)。
Modal Research 与 NYU Shanghai HeavyBall Research 提出多 token 残差预测(MRP),用一个 3 层小模块预测相邻去噪步之间的 logit 残差,让冻结的扩散语言模型骨干一次前向解码多个 token。
通义实验室 ATH-Token Foundry 联合中国人民大学高瓴人工智能学院开源多领域科学生成基础模型 LOGOS,基于统一科学语法在六大科学任务上匹配或超越领域专用方法。
Jina v5-omni 已在 Elastic Inference Service、HuggingFace 和 Jina API 上线。相关模型可在 HuggingFace 集合页获取,技术细节见 arXiv 论文 2605.08384 与 Jina 官方博客。
OpenAI 用内部模型一次性解决了五个新的 Erdős 问题,相关论文已发布在 arXiv(2604.06609)。其中 Erdős Problem 1091 被解决:该猜想问的是色数为 4、且所有小子图色数不超过 3 的图是否必含带多条对角线的奇环,模型给出了反例。论文 Figure 5 由 Codex 生成,随模型进步,证明也变得更优雅。
NVIDIA 联合 Berkeley、Stanford 和 CMU 开源了 CaP-X,采用 MIT 许可证,代码、论文与项目主页均已公开。论文编号为 arXiv:2603.22435。
Jared Duker Lichtman 在推文中提及 Terry Tao 的最新论文,并附上被引用推文的链接。推文未披露论文的具体主题、模型或数据。
Jina AI 推出 Small & Nano 两款小尺寸嵌入模型,针对端侧检索、浏览器内搜索和边缘部署等受限内存场景。模型权重已在 HuggingFace 开放,包含 GGUF 和 MLX 格式,技术细节见配套博客与 arXiv 论文。
Jina AI 发布视觉语言模型 jina-vlm,相关论文(arXiv 2512.04032)与 HuggingFace 模型权重已同步公开,并在官方博客介绍了该模型。目前仅公布了 arXiv、HuggingFace 和博客三条发布链接,模型参数规模、benchmark 分数与价格等细节尚未披露。
Lilian Weng 回应了一条推文:Isa Fulford 在 ICLR 的 OpenAI 招聘活动上被人问"你听说过 arXiv 吗"。该推文获得 243 次点赞和 8.4 万次浏览。
大语言模型幻觉被区分为上下文幻觉与外在幻觉两类,后者指模型输出无法被预训练数据所代表的世界知识所支撑。Gekhman et al. 2024 发现,模型学习含新知识的微调样本明显更慢,一旦学会这些样本,其幻觉倾向随之上升。
Geoffrey Hinton 发布新论文,探讨神经网络如何表示部分-整体层级,论文编号 arXiv:2102.12627。该论文提出了一种在神经网络中表征部分与整体层级关系的方法。