跳到正文

#论文/研究

今日 11 条
今天10月10日周六
  1. AI前线AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    字节 Seed 等团队发现 DeepSeek-V4 长文本检索的周期性盲区

    字节跳动 Seed 团队联合普林斯顿大学、斯坦福大学和加州大学伯克利分校,系统测试 DeepSeek-V4 与 V4.1 后发表论文,揭示其分块 KV 缓存压缩带来的相位敏感性缺陷。

  2. 新智元AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AgentWorld 基准评测多智能体协作:最强模型团队仅完成 52.0% 任务

    OpenAgents 联合哥伦比亚大学、宾夕法尼亚大学等高校构建多智能体协作评测基准 AgentWorld,让 3 至 20 个智能体在 MMORPG 沙盒中分工完成 100 个人工设计任务及 100 个增强变体。

  3. 新智元AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 公开 175 页四维挂谷猜想证明稿及 97 页三维极大函数手稿

    OpenAI 于 10 月 6 日在 GitHub 公开首批 722 篇数学手稿,其中一篇 175 页瞄准四维挂谷猜想的集合版,另一篇 97 页针对更强的三维极大函数猜想。两篇论证均依赖 Guth、王虹与 Zahl 的集合估计等已有结果,若成立可将四维满维结论从特殊情形推进到一般情形,但更强的四维极大函数版及五维以上问题仍未解决,且两篇手稿还需独立检验。

  4. 哔哩哔哩技术AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HOMURA:面向时间受限场景的 LLM 翻译强化学习优化,入选 EMNLP 2026 Oral

    哔哩哔哩 Index LLM 团队提出 HOMURA 强化学习框架,通过 KL 正则化目标与动态音节比例奖励,在音节级长度约束下优化翻译的语义保留与时间合规性,并构建了 Sand-Glass 基准测试。

  5. InfoQ 中文AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    让 AI 组队干活,最强模型也只完成约一半任务:AgentWorld 如何评测 Agent 协作能力?

    研究者构建了多智能体协作评测基准 AgentWorld,让 LLM 驱动的智能体在 MMORPG 沙盒中分工完成制作、采集、战斗等长时程任务。

  6. 创业邦AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 公开 722 篇数学手稿,声称证明三维挂谷极大函数与四维挂谷猜想

    OpenAI 于 10 月 7 日一次性公开 722 篇数学手稿,论文和部分 Lean 证明上传 GitHub,作者栏均署 OpenAI。其中编号 074 的两篇分别声称证明三维挂谷极大函数猜想和四维挂谷集的 Hausdorff 维数猜想,后者把此前卡在 3 点几的维数下界直接推到 4,两篇共 272 页,四维论文还引用了三维论文中的引理。

  7. AI Will(@FinanceYF5)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 722 篇内部模型完成的数学手稿

    OpenAI 一次性发布 722 篇由未公开内部模型完成的数学手稿,成果来自约 4,000 个研究问题,被归为 372 个相关结果家族。OpenAI 称标准流程中每项成果平均使用约 3 小时的 ChatGPT Pro 思考算力。本次发布包含论文、证明材料和部分推理摘要,但模型本身仍未公开。

  8. AI Will(@FinanceYF5)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 用未发布内部模型生成 722 篇数学手稿

    OpenAI 发布了一款未公开内部模型生成的 722 篇数学手稿,按 372 个相关结果族归类,来自约 4000 道研究问题的评测。OpenAI 称标准流程每条结果平均消耗约三小时 ChatGPT Pro 的思考算力,此次发布包含论文、证明产物和部分推理摘要,模型本身仍未发布。

  9. AI Will(@FinanceYF5)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 公开数学成果论文:722 篇手稿覆盖 372 项结果

    OpenAI 正式公开此前“解决开放数学问题”声明背后的完整论文,包含 722 篇数学手稿、覆盖 372 项重要结果。该目录来自对内部模型约 4,000 个研究问题的测试,经归类和筛选形成,几乎所有结果采用同一套标准流程。每项成果平均消耗相当于 ChatGPT Pro 思考 3 小时的算力。

  10. AI Will(@FinanceYF5)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布其开放问题成果背后的完整论文:722 篇手稿涵盖 372 类数学结果

    OpenAI 发布了其开放问题主张背后的完整论文,包含 722 篇手稿,涵盖 372 类数学结果。该目录的构建方式是在测试阶段让内部模型处理约 4K 个研究问题,再对输出分组和筛选,得到 372 个重要结果族。这些结果几乎都来自同一标准设置,每项平均消耗相当于 3 小时 ChatGPT Pro 思考的算力。

  11. elvis(@omarsar0)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta Superintelligence Labs 提出 agent plasticity,用每美元学习收益衡量 AI 智能体自我改进

    Meta Superintelligence Labs 提出用 "agent plasticity" 衡量智能体自我改进的性价比,即在模型权重冻结、每次运行使用全新上下文的条件下,衡量花费每美元学习成本在留出任务上取得的收益。

10月9日周五
  1. 宝玉(@dotey)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    《State of AI Report 2026》发布:AI 参与自身研发,智能体闯进真实系统

    《State of AI Report 2026》10 月 8 日发布,第九期由 Air Street Capital 的 Nathan Benaich 牵头,正文 240 多页,分研究、产业、政治、安全、预测五部分。

  2. 赛博禅心AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 研究员用 Claude Science 完成首张完整全天紫外地图

    约翰斯·霍普金斯大学天体物理学家、Anthropic 研究员 Brice Ménard 使用 Claude Science 做出首张完整全天紫外地图,其中约三分之一天空从未被紫外望远镜观测过,由 Claude 预测补齐,并为每个像素标注实测或预测及误差估计。

  3. 字节跳动技术团队AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenViking 团队三篇论文拆解其上下文数据库核心技术

    OpenViking 团队围绕 Agent 的上下文管理发布三项研究:VikingMem(VLDB 收录)把记忆分为事件与实体两层并维护最新档案,在 LoCoMo 长期记忆评测上得 88.83。

  4. AI Will(@FinanceYF5)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    第 9 份年度《State of AI》报告发布:AI 如何构建更强的 AI、世界模型与 Physical AI

    第 9 份年度《State of AI》报告发布,内容涵盖 AI 如何构建更强的 AI、世界模型、Physical AI、地缘政治、网络防御,以及对未来 12 个月的预测。报告列出了今年最重要的发现,并附带视频与原文链接。

  5. AI Will(@FinanceYF5)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    State of AI 第九份年度报告发布:AI 构建更好的 AI、世界模型与物理 AI

    State of AI 第九份年度报告正式发布,涵盖 AI 构建更好的 AI、世界模型、物理 AI、地缘政治、网络防御以及 12 个月预测等议题。报告可在 stateof.ai 阅读,作者 Nathan Benaich 另提供了主编剪辑版视频。

  6. 机器之心AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞团队发布 OpenWAM:世界动作模型开源框架让动作翻译器可迁移

    斯坦福大学李飞飞、吴佳俊、Ehsan Adeli 等人发布论文,提出开放的世界动作建模框架 OpenWAM,相关代码、评测与预训练视频模型权重已开源。框架从阿里开源的 Wan2.2-5B 出发,在约 334 万条人机交互视频上继续预训练,用 MoT 架构把 5B 视频专家与 2B 动作专家拼在一起,并定义 VTA、ATV、Joint、Decoupled 四种交互程序。

  7. DatawhaleAI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI公布722份由前沿模型产出的数学手稿

    OpenAI公布了一批由内部前沿模型产出的数学研究成果,包括722份数学手稿和372组相关成果,覆盖数论、代数几何、实分析、组合数学、理论计算机、数学物理、偏微分方程等多个方向。部分成果附有可由计算机核验的Lean形式化证明,社区初步核查发现其中涉及多个长期未解的开放问题,但具体结论仍需数学界进一步审阅与验证。OpenAI表示,AI正在从辅助解题走向参与真正的数学研究与发现。

  8. DatawhaleAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    谷歌牵头 32 位作者 154 页综述:把大模型「Token」认字机制讲明白

    谷歌联合 20 多家研究机构、32 位作者发布 154 页综述,系统梳理大模型的分词(Token)机制,指出模型数不清 strawberry 里有几个 r、多位数算术出错,病根在文本进入模型前的分词环节。

  9. 新智元AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    墨尔本大学与新南威尔士大学提出多会话语音记忆基准VoxMem,专治音频大模型记不住「谁说的、怎么说」

    墨尔本大学与新南威尔士大学联合团队提出多会话语音记忆基准VoxMem,用「声学证据×记忆操作」二维分类覆盖15种考察组合,包含799道题、3,196个评测实例、34,743个语音会话(约177小时),每道题在8K到64K token历史长度下保持不变。

  10. 小互(@imxiaohu)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Contra Labs 发布 2026 创意行业报告:超 70% 创意人每天用 AI,项目客单价涨 40% 以上

    Contra Labs 发布《Creative Intelligence Report 2026》,问卷覆盖 15 万名以上在职创意专业人士,数据依托 200 万以上创作者,显示超过 70% 的创意人每天都在用 AI,善用 AI 者承接项目客单价平均增长 40% 以上。

  11. 国际大厂AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    英伟达 Physis-Lang:让自然语言成为世界模型的物理表征,增强视频物理真实性

    英伟达联合 MIT 和牛津大学提出 Physis-Lang,把物理原因、规律和结果写进语言描述,并贯穿数据筛选、训练与视频生成。其 Cosmos3-Super 和 Cosmos3-Nano 版本在 Physics-IQ Verified 榜单上分别以 48.2 和 43.3 分按平均分位列第一、第二,Super 较此前最高分提升 5.5 个百分点。

  12. 量子位AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MirroS 团队发布 AgentGarten:让智能体在代码与实时渲染的试炼场中边玩边进化

    MirroS 团队发布 AgentGarten,将可执行代码环境与实时神经渲染器连接,物理规则由代码裁决、光影由模型生成,以超过 30 fps 的吞吐让智能体持续与虚拟世界交互。

  13. 量子位AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    字节Seed发现DeepSeek时强时弱的原因:分块KV Cache压缩带来相位敏感性

    字节Seed团队发现,DeepSeek-V4系列在长上下文检索中的表现会随信息位置按固定周期波动,波动周期与模型采用的KV Cache压缩步长一致。

  14. AK(@_akhaliq)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LIFT:大视角变化下通过 On-Policy 自蒸馏实现 Layout-In-Future 视频生成

    LIFT 提出一种 Layout-In-Future 视频生成方法,在大视角变化条件下通过 On-Policy 自蒸馏实现生成,论文已发布在 Hugging Face Papers。

  15. elvis(@omarsar0)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 论文提出 VERA:将基准轨迹转为 9000 多个可重启沙箱并协同演进模型与 harness

    NVIDIA 发布论文 VERA,把基准轨迹转成 9000 多个可重启沙箱并附带 rubric 评分,只保留能运行且可依据可观察证据评分的环境。系统同时更新模型权重和 harness,harness 改动需通过自测并在开发集上至少提升 5 分才保留,模型 checkpoint 若得分下降超过 20% 则被拒绝。

  16. elvis(@omarsar0)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 研究:给多模态模型接入工具会削弱其拒绝有害请求的能力

    NVIDIA 一篇被 NeurIPS 2026 接收的论文发现,给多模态模型接入工具后,其拒绝有害请求的失败率相对上升最高达 68.7%,平均上升 17.7%。

  17. elvis(@omarsar0)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    RSI 递归自我改进研究合集:AI 热门方向的最新论文与阅读清单

    递归自我改进(RSI)是当前 AI 最热门的议题之一,且仍处于非常早期阶段。有人整理了一份 RSI 论文合集与阅读清单,用于了解该方向的历史与最新技术,链接为 academy.dair.ai/papers/collect。

  18. elvis(@omarsar0)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DAIR.AI 推出 MCP 工具,可在 Codex/Claude/Grok Bot 中检索 AI 论文

    DAIR.AI 发布 MCP 工具,将其 AI 论文索引接入 Codex、Claude、Grok Bot,用于发现和梳理热门论文。该索引收录了 elvis 近两年在 X 上推荐的论文,支持查找与总结论文、生成文献综述、可视化论文等功能。官方称未来几周还将发布多个配套 benchmark。

  19. elvis(@omarsar0)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Voice Arena 的 Monsoon 语料:孟加拉语微调让 Whisper Medium 的 WER 从 85.27% 降至 7.65%

    Voice Arena 发布 Monsoon ASR 语料库七天内,已有 80 多家机构申请授权。在孟加拉语 FLEURS 上,用 Monsoon 微调 Whisper Medium 将词错率从 85.27% 降至 7.65%。Monsoon 覆盖 50 种语言共 10 万小时,多为长尾语言,计划 2 月扩展到 100 种语言、2027 年底达到 1000 种,并开放模型 API 供实验室自测。

  20. 美团技术团队AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团 LongCat 发布 MineExplorer:首个开放世界分钟级长程任务评测基准,18 款顶级多模态大模型集体"考砸"

    美团 LongCat 团队构建 MineExplorer,首个在开放世界中做到分钟级长程任务的评测基准,包含 813 个人工验证实例(1-hop 到 4-hop),每个任务实例运行 1800 个环境步、对应 3 分钟连续交互。

  21. 美团技术团队AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团开源 LoHoSearch 搜索智能体评测基准,用知识图谱让机器自动出题

    美团 LongCat 团队开源 LoHoSearch,一个基于覆盖 762 万维基百科实体知识图谱自动生成题目的搜索智能体评测基准,含 544 道经人工核验题目、覆盖 11 个领域。

  22. 美团技术团队AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    KDD'26 美团学术论文精选及 KDD Cup'26 DataAgents 赛道冠军思路解读

    美团技术团队在 KDD 2026 分享 8 篇收录论文,覆盖推荐大模型 MTFM、奖励建模框架 CDRRM、智能体搜索基准 LocalSearchBench、ETA 元泛化框架 UME 及生成式推荐训练系统 MTGenRec 等方向。大众点评技术部还在 2026 KDD Cup 复杂数据分析 Data Agents 赛道夺得冠军与季军,相关代码已在 GitHub 开源。

  23. lmarena.ai(@lmarena_ai)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 发布技术报告与 Alignment Index 完整排名

    LMArena 发布技术报告,并开放 Alignment Index 完整排名查看。原文未披露具体模型、参数量或评测分数等细节,仅给出博客报告与排名页面链接。

  24. 量子位AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 与 BIDMC 研究登《柳叶刀》:AMIE 预诊获初步验证

    Google 与贝斯以色列女执事医疗中心(BIDMC)研究人员主导的一项研究发表于《柳叶刀》主刊,这是 Google 研究成果首次登上该刊。

  25. 国际大厂AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    TouchScale 发布 500 小时人类视觉-触觉数据集,机器人真机成功率翻番

    德州农工大学、Google DeepMind、CMU 等 15 家机构联合发布 TouchScale,一个在统一传感器与采集流程下构建的 500 小时人类双手视觉-触觉数据集。

  26. 美团技术团队AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团 GeoRA:为 RLVR 设计的 LoRA,获 ACL 2026 杰出论文

    美团履约技术团队与北京大学提出 GeoRA,一种为 RLVR 显式对齐更新几何的低秩适配方法,已被 ACL 2026 接收为杰出论文(全球 18 篇入选)。

  27. 美团技术团队AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团 MTFM:统一推荐基座大模型在外卖多业务场景的落地实践

    美团在 MTGR 基础上提出统一推荐基座大模型 MTFM,首次实现外卖多个主要业务的统一精排模型,相关成果已被 KDD 2026 收录。MTFM 以异构 Tokenizer 与动态掩码实现多场景特征免对齐,通过混合注意力与 Target Scale-Up 提升 Scaling 能力,单样本计算量达 192 GFLOPs。美团外卖多业务订单量提升 2.06%~6.68%,在线推理成本降低 24%。

  28. Hunyuan(@TXhunyuan)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元联合复旦、清华发布 ExplorationBench:评测 AI 系统的探索能力

    腾讯混元联合复旦、清华推出 ExplorationBench,用于衡量 AI 系统如何探索未知规则,包含 31 处隐藏规则改动、70 项任务的 AlienCode 与 24 条补丁推理规则、70 条定理的 AlienLogic 两个可验证沙盒。

  29. elvis(@omarsar0)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HERMES harness 让 GPT-5.6 Sol 仓库级迁移成功率从 6.5% 升至 31.0%

    在整仓库迁移任务上,同一模型和相同 effort 设置下,把 Codex 换成 HERMES harness 后 GPT-5.6 Sol 的成绩从 6.5% 提升到 31.0%,增益来自 harness 本身。