跳到正文

#arXiv

今日 3 条
今天10月10日周六
  1. AI科技评论AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    字节论文发现 DeepSeek V4 分块 KV Cache 压缩的周期性盲区

    字节团队论文《Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression》指出,DeepSeek V4 系列采用的分块 KV Cache 压缩会让模型对 Token 所处位置敏感,关键信息落到切块交界处时答案出错。

  2. 新智元AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AgentWorld 基准评测多智能体协作:最强模型团队仅完成 52.0% 任务

    OpenAgents 联合哥伦比亚大学、宾夕法尼亚大学等高校构建多智能体协作评测基准 AgentWorld,让 3 至 20 个智能体在 MMORPG 沙盒中分工完成 100 个人工设计任务及 100 个增强变体。

  3. InfoQ 中文AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    让 AI 组队干活,最强模型也只完成约一半任务:AgentWorld 如何评测 Agent 协作能力?

    研究者构建了多智能体协作评测基准 AgentWorld,让 LLM 驱动的智能体在 MMORPG 沙盒中分工完成制作、采集、战斗等长时程任务。

10月8日周四
  1. AI科技大本营AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    多加 50% GPU,Rollout 只快 10.3%:Agent 训练的瓶颈开始从模型转向系统

    中科大、香港科技大学与阿里巴巴研究者发布 PEARL 论文,针对 Agentic RL 中 Rollout 占端到端时间 81.8% 的 GPU 调度瓶颈,提出动态调整 GPU 角色与 Prefill–Decode 配置的弹性方案。

  2. Stanford AI Lab(@StanfordAILab)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 在 COLM 展示 SAIL 项目

    Stanford AI Lab 本周在旧金山 COLM 上展示多项 SAIL 项目,并附上官方博客链接 ai.stanford.edu/blog/colm-2026/。

10月7日周三
  1. 机器之心AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    哈工大(深圳)与 NUS 提出 QuantWM:免训练 2-bit KV Cache 量化,视频世界模型压缩最高 6.20 倍

    哈工大(深圳)iLearn-Lab 与新加坡国立大学 LV-Lab 提出免训练 2-bit KV Cache 量化框架 QuantWM,通过量化敏感性感知聚类(QSAC)和主子空间注意力补偿(PSAC)改善视频世界模型的时序闪烁与画质下降。

  2. elvis(@omarsar0)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    论文提出 Harness-Aware Distillation:为小语言模型智能体做 harness 感知蒸馏

    一项新论文提出 Harness-Aware Distillation,用同一教师模型分别在带与不带 harness 信息下作答,训练学生模型偏好带 harness 时选择的动作,并用过滤器剔除与 harness 记录矛盾的配对,全程不使用任务奖励或成功标签。

10月6日周二
  1. QdrantAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google EmbeddingGemma 2 能压到多小?1-bit 量化省 30 倍向量内存

    Google DeepMind 发布开源嵌入模型 EmbeddingGemma 2,基于 Gemma 4,把文本、代码、图像、视频、音频映射到同一 768 维空间,文本路径为 270M 参数,支持 8K token 上下文,代码检索较初代提升 14%。

10月5日周一
  1. elvis(@omarsar0)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SelfSearch 让编码智能体改写自身 harness,成本 4.03 美元追平 Codex

    一项名为 SelfSearch 的研究让 AI 智能体基于此前自我修改的记录来改写自己的指令、工具与流程,编码智能体借此在 DeepSeek V4 Flash 上以 4.03 美元的搜索成本解出 Terminal-Bench 2.1 的 82.0% 任务,无需搜索期间的任务奖励。

  2. AK(@_akhaliq)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    EditHero:面向长程部件级 3D 编辑与 Vibe Modeling 的基准

    EditHero 是一个面向长程部件级 3D 编辑与 Vibe Modeling 的基准,论文已在 Hugging Face Papers 发布(编号 2610.02)。该基准聚焦长时程、部件粒度的 3D 编辑任务,具体指标与数据未在原文披露。

10月3日周六
  1. AK(@_akhaliq)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Adaptive Reward Routing:面向音视频联合扩散模型的前向过程 RL 多奖励优化

    论文提出 Adaptive Reward Routing,面向音视频联合扩散模型做动态多奖励优化,方法基于前向过程 RL(Forward-Process RL)。论文已发布在 Hugging Face Papers(编号 2609.37)。

9月30日周三
  1. 大模型智能AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ACL 2026 杰出论文奖 | PALU:在关键前缀上最大化局部熵,让大模型精准“失忆”

    中国科学技术大学与新加坡国立大学团队提出 PALU(Prefix-Aware Localized Unlearning,前缀感知局部遗忘),从时序与词表两个维度做局部化约束:只干预敏感片段最前面的 N 个词元,且只对冻结参考模型选出的 Top-K logit 做局部熵最大化,并用 KL 散度约束非敏感词元分布。

9月23日周三
  1. vivo互联网技术AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    vivo BlueImage Lab 提出妆容迁移框架 ART,入选 ECCV 2026

    vivo BlueImage Lab 提出妆容迁移框架 ART,通过两阶段训练把监督信号从合成伪目标逐步锚定到真实参考图像,解决复杂妆容迁移中的细节丢失与身份漂移问题。该方法在 MT、LADN、MT-Wild、MF2K 四个测试集上 MSimG 全部第一,MF2K 艺术妆测试集 MSimG 达 9.22,并发布首个 2K 妆容数据集 MF2K(8,573 张 2048×2048 人像)。

  2. mem0(@mem0ai)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    mem0 发布 DolphinBench 基准测试

    mem0 发布 DolphinBench 基准测试,配套上线官网、排行榜与数据集,并开放运行与提交入口,代码仓库和论文同步公开。

9月22日周二
  1. Hunyuan(@TXhunyuan)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元推出 WebCraftBench:用真机探索评测 AI 生成网站

    腾讯混元发布 WebCraftBench,让智能体实际操作运行中的网页应用,通过覆盖率引导探索发现未被触达的页面,再对美观度、可用性及是否满足原始需求打分。在 197 组人工校验样本上,该评测与人类偏好的一致率为 85.3%。

9月20日周日
  1. 腾讯混元AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元联合清华北大提出 WebCraftBench:让智能体实测 AI 生成的网页

    腾讯混元联合清华、北大提出网页生成评测基准 WebCraftBench,把软件测试方法引入评测:用智能体真实操作网页,结合代码覆盖率与美观度、易用性、需求符合度三维打分。基准含 369 条真实需求、5,088 条验收标准,覆盖 17 个前沿模型生成的 6,273 个应用,在 197 组人类偏好对比中一致率达 85.3%。

9月18日周五
  1. Yangyi(@Yangyixxxx)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    arxiv.org/pdf/2609.14858 论文分享

    分享了一篇 arxiv 论文(编号 2609.14858)。原文未提供更多细节,暂无模型、参数或评测信息可述。

9月10日周四
  1. Perplexity(@perplexity_ai)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 开放 Hugging Face 检索模型评测申请

    Perplexity 开放检索模型评测申请,开发者可通过 Google 表单提交公开可用的 Hugging Face 检索模型参与评估,包含评测方法与结果的完整技术报告已发布在 arXiv(2609.08887)。

9月2日周三
  1. vivo互联网技术AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    TinySR:面向真实世界图像超分辨率的轻量级扩散模型

    浙江大学 AiXM 课题组、vivo BlueImage Lab 与之江实验室提出轻量级扩散模型 TinySR,用于真实世界图像超分辨率。它通过深度剪枝、动态块间激活、扩张-腐蚀策略、VAE 轻量化、移除时间与提示模块及 pre-caching 优化推理,相比教师模型 TSD-SR 最高提速 5.68 倍、参数量减少 83%、MACs 降低 84%。

8月5日周三
  1. Mistral AI(@MistralAI)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 内容审核模型:以自然语言政策输出校准评分,统一处理文本与图像

    Mistral 的内容审核模型把审核政策当作自然语言问题输入,直接返回校准后的评分,并在同一接口中同时处理文本和图像。完整技术报告已发布在 arXiv(2607.25857)。

7月17日周五
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    YC Paper Club 芯片与内核专场:ParallelKittens、Intelligence Per Watt 等论文分享

    YC Paper Club 举办 Kernels/Chips 专场,分享了 ParallelKittens、"Intelligence Per Watt:衡量本地 AI 的智能效率"等论文,以及关于自动化系统研究与 AI 推理异构硬件的分享。下一场主题为机器人。

7月6日周一
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ICML 2026 论文:LLM 预测其他模型回答的准确率高于预测事实真相

    在 ICML 2026 论文《Truthfulness Does Not Scale Like Reasoning》中,研究者发现 LLM 预测其他模型会说什么的准确率高于预测事实真相,且模型犯错时会"一起犯错",因此通过多次采样投票无法恢复真相。Pass@k 与自一致性在数学和代码等有验证器的领域有效,但在没有验证器的领域中无法扩展真实性。论文将在首尔 ICML 2026 会议上报告。

7月5日周日
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    研究:预训练数据残留重复最坏可浪费 33% 算力,重复结构可由模型规模预测

    斯坦福 AI Lab 分享的研究《Internal Data Repetition Destroys Language Models》量化了预训练数据去重后残留重复的代价:最坏情况下可浪费高达 33% 的算力(FLOPs),且最坏情况的重复结构可由模型规模预测。

7月3日周五
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford 提出 Freeform Preference Learning:用自然语言偏好轴改进机器人策略

    Stanford AI Lab 提出 Freeform Preference Learning,让标注者用自然语言描述偏好轴,并据此学习条件奖励、提取更优策略。该方法针对机器人反馈中单一偏好会掩盖信息的问题——如同样的两条轨迹,一条掉了餐具、一条掉了盘子,只问一个偏好无法体现差异。相关博客与论文已公开(arXiv 2606.32027)。

7月1日周三
  1. Modal BlogAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 与 NYU Shanghai 提出 MRP:为扩散语言模型做多 token 残差预测

    Modal Research 与 NYU Shanghai HeavyBall Research 提出多 token 残差预测(MRP),用一个 3 层小模块预测相邻去噪步之间的 logit 残差,让冻结的扩散语言模型骨干一次前向解码多个 token。

4月9日周四
  1. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 内部模型一次解决五个 Erdős 问题,证明随模型进步愈发优雅

    OpenAI 用内部模型一次性解决了五个新的 Erdős 问题,相关论文已发布在 arXiv(2604.06609)。其中 Erdős Problem 1091 被解决:该猜想问的是色数为 4、且所有小子图色数不超过 3 的图是否必含带多条对角线的奇环,模型给出了反例。论文 Figure 5 由 Codex 生成,随模型进步,证明也变得更优雅。

4月1日周三
  1. Jim Fan(@DrJimFan)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 联合 Berkeley、Stanford、CMU 开源 CaP-X,采用 MIT 许可证

    NVIDIA 联合 Berkeley、Stanford 和 CMU 开源了 CaP-X,采用 MIT 许可证,代码、论文与项目主页均已公开。论文编号为 arXiv:2603.22435。

3月25日周三
  1. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jared Duker Lichtman 谈 Terry Tao 最新论文

    Jared Duker Lichtman 在推文中提及 Terry Tao 的最新论文,并附上被引用推文的链接。推文未披露论文的具体主题、模型或数据。

2月26日周五
  1. Geoffrey Hinton(@geoffreyhinton)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Geoffrey Hinton 发布新论文:神经网络如何表示部分-整体层级

    Geoffrey Hinton 发布新论文,探讨神经网络如何表示部分-整体层级,论文编号 arXiv:2102.12627。该论文提出了一种在神经网络中表征部分与整体层级关系的方法。