跳到正文

#数据/训练

今日 5 条
今天10月10日周六
  1. AI前线AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    字节 Seed 等团队发现 DeepSeek-V4 长文本检索的周期性盲区

    字节跳动 Seed 团队联合普林斯顿大学、斯坦福大学和加州大学伯克利分校,系统测试 DeepSeek-V4 与 V4.1 后发表论文,揭示其分块 KV 缓存压缩带来的相位敏感性缺陷。

  2. 哔哩哔哩技术AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HOMURA:面向时间受限场景的 LLM 翻译强化学习优化,入选 EMNLP 2026 Oral

    哔哩哔哩 Index LLM 团队提出 HOMURA 强化学习框架,通过 KL 正则化目标与动态音节比例奖励,在音节级长度约束下优化翻译的语义保留与时间合规性,并构建了 Sand-Glass 基准测试。

  3. 创业邦AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 公开 722 篇数学手稿,声称证明三维挂谷极大函数与四维挂谷猜想

    OpenAI 于 10 月 7 日一次性公开 722 篇数学手稿,论文和部分 Lean 证明上传 GitHub,作者栏均署 OpenAI。其中编号 074 的两篇分别声称证明三维挂谷极大函数猜想和四维挂谷集的 Hausdorff 维数猜想,后者把此前卡在 3 点几的维数下界直接推到 4,两篇共 272 页,四维论文还引用了三维论文中的引理。

  4. AI Will(@FinanceYF5)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 公开数学成果论文:722 篇手稿覆盖 372 项结果

    OpenAI 正式公开此前“解决开放数学问题”声明背后的完整论文,包含 722 篇数学手稿、覆盖 372 项重要结果。该目录来自对内部模型约 4,000 个研究问题的测试,经归类和筛选形成,几乎所有结果采用同一套标准流程。每项成果平均消耗相当于 ChatGPT Pro 思考 3 小时的算力。

  5. AI Will(@FinanceYF5)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布其开放问题成果背后的完整论文:722 篇手稿涵盖 372 类数学结果

    OpenAI 发布了其开放问题主张背后的完整论文,包含 722 篇手稿,涵盖 372 类数学结果。该目录的构建方式是在测试阶段让内部模型处理约 4K 个研究问题,再对输出分组和筛选,得到 372 个重要结果族。这些结果几乎都来自同一标准设置,每项平均消耗相当于 3 小时 ChatGPT Pro 思考的算力。

10月9日周五
  1. 字节跳动技术团队AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenViking 团队三篇论文拆解其上下文数据库核心技术

    OpenViking 团队围绕 Agent 的上下文管理发布三项研究:VikingMem(VLDB 收录)把记忆分为事件与实体两层并维护最新档案,在 LoCoMo 长期记忆评测上得 88.83。

  2. AI Will(@FinanceYF5)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    State of AI 第九份年度报告发布:AI 构建更好的 AI、世界模型与物理 AI

    State of AI 第九份年度报告正式发布,涵盖 AI 构建更好的 AI、世界模型、物理 AI、地缘政治、网络防御以及 12 个月预测等议题。报告可在 stateof.ai 阅读,作者 Nathan Benaich 另提供了主编剪辑版视频。

  3. 新智元AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    墨尔本大学与新南威尔士大学提出多会话语音记忆基准VoxMem,专治音频大模型记不住「谁说的、怎么说」

    墨尔本大学与新南威尔士大学联合团队提出多会话语音记忆基准VoxMem,用「声学证据×记忆操作」二维分类覆盖15种考察组合,包含799道题、3,196个评测实例、34,743个语音会话(约177小时),每道题在8K到64K token历史长度下保持不变。

  4. 国际大厂AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    英伟达 Physis-Lang:让自然语言成为世界模型的物理表征,增强视频物理真实性

    英伟达联合 MIT 和牛津大学提出 Physis-Lang,把物理原因、规律和结果写进语言描述,并贯穿数据筛选、训练与视频生成。其 Cosmos3-Super 和 Cosmos3-Nano 版本在 Physics-IQ Verified 榜单上分别以 48.2 和 43.3 分按平均分位列第一、第二,Super 较此前最高分提升 5.5 个百分点。

  5. elvis(@omarsar0)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 论文提出 VERA:将基准轨迹转为 9000 多个可重启沙箱并协同演进模型与 harness

    NVIDIA 发布论文 VERA,把基准轨迹转成 9000 多个可重启沙箱并附带 rubric 评分,只保留能运行且可依据可观察证据评分的环境。系统同时更新模型权重和 harness,harness 改动需通过自测并在开发集上至少提升 5 分才保留,模型 checkpoint 若得分下降超过 20% 则被拒绝。

  6. elvis(@omarsar0)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Voice Arena 的 Monsoon 语料:孟加拉语微调让 Whisper Medium 的 WER 从 85.27% 降至 7.65%

    Voice Arena 发布 Monsoon ASR 语料库七天内,已有 80 多家机构申请授权。在孟加拉语 FLEURS 上,用 Monsoon 微调 Whisper Medium 将词错率从 85.27% 降至 7.65%。Monsoon 覆盖 50 种语言共 10 万小时,多为长尾语言,计划 2 月扩展到 100 种语言、2027 年底达到 1000 种,并开放模型 API 供实验室自测。

  7. 美团技术团队AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团开源 LoHoSearch 搜索智能体评测基准,用知识图谱让机器自动出题

    美团 LongCat 团队开源 LoHoSearch,一个基于覆盖 762 万维基百科实体知识图谱自动生成题目的搜索智能体评测基准,含 544 道经人工核验题目、覆盖 11 个领域。

  8. 国际大厂AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    TouchScale 发布 500 小时人类视觉-触觉数据集,机器人真机成功率翻番

    德州农工大学、Google DeepMind、CMU 等 15 家机构联合发布 TouchScale,一个在统一传感器与采集流程下构建的 500 小时人类双手视觉-触觉数据集。

  9. 美团技术团队AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团 GeoRA:为 RLVR 设计的 LoRA,获 ACL 2026 杰出论文

    美团履约技术团队与北京大学提出 GeoRA,一种为 RLVR 显式对齐更新几何的低秩适配方法,已被 ACL 2026 接收为杰出论文(全球 18 篇入选)。

  10. 美团技术团队AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团 MTFM:统一推荐基座大模型在外卖多业务场景的落地实践

    美团在 MTGR 基础上提出统一推荐基座大模型 MTFM,首次实现外卖多个主要业务的统一精排模型,相关成果已被 KDD 2026 收录。MTFM 以异构 Tokenizer 与动态掩码实现多场景特征免对齐,通过混合注意力与 Target Scale-Up 提升 Scaling 能力,单样本计算量达 192 GFLOPs。美团外卖多业务订单量提升 2.06%~6.68%,在线推理成本降低 24%。

  11. Hunyuan(@TXhunyuan)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元联合复旦、清华发布 ExplorationBench:评测 AI 系统的探索能力

    腾讯混元联合复旦、清华推出 ExplorationBench,用于衡量 AI 系统如何探索未知规则,包含 31 处隐藏规则改动、70 项任务的 AlienCode 与 24 条补丁推理规则、70 条定理的 AlienLogic 两个可验证沙盒。

  12. elvis(@omarsar0)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HERMES harness 将 GPT-5.6 Sol 仓库迁移成功率从 6.5% 提升至 31.0%

    论文发现,在整仓库迁移任务上,同一模型和相同 effort 设置下把 Codex 换成 HERMES harness 后,GPT-5.6 Sol 的成功率从 6.5% 升到 31.0%,收益来自 harness 本身。

  13. AK(@_akhaliq)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    面向世界动作模型的视频原生动作先验学习论文发布

    一篇题为 Native Action-Prior Learning from Videos for World Action Models 的论文发布,提出从视频中直接学习动作先验,用于世界动作模型。论文页面可在 huggingface.co 查看。

  14. AK(@_akhaliq)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    PAMI:面向文本到人-物交互生成的部分锚定运动方法

    论文提出 PAMI(Part Anchored Motion),用于文本到人-物交互(Human-Object Interaction)生成,论文页面已发布在 Hugging Face Papers(编号 2609.38…)。

  15. elvis(@omarsar0)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    RSIGym:Evolvent AI 发布 AI 研究智能体训练环境,Opus 5 在 SWE-bench Verified 提升至 50.33%

    Evolvent AI 推出 RSIGym,把训练、推理、评测与沙箱打包成研究智能体可调用的服务,并开源代码、实验配置、研究轨迹和评测日志。以 Opus 5 作为研究者,改进后的系统在 SWE-bench Verified 上从 17.67% 升至 50.33%。

10月8日周四
  1. AI科技大本营AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    多加 50% GPU,Rollout 只快 10.3%:Agent 训练的瓶颈开始从模型转向系统

    中科大、香港科技大学与阿里巴巴研究者发布 PEARL 论文,针对 Agentic RL 中 Rollout 占端到端时间 81.8% 的 GPU 调度瓶颈,提出动态调整 GPU 角色与 Prefill–Decode 配置的弹性方案。

10月7日周三
  1. 新智元AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    2026年诺贝尔化学奖揭晓:95岁 Henri Kagan 与 Kenso Soai 破解生命同手性之谜

    2026年诺贝尔化学奖授予 Henri Kagan 和 Kenso Soai,表彰他们在不对称有机合成中发现非线性效应与自催化作用。Kagan 证明异手性催化剂配对会失活、实现手性放大,Soai 则发现 Soai 反应:起点仅 0.00005% 的手性偏差经三轮自催化放大至 99.5% 以上。

  2. Epoch AIAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 发布 InnovationEval:AI 能自动完成 AI 研发吗?

    Epoch AI 发布 InnovationEval 评测,用一篇已发表的在线策略自蒸馏(SDPO)论文作基准,测试 AI 能否独立提出有同等效果的新后训练算法。

  3. The Rundown AI(@TheRundownAI)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 用未公开内部模型发布 722 篇数学论文

    OpenAI 发布 722 篇由一款未公开内部前沿模型产出的数学论文,称这些结果解决或推进了数百个未解问题。该模型被输入约 4000 道题,每个结果平均消耗约三小时 ChatGPT Pro 级算力。OpenAI 表示曾咨询普林斯顿高等研究院数学与人工智能独立顾问组,并参考其公开建议决定发布方式,结果已上传至 github.com/openai/math。

  4. elvis(@omarsar0)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    论文提出 Harness-Aware Distillation:为小语言模型智能体做 harness 感知蒸馏

    一项新论文提出 Harness-Aware Distillation,用同一教师模型分别在带与不带 harness 信息下作答,训练学生模型偏好带 harness 时选择的动作,并用过滤器剔除与 harness 记录矛盾的配对,全程不使用任务奖励或成功标签。

10月6日周二
  1. Epoch AIAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    谁最容易受到芯片供应冲击?Epoch AI 拆解半导体投入产出数据

    Epoch AI 将半导体从国际投入产出表的宽泛电子类别中拆分出来,测算各国对芯片供应链冲击的暴露程度。2022 年每 1000 美元中国最终需求为半导体生产商带来 15.2 美元收入,是美国的 2.7 倍(美国为 5.7 美元)。在台湾供应中断叠加中西脱钩的模拟情景中,中国先进处理器价格上涨 17 倍、实际国民总支出下降 3%,美国则约为 20% 涨幅和 0.6% 降幅。

  2. QdrantAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google EmbeddingGemma 2 能压到多小?1-bit 量化省 30 倍向量内存

    Google DeepMind 发布开源嵌入模型 EmbeddingGemma 2,基于 Gemma 4,把文本、代码、图像、视频、音频映射到同一 768 维空间,文本路径为 270M 参数,支持 8K token 上下文,代码检索较初代提升 14%。

  3. 大模型智能AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hinton等22人发布首篇RSI论文,讨论AI研发自动化是否触发智能爆炸

    Geoffrey Hinton、Yoshua Bengio、Andrew Barto、Jakub Pachocki 等22位作者发布论文《What if automating AI R&D triggers an intelligence explosion?

10月5日周一
  1. clem 🤗(@ClementDelangue)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hugging Face 用代理把 Claude Code、Codex 等 10 个编码 harness 变成 RL 训练环境

    Hugging Face 的 Clement Delangue 介绍,团队在不改动 harness 和训练代码的前提下,把 Claude Code、Codex。

  2. AK(@_akhaliq)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    递归自改写实现复杂任务的扩展轨迹

    一篇题为《Scaling Trajectories for Complex Tasks through Recursive Self-Rewrite》的论文已在 Hugging Face 上线,提出用递归自改写来扩展复杂任务的性能轨迹。论文页面已公开,具体方法与结果细节以原文为准。

  3. elvis(@omarsar0)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    UT Austin 研究:编码智能体上下文压缩可能让运行更慢

    UT Austin 对编码智能体中的上下文压缩做了一项研究,在 SWE-bench Verified 和 Terminal-Bench 上跑了近 35,000 次智能体运行,分别改变压缩方式、触发时机和压缩比例三个变量。

10月3日周六
  1. 机器之心AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    亚马逊与杜克大学研究:万分之一稀疏监督即可提升大模型推理能力

    亚马逊与杜克大学研究发现,大模型后训练中每条 rollout 只保留一个 token 的梯度信号(占比约0.025%),学生模型推理能力反而显著提升。基于 Qwen3 的9组教师—学生配置及代码推理、Llama 系列、PPO-based RLVR 验证中均复现该现象,仅监督一到两个分歧最大的 token 即可匹配甚至超过全信号训练。极稀疏监督仅更新约10%网络参数,其机制仍待解释。

  2. Stanford AI Lab(@StanfordAILab)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 发布 SWE-chat v2:23 万条真实开发者与 AI 编程智能体交互数据集上线 HuggingFace

    Stanford AI Lab 与 Joachim Baumann 发布 SWE-chat v2,包含来自真实开发者的 23 万条 prompt、覆盖 1.8 万次会话,已上线 HuggingFace。该数据集记录人类与 AI 编程智能体的真实交互,v2 在上一版基础上规模进一步扩大,团队将在 COLM 会议上介绍相关工作。

10月2日周五
  1. lmarena.ai(@lmarena_ai)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何为后训练前沿图像模型设计奖励?LMArena 研究提出复合奖励方案

    LMArena 研究指出人类偏好奖励对后训练图像模型必要但不充分,模型仍会奖励好看却丢细节或引入无关内容的输出,因此提出复合奖励:约 560 万对人工投票训练的 Bradley-Terry 奖励模型、由视觉语言模型评估自动生成提示词清单的忠实度奖励、约束奖励与反奖励黑客评分奖励。

10月1日周四
  1. Epoch AIAI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 推出 ChatGPT 使用情况浏览器:基于 YouGov 5,000 名美国用户数据

    Epoch AI 发布 ChatGPT 使用情况浏览器,基于 YouGov 提供的 5,000 名美国 ChatGPT 用户聊天元数据,覆盖约 830 万条消息、66 万次对话,部分记录可追溯至 2022 年 11 月 ChatGPT 上线后数周。

  2. Demis Hassabis(@demishassabis)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 开源 SynthID Bio 为 AI 设计蛋白加水印

    Google DeepMind 将 SynthID 引入生物学领域,推出蛋白质水印方法 SynthID Bio,让 AI 生成的蛋白质可以被水印标记。相关成果发表在 Nature 上,团队还实现了兼具功能性与水印的 AI 设计蛋白质的成功合成,并将 SynthID Bio 工具开源供研究社区使用。Demis Hassabis 称这是 AI 时代生物安全的关键一步。

9月30日周三
  1. Berkeley AI Research(@berkeley_ai)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何把触觉世界建模扩展到十指?一种手指与姿态感知的触觉压缩器

    一种手指与姿态感知的触觉压缩器将10路指尖数据流映射为2个手部级潜变量,同时保留89.4%的融合前接触召回率,使训练速度提升2.26倍、推理速度提升1.29倍。该工作面向十指触觉世界建模的规模化问题。

  2. 大模型智能AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ACL 2026 杰出论文奖 | PALU:在关键前缀上最大化局部熵,让大模型精准“失忆”

    中国科学技术大学与新加坡国立大学团队提出 PALU(Prefix-Aware Localized Unlearning,前缀感知局部遗忘),从时序与词表两个维度做局部化约束:只干预敏感片段最前面的 N 个词元,且只对冻结参考模型选出的 Top-K logit 做局部熵最大化,并用 KL 散度约束非敏感词元分布。

9月29日周二
  1. Microsoft Research BlogAI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软研究院发布生物学 AI 研究系统 Quine

    微软研究院发布 Quine,一个面向生物学复杂性的多模态世界模型加交互式 harness,连接科学工具、文献、湿实验与研究人员。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并优先排序数千种化合物以改变肿瘤细胞状态,从缩小搜索空间到筛出候选仅用一个周末,排名最高的化合物在多种湿实验中获得验证。

  2. Thomas Wolf(@Thom_Wolf)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NanoGPT 训练记录降至 39.9 秒,提出「按 flop 价值取舍」新范式

    NanoGPT 训练纪录被刷新至 39.9 秒,比此前的 67.6 秒缩短 27.7 秒。该方案不再优化 matmul 或增加算子,而是逐 flop 判断价值。