跳到正文

#论文/研究

今日 11 条
10月5日周一
  1. 新智元AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Caltech 用物理信息神经网络求解无强迫三维欧拉方程奇点候选解

    Caltech 的 Anima Anandkumar 团队用物理信息神经网络(PINN),在无边界自由空间、无外加强迫项的条件下跑通了三维欧拉方程的自相似爆破奇点候选解,论文链接发布在 tensorlab.cms.caltech.edu。

  2. AK(@_akhaliq)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    递归自改写实现复杂任务的扩展轨迹

    一篇题为《Scaling Trajectories for Complex Tasks through Recursive Self-Rewrite》的论文已在 Hugging Face 上线,提出用递归自改写来扩展复杂任务的性能轨迹。论文页面已公开,具体方法与结果细节以原文为准。

  3. AK(@_akhaliq)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Octrees as an Explicit 3D Language:用八叉树作为显式 3D 语言的论文

    论文《Octrees as an Explicit 3D Language》提出将八叉树作为显式的 3D 语言表示,论文页面已在 Hugging Face Papers 上线(huggingface.co/papers/2610.02…)。该工作由 AK 在 X 上分享,附带的演示视频因浏览器不支持 video 标签未能直接播放。

  4. AK(@_akhaliq)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    EditHero:面向长程部件级 3D 编辑与 Vibe Modeling 的基准

    EditHero 是一个面向长程部件级 3D 编辑与 Vibe Modeling 的基准,论文已在 Hugging Face Papers 发布(编号 2610.02)。该基准聚焦长时程、部件粒度的 3D 编辑任务,具体指标与数据未在原文披露。

  5. 机器之心AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    VA-Bench 测出大模型空间智能执行断层:目标识别接近满分,完整任务成功率仅约一半

    VA-Bench 以观察、推理、行动、修正的闭环测试 12 个多模态模型,覆盖 14 类机器人操作任务共 280 个基础场景。表现最好的模型在目标识别与定位上达到 100%、操作语义理解达到 99.6%—100%,但 Qwen3.8-max、Opus-5 和 GPT-5.6-sol 的完整任务成功率分别只有 53.93%、52.86% 和 51.55%。

  6. AINLPAI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软与 UCSB 提出 ScholarEvolve:用论文进化 Agent Harness

    微软与加州大学圣巴巴拉分校研究者公开论文 ScholarEvolve,从已发表 Agent 研究中提取改进思路,写入运行框架 Harness,再用真实任务检验,执行任务的模型本身保持不变。

  7. elvis(@omarsar0)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    UT Austin 研究:编码智能体上下文压缩可能让运行更慢

    UT Austin 对编码智能体中的上下文压缩做了一项研究,在 SWE-bench Verified 和 Terminal-Bench 上跑了近 35,000 次智能体运行,分别改变压缩方式、触发时机和压缩比例三个变量。

  8. Epoch AIAI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:OpenAI 编码智能体使用量约每月翻倍

    Epoch AI 基于 OpenAI 2026 年 9 月发布的内部数据整理发现,OpenAI 研究人员的编码智能体使用量约每月翻倍。按 API 价格计价,中位数研究员的日均编码智能体支出从 2026 年 1 月的不足 1 美元升至 8 月中旬的 601 美元,第 90 百分位研究员同期超过 7000 美元。

10月4日周日
  1. 机器之心AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    南洋理工大学安波团队研究:Agent Harness 如何按模型与任务组合选择

    新加坡南洋理工大学安波教授团队发布报告《Finding the Right Fit: Model–Harness Interactions across Agent Tasks》。

  2. cohere(@cohere)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere 团队将在 WMT 2026 分享 North Small 翻译模型技术细节

    Cohere 团队将在今年 10 月的 WMT 2026 大会上分享其翻译模型的技术细节,相关视频同步放出。推文同时给出完整技术报告链接 cohere.com/north-small-tr,团队研究员 Kocmi 也参与其中。

  3. 大模型智能AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    把 Depth Anything 砍到 6M,DepthART 让深度估计跑进 Jetson

    DepthART 将单目深度基础模型压缩到 6.0M 参数:用抗偏置数据采样从约 4400 万张候选图像筛出约 170 万张均衡数据,再以 Depth Anything V2-L 伪深度蒸馏到 TinyViM+DPT。

10月3日周六
  1. AI科技评论AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴佳俊 IROS 2026 演讲:结构化表征是机器人学会推理的脚手架

    斯坦福大学助理教授吴佳俊在 IROS 2026 的 RoBoWoMo 研讨会上发表《Building Physical Agents via Structured Representations》报告,提出用结构化表征搭建物理世界智能体。他介绍了从演示中学习谓词与原子动作、让模型自行提出 DSL、并用演示标签对视觉判据做后训练等路径,并透露最近投稿的工作已将规划器也换成后训练的开源视觉模型。

  2. 机器之心AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    亚马逊与杜克大学研究:万分之一稀疏监督即可提升大模型推理能力

    亚马逊与杜克大学研究发现,大模型后训练中每条 rollout 只保留一个 token 的梯度信号(占比约0.025%),学生模型推理能力反而显著提升。基于 Qwen3 的9组教师—学生配置及代码推理、Llama 系列、PPO-based RLVR 验证中均复现该现象,仅监督一到两个分歧最大的 token 即可匹配甚至超过全信号训练。极稀疏监督仅更新约10%网络参数,其机制仍待解释。

  3. cohere(@cohere)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere 提出 RCP-nDCG@10:不只看答案键,逐条评估检索结果相关性

    Cohere 提出 RCP-nDCG@10,替代传统 nDCG 只给答案键内结果记分的做法,对每条结果按其真实相关性打分。该指标结果由人工审核员与 MTEB 背书。

  4. Stanford AI Lab(@StanfordAILab)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 发布 SWE-chat v2:23 万条真实开发者与 AI 编程智能体交互数据集上线 HuggingFace

    Stanford AI Lab 与 Joachim Baumann 发布 SWE-chat v2,包含来自真实开发者的 23 万条 prompt、覆盖 1.8 万次会话,已上线 HuggingFace。该数据集记录人类与 AI 编程智能体的真实交互,v2 在上一版基础上规模进一步扩大,团队将在 COLM 会议上介绍相关工作。

  5. Stanford AI Lab(@StanfordAILab)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    语言模型 tokenization 有哪些出人意料的特性?Stanford AI Lab 分享相关研究

    Stanford AI Lab 分享了一场关于语言模型 tokenization 的演讲,题为《Tokenizer 迷思与如何破除它们》,相关预印本即将发布。演讲由 Rylan Schaeffer 主讲,聚焦 tokenization 中一些有趣且可能出人意料的特性,并公开征集反馈。

  6. AK(@_akhaliq)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Adaptive Reward Routing:面向音视频联合扩散模型的前向过程 RL 多奖励优化

    论文提出 Adaptive Reward Routing,面向音视频联合扩散模型做动态多奖励优化,方法基于前向过程 RL(Forward-Process RL)。论文已发布在 Hugging Face Papers(编号 2609.37)。

  7. Harrison Chase(@hwchase17)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Harrison Chase 点评 Google 多智能体证明发现论文的验证者独立上下文模式

    Harrison Chase 点评一篇 Google Research 的多智能体证明发现论文,认为验证者从干净上下文起步的模式值得借鉴,探索者的推理无法说服验证者接受错误证明,探索者因此可以大胆尝试,由验证者筛掉错误方向,DeepAgents 子智能体拥有独立上下文也是同一道理。

  8. AK(@_akhaliq)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    EgoTools:面向真实第一人称视频的工具中心推理

    论文 EgoTools 提出面向真实第一人称视频的工具中心推理,论文已在 HuggingFace 上线(编号 2609.39…)。目前仅有论文链接与演示视频,未披露模型规模、benchmark 分数或开源情况。

10月2日周五
  1. lmarena.ai(@lmarena_ai)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何为后训练前沿图像模型设计奖励?LMArena 研究提出复合奖励方案

    LMArena 研究指出人类偏好奖励对后训练图像模型必要但不充分,模型仍会奖励好看却丢细节或引入无关内容的输出,因此提出复合奖励:约 560 万对人工投票训练的 Bradley-Terry 奖励模型、由视觉语言模型评估自动生成提示词清单的忠实度奖励、约束奖励与反奖励黑客评分奖励。

  2. Stanford AI Lab(@StanfordAILab)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    斯坦福 AI Lab 提出 Training Witnesses:用算法为 ML 会议的数据与评测提供"诚实"证书

    Stanford AI Lab 介绍 Training Witnesses,一套可为数据和评测生成"诚实"证书的系统,验证者可低成本核验并信任结果。该工作针对会议投稿过载这一长期少被探索的问题,主张用技术治理手段重建对 ML 会议系统的信任,从而让研究能建立在他人的贡献之上。

  3. 大模型智能AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    世界—动作模型综述:从预测未来到机器人闭环控制

    MBZUAI、Caltech 等机构发布综述《World-Action Models for Robot Learning and Control: A Survey》,系统梳理世界—动作模型(WAMs)的概念、架构、训练与评测,核心是把未来世界预测与可执行动作生成连接起来。论文按语言接口、视觉编码器、预测骨干与动作解码器拆解 WAM,并区分联合预测与逆动力学两条路径,覆盖操作、导航与自动驾驶。

10月1日周四
  1. Epoch AIAI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 推出 ChatGPT 使用情况浏览器:基于 YouGov 5,000 名美国用户数据

    Epoch AI 发布 ChatGPT 使用情况浏览器,基于 YouGov 提供的 5,000 名美国 ChatGPT 用户聊天元数据,覆盖约 830 万条消息、66 万次对话,部分记录可追溯至 2022 年 11 月 ChatGPT 上线后数周。

  2. AK(@_akhaliq)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LongLive-Plug:面向视频生成的一次性通用蒸馏

    LongLive-Plug 提出一种面向视频生成的“plug once-for-all”蒸馏方法,论文已发布在 Hugging Face Papers。该方法主打一次蒸馏即可通用适配,具体加速倍数与评测结果原文未披露。

  3. AK(@_akhaliq)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Omni-IO Skills:让 AI 智能体实现 Omni-Native 的论文发布

    论文 Omni-IO Skills 提出让 AI 智能体具备 Omni-Native 能力,论文已在 Hugging Face 上线。该工作由 AK(@_akhaliq)发布,配文包含演示视频,附论文链接 huggingface.co/papers/2609.31…。

  4. AK(@_akhaliq)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LEGO-Anything:面向 3D 场景重建的编码智能体

    LEGO-Anything 提出用编码智能体(Coding Agents)做 3D 场景重建,论文已发布在 Hugging Face Papers(编号 2609.36)。该工作把 3D 场景重建任务交给编码智能体完成,具体方法与实验结果见论文原文。

  5. Demis Hassabis(@demishassabis)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 开源 SynthID Bio 为 AI 设计蛋白加水印

    Google DeepMind 将 SynthID 引入生物学领域,推出蛋白质水印方法 SynthID Bio,让 AI 生成的蛋白质可以被水印标记。相关成果发表在 Nature 上,团队还实现了兼具功能性与水印的 AI 设计蛋白质的成功合成,并将 SynthID Bio 工具开源供研究社区使用。Demis Hassabis 称这是 AI 时代生物安全的关键一步。

  6. Microsoft Research(@MSFTResearch)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软研究:新机器学习系统可提前 30-60 分钟预测极端太空天气受损区域

    微软研究院提出一种机器学习系统,可在极端太空天气风暴到达前 30-60 分钟预测地球电力系统、GPS 精度与卫星运行最可能受损的位置。该研究针对极端太空天气事件对地面电网和卫星作业的破坏性影响。

9月30日周三
  1. Hunyuan(@TXhunyuan)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元联合复旦、清华发布 ExplorationBench 探索能力基准

    腾讯混元、复旦大学和清华大学的研究者发布 ExplorationBench,用于衡量 AI 系统的探索能力,并构建了规则可执行、与已知知识冲突的 Alien Worlds 环境。

  2. AK(@_akhaliq)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SpatialClaw:重新思考智能体空间推理的动作接口

    SpatialClaw 提出重新思考智能体空间推理的动作接口,相关论文已发布在 Hugging Face Papers。原文未披露模型规模、benchmark 分数或开源情况。

  3. NVIDIA AI(@NVIDIAAI)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 发布 Physis-Lang:为视频世界模型补上物理推理

    NVIDIA 研究人员发布开源自进化框架 Physis-Lang,通过为视频描述加入物理解释来提升世界模型的物理推理能力。仅将物理推理加入提示词、不做重训练,NVIDIA Cosmos 3 的 PhyGenBench 分数即提升 5.62 分。论文与项目已上线。

  4. Berkeley AI Research(@berkeley_ai)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Dextac-WAM 项目网站上线:新增真机演示、世界模型预测与触觉可视化

    Dextac-WAM 项目网站新增真机演示、世界模型预测、触觉可视化、消融实验与详细说明,网址为 dextacwam.github.io。

  5. Berkeley AI Research(@berkeley_ai)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何把触觉世界建模扩展到十指?一种手指与姿态感知的触觉压缩器

    一种手指与姿态感知的触觉压缩器将10路指尖数据流映射为2个手部级潜变量,同时保留89.4%的融合前接触召回率,使训练速度提升2.26倍、推理速度提升1.29倍。该工作面向十指触觉世界建模的规模化问题。

  6. Berkeley AI Research(@berkeley_ai)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Berkeley AI 开源 DexTacWAM:面向灵巧操作的视触觉世界-动作模型

    Berkeley AI 人类智能中心发布 DexTacWAM,一个将预训练视频世界模型通过持续视触觉学习改造而成的视触觉世界-动作模型,用于多指接触预测与动作生成。

  7. Microsoft Research(@MSFTResearch)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软研究院 Quine:构建生物学的多模态世界模型

    微软研究院启动早期研究项目 Quine,旨在构建生物学的多模态世界模型,打通不同生物尺度和模态间的洞察。Quine 帮助科学家以计算方式搜索远超直觉范围的假设空间,并在进入实验室前对假设排序;实验结果再作为反馈,帮助研究者校准后续研究方向。

  8. 大模型智能AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ACL 2026 杰出论文奖 | PALU:在关键前缀上最大化局部熵,让大模型精准“失忆”

    中国科学技术大学与新加坡国立大学团队提出 PALU(Prefix-Aware Localized Unlearning,前缀感知局部遗忘),从时序与词表两个维度做局部化约束:只干预敏感片段最前面的 N 个词元,且只对冻结参考模型选出的 Top-K logit 做局部熵最大化,并用 KL 散度约束非敏感词元分布。

9月29日周二
  1. Thomas Wolf(@Thom_Wolf)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NanoGPT 训练记录降至 39.9 秒,提出「按 flop 价值取舍」新范式

    NanoGPT 训练纪录被刷新至 39.9 秒,比此前的 67.6 秒缩短 27.7 秒。该方案不再优化 matmul 或增加算子,而是逐 flop 判断价值。

  2. LlamaIndex 🦙(@llama_index)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 探讨 Jev 类模型在文档解析中的早期方案

    LlamaIndex 探索了 Jev 及同类模型在文档解析任务上的早期方案,覆盖方向检测、语言检测、路由等场景。文档解析需要大量即时决策,这些任务正是其中的关键环节。

  3. SemiAnalysisAI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM5.3 稀疏注意力如何影响 HBM 显存占用

    SemiAnalysis 分析 GLM-5.3 采用 DeepSeek Sparse Attention 后,稀疏注意力虽降低了 SDPA 阶段的 KV cache 读写需求,但 top-k 选择仍需完整上下文驻留 HBM,因此并未消除显存容量瓶颈。

  4. AK(@_akhaliq)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    FuseReg:正则化层融合缓解表征自编码器的重建-生成差距

    论文提出 FuseReg,通过正则化层融合缓解表征自编码器中的重建-生成差距。论文已在 HuggingFace 上线(huggingface.co/papers/2609.31…)。