Perplexity 研究:用提示引导自蒸馏后训练 Computer 模型,工具调用失败率降低 21.2%
Perplexity 通过提示引导自蒸馏(hint-guided self-distillation)对 Computer 模型进行后训练,让模型从自身错误中学习。在线 A/B 测试中,较晚训练出的 checkpoint 相比早期 checkpoint 将工具调用失败率相对降低 21.2%。
Perplexity 通过提示引导自蒸馏(hint-guided self-distillation)对 Computer 模型进行后训练,让模型从自身错误中学习。在线 A/B 测试中,较晚训练出的 checkpoint 相比早期 checkpoint 将工具调用失败率相对降低 21.2%。
Sluicebox 构建了名为 Lucy 的 AI 供应商智能体,用于梳理零部件清单、文档和供应商邮件等数据,帮助工程师在设计阶段就了解数据中心碳足迹。Lucy 基于 NVIDIA Nemotron 3 Ultra,在 Sluicebox 测试中提升了准确率,成本降低 51–80%,响应速度最高提升 2 倍。
onPanda 提出通过 Token 级纠正实现 LLM 与智能体的 on-policy 对齐数据高效标注,论文已发布在 Hugging Face Papers。该工作面向对齐训练数据的标注环节,具体方法与实验结果可查阅论文原文。
DolphinBench 是一个新的智能体记忆基准,在长历史对话后直接评测智能体的动作是否正确,而非问答式打分,并把准确率、成本与延迟放在同一张榜单上。它针对现有记忆评测已趋于饱和、且忽略选型时最关键的成本与延迟问题,主张关注工具调用中真正决定成败的事实。
AICC2026 人工智能计算大会上,播客屠龙之术梳理出三条主线:从 Chat 到 Agent 的需求侧结构性跃迁、智能从概率拟合转向可信生产、以及算力与芯片在系统、器件、生态上的突围。会上 IDC 与浪潮信息联合发布《中国人工智能计算力发展评估报告》,并提到浪潮信息的智算系统双唯进化主张与新产品、芯算一体、让计算走进存储,以及 FlagOS 生态下的国产模型与国产芯片 Day 0 适配。
一个智能体记忆基准需满足三项属性:按行动评分、在准确率之外同时衡量成本与延迟、以及可解性认证(带历史能通过、不带历史则失败)。该观点用于对比现有的 Agent Memory Benchmarks。
Anthropic 成立生命科学实验室,让 Claude 智能体在 DNA 数据库中自主搜索,发现了一种与重复序列关联的新型逆转录酶系统 ART,相关预印本已发布。
Firecrawl 宣布将这笔资金用于 Alexandria,帮助研究者、出版商、专家、内容创作者和数据提供方获得报酬,以便为 AI 智能体提供更好的信息。该平台现已开放提供方等待名单(waitlist)申请。
Firecrawl 正在构建 Alexandria,目标是让 AI 能够利用世界快速增长的数据,解决人类最棘手的问题。该项目被形容为"为超级智能建造的图书馆",并已通过 firecrawl.dev/careers 开放招聘。
Alexandria 完成由 Smash Capital 领投的 7500 万美元 B 轮融资,目标是为超智能构建全球最大的知识库。该平台让 AI 智能体即时接入最强数据集与数据供应商。
ElevenLabs 发布语音转文本模型 Scribe v2 Medical,针对临床音频微调,相较基础版 Scribe v2 在临床音频上的词错误率(WER)降低 18%。该模型提升了对药物名称、解剖结构和病理术语的识别能力。
快手技术团队联合北京航空航天大学提出面向工业级推荐模型训练的自适应检查点系统 AdaptCP,相关论文已被 EuroSys 2027 接收。
晚点独家获悉,理想芯片子公司正推进首轮外部融资,投前估值约 150 亿元,计划融资数十亿元。工商信息显示,Mach Intelligent Cores Limited 于 7 月 14 日在香港成立,其全资持有的上海马赫智芯智能科技有限公司于 8 月 4 日成立,理想 CTO 谢炎任法定代表人。
阿里在云栖大会集中发布 ROLL、RTP-LLM、Atrex Kernel Agent、OpenSandbox、Open Agent Auth、OpenCodeReview 六个开源项目,分别面向大规模强化学习、生产级推理、异构算子生成优化、Agent 沙箱运行、企业级授权和智能代码评审。
腾讯混元团队把 Hy4 preview 的权重从约 1.5TB 压缩到 214 GiB,参数量仍为 770B,改变的是权重的表示方式。
Epoch AI 发布研究《The plunging price of thought》,测算达到同一性能水平的 AI 推理成本自 2023 年以来约每季度下降 47%,即每年约 13 倍。
TypeSafe 于 9 月 15 日发布首个模型 Jev,它不生成文本、只输出带置信度的判断,速度比前沿大模型快两百倍、价格便宜四百倍。CEO Diogo Almeida 认为 RLHF 把人类偏好放进训练循环,导致谄媚与幻觉,AI 因此无法离开人实现自动化,Jev 选择优化"校准的决策"这条第三条路。
White Circle 发布开源模型后训练框架 Halo,吞吐量最高达原生 TRL 的 2.8 倍,峰值内存更低,且模型保持 HuggingFace 原生格式。HuggingFace CEO Clement Delangue 转发称,借助智能体,训练模型正变得越来越容易。
Thomas Wolf 认为,在 RLVR 新范式下,发布大量高质量开源 RL 环境相当于当年共享高质量预训练数据,是当下推动开源前沿最有影响力的事。他转述 eliebakouch 的说法称,对方将开源约 7k RL 训练数据及框架,并已发布模型与技术报告,距启动最终 RL 训练不到 1 周。
SemiAnalysis 解析 MoE 推理的计算与数据搬运,将模型服务拆为 Prefill、Midfill、Decode attention、Decode experts 四种运行模式,各自对算力、内存和网络的需求不同。
微软研究院在 Nature 发表逆合成模型 RetroChimera,将 Transformer 的 R-SMILES 2 与基于 GNN 的 NeuralLoc 通过可学习集成排序结合,预测结果优于任一子模型。
关停的初创公司 eidon.ai 将 1,274 小时第一人称视角机器人数据开源,包含 13,451 段人类完成日常任务的录制,作为送给机器人社区的礼物。数据已发布在 Hugging Face 上。
快手在第五期技术沙龙上首次系统披露 Data Agent 规模化落地数据:平台 WAU 突破 10,600,周人均对话 55 次,数据分析师与产品运营渗透率超 80%,NPS 达 73.5,单次任务提效中位数 13 倍。
侵入式脑机接口公司智冉医疗完成新一轮融资,估算金额超6亿元,顺禧基金、君联资本、红杉资本、美团龙珠等参与投资,累计融资已超12亿元。其128通道脑机接口系统今年5月启动多中心GCP注册临床,计划年内完成30至40例患者入组,预计明年提交三类证注册申请,下一代1024通道产品已定型。
阿里云智能副总裁安筱鹏在中国国际大数据产业博览会上提出,AI时代企业护城河取决于数据从比特到Token的转化率,而非数据存量或模型强弱。他引用a16z报告称,今年2月AI智能体的Token消耗首次超过人类用户,到8月已达人类用户的5倍,前沿企业与一般企业的Token消耗差距从2.6倍扩大到8.3倍。企业需构建数据知识资产化、模型管理、智能体开发运营三大平台,以及智能体运营与模型训练两个飞轮。
清华交叉信息研究院助理教授徐梦迪的核心研究方向是机器人的 in-context learning:让机器人到新环境后通过一两次交互当场学会新任务,且越学越快。节目录制后第二周,Generalist 发布 GEN-1.5,仅给机器人看一段 3-12 秒动作示范作为 physical prompt,不做微调、不更新参数即可当场尝试新任务,10 项任务平均成功率约 59%。
Nathan Lambert 猜测,在规模化强化学习上,多数中国头部 AI 实验室正开始大量用华为做推理、用 Nvidia 做训练(特殊架构可能除外)。他认为随着智能体集群和更大规模后训练成为常态,这会加速中国本土产业。
OpenAI 动用 10,000 个智能体证明 Navier-Stokes 方程会失效,引发关于提示词数据隐私与 AI 在数学中角色的争论。DeepSeek V4.1 Flash 则推出全新架构,面向更低成本的长上下文工作负载。上述内容来自 DeepLearning.AI 每周两次的短讯 newsletter Data Points。
Founder Park 编译 YC 播客《The Lightcone》内容,YC CEO Garry Tan 与合伙人 Diana Hu、Jared Friedman、Harj Taggar 复盘过去 12 到 18 个月的批次数据。
快手电商直播技术团队将"主播说话到字幕上屏"端到端耗时从1.5~2秒压缩到400~500毫秒,字错率(CER)从7.81%降至3.51%,并支撑千万级持续并发分发。系统按"拉流—识别—对齐—分发—渲染"链路建设,用 PTS 队列统一媒体时间线,以房间事件加两级级联实现一份计算多方消费,客户端按播放器 PTS 驱动字幕渐进吐字与修正。
DSV4.1 的 Engram 表被评价为"超级酷",其核心思路是一切都靠压缩,之后一切都靠缓存。该帖未披露具体参数量、benchmark 分数或可用性信息。
作者用 ChatGPT Pro 中的 GPT 6 Astra 将《桃花源记》全文做成可实时交互的 3D 网页《桃源·豁然开朗》,拆成 20 幕,支持连贯体验与逐章慢读、原文与白话切换。
Stanford AI Lab 提出 Context-Sharded Block Parallelism(CSBP),一种面向扩散 LLM 的分布式并行策略,训练加速随上下文长度增长而提升。
SemiAnalysis 分析了 DeepSeek 式 Engram 多 token 查表嵌入的协同设计思路:每个 token 只访问地址依赖 token ID 的少量嵌入行,运行时可在前层计算时从 host DRAM 预取,使嵌入表无需常驻 HBM。
Kastle 正在为银行构建 AI 员工,其智能体可自动化抵押贷款服务、消费信贷等后台运营流程。目前 Kastle 已与 25 家顶级抵押贷款服务商中的 10 家合作,累计处理交易额超过 20 亿美元。该公司在参加 YC 两年后完成 2400 万美元 A 轮融资,两位创始人分享了如何让智能体可靠到足以处理真实金融交易。
Qdrant 举办的 Vector Space Stream 直播结束,全程超过 4 小时,覆盖 token 原生存储、向量压缩、机器人、新型嵌入向量几何、双编码器、自适应混合搜索、十亿级规模评估以及计算与存储分离等主题。错过直播的观众现可在 YouTube 观看回放,并可通过 Qdrant 的 Discord 社区继续讨论。
Epoch AI 基于 2025 年 1 月至 2026 年 8 月的全部数学 arXiv 预印本分析发现,致谢 AI 使用的论文比例从 4 月的 4% 升至 8 月的 25%。
Anthropic 与 Adaptyv Bio 合作举办蛋白质设计竞赛,将实验验证超过 5000 个设计。Anthropic 提供最高 100 万美元 Claude credits 及实验验证资金,Modal 出资最高 25 万美元算力,Twist Bioscience 提供 DNA。竞赛详情与报名入口分别发布于 Adaptyv 的 Proteinbase 页面和 Google 表单。
Anthropic 公布三项用于追踪 AI 发展的指标:AI 承担了多少 AI 研发工作、AI 智能体的受监督程度、算力如何分配,并给出 Anthropic 内部的指标快照。Anthropic 表示任何前沿开发者都可发布同样的指标,第三方也可验证,以缩小前沿实验室与公众之间的信息差。
LlamaIndex 上周参加 Connected Stack 大会,@jerryjliu0 在 Founder Flash Talks 环节指出企业智能体普遍面临的问题:通用模型难以读取杂乱复杂的文档。LlamaIndex 将自己定位为面向智能体的文档基础设施,因为智能体正在成为新的知识工作者。