腾讯混元 Hyra 数学能力再进阶:3D Blaschke–Lebesgue 等四项问题取得新进展
腾讯混元 Hyra 在数学领域再获四项进展:3D Blaschke–Lebesgue 常数宽度体普遍下界从 0.380799w³ 提升至 0.411040w³。
腾讯混元 Hyra 在数学领域再获四项进展:3D Blaschke–Lebesgue 常数宽度体普遍下界从 0.380799w³ 提升至 0.411040w³。
Milvus 3.0 Storage V3 引入 Manifest,用一个统一位置描述数据集状态:某个版本包含哪些文件、遵循什么 schema、适用哪些删除操作,以及关联的统计与索引。
Kevin Weil 赞同 Fidji Simo 的观点,认为不应让 AGI 只服务于企业生产力而错过科学加速。他指出,从更聪明的模型到治愈疾病之间缺失大量基础设施,许多地方缺乏理解疾病所需的生物数据。他因此最看好 AI 率先在癌症领域取得突破,因为基因组学、病理、影像等领域已有数十年积累的数据集,但模型智能与生物基础设施必须同步扩展。
Nathan Lambert 认为,开源语言模型(带完整训练配方)更像开源操作系统,而开放权重模型只是基于它构建的软件版本,二者不应混为一谈。Nvidia 据报投入 260 亿美元推进近乎开源的 Nemotron 等模型,目的是让无数公司都能造"token 机器",从而持续拉动其芯片需求。
Import AI 第 469 期介绍新基准 DiG-bench,用 70 款隐藏规则的文字游戏测试 AI 自主发现环境规律的能力,Claude Opus 5 与 Fable 5 配合 Claude Code 表现最佳,GPT-5.5 紧随其后,但仅 Opus 5 和 Fable 5 能在最难的第 7 档取得 0.2 的成绩。
《晚点聊》第 179 期与《晚点 LatePost》主笔高洪浩讨论蒸馏,这一技术从早期的模型压缩演变为让模型变强的手段,并在 2026 年出圈。节目提到字节讨论训练超 5 万亿参数模型,张一鸣判断不蒸馏、也不被 Coding 这类短期热点影响,认为蒸馏最多只能逼近、很难真正超越。讨论还涉及智能体轨迹蒸馏、大规模蒸馏的数据管线与 know-how、蒸馏行为能否被隐藏,以及学生模型能否超越教师模型。
42章经将于北京时间 8 月 22 日(周六)上午 10:30 举办线上活动,邀请 Evolvent AI 联创繁青与数十位 Model Researchers 交流 RSI、合成数据等话题,免费参加。
前 Kimi 研究员、Evolvent AI 联创繁青认为,国内模型与国外差距缩小主要靠预训练架构创新,如 Kimi Linear 和 DeepSeek 的 Multi-head Latent Attention,蒸馏只是补后训练数据积淀不足的手段。
用 DistilBERT 微调出一个输出 0-100 分 AI 生成概率的检测器,并作为 verifier 训练小语言模型写出能规避检测的文本。项目最终交付一个可供人类和 AI 智能体调用的检测 API 及本地浏览器 UI,支持整篇评分与按文本片段高亮打分,目标是讲解 AI 检测器的工作原理及其局限。
Qdrant 与 Minima 在单张 RTX PRO 6000 Blackwell GPU 上实现智能体 RAG,混合搜索与晚交互重排让首次检索即足够的比例从 72% 提升至 87%。中位延迟由 21.3s 降至 7.7s,每 GPU-小时成功任务数提升 2.92 倍。
Firecrawl 为 Firecrawl Research Index 新增 4100 万+ 篇生命科学论文,覆盖药物发现、临床试验和生物学文献,AI 智能体现可通过 /search/research API 检索,recall @10 达 90%。内容全部来自权威来源且 100% 免费。
Mem0 正在构建独立的记忆层,认为记忆不该是一个塞满旧对话的巨型提示词,而应拥有自己的层。该帖将其称为真正的调试界面(debugging surface)。
mem0 指出,多数被归咎于"模型"的失败实际发生在记忆管线各环节:抽取漏掉事实、系统存入临时噪声、更新逻辑未能解决冲突、检索拉取错误记忆。该帖未给出具体模型或版本,也未提供 benchmark 数据。
LlamaIndex 推出 ExtractBench,用 1950 年代监管文件、手填税表及经传真阈值化、复印机色调曲线、传感器噪声和手机拍摄退化的页面测试了 14 个文档抽取系统。
英伟达研究副总裁刘洺堉透露,其领导的唯一项目世界基座模型 Cosmos 已发布至第 3 代,直属团队不到 100 人,虚线汇报规模 200 至 300 人,黄仁勋要求他"做到 Cosmos 97"。他表示英伟达不做存量竞争,目标是像 CUDA 一样造出 Physical AI 这一新市场,因此坚持开源模型帮助具身智能领域分担压力。
Bayer 用 Qdrant 构建企业级搜索引擎,支撑内部生成式 AI 平台 myGenAssist 每月处理超 150 万条消息、已接入逾 45 万份上传文档,覆盖 11.6 万名员工。
Minima 基于 Qdrant 混合检索与 Qwen3.6-27B 构建有界检索智能体,在单张 96 GB NVIDIA RTX PRO 6000 Blackwell GPU 上实现 3,750 任务/GPU-小时,而稠密检索加 BF16 推理仅 1,350,提升 2.92 倍。
Epoch AI 基于其 AI Chip Sales Hub 数据测算,自 2023 年以来每季度购买的 AI 芯片每美元性能年均增长约 49%(90% CI:36%–66%),按此速度约每 1.7 年翻倍。
LlamaIndex 发布文档抽取基准 ExtractBench,覆盖 370 份企业文档、14 个系统,最难的测试是长列表完整性:26,725 行的无主财产清单、8,624 条债权人矩阵、3,063 项持仓的 13F。
Interconnects AI 作者 Nathan Lambert 完成了一本关于 RLHF 的后训练教科书《Reinforcement Learning from Human Feedback》,写作中借助 LLM 处理 LaTeX 公式、大量 copyediting 和 TikZ/Python 图表。
这期播客从神经科学角度讨论长期使用 AI 工具对学习和记忆的影响。节目引用 MIT Media Lab 研究称,长期用 AI 写作的年轻人脑电活动偏低,研究者将依赖 AI 后大脑激活减弱、记忆下降的现象称为认知债务;同一实验里,用 ChatGPT 写 SAT 作文的一组神经耦合度最低,且难以复述自己写的句子,4 个月后换回手写大脑活性依然偏低。
Epoch AI 以 Anthropic 为例分析算力扩张的资金来源,认为短期内融资不太可能成为前沿算力增长的约束。
Chai Discovery 联合创始人 Matt McPartlon 与产品负责人 Patil 详解 Chai-2 与 Chai-3 如何逼近一次性生成治疗级分子,以及其类 CAD 设计套件让科学家精确设计抗体与结合位点。他们称 AI 药物设计已从演示阶段跨入药企可信工具,更快的模型到实验室反馈闭环有望把药企瀑布式发现流程变成迭代循环。
微软研究院推出研究模型 CARE-X,一个统一胸部 X 光 VLM,可兼顾报告生成与结构化诊断预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。另一项独立实验中,团队将 Qwen3-VL-4B-Instruct 与确定性测量工具配对,检验直接计算能否改善心脏增大等依赖测量的病变判断。
LlamaIndex 发布 ExtractBench,用于评测复杂企业文档的信息抽取能力,测试覆盖 14 个系统(前沿 VLM、编程智能体和抽取 API)、370 份企业文档、4,869 页、67 种文档类型,全程无 LLM 评判、完全确定性。
Naval 发帖称"认真做软件的人会训练自己的模型",该帖获得 11878 次点赞、712 次转发和 132 万次浏览。
智库 IFP 提出 23 条"低后悔"政策建议,分属 7 大类,旨在帮助政策制定者应对 AI 研发进一步自动化的风险。MIT 与 Columbia 的论文 Racing to Ruin 用博弈模型分析前沿企业竞争,结论是透明度和把对手视为可信理性方是协调放缓的两个关键变量。本期还介绍了一个 PostTrainBench+ 相关内容和一篇关于智能机器的虚构短篇。
小度 AI 智能助手团队以信息类 Bot Aries 为试点,打通从 bad case 发现、归因到上线解决的 Agent 研发闭环,主张“不确定的交给 Agent,确定的交给代码,不可逆的交给人”。
在 Qdrant 集合中,重复点占据 top-5 结果槽位会拖垮回答质量:把 8,416 个独立点重复写入至 22,946 个点后,37 个测试问题中有 36 个 top-5 含重复,去重后降至 2 个,回答正确率从 0.57 升到 0.76。
Evolvent AI 联合创始人孟繁青认为,蒸馏只是加速手段,并非国内模型变强的决定性因素,即便海外封掉所有蒸馏通道,国模仍可靠预训练架构创新构建竞争力。他提出国内模型的特色不在偏工程的 Post-training,而在资源限制倒逼出的 Pre-training 架构创新。Evolvent AI 最近发布了新研究成果 RSIBench-Data。
Adam D'Angelo 认为,AI 领域的边际收益递减不像传统软件开发那样强烈,价值都集中在前沿。他指出知识蒸馏虽有损害,但不足以抵消规模经济效应。
LlamaIndex 指出,跨三代 GPT 模型文档解析准确率提升约 24 分,但每页成本上涨 4 倍,最新前沿模型仍落后于专用解析器。该机构认为"OCR 只是前沿模型的一个功能、会被吃掉"的说法与数据不符,并撰文分析这一差距为何持续存在且不断累积。
Jeff Dean 正在筹备新公司 Discovery Loop,当前首要任务是寻找办公场地并在未来几周内组建创始团队,同时启动基础设施与 AI 模型的搭建。首个切入领域是自动化 ML 研究与工程中的大规模实验,公司将成为自身产品的首个客户,并通过快速反馈迭代。招聘信息见 discoveryloop.com。
Jeff Dean 表示其团队的整体思路是自动化实验闭环,认为该方法可广泛适用于多个科学与工程领域。团队初期将聚焦机器学习研究与工程,并相信它能帮助解决美国国家工程院(NAE)十四项重大挑战中的诸多子问题,做好此事需要机器学习与大规模系统方面的深厚专长。
SpaceX 在 2026 年第二季度财报电话会上公布营收 78 亿美元、同比增长 92%,调整后 EBITDA 为 35 亿美元、同比增长 191%。
Weaviate 指出,导入返回 HTTP 200 不代表校验结束,单个对象仍会因限流、向量化器报错或 schema 不匹配而失败。其建议的弹性导入流程包括流式传输数据、由服务端处理批处理与背压、用稳定源键生成确定性 UUID、只重试失败对象,以及记录检查点并将反复失败的对象送入死信队列。确定性 ID 可让重试具备幂等性,避免重复创建对象。
微软发布 PRISM2,一个用病理图像和真实病理报告语言训练的多模态基础模型。仅靠简单问答,PRISM2 在多项基准任务上追平专用癌症检测系统,且无需为每项任务单独建模型。
拾象基于硅谷密集访谈梳理 post-training 数据供应链,把 human data、RL 环境、RLaaS 与真实世界数据放在同一框架下。
前华为天才少年黄青虬创办的墨奇智能成立于 2025 年底,半年内完成超 10 亿元天使轮融资,他现任联合创始人兼 CTO。黄青虬认为具身是马拉松而非百米冲刺,技术范式尚未收敛,起点差几个身位区别不大。他判断 VLA 和世界模型都不够本质,今年能产出 5000 台靠谱机器人的公司不会超过三家,且具身数据质量远比数量重要。
晚点聊邀请 RadixArk 与 SGLang 创始成员赵晨阳和华盛顿大学博士生曾致远,从推理与算法两条线拆解 Kimi K3。