专访 UCSD 正教授商静波:LLM 正在收敛,下一站押注超级智能
34 岁的 UCSD 正教授商静波认为,如果 AGI 指在广泛任务上达到普通人水平,那它某种意义上已经实现,真正未到来的是能在重要领域持续超越最优秀人类的超级智能。
34 岁的 UCSD 正教授商静波认为,如果 AGI 指在广泛任务上达到普通人水平,那它某种意义上已经实现,真正未到来的是能在重要领域持续超越最优秀人类的超级智能。
技嘉 10 月 9 日宣布,全部 B760 和 H610 主板将通过 BIOS 更新支持预计 2027 年初推出的新款英特尔 LGA1700 处理器,其中包含 DDR4 主板。
Mercor VP Chirag Mahapatra 在 Assembling 2026 上表示,前沿实验室在科学、材料科学、生物等复杂领域只收集到构建极高质量模型所需数据的 1% 到 2%,物理世界数据同样如此,整体可能只到 2% 到 5%。
Google DeepMind 的 Pushmeet Kohli 与 Biohub 的 Sal Candido 在对话中指出,AlphaFold 的突破只是开始,蛋白质折叠远未解决,静态结构预测无法覆盖蛋白质动态与无序性。
ChatGPT 会话标题末尾偶发出现外语词或赌博色情小广告,作者结合抓包记录与 EMNLP 论文《Speculating LLMs' Chinese Training Data Pollution from Their Tokens》推断,标题由轻量推理模型生成,常在该结束生成时收尾失败,继续按概率输出词元。
AI 训练数据被视为唯一"一旦奏效就贬值"的产品:当模型在某项任务上正确率达到约 70%,实验室就会砍掉这项任务的数据需求。这个市场还造就了全球最年轻的白手起家亿万富翁。
Epoch AI 讨论中三位嘉宾给出三种判断:EverettRandle 认为数据是下一个 1 万亿美元品类;viks_rum 预计到 2031 年规模化独立玩家不足 10 家;Satya Nadella 称企业为智能付费两次,应保留自有数据。最值钱的数据或许是你永远不卖的数据。
Nathan Lambert 认为 AI 会迎来快速进步,但不会走向通用超级智能。他指出,模型将在几年内成为超人的分布式 GPU 工程师,并可自动化预训练架构与数据选择研究,主要来自推理算力扩展与推理成本近指数级下降,而非模型研究能力的质变。他预计这会引发智能体模型的杰文斯悖论,需求只增不减,并带来 RL 环境质量提升的空间。
Andrew Ng 在 The Batch 本周通讯中透露,他的一个智能体每天进行 5000 到 10000 次网络搜索,并认为智能体将需要多得多的数据中心。本期通讯还提及 GPT-6.1 Sol、Gemini 4 Argon、FLUX 3 Action 以及 HYSET。
在2026(第二十届)DEMO CHINA现场,戴盟机器人王煜、灵御智能莫一林与OriginFlow秦深涛讨论具身智能落地路径。莫一林认为"模型"被高估、"身"被低估,灵御采用类自动驾驶L2的人机共驾模式,机器人已在超市做试吃,能以人的七八成效率完成七八成工作;秦深涛强调数据并非越多越好,关键是低成本获取多样高质量数据并跑通经济效率。
2026 年上半年垃圾债发行量达 2290 亿美元,而投资级债券为 8059 亿美元,垃圾债市场已膨胀至投资级市场的 28.4%,较 2011 年上半年的 30 亿美元增长 75 倍。
前 Intel CEO Pat Gelsinger 在 a16z 播客中称,美国整体能源产能停滞了约十五年,经济产能也随之停滞,即便近年国家能源产能年增约 4%。他认为能源产能会抑制 AI 热潮的乐观程度——"如果供不上电,为什么要建新数据中心、买百万块 GPU",并指出核能作为基荷值得扩建,而可再生能源对中国有深度依赖。
Pyromind 押注 RSI 产业化的早期形态出现在企业 Agent 上线后的持续学习,用 AutoRL 和 Reward Data Flywheel 把真实任务反馈转化为可训练、可评估的模型能力。
有人基于 Levels.fyi 的提交数据,统计了大型科技公司中每位工程经理大约对应的工程师数量,AI 实验室则单独发布报告。该统计只是代理指标,更适合观察方向,不能视为精确的组织数据。
Yann LeCun 回忆 1986 年 6 月首次在美国参会并首次到访 MIT,展示了一张关于多层网络的海报。他在 Thinking Machines Inc 主办的招待会上首次见到 Marvin Minsky,对方惊讶于神经网络可被训练来计算两个二进制数的乘积。
生物医学影像领域的真正瓶颈在于数据而非模型。文章指出医院与卫生系统产生的数据虽多,但四个相关领域都卡在同一个数据环节上。
LlamaIndex 称 Markdown 已成为人与 AI 智能体之间的通用信息表示,它保留标题、列表等结构原语,让智能体能按语义读懂内容,并支持表格、图表,还可原生嵌入 HTML。由于多数非结构化数据尚不原生以 Markdown 存在,难点落在转换层,LlamaIndex 表示已打造最优模型,可将任意非结构化文档容器转为 Markdown,表格合并表头时改用 HTML。
SemiAnalysis 统计 2021 年至 2026 年 9 月 15 日 9 家中国头部开发商的 857 个模型发布,仅 31 个(3.6%)附带开发者公布的安全评估结果,其中只有 9 个(1.1%)在发布时或之前公布。
Kenan Saleh 称其合作的一家公司 3 个月内从 $0 增长到 $60M,本月将触及 $100M run-rate,是他见过增长最快的公司。该公司向 AI 实验室和模型开发者售卖前沿数据(frontier data),他认为外界尚未充分认识到数据与算力、算法并列成为一等公民。
Periodic Labs 的 Liam Fedus 和 Ekin Dogus Cubuk 提出“synthesis superintelligence”,主张让模型在真实物理实验中做强化学习,而非只训练互联网数据。他们认为科学发现不同于数学与编程,物理实验才是最终基准,失败实验可能是最有价值的训练数据,目标是让每台实验仪器具备“140 IQ”并压缩数十年的试错。
养猪业连亏超10个月,佛山50人养猪设备公司老板刘文用AI重写卖了十年的软件;牧原与阿里云共建养猪大模型,一秒出诊断结果并铺设至1000多个猪场。一线从业者的阻力多来自数据割裂与部门墙,而非模型本身;刘文每月花不到6000元订阅AI,靠内容矩阵每月稳定获客30个。
ZooWork 创始人兼 CEO Ning Hu 在 Assembling 2026 AI 峰会炉边对谈中提出企业 AI 的 L1 到 L4 分级:L1 是人用 AI 提效,L4 是 AI 在岗位上执行并递归学习,目前多数企业仍停留在 L1。
Ben Affleck 自称会写"相当糟糕的" Python 脚本,长期关注计算机与电影从模拟向数字的转变。他提到视觉特效流程多年来已用到机器学习,用卷积神经网络(Transformer 的前身)在 tensor 上做边缘检测和特征提取,从而更轻松地抠掉绿幕画面并替换背景。
前亚马逊 Rufus 项目创始成员判断,5年后手机上的购物 App 会消失,入口交给能自己完成搜索、比较、下单的购物 Agent。亚马逊 Rufus 2023 年启动时仅七八人、约两个月做出演示版本,团队后扩至数百人;其公式为 Agent = 强模型 + 上下文 + 多步执行。
Mistral 4 仅用 3,800 块 Grace Blackwell 就达到 GPT-6 Astra 72% 的智能水平,后者使用超过 100,000 块 Grace Blackwell。按"每 GPU 智能"计算,Grok 4.7 约用 200,000 块 GPU,Claude Opus 5.5 约用 500,000 块 Trainium2,凸显 Mistral AI 团队的效率优势。
Mercor 等数据公司正以时薪低至 45 美元起的零工,雇人编写评分细则、标准答案和推理轨迹来训练 AI,部分项目任务量骤减、时薪下调 8 美元,劳动者还被 Insightful 软件逐秒监控。Mercor 由三名 19 岁创始人于 2023 年创办,去年估值达 100 亿美元,每周约 3 万名专业人士在其平台工作,OpenAI 和 Anthropic 都曾是客户。
法律 AI 公司 Harvey 联合创始人兼总裁 Gabe Pereyra 在 Sequoia Capital 的“Own Your Intelligence”活动上,介绍了应用公司在资金、算力不及基础模型公司时建立研究能力的方法:先建评测标准与训练数据,再与外部研究团队合作完成后训练,最后搭建模型部署基础设施。
Yann LeCun 认为 AI 的进展反而让系统神经科学变得更有意思,因为当前 AI 在物理直觉、常识、世界模型、规划/推理、动机/驱动力和情感等方面都还没有特别好的解法。他表示,现在我们或许已经拥有实现并检验认知架构的工具。
Replit CEO Amjad Masad 提出,通用模型可在运行中训练自己的"替代品"——更小、更专一的领域模型,类似即时编译器在动态执行时按需生成优化机器码。他认为这类专用模型更便宜、更不易受提示词注入攻击,危害也更小,因为能力更有限。Masad 称当前关于递归自我改进的讨论很多,但"模型训练自己的替代品"这一方向却少有人关注。
Replit CEO Amjad Masad 提出"模型训练自己的替代者":通用模型在执行任务时发现用例有限,可像即时编译器一样当场训练出更垂直的小模型。这类模型更便宜、更不易被提示词注入攻击,也因能力更弱而更少危害,但通用智能体本身存在缺陷与失控风险。
Anthropic 强化学习方向技术负责人 Nicholas Marwell 和 Sholto Douglas 在播客访谈中表示,蒸馏无法把前沿继续向前推进,只能复制当前前沿,而真正进入下一代前沿需要巨额前期资本投入,因此他们反对模型蒸馏。
作者在 WorkBuddy 模型面板观察到匿名模型 Space-Bunny,倍率 0.03x 且限时折扣,9 月 23 日上线后登顶 OpenRouter 与 OpenCode 调用量榜首,截至 10 月 2 日仍无人认领。
前微软合伙人 Ramez Naam 发表长文质疑递归自我改进(RSI)引发智能爆炸的判断,认为当前回路强度仅为起飞门槛的 10% 到 20%,需再增强 5 到 10 倍。
Epoch AI 测算,2025–27 年出货的 HBM 硬件最多可支撑约 3000 万至 1.7 亿个并发前沿模型智能体,按每周 168 小时不间断运行折算,相当于约 1.4 亿至 7.2 亿名全职员工的工作时长。
针对 arXiv 论文《Score Centering Stabilizes Off Policy Reinforcement Learning》被传为 OpenAI 后训练 RL 算法,有分析指出该 score centering 算法本质上是 STE(straight through estimation)的近似实现,其梯度与 STE 方案完全一致。
Lenny Rachitsky 发问:还有比你的 Google 数据更有价值的数据集吗?他指出每个 AI 助手都在"吞食"这些数据并做出奇妙的事,而 Google 在这一领域却不见踪影。该帖获得 119 条回复、16 次转发和 592 个点赞,浏览量达 116059。
Jerry Liu 主持了与 Snorkel AI 的 Vincent Chen 的晚餐对话,聚焦评测与 RL 环境。构建 RL 环境的一大挑战是"公平性":模型失败时难以归因于输入、harness 还是奖励模型;奖励设计困难,长周期评测因业务结果需数周至数月而极难推进。受监管行业仍需 human in the loop 保证约 100% 准确率,模型仍存在"锯齿状智能",长尾边缘案例持续失败。
开源模型的私有化部署正成为新趋势:隐私与合规风险凸显、开源模型能力已过可用阈值、企业 token 开销失控推动成本考量,但版本迭代投入、使用频率不足导致综合成本高于云厂商、私有化部署稳定性仍是问题。
本期 Import AI 介绍了 Michael Levin 关于心智或为 Platonic 模式空间界面的论文,认为身体与机器只是这些模式进入物理世界的接口;Anthropic 的 Perry Dong 与 Chelsea Finn 提出机器人缺少类似 LLM 的后训练通用配方,并介绍了 EXPO(-FT) 算法。
图灵奖得主、Ingres 和 Postgres 创始人 Mike Stonebraker 认为,为智能体 AI 提供数据的数据源都是关系型的,而基础模型只处理纯文本将成为重大弱点。