专访 UCSD 正教授商静波:LLM 正在收敛,下一站押注超级智能
34 岁的 UCSD 正教授商静波认为,如果 AGI 指在广泛任务上达到普通人水平,那它某种意义上已经实现,真正未到来的是能在重要领域持续超越最优秀人类的超级智能。
34 岁的 UCSD 正教授商静波认为,如果 AGI 指在广泛任务上达到普通人水平,那它某种意义上已经实现,真正未到来的是能在重要领域持续超越最优秀人类的超级智能。
Google DeepMind 的 Pushmeet Kohli 与 Biohub 的 Sal Candido 在对话中指出,AlphaFold 的突破只是开始,蛋白质折叠远未解决,静态结构预测无法覆盖蛋白质动态与无序性。
用户反馈 Luna 连简单数学都算不对,Haiku 则拒绝翻译文章。该用户由此感叹 AI 模型的发展走向十分诡异。
Gary Marcus 指责 Noah Smith 对其观点的批评"断章取义",称其若真正跟踪该领域,就应理解纯 LLM 与带神经符号 harness、代码解释器和验证器的 LLM 之间的区别。
Nathan Lambert 认为 AI 会迎来快速进步,但不会走向通用超级智能。他指出,模型将在几年内成为超人的分布式 GPU 工程师,并可自动化预训练架构与数据选择研究,主要来自推理算力扩展与推理成本近指数级下降,而非模型研究能力的质变。他预计这会引发智能体模型的杰文斯悖论,需求只增不减,并带来 RL 环境质量提升的空间。
ColaOS 创始人橘子在与「AI 炼金术」的对谈中复盘个人 Agent 这半年:flash 级模型让看邮件、订机票等任务的 token 成本降到当时的几十分之一,单用户月补贴从数百美金降至十美金左右,补贴成本已低于获客成本。他为此放弃卷办公赛道,转向做「996 之外」的个人 agent,并称 Opus 5.5 已把世界模型的活吃掉。
前 Intel CEO Pat Gelsinger 回忆自己 18 岁被 Intel 招募,面试官给他的评语是"聪明、激进、傲慢,他会很合群"。他是 386 的第四号工程师、486 的架构与设计经理,这些工作都是在他攻读学士、硕士和博士期间完成的。他还讲述在斯坦福课堂上与教授争论其 carry lookahead adder 设计不成立的经历。
《State of AI Report 2026》10 月 8 日发布,第九期由 Air Street Capital 的 Nathan Benaich 牵头,正文 240 多页,分研究、产业、政治、安全、预测五部分。
推理将成为最大的 AI 市场,其规模已经超过训练。这一变化可能改变数据中心的建设方式,并影响未来机会所在的方向。
Jessie Dong 认为推理市场规模已超过训练,将改变数据中心建设方式与机会分布:推理不需要上千块 GPU 集中在一处,小型数据中心更易解决供电与监管问题。Nvidia 正在建设 25 个 5-20 MW 的小型数据中心,Akamai 则在全球 4,400 个小型站点上运行推理。她认为小型数据中心盈利能力更强、建设风险更低。
OpenAI 新模型在 7 个千禧年大奖难题中的 4 个上取得实质进展,涉及 Navier-Stokes(声称)、Riemann、Hodge 和 Birch-Swinnerton-Dyer,结果尚待验证。据 Deedy 称,每个结果平均仅消耗 3 小时思考算力,所用模型尚未发布。
Theo(t3.gg)反驳 Cursor 工程师 Lauren 每年 1.32 亿美元 Token 成本的估算,称真实 API 成本约为每月 10 万-50 万美元,按当前价格更接近每年 300 万美元。
Richard Ngo 撰文梳理社会学与智能体基础研究的联系,重点讨论社会均衡、博弈论均衡、规范内化与集体行为三部分,主张将理性社会与政治行为理论作为 Von Neumann 和 Morgenstern 理性经济行为理论的扩展或替代。
Yann LeCun 认为数学正开启一个新时代:形式化证明将大规模自动化,研究重心会转向新概念、新抽象、新定义与新猜想的提出。他以船只发明削弱游泳重要性、却让人发现新大陆作类比。
Gary Marcus 与 Terence Tao 就 OpenAI 的数学领域大动作发表互补评论,试图解读数学研究的新范式。相关内容发布于 Gary Marcus 的 Substack。
Gary Marcus 与 Terence Tao 就 OpenAI 新公布的数学成果发表互补评论。Marcus 指出,OpenAI 仅称"用同一流程、借助未发布模型"完成证明,未披露架构、失败率、训练与数据增强细节,还提到证明是否由 Lean 一次性生成并验证也不清楚。他认为无法判断该结果的通用性,甚至无法排除其只是借助 Lean 与合成数据在可验证领域取巧。
Gary Marcus 批评 OpenAI 一份关于未发布模型的报告信息严重缺失:未说明"same procedure"具体流程、架构细节(证明是否一次性生成再由 Lean 验证)、失败率,以及训练、后训练和数据增强方式。因此无法判断该结果在数学领域之外的可泛化性,它既可能是迈向 AGI 的一步,也可能只是借助 Lean 与合成数据在可验证领域的技巧性应用。
Eli Lilly 和 Novo Nordisk 称,服用其 GLP-1 减肥药的患者在追踪 DNA 与关键蛋白变化的分子“衰老时钟”上衰老更慢,但这一结果的解读仍存疑问。
辛顿转发22位AI研究人员署名论文《如果AI研发自动化引发智能爆炸?》,首次正式参与递归自我改进(RSI)研究。论文援引Anthropic数据:AI生成获批代码占比从2025年1月的个位数升至2026年5月的超80%,Claude自主完成的内部AI研发工作比例从3月的约1%升至8月的26%。辛顿警告,若AI能力继续指数级加速,留给人类建立监管与安全机制的时间可能只有一两年。
Gary Marcus 批评那些把「神经网络自己解决问题」与「神经网络提出答案、再由独立符号系统验证」混为一谈的评论者,称这种混淆正是对 AI 缺乏基本理解的典型表现。他强调,分不清这两者是根本性认知错误,不懂的人不应就 AI 发表评论。
Gary Marcus 就 OpenAI 新数学成果表态:该系统在 LLM 之外还使用了 Lean 等符号 AI,印证了他多年主张的神经符号 AI 路线。但他强调这并不意味着 OpenAI 已实现 AGI,因为数学领域的符号验证与符号数据增强无法在开放的真实世界中广泛泛化。他重申 2019 年的观点:神经符号 AI 是必要而非充分条件,世界模型同样关键。
李飞飞在Huberman Lab等播客访谈中判断,未来十年职场上更有竞争力的是把一件事做到极致的专才和什么都能上手的通才,两者共同的能力是主动性。她创办的World Labs正探索空间智能,让机器理解并生成三维空间;她认为AI的下一个前沿在语言之外,机器人落地仍需更长时间。
xAI 联合创始人 Christian Szegedy 发长文《数学何去何从?》,宣告数学的「英雄探险时代」结束,AI 这架「飞机」已把旗插上无人登顶的山峰。
OpenAI 研究员、o1 早期奠基者之一 Noam Brown 在与 Dwarkesh Patel 的对话中表示,1 万个智能体花费 88 小时、消耗 1300 亿 token 解决一道千禧年大奖难题,功劳并不主要来自多智能体,他甚至连 10% 都不会归给多智能体,真正支撑突破的是足够强大的通用模型和让它持续并行思考的能力。
作者称自己的本地机双 5070ti 跑 Qwen Flash,从上周末的 200 prefill、10 decode 提升到今天在 Strata 与自制 PR 支持下的 2200/67,只用一张卡,读写速度都提高近十倍。
斯坦福大学助理教授吴佳俊在 IROS 2026 的 RoBoWoMo 研讨会上发表《Building Physical Agents via Structured Representations》报告,提出用结构化表征搭建物理世界智能体。他介绍了从演示中学习谓词与原子动作、让模型自行提出 DSL、并用演示标签对视觉判据做后训练等路径,并透露最近投稿的工作已将规划器也换成后训练的开源视觉模型。
前微软合伙人 Ramez Naam 发表长文质疑递归自我改进(RSI)引发智能爆炸的判断,认为当前回路强度仅为起飞门槛的 10% 到 20%,需再增强 5 到 10 倍。
Yann LeCun 在 X 上发问:"我的家用机器人在哪?我的 L5 自动驾驶汽车在哪?"他指出,可以把 LLM 微调成能回答任何物理世界问题的模型,但这并不意味着它拥有足够的理解力和物理直觉,去预测一个 6 岁儿童就能预测的事情。
Epoch AI 测算,2025–27 年出货的 HBM 硬件最多可支撑约 3000 万至 1.7 亿个并发前沿模型智能体,按每周 168 小时不间断运行折算,相当于约 1.4 亿至 7.2 亿名全职员工的工作时长。
Richard Sutton 在《苦涩的教训》中指出,回顾 70 年 AI 研究,长期最有效的往往是能持续利用更多算力的通用方法,而非人类精心设计的领域知识。国际象棋、围棋、语音识别与计算机视觉的历史都显示,研究者起初想用人类理解减少搜索,真正的突破却来自拥抱搜索和学习。他因此认为,搜索和学习是当前最能随算力扩展的两类方法,而试图把人类对心智的理解直接写进系统,长期会停滞甚至阻碍突破。
针对 arXiv 论文《Score Centering Stabilizes Off Policy Reinforcement Learning》被传为 OpenAI 后训练 RL 算法,有分析指出该 score centering 算法本质上是 STE(straight through estimation)的近似实现,其梯度与 STE 方案完全一致。
在华盛顿一场科技圆桌论坛上,黄仁勋、马斯克与 Anthropic 联合创始人 Tom Brown 同台对话。
Sebastian Raschka 以 Jev 引发的热度为切入点,回顾文本分类从词袋加朴素贝叶斯、逻辑回归、RNN、CNN 到 BERT、GPT、T5 的技术演进,并实测 Jev 在 IMDb 电影评论数据集上的表现。
Naive AI 发布开源模型 Naive-N0.5-Flash,权重与推理代码以 MIT 许可证开放,API 输入每百万 Token 0.6 元、输出每百万 2.6 元。
Runway 联合创始人兼联合 CEO Anastasios Germanidis 阐述 AI 视频的终局是世界模型:Sora 曾触发 Runway 内部的生死冲刺,而扩大视频模型规模或许足以学到物理规律。他进一步提出实时生成可让世界模型充当机器人模拟器,软件的未来可能是直接以像素而非 HTML 和代码生成的界面,Runway 正朝完全神经操作系统推进。
LlamaIndex 研究团队发布博客,讨论校准置信度分数对文档抽取和智能体决策的价值:设定置信度阈值后可自动接受高于阈值的取值、对低于阈值的做人工复核,阈值越高可保证的精度越高,例如置信度 0.7 对应 95% 精度、0.9 对应 98% 精度,代价是更多假阴性需要人工审核。
Latent.Space 发布对话 TypeSafe CEO @CompleteSkeptic 的播客,其打造的产品 Jev 被明确不称作「Decision Model」。他解释 AI 能解决极难问题却仍无法自动化基础工作,Jev 面向软件内的可靠决策而非聊天,TypeSafe 拒绝公开 benchmark 和 API 层的拒绝机制,并称即便有 10 亿美元也不会从头预训练模型。
曦望Sunrise联席CEO王湛在2026网易未来大会上提出,AI产业的损益表正在被Token重写,Token价格直接决定智能经济规模。他援引国家数据局数据称国内日均Token调用量已从2024年初的1000亿增至今年3月的140万亿,并判断算力结构性缺口大概率延续到2028年。曦望为此推出专为推理设计的启望S3 GPU,单卡性能为上一代5倍,单Token成本降低90%。
AICC2026 人工智能计算大会上,播客屠龙之术梳理出三条主线:从 Chat 到 Agent 的需求侧结构性跃迁、智能从概率拟合转向可信生产、以及算力与芯片在系统、器件、生态上的突围。会上 IDC 与浪潮信息联合发布《中国人工智能计算力发展评估报告》,并提到浪潮信息的智算系统双唯进化主张与新产品、芯算一体、让计算走进存储,以及 FlagOS 生态下的国产模型与国产芯片 Day 0 适配。
Epoch AI 洞察团队负责人 JS Denain 与 Nathan Lambert 在播客中辩论了 RSI、机器人对 AI 加速的作用、中国模型落后程度以及蒸馏是否能解释这一差距。