GPT-6 自称 AGI,李飞飞与马斯克为何不服?聊聊 GPT-6、世界模型与 Cybercab 谁是 AGI
播客围绕 GPT-6 Astra 展开讨论,并质疑其自称 AGI 的说法;李飞飞的世界模型被指是"三无产品",而数据是否用完被称作伪命题。节目还探讨真正的物理世界模型如何拼出、没有手脚能否算 AGI,以及 Cybercab 为何只做两座、远程操控与真实路测数据为何大多无效。
播客围绕 GPT-6 Astra 展开讨论,并质疑其自称 AGI 的说法;李飞飞的世界模型被指是"三无产品",而数据是否用完被称作伪命题。节目还探讨真正的物理世界模型如何拼出、没有手脚能否算 AGI,以及 Cybercab 为何只做两座、远程操控与真实路测数据为何大多无效。
Astra 能够从 mel 频谱图中零样本识别声音,发布者称这还只是该模型的轻量推理,尚未触及能力上限。该演示由 Max @maxxrubin_ 分享,Greg Brockman 转发。
SemiAnalysis 发布 TPUv7 Ironwood 在 InferenceX 预览版上的首批第三方推理结果,在与 B200/B300 的同等条件对比中,Ironwood 每美元性能最高提升 50%。
腾讯混元发布 Hy4 preview 升级,针对用户反馈的复杂任务中长思考与过度验证问题做了优化,现已向所有人开放。官方称任务质量不变,轮次更少、输入输出 token 更低,基准测试与人工评测均已确认,并邀请用户在 WorkBuddy(WorkBuddy.ai)上试用并反馈问题。
NVIDIA 发布技术指南,讲解如何在 Jetson 边缘设备上部署与优化具备多步推理能力的模型。此前这类推理模型体量过大,只能将推理请求绕行数据中心处理,带来网络依赖、成本上升和敏感数据离机的风险。该限制正在解除。
Greg Brockman 引用 ARC Prize 消息称 ARC-AGI-3 现在已被刷满。OpenAI 的 GPT-6 Astra 在该基准上取得 SOTA:Astra 在 ARC-AGI-3 上得分 63%,通过新的 provider adapter harness 达到 99%,在 96% 的 ARC-AGI-3 关卡上超过人类表现,并构建出目前所见最精确的新环境符号模型。
OpenAI 发布 GPT-6 Astra,Greg Brockman 称其在 FrontierMath Tier 4、ARC-AGI 3 和 TerminalBench-4.0 上达到当前最优水平。
Anthropic 最capable的模型 Claude Fable 5.1 已在 Poe 上线,针对高难度推理与长周期智能体任务打造。该模型支持 1M token 上下文、网页搜索,以及从 low 到 max 的自适应思考强度。
Google 的 Gemini 3.8 Flash 已在 Poe 上线,主打快速、低成本,面向编程和智能体场景,可在 Flash 速度下提供较强推理能力。该模型支持 1M token 上下文窗口、网页搜索和可调节的思考等级。
AI SDK 宣布支持使用 Gemini 3.8 Flash。Google 发布 Gemini 3.8,称其为目前推理与编码能力最强的模型,并基于 3.7 Flash 推出 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两个新变体,依托长时间运行的智能体循环构建。
Google 发布新 3.8 Flash 模型,这是六周内的第三次 Flash 发布。官方称其在软件工程、智能体任务和多步推理上较 3.7 Flash 有明显提升,在 DeepSWE v1.1 上能以更低成本自主端到端解决复杂工程问题,表现超过多数更大的前沿模型。
NVIDIA 技术博客发布 AI 模型协同设计系列第三篇,介绍如何用投机解码在保持准确率的前提下加速 LLM 推理,并给出在帕累托前沿上选择草稿长度与草稿机制的 5 条准则。
Google 发布 Gemini 3.8,称其为目前最强的推理与编码模型,并推出 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两个变体,依托长时运行的智能体循环。
Google 发布 Gemini 3.8 Flash,定位为面向复杂智能体和多步骤任务的最智能主力模型,在推理上有明显提升,可处理模糊且高摩擦的任务并参与复杂项目。3.8 Flash 提供一贯的 effort 控制,让任务所需的思考量与 tokens 消耗成比例。官方演示中,它结合原生视频理解与高级编码,在 @antigravity 中自主构建 3D 游戏、试玩找错并在智能体循环中执行代码修改。
DeepLearning.AI 汇总称,多家头部 AI 公司正把推理速度当作值得付出成本的架构要求。
Augment Code 的模型选择器现已上线 Claude Fable 5.1,初期沿用 Fable 5 的用例,聚焦需要深度推理的超长多步骤任务,并逐步推动模型完成可无人值守运行的任务,用户可在 Cosmos 中试用。
DeepLearning.AI 指出头部 AI 公司正把推理速度视为值得投入的架构要求。OpenAI 与 Cerebras 展示 GPT 5.6 Sol 达到 750 tokens per second。
Gemini 的视频理解改为智能体方式,可自行在时间轴上迭代导航,决定看什么内容、选择帧率,并判断回答提示词是否需要语音转录、音频或视觉帧。官方给出的结果是长视频最多减少 88% 的 token、成本降低 66%,基准准确率提升约 7%。
腾讯混元介绍 Hy4 preview 在 AI 研究中自主发现推理瓶颈,通过算子融合与通信优化将端到端吞吐提升 31.8%,且在不同上下文长度和并发下保持稳定。该模型为 770B 参数、49B 激活、1M 上下文,已开源并登陆 HuggingFace 与 GitHub。
Two Minute Papers 在视频中介绍了 GLM 5.3,标题指出强 AI 能力正变得近乎免费。
Epoch AI 数据显示,自推理模型出现以来,其 ECI(AI 能力指数)前沿水平以每年 14 分的速度提升。该机构此前在报告《Have AI capabilities accelerated?》中指出,ECI 等 AI 能力指标在推理模型出现后发生了趋势断点。相关趋势线、90% 预测区间及 bootstrap 样本数据已于 9 月 1 日更新。
Epoch AI 发布 FrontierMath Erdős 基准,由 Thomas Bloom 从 erdosproblems.com 未解问题中挑选 68 道兼具数学意义与难度的问题,其中 50 道已由 Google Formal Conjectures 项目完成 Lean 形式化。
腾讯 Hy4-preview 发布预览权重,并已在 vLLM 的 day 0 支持,在 NVIDIA GPU 上完成验证。
暗涌Waves独家获悉,国产GPU公司曦望Sunrise再获新一轮20亿元融资,投后估值约200亿元;今年4月其完成杭州资本领投的超10亿元融资、估值破百亿,不到半年接近翻倍。
Google DeepMind 研究副总裁 Zoubin Ghahramani 与 Fryrsquared 对谈,探讨为何让系统具备"自我怀疑"与概率思维,能带来更安全可靠的现实决策。内容从天气预报、机器人等场景切入,涵盖不确定性的作用、正确性与置信度的区别、AI 中的贝叶斯思维及面向 AGI 的未来研究。
Niklas Muennighoff 等人提出 Prefix Sliding,一种面向高效测试时扩展的简单快速方法,让 LLM 在长推理轨迹中“遗忘”部分前缀。该方法针对原生全注意力在长任务上 OOM、而压缩又会丢失关键细节的问题,效果可同时超过两者。
Qwen3.8-Flash 已在 OpenRouter 上线,一次 API 调用即可支持编程助手、智能体工作流和长视频理解。该模型为多模态推理模型,面向代码库与文档分析、桌面交互、图表和长视频等场景。
阿里发布 Qwen3.8-Flash,这是一个多模态 MoE 模型,主模型参数量 125B,另配 51B N-gram Embedding,每 token 激活 6B 参数,原生支持 262,144 token 上下文并可通过 YaRN 扩展至 1M token。
官方一次给出 Qwen3.8-Flash 的架构改动、成本对比与开源权重入口,读者可据此判断新架构对长上下文推理的实际影响。
Adam D'Angelo 指出,任何把多个模型的 tokens 混在一起统计的指标都毫无意义,tokens 无法跨模型比较。他表示这一判断一直成立,而随着模型日益多样化、推理占全部 tokens 的比重越来越大,这一点正变得越来越明显。
在 1M-token 上下文长度下,QSA 的注意力内核在 prefill 阶段最高提速 7.6×,decode 阶段提速 4.9×。当 prefix-cache 命中率为 90% 时,Qwen3.8-Flash-Next 的 prefill 吞吐量达到 Qwen3.7-Plus 的 8.6 倍。
Naval 推荐了一期 AI 播客,嘉宾 Neil Movva 从 Nvidia 的 GPU 与 kernel 工作起步,如今经营 Sail Research,为 AI 智能体构建让 token 尽可能便宜的基础设施。节目以类似 401 级课程的深度讨论了延迟与吞吐、芯片与内存、Transformer、AI 训练数据的未来、算力套利与电力"拾荒者策略",以及开源与前沿实验室之争。
OpenAI 在 Hot Chips 上公布了与 Broadcom 合作自研的推理芯片 Jalapeño,设计始于 2024 年中,约 16 个月完成流片,SemiAnalysis 受邀在其实验室用 InferenceX 实测该芯片。
SemiAnalysis 在 OpenAI 实验室实测其首款推理芯片 Jalapeño,给出逐场景吞吐与能效对比及架构细节。
Gemma 4 家族还带有 MTP drafters,采用专门的投机解码架构,最高可实现 3 倍提速。相关细节来自 Google 的一篇博客文章,另有 Leonie 整理的投机解码学习笔记可供参考。
SemiAnalysis 发布 AgentX 1.0,称其为全球首个完全开源、100 万上下文的多轮智能体编码推理基准,Apache 2.0 许可,数据集与全栈工具投入超 300 万美元。
Yann LeCun 表示,如果重返校园,他会先弄清 LLM 为何能写论文却不会打扫卧室,再据此选专业方向。他称将寻找超越 LLM 的方法与架构,让机器能像人类和动物一样快速学会执行物理任务,并强调这件事与年龄无关。
Yann LeCun 表示,不应把世界模型与视频预测或视频生成模型混为一谈;理解系统动态以对其进行控制,与生成好看的视频并不是一回事。该表态是对 Jitendra Malik 观点的回应。
Google 的 Gemini 3.7 Flash 首周打破了此前 Gemini 的增长纪录,成为 Google 增长最快的模型,目前已接入 Search 和 Gemini app。ARC Prize 公布的评测数据显示,该模型在 ARC-AGI-2 上得分 84.6%、每任务 0.25 美元,在 ARC-AGI-1 上得分 95.5%、每任务 0.12 美元,以低成本和高分在前沿模型中较为突出。
Google CEO 给出 Gemini 3.7 Flash 首周增速与 ARC-AGI 两项成绩,可据成本与分数判断其定位。
OpenAI 将 GPT-5.6 Sol 价格下调 20%,为期 3 个月,叠加此前 70% 折扣后,至 10 月 3 日可享原价 76% 的优惠。Cognition 称 GPT-5.6 Sol 现为 Devin Desktop 和 Devin CLI 上最实惠的前沿模型。
Niklas Muennighoff 等人在新工作"embedder's dilemma"中发现,LLM 在嵌入任务上已超过专用嵌入模型,但成本高得多。该研究探讨了在什么场景下应选择嵌入模型、什么场景下应选择 LLM。论文见 arxiv.org/abs/2608.12875。
腾讯混元 Hyra 在数学领域再获四项进展:3D Blaschke–Lebesgue 常数宽度体普遍下界从 0.380799w³ 提升至 0.411040w³。