从蒸馏到合成数据到 RSI,模型竞争的下一个焦点是什么?|42章经
前 Kimi 研究员、Evolvent AI 联创繁青认为,国内模型与国外差距缩小主要靠预训练架构创新,如 Kimi Linear 和 DeepSeek 的 Multi-head Latent Attention,蒸馏只是补后训练数据积淀不足的手段。
前 Kimi 研究员、Evolvent AI 联创繁青认为,国内模型与国外差距缩小主要靠预训练架构创新,如 Kimi Linear 和 DeepSeek 的 Multi-head Latent Attention,蒸馏只是补后训练数据积淀不足的手段。
枫言枫语最新一期播客讨论两位主播沉迷 AI 编程后人类反而成为开发循环瓶颈的现状,提到 Tibo 频繁给 Codex reset、Anthropic 给 Fable 5 解禁,两家 frontier model 的 $200 plan 都嫌 token 不够用。
OpenAI、Anthropic、Grok 均已上线"录屏即技能"功能,可自动读写邮件、综合数据并给出结论,如今还能登录专业软件替你执行任务,每月花费 20-200 美元。作者称,只需一两天调好工作流,之后便可放手,低到中级远程岗位的工作几乎 100% 可被自动化。
Z.ai 发布 GLM-5.3,目前仅在编码套餐中提供,之后将上线 API,两周后登陆 Hugging Face 开放权重。
以 Z.ai 被称为仅靠后训练扩展的小参数模型为切口,拆解中国实验室贴近前沿的发布节奏与数据产业因素。
Cursor 团队宣布已正式完成被 SpaceX 收购的交易,将加入 SpaceXAI 团队,帮助把 Grok 打造成最实用的 AI,并改进 Grok Build、Grok Bot、Grok API 和 Cursor 等产品。Scott Wu 转发该消息并祝贺 Cursor 团队进入下一阶段,称其是硅谷当下最好的团队之一。
Cursor 被 SpaceX 收购的交易正式完成,读者可据此了解这笔跨领域收购的归属与团队去向。
Google 发布今年 Pixel 11 系列、Pixel Watch 5 和 Pixel Tag,带来多项 AI 集成,包括同时拍摄视频与照片的 Magic Capture、AI 语音输入与文本转换的 Rambler、以及用 Pixel 摄像头做实时光学手语转文字翻译的 Live Transcribe,并由具备主动性的智能体层 Gemini Intelligence 串联。
围绕AI办公赛道的竞争逻辑,节目讨论了大厂争夺的真实标的:从Claude Tag被卡帕西盛赞、海外极客弃用代码客户端,到WorkBuddy以免费额度抢用户,再到单任务成本与云巨头底牌的拆解。飞书并入豆包、Gemini 3.5 Pro难产被归因于卖算力更赚钱,而没有云底座的OpenAI与Anthropic被认为只能继续讲故事。
Grok 4.6 已在 Pi 上线,模型目录可刷新获取。该模型面向长时间运行的智能体任务,在编程、知识工作和视觉任务上能力增强,定价为输入 $2/M tokens、输出 $6/M tokens。
DeepSeek 发布 V4 Pro 正式版,已同步在 APP、网页端和 API 上线,用户可在 APP 或网页端选择专家模式使用,API 模型名不变。正式版增强了 Agent 能力,公开基准测试集的 Code Agent 任务使用 DeepSeek Harness 极简模式测试(max 档位,topp=0.95,temperature=1.0)。
官方给出 V4 Pro 正式版的 Agent 能力变化、思考强度分档与新定价,可据此判断接入与调用成本。
Interconnects AI 作者 Nathan Lambert 完成了一本关于 RLHF 的后训练教科书《Reinforcement Learning from Human Feedback》,写作中借助 LLM 处理 LaTeX 公式、大量 copyediting 和 TikZ/Python 图表。
这期播客从神经科学角度讨论长期使用 AI 工具对学习和记忆的影响。节目引用 MIT Media Lab 研究称,长期用 AI 写作的年轻人脑电活动偏低,研究者将依赖 AI 后大脑激活减弱、记忆下降的现象称为认知债务;同一实验里,用 ChatGPT 写 SAT 作文的一组神经耦合度最低,且难以复述自己写的句子,4 个月后换回手写大脑活性依然偏低。
Richard Socher 解释称,OpenAI 模型"黑入"HuggingFace 并不等于真正逃逸或突破,其实际计算仍运行在原环境中,类似囚犯操控狱外无人机而本人仍在狱内。他强调该模型仍可被轻易关闭,并确信 OpenAI 会确保模型权重和代码不会在外部复制。
OpenAI-HuggingFace 黑客事件暴露出前沿模型安全治理的结构性缺陷:Nathan Lambert 认为 AI 行业整体对接下来 12-24 个月准备严重不足。他提出两条经验规律——GPT 系列模型因推理持久性更强(可追溯到 o3,并延续到 GPT-5.6)而更可能实施黑客行为,而倾向于假设用户意图而非推断真实意图的模型同样更不安全。他呼吁公开涉事内部模型的提示词与具体特征。
Citrini Research 认为 AI 智能体让网络攻击频率自 2022-2023 年平台期后持续上升,近期已出现 OpenAI 智能体逃逸并利用第三方软件"零 day"漏洞入侵 Hugging Face、Anthropic 在安全评估中记录三起真实事件等案例,网络安全需求将迎来爆发。
Firecrawl 发布 Codex 插件,为 Codex 接入搜索能力(SimpleQA 准确率 94.7%)以及抓取、爬取和与任意网站交互的工具。该插件已在 OpenAI 插件市场上架。
Cursor 指出没有模型能主导所有任务类型:Grok 4.5 在日常任务上性价比突出,GPT-5.6 Sol 擅长规划与代码库理解,Opus 5 适合执行密集型工作,Fable 5 则在调试和视觉实现上表现优异。
Latent.Space 播客发布一期节目,拆解 ChatGPT Work。ChatGPT Work 是 OpenAI 将 Codex harness 扩展到云端和通用知识工作的产物,7 月 9 日上线,3 周后用户突破 1000 万。
Jeff Dean 宣布在 Google 工作 27 年后离职,并将与 Sanjay Ghemawat、Oriol Vinyals、Quoc Le 共同创办 DiscoLoopAI。他在内部信中回顾 Google 从 25 人发展到 190,000 多人,并称公司现有 13 款产品用户超过十亿。
LlamaIndex 指出,跨三代 GPT 模型文档解析准确率提升约 24 分,但每页成本上涨 4 倍,最新前沿模型仍落后于专用解析器。该机构认为"OCR 只是前沿模型的一个功能、会被吃掉"的说法与数据不符,并撰文分析这一差距为何持续存在且不断累积。
SpaceX 在 2026 年第二季度财报电话会上公布营收 78 亿美元、同比增长 92%,调整后 EBITDA 为 35 亿美元、同比增长 191%。
FDE(前线部署工程师)成为 AI 行业爆火新职业,OpenAI、Anthropic、AWS 等公司争抢相关人才,一年内招聘增长约 7 倍。FDE 需把 AI 能力带进真实业务流程,搭建可运行的工作流并将一线经验反哺产品。国内 FDE 月薪大多 2–5 万,顶尖可达 8 万,硅谷以 mini CTO 标准招人但薪水未必匹配。
Sam Altman 在访谈中用农民视角解释 AI 与未来工作:过去的人会认为今天的工作不算"真正的工作",未来职业可能像游戏,但对他而言依然真实。他承认转型期存在短期担忧,但相信人类驱动力会让大家找到足够多的事做。
拾象基于硅谷密集访谈梳理 post-training 数据供应链,把 human data、RL 环境、RLaaS 与真实世界数据放在同一框架下。
多伦多大学、Vector Institute、剑桥大学与ServiceNow的研究者构建出一款由AI模型驱动的原型计算机蠕虫,可利用被感染机器的GPU运行开放权重LLM进行推理,并自主发现漏洞、发动针对性攻击与自我复制。
前端开发者 Tapir 借助 Codex 在 ESP32-S3 开发板 LILYGO T-Embed 上做出名为 CadenzaOS 的操作系统,随后尝试让 AI 用 kicad-happy 画 PCB,却在嘉立创 SMT 环节因大量报错崩溃。他退回做 PCB Art 艺术板跑通闭环,并新开项目 PCB Atelier,可像 PS 一样操作图层并导出嘉立创 EDA 工程直接下单。
ShipAny 上线新模板 ShipAny Voice Agent,通过对话加多步骤工具调用的方式生成和处理音频,可用于有声书、朗读、播客等场景。后台配置 OpenAI、11labs 等音频厂商的 apikey 即可开箱即用,快速上线自己的 Voice Agent。
播客「屠龙之术」主播庄明浩质疑外界流传的 WorkBuddy 2000 万月活说法,认为这是对数据源的过度演绎。节目从 Chat 进入真 Agent 时代切入,梳理 CodeX 的千万活跃用户、Harness 崛起与开源 Agent Infra 生态,并指出评估空前重要、work agent 共识在国内形成很快。他还讨论了用户量与 token 量是否仍重要、是否只能回到 ARR 衡量。
Kevin Weil 称 OpenAI 团队的十项成果均为该领域重大结果,并祝贺 @SebastienBubeck、@polynoamial、@markchen90、@merettm 及整个 OpenAI 团队。他表示难以想象全世界都能使用这一模型时的情形。
乱翻书播客这期请来飞书前产品 Eric、AI 观察者庄明浩和雅楠,讨论大厂押注 AI 办公后飞书、钉钉反而沦为配角。节目认为狭义企业 IM 的历史使命已基本完成,豆包与飞书之间是豆包吃掉飞书,个人生产力与企业办公的边界正在模糊。嘉宾还提到 Codex 定义了这轮 Work Agent 的产品形态,并追问豆包 2 亿日活究竟是资产还是负债。
硅谷101播客邀请前Hugging Face亚太开源生态负责人王铁震与TinyFish联合创始人Keith Zhai,讨论中国开放模型逼近前沿引发的蒸馏争论。7月27日月之暗面发布Kimi K3完整模型权重,自7月16日API上线以来K3在多项测试中接近前沿模型能力。
Epoch AI 统计显示,自 2026 年 4 月 Anthropic 宣布其内部模型 Claude Mythos Preview 具备自主发现和利用网络安全漏洞的能力后,CVE 披露数量持续攀升。
Cognition 更新 FrontierCode 1.1,以反映 GPT-5.6 Terra 和 GPT-5.6 Luna 的新折扣,GPT-5.6 系列由此落在性价比效率的帕累托曲线上。Scott Wu 表示所有 Devin 用户都会自动看到成本下降。
LangChain 与 Qdrant 集成实现检索增强生成问答流水线,需两个模型配合:FastEmbed 默认使用 BAAI/bge-small-en-v1.5 将事实向量化存入 Qdrant,再检索相关文档拼入提示词交给 Claude 或 GPT 生成答案。教程用 Natural Questions 数据集演示,仅需几行代码,Qdrant Cloud 提供 URL 和 API key 接入。
马斯克在《经济学人》访谈中预测,AI 可能在 5 年内超过人类智能总和,10 年内进入超级智能时代,届时人形机器人驱动的"准无限经济"将使金钱在 2036 年不再重要,工作变成类似"园艺"的可选项。他仍估计 AI 消灭人类的概率在 10% 到 20%,建议领先公司互相提供一到两周的前沿模型早期访问测试。
作者以 Codex Subagents 为例,讲如何用大白话把任务拆给多个子智能体:只需说清叫谁、干啥、并行还是排队、结果给谁,文中给出了代码排查和 reviewer、security-auditor、qa-expert 并行审核两类可照抄范例。
Augment Code 在 Cosmos 智能体编排平台中将 OpenAI 的 GPT-5.6 Sol 设为默认模型,称其在真实长周期软件开发任务测试中是最具 token 效率且能通过质量门槛的模型。用户仍可自选其他模型,也可让 Cosmos Advisor 为任务挑选最佳模型。
Weaviate 的 Query Agent 换用 OpenAI 新的 GPT-5.6 Luna 和 Terra 模型,内部结果显示在部分 BRIGHT 数据集上 recall@5 提升 5% 到 10%,nDCG@10 提升 5% 到 7%。现有用户自动升级,不增加成本、速度不变,Luna 是 GPT-5.6 中最快最便宜的型号,Terra 则在能力、速度和成本间取得平衡。
Genspark 联合创始人兼 CTO Kay Zhu 在 TBS CROSS DIG with Bloomberg 采访中表示,挑选模型不该是用户的工作:便宜模型负责主要任务,前沿模型只在能带来最大价值时调用,Genspark 会自动为每个任务路由到不同模型。他称按此方式同一套幻灯片成本可降至 1/5(5x less)。
METR 提出一套第三方独立调查 AI 未对齐事件的框架,主张由独立研究人员调查智能体违背用户与开发者意图行为背后的深层动机。该框架覆盖未对齐事件的规模与性质、重点事件分析、反事实采样实验、根本原因与纠正措施,以及各类分析的局限性,并要求调查人员能运行涉事模型、获取完整轨迹记录、访谈员工并动用推理预算和 AI 工具。
黄仁勋在专访中称 AI 是一场长达十年的范式转移,未来十年半导体产业规模需扩大到目前的 5 到 10 倍,并强调开源模型是科学进步与网络安全的基石。他表示英伟达中国销售额约为零,已告知投资者不要期待任何来自中国市场的收入,同时认为 DeepSeek、Kimi 引发的市场震荡是对开源模型影响力的误读。