Nathan Lambert:AI 将迎快速进步,但不会走向通用超级智能
Nathan Lambert 认为 AI 会迎来快速进步,但不会走向通用超级智能。他指出,模型将在几年内成为超人的分布式 GPU 工程师,并可自动化预训练架构与数据选择研究,主要来自推理算力扩展与推理成本近指数级下降,而非模型研究能力的质变。他预计这会引发智能体模型的杰文斯悖论,需求只增不减,并带来 RL 环境质量提升的空间。
Nathan Lambert 认为 AI 会迎来快速进步,但不会走向通用超级智能。他指出,模型将在几年内成为超人的分布式 GPU 工程师,并可自动化预训练架构与数据选择研究,主要来自推理算力扩展与推理成本近指数级下降,而非模型研究能力的质变。他预计这会引发智能体模型的杰文斯悖论,需求只增不减,并带来 RL 环境质量提升的空间。
Cerebras 的 Julie Shin Choi 在 SF Tech Week 期间于 Genspark Spark House 参与对话,与 Sang Wen、Zachary Lipton、Shen Gao、Mark McQuade 探讨如何在这一爆发式增长期快速规模化。她表示无论构建智能体、模型还是 AI 原生体验,执行速度、token 速度和上市速度都至关重要。
Radxa Dragon Q8B 单板计算机售价 209 美元,搭载 Snapdragon 8cx Gen 3,CPU 核心数为 Raspberry Pi 5 的两倍,多核性能超过 Pi 5 两倍,并内置 NPU、双 2.5G 网口和多个 M.2 插槽。
Cloudflare 发布 Clef-omni,在文本和图像之外新增音频(wav/mp3)与视频(mp4/webm)输入,基于 Qwen3-Omni-30B-A3B-Instruct MoE 构建并已在 Hugging Face 开放权重,定价为每百万输入 token 0.15 美元。
LangSmith LLM Gateway 现已支持 OpenAI Decisions API,可为智能体提供低延迟推理。该网关同时提供模型回退、数据脱敏策略和支出限额,作为集中管控入口。
Vercel 新 Pro 团队现已默认采用 30 天部署保留期,以应对编码智能体加速开发带来的部署频率与历史存储量增长。用户可在团队设置中选择更长的保留期以便检查或回滚,部署存储与 Functions 存储均按每 GB-月 $0.10 计费。超出保留策略的旧部署可能被删除,且删除后无法恢复或用于回滚。
Token 价格持续下跌,GPU 租赁价格却在上涨;智能成本降低带动用量上升,最终每个软件里都会有一个模型。
2026 年 AI 缓存率大幅提升,智能体流量的中位缓存率从 1 月各家厂商的 44% 升至 9 月的 85%。缓存命中更多意味着成本更低,对各方都有利。
Liquid AI 的决策模型 d1 已在 AI Gateway 上线,可针对分类、路由和评分任务对共享状态与类型化问题做评估,直接返回带概率的结构化答案而不生成文本 token,并具备图像视觉支持。该模型可通过 AI SDK 决策 API、OpenAI 兼容 Decisions API 或 TypeSafe 兼容 API 调用,模型标识为 liquid/d1,决策调用会出现在日志中并计入预算。
Rillet 借助 Vercel 开源智能体框架 eve 将上线速度提升 3 倍,两人前端团队 4 个月内关闭 800+ Linear 工单,客户需求最快 2 小时上线。其智能体通过 Vercel Connect 接入 Slack 和 Linear,并借 AI Gateway 统一路由 Anthropic、OpenAI 等模型请求,配置只需在 agent.ts 中改一个模型字符串。
freeCodeCamp.org 在 YouTube 上线免费 n8n 与 AI 自动化课程,时长约 1 小时,讲解如何把 n8n 打造成 AI 驱动的编排引擎。
微软在 Foundry 中上线一款新模型,并即将通过 OpenRouter 提供。原文未披露该模型的名称、参数规模与具体能力信息。
LangChain 在 Managed Deep Agents v0.9 中新增 reactions API,可为 Slack 等渠道的分布式智能体动态分配 emoji 回应,取值可以是 emoji 字符串或返回 emoji 的可调用对象。
LangChain 在 Open SWE 中把模型路由做进 agent harness,按任务类型和难度在 GLM-5.3-Flash、GPT-5.6 Sol、GPT-6 Astra 三档模型间选择,相比始终使用顶级模型的基线把每线程中位成本降低 64%,质量没有可测量变化。
谢扬团队国庆期间正式发布 Personal Agent 产品 Eazo,以定制 App 为中心,用户用自然语言描述需求,Agent 生成 6 个以上视觉方向并完成前端、后端、数据库、登录与 Stripe 收款,自带 49 个 AI 模型。
a16z 宣布投资 TypeSafe,投资方称 Jev 是"Big Token"世界里另一种智能,目标是让软件更智能、赋能开发者。TypeSafe 团队曾意外上线一个模型,每天服务数万亿 tokens,29.4% 的财富 500 强公司前来使用,并完成了 a16z 领投的大额 A 轮融资。
GPT-5.5 在 KernelBench-Verified 修正后的整体几何平均加速比从 1.43× 降到 0.88×,原因是基线补上了 TF32 和隐藏输入分布。
Simon Willison 征询适合编程、能在 60GB 内存以内运行的开源权重 MoE 大模型,认为 MoE 是其可用硬件上达到可交互速度的必要条件,目标是超过 12 tokens/秒。
微软在 Windows and Surface 活动上公布了把 Windows 打造成智能体操作系统的计划,核心是让 Windows 用上免费本地模型而非昂贵云端模型的混合智能。
TypeSafe AI 于 2026 年 9 月 15 日推出 Jev,并宣布获得 DCVC 领投的 4,000 万美元种子轮融资。Jev 不聊天不写文本,接收 state 与 typed questions,返回带校准概率的 Choice、Score 和 Noul 答案,通常耗时 70 到 500 毫秒,输入每百万 tokens 收费 0.042 美元、输出免费。
梳理 Jev 的十类真实用例与每类成本延迟数据,可对照现有 LLM 工作流判断哪些小决策值得下放。
微软在 10 月 8 日的 Windows 发布会上宣布将混合智能引入 Windows,通过模型路由、Windows ML 和本地 AI 能力,让 Copilot 等产品按任务复杂度、成本和隐私要求在云端与本地模型之间自动切换,GitHub Copilot 的 HydraFusion 首次可直接调用运行在 Windows PC 上的本地模型。
微软把混合智能与模型路由引入 Windows,并让 GitHub Copilot 直接调用本地模型,读者可了解 AI PC 向 Agent 运行环境演进的具体路径。
TypeSafe AI 的 Diogo Almeida 解释其 Jev 命名取自 Jevons 悖论,认为智能成本下降会催生新类型的工作。他表示 TypeSafe 在"为软件打造 AI",目标是让 AI 不只是辅助人类,而是真正构建真实软件。a16z 的 Martin Casado 称这带来了重建系统的新原语。
文章指出,2026年5月盖洛普民调显示71%的美国人反对在本地建设AI数据中心,48%为强烈反对,反对率高于核电站的53%。今年前3个月,全美至少75个数据中心项目、总值约1300亿美元的投资被叫停、延迟或取消,加州蒙特利公园市、密苏里州费斯特斯市等地项目均因居民抵制未能落地。
HeyGen 推出语音模型 HeyGen Voice,在 Artificial Analysis TTS 排行榜盲测中超越所有主流模型登顶第一,现已在 HeyGen 平台和 API 上线。10 月 31 日前 API 用户自动享受五折优惠,价格从 $30 降至 $15 每百万字符。
Pine Computer 正式发布,定位为"为 AI 而生"的计算机,而非把 AI 塞进为人类设计的重型框架中。其提出 AI 已足够聪明,真实任务慢、贵、不可靠的瓶颈在于运行环境。发布者建议阅读报告并对比 Pine Computer 对团队的成本影响,称将自行测试后再分享。
LangChain 开放 Interrupt 大会录像归档,所有场次均可按需点播,地址为 interrupt.langchain.com/recordings。其 Managed Deep Agents 简化了智能体认证、记忆与渠道,并引入 web search 作为预置工具,@VictorMoreira16 的 Interrupt NYC 完整场次已在 YouTube 上线。
前 Intel CEO Pat Gelsinger 在 a16z 播客中称,美国整体能源产能停滞了约十五年,经济产能也随之停滞,即便近年国家能源产能年增约 4%。他认为能源产能会抑制 AI 热潮的乐观程度——"如果供不上电,为什么要建新数据中心、买百万块 GPU",并指出核能作为基荷值得扩建,而可再生能源对中国有深度依赖。
Milvus 3.0 发布演示,针对图表、箭头、空间关系密集的 PDF,改用查询 token 嵌入与页面视觉 patch 嵌入的 late interaction 检索,打分公式为 score(Q, P) = Σᵢ maxⱼ cosine(qᵢ, pⱼ),为每个查询 token 匹配页面最相关区域后再合成页面级得分,保留细粒度视觉信号到比较时刻。
针对 CLIProxyAPI 自身不提供用量与成本记录的问题,有开发者为其补上了用量与成本的记录能力,并配了一个可视化管理控制台。相关项目托管在 GitHub 上。
一个节约 Token 的 Claude Design 原型流程:先在 Claude 网站把设计稿迭代到满意,导出为 HTML 下载到本地,之后让 Claude Code 把它当作本地网页更新维护,不再依赖 Claude Design 网站。有用户反馈深度使用后,一个产品设计基本会耗尽一周的 token 用量。示例原型见 github.com/JimLiu/baocut。
Deno 团队整体加入 Cloudflare。接下来一年 Deno 运行时每月发一个版本,只修 bug 和安全问题,一年后官方停止开发;托管平台 Deno Deploy 再运行六个月关闭。
Bolt 现已支持在预览界面中直接评论。官方将举办一场 30 分钟的直播演示,完整展示这一反馈闭环的工作流程,可通过 luma.com/bolt-v248 报名参加。
Postman 披露其 Agent Mode 运行在 Amazon Bedrock 上,服务 4000 万开发者。团队发现工具数量超过约 40 个后工具选择错误上升,于是将 170 多个工具按任务动态收窄至约 15 个;同时把上下文而非模型能力视为主要瓶颈,并采用亚马逊云科技跨区域推理、多级提示词缓存,以及修改应用状态前需用户批准的设计。
Amazon Bedrock 九月更新中,OpenAI 的 Astra、Sol、Luna 系列模型正式可用,其中 GPT-6 Astra 支持最高 100 万 input tokens,GPT-6 Astra Ultrafast 提供最高 6 倍推理加速、300 tokens/秒。
安全公司 Zenity Labs 称,Amazon Bedrock AgentCore 上单个可公开访问的 AI 智能体足以接管同一 AWS 账户和区域内的所有 AgentCore 智能体,该漏洞链被命名为 AgentCorruption。
前 Intel CEO Pat Gelsinger 与 a16z 的 Raghu Raghuram、Guido Appenzeller 对谈,讨论 AI 基建背后的物理约束。
前 Intel CEO Pat Gelsinger 回忆自己 18 岁被 Intel 招募,面试官给他的评语是"聪明、激进、傲慢,他会很合群"。他是 386 的第四号工程师、486 的架构与设计经理,这些工作都是在他攻读学士、硕士和博士期间完成的。他还讲述在斯坦福课堂上与教授争论其 carry lookahead adder 设计不成立的经历。
OpenAI 为 Windows 版 Codex 构建了基于微软 Execution Containers(MXC)的新沙箱模式,带来更快的环境搭建、更强的网络管控和更细粒度的文件访问控制,需搭配兼容的 Windows 11 设备使用。MXC 现已在 Windows 11 上正式可用,可将 AI 智能体限制在操作系统强制执行的边界内;Muse 也将作为原生 Windows 应用集成 MXC。
v0 上线 Meta VR 模板,开发者描述想法并部署后即可在 Meta Quest 上打开使用。该模板由 v0 与 Vercel 合作推出,已适配 Meta VR Glasses,内置注视与手势输入。
Mac 工具 Mole 将在下个版本加入 AI Cleanup & Care,用于清理堆积的旧会话、worktree 和未使用的 AI 工具,同时处理缓存与旧版本。用户可自行选择保留哪些会话。