Meta Superintelligence Labs 提出 agent plasticity,用每美元学习收益衡量 AI 智能体自我改进
Meta Superintelligence Labs 提出用 "agent plasticity" 衡量智能体自我改进的性价比,即在模型权重冻结、每次运行使用全新上下文的条件下,衡量花费每美元学习成本在留出任务上取得的收益。
Meta Superintelligence Labs 提出用 "agent plasticity" 衡量智能体自我改进的性价比,即在模型权重冻结、每次运行使用全新上下文的条件下,衡量花费每美元学习成本在留出任务上取得的收益。
elvis 对后训练变得更易获取这一趋势表示乐观,认为新的后训练时代已经到来。他指出在智能体 RL 中,长上下文任务成本高、效率低且难以扩展,rollout 消耗了大部分 token,每一轮都要重新读取不断增长的上下文,包括工具输出、文件和此前的轮次。
Armadin Security 创始研究员 Yonatan Oren 分享了其团队如何在 Fireworks Forge 上后训练开源模型,用于监控生产环境中的安全智能体。相关分享将于 11 月 3 日在旧金山举行。
GrokBot 邮箱现已开放申请:用户需先拥有 Grokbot 账号并绑定 X,然后在 X 上 @bot 说明想要的邮箱地址,Grokbot 会发来消息要求授权,地址被占用还可以修改。该邮箱可用于注册服务、代你联系商家或与他人约时间。
Grokbot 能连接 X,这是它的一大优势,可以让它帮你推送 X 上值得关注的 AI 资讯。
Cognition 宣布 Devin 可接入个人 ChatGPT 订阅,用户连接 Go、Plus 或 Pro 计划后,所有 GPT 模型用量将从该订阅的配额中扣除。
原字节 AI 编程产品 TRAE 负责人石扬于国庆前夕离职,与前字节 AI 数据与安全负责人傅越联手创办 AI 办公公司,已敲定首轮融资,投后估值约 2 亿美元。石扬此前在字节操盘豆包 MarsCode 与 TRAE,傅越曾组建字节 Global Data 团队;新公司目前仍处于 Stealth Mode。
宝玉描述自己的功能开发和 bug 修复都跑在一个 loop 循环里,Agent 和自己都能快速拿到反馈,loop 转得越快效率越高。Loop 跑通后可尝试多任务并行,因为大部分时间由 Agent 生成和验证,人可以专注定义问题和验证。当前主要瓶颈是电脑设备不够多和 Token 不够用,他计划多在云端开任务来缓解设备不足。
宝玉建议用 /autocompact 400k 限制 Claude Code 的自动压缩上下文长度,认为 400k 左右比较合理,他自己设置为 300k。他还表示此前建议在 ~/.claude/settings.json 中禁用 1M 上下文的 "CLAUDE_CODE_DISABLE_1M_CONTEXT" 现已没必要,应删除,否则最多只能到 200k。
Vercel 扩展其 CLI 能力,AI 智能体现在可直接通过命令行购买域名。此前智能体已在其 marketplace 中频繁通过 CLI 购买基础设施产品和服务,如今加上域名后,智能体可完成从想法到上线业务的全栈流程。
Agent Arena 采用因果追踪(causal tracing)方法衡量智能体能力,替代成对偏好投票,从真实、长时程的智能体会话中提取五项信号。
Vercel CLI 新增域名购买能力,智能体可通过 vercel domains search/check/price/buy 完成从搜索到下单的流程,购买决策仍由用户确认。该命令非交互运行时返回结构化错误和建议的后续命令,避免智能体未经批准消费;CLI 还附带面向智能体的技能,覆盖发现、定价与购买全流程。
ElevenLabs 在 ElevenAgents 中推出合成语音检测,用于识别代个人、其他公司乃至恶意行为者拨入企业的 AI 智能体来电。ElevenLabs 同时加入新成立的 Personal Agent Protocol 工作组,参与制定智能体之间的交互规范。
宝玉将文章中的开发方法论完整应用于开源项目 baocut,流程涵盖技术方案文档、原型与 UI 设计、编码实现和测试验收。他让 Agent 先做调研并撰写技术方案文档,反复沟通定稿后再产出接近正式 UI 的高保真原型,最后才实现代码。验收阶段 Agent 借助 Electron 的浏览器能力自行测试,多数活由 Agent 完成,人只负责定义问题和验收。
宝玉将其文章方法论完整应用于开源项目 baocut,流程分四步:先让 Agent 写技术方案文档并反复修改定稿,再做高保真原型与 UI 设计,然后实现代码,最后由 Agent 自行测试验收、人工复测收尾。他把技术栈改回 Electron,Agent 通过浏览器即可验证绝大部分功能,仅复杂场景才用 Computer Use 辅助。人主要负责定义问题和验收两端。
lmarena.ai 发布了一条指向 arena.ai/resources/agen… 的链接,正文未附任何说明文字,仅显示 0 条回复、0 次转发、5 次点赞和 2675 次浏览。该帖由 xgo.ing 提供数据支持。
LangSmith LLM Gateway 现已支持 OpenAI Decisions API,可为智能体提供低延迟推理。该网关同时提供模型回退、数据脱敏策略和支出限额,作为集中管控入口。
苹果发布会的“科技春晚”地位正在消退,OpenAI、Google、Anthropic 等 AI 开发者大会成为新的关注中心。2026 年 9 月 OpenAI DevDay 发布二十多项更新,重点推出可长期运行的个人 Agent Dots,并新增每月 500 美元会员档位、调整 GPT-6.1 Sol 价格体系,但新能力增量有限、悬念减弱。
4 个 Grok @bot 模板现已可在 X 上直接使用,分别覆盖 launching、threat hunting、threat intel 和 X API 集成四类场景。
X API Engineer 已在 Grok Bot 中上线,可帮助开发者基于 X API 从案例中获取灵感、完成构建与测试,并直接部署项目供他人使用。该功能由 Paul Vann 介绍,意在解决开发者不知从何入手的问题。
Grok Bot 正式推出专属邮箱,Bot 可用它注册服务、替你联系商家或与他人约定时间。该邮箱前缀可在评论区 @ Grok Bot 或转发推文领取。
elvis(@omarsar0)用 Jev 驱动的自动化流程追踪并索引 X 上分享的 Jev 用例,整理成一份灵感清单,发布在 academy.dair.ai。他表示 Jev 已成为 dair_ai 构建软件的核心工具,并称其减少了可靠性问题。该索引自动化本身也由 Jev 完成。
内容指向在 academy.dair.ai 的 dashboard 资源页用 Jev 和 Pi 构建自定义 harness。原文未给出更多模型版本、参数或可用性细节。
Codex 面向 Pro 用户开放 composer predictions 测试版,可基于对话内容和你与它的交流方式预测你的下一条消息。有开发者表示自己在 agent orchestrator 中已自建同类功能数月,并用 Haiku、Luna 等小模型实现,可随使用调优并适配个人偏好。
Andrew Ng 在 The Batch 本周公开信中指出,他的一个智能体每天执行 5000 到 10000 次网页搜索,智能体将需要远更多的数据中心。本期还提到 GPT-6.1 Sol、Gemini 4 Argon、FLUX 3 Action 和 HYSET。
LangChain 提出每个 AI 智能体开发者都应能回答的 3 个问题:智能体在哪里失败、如何复现、如何让它停止失败。相关分享来自 Jake Broekhuizen 的一场演讲,视频已在 YouTube 上线。
Asana 借助 GPT-6.1 Sol 让浏览器智能体在测试中成本降低 76 倍、速度提升 5 倍,从而为客户提供能力更强的模型。
Rillet 借助 Vercel 开源智能体框架 eve 将上线速度提升 3 倍,两人前端团队 4 个月内关闭 800+ Linear 工单,客户需求最快 2 小时上线。其智能体通过 Vercel Connect 接入 Slack 和 Linear,并借 AI Gateway 统一路由 Anthropic、OpenAI 等模型请求,配置只需在 agent.ts 中改一个模型字符串。
a16z 对谈 TypeSafe AI 的 Diogo Almeida 指出,AI 在 3 年内的"贬值"幅度相当于 PC 用 15 年才完成的水平,廉价智能正让模型走出聊天机器人、进入真正干活的软件。TypeSafe 称其在为软件打造 AI,目标是让 AI 不只服务"人类在环",而是真正构建软件。Martin Casado 认为这带来重建系统的机会,因为行业多了一个全新原语。
Grok Bot 现在拥有自己的邮箱,可用于注册服务、代用户联系商家或与某人约时间。该功能由 xgo.ing 提供支持。
ChatGPT 的 dot 现在能在 Codex 中启动工作、跟进已有线程,并调用你的 ChatGPT 对话、Codex 线程和自动化任务,还能判断何时续用线程、何时新开。dot 也可在 ChatGPT Work 中查看和编辑 Scheduled Tasks,支持查询已排期任务或随计划变化更新重复任务。
freeCodeCamp.org 在 YouTube 上线免费 n8n 与 AI 自动化课程,时长约 1 小时,讲解如何把 n8n 打造成 AI 驱动的编排引擎。
LangChain 在 Managed Deep Agents v0.9 中新增 reactions API,可为 Slack 等渠道的分布式智能体动态分配 emoji 回应,取值可以是 emoji 字符串或返回 emoji 的可调用对象。
LangChain 在 Open SWE 中把模型路由做进 agent harness,按任务类型和难度在 GLM-5.3-Flash、GPT-5.6 Sol、GPT-6 Astra 三档模型间选择,相比始终使用顶级模型的基线把每线程中位成本降低 64%,质量没有可测量变化。
Anthropic 为 Claude Managed Agents 加入动态工作流,实现多智能体编排:由主智能体制定计划、向子智能体分发任务并合并结果,单次执行最多可并行运行 1000 个智能体。
谢扬团队国庆期间正式发布 Personal Agent 产品 Eazo,以定制 App 为中心,用户用自然语言描述需求,Agent 生成 6 个以上视觉方向并完成前端、后端、数据库、登录与 Stripe 收款,自带 49 个 AI 模型。
a16z 发布 Ben Horowitz 与 TypeSafe AI 的 Diogo Almeida 对谈,主推其"build prod, not God"路线。Diogo 透露其模型意外每天服务数万亿 token,29.4% 的《财富》500 强客户找上门,并于 3 周前从 a16z 完成一笔大额 A 轮融资。他称大多数 AI 圈内人"没搞懂",只把问题当成分类器层面的抱怨。
TypeSafe AI 的 Diogo Almeida 认为,最“无聊”的大型 SaaS 公司最有希望赢下 AI,因为它们最懂该自动化哪些工作流。他称 SaaSpocalypse 关于“软件易复制”的叙事站不住脚,很多关键逻辑藏在底层,SaaS 将成为 AI 最大赢家之一。他透露其模型曾意外每天服务数万亿 token,并有 29.4% 的财富 500 强客户出现。
EngramLab 联合创始人 JessyLin 将在 Fireworks Forge 上演讲,主题是构建具备原生记忆的智能体——让智能体既能在权重中记忆,也能在上下文中记忆。活动于 11 月 3 日在旧金山举行。
OpenAI 推出 GPT-6.1 Sol 的 Ultrafast 版本,速度是标准版的 8 倍,官方称智能水平与标准版一致且逼近旗舰 Astra。