想30分钟写出好skill?用Anthropic官方五项标准评审internal-comms
写好 skill 的前提是先看懂好 skill 的标准,评审优秀 skill 有五项标准:description、触发策略、正文、第三层、一致性。
写好 skill 的前提是先看懂好 skill 的标准,评审优秀 skill 有五项标准:description、触发策略、正文、第三层、一致性。
VA-Bench 以观察、推理、行动、修正的闭环测试 12 个多模态模型,覆盖 14 类机器人操作任务共 280 个基础场景。表现最好的模型在目标识别与定位上达到 100%、操作语义理解达到 99.6%—100%,但 Qwen3.8-max、Opus-5 和 GPT-5.6-sol 的完整任务成功率分别只有 53.93%、52.86% 和 51.55%。
OpenAI 研究员、o1 早期奠基者之一 Noam Brown 在与 Dwarkesh Patel 的对话中表示,用 1 万个智能体在 88 小时内消耗 1300 亿 token 解决一道千禧年大奖难题,功劳主要不在多智能体,他估计多智能体的贡献不到 10%,核心原因是拥有一个强大的通用模型。
Nathan Baschez 认为 99% 公司让员工各自折腾 Codex、Claude Code 等个人 AI Agent 的模式不是终局,下一步应是共享的「AI 工厂」。与 Skills 不同,工厂要求系统 Shared、Specific、Scrutinized——尤其可审视性决定反馈回路是否存在。他以两家百人咨询公司为例:集中建设共享工厂的一方在学习曲线上可深入约 5 倍。
微软与加州大学圣巴巴拉分校研究者公开论文 ScholarEvolve,从已发表 Agent 研究中提取改进思路,写入运行框架 Harness,再用真实任务检验,执行任务的模型本身保持不变。
逛逛GitHub 盘点 9 月 GitHub 上 20 个热门开源项目,月增 Star 最高的是 Archify,约 3.34 万,用 Skill 把系统描述或代码仓库画成交互式架构图;Ponytail 以约 3.12 万 Star 教 Agent 优先复用现有代码。
UT Austin 对编码智能体中的上下文压缩做了一项研究,在 SWE-bench Verified 和 Terminal-Bench 上跑了近 35,000 次智能体运行,分别改变压缩方式、触发时机和压缩比例三个变量。
本地优先的 Excel / CSV / TSV 数据质量工具 Precis 通过 MCP 暴露 validate_data、check_config、describe_constraints、infer_schema 四个工具,让 AI 助手负责解释需求、生成规则草稿和触发校验,确定性规则执行仍落在本地引擎。
fx v0.0.13 新增 Ultrafast 支持,针对受支持的 OpenAI 模型将启动速度提升最高 23 倍、shell 调用提升 8.6 倍、退出提升 44 倍,并加入可配置的自动压缩。Guillermo Rauch 表示,随着模型本身加速,harness 开销愈发关键,下一版将改进会话存储与检索,并在 libfx 中解锁云端持久性。
Vercel 持续推进 Rust 化,早期把 Turborepo 从 Go 迁移到 Rust,迁移虽完成,但内部对回报争议很大——Rust 更适合构建系统所需的底层系统访问,人力迁移成本却相当高。Guillermo Rauch 表示,随着 AI 智能体到来,这一权衡已被改写,"对人类最好"不再等于"对业务最好",Rust 也未必是终极工具链。
Browser Use 推出 JavaScript 版本,已随 browser use pi 一同发布。此前大量用户询问 JS 版浏览器使用能力,官方现已在 GitHub 上线对应仓库。
Jerry Liu 认同 ChatGPT/Codex 拥有当前最好的深度工作智能体界面,理由是它把编程与知识工作统一在一个界面中,ChatGPT 与 Codex 之间切换没有明确分离的流程,并支持分支(forking)。他仍喜欢 Opus 5.5,尤其用于产品演示,也认为 Claude Code CLI 已是 CLI 应用能做到的最好水平。
LlamaIndex 推出 Extract v2.5 系列文档抽取智能体,包括 cost-effective、agentic、agentic plus 三个档位,称在 ExtractBench 上价格性能达到 SOTA,抽取表现优于 Opus 5.5 和 GPT-6 Sol 且便宜 30%-4x。
Perplexity 的 Computer 支持用户在内部构建自定义垂直 AI 应用,例如用 3D 与卫星视图猜测图像空间位置。
马斯克规定管理人员收到明确指令的邮件只能有三种回应:解释为何有误、要求澄清、或直接执行,否则将被要求立即辞职。有人将这三条规则套用到 AI Agent 上,但指出 Agent 并不怕被开除。
Anthropic 的 Claude Managed Agents 实操 workshop 将于 10 月 12 日在 AI Engineer New York 开讲,由 cjav_dev 和 Harrison Stall 主讲,内容为 Managed Agent 的最新功能。活动 10 月 12 日至 14 日在纽约举行,workshop 需在会议通票之外另行购买。
OpenAI ChatGPT 与 Codex 负责人 @thsottiaux 在访谈中表示,模型选择器很可能消失,循环与图结构只是过渡阶段,未来互联网上大多数操作将由 AI 智能体完成,并谈及 OpenAI 的 AI 安全思路。
Meta 的 Muse 登上美国 App Store Productivity 分类第一,评分 4.9、超过 10 万条评分,同时 Meta 开源了 Muse Gadget SDK。
Citadel Securities COO @jay_wooow 提出"公司没有自身的模型",主张用 Slack、演示文稿和会议记录构建企业世界模型。他将分享该模型如何保持时效,以及构建过程中出现的问题。演讲定于 10 月 14 日 AI Engineer New York 主题演讲,大会时间为 10 月 12 日至 14 日。
LiteLLM 推出 Agent 轨迹智能分析功能「LiteLLM Lens」,可自动审查海量生产运行轨迹、聚类问题并给出带证据的改进建议。轨迹数据自托管在用户自己的 ClickHouse 中,并提供无速率限制的 SQL/API,让 Codex、Claude Code 等编码工具直接消费轨迹数据。
LangChain 的编程智能体成本连续第二个月显著下降。Harrison Chase 给出的三步做法是:用 LangSmith 追踪全部用量实现成本可见性、通过 LLM gateway 设置用户级成本上限、并借助其开源云智能体框架 OpenSWE 做模型路由来优化 harness。第三方 harness 优化难度更大,相关长文将后续发布。
宝可梦火红版的四天王与冠军被一次通关,决策由 Perplexity Decisions API 驱动。实测 137 次实时 API 调用,中位响应 592 毫秒、p95 为 987 毫秒,96.4% 的响应在一秒内,推理成本约 0.028 美元。
Andrej Karpathy 时隔两个月发文,公开了自己日常让大模型把内容讲透的四级递进技巧。第一级是写作,用航空维护文档规范 ASD-STE100 让模型产出受控文本。
外网博主 @imjustnewatai 用 Fable 5.5 输入一句提示词,生成了一部 3 分钟人类数万年进化史短片,把人类发明史压缩成一天 24 小时,从 23:40 的洞穴壁画到 00:00:00 的 2026 年,再以指数速度想象 2031 年之后。
向阳乔木发现并测试通过一种方法,可让任意 Agent 调用 Codex 的 Computer Use,他借此把常用的 Claude Opus 5.5 与 Codex 的 Computer Use 能力结合使用。安装后建议配置 Hook,指定白名单以控制哪些 App 可被调用,安装地址在评论区。
阿里「AI Native 研发范式实践手册」的 Agent 运行环境章节介绍了阿里开源的 OpenSandbox,其支持 Docker/Kubernetes、多语言 SDK、MCP 及浏览器、桌面等执行环境。
Anthropic 发布由 Addy Osmani 撰写的官方文章《Getting the most out of Opus 5.5 in Claude and Claude Code》,讲解如何充分发挥 Opus 5.5 的能力。内容涵盖任务下达、Long Run 控制、结果验收、Claude App 使用技巧,以及敏感内容被判定后自动切换更旧模型继续回答的安全开关机制。
宝玉认为,Lauren 敢不 Review PR 的前提是能用上 Fable、Opus 5.5 这类最强模型且不用考虑 Token 成本,而 GPT-6 操作电脑的水平虽已超过真人,也只能替代一部分验证工作。他建议从自己日常开发流程出发,把手动重复的环节交给 Agent,再沉淀成 Skill 反复迭代,同时方向仍要靠专业判断来指。
宝玉引用播客内容介绍,SpaceXAI 做 Grok Bot 的 Lauren Tan 一个月合并 2500 个 PR,不逐个 Review,而是晚上让 AI 自检自合并、第二天早上抽查。
腾讯上线小程序企鹅微单,连接需求方与AI图片、AI视频、剪辑等内容创作者,把发需求、匹配、拉三方微信群、下单付款、交付验收的链路收进微信。平台计划加入AI助手帮需求方把时长、平台、风格、用途等问清楚,该功能目前显示升级中即将上线;付款按部分预付、验收后结清的方式结算。目前平台处于邀请阶段,需联系客服开通。
前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 于 9 月 15 日发布只做判断的 Jev 模型后,OpenAI 推出 Decisions API。
OpenAI 产品负责人 Tibo Sottiaux 预告下一代模型将更擅长删除和简化代码,并在评论中透露「6.1 coming soon」。负责 coding post-training 的研究员 Rajan Agarwal 同时向用户征集模型的 sloppy code 案例。
新加坡南洋理工大学安波教授团队发布报告《Finding the Right Fit: Model–Harness Interactions across Agent Tasks》。
Anthropic 两位强化学习技术负责人 Nicholas Marwell 和 Sholto Douglas 在一档播客中表示,未来几年很可能出现能力达到或超过所有人类的模型,而蒸馏只能复制当前前沿、无法推进下一代,因此反对不设门槛地释放能力。
回看 Agent 的发展,基本是一路补短板:缺少当前事实就加检索和数据接口,长任务容易丢信息就加状态保存和上下文管理,工具调用会失败就加重试、检查和恢复,行动可能越权就加权限隔离和审批。这些支撑技术决定了模型的原始能力能否真正落进现实场景,但也带来延迟、维护成本、错误传播和协调开销。外围不断加支撑系统兜底,模型进步又把其中一部分能力吸收进去,让结构重新变简单。
AI 世界里时间几乎不存在,可以飞快遍历可能性的解空间。Agent 一旦探出有效路径,就能把其中稳定的部分「固化」成脚本或流程。
红杉资本合伙人 Konstantine Buhler 提出,脑力劳动正沿着体力劳动的老路机械化:约两百年间体力劳动从 99% 由生物完成变为 99.9% 由机器完成,而不远的未来 99.9% 的脑力劳动也将由机器完成,认知革命规模更大、速度更快。
OpenAI 研究员、o1 早期奠基者之一 Noam Brown 在与 Dwarkesh Patel 的对话中表示,1 万个智能体花费 88 小时、消耗 1300 亿 token 解决一道千禧年大奖难题,功劳并不主要来自多智能体,他甚至连 10% 都不会归给多智能体,真正支撑突破的是足够强大的通用模型和让它持续并行思考的能力。
Sriram Krishnan 认为,个人智能体的设计与 UX 让产品管理重新变得关键。Instinct、dot、muse、grok bot 都在大量投入产品工作,把 UX 与底层模型能力及其服务访问打通,用户往往不关心底层模型,而在意 muse 活动通知、Instinct 的点赞 emoji 这类细节。
PowerTokens/video-studio 是一款面向 Windows 的 Wan 3.0 视频批量生成工具,支持 Excel/CSV 导入镜头表、任务 ID 恢复、断点下载、Key 池、CLI 与 MCP,采用 MIT License,主要代码为 Python,截至 2026 年 10 月 1 日仓库约 1 Star。