模型开放之后,AI 能力为什么仍难以复用?
AI 开源的价值正从"开放了什么"转向"开放的能力能否被验证、复用和持续迭代"。2026 年世界人工智能开源大赛(GOAI)覆盖 91 个国家和地区、吸引超 1.4 万名开发者,收到 2999 份有效初赛作品,70 个项目进入总决赛,多 Agent 协作与 Skill 调用成为工程考察重点。
AI 开源的价值正从"开放了什么"转向"开放的能力能否被验证、复用和持续迭代"。2026 年世界人工智能开源大赛(GOAI)覆盖 91 个国家和地区、吸引超 1.4 万名开发者,收到 2999 份有效初赛作品,70 个项目进入总决赛,多 Agent 协作与 Skill 调用成为工程考察重点。
Stripe 联合创始人 John Collison 在 Sourcery 播客访谈中判断,AI agent 将重写商业与互联网,因为 computer use 是"通往真实世界的终极向后兼容层",AI 无需等 DMV 等机构改造网站就能直接操作现有界面办事。
9月28日起,新韩银行等七家韩国金融机构遭渗透,6万多人信息外泄,韩国总统下令彻查。研究人员发现疑似攻击服务器运行开源工具 ARTEX(自主渗透测试控制台),主要接入 DeepSeek,其他会话还使用 GLM、Grok 和 Claude Code,服务器目录浏览未关,配置文件、CLAUDE.md 与 AI 聊天记录可被直接读取。
文章指出,2025 年 5 月 Anthropic 把向量搜索从 Claude Code 中移除,改用 grep,作者 Boris Cherny 称结果全面胜出且优势很大;此后 Cursor、Windsurf、Cline、Devin、Sourcegraph Amp 相继转向工具驱动的 agentic 检索。
Anthropic 工程师 Thariq Shihipar 在播客中谈 Claude Code,认为 Agent 写代码已成许多人的默认方式,真正拉开差距的是能否把需求讲清楚。
有开发者用 Opus 5.5 搭建了带个人智能体上层的 agent-to-agent 通信系统,并称模型协调能力超出预期。他从单个 Claude Code 会话起步,先转向 subagent 多智能体并行,再构建了类似 Grok Bot 的常驻智能体团队,包含 CFO、CTO、CMO 等约 8 个专业 bot,一个月前开始试验 agent 间通信。
作者用十天体验 Teambition 创始人齐俊元打造的 Today AI,其国内版于 9 月 24 日上线,已接入飞书、钉钉、腾讯文档和邮箱;绑定微信后可直接在微信里发语音、图片和文件与它交互。
Govee 在 IFA 2026 发布 Sky Ceiling Light、COB Strip Light 2 Pro 和 Permanent Outdoor Lights 2 Pro 三款新品,均搭载 AI Lighting Bot 2.0,用户可用文字、语音或图片生成灯光效果并进行多轮对话调整。
OpenClaw 之父 Peter Steinberger 与 GitHub 联合创始人 Tom Preston-Werner 对谈,主张 AI 批量生成样板代码的时代应废掉传统 Pull Request,转向附带思考链路与脱敏 Prompt 的「Prompt Request」。
Nat Eliason 分享了其 @bot 系统的 15 项能力:一个"Chief of Staff"机器人每天从邮件和任务中梳理待办并给出建议,每约 2 小时扫描邮件自动起草回复。系统还包含按课程、工程、招聘等分工的专项机器人、云编码智能体(接手 Linear issue 并提 PR),以及基于 Notion 和 GitHub 持续更新的可分享知识库。
Sahil Lavingia 在 X 上提问:如果 IRS 推出 MCP,你会用吗?该帖获得 48 条回复、7 次转发、35 次点赞和 14111 次浏览。
OpenAI 的 ChatGPT 和 Codex 负责人 Tibo Sottiaux 在 X 上承诺,未来 28 天每天要么推出一项对多数 Codex 和 Work 用户明显有用的改进,要么进行一次完整的额度重置。
Tibo 认为互联网上的大多数操作很快将由 AI 智能体完成,Notion 上线 MCP server 后流量激增、被迫重新考虑其经济模型,每个产品团队迟早都要决定是否为智能体而构建。
Reducto 的 Adit Abraham 指出,文本摘要有利于检索,结构化表格则有利于推理,因此智能体能否"找到"表格与能否"读"表格是两回事。该观点来自其在 World's Fair 2026 的演讲,AI Engineer NYC 将于 10 月 12 日至 14 日举行。
播客 Next Token 第四期讨论 Meta 的 Personal Agent 产品 Muse,认为它把云端电脑和易用性结合,让 Agent 从小众极客走向大众。
OpenRouter 联合创始人 Alex Atallah 认为,Jev 等决策模型的一个潜在用途是做智能体对齐层,检查工具调用或智能体间通信是否符合原始系统提示词。他强调工具调用数量太多,需要廉价快速的模型来做拦截,OpenRouter 内部已有小原型在跑。他还提到,对红队类智能体,可用另一个模型检查每次工具调用是否越界,并叠加结构性防护。
OpenRouter 联合创始人 Alex Atallah 回应“所有人都在造同一个东西”的说法,称各家都在做带通知、第三方连接器、上下文管理、记忆、沙箱、智能体网页搜索的常驻 Agent 循环,但这些只是新的基础能力,就像 2005 年人人都在做数据库、用户表、登录注册页。
作者在 WorkBuddy 模型面板观察到匿名模型 Space-Bunny,倍率 0.03x 且限时折扣,9 月 23 日上线后登顶 OpenRouter 与 OpenCode 调用量榜首,截至 10 月 2 日仍无人认领。
Sam Altman 认为,Sign In With ChatGPT 与 Plugin Extensions 蕴含的潜力远超外界目前的认知。他未在推文中给出具体的功能细节、时间表或数据,仅以这一判断表达对该方向前景的看好。
一则以笔记形式讨论提示词工程:提示词取决于心智模型是否匹配、以及是否具备足够领域词汇,而非把指令写得更长;领域词汇来自实际做过该工作。作者指出 MCP 只是无头 API、Artifact 是短生命周期 UI,二者可跨 MCP 组合,并把这套"brain / hands / surface"读作智能体原生的经典软件架构版本:未来开发从写前端转向写 MCP server,由智能体组合 UI。
Jonathan Wilke 提出,你的 SaaS 应该有一个 agent skill,此前他曾主张 SaaS 应该有一个 MCP server。
Akshay Kothari 称赞 Tibo 及其团队真正在意生态,是优秀的合作伙伴,始终想着把蛋糕做大。Tibo 认为 ChatGPT 上的插件发现带来巨大的采用机会,开放生态终将胜出。
Harrison Chase 称赞 @pirroh 的文章指出,随着模型变强,harness 不会消失,而是从"决策"转向"提供选项"。在 deepagents 中,每个 subagent 拥有自己的模型、工具和权限,主循环负责决定生成哪个 subagent 以及何时生成。
Harrison Chase 对比了企业级 agent(org harness)与个人 agent:前者面对多用户、单智能体,需要支持多人协作甚至同线程共用,并正确处理认证与记忆,可观测性、可审计性和管理控制台也更重要,交互上更偏事件驱动与异步。两者共同点是都能编写和执行代码、浏览器使用很可能非常关键、以 skills/MCP 为标准化方式,并共享核心 agent 循环逻辑。
Agent 周边 infra 设施被认为极具价值,除钱包支付外,单一 RBAC 系统只要聚合足够多也相当值钱。未来企业将从管理人类的 Human Resource 演化出 Agent Resource 角色,需要管理本机权限、云端权限、Skill 能力、Agent 工具以及记忆文件。作者在 NewMax 中做了初步尝试,发现这些问题非常通用,每个 Agent 都会遇到,意味着市场巨大。
OpenClaw 之父 Peter Steinberger 与 GitHub 联合创始人 Tom Preston-Werner 在播客《AI Worth Using》中提出,AI 批量生成样板代码后开源项目应废除传统 Pull Request,改收附带思考链路与脱敏 Prompt 的 Issue。
Vercel CEO Guillermo Rauch 将 Mini 网页浏览器移植到 Rust 和 Swift,称其更快、更安全,且迭代体验优于 Electron + Bun。
从 2022 年 11 月 30 日 ChatGPT 上线到 2026 年 9 月,AI 用不到四年从聊天框走向完整任务执行:LangChain、RAG 和 MCP 接上外部世界,Codex、Claude Code、Cursor 转向仓库级编程 Agent,Agent Skills 与 AGENTS.md 沉淀协作经验。
Harrison Chase 认为 Jev 与 LangGraph 是绝佳组合:把 AI 智能体建模为复杂系统、让 AI 深度融入其中非常合理,LangGraph 是这类建模的最佳方式,而在 LangGraph 内用 Jev 加速各类小决策效果出色。该观点引自其转发的 Sydney Runkle 文章。
GitHub Podcast 针对三个热门议题做出回应:AI 生成代码是否需要审查、RAG 是否已经过时、Skills 是否让 MCP 变得多余。相关讨论发布在 GitHub 博客的 AI 与 ML 栏目。
YC 举办主题为《Why the Harness Matters More Than the Model》的 Paper Club,讨论模型外部运行框架 Harness 对 Agent 表现的影响。
LangChain 作者 Harrison Chase 称 browser use 是他在 Jev 上见过的最佳应用。Nathan Drezner 用 LangChain 搭配 typesafeai 的 Jev 构建了浏览器智能体,他表示该组合在玩 Wikipedia Game 上表现出色,也擅长找便宜机票这类"叠衣服"式的琐碎任务。
在2026 Inclusion·外滩大会主论坛圆桌“当Agent成为交易主体”上,蚂蚁集团CEO韩歆毅、万事达卡首席产品官Jorn Lambert、OPPO刘作虎与阿里巴巴周靖人讨论了Agent交易爆发前的信任基建。
Waza 作者 Tw93 认为模型越强,技能的数量和厚度就该越少,自己已探索 141 个技能,但 10,100 次运行中有 4,500 次(约 45%)集中在 4 个 Waza 技能上。他自 4 月起只保留 8 个技能,其 SKILL.md 文件从 7 月中的 164KB 降至 128KB,两个月减少 22%,细节移入按需加载的引用文件。
output_schema、无状态(stateless)与 code mode 三项能力将共同推动 MCP 复兴。该观点来自一条社交平台帖子,未给出具体实现细节或数据。
AI 时代下,美团、阿里等大厂已跳过原型图和设计稿,由产品经理用 AI coding 直接生成前端页面,纯执行型 UI 设计岗位持续收缩。文章认为 UI 设计师的需求分析、用户调研、原型设计与竞品拆解能力,正是 AI 产品经理岗位的核心要求,并推荐了一门主打 Agent、RAG、Function Calling 与 Vibe Coding 的「零基础入门AI产品岗」课程。
2026年8月,DeepSeek 开源 DeepSeek Harness 后两天冲上 9 万多 GitHub Star,OpenAI 随后开源 Codex 的 Harness 层,包括 CLI、app-server 和官方 SDK。
Docker 认为多模型、多 harness 的智能体未来需要一层位于 harness 之下的运行时治理层,因为 harness 自带护栏在智能体绕过、供应商更新和安全边界覆盖上都会失效。该层统一管控代码执行、工具调用、凭证与花费,让权限像 1988 年的“混淆代理人”问题一样与智能体隔开一层。
在支付宝年度生态大会的闭门圆桌上,蚂蚁集团 CEO 韩歆毅、千问事业部总裁吴嘉、吉利首席工程技术科学家任向飞以及 OPPO 唐凯、vivo 周围五位高管,围绕 Agent 商业化关键元年讨论了流量漏斗向意图放大器的转变、终端从应用入口变为意图入口,以及跨端协同与开放生态的利益信任难题。
AI 原生组织转型系列第一期提出,AI 不是组织的工具而是组织的替代品,应让 AI 接管对齐事实与对齐打法。作者认为知识工作约 60% 的时间耗在开会与协调上,局部提效动不了这个大头;AI 可把 N×N 沟通变成 N,并用 skill、检查点等方式把规范写进执行环境。文中列举出门问问、安克创新、Claude Tag、ZooClaw 等正在发生的做法。