逛完外滩大会,蚂蚁在 AI 时代找到了什么新位置?
蚂蚁在外滩大会上的 AI 布局被拆成应用、基建与公司架构三层来看:应用侧是个人 Agent「阿宝」与健康 Agent「阿福」,基建侧是支付宝的支付生态与「碰一下」三千万个触点,公司侧则是四家子公司密集融资、被拆成四个可单独定价的资产。嘉宾认为蚂蚁的幸运是赶上 AI,不幸是 AI 变得太快,其定位是应用与基础设施各一只翅膀,中间由模型、数据库和技术后台支撑。
蚂蚁在外滩大会上的 AI 布局被拆成应用、基建与公司架构三层来看:应用侧是个人 Agent「阿宝」与健康 Agent「阿福」,基建侧是支付宝的支付生态与「碰一下」三千万个触点,公司侧则是四家子公司密集融资、被拆成四个可单独定价的资产。嘉宾认为蚂蚁的幸运是赶上 AI,不幸是 AI 变得太快,其定位是应用与基础设施各一只翅膀,中间由模型、数据库和技术后台支撑。
LangChain 为 Managed Deep Agents 推出 Connections,把 API 凭证改为 LangSmith 工作区中按 slug 命名的连接,工具在运行时通过 connections.get() 读取。
LangChain 基于 Deep Agents 构建了 GTM Agent,在 Salesforce 新线索触发后自动判断是否触达、汇集 Gong 通话记录与 LinkedIn 等上下文,并把带推理依据和来源的草稿发到 Slack 供销售审核。
Credit Genie 采用 LangChain 开源仓库文档智能体 OpenWiki,自动生成并维护代码库文档,替代此前容易过期的 Notion 页面、README 和 AGENTS.md。
Microsoft Foundry 被指为最适合在企业中运行智能体的平台,可让长时间运行的 agent 推理、行动并调用工具。其可观测性与治理能力覆盖多智能体、多模型工作流,从可访问范围、数据流向、行为可重建到成本预算控制均有对应答案,并将安全防护、可审计和 FinOps 从系统搭建之初就纳入。
「有意思小周刊」vol.171 汇总了 AI 产品经理 PRD 撰写方法:AI 产品面向概率性系统,不能沿用确定性功能的传统 PRD 思路,完整骨架含十个部分,其中场景定义与输入输出、能力与功能描述、效果要求、异常与降级设计、评测方案五块应占全文一半以上篇幅。
Sahil Lavingia 把自己所著《The Minimalist Entrepreneur》转化为 9 个 Claude Code 技能,并称这是他 star 数最多的 GitHub 仓库,已超过 10,000 stars。
Browser Use 发布文章解释"什么是无头浏览器",由 Gregor Zunic 撰写。无头浏览器指没有图形界面、由程序控制的浏览器,是 AI 智能体操作网页的常见运行方式。
Firecrawl 将 Developer Index 接入 Grok Build 插件,Grok 在写代码时可检索覆盖代码仓库、文档和 issue 的 7000 万+ 一手来源,用于核对 API 并查找修复方案。用户运行 /plugin 安装 Firecrawl 即可试用。
GPT-6 Astra 是否会降维打击具身行业,成为这场圆桌讨论的核心问题之一。苏度科技韩铮、蚂蚁灵波沈宇军、自变量王潜、破壳机器人许华哲四位一线从业者,围绕数据来源(仿真与真机、Real-to-Sim)、模型路线、商业化落地指标(高成功率、客户持续付钱)以及被高估与低估的领域展开分歧讨论。
Browser Use 推出 Agency,把交互反过来:不再由用户写提示词,而是智能体主动提议它认为有用的工作,用户选择批准或跳过。按官方描述,它会读取用户生活全貌上下文、发现被遗忘的事项、在用户看到问题前修好,并声称可减少打开 Gmail、Chrome 或 Slack。
Naval 认为强化责任追究对 AI 讨论有帮助:智能体集群失控、防护薄弱的模型被越狱、以及托管防护薄弱的开源模型,责任都由发布方承担。
Simon Willison 借机对 ChatGPT 本身做了一次逆向工程,生成的运行地图通过 ChatGPT 的 "visualize" 技能以 HTML 片段呈现,并用 D3 绘制地图与叠加路线。该可视化托管在 simonw.chatgpt.site 的 skills 路径下。
Thomas Wolf 分享了一款新的端侧本地 AI 智能体系统,运行一个量化到 4 bit 的开源 4B 模型(MLX)。该系统的作者 Sigil Wen 称其为"on-device AI OS"Underdog,完全本地运行,起因是他对云端数据被用于训练、邮件和 iMessage 被采集以及 AI 攻击能力的担忧。
在联合创立 Kepler AI 之前,Vinoo Ganesh 在 Palantir 领导 Spark 团队并打造了 Project Frontline——一个面向 Forward Deployed Engineer(FDE)的开创性项目。他在访谈中分享了 FDE 的最佳实践。
Meta 的 Muse 被评价为目前最佳的智能体实现,特点是操作极其简单、直观且功能强大,并且免费。该内容来自 Paul Couvert 的推文,未披露具体模型参数或评测数据。
pnpm 12.4 将 npm、Python 和 Cargo 依赖安装收进同一套工作区配置,一条 pnpm install 即可处理三个生态的依赖,新增的 pipeline 负责安装后的构建与验证编排。
云栖大会千问AI平台分论坛将于 9 月 23 日 9:50—12:00 在杭州国际博览中心一期 3F 308 举行,千问AI平台最新产品能力首次集中公开,Qwen 共创计划同步发布并开放报名。
Greg Brockman 表示 ChatGPT Sites 上线三个月以来,用户已创建超过 500 万个站点。此次更新支持邀请队友共同编辑、保存和发布站点,也支持将站点以私有方式分享给指定人员;同时将提示词到部署的时间缩短一半,可让 ChatGPT 检查站点数据库,并支持添加自定义域名。
Simon Willison 称,另一批 OpenAI 智能体集群早在 5 月就在 RubyGems 上进行垃圾信息和漏洞利用,时间距离此前曝光的 Wiki 攻击仅数天。他附上了自己博客的相关链接 simonwillison.net/2026/Sep/12/op。
Browser Use 上线 browser-use.com 网站,并通过其官方 X 账号发布了该网址链接。原文未提供更多关于网站功能、模型或版本的信息。
Browser Use Cloud 支持云智能体在不登录的情况下保持认证状态:先在本地 Chrome 登录,再把本地 cookies 同步到云端,智能体全程看不到用户密码,用户也保持登录。该功能已在 Browser Use Cloud 上线。
Augment CTO 兼联合创始人 Igor Ostrovsky 指出,软件工厂能高效清空 issue 积压,关键却不在修复代码本身,修复实现是修 bug 中最不重要的环节。他认为单靠一个修 bug 智能体难以真正烧掉团队的 bug 积压。
Dify 发起 #DifyNewAgent 征集活动,邀请开发者展示自己构建的 AI 智能体,形式可以是快速演示、截图或几行文字说明。作品不限于独立 Agent,也可以是 Workflow 的一部分。Dify 将联系其最喜欢的作品,协助打包上架 Marketplace,并分享给 10 万+ 构建者。
Augment Code 上线 cosmos.augmentcode.com,作为其对外入口,推文附带的链接直接指向该站点,互动数据为 0 转发、0 回复、0 点赞、486 次浏览。原文未披露该站点的具体功能、模型版本或可用范围。
Augment Code 的 Cosmos 用两块屏幕和一个提示词就能搭起"软件工厂":连接代码仓库、创建环境、描述你想要的工厂。Advisor 会挑专家、写配置、自动应用,遇到需要决策时再询问你。
ChatGPT 官方回顾 ChatGPT Sites 上线三个月,称用户已创建超过 500 万个站点。此次更新包括邀请队友共同编辑、保存和发布共享站点,邀请特定人员访问非公开站点,部署耗时缩短一半,让 ChatGPT 检查站点数据库,以及支持添加自定义域名。
Cognition 在 Devin CLI 与 Devin Desktop 中推出 Fusion,官方称其为面向 Fable 与 Astra 的最高效 frontier harness,在各项编码基准上成本最高降低 39%。
IBM Research 在八款模型上发现,智能体记忆的合适"剂量"随模型能力变化:能力强的模型能从完整指南集中获益,较弱模型更适合精简核心加任务相关检索,已饱和的模型则无明显提升。
OpenAI 发布 GPT-6 Astra,支持 1M+ 输入 token 和 5 档推理级别;Anthropic 更新 Claude Fable 5.1,在 Artificial Analysis Intelligence Index v4.3 上并列最高分,放宽网络安全任务限制并减少冗余输出。
Google DeepMind 研究者把 100 个 Gemini 智能体放进同一个共享仓库求解 71 道数学定理。
AWS 展示了一套库存自动化架构:用零样本时序基础模型 Amazon Chronos2 做概率需求预测,再由 Strands Agents SDK 构建的 Supervisor、Preprocessing、Forecasting、Reporting 四个 LLM 智能体在 Amazon Bedrock AgentCore 上编排确定性工具,把预测转成可审计的采购订单。
京东零售产品经理用 PRD 四步法加 Skill 沉淀,把一批覆盖接需求、沟通、交互、文档与评审的需求从 34 个人日压缩到 15 个人日,并通过评审且质量未打折。方法分三层:Prompt 到 Context 再到 Harness,人负责判断与复核,AI 负责初稿、追问与遗漏检查。核心场景是需求文档撰写与交互设计,可复用经验沉淀为 Skill。
大淘宝技术直播技术团队开源了本地长期记忆系统 HL-Mem(Apache-2.0),对应 v1.1 系列,采用事实与经验双通道架构,用不可变 Event 加可更新 Claim 实现证据可追溯、有效时间与记录时间双时间可解释,以及记忆的修正与遗忘。系统默认仅依赖 SQLite 单文件部署,配后台异步 Worker 处理去重、冲突消解与生命周期管理,运行时独立、本地优先,并支持中文检索。
NeoCognition 推出 ApprenticeBench,用于评测 AI 在真实工作中的电脑操作与持续学习能力。Fable 5.1 和 GPT-6 Astra 在该基准上能一边工作一边持续学习,并超越人类专业者,无需 FDE 介入,智能体可自行部署到岗位中。
Replit 上出现了一批用 Astra 制作的 3D 实验作品,用户 sarah li 分享了自己在长周末用 Astra 搭建的可探索 3D 童年卧室。Amjad Masad 转发了这些创作并表示很喜欢。
阿里云于 9 月 11 日升级 Token Plan 个人版,原有价格及 Credit 额度不变,Standard 和 Pro 套餐新增 Agent Harness 工具权益与用量,覆盖搜索、网页解析、图像生成、语音处理、代码执行等 12 项能力,均通过 MCP 标准协议开放,可直接接入自有 Agent 应用。
模型架构引入过多复杂性会带来连内部 eval 都无法测试的未知问题。但作者认为,随着基础模型越来越聚焦所谓 agentic 任务,有时可以为效率上的大幅收益接受这些小的未知成本。
Browser Use 云平台现可运行 DeepSeek V4.1 Flash,其性能达 GPT 5.6 Sol xhigh 的 97%、Claude Opus 5 的 95%,智能体成本低 30 倍。新用户可用 15 美元免费额度运行 100 个复杂网页智能体任务。
OpenAI 发布 ChatGPT for Financial Services,这是一套定制的 ChatGPT Work 体验,将内置金融数据与 GPT-6 Astra 的推理能力结合。团队可用于开展研究、构建金融模型并制作定制化客户材料。