Lauren & Matt Pocock:如何把每月数千个 PR 上到生产环境
Lauren Tan(Poteto,pstack 创作者)在 SpaceX AI 的工作中,把 Agent 提交代码做成了日常流程,实现每月数千个 PR 上到生产环境。
Lauren Tan(Poteto,pstack 创作者)在 SpaceX AI 的工作中,把 Agent 提交代码做成了日常流程,实现每月数千个 PR 上到生产环境。
基于 Amazon Bedrock AgentCore 运行时和开源智能体系统 OpenClaw,可搭建具备长期记忆的上下文感知 AI 助手,AgentCore memory 负责将一次性对话沉淀为持久知识。文本走 Claude Haiku 4.5、图像走 Claude Sonnet 4.5,整套系统装在单个 AWS CloudFormation 模板中一键部署,轻度个人使用每月约 1–2 美元。
a16z 的 Angela Strange 与 Valon 的 Andrew Wang、Linda Du 对谈,讨论如何重建仍依赖互联网前系统的 13 万亿美元抵押贷款市场基础设施。
LangChain 发布了一段 90 秒视频,用于解释 Deep Agents。正文除视频外未披露具体功能、参数或可用性信息。
LangChain 上线 Deep Agents 课程,教开发者构建可长时间运行、处理复杂工作流的 AI 智能体,课程已在 LangChain Academy 开放。
a16z 发布 OpenAI 的 Greg Brockman 访谈,他称能帮攻击者发现安全漏洞的 AI 对防守方其实是伪装的好事:一旦攻击者能找出漏洞就可能被滥用,但防守方可以据此打补丁,并掌握系统布防的主动权。
Parsewave 审查了 Zapier AutomationBench 全部 600 个公开任务,用智能体写出逼真的错误答案来诱导验证器,人工复核确认 206 个真实 bug,并全部修复,发布 AutomationBench Verified。
Mistral Large 4 面对未知二进制样本可完成端到端逆向分析:判定样本为 Cobalt Strike,提取 IoC 与恶意软件配置,并输出含 YARA 规则的报告以捕获后续事件。这一原本需要一天的任务在 12 分钟内完成。
AgentMail 发布 AgentID,让每个 AI 智能体拥有专属验证收件箱用于登录,并关联真实人类所有者,应用可借此识别智能体背后的真人。该功能被形容为面向 AI 智能体的"Sign in with Google",已集成提示词并在回复截图后可获 3 个月任意 AgentMail 套餐免费使用权。
Parsave 对 Zapier AutomationBench 全部 600 个公开任务逐一审计验证器,智能体标记出 323 个可疑验证器,人工复核确认 206 个真实 bug,并已全部修复,发布 AutomationBench Verified。
Gumloop 的 Agent Browsers 已在 Gumloop 上线,让智能体访问没有 MCP 或 API 的工作。该工具在没有连接器时会在自有云沙盒中打开浏览器,登录并下载导出文件,把任务步骤保存为 recipe 后每周自动重复执行。支持安全凭证存储与 1Password 集成、会话回放、隐蔽代理会话,且完全模型无关。
personal agent 产品 Hark Pro 已在 web、iOS 和 Android 上线,据称由 Opus 5.5 和 Sonnet 5.5 驱动。早期申请用户可获赠一个月 Pro 会员,其左侧卡片支持 AI 自定义,整体设计与动效细节获好评。
Claude 现已支持在 Google Docs、Sheets 和 Slides 中工作,这些文件也能在 Claude 内打开。在 Google Workspace 中,Claude 以侧边栏形式出现在文件旁,读取当前打开的内容并就地编辑,每处修改可在生效前逐条确认。
作者推荐开源项目 Overmind,认为应通过挖掘 agent traces 中的知识来掌控自己的智能栈。Overmind 能从代码和 traces 构建上下文图、整理训练与评估数据集、评估提示词和模型,并训练出用户自己拥有的更小专用模型。项目地址为 github.com/overmind-core/。
LlamaIndex 等团队合办的 Agent Economy Gala 将于周五在 Redwood Room 举办,是 SF Tech Week 规模最大的一晚,采用黑领结着装、仅限受邀参加,现场有爵士乐演出。活动预计聚集 120+ 智能体创始人和 50 位投资人,合作方包括 SpaceX、Daytonaio、lemma_、Tiny_Fish、thelinqapp、Obvious 等。
Gumloop 推出 Agent Browsers,让智能体能够触达没有 API 或 MCP 的工作流程。该功能支持安全凭证存储与 1Password 集成、会话回放以及隐身代理会话,且完全模型无关。
LangChain 在编码智能体的 harness 中内置模型路由器,成本降低 64% 且未牺牲质量。Sydney Runkle 的视频介绍了具体做法:理解任务、理解模型、在 harness 中构建路由器,并跟踪任务结果。
Figure AI 创始人 Brett Adcock 的 Hark 推出 Hark Pro,一款主动式个人 AI 助手,界面由曾发布 iPhone Air 的前 Apple 设计师主导。该产品在网页和移动端免费提供,硬件将于 2027 年推出。
Claude 推出 Startup Stack,整合 Linear、Lovable、ElevenLabs、Granola 和 Hex 等基于 Claude 构建的公司提供的优惠。该计划覆盖销售、设计、数据工程等工具,折扣与 credits 价值最高 45,000 美元。
Kevin Mandia 称,Armadin 自今年 1 月以来在客户生产环境累计发现 90 多个零日漏洞,涉及大型软件公司,多数在 48 小时内通知对方 CISO。他表示团队用真实红队人员对模型做后训练,扫描时以黑盒方式从互联网侧切入、不依赖源码审查,因此能发现远程代码执行等问题;他还指出 AI 驱动的攻击会更多寻找定制应用中的逻辑漏洞而非代码漏洞,并持续穷举所有路径。
Harness-Aware Distillation 让同一教师模型分别在带与不带 harness 信息时作答,再训练学生模型偏好带 harness 时的动作,且不使用任务奖励或成功标签。
作者称 Jev 的一个有趣之处是其一致性(consistent property),这对为智能体工作流构建可靠的评审器很有用。目前作者正在做一个小型 benchmark,以更广泛地测试这一点,并与其他决策 API 进行比较,更多内容将很快公布。
Ampersand 是专为企业 AI 智能体打造的系统集成基础设施,让智能体能够在 Salesforce、SAP、NetSuite、Workday 等系统记录中执行操作。用户只需在一份配置中定义每个客户的对象与映射,Ampersand 负责处理认证、重试、回填和监控。它已支撑 11x、Orb 和 Square 的智能体行动能力。
ElevenLabs 发布 ElevenAgents Architect,让团队任何成员都能在 ElevenAgents 中通过对话管理 AI 智能体。该工具还可从 Claude、Claude Code、ChatGPT、Cursor 和 Grok Bot 直接调用。
ElevenLabs 为 ElevenAgents 推出内置专家 ElevenAgents Architect,用户只需对话或输入文字,即可让团队快速搭建并优化 AI 智能体。该功能定位为嵌入 ElevenAgents 的专家角色,官方同步发布了演示视频。
LangChain 将举办名为 The Agentic Operating Model 的网络研讨会,聚焦企业规模化落地生产级 AI 时人与流程、技术如何协同演进。议题包括智能体开发与运维由谁负责、跨团队应标准化哪些内容、治理与控制应放在哪里、团队如何在不拖慢开发的前提下共享基础设施,以及如何持续评估和改进生产环境中的智能体。
Replit 现在支持跨所有项目共享上下文,用户可在新对话中让它查找已有项目、添加功能,或以某个项目为参照修改另一个项目。它还能读取项目文件,把编辑作为后台任务启动,并提供链接查看改动、继续工作;官方举例包括按 Partner Marketing Hub 的配色更新 Competitor Weekly 和 GTM Strategy 幻灯片。
Datawhale 发布开源中文教程《Jev Cookbook》,面向 System One 决策模型,包含 11 章系统讲解与 18 篇可运行的 Jupyter Notebook,从 Choice、Score、Noul 三种核心原语讲起,覆盖 RAG 引用过滤、动态工具路由、风险拦截等接入场景。
航空应用可借助 Amazon Nova Sonic 语音模型、Amazon Bedrock AgentCore 与 Bedrock Knowledge Bases 加上一层实时语音层,让旅客用说话完成改座位、查延误、更新餐食偏好。
Figma 宣布 Figma agent 结束 beta 并带来多项改进,包括输出质量提升。新 agent 在遵循指令和处理更长任务上表现更好,在与专业设计师的人工评测中胜率超过约 60%。
elvis 回应 @pidotdev 称该版本引发大量关注,此后已加入不少内容,包括用于测试多种主动能力的连接器,并小幅改进了记忆。更多更新即将发布。
Perplexity Decider 被 Aravind Srinivas 称为最佳决策模型。在一项用 8 个决策模型玩 Tetris 的基准测试中,Perplexity Decider 持续排名第一,测试者可在 app.routerplus.com 的 playground 中试用。
Google Research 与 Google Health 发布研究,展示 Google Earth AI 结合卫星影像、移动性数据与基础模型(AlphaEarth Foundations、Population Dynamics Foundation Model),并配合 Geospatial Reasoning 智能体原型,帮助公共卫生机构预测疾病暴发。
LangChain 为 Managed Deep Agents 免费加入网页搜索能力,由 p0 提供支持,无需单独开通供应商账号、管理额外 API key 或自行接入搜索工具。官方同时放出一段由 @ndrezn 演示的快速上手视频。
a16z 介绍新公司 Armadin Security,用 AI 智能体从外部主动攻击企业网络,在犯罪分子之前找出可利用的零日漏洞,并最终实现自主修复。公司自 1 月以来已在财富 500 强企业中发现 90+ 个零日漏洞。
两个 AI 智能体在《星际争霸》中实时对战,全程不暂停,各自思考时游戏仍在继续,最终 Blue 2 – Red 5。蓝方安全发育至 41 个 Dragoons 后出击,红方以 High Templar 的 Psionic Storm 迎击,而蓝方未侦察红方建造内容。
Mistral 现可在 Battle Mode 和 Agent Mode 中测试,入口为 arena.ai。
Mistral AI 的 Mistral Large 4(代号 Le Chonk)已上线 Arena,可在 Agent Arena 中实测,投票将影响其评估,分数稍后公布。
Jev-as-a-Judge 通过一致性提升 LLM judge 的可靠性,适合用作评判器、验证器和持续监控。该用例被评价为 Jev 最亮眼的应用之一,作者长期从事 agent evals、judges 和 verifiers 相关工作。
Figma agent 已结束 beta 正式上线。原文未披露模型版本、参数规模或评测数据,仅附带演示视频与 Twitter 链接,浏览量超 140 万。