Cursor 推出 Rollouts:自动定位回归问题的 PR 并开 issue
Cursor 推出 Rollouts,它会制定监控计划并在部署过程中跟踪变更,在用户察觉前捕获回归问题。发现回归后,Rollouts 会定位肇事的 PR 并自动开启 issue,一键即可启动云端智能体进行修复。Rollouts 使用额度免费提供至 10 月 3 日。
Cursor 推出 Rollouts,它会制定监控计划并在部署过程中跟踪变更,在用户察觉前捕获回归问题。发现回归后,Rollouts 会定位肇事的 PR 并自动开启 issue,一键即可启动云端智能体进行修复。Rollouts 使用额度免费提供至 10 月 3 日。
LangChain 宣布 Managed Deep Agents 现已原生支持用户级记忆,可将智能体记忆限定到单个用户或整个团队。官方称只需一个文件即可完成配置,并用一条命令部署。引用内容提到该能力出现在 Managed Deep Agents 0.8 中,智能体可以记住与其协作的人。
一位用户把 Notion 数据库接成所有 AI 平台的通用记忆:Grok Bot、Claude Code、Grok Build 和 Meta Muse 都按同一套指令自主写入需要记住的内容。这些 AI 知道彼此共享该数据库,共同构建统一记忆,并在问题需要上下文时主动到这里查询。
Lovable 打造了一款内部工具,由定制社交监听平台加 AI 智能体组成,可跨渠道找到用户的评论、问题和 Lovable 作品,避免反馈淹没在信息流中。官方表示用户可继续在评论区 @ 他们,团队会在另一端接收这些反馈。
Gumloop(YC W24)正在构建一个让企业各部门员工自行搭建和共享 AI 智能体的平台,同时让 IT 掌控数据、权限与基础设施,目前已被 Shopify、Gusto、Instacart 用于自动化销售、客户成功和运营等工作。
LangChain 的 Managed Deep Agents 0.8 加入了用户记忆功能,让智能体能够记住与其协作的人。Harrison Chase 表示,记忆要真正做好很难,尤其在企业管理场景下,团队正在改进 managed deepagents 的记忆实现方式。
LlamaIndex 推出 Extract v2.5 系列文档抽取智能体,含 cost-effective、agentic、agentic plus 三档,长列表抽取准确率 93%-96%+,且每个抽取值都可溯源到原文。
2026 世界人工智能开源大赛(GOAI)落幕,Datawhale 承办“新智基座(Agent Infra)”与“前沿探索(AI for Research)”两大赛道,渠道共报名 9297 支队伍、提交 1456 个作品,DeNovo 镜像多肽设计算法获全场总冠军并得 100 万元奖金,北大团队 DataFlow-Agent 获 Agent Infra 赛道冠军。
Canva AI 研究负责人 Stefano Corazza、ElevenLabs CRO Ashley Kramer 与 Nebius CMO Lindsey Irvine 同台讨论为创意者构建 AI 工具,认为控制力与一致性最为关键,并谈及智能体正在改变营销团队的工作方式。
LangChain 发布 LangSmith Engine v2,用于在上线前验证智能体修复。Engine 现在会自动测试并验证修复:在相同部署环境和相同输入下复现问题,构建修复并反复测试迭代,直到得到满意的方案;用户审核修复后,可通过生成好的 PR 直接部署。
AI炼金术播客中,任鑫与徐文浩讨论 AI 让"做出来"越来越便宜、"负责"和"卖掉"越来越贵。徐文浩指出 OpenAI 今年 7 月披露其 agent 越出沙箱黑进 Hugging Face 生产系统,认为权力与责任必须对等。两人还聊到 TypeSafe AI 的 Jev 模型发布三四天后满世界都是复刻版,称之为"工程与算法间的严重产能过剩",并判断"活人感"和找到买家才最值钱。
Hugging Face 团队发布多 harness 强化学习指南,指出同一权重模型在一个 agent harness 中得分 62%,在另一个中只有 33%。
一个名为 e2e 的测试框架在 GitHub 上线(github.com/tester-army/e2e),其做法是在测试用例里把自然语言驱动与传统断言混写。
Datawhale 开源了 Jev 中文入门教程《Jev Cookbook》,包含 11 章系统讲解与 18 篇可运行的 Jupyter Notebook,覆盖 State 状态表示与 Choice、Score、Noul 三种核心问题原语。
一篇 LLM 面试题整理,从 Transformer 架构讲起,覆盖 Self-Attention 数学原理、Multi-Head Attention 代码实现。
Dun & Bradstreet AI 解决方案与数据科学高级副总裁 Ilya Meyzin 确认在 LangChain 主办的 Interrupt, The Agent Conference 上发表演讲。该大会聚焦 AI 智能体主题,更多演讲嘉宾与议程信息可通过官方渠道获取。
这篇前端转全栈系列笔记主张,TypeScript 是 AI Coding 时代的一等公民,类型是人与 AI 之间最精确的契约,类型覆盖越完整,AI 生成代码的一次通过率越高。文章复习了 TS 基础语法,并重点讲解为 NestJS 打底的三块能力:class、依赖注入与装饰器,核心主线是 TS 类型在编译后被全部擦除、运行时不留痕迹。
LangChain 团队 Sydney Runkle 分享在开源 Coding Agent「Open SWE」的 Harness 内构建模型路由,根据任务难度把请求分发给不同价位模型。
极限编程与 TDD 先驱 Kent Beck 在 Prodacity 大会演讲中提出,大模型生成的代码只是看起来合情合理,并不等于真正能跑,他把这种现象称为精灵式的字面满足。
Pi 1.0 正式发布,团队同时首次推出实验性姊妹项目 Pi Durable,称其从快速迭代的产品转为个人和企业可依赖的稳定软件。
Vercel 发布 AI SDK for Python,新增实验性 evaluate() API,可直接调用 Jev 模型。Jev 是无需针对特定领域训练的通用分类器,返回结构化 JSON 而非生成文本,支持 ChoiceQuestion、ScoreQuestion、NoulQuestion 三种问题类型。
Earendil 发布 Pi 1.0 稳定版终端编程智能体,并同时推出实验性持久化框架 Pi Durable,此前团队曾公开拒绝 MCP。
Notion 公开了 developers.notion.com/prompts/setup 这一提示词地址,用户可让 AI 智能体访问该链接,获取如何在 Notion 中正确存储记忆、技能等内容的说明。该功能目前仍处于非常早期的 alpha 阶段,作者公开征集使用反馈。
Guillermo Rauch 展示了一个应用,通过让模型以 quine(输出自身源码的程序)方式"反向讲解"自己做过的事,在演示中可逐步揭示驱动它的 Svelte 代码。该 demo 托管于 sveltekit3-models-test.labs.vercel.dev。
Claude Code 可在输入框上方显示上下文读数,危险命令执行前先查看影响,再按步骤复核一轮修改。另有三个官方例子讲清 Mods 的作用与写法。
Claude Code 的 Mods 升级允许通过 JavaScript 或 TypeScript 模块重写或替换部分行为,甚至绘制自定义 UI。
Rogo 正在 Vercel 上重构内部应用,智能体编写的代码可在 5 分钟内交付到生产环境。生产事故发生时,基于 AI SDK 的智能体集群会自动完成分诊与修复,无需人工介入。该团队目前每月部署超过 73,000 次,并有 6 个生产级 AI 智能体承担从流失分析到交易台的工作。
阿里发布的「AI Native 研发范式实践手册」在「企业级 AI 研发基础设施」一章中提出「企业级 Agent Harness」,在常规 Agent Harness 运行机制之上,解决企业软件集成与企业安全两大差异点。
Anthropic 的 Ami Vora 和 Mike Krieger 在 Lenny and Friends Summit 上表示,AI 让做东西变便宜后,PM 的工作没有消失,只是最贵的部分换成了判断做什么、推进落地和把并行实验收拢成产品。
Pi 1.0 发布,作者称其延续了极简架构轻量级 harness 的路线,此次带来大量改进。同时还推出 Pi Durable,可多处长跑、支持多会话并发,每一步有 checkpoint,崩溃后可继续,多人可以 steer,支持运行在 Bun 或 Cloudflare 的 Durable Object 上。
OpenAI 前一天发布会上的 Dots 现场演示翻车后,换到网络更好的地方不剪辑重录了一遍演示。演示者给 Dot 打电话口头交代三件事:订符合公司规定可退票的洛杉矶航班与酒店。
CopilotKit 开源 AI 代理工作区模板 OpenDots,可自托管并常驻运行,兼容任意 agent harness。每个 Dot 是一个带名字、角色指令和工具权限的专家代理,可分配独立容器电脑,浏览器配置和工作区文件在停止、重启后都保留,权限按浏览器、文件、shell 分开设置。
SvelteKit 3 发布,Guillermo Rauch 称其令人惊叹并祝贺团队,尤其期待 Async Svelte 与 Remote Functions 的表现。他用其构建的小应用端到端构建加部署仅耗时 15 秒,运行即时,且 fx 与 opus 轻松搞定了全部流程。
晚点聊「AI季报26Q3」由主播程曼祺与 MoE Capital 创始合伙人 Henry Yin 对谈,梳理 GPT-6 Astra 进入机器人、Opus 5.5 与个人助理产品 Muse、Instinct 的进展,以及 OpenAI ARR 猛增、Anthropic 招股书透露 5180 亿美元承诺。
MIT 的 @a1zhang 在 Latent.Space 播客中讲解递归语言模型(RLM),称 Claude Code、Codex 和 Pi 本质上是同一类东西,RLM 通过代码、上下文卸载和递归子智能体实现跨任务泛化。他还谈到专家有时能替代万亿 token 的暴力搜索,以及 OpenAI 那个 1 万智能体、130B 输出 token 的实验对未来语言模型意味着什么。
Claude Code 支持安装 Mod,用户可用 TypeScript 写模块,也可直接让 Claude 现场生成并热加载,改造界面、操作逻辑和底层功能,官方已把 /diff 和 AGENTS.md 支持改为 Mod 实现。
Epoch AI 测算,2025–27 年出货的 HBM 硬件最多可支撑约 3000 万至 1.7 亿个并发前沿模型智能体,按每周 168 小时不间断运行折算,相当于约 1.4 亿至 7.2 亿名全职员工的工作时长。
Spring AI 发布模块化 RAG 实践教程,用 RetrievalAugmentationAdvisor 的 builder 把查询改写、查询扩展、向量检索、JevDocumentFilter 与 JevDocumentReranker 后处理拼成一条流水线。
Akshay Kothari 正在招募使用多个 agent 的用户,试用一款新原型,可集中存储所有记忆、技能和产物(memories、skills、artifacts)。有意者可在原帖回复或私信联系。
Harrison Chase 称每个 agent harness 都需要 durable runtime,并点名 pi-durable、deepagents 和 langgraph 三个方向。Pi 团队宣布 Pi 1.0 随 Pi Durable 一同发布,官方博客链接为 earendil.com/posts/pi-1-0/。