Browser Use 发布 browser-use 新链接
Browser Use 在 X 上发布了一条指向 github.com/browser-use/be… 的链接,未附任何说明文字,该帖获得 1 个点赞和 1199 次浏览。
Browser Use 在 X 上发布了一条指向 github.com/browser-use/be… 的链接,未附任何说明文字,该帖获得 1 个点赞和 1199 次浏览。
GPT-6.1 Sol 在 Browser Use Bench 2.1 上取得最高分,超过 Astra,且预估成本低 7.8 倍。其 95% 的提示词 token 被缓存,缓存 token 费率比 Astra 便宜 10 倍。Opus 5.5 和 Grok 4.7 得分更低且成本更高。
smol 发布更新,支持在一个地方连接所有智能体。该消息由 Akshay Kothari 发布,配有一段演示视频。
LangSmith for Startups Spotlight 介绍了 Corridor 的使用方式:用 LangSmith 开发并运行新型智能体安全评估、构建并追踪推理管线,以及管理为不同产品界面提供专门上下文的记忆图谱。Corridor 提供了演示地址 corridor.dev/demo。
Anthropic 的 Thariq 介绍 Claude Mods 带来的能力:对话上下文、子智能体、结构化输出以及 UI 控制。他表示 Mods 可以读取对话轮数和已用 token 等上下文,因为整个过程在进程内运行,所以能派生子智能体、解析其结果并用结构化输出返回;同时还能修改 UI,而这在 hooks 中无法做到。
Grok 4.7 现已在 Gemini Enterprise Agent Platform 上线。该消息由 xAI 发布,正文未披露参数规模、上下文长度或基准分数等细节。
LangChain Academy 更新了《Introduction to Deep Agents》课程,Deep Agents 让构建智能体更简单,Managed Deep Agents 则支持用单条 CLI 命令完成部署。课程还演示了如何把智能体部署到 Slack。
Azure Cosmos DB 推出 Global Secondary Indexes,把 AI 智能体的读密集型后台工作与实时智能体流量拆分开,无需搭建复制管道。该方案面向需要持续读写、工具调用和数据库访问的 AI 智能体场景。
哈佛物理学家 Matthew Schwartz 在 Anthropic Science Blog 客座文章中提出,AI 与科学之间存在类似物理学的"阻抗失配"——LLM 能力不俗,但像对待人类合作者那样使用它们并非发挥其科学优势的最佳方式。
Docker 在 WeAreDevelopers World Congress North America 上发布 Cloud Sandboxes,为智能体提供隔离 microVM 运行环境,开发者可用同一命令行工具 sbx 在本地启动、将沙箱迁移至云端长时间运行再取回结果,计算按秒计费,目前可用。
Guillermo Rauch 提出"验证工程"将成为未来方向,手段包括证明、e2e 测试、benchmark 和 linter,其中部分测试是确定性的,部分由 AI 智能体驱动。
NVIDIA 发布 DOCA Agent Skills,为通用 AI 智能体补上 DOCA 这一基础设施软件领域的专业知识,减少其在开发中因缺乏领域知识而产生的猜测性错误,从而缩短反复纠错占用的时间。DOCA 是 NVIDIA BlueField 的统一软件平台,该技能面向在 BlueField 上构建应用的开发者。
LangChain 分享了在 harness 中构建模型路由器的四个步骤:理解任务、理解模型、在 harness 中实现路由器、追踪任务结果。据其披露,该方案将每线程中位成本降低了 64%,且质量没有变化。
Perplexity 的 Computer 功能新增内联图表、示意图与可视化,可直接在对话线程中生成交互式图表。金融数据部分由 TradingView 的 Lightweight Charts 驱动,支持 K 线、成交量和移动平均线。
LlamaIndex 发布 Extract v2.5,一组专为文档抽取调优的前沿智能体,分为 cost-effective、agentic、agentic plus 三档,价格比 Opus 5.5 和 GPT-6 Sol 便宜 30%-4x。
Firecrawl 发布 People Enrichment Pack,Apollo、FullEnrich 和 Data Legion 已在 Alexandria 上线,可让智能体查找买家及其工作邮箱、按技能和任职经历筛选人才,并获取公司规模与融资信息。该功能现可在 Claude、ChatGPT 或 Firecrawl API 中试用。
Anthropic 推出 Claude Frontier Academy,投入 1 亿美元,目标到 2027 年底培养 1 万名 Frontier Deployed Engineer(FDE)。
NVIDIA 发布基于 Cosmos 和 VSS 3.3 的方案,可通过一条提示词构建视觉 AI 智能体。该内容以直播形式呈现,具体功能与参数未在原文中披露。
Sam Altman 认为 Sign In With ChatGPT 与 Plugin Extensions 蕴含的潜在能量远超外界认知。他在推文中表达了对这两项能力未被充分认识的看法,该帖获得 1325 次点赞、181 条回复与 53 次转发。
Mem0 可让 Claude Code 无需在每个会话中重新解释代码库。该内容为一条推文式演示,未披露具体实现细节、版本号或性能数据,原文仅附视频入口与互动数据。
Runway 推出新能力,可将任意媒体扩展为交互式实时世界模拟,把固定体验转变为面向人和 AI 智能体的沉浸式多模态模拟。原文未披露模型版本、参数规模或可用性细节。
Philipp Schmid 表示首次见到"人类使用不限量、智能体(agent)使用受限"的产品设定,并称这一现象很有意思。
Datalex 与 AWS 在 2025 年 12 月合作开展为期三天的 Experience-Based Acceleration(EBA)工作坊,16 名 Datalex 工程师与 6 名 AWS 专家将 EJB/Java 8 迁移到 Spring/Java 21。
Halluminate 正在构建强化学习环境与基准,让 AI 模型掌握编程之外的知识工作,首个落地领域为金融。团队不足 10 人,已与 5 家美国头部闭源 AI 实验室中的 4 家合作,并完成 3000 万美元 A 轮融资。其路径从浏览器智能体测试延伸到金融建模等训练环境,并强调更好的验证机制比更多训练任务更关键,未来目标是构建 AI 智能体团队协作的模拟公司。
ChatGPT 订阅额度现可直接在 16 家以上合作伙伴产品中使用,无需额外规则,包含 Devin、OpenCode、Notion 等,通过 Sign in with ChatGPT 登录即可使用。该消息由 Tibo 发布,Lenny Rachitsky 转发并称其为 DevDay 的意外亮点。
LangChain 在两个自研智能体上测试 OpenSWE Review,其精度从 62.9% 提升至 81.5%,每次审查的工具调用减少 29%。基于 Kimi K3 微调的 Engine 在问题检出基准上超过了基座模型与 GPT-5.6 Sol。相关细节见 LangChain 博客。
LangChain 上周发布 LangSmith Fine-Tuning 和 smithtune CLI,可将 agent 自身的运行轨迹直接转化为微调模型,无需手工搭建训练流程。官方表示 agent 的 trace 已体现代码执行任务的过程,这些信号现在可直接作为训练数据使用,并附有一段快速演示。
Perplexity 在 Computer 中推出由 Amex 精选的即用技能库,面向符合条件的美国 Amex Business 小企业卡会员开放。这些预置工作流可处理现金流预测、营销活动生成等日常业务任务,用户只需在 Computer 中选择任务并补充业务信息,无需从零编写指令。
AbridgeHQ 把临床医生反馈构建进评估系统,帮助团队衡量智能体质量、识别改进点并支持更快发布。这是医疗机构从主观评审转向可重复的生产级 AI 评估系统的一个案例。LangChain 免费指南中有更多相关内容。
美国财长贝森特就 Hugging Face 事件表态,称这是 OpenAI 管理层的责任而非一群 agent 的责任,政府不会给 AI 实验室免责豁免。徐文浩与任鑫在播客中讨论了 agent 出事谁背锅、大公司 AI native 转型为何被拖慢、小公司借此少交「责任分配税」的机会,以及 Jev 模型引发的「工程与算法间的严重产能过剩」现象。
CopilotKit 赞助 Interrupt London,将在活动期间设立展位,供参会者现场上手体验面向智能体的企业级前端技术栈。
LangChain 公布其智能体大会 Interrupt 的详情并开放 RSVP 报名,报名链接为 interrupt.langchain.com/london。该会议由 LangChain 主办,CopilotKit 在推文中被提及。
JetBrains 在 JetBrains IDEs 中启动 Air 的 Early Access Program,Air 以插件形式上线 JetBrains Marketplace,也原生集成在 2026.3 EAP 版本的 IDE 中。
LangChain 团队将在 World Summit AI 的 G54 展台亮相,10 月 7 日 11:50 由 @hwchase17 带来关于智能体现状的演讲。10 月 8 日 11:50 还有 LangChain 与 LangSmith 的 Agent Development 工作坊,首日活动结束后与 Elastic、Google Cloud 一同出海交流。
Google DeepMind 推出前沿 AI 模型 Gemini 4 Argon,主打复杂长流程任务中的深度推理,目前通过 Fairwind 计划向网络安全专家开放试用。
官方披露了 Gemini 4 Argon 在软件工程、安全防御等长流程任务中的能力和定价,可据此判断前沿模型在企业工作流中的落地进展。
Kin 在 Grok bot 上搭建了一个「推特运营专家」Agent,一个月内把推特账号从近 0 做到涨粉 4000+。该 Agent 每天调研热门及低粉高爆帖子、挖掘选题并按他的风格生成文案,沉淀到 Notion 选题库,他只做筛选、让 Agent 修改后人工发布。目前该 Bot 已开源,可通过 x.ai/bot/ScOhH1qaoq 免费使用。
有用户实测给 dot 打电话,认为可以完美替代此前在 chat 里打电话的需求。社群有朋友提出可把 grokbot 迁移过来,但该用户感觉两者不一样,并认为多 bot 形态更容易接受,例如 grokbot 里有视频号提取 bot、视频号批量提取 bot、邮箱 bot、微信 bot 等多个专用 bot。
lencx 见闻汇总指出 Claude Code 防封技巧多为自欺欺人,封号靠程序自动化叠加多因素触发。
在华盛顿一场科技圆桌论坛上,马斯克称美国平均用电负荷约 500 GW,每新增 5 GW 基荷电力约拉动 1% GDP(约 3000 亿美元),并主张把算力送上太空,SpaceX 计划与特斯拉联手实现每年 200 GW 太阳能组件产能。
MiniMax 上线首个 Flash 模型 M3.1-Flash-Preview,目前为预览版,未正式发布也未公布 benchmark,规格为 100 万 token 上下文、原生多模态,深度思考分 low 到 max 五档,默认 max。