Browser Use 构建浏览器 harness 的经验总结
Browser Use 分享了构建浏览器使用 harness 的经验教训。Gregor Zunic 发布了这篇文章,推文获得 117 个点赞、6 次转发和 17022 次浏览。
Browser Use 分享了构建浏览器使用 harness 的经验教训。Gregor Zunic 发布了这篇文章,推文获得 117 个点赞、6 次转发和 17022 次浏览。
ElevenLabs 基于 ElevenAgents 构建的 AI SDR「Dom」正在承接其自身越来越多的入站销售线索资格审核,单条线索审核仅需 4 分钟,而人类中位数为两天。该智能体单月产出超过 100 万美元的合格销售管道,目前已在 ElevenLabs 内部投用。
Perplexity Computer 将预装于 HP ZBook Ultra G3a,用户可通过简单界面运行复杂的多步骤工作。Computer 智能体基于深度研究,并可连接数百种工具,其中新增 Autodesk。
当前 UI 设计师招聘中 10 家有 6 家以上要求 AI 技能,Vibe Coding 在大厂 JD 中出现频次极高。Vibe Coding 即指挥 AI 生成代码,能让人体验产品从零到上线的完整生命周期、认识 AI 的能力边界并积累技术框架认知。入门方式是打开 Codex、Workbuddy、豆包工作等工具,从待办管理、番茄钟等自用本地小工具做起,再部署到服务器跑通。
Claude Fable 5.1 在 Artificial Analysis 的 Intelligence Index v4.2 上守住第一,并与 OpenAI 的新模型在更新后的基准测试中并列。
Harrison Chase 认为记忆难以产品化,核心原因是"记住什么"的判断逻辑往往与应用强绑定,且本质上只是提示词工程,存储和查询反而不难。他指出记忆需要与 harness 深度集成,难以做成独立产品,在通用智能体里用处有限,更适合重复性任务。他还表示记忆尚未在编码智能体中证明价值,而多数爆发的智能体能力都先在编码场景跑通。
a16z 投资的 AI 助理 Town 上线 3 个月,试用用户付费率超过 15%,传闻正洽谈约 10 亿美元估值的新融资。Town 要求用户先连接邮箱和日历才能使用,会按任务难度分配模型,大部分任务仍依赖前沿模型,为此公司每年为每位工程师投入至少 7.5 万美元购买 AI 工具。
Linkloud 沙龙第44期将于 9 月 19 日在成都举办,主题为 Agent 如何从“能做”走向“能用”与“能卖”。SandBaseAI 创始人李样兵、VMEG.AI 创始人胥彪、Deotaland 联合创始人兼 CTO 凌星炜、Crescendia 创始人王斌将围绕 Agent 工程化、FDE 角色、海外 0 到 1、AI Agent 智能硬件与 GEO 增长展开对话。
京东一次性发布四款企业级 AI 办公产品:JD JoyWork、JoyDesk 2.0、京东百灵数字员工和研发生产力平台 JoyCode,主打从“能干活”转向“能交付结果”。其中百灵数字员工按 KPI 验收交付,客服场景使某保险客户转人工率下降 50%。这些产品已落地北京市“京办”,并服务五粮液、荣耀、雀巢等客户。
飞连将安全能力融入豆包工作的使用过程,覆盖工作成果保护、Agent 运行安全和整体 AI 办公治理。飞连可识别并保护豆包工作处理、生成的文件内容,按企业策略控制敏感数据流转,并对 Skill 下载进行检测、阻断恶意 Skill、扫描隔离本地风险文件。飞连还能从终端、网络和应用行为中持续发现 AI 资产,支持对高风险 Agent、AI 工具和 AI 网站设置访问限制。
AI Simulation赛道升温,Simile估值达20亿美元,Aaru估值接近10亿美元,哈佛与MIT等机构联合的MatrAIx项目构建了83亿个AI虚拟人格。MatrAIx用1290个维度定义每个人格,完成超1.8万次测试,400次受控实验显示91.5%情况下Agent能遵循预设人格。Simile已为财富100强企业运行数千万次模拟,CVS用它构建了40万个数字分身。
MiniMax Design 展示了一个全流程制作案例:用户给 Astra 一句需求,它便在 Blender 中交付完整场景,包含镜头调度,全程运行在 MiniMax Design 内。Astra 作为智能体通过官方 connector 与 Blender 通信,内容直接同步到画布,最终视频由同一画布上的 MiniMax H3 生成。
Qdrant DevRel 工程师 @itsclelia 将在 n8n in the loop 2026 上演示如何构建无需微调、从自身运行历史中学习的研究智能体。
idoubi 在 X 上分享做协作类 agent 产品的关键点,认为核心难点在于保证多 agent 群组的整体可用性。他列举多 agent 协作的常见问题,包括成员因模型限额、封禁、工具调用异常或网络问题罢工,leader 分配不合理导致重复或冲突,leader 自身挂掉,以及定时任务等外部依赖异常。
Schneider Electric、Vodafone 和 monday.com 分享了规模化运营 AI 智能体的经验:Schneider Electric 建立 350 人内部 AI Hub,支撑 60 多个智能体,以可观测性、评估和部署为核心构建 LLMOps 体系。
LangChain 公开其付费媒体智能体的构建过程,该智能体常驻 Slack,每周一汇总各广告平台数据并生成报告,六个月内把付费媒体对营销管线的贡献从 0 提升到 20%,6 月至 8 月单条合格线索成本下降 30%。
千问AI平台将于9月22-24日在杭州国际博览中心云栖大会设分论坛与三大体验展区,现场开放 Model·Skill·Agent 体验动线。活动涵盖平台能力与共创计划首发、AIGC 创作、模型评测、Skills 与 Agent 实战及新手 AI 实训营,并可申领最高1亿 Token 权益。
Weaviate 的 Engram 用异步管线处理 AI 记忆:原始消息先提取关键事实,再与已有记忆比对,调和矛盾、去重与更新,最终只保留经过修剪的记忆集供检索。
AI 智能体定时循环执行任务后,作者需要逐一审核三个收件箱:智能体自主完成的工作、从 Google Docs 和幻灯片里收藏的 Slack 消息,以及他自己的真实邮箱。这条帖子获得 115 条回复、202 个点赞和 27351 次浏览。
腾讯云开发者文章梳理多项研究与官方工程实践,讨论 Agent 系统指令、Skill 与工具说明什么时候该补写、删减或按需加载,指出没有通用最佳长度。
RAG问答是"问什么答什么"的被动检索生成,平均消耗几千tokens、几秒到几十秒完成;Agent则是"给定目标自主完成",具备规划、记忆、工具调用与反思能力,简单任务消耗几万tokens、复杂任务可达千万级、耗时几分钟到几十分钟。企业获取知识应优先用RAG问答,写代码、改文档、订票等复杂任务再交给Agent,而非越高级越好。
Browser Use 宣布为现有 sandbox 提供隐身浏览器,并支持在通用智能体中以本地部署方式使用该隐身浏览器。官方表示有需求可直接私信 Magnus Müller(@mamagnus00)咨询。
金沙江创投朱啸虎在对话中判断,今年可能是基础大模型的最后一年,明年资本市场需要讲新故事,等Anthropic和国内大模型公司上完市,故事就讲得差不多了。他认为办公Agent肯定是大厂的天下,因为企业微信、飞书、钉钉掌握的组织关系与历史数据是创业公司难以逾越的上下文壁垒,创业公司只能选一家平台做垂直Agent。
Fireworks AI 帮助 Juicebox 用定制专用模型,把数十万份人才档案的实时搜索延迟降低 80%,推理成本从每年 400 万美元降至 80 万美元。Juicebox 需要多个实时搜索智能体在数秒内完成检索。
LangChain 的 Managed Deep Agents 现已与 Slack 深度集成,用户可通过 @提及、私信和线程回复直接触发智能体运行,智能体随后在同一会话中回帖。官方已发布入门教程,演示具体接入方式。
微软研究院新一期 Research Focus 聚焦四个方向:编码智能体在规模化场景下的行为表现、AI 模型在 PET/CT 扫描中识别淋巴瘤病灶的评估、AI 聊天机器人依赖问题,以及大规模决策系统的推进。
Bolt 推出 Bolt Forge,在 bolt.new 的模型选择器中上线,新增 GLM、DeepSeek、Kimi,用量最高可达原来的 50 倍且零使用费用,免费期至 10 月 14 日。
MemPalace 把项目知识按"宫殿"结构组织:wing 对应项目或知识库,room 归类相关主题,drawer 将原始内容切成可检索的小块,Milvus 在背后存储文本、嵌入向量和元数据。
DeepLearning.AI 指出 GPT-6 Astra 登顶 ARC-AGI-3 榜单,同时降低 token 成本。它在 Artificial Analysis 的 Intelligence Index 上与 Claude Fable 5.1 持平,并具备异步工具调用以支持并行执行、跨 API 调用保留推理记忆等特性。
Portable Computer 现已在搭载 NVIDIA RTX GPU 的 Windows PC 上可用,可在本地运行 harness、智能体与模型。它支持在不把任务发送到云端的情况下处理本地文件和已连接的应用,必要时也可调用前沿云端模型。
Google Labs 推出 Dreambeans,从 Gmail、Calendar、Search、Gemini App 和 Google Photos 的人脸分组等已连接来源汇总信息,生成个性化图文故事,而非按单个应用隔离数据。
Gemini API 的 agent harness 并非新模型。相关方表示本周晚些时候会分享更多信息。
Christian Catalini 指出,当无人为未经验证的失败付出代价、责任敞口趋近 0 时,验证预算就会崩塌。此时部署者会把未监控的 AI 智能体大量投入"失控风险区"(Runaway Risk Zone),获取自动化的收益,却把灾难性风险社会化。他在分析 AGI 经济学时认为,AI 大幅降低了任何易验证事项的执行成本,其余场景的瓶颈则是验证。
Gamma 联合创始人兼 CPO Jon Noronha 在 First Round Capital 播客中复盘:这款超 1 亿注册用户的 AI 产品正拆掉 2023 年为弱模型搭的"护栏",不再由系统锁定字体与样式,转而让模型直接生成 HTML 和 CSS。团队约 100 人时已觉得太慢,主张服务上亿用户的系统只准备用六到十二个月,最终作品必须耐久,生产作品的方法可以易朽。
Linkloud 沙龙第 44 期将于 2026 年 9 月 19 日在成都举办线下活动,主题为 Agent 如何从“能做”走向“能用”与“能卖”。
小红书 AllSpark 团队发布 Search Agent Iris,权重与评测代码已开源,并计划陆续公布数据与训练完整配方。
腾讯技术工程发布长文,梳理 AI 工程从 Prompt Engineering 到 ReAct 再到 Context Engineering 的三阶段演进,并以 Anthropic《Effective Context Engineering for AI Agents》为主要参考构建实践体系。
有人在 X 上发问是否已存在针对 bot / AI worker 的 benchmark,并点名 grok bot、muse、hermes、openclaw 等待评测对象,但未给出任何实测数据、指标或结果。该帖获 404 点赞、74 条回复、11 次转发,浏览量达 42370。
DeepSeek-V4.1-Flash 正式上线千问 AI 平台,相关 API 服务与 Token Plan 同步开放,开发者可通过 API 接入应用,也能在 Qoder、千问 APP、Codex 等工具中直接调用 Token Plan。
termany.sh 上线 Bot Mode,可把本地 AI 智能体组合起来,让它们协作处理任务。官方已放出演示视频,具体协作机制与支持范围尚未披露。