编码智能体 Harness 设计的实证研究
一篇关于编码智能体 Harness 设计的实证研究论文发布在 Hugging Face,论文链接已公开。原文未披露具体模型、benchmark 分数或实验结果。
一篇关于编码智能体 Harness 设计的实证研究论文发布在 Hugging Face,论文链接已公开。原文未披露具体模型、benchmark 分数或实验结果。
Dify 用 New Agent 在一家真实家居用品商店上落地售前场景,从"帮我找 40 英镑以内的乔迁礼物"这类商品发现任务起步。它通过对话持续迭代同一个 Agent,把最初的产品发现扩展为能力更强的售前体验。Dify 称电商的难点不只是展示商品,而是帮顾客从浏览走向有把握的决定,并发布了完整案例博客。
Grok Bot 现已支持开启自动更新,用户需升级至 0.40 版本才能启用该设置。官方表示过去 7 天共发布了 49 个新版本,自动更新可帮助用户及时用上最新功能。
Grok 的 bot 现在支持 webhook 触发,从任意位置唤醒。创建 routine 后点击「add trigger」选择 webhook,即可接入 WhatsApp 特定联系人消息、Notion 页面变更、家庭温度传感器阈值、桌面按钮、GitHub Action 完成或服务器错误率飙升等事件。
Grok Bot 新增 marketplace 和 Bot 模板功能,用户可从 marketplace 添加模板。官方首批分享的 Haggle Bot 用于谈判供应商合同、查找闲置 SaaS 席位并为经常性采购比价,上线一周已为其节省超 10 万美元。
Bolt 在开放模型上线首周迎来 DeepSeek V4.1 Flash 加入 Bolt Forge,该模型被 beta 用户称为生成网站外观最好的选择。官方称其使用量达到 DeepSeek V4 Pro 的 10 倍,首周构建者则以压倒性比例选中了速度最快的那一个。
Andrew Ng 在 The Batch 中反驳最新一轮 AI 末日论,认为近期网络安全事件的真正根源是粗糙的沙箱隔离,而非 AI 软件失控,把可预测的黑客攻击归咎于过于强大的 AI 智能体就像自己砸破窗户却怪锤子。
李继刚提出两个公式:Agent = Harness(LLM),Result = Agent(Context)。即智能体由大语言模型加上外层 Harness 构成,而最终结果取决于智能体与上下文的结合。
李飞飞表示,Agent 可以是 AI,但能动性(agency)属于人类,每个人都有责任借助工具增强自身的能动性,而北极星始终应是以人为中心。
Kastle 正在为银行构建 AI 员工,其智能体可自动化抵押贷款服务、消费信贷等后台运营流程。目前 Kastle 已与 25 家顶级抵押贷款服务商中的 10 家合作,累计处理交易额超过 20 亿美元。该公司在参加 YC 两年后完成 2400 万美元 A 轮融资,两位创始人分享了如何让智能体可靠到足以处理真实金融交易。
MiniMax Code CLI 的 v0.4.12 版本面向全球开发者开放,并以 MIT 协议开源,它是 MiniMax Code 客户端的核心组件,源码已发布在 GitHub。
奇舞周刊第597期汇编多篇 Agent 工程实践:淘宝百亿补贴数据分析助手 Agent 在自然语言与 SQL 间加入业务语义层,结合多 Agent 编排、知识检索与执行校验,案例查询耗时从 30—120 秒降至 3—10 秒。
9月14日豆包手机助手正式发布消费者版本,搭载在努比亚 NaviX Ultra 手机上,重点转向交互、意图理解与 Agent 融入 App 生态。新版增加专属 AI 键与指纹鉴权,可检索相册、短信、便签等本地数据,并接入飞书妙记录音能力。同日推出屏幕自动化操作声明协议 SAEP,第三方应用可自主决定是否允许 AI 在应用内自动操作,规则公示 30 天至 10 月 15 日。
豆包2.1 Pro 0915版进入火山方舟模型列表,支持百万 Token 上下文与多模态编程,并强化长程 Agent 协作与异步子任务验收。Anthropic 开源含 36 套工具的生物模型推理优化工具集,报告平均提速约 4 倍,其中 FlashPairformer 专用内核加速结构预测,仓库为研究参考发布、不计划持续维护。
刘小排提出,创业成功不是公司上市、被收购或达到某个收入数字,而是"找到一个值得长期待下去的赛道 + 找到一个会自己变强的模式",即哪怕创始人不再越来越牛,公司仍能越来越牛。
交互模型正成为一个尚未收敛的热门赛道,Loopit、Reverie AI、SigmaZ AI 等团队各以「交互世界模型」「交互模型」「下一代 AI Interface」等不同称呼切入,Runway 也推出实时角色 Characters、可交互世界 GWM Worlds 和生成交互界面的 Solaris。
SemiAnalysis 披露其公司 AI token 开销已占员工薪酬的 30%,每位员工每月消耗约 50 亿 token。文章指出模型开源与 Agent 开源是两件事,真正承载用户资产的是负责调度模型、连接工具、管理记忆的 Agent Runtime,并以 DeepSeek Harness、网易有道 LobsterAI 为例讨论执行层开源。
Hamel Husain 整理了他与 Shreya 在向 5000+ 名工程师和 PM 讲授 AI Evals 时收到的最常见问题,组成一份按主题分类的 FAQ。
TypeSafe AI 的 Jev 在 Vercel AI Gateway 上线 24 小时内,采用它的付费团队数量超过以往任何模型发布的两倍。Jev 在上线后首 12 小时超过所有对比模型,并在此后继续扩大领先;到第 24 小时,近 13% 的付费团队在使用它,是 GPT-5.6 系列的 2 倍、Fable 5.1 份额的 6 倍以上。
新一代原生全模态模型 Qwen3.8-Omni-Flash 正式上线千问AI平台,支持文本、图像、音频和视频输入以及 1M 长上下文,目标是把全模态能力从理解内容推进到规划任务、调用工具并完成创作。
原文给出全模态模型的评测提升、API 降价幅度与配套开源工具,读者可据此判断音视频智能体的落地成本变化。
browser-use 开源了 Jev,它通过将"思考"与"下一步动作"拆分,由大模型负责复杂推理,小模型只负责从页面真实按钮中挑选点击、输入、滚动等操作。该方案面向浏览器智能体、自动 QA、交易循环、Agent 路由等需要反复选择动作的场景,已有 NewMax 正在接入。
Tony Dinh 用 Jev 做了一个开源 Chrome 扩展,实时监听 YouTube 音频、检测赞助片段并自动跳过,每条视频成本约 $0.005。该项目为原型、采用 BYOK 模式,代码已发布在 GitHub。
蚂蚁集团CEO韩歆毅、万事达卡首席产品官Jorn Lambert等人在2026外滩大会圆桌讨论"当Agent成为交易主体",聚焦智能体支付中的授权、身份与责任问题。韩歆毅透露自己已用AI Agent下单买零食,并预测智能体经济将在未来6—12个月爆发,但坦承目前后台数据尚未显现迹象,行业面临"先有鸡还是先有蛋"困境。万事达卡提出"可验证意图"机制,韩歆毅则提出KYA(了解你的智能体)概念。
Browser Use 创始人 Gregor Zunic 发布实测视频,展示浏览器 Agent 查询真实航班机票从打开网页到返回结果只用 7 秒,1 倍原速无快进,单次成本 0.0039 美元。
Jev 决策模型已在 OpenRouter 上线,定位为 System One,不做长文生成,只处理布尔判断、枚举选择、候选打分三类决策任务。它不兼容 OpenAI Chat Completions 格式,需用 Decisions API 自行拼 state 与 questions。典型场景包括搜索意图识别、本地模型网关路由和多 Agent 协作中的 Bot 分派。
谷歌/DeepMind 研究人员推出 Dream-RSI,让 AI 智能体通过重放过去的发现尝试来改进探索问题的方式,以低成本测试数千种替代策略,并在下一轮部署更优策略。该系统在算法设计、数学优化和 GPU 内核工程中保持或提升发现质量的同时大幅降低搜索成本,一种场景下将智能体调用次数最多减少 162 倍。其改进的是探索策略,而非底层模型权重。
Browser Use Cloud 即将上线 ULTRAFAST,官方称其具备超人类速度、成本低且难以被检测三项特性。用户可在等待名单登记,并说明自己想要自动化的任务。ULTRAFAST 目前尚未公布具体参数与上线时间。
Dify 与 TiDB 将于 2026 年 9 月 24 日 11:00–12:00 SGT 举办炉边对话,Lusha Chen 和 Terry Purcell 将讨论开发者从应用转向 AI 智能体后,数据层哪些假设开始失效。AI 智能体的流量不遵循人类用户的节奏,会分支、重试、保持状态,并在数据层制造并发突发流量。活动无幻灯片,含实时问答,需在 pingcap.com 报名。
阿里发布 Qwen3.8-Omni-Flash,称其为 Qwen 首个围绕智能体能力构建的全模态模型,将原生音视频理解、推理与工具调用整合在同一模型中,实现理解内容、规划任务、用工具执行并交付结果。
大淘宝技术针对策略效果类 Agent 提出“五层、四步、三阶段”评测方法论:五层评测对象界定评什么,四步质量归因(诊断、定位、优化、验证)决定评完怎么办,三阶段上线治理(准入、灰度、监控)解决如何上线。团队同时提出 Auto Rubrics 方法,用结构化 Rubrics 替代黑盒 Reward Model,通过三层架构构建可解释的业务效果 Judge 体系,规避位置偏差与选择过拟合等陷阱。
Genspark 公布 AI Chat 与 AI Image 的每周额度使用规则:现有 Plus 或 Pro 订阅用户在 2026 年 12 月 31 日前可零 credits 使用全部模型,包括 Opus 等旗舰模型;2027 年 1 月 1 日起改用与新会员相同的条款,旗舰模型消耗 credits,Core 模型在每周额度内免费。
一篇综述把 Agent 的能力来源从模型转向模型之外的 Harness,按「一个循环、四个子系统、生产化、长时运行、评测、选型」展开。
TypeSafe AI 发布新模型 Jev,它不生成文字,只输出决策与置信度,定位为 System One Model 通用分类器,主打高频判断场景。官方称其速度比常规大模型快 20~200 倍、成本低 40~400 倍,价格为 0.042 美元/百万 Token,输出 Token 免费,并采用名为 RLCD 的面向校准决策的强化学习方法。
Shopify 宣布放弃 React Native,改用 Swift 和 Kotlin 开发移动客户端,回到原生语言路线;六年前它曾高调从原生转向 React Native。周刊还提到联合国投票决定废除墨卡托投影,建议改用 Equal Earth Projection 绘制世界地图;成都市计划推出"词元券",对企事业单位消耗的 Token 补贴不超过 30% 的消费金额。
在2026 Inclusion·外滩大会主论坛圆桌“当Agent成为交易主体”上,蚂蚁集团CEO韩歆毅、万事达卡首席产品官Jorn Lambert、OPPO刘作虎与阿里巴巴周靖人讨论了Agent交易爆发前的信任基建。
Elastic 推出内置于其平台的 SNAP 支付错误检测方案,用规则、机器学习与 Elastic Agent Builder 对话式调查三层能力,在案件入索引时实时识别资格错误与欺诈,而非依赖隔夜批量规则引擎。
Notion 被类比为知识工作领域的 GitHub:正如 Cursor 让开发者在 Git 仓库上编码,Notion agents 让用户在公司知识文本上工作。该观点来自一条引用帖,认为任何智能体提供商都可接入这一"公司大脑"。
Vercel CLI 现已支持亚秒级部署静态产物,运行 vercel deploy 可跳过构建步骤直接返回线上 URL,官方示例显示 802ms 即就绪。该功能自动识别符合条件的部署,支持最多 10 个 HTML 或 Markdown 文件、总大小不超过 5 MB,扩展名限 .html、.htm 和 .md。需升级至 Vercel CLI 59.16.0 或更高版本。
OpenAI 推出 Astra for Law,定位为面向律所的工具与技能集合,由 GPT-6 Astra 驱动,提供工具、设置和上下文以支持律师与法律科技公司的专业判断。该产品将数据隐私列为核心功能,包含 26 个合作伙伴构建的插件和 47 个社区插件用于 ChatGPT 中的法律工作。
Gemini API 的 Managed Agents 迎来 harness 重大更新,Google AI Studio 发布了相关说明。原文未披露具体更新细节与版本号。