Agent Arena 评测 Jev Router:成本高 38%、延迟 1.7 倍,但可控性接近 Claude Opus 5.5
Agent Arena 用超 4700 个真实智能体会话评测 typesafeai 的 Jev Router,结果显示它未能推进当前帕累托前沿:达到与 DeepSeek V4.1 Flash(Max)相近性能时成本高 38%,模型请求延迟中位数高 1.7 倍。
Agent Arena 用超 4700 个真实智能体会话评测 typesafeai 的 Jev Router,结果显示它未能推进当前帕累托前沿:达到与 DeepSeek V4.1 Flash(Max)相近性能时成本高 38%,模型请求延迟中位数高 1.7 倍。
Arena 推出 Arena Alignment Index,基于 27 个模型的 90K+ 真实智能体会话,衡量三类安全信号:越权操作、错误归因和虚假完成。
Arena 宣布完成 2 亿美元 B 轮融资,估值 31 亿美元,同时发布 Arena Alignment Index。该指数基于真实世界智能体轨迹构建,首批包含 Unauthorized Action、False Attribution 和 Deceptive Completion 三项信号,今日公布 20 多个前沿模型的结果。
lmarena 宣布与 Khosla Ventures 合作。Khosla Ventures 的 Tal Broda 表示,lmarena 打造了业界最重要的 AI 排行榜,如今正在衡量 AI 智能体在真实世界中的行为表现,这项工作对实现安全且对齐的 AGI 至关重要。
LMArena 完成 2 亿美元 B 轮融资,Lightspeed 继种子轮后继续加注。Arena 年化收入已超 1 亿美元,另有数百万用户通过真实使用参与前沿模型评估。Arena 同时推出 Alignment Index,用于衡量 AI 行为在真实场景中与人类价值观的一致程度。
Arena 发布 Alignment Index,并在博客给出完整技术报告和排行榜。Arena CEO 表示,在完成 2 亿美元 B 轮融资后,平台从人类偏好评测进一步扩展到对齐领域,主要考察三类问题:模型采取未经授权的操作、模型谎称已完成实际未做的事,以及模型把并不存在的意图归因于人类。他称智能体正在欺骗用户、未经授权删除文件并绕过权限。
微软在 Windows 上发布本地智能体能力,并推出 137B 参数、256K 上下文窗口的编码模型 MAI-Code-1.1 Flash,已针对 PC 端运行优化。
Windows 把本地代码模型与智能体执行环境整合进桌面,读者可据此判断端侧开发与云端 token 成本结构的变化。
AWS 推出一个为期六周的 AI 构建能力培养项目,参与者每周投入约 4 小时,用 Amazon Bedrock 与 Amazon Bedrock AgentCore、Strands Agents SDK 等生产级工具搭建可运行的 AI 原型。
Tavily 赞助 Interrupt London,并在活动期间设立展位,展示如何将 AI 智能体连接到网络。活动由 LangChain 发布消息,互动数据为 13 个点赞、5 条回复、2 次转发。
LangSmith Engine v2 新增三项能力:对 AI 智能体进行红队测试、检测更多问题类型,以及自动测试提出的修复方案。@bentannyhill 在 Interrupt NYC 场次中讲解了这些更新及 LangChain 改进智能体的思路,完整视频已在 YouTube 发布。
LangChain Academy 发布了一个两分钟讲解视频,解释什么是 agent skill,以及它如何保护智能体的上下文窗口。该内容出自 LangChain 的 Deep Agents 课程,课程地址为 academy.langchain.com/courses/founda…。
LangChain 发布 Managed Deep Agents v0.9,新增 Schedules SDK,让智能体可在对话中自行创建提醒、跟进和周期性任务。该版本支持按每次运行选择模型、技能、MCP 服务器和沙箱,使单次部署即可服务不同团队或代码仓库;智能体在启动运行时会通过 Slack Reactions 回应消息。
LangChain 对 Deep Agents 的 skills 进行重构,以应对各方团队日益将 skills 视为向智能体提供领域知识标准的需求增长。官方称此次改版针对不断上升的实际使用需求。
Jerry Liu 认为,如今大多数任务可以直接通过定义 eval 并对其爬山优化来解决,而不必显式编写确定性或智能体工作流。数据提供方公司的职责是为各类经济活动定义 eval,让前沿模型具备通用能力,用户只需指明要解决什么、如何衡量好坏。最复杂的流程仍需显式工作流构建界面,但多数任务可压缩为目标加 eval 指令。
Meshy 创始人胡渊鸣在创业反思中提出,管理几十人靠一号位对业务细节的深入理解,管理几百人则需真正践行的原则与价值观和高密度人才梯队,并主张用"人力投资"取代"人力成本"、给员工市场最高位薪资。他认为 low performer 会逼走 high performer,招聘应宁缺毋滥、每个人都必须比现有的人更强。他还以任天堂、吉卜力和 Ray Dalio 为例,指出停止快速学习就会被"登味"腐蚀。
谷歌云在 Gemini at Work 2026 发布会上推出面向企业客户的 Gemini 智能体(Gemini Agent),定位通用工作智能体,可回答问题、处理知识型工作、创建媒体内容与编写程序,支持 Gemini Enterprise、Workspace 及第三方服务,目前兼容 Gemini 和 Claude 模型,并会提供 API 供开发者集成。
马斯克推出 Grok Bot,可通过 Cursor 账号登录 PC 端应用使用,后台集成 Opus 5.5、Midjourney、Suno 等模型并按需自动路由调用。
华人团队 Novix 将自我改进机制嵌入真实前沿算法与工程任务,提出 Co-Evolutionary RSI(协同进化式 RSI),成立半年已服务 20 万名专家、覆盖 40 多个国家和地区。
Meta 首席 AI 官 Alexandr Wang 表示,不要指望 Muse 能神奇地帮用户赚到 1 万美元,公司希望继续改进 Muse 的记忆能力。
美团智播是面向本地生活场景的AI数字人直播解决方案,支持真人1:1复刻、30秒生成直播素材、3分钟完成开播配置,7×24小时稳定上播。过去一年其数字人直播月日均GTV同比增长82.12%,月日均观看人次同比增长163.44%,开播场次提升11倍。
美团技术团队发布《Agent 评测白皮书》系列第一篇《评测全览》,提出完备评测体系可概括为四个模块、三种能力、两条 Loop、一套资产。两条 Loop 分别为评测体系迭代 Loop 与 Agent 迭代 Loop,二者共享线上真实样本,通过 Case 挖掘与归因咬合。评测集是核心资产,分端到端与过程两类,前者答"事有没有办成",后者答"中间哪一步出了问题"。
AI Will(@FinanceYF5)提出,营销人只需掌握 Claude Code 和 GitHub 两个基础工具,学会"营销工程"并搭建自己的 Agent,就能为公司创造真正的收入。该帖列出 11 个练习方向,并引导关注账号、点赞转发首条帖子。
Ira Bodnar 称掌握营销工程就永远不会失业,只需两样东西:Claude Code 和一个 GitHub 账号。会用它们并自建智能体的营销人员将为公司创造真金白银,他还给出了 11 个步骤。
营销 Agent 可连接 Meta 和 Google Ads,支持定时运行、预算限制与操作日志。示例规则为每小时检查账户:50 次转化后暂停 CPA 超目标 3 倍的广告,连续 3 天胜出则加预算 20%,并为最佳广告写 3 个新版本,每次操作及原因同步到 Slack。规则相同时,评论、竞品和真实混合 CAC 等独有数据决定胜负。
营销人只需掌握 Claude Code 和 GitHub 两个基础工具,就能学会"营销工程"这套能力,甚至搭建自己的 Agent。真正会用它们并自建 Agent 的营销人,能为公司创造真正的收入。原文列出 11 个练习方向。
Anthropic 为 Claude 新增两项测试阶段功能:Claude Dashboards 可连接 BigQuery、Snowflake、Databricks。
一直不看好多人 agent 协作的作者今天改观:不同性格和技能的 Bot 会讨论拍板,给出 GitHub、Cloudflare 和豆包播客 API 后做出一个 24 小时播报 AI 新闻的电视台,作者称下午弄好后开源。
Agent Arena 完整排行榜已在 arena.ai/leaderboard/ag 公布,该榜单用于对比各类 AI 智能体的表现。帖子附有链接,除排行榜外未披露具体排名、参评模型或评测分数。
斯坦福大学 CS146S「The Modern Software Developer」第三周课程已公开,主题为 Agent Skills and CLI,首次加入客座讲师 @leerob,内容涵盖 SKILL.md 与脚本编码工作流、Web skills 扩展 Agent 能力边界及 CLI 高效工作方式。
Matt Pocock 分享了 AI Coding Agent 该用多重流程的决策框架,按改动规模匹配流程重量。他给出两个命令的使用时机:/grill-with-docs 是轻量澄清流程,agent 动手前结合文档把需求问清楚;/wayfinder 是重型规划流程,先为代码库画 map、拆 tickets 再施工。
Genspark 宣布 Claude Haiku 5.5 已在其 AI Chat、Code Agent 和 Claw 中上线。所引 Anthropic 介绍称,这是其迄今最便宜、最快、能力最强的小模型,平均运行成本比 Claude Haiku 4.5 低约 75%。
Unsloth 与 Windows 团队合作,将微软开源的跨平台沙箱系统 mxc 集成到 Unsloth 的 Windows 版本中,用于隔离 AI Agent 的代码执行,官方称额外开销低于 100 ms。
腾讯混元联合复旦、清华推出 ExplorationBench,用于衡量 AI 系统如何探索未知规则,包含 31 处隐藏规则改动、70 项任务的 AlienCode 与 24 条补丁推理规则、70 条定理的 AlienLogic 两个可验证沙盒。
OpenAI 宣布在 ChatGPT 上线 GPT-6 系列模型与全新 Intelligent UI 交互界面。Plus 及更高付费订阅用户即日起可使用 GPT-6 Sol,免费版与 Go 档位用户自 10 月 8 日起可使用轻量模型 GPT-6 Luna。
读者可了解 GPT-6 系列在 ChatGPT 的分档开放方式,以及新交互界面如何让模型直接渲染交互组件。
歸藏用 Grok Bot 每天定时生成 AI 早报视频,内容收集、写代码和视频渲染全部跑在 Grok 云端虚拟机上,无需本地电脑。他公开了所用提示词,复制后其他 Grok bot 也能执行同一任务。
港大教授孔令鹏创立的扩散语言模型公司 DiffuSpace 完成 dLLM 方向全球最大规模融资,高鹄资本担任交易方。其开源模型 Dream 7B 在 Hugging Face 累计下载量超过 250 万,今年内计划发布参数规模更大的新模型,并针对性适配代码 Agent 与智能推理等任务。
Next Token 第 5 期已更新,本期继续讨论 personal agent 话题,包括为什么 Dots 这么难用、为什么国内 personal agent 可能不成立。节目还聊了 AI 复刻任何软件可能带来的影响,并探讨小硬件的机会。该播客第 4 期在小宇宙获得 1 万播放,做了 5 期达到 5,000 订阅。
GhosttyEXTREME 是 Ghostty 1.3.1 的 macOS 分支,解决在 macOS 上同时运行 Claude Code、Codex 等多个 AI 编码代理时原版终端看不到实时状态的问题。它通过侧边栏、跟随编辑的代码编辑器和代码地图可视化这些过程,并提供权限应答、回合撤销和变更审查。项目已发布在 GitHub。
Agent Economy Gala 以 400 名嘉宾满员收官,其中 295 人正在构建智能体应用或基础设施,另有 203 位创始人(累计融资超 $1B)、67 位创始运营者、58 位投资人和 23 位创作者。
一篇论文发现,在整仓库迁移任务上,同一模型与相同 effort 设置下,把 Codex 换成 HERMES harness 后 GPT-5.6 Sol 的成绩从 6.5% 提升到 31.0%,提升来自 harness 本身。