Anthropic 发布 Claude Haiku 5.5,编码与电脑操作能力较 4.5 明显提升
Anthropic 宣布 Claude Haiku 5.5 发布,称其在编码、computer use 和知识工作方面相比 Haiku 4.5 有明显提升。
Anthropic 宣布 Claude Haiku 5.5 发布,称其在编码、computer use 和知识工作方面相比 Haiku 4.5 有明显提升。
Anthropic 发布 Haiku 5.5,这是首个带有可调 effort 设置的 Haiku 模型,用户可针对每个任务自行决定侧重成本还是智能表现。
GPT-6 开始面向每周超过 12 亿 ChatGPT 用户全面推送,并带来新的 Intelligent UI 能力:回复可用文本、视觉与交互元素共同组织,包含图形、按钮、表单、图表乃至可直接使用的交互式工具。
原文给出 GPT-6 面向 12 亿周活用户推送的消息,并拆解 Intelligent UI 的两层技术实现。
微软正式将 Windows 的战略定位从个人计算平台升级为 the home for hybrid intelligence,作为 AI Agent 在本地与云端的承载、安全隔离和企业管理主阵地,并发布四层架构。
斯坦福 Fall 2026 课程 CS 329Z《Engineering AI Agents》第 4、5 讲已公开,分别由 @Diyi_Yang 讲「Tool Use」、@Diyi_Yang @michaelryan207 @jyangballin 讲「Frameworks & Orchestration」。
Claude Haiku 5.5 的 benchmark 全面领先 GPT-6 Luna,OpenRouter 观测到的 token 输出速度也是 2 倍。Anthropic 官方称 Claude Haiku 5.5 是迄今最便宜、最快、最强的小模型,运行成本比 Claude Haiku 4.5 低约 75%。
阿里在「AI Native 研发范式实践手册」结尾给出四点官方陈述:从写代码到可靠交付仍有较多技术问题待解,基础设施工程复杂度可能不亚于 Agent 应用层建设。企业知识资产尚未做到 Agent 友好,结构化、版本化、权限管理与质量治理仍有大量工作;组织设计影响更深远且更难有确定答案,AI 迭代速度还会持续冲击现有架构,需保持架构适应弹性。
LangChain 为 Deep Agents 框架的 Skills 带来三项工程升级:工具绑定 Skills 通过 SKILL.md 的 metadata.include_tools 声明工具。
腾讯云开源自托管多智能体 AI 助手平台 Octop,面向家庭和小团队,主打多用户、多智能体和数据完全留在本机。整个系统为单个 Python 进程,数据落在 ~/.octop/,默认 SQLite(WAL 模式)并可切换 PostgreSQL;模型层走 OpenAI 兼容 API,支持 DashScope、Ollama 与可替换的存储和渠道。
Anthropic 发布 Claude Haiku 5.5,10 万 Token 以内请求每百万 Token 输入 0.1 美元、输出 0.5 美元,比 Haiku 4.5 便宜 90%,长请求为 0.5 和 2.5 美元,便宜一半。
Haiku 5.5 的降价与跑分变化并列给出,可据此判断小模型在批量任务和子智能体场景中的成本位置。
宝玉披露,Lauren 30 天 Token 消耗达 1.5T,用得最多的模型是 Opus 5.5,Cloud 是消耗大头。Cloud 上每个任务可用独立虚拟机并行,但改动验证不如本机方便。他同时提醒,不 Review PR 的前提是能用上 Fable、Opus 5.5 这类最好模型且有充足 Token;AI 验证只能替代一部分,方向仍需人自己把握。
OpenAI 开始向 ChatGPT 推送 GPT-6,主打功能为 Intelligent UI,可根据问题类型生成可点击、可调节参数的界面,Plus、Pro、Business、Enterprise 用户今天起可用,免费版和 Go 版明天起陆续开放。
对比了 OpenAI 与 Anthropic 在交互式回答上的两种路线,读者可据此判断界面生成的实现差异。
宝玉分享了自己在 Claude Code 中使用 Fable 的用法,把任务交给 Fable 负责分析、编排和验收,再派 SubAgent(Opus)去执行,大部分时间 Fable 在等 SubAgent 执行,因此可以持续派活而无需等待任务完成。
DAIR.AI 发布论文 MCP 工具,接入 Codex、Claude 或 Grok Bot 后即可发现并探索精选 AI 论文,索引涵盖其近两年在 X 上推荐的全部论文。功能包括查找与总结论文、探索 harness engineering 合集、检索 SOTA 结果、生成文献综述与调查、构建个人收藏及可视化论文。官方表示未来几周还将发布多项 benchmark,并持续更新。
NVIDIA 发布论文 VERA,将基准轨迹转化为超过 9000 个可重启沙箱并配合 rubric 评分,只保留能运行且可依据可观察证据打分的环境。系统同时更新模型权重和 harness,harness 改动需通过自测并在开发集上至少提升 5 分才被保留,模型 checkpoint 若分数下降超过 20% 则被拒绝。
Dair.ai 创始人 Elvis 用 AI 员工 Viktor 自动排查 agent harness 的夜间评测结果:23 个昨天通过、今天失败的任务会被逐一检查日志、追溯到引发失败的改动并建议回滚。Viktor 在 Slack 中运行,还会主动标记问题,目前可免费试用并赠送 $100 额度、无需信用卡。
个人智能体之上的 Agent 间通信让 Opus 5.5 的协调能力被低估,但仍需在 automations、webhooks、系统提示词和工具调用上调优,并在合适时机检索上下文。
NVIDIA 一篇被 NeurIPS 2026 接收的论文发现,给多模态模型接入工具后,其拒绝有害请求的失败率相对上升最高达 68.7%,平均上升 17.7%。
Cogent 发布 Cogent Attack Path Analysis,用其自研网络安全模型找出 AI 智能体集群可能利用的更长入侵路径,并指出能一次性封堵每条路径的单个修复点。
DAIR.AI 发布 MCP 工具,将其 AI 论文索引接入 Codex、Claude、Grok Bot,用于发现和梳理热门论文。该索引收录了 elvis 近两年在 X 上推荐的论文,支持查找与总结论文、生成文献综述、可视化论文等功能。官方称未来几周还将发布多个配套 benchmark。
NaturaAI 推出名为 Interface 的戒指硬件,售价 99 美元,明年 1 月发货,用户按住说话、松开即可把请求发给 Claude Code、Codex、Hermes 等所连接的智能体。该产品被定位为智能体时代的首要硬件,主张更简单的接口才是趋势,因为如今智能体已足够好用,慢的一步反而是把任务交给它们,而掏出手机打字会打断专注。
马斯克宣布 Grok Bot 今后将针对不同任务调用最佳后端模型,包括 Claude Opus 5.5、MidJourney、Suno 及其他领先 API,以求得最优结果。他称 SpaceX 也将采用同样策略。此举疑似为即将推出的大一统订阅服务做准备。
Claude 发布实时数据看板 Dashboards 和代码驱动动态解说工具 Claude Motion。Dashboards 可直接接入企业数仓或 CRM,用自然语言提问生成联动的业务看板,并随底层数据变动自动刷新;Motion 则把报告、图表或产品演示转成短动画并导出 MP4,由 Claude 用代码为文字、图表、形状和图片编排动画,文字、数字与节奏均可编辑。
OpenAI 10 月 7 日起向 ChatGPT Plus、Pro、Business 和 Enterprise 用户推送 GPT-6,新增可组合图形、按钮、表单的「Intelligent UI」,内部评测中 GPT-6 Instant 比 GPT-5.6 Instant 提前 44% 开始回答需联网搜索的问题。
微软在特别发布会上推出 Surface Laptop Ultra,搭载 NVIDIA RTX Spark Superchip,最高 128GB 统一内存,可在本地运行超 1200 亿参数模型,起售价 2599 美元,10 月 7 日开放预订、10 月 16 日供货。
梳理微软从硬件到 MXC 容器、混合智能调度的整条设备链路,可对照两年前 Copilot+ PC 的定位变化。
向阳乔木(@vista8)开发了一款名为 qiaomu-ui-learn 的 Obsidian 插件,专门用于学习提升 Vibe Coding 审美。该插件支持一键复制 Prompt 生成类似网站,可学习网页和手机组件让 Vibe Coding 描述更精准,并内置测试题,在 Obsidian 官方插件库搜“qiaomu”即可安装。
yetone 的 magpie 是一套 AI Agent 基建,支持各种模型配置和 OAuth 登录,开发 AI 工具时可把仓库发给 Agent 学习参考。其平台图标采用 lobehub 整理的 icon,添加服务商的操作也更直观。仓库地址为 github.com/yetone/magpie。
Grok bot 现已支持搜索、阅读和监控 X。Personal Agent 竞争日益激烈,Grok bot 的用户价值正快速提升。
乔木剪藏提供一段可直接复制给 AI Agent 的 prompt,让它读懂 README.md 与 native/README.md 后按系统与浏览器完成安装。
OpenAI 宣布 GPT-6 新增 Intelligent UI 能力,可根据用户问题自行组合文字、视觉内容和交互元素来生成回复。回复中可包含用于解释概念的图形与图表,以及按钮、表单等可直接在对话中使用的交互体验。
美团 LongCat 团队构建 MineExplorer,首个在开放世界中做到分钟级长程任务的评测基准,包含 813 个人工验证实例(1-hop 到 4-hop),每个任务实例运行 1800 个环境步、对应 3 分钟连续交互。
美团 LongCat 团队开源 LoHoSearch,一个基于覆盖 762 万维基百科实体知识图谱自动生成题目的搜索智能体评测基准,含 544 道经人工核验题目、覆盖 11 个领域。
美团正式发布全场景 AI Agent 平台 CatPaw,搭载本月开源的 LongCat 2.0(总参数 1.6T,原生支持 1M 超长上下文),提供 AI 智能工作台与企业级 Agent 开发托管能力。
美团图灵Agent评测团队公开内部博客,系统讲解Agent评测:评测需覆盖结果层、过程层、效率层、风险层四层,主张"观测+评测=持续迭代",并将模糊指标下钻为二元化Rubric以实现人人一致与人机一致,如Beam人机一致率从62%提升到92%。
美团技术团队在 KDD 2026 分享 8 篇收录论文,覆盖推荐大模型 MTFM、奖励建模框架 CDRRM、智能体搜索基准 LocalSearchBench、ETA 元泛化框架 UME 及生成式推荐训练系统 MTGenRec 等方向。大众点评技术部还在 2026 KDD Cup 复杂数据分析 Data Agents 赛道夺得冠军与季军,相关代码已在 GitHub 开源。
Cloudflare 将前沿 AI 模型放入受控测试框架中探测其 WAF,以已拦截的攻击载荷为起点让模型生成并迭代新变体,在 45 个场景中产生 1,107 次尝试,经人工筛查后留下 49 项发现。
Hannah Foxwell 在演讲中指出,Cursor 中智能体请求数已超过 tab 补全接受量,智能体驱动的开发成为主流工作方式。她认为开发团队需围绕三个不变锚点重塑:构建有价值的东西、速度需要安全、人很重要。多数组织尚未准备好让智能体团队向生产环境交付,但应尽早尝试。
InfoQ 将于 10 月 14 日举办免费 60 分钟线上研讨会"AI in Production: What Breaks, What Works, and Who Approves It?
Claude Haiku 5.5 现可在 Arena 的 Battle Mode 和 Agent Mode 中测试,入口为 arena.ai。该消息由 LMArena 发布,未披露模型参数、上下文长度或跑分数据。
Anthropic 发布 Claude Haiku 5.5,官方称这是其推出的最便宜、最快、能力最强的小模型,平均运行成本比 Claude Haiku 4.5 低约 75%。该模型现已加入 Agent Arena,可在其中使用网页搜索、文件系统和终端工具完成长流程智能体任务,成绩尚未公布;同时也在 Code Arena 的 WebDev、Text、Document 和 Vision 板块上线。