跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 21–40 条 · 共 86 条
10月8日周四
  1. Greg Brockman(@gdb)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 在 ChatGPT 推出 Intelligent UI,结合 GPT-6 提供交互式回答

    OpenAI 在 ChatGPT 中推出新能力 Intelligent UI,结合 GPT-6 现已向所有用户逐步上线。该能力用完全交互式的用户界面快速作答,让日常问题更直观、复杂话题更易理解,并可即时调用交互式工具。

    为什么值得看

    OpenAI 在 ChatGPT 中上线 Intelligent UI,读者可了解它与 GPT-6 结合后的交互形态变化。

10月7日周三
  1. 新智元AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 发布 1 万亿参数 Mistral Large 4,权重月底开源

    Mistral 发布新旗舰 Mistral Large 4,总参数 1 万亿,采用混合专家架构,每个 token 激活 490 亿参数,权重将于月底全部开源。

    为什么值得看

    通过第三方智能指数与多项细分基准的横向对比,读者可以看到开源万亿参数模型与闭源旗舰之间的实际差距。

  2. AI寒武纪AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 推出扩展版网络验证计划,向认证用户开放 Claude 攻防能力

    Anthropic 正式推出扩展版网络验证计划,将 Claude Opus 5.5、Claude Sonnet 5.5 和 Claude Mythos 5.1 的网络安全攻防能力按防御、红队、特种三档权限开放给经过认证的机构。

    为什么值得看

    Anthropic 把网络安全能力按防御、红队、特种三档分级开放,并给出封锁解除前后的实测对比数据。

10月3日周六
  1. DatawhaleAI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta 开源 Muse Gadgets,为 Muse 助手增加硬件接口

    Meta 开源 Muse Gadgets,让开发者把个人 AI 助手 Muse 接入树莓派、带屏开发板等设备,做成自定义 AI 小设备。项目包含面向微控制器的 ESP32 固件、面向单板计算机的 Linux SDK,以及通过 USB-C 供电、可连接电视音响等智能家居设备的官方配件 Muse Home Link,代码在 GitHub 以 Apache 2.0 协议开源。

    为什么值得看

    Meta 把 Muse 助手的能力开放到树莓派、ESP32 等现成硬件上,可据此判断 AI 助手的硬件落地路径。

  2. AI前线AI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 Decisions API 15 天后,Jev 被质疑没有护城河

    OpenAI 在 DevDay 上发布 Decisions API,基于当前体量最小、价格最低的 GPT-6 Luna,让模型在一组预设答案中作出选择并返回置信度分数,官方给出的延迟为 150 毫秒,而直接用 GPT-6 Luna 完成同类任务需 1.6 秒。

    为什么值得看

    围绕OpenAI新API与Jev的能力重合度,梳理了双方产品形态与护城河所在,可帮助读者判断这一赛道的竞争格局。

10月1日周四
  1. 谷歌开发者AI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 推出前沿 AI 模型 Gemini 4 Argon,主打复杂长流程任务中的深度推理,目前通过 Fairwind 计划向网络安全专家开放试用。

    为什么值得看

    官方披露了 Gemini 4 Argon 在软件工程、安全防御等长流程任务中的能力和定价,可据此判断前沿模型在企业工作流中的落地进展。

  2. AI寒武纪AI 评估 · 87/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    谷歌发布 Gemini 4 Argon:单次输出上限提至100万Token

    谷歌发布 Gemini 4 Argon,单次输出 Token 上限从 64K 提升至 100 万,面向软件工程、法律金融等企业级知识工作及网络安全防御场景。

    为什么值得看

    谷歌新一代模型把单次输出上限提升至100万Token,并给出内部代码迁移与定价细节,可据此判断长程任务的成本与落地边界。

  3. Google DeepMind BlogAI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,通过 Fairwind Program 先向受信任的网络安全防御方开放,后续将逐步提供给开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入按输入价 95% 折扣计费。

    为什么值得看

    原文给出了输出上限、基准成绩与定价,读者可以据此判断它在长程工程与网络安全任务上的定位。

9月30日周三
  1. 有新NewinAI 评估 · 91/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 2026 开发者大会:个人 Agent Dots、GPT-6.1 Sol 等 20 多项更新登场

    OpenAI 在旧金山举行 DevDay 2026,一次性更新 20 多项产品和能力,核心是长期在线、拥有独立云端电脑的个人 Agent Dots,由 GPT-6 Astra 驱动,可连接超过 4000 款应用并进入 Slack、Teams 等工作流。

    为什么值得看

    这场发布会把长期在线 Agent、共享工作区与云端 Codex 串成一套工作流,可据此判断开发与协作方式的变化。

  2. AI寒武纪AI 评估 · 81/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI DevDay 2026发布dots智能体、GPT-6.1 Sol与500美元Pro订阅

    OpenAI在DevDay 2026上发布20多项更新,推出可全天候自主接管工作的智能体dots,由旗舰模型GPT-6 Astra驱动,每个dot拥有独立云端计算机并连接用户授权应用,目前仅面向Pro、Business Premium和Enterprise用户开放。

    为什么值得看

    梳理了DevDay 2026二十多项更新,从主动智能体到订阅与市场,呈现OpenAI从模型到办公生态的完整布局。

  3. 赛博禅心AI 评估 · 92/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 年度 DevDay 实录:25 项发布逐一详解

    OpenAI 在旧金山举办第四届 DevDay,发布 Dots 与 ChatGPT Space 两款新产品:Dots 是一直在线的个人 agent,今天起向 Pro、Business Premium 开放,Specialist dots 面向企业预览并可接入微软 Agent 365。

    为什么值得看

    按主题逐条梳理了OpenAI DevDay的25项发布,读者可据此判断其产品矩阵与开发者平台的整体走向。

9月29日周二
  1. DatawhaleAI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek Harness 桌面版发布,同步更新 v0.2 预览版

    DeepSeek Harness 桌面版正式发布,macOS 和 Windows 安装包同步上线,并伴随 DeepSeek Harness v0.2 预览版更新。

    为什么值得看

    材料完整列出桌面版、v0.2 预览版的插件管理与创造模式等变化,可据此判断其工作流整合程度。

  2. AI前线AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Manus 2.0 发布并推出个人智能体应用 Cue

    Manus 团队 9 月 28 日将产品更新到 2.0 版本,重做智能体执行框架并推出 Cascade、可长期运行的云电脑与事件触发的 Automations,同时把桌面应用升级为覆盖文档、视频和游戏制作的 Manus Studio。

    为什么值得看

    梳理 Manus 2.0 与 Cue 的功能拆解与授权边界问题,可对照 Meta Muse 观察个人智能体的两条产品路线。

  3. 夕小瑶科技说AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Sonnet 5.5,编程能力逼近 Opus 5.5

    Anthropic 发布 Claude Sonnet 5.5,距 Opus 5.5 发布不到一周。在 Terminal-Bench 4.0 编程评测中,Sonnet 5.5 的 Max 档从上一代 Sonnet 5 的 10.3% 提升到 70.6%。

    为什么值得看

    梳理了 Sonnet 5.5 在编程与知识工作评测上的具体提升幅度、推理档位差异和官方迁移建议,便于对照选型。

9月24日周四
  1. OpenAI(@OpenAI)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 为 ChatGPT Voice 加入插件支持与 ChatGPT Work

    OpenAI 宣布 ChatGPT Voice 现在可以使用邮箱、日历和 Slack 等插件,并由 GPT-6 Astra、Sol 和 Luna 驱动。该功能可在 Web 和移动端的 ChatGPT Work 中使用,用户通过语音创建文档、演示文稿、网站和表格,或在浏览器中处理复杂任务,即日起随最新版应用全球推送。

    为什么值得看

    ChatGPT Voice 接入邮箱、日历和 Slack 等插件,并进入 ChatGPT Work,可据此判断语音交互的适用边界。

9月23日周三
  1. Aravind Srinivas(@AravSrinivas)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米发布 MiMo-V2.6 Pro 与 Flash 全模态开源模型

    小米发布 MiMo-V2.6,包含 Pro 和 Flash 两个全模态模型,通过规模化强化学习推进,并可开放获取模型权重、技术报告、强化学习环境与训练代码。Pro 在多数智能体基准上与 Claude Opus 5 和 GPT-5.6 Sol 表现相当,在 Artificial Analysis 智能指数上得分 46,为开源模型中最高,同时在编码、电脑操作、3D 推理和创作能力上更强。

    为什么值得看

    小米发布 MiMo-V2.6 双版本开源权重模型,并给出与闭源前沿模型在智能体基准上的对照成绩。

  2. 夕小瑶科技说AI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测小米 MiMo-V2.6:Pro 版 AA 智能指数 46 分,跑一道题 0.13 美元

    小米正式推出 MiMo-V2.6-Flash、MiMo-V2.6-Pro 及 Pro 的 UltraSpeed 版本;Pro 在 Artificial Analysis 智能指数拿 46 分,超过 Kimi K3 和 Qwen3.8 Max。

    为什么值得看

    作者用编程、设计、视频三类实测展示 MiMo-V2.6 的实际交付能力,并给出与同级模型的价格对比。

  3. 机器之心SOTA模型AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Opus 5.5,OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna

    Anthropic 发布 Claude Opus 5.5,重点提升代码库级迁移、调试、审查和长时间自主任务能力,API 输入输出每百万 token 分别为 4 美元和 20 美元,官方称典型任务整体运行成本较 Opus 5 降低约 40%、输出速度提高超过 30%。

    为什么值得看

    同一天多款编程与办公模型集中更新,并给出具体价格与运行成本变化,便于横向比较

  4. 花叔AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Opus 5.5,OpenAI 随后推出 GPT-6 Sol 与 GPT-6 Luna

    Anthropic 更新 Opus 5.5,每百万 token 输入 4 美元、输出 20 美元,比 Opus 5 降 20%,缓存读取从 0.5 美元降到 0.2 美元,已在 Claude Code 2.1.280 中设为默认 Opus 模型,支持 1M 上下文。

    为什么值得看

    作者用11道题横测Opus 5.5、Opus 5与Fable 5.1,给出真实账单与失败案例,可据此判断默认档位的取舍。

  5. 数字生命卡兹克AI 评估 · 87/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5、GPT-6 Sol 与 Luna 同日发布

    Anthropic 发布 Claude Opus 5.5,OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,两款 GPT-6 新模型已上线 Codex,但尚未在 ChatGPT 聊天中提供。

    为什么值得看

    同一晚两家旗舰同代下放,对比价格、终端任务分数与实测体验,可看前沿能力下放的性价比取舍。