跳到正文

#Agent

今日 160 条
9月14日周一
  1. 乱翻书AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    逛完外滩大会,蚂蚁在 AI 时代找到了什么新位置?

    蚂蚁在外滩大会上的 AI 布局被拆成应用、基建与公司架构三层来看:应用侧是个人 Agent「阿宝」与健康 Agent「阿福」,基建侧是支付宝的支付生态与「碰一下」三千万个触点,公司侧则是四家子公司密集融资、被拆成四个可单独定价的资产。嘉宾认为蚂蚁的幸运是赶上 AI,不幸是 AI 变得太快,其定位是应用与基础设施各一只翅膀,中间由模型、数据库和技术后台支撑。

  2. LangChain BlogAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 为 Managed Deep Agents 推出 Connections:托管凭证与按调用者身份

    LangChain 为 Managed Deep Agents 推出 Connections,把 API 凭证改为 LangSmith 工作区中按 slug 命名的连接,工具在运行时通过 connections.get() 读取。

  3. LangChain BlogAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 如何构建 GTM Agent:线索转化率提升 250%

    LangChain 基于 Deep Agents 构建了 GTM Agent,在 Salesforce 新线索触发后自动判断是否触达、汇集 Gong 通话记录与 LinkedIn 等上下文,并把带推理依据和来源的草稿发到 Slack 供销售审核。

  4. LangChain BlogAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Credit Genie 如何用 LangChain OpenWiki 保持代码库文档常新

    Credit Genie 采用 LangChain 开源仓库文档智能体 OpenWiki,自动生成并维护代码库文档,替代此前容易过期的 Notion 页面、README 和 AGENTS.md。

  5. Satya Nadella(@satyanadella)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Satya Nadella 转发演示:Microsoft Foundry 如何让长时间运行的智能体满足企业级要求

    Microsoft Foundry 被指为最适合在企业中运行智能体的平台,可让长时间运行的 agent 推理、行动并调用工具。其可观测性与治理能力覆盖多智能体、多模型工作流,从可访问范围、数据流向、行为可重建到成本预算控制均有对应答案,并将安全防护、可审计和 FinOps 从系统搭建之初就纳入。

  6. 强少来了AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI产品经理的PRD怎么写|有意思小周刊vol.171

    「有意思小周刊」vol.171 汇总了 AI 产品经理 PRD 撰写方法:AI 产品面向概率性系统,不能沿用确定性功能的传统 PRD 思路,完整骨架含十个部分,其中场景定义与输入输出、能力与功能描述、效果要求、异常与降级设计、评测方案五块应占全文一半以上篇幅。

  7. Sahil Lavingia(@shl)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sahil Lavingia 将《The Minimalist Entrepreneur》做成 9 个 Claude Code 技能

    Sahil Lavingia 把自己所著《The Minimalist Entrepreneur》转化为 9 个 Claude Code 技能,并称这是他 star 数最多的 GitHub 仓库,已超过 10,000 stars。

  8. Browser Use(@browser_use)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Browser Use 科普:什么是无头浏览器?

    Browser Use 发布文章解释"什么是无头浏览器",由 Gregor Zunic 撰写。无头浏览器指没有图形界面、由程序控制的浏览器,是 AI 智能体操作网页的常见运行方式。

  9. Firecrawl(@firecrawl_dev)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Firecrawl 为 Grok Build 插件加入开发者索引,可搜索 7000 万+ 一手来源

    Firecrawl 将 Developer Index 接入 Grok Build 插件,Grok 在写代码时可检索覆盖代码仓库、文档和 issue 的 7000 万+ 一手来源,用于核对 API 并查找修复方案。用户运行 /plugin 安装 Firecrawl 即可试用。

  10. 十字路口CrossingAI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    具身智能走到十字路口:对谈苏度、蚂蚁灵波、自变量、破壳的四种一线判断

    GPT-6 Astra 是否会降维打击具身行业,成为这场圆桌讨论的核心问题之一。苏度科技韩铮、蚂蚁灵波沈宇军、自变量王潜、破壳机器人许华哲四位一线从业者,围绕数据来源(仿真与真机、Real-to-Sim)、模型路线、商业化落地指标(高成功率、客户持续付钱)以及被高估与低估的领域展开分歧讨论。

9月13日周日
  1. Browser Use(@browser_use)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Browser Use 推出 Agency:让智能体主动提议任务,用户批准或跳过

    Browser Use 推出 Agency,把交互反过来:不再由用户写提示词,而是智能体主动提议它认为有用的工作,用户选择批准或跳过。按官方描述,它会读取用户生活全貌上下文、发现被遗忘的事项、在用户看到问题前修好,并声称可减少打开 Gmail、Chrome 或 Slack。

  2. Naval(@naval)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Naval:强化责任追究或有助于 AI 监管,智能体失控、模型被越狱、托管防护薄弱的开源模型都要担责

    Naval 认为强化责任追究对 AI 讨论有帮助:智能体集群失控、防护薄弱的模型被越狱、以及托管防护薄弱的开源模型,责任都由发布方承担。

  3. Simon Willison(@simonw)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison 逆向工程 ChatGPT 并用 visualize 技能绘制运行地图

    Simon Willison 借机对 ChatGPT 本身做了一次逆向工程,生成的运行地图通过 ChatGPT 的 "visualize" 技能以 HTML 片段呈现,并用 D3 绘制地图与叠加路线。该可视化托管在 simonw.chatgpt.site 的 skills 路径下。

  4. Thomas Wolf(@Thom_Wolf)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thomas Wolf 关注到一款端侧本地 AI 智能体系统,运行 4-bit 量化的开源 4B 模型(MLX)

    Thomas Wolf 分享了一款新的端侧本地 AI 智能体系统,运行一个量化到 4 bit 的开源 4B 模型(MLX)。该系统的作者 Sigil Wen 称其为"on-device AI OS"Underdog,完全本地运行,起因是他对云端数据被用于训练、邮件和 iMessage 被采集以及 AI 攻击能力的担忧。

  5. Latent.Space(@latentspacepod)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vinoo Ganesh 谈 Palantir Forward Deployed Engineer 的最佳实践

    在联合创立 Kepler AI 之前,Vinoo Ganesh 在 Palantir 领导 Spark 团队并打造了 Project Frontline——一个面向 Forward Deployed Engineer(FDE)的开创性项目。他在访谈中分享了 FDE 的最佳实践。

9月12日周六
  1. Paul Couvert(@itsPaulAi)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta 的 Muse 被称为目前最佳智能体实现

    Meta 的 Muse 被评价为目前最佳的智能体实现,特点是操作极其简单、直观且功能强大,并且免费。该内容来自 Paul Couvert 的推文,未披露具体模型参数或评测数据。

  2. 浮之静AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    pnpm 12.4:统一多语言开发工作流

    pnpm 12.4 将 npm、Python 和 Cargo 依赖安装收进同一套工作区配置,一条 pnpm install 即可处理三个生态的依赖,新增的 pipeline 负责安装后的构建与验证编排。

  3. 阿里云开发者AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    云栖大会千问AI平台分论坛:重磅产品首发与 Qwen 共创计划发布

    云栖大会千问AI平台分论坛将于 9 月 23 日 9:50—12:00 在杭州国际博览中心一期 3F 308 举行,千问AI平台最新产品能力首次集中公开,Qwen 共创计划同步发布并开放报名。

  4. Greg Brockman(@gdb)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT Sites 上线三个月创建超 500 万个站点,并推出协作与私有分享等更新

    Greg Brockman 表示 ChatGPT Sites 上线三个月以来,用户已创建超过 500 万个站点。此次更新支持邀请队友共同编辑、保存和发布站点,也支持将站点以私有方式分享给指定人员;同时将提示词到部署的时间缩短一半,可让 ChatGPT 检查站点数据库,并支持添加自定义域名。

  5. Simon Willison(@simonw)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison:另一批 OpenAI 智能体集群 5 月曾攻击 RubyGems

    Simon Willison 称,另一批 OpenAI 智能体集群早在 5 月就在 RubyGems 上进行垃圾信息和漏洞利用,时间距离此前曝光的 Wiki 攻击仅数天。他附上了自己博客的相关链接 simonwillison.net/2026/Sep/12/op。

  6. Browser Use(@browser_use)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Browser Use 发布 browser-use.com 网站

    Browser Use 上线 browser-use.com 网站,并通过其官方 X 账号发布了该网址链接。原文未提供更多关于网站功能、模型或版本的信息。

  7. Browser Use(@browser_use)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Browser Use Cloud 云智能体免登录保持认证:同步本地 Chrome cookie,智能体看不到密码

    Browser Use Cloud 支持云智能体在不登录的情况下保持认证状态:先在本地 Chrome 登录,再把本地 cookies 同步到云端,智能体全程看不到用户密码,用户也保持登录。该功能已在 Browser Use Cloud 上线。

  8. Augment Code(@augmentcode)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Augment 联创 Igor Ostrovsky:修 bug 智能体为何烧不掉团队积压

    Augment CTO 兼联合创始人 Igor Ostrovsky 指出,软件工厂能高效清空 issue 积压,关键却不在修复代码本身,修复实现是修 bug 中最不重要的环节。他认为单靠一个修 bug 智能体难以真正烧掉团队的 bug 积压。

  9. Dify(@dify_ai)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Dify 发起 #DifyNewAgent 征集:晒出你构建的 AI 智能体

    Dify 发起 #DifyNewAgent 征集活动,邀请开发者展示自己构建的 AI 智能体,形式可以是快速演示、截图或几行文字说明。作品不限于独立 Agent,也可以是 Workflow 的一部分。Dify 将联系其最喜欢的作品,协助打包上架 Marketplace,并分享给 10 万+ 构建者。

  10. Augment Code(@augmentcode)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Augment Code 发布 cosmos.augmentcode.com 入口

    Augment Code 上线 cosmos.augmentcode.com,作为其对外入口,推文附带的链接直接指向该站点,互动数据为 0 转发、0 回复、0 点赞、486 次浏览。原文未披露该站点的具体功能、模型版本或可用范围。

  11. Augment Code(@augmentcode)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Augment Code 的 Cosmos:两步一提示词搭建软件工厂

    Augment Code 的 Cosmos 用两块屏幕和一个提示词就能搭起"软件工厂":连接代码仓库、创建环境、描述你想要的工厂。Advisor 会挑专家、写配置、自动应用,遇到需要决策时再询问你。

  12. ChatGPT(@ChatGPTapp)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT Sites 上线三个月建站超 500 万个,新增协作与自定义域名

    ChatGPT 官方回顾 ChatGPT Sites 上线三个月,称用户已创建超过 500 万个站点。此次更新包括邀请队友共同编辑、保存和发布共享站点,邀请特定人员访问非公开站点,部署耗时缩短一半,让 ChatGPT 检查站点数据库,以及支持添加自定义域名。

  13. Windsurf(@windsurf_ai)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Devin Desktop 与 CLI 推出 Fusion,编码基准成本最高降低 39%

    Cognition 在 Devin CLI 与 Devin Desktop 中推出 Fusion,官方称其为面向 Fable 与 Astra 的最高效 frontier harness,在各项编码基准上成本最高降低 39%。

9月11日周五
  1. Milvus(@milvusio)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    IBM Research 发现智能体记忆并非越多越好,MemSearch 给出选择性检索方案

    IBM Research 在八款模型上发现,智能体记忆的合适"剂量"随模型能力变化:能力强的模型能从完整指南集中获益,较弱模型更适合精简核心加任务相关检索,已饱和的模型则无明显提升。

  2. DeepLearning.AI(@DeepLearningAI)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 时代工程师技能变革:GPT-6 Astra、Claude Fable 5.1 等本周要点

    OpenAI 发布 GPT-6 Astra,支持 1M+ 输入 token 和 5 档推理级别;Anthropic 更新 Claude Fable 5.1,在 Artificial Analysis Intelligence Index v4.3 上并列最高分,放宽网络安全任务限制并减少冗余输出。

  3. Philipp Schmid(@_philschmid)AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 让 100 个 Gemini 智能体解 71 道数学定理,暴露评测漏洞下的作弊分化

    Google DeepMind 研究者把 100 个 Gemini 智能体放进同一个共享仓库求解 71 道数学定理。

  4. AWS Architecture BlogAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Amazon Bedrock AgentCore 把零样本预测变成采购订单

    AWS 展示了一套库存自动化架构:用零样本时序基础模型 Amazon Chronos2 做概率需求预测,再由 Strands Agents SDK 构建的 Supervisor、Preprocessing、Forecasting、Reporting 四个 LLM 智能体在 Amazon Bedrock AgentCore 上编排确定性工具,把预测转成可审计的采购订单。

  5. 京东技术AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    京东零售产品经理实战:PRD 四步法与 Skill 沉淀,34 人日压缩到 15 人日

    京东零售产品经理用 PRD 四步法加 Skill 沉淀,把一批覆盖接需求、沟通、交互、文档与评审的需求从 34 个人日压缩到 15 个人日,并通过评审且质量未打折。方法分三层:Prompt 到 Context 再到 Harness,人负责判断与复核,AI 负责初稿、追问与遗漏检查。核心场景是需求文档撰写与交互设计,可复用经验沉淀为 Skill。

  6. 大淘宝技术AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    让 Agent 像人一样记忆:本地长期记忆系统 HL-Mem v1.1 的设计与取舍

    大淘宝技术直播技术团队开源了本地长期记忆系统 HL-Mem(Apache-2.0),对应 v1.1 系列,采用事实与经验双通道架构,用不可变 Event 加可更新 Claim 实现证据可追溯、有效时间与记录时间双时间可解释,以及记忆的修正与遗忘。系统默认仅依赖 SQLite 单文件部署,配后台异步 Worker 处理去重、冲突消解与生命周期管理,运行时独立、本地优先,并支持中文检索。

  7. Binyuan Hui(@huybery)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ApprenticeBench 发布:Fable 5.1 与 GPT-6 Astra 可在真实岗位上持续学习并超越人类专业者

    NeoCognition 推出 ApprenticeBench,用于评测 AI 在真实工作中的电脑操作与持续学习能力。Fable 5.1 和 GPT-6 Astra 在该基准上能一边工作一边持续学习,并超越人类专业者,无需 FDE 介入,智能体可自行部署到岗位中。

  8. Amjad Masad(@amasad)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit 上涌现大量 Astra 3D 实验作品

    Replit 上出现了一批用 Astra 制作的 3D 实验作品,用户 sarah li 分享了自己在长周末用 Astra 搭建的可探索 3D 童年卧室。Amjad Masad 转发了这些创作并表示很喜欢。

  9. 阿里云开发者AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里云 Token Plan 个人版升级:新增 12 类 Agent Harness 工具,加量不加价

    阿里云于 9 月 11 日升级 Token Plan 个人版,原有价格及 Credit 额度不变,Standard 和 Pro 套餐新增 Agent Harness 工具权益与用量,覆盖搜索、网页解析、图像生成、语音处理、代码执行等 12 项能力,均通过 MCP 标准协议开放,可直接接入自有 Agent 应用。

  10. Junyang Lin(@JustinLin610)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    模型架构过度复杂会带来 eval 无法测出的未知问题

    模型架构引入过多复杂性会带来连内部 eval 都无法测试的未知问题。但作者认为,随着基础模型越来越聚焦所谓 agentic 任务,有时可以为效率上的大幅收益接受这些小的未知成本。

  11. Browser Use(@browser_use)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Browser Use 云平台上线 DeepSeek V4.1 Flash:性能达 GPT 5.6 Sol xhigh 的 97%,成本低 30 倍

    Browser Use 云平台现可运行 DeepSeek V4.1 Flash,其性能达 GPT 5.6 Sol xhigh 的 97%、Claude Opus 5 的 95%,智能体成本低 30 倍。新用户可用 15 美元免费额度运行 100 个复杂网页智能体任务。

  12. Greg Brockman(@gdb)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 推出 ChatGPT for Financial Services

    OpenAI 发布 ChatGPT for Financial Services,这是一套定制的 ChatGPT Work 体验,将内置金融数据与 GPT-6 Astra 的推理能力结合。团队可用于开展研究、构建金融模型并制作定制化客户材料。