跳到正文

#Agent

今日 165 条
10月9日周五
  1. 歸藏(guizang.ai)(@op7418)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok Bot 定时任务自动生成 AI 早报视频,全程跑在云端虚拟机

    歸藏用 Grok Bot 设置定时任务,每天早上自动产出一条 AI 早报视频,内容收集、写代码和视频渲染全部在 Grok 的云端虚拟机上完成,未使用本地电脑。他公开了自己使用的提示词,复制后其他 Grok bot 也能执行同样的任务。

  2. 投资融资AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    港大教授孔令鹏创立的 DiffuSpace 完成 dLLM 领域全球最大融资

    港大教授孔令鹏创立的扩散语言模型公司 DiffuSpace 完成 dLLM 方向全球最大规模融资,高鹄资本担任交易方。其开源模型 Dream 7B 在 Hugging Face 累计下载量超过 250 万,今年内计划发布参数规模更大的新模型,并针对性适配代码 Agent 与智能推理等任务。

  3. Geek(@geekbb)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GhosttyEXTREME:为 Ghostty 1.3.1 加上 AI 编码代理实时状态可视化

    GhosttyEXTREME 是 Ghostty 1.3.1 的 macOS 分支,用于在同时运行 Claude Code、Codex 等多个 AI 编码代理时,通过侧边栏、跟随编辑的代码编辑器和代码地图把代理过程可视化。它还提供权限应答、回合撤销和变更审查功能。

  4. Jerry Liu(@jerryjliu0)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Agent Economy Gala 门票售罄:400 位嘉宾齐聚 a16z TECH WEEK

    Agent Economy Gala 在 a16z TECH WEEK 期间满员 400 人,其中 203 位创始人累计融资超 $1B,295 位嘉宾正在构建智能体应用或基础设施。

  5. elvis(@omarsar0)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HERMES harness 让 GPT-5.6 Sol 仓库迁移成功率从 6.5% 升至 31.0%

    一篇论文提出 HERMES harness,在同一模型与相同 effort 设置下把 GPT-5.6 Sol 的整仓库迁移成功率从 6.5% 提升到 31.0%,提升来自 harness 本身。

  6. DeepTech深科技AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Aether AI 发布因果智能机器人系统 CRIS-0,把任务状态带进连续行动

    Aether AI 展示因果驱动的机器人智能系统 CRIS-0,以任务状态为共同依据协调因果世界模型、动作策略和验证工具,让机器人在环境变化后判断动作继续、重试或回退。演示覆盖抗干扰、长程任务和个性化交互三个维度,测试中系统平均 2 秒内识别环境变化并重新规划,10 次干扰完成 9 次有效恢复,微波炉场景下 0.2s 内停止动作。

  7. 创业邦AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Manus 完成超 5 亿美元新融资,OpenAI 上线 GPT-6,腾讯 WorkBuddy 推出独立文件浏览器丨邦早报

    Manus 母公司蝴蝶效应完成超 5 亿美元新一轮融资,由博裕投资、IDG 资本领投,腾讯、红杉中国、真格基金继续加持。OpenAI 宣布面向全球所有 ChatGPT 用户上线 GPT-6,并聘请 SpaceX AI 高管出任欧洲、中东和非洲地区销售副总裁。腾讯 WorkBuddy 上线“独立文件浏览器”,生数科技发布 Vidu Q4 Preview,视频生成单价 0.09 元每秒起。

  8. DeepLearning.AI(@DeepLearningAI)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepLearning.AI 介绍智能体研究模型 AREX:逐条核验答案并补齐研究空白

    DeepLearning.AI 介绍了一个名为 AREX 的智能体研究模型与 harness,它逐条核验答案,保留已核实内容,只针对空白部分继续研究。AREX 在 BrowseComp 上达到 82.5%,在 WideSearch-en 上为 82.0 F1,仅 harness 本身即可带来最高 10 分的提升。

  9. Latent Space [Youtube]AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 解雇三名安全研究员,GPT-6.1 Sol Ultrafast 与 Claude Haiku 5.5 同日登场

    OpenAI 解雇了 Tomek Korbak、Mikita Balesni 和 Jasmine Wang 三名安全研究员,三人发公开信称因"把安全置于公司短期利益之上"被辞退,OpenAI 称其不当处理机密信息。

  10. Mind the Future — Richard NgoAI 评估 · 14/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    社会理论与智能体基础:社会均衡如何扩展博弈论理性模型

    Richard Ngo 撰文梳理社会学与智能体基础研究的联系,重点讨论社会均衡、博弈论均衡、规范内化与集体行为三部分,主张将理性社会与政治行为理论作为 Von Neumann 和 Morgenstern 理性经济行为理论的扩展或替代。

  11. AK(@_akhaliq)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Agent Plasticity:通过经验衡量自我改进的论文发布

    一篇名为 Agent Plasticity 的论文发布,提出通过经验衡量 AI 智能体自我改进能力的方法。论文已在 HuggingFace 上线(编号 2610.08…),但摘要未披露具体模型、参数规模或 benchmark 分数。

  12. Google Developers BlogAI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Cloud 开源 AQuA:为生产环境 AI 智能体诊断质量回归

    Google Cloud 开源 AQuA(Ambient Quality Agent),一个与生产环境 AI 智能体并行运行的参考实现,可扫描并核验失败聚类、对照对话记录,并按实际部署的源码快照定位根因。它针对的是智能体上线后难以察觉的质量回归——这类问题往往仍返回 HTTP 200 OK。

  13. 技术前沿AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    个人 AI 智能体很能干,直到它在工作群里分享你的银行流水

    个人 AI 智能体有时会过度分享信息——比如把你的银行对账单发进工作聊天群,还会过度承诺、过度消费。

  14. AI Engineer(@aiDotEngineer)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AlixPartners 用 Claude Code 审查合同与支出数据,如何识别重复报销

    AlixPartners 的 Natalia Connolly 与 Kevin Madura 用 Claude Code 审查合同和支出数据,并探讨如何识别重复的节省主张。两人将在 10 月 14 日的 AI Engineer New York 上分享这一内容,门票见 ai.engineer/nyc。

  15. 硅谷101AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    模型越来越强,为什么用户没感觉?再访阿里国际站总裁张阔

    阿里国际站总裁张阔在播客中分享,团队从真实业务整理出107个任务,用于评测AI能否独立完成商家工作,结果最前沿模型在无人干预条件下的任务通过率约为61%。他指出,模型通用评测成绩已接近满分,但商家在报价比较、钓鱼邮件识别、订船期和交易纠纷处理等经营环节并未感受到同等幅度的提升。他同时谈到,最贵的模型不一定最好,多模型路由需要为不同任务匹配能力与成本。

  16. Paul Couvert(@itsPaulAi)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    开源桌面应用 Atomic Agent 将对话记忆压缩高达 80%,支持本地智能体

    Atomic Agent Desktop 发布,这是一款采用 MIT 开源协议、覆盖 macOS/Windows/Linux 的本地 AI 智能体桌面应用,可将对话占用内存压缩最高 80%。

  17. Rowan Cheung(@rowancheung)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GrokBot 新增原生 X 监控:4 个可复制的日常例程

    GrokBot 近期更新加入原生 X 监控能力,可自动执行搜索、筛选与推送。作者分享 4 个可直接复制的例程:每工作日 9:15 筛选 X 上真实 AI 工作流并剔除「10 prompts」类炒作帖,每工作日 9:00 抓取品牌提及并分类后在 Slack 提醒,以及每 4 小时捕捉正在评估其产品品类的用户帖子。

  18. The Keyword (blog.google)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 与 BIDMC 在《柳叶刀》发表 AMIE 临床研究

    Google 与 Beth Israel Deaconess Medical Center(BIDMC)团队在《柳叶刀》发表研究,在 BIDMC 门诊开展真实临床研究,98 名患者在紧急就诊前先与 Google 研究型诊断 AI 聊天机器人 AMIE 对话。

  19. Replit ⠕(@Replit)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit 对话内直接生成行动方案、演示文稿与研究简报

    Replit 支持在同一段对话中延续已完成的调研结果,直接基于分析结论继续操作。用户可下达“Draft an action plan”“Create a presentation”“Prepare a research brief”等指令,把已探索的发现作为下一步工作的起点。

  20. DatabricksAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lakebase 与 Agentic SDLC:为编码智能体打造可分支数据库

    Databricks 发文介绍 Lakebase 与 Agentic SDLC,提出用数据库分支支撑编码智能体工作流。其思路是让编码智能体像操作代码分支一样对数据库进行分支,从而在开发流程中隔离和并行推进变更。

  21. a16z(@a16z)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 引用 AWS CEO:智能体 token 消耗是人类的近 5 倍,半年增长 14 倍

    a16z 引用 AWS CEO Matt Garman 的观点指出,AI 智能体消耗的 token 几乎是人类的 5 倍,六个月内增长了 14 倍。Garman 表示 AWS 正在为智能体这类新“用户”改造云服务,包括三秒启动数据库、计算沙箱、网关,以及区分智能体与人类或服务角色的权限体系。他提到许多智能体只需创建数据库、完成少量工作后就让数据库销毁,因此并不需要五个九的持久性。

  22. eric zakariasson(@ericzakariasson)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok Bot 磁盘空间不足?Disk Saver 帮你清理释放空间

    针对 Grok Bot 电脑空间不足的情况,Disk Saver 机器人可通过提出清理建议帮助释放磁盘空间。该机器人由 xgo.ing 提供支持。

  23. LangChain(@LangChainAI)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 联合 AWS、NVIDIA 探讨生产级 Agent 基础设施

    LangChain 联合 AWS 和 NVIDIA 举办活动,探讨随着智能体工作负载增长、架构演进、基础设施需求日益复杂,全球团队如何应对生产级智能体系统背后的基础设施层。活动报名链接已开放。

  24. Notion(@NotionHQ)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Notion 如何为 Baseten 搭建会自我进化的答案工厂

    Baseten 用 Notion Agents 搭了一套自动问答系统:问题发进 Slack,答案自动回复;当系统不知道答案时,它会学习并更新所有来源,供下次使用。Baseten 一边帮 Notion 做模型训练与推理,一边用该知识库支撑内部 GTM 团队维护 wiki。

  25. Cursor(@cursor_ai)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 上线 /visualize:在聊天中直接生成图表与示意图

    Cursor 新增 /visualize 功能,可在聊天窗口内直接生成图表和示意图,用 /visualize 分析数据并就地查看结果。该功能已在 Agents Window 中开放使用。

  26. Stack Overflow BlogAI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何运维 LLM 系统:可观测性、成本、路由与底层平台

    Stack Overflow 博客给出 LLM 生产系统成熟度模型 Level 5 的运维规范,核心是一个模型流量收口、一个贯穿全链路的 decision_id,以及不让业务感知具体供应商。

  27. a16z(@a16z)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AWS CEO Matt Garman 谈为 AI 智能体重构云服务

    AWS CEO Matt Garman 表示正为 AI 智能体重构云服务,团队越来越需要"对智能体友好"而非仅面向人的云。AWS 已把数据库启动时间压缩到三秒,并新增计算沙箱、网关、智能体权限等全新构建模块。他指出许多智能体只需临时建库做少量工作,并不需要五个九的持久性。

  28. elvis(@omarsar0)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 提出 CI 程序修复智能体 FlowAgent,真实故障修复正确率 67.18%

    Google 提出 CI 内的程序修复智能体 FlowAgent,针对提交前测试失败运行 ReAct 式生成-验证循环,并在代码审查工具中展示修复建议,其前置与后置两道弃权过滤器会拦下薄弱建议。对 195 个真实故障的人工评审显示,67.18% 的修复正确。Google 全公司上线后,它在 295,508 次变更上给出建议,开发者预览 65,069 次、采纳 28,554 次。

  29. THE DECODERAI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 为 Claude 推出 Dashboards 与 Motion 两项 beta 功能

    Anthropic 为 Claude 上线两项 beta 功能:Dashboards 可连接 BigQuery、Databricks、Snowflake、Salesforce 等数据源。

  30. Notion(@NotionHQ)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Notion 推出数据智能体 Data Scout,可连接 Snowflake 并用自然语言查询数据

    Notion 内部最常用的智能体之一是 Data Scout,可连接 Snowflake 与 Notion、Slack 等数据源,让任何人用自然语言提问,并展示答案来源以便核实和深入分析。它还能被其他智能体调用以生成周期性报告,Notion 正帮助一小批客户构建自己的数据智能体。

  31. Harrison Chase(@hwchase17)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam 谈决策模型在 harness 中的定位,以及如何在 LangChain 中使用 Jev

    LangChain 的 Sam 在 First Pass 对话中讨论了决策模型在 harness 中的定位,以及如何在 LangChain 中使用 Jev。Jev 由 typesafeai 推出后迅速走红,随后 OpenAI 和 Databricks 分别发布了 Decisions API 和 ai_decide function 等相关产品。

  32. Claude(@claudeai)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Docs、Slides 和 Design 结束测试并对所有套餐开放

    Claude Docs、Slides 和 Design 即日起结束 beta 阶段,面向包括 Free 在内的所有套餐开放。团队和 Claude 可以在同一份文档、演示稿或设计稿上共同编辑。

  33. Claude(@claudeai)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Motion 发布:将报告与演示转成动画

    Claude 发布 Claude Motion,可将报告、图表或产品演示转成短动画。每段动画由 Claude 以代码方式生成,不涉及视频模型,因此可修改任意文字、数字或时间点,并导出 MP4。目前面向 Team 和 Enterprise 套餐开放 beta。

  34. AI Engineer(@aiDotEngineer)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Engineer 发布金融AI指南:模型给出的数字能否溯源

    AI Engineer 发布面向金融领域的 AI 指南,聚焦研究、智能体评测以及金融操作的权限控制,核心问题是模型给出的数字能否追溯到来源。该指南在纽约活动(10 月 12 日至 14 日)前发布,活动门票已在 ai.engineer/nyc 开放。

  35. elvis(@omarsar0)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Voyager 发布面向视频、图形与游戏的开放 harness

    Anvisha 发布 Voyager,一个面向视频、图形和游戏创作的开放 harness,被形容为创意工作的 Codex。它自带免费的图形、音乐和视频编辑工具,也能在桌面端驱动 Blender、DaVinci Resolve、After Effects、Ableton 等 100 多个应用,并支持 Opus、Astra、DeepSeek 等模型。

  36. AWS Machine Learning BlogAI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    BlockRun 与 Incarna 如何用 Amazon Bedrock AgentCore payments 实现按次推理付费

    Incarna 借助 Amazon Bedrock AgentCore payments,让 AI 智能体逐次向 BlockRun 支付模型推理费用,把接入 x402 支付的工作从数月缩短到数天,并已将端到端按次付费流程投入生产。

  37. NVIDIA Technical BlogAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA KGMON 团队在 KDD Cup 2026 Data Agents 竞赛中获亚军

    NVIDIA KGMON 团队在 KDD Cup 2026 Data Agents 竞赛中获得第二名,其系统核心思路是让智能体的 harness 更小、更清晰、更易于验证。该竞赛要求智能体针对数据库、CSV 和 JSON 文件、散文文档、PDF 及简报视频等异构数据源回答自然语言问题。

  38. OpenAI Developers(@OpenAIDevs)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 公布 GPT-6.1 Sol Ultrafast 模式 API 定价

    OpenAI Developers 公布 GPT-6.1 Sol 在 Ultrafast 模式下的 API 定价:输入 $12/百万 token,输出 $60/百万 token。该模式面向对速度和智能都有要求的场景,例如排查线上故障、智能体操作应用,以及分秒必争的实时体验。

  39. 技术前沿AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 在 Gemini 中引入智能体能力,先从企业客户开始

    Google 在 Cloud 活动上宣布将 Gemini 带入智能体阶段,推出统一智能体,既能回答问题也能代用户完成任务,初期面向企业、之后再向消费者开放。该智能体可接收目标而非指令,自行规划工作并调用自定义技能与工具;默认自动选择模型,用户也可手动切换,首批第三方模型为 Anthropic 的 Claude。

    为什么值得看

    Google 把 Gemini 智能体先落到企业场景,文中给出的模型选择、系统连接与审计线索可供评估落地边界。

  40. Sundar Pichai(@sundarpichai)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布面向工作场景的统一智能体 Gemini agent

    Google 在 Gemini at Work 活动上发布新的 Gemini agent,定位为面向工作的单一通用智能体,可处理问答、知识工作、图像与媒体生成以及代码编写与运行,全部通过一个提示框完成。