跳到正文

#Agent

今日 0 条
10月8日周四
  1. Windsurf(@windsurf_ai)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Windsurf:Devin 每个会话获得独立云端 Mac,可运行真实 iOS 工具链

    Windsurf 宣布 Devin 的每个会话都将配备独立云端 Mac,使移动端开发能像普通工单一样被委派。云端智能体现在可以运行真实工具链,包括 xcodebuild、iOS Simulator,以及通过 Computer Use 操作 UI。

  2. Cognition(@cognition_labs)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Haiku 5.5 上线 Devin,FrontierCode 1.1 得分 58.4%

    Claude Haiku 5.5 已在 Devin 上线,在 FrontierCode 1.1 上得分 58.4%,超过 Sonnet 5,而每任务成本约为后者的八分之一。它还可作为 Fusion 中的辅助模型,并可与 Opus 5.5 搭配用于 Devin Desktop 和 CLI。

  3. 浮之静AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    lencx 见闻汇总:Strata 本地推理引擎、ArtCraft 创作七件套与 Agent Memory Repo 等开源项目

    开源本地推理引擎 Strata 主打在消费级电脑上运行 1250 亿参数的 Qwen3.8-Flash-Next 量化版,通过量化、GPU 专家缓存和 CPU/GPU 协同推理降低显存门槛,RTX 5070(12 GB 显存)下 Q2_0 量化版短对话生成速度约 94 tokens/s。

  4. GTM与增长AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Nous Research 确认 15 亿美元估值,推出面向企业用户的 AI 智能体

    Nous Research 以 15 亿美元估值完成 9000 万美元 B 轮融资,本轮由 Robot Ventures 领投,Nvidia、Union Square Ventures、Menlo Ventures、Samsung 等参投,公司累计融资达 1.58 亿美元。

  5. GitHub(@github)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 的 Claude Haiku 5.5 在 GitHub Copilot 正式可用

    Claude Haiku 5.5 现已在 GitHub Copilot 正式可用,这是一款面向子智能体、快速编辑和终端任务等高频工作的轻量模型。GitHub 早期测试显示,它在许多编码任务上追平 Claude Sonnet 5,同时消耗的 tokens 和步骤明显更少。该模型可在 GitHub Copilot 应用、CLI 或 code 中使用。

  6. Stack Overflow BlogAI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何让 Agent 知道自己不知道:置信度层

    Stack Overflow 博客“Running LLM systems in production”系列第 3 篇,介绍六层成熟度模型中的 Level 3 置信度层。

  7. ChatGPT(@ChatGPTapp)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT 推出 Intelligent UI,并预告 GPT-6 将面向所有用户上线

    ChatGPT 宣布推出 Intelligent UI,让 ChatGPT 用完全可交互的用户界面快速作答,把日常答案变得更直观,便于学习复杂主题,并能即时生成工具解决当下任务。官方同时预告 GPT-6 将进入 ChatGPT,面向所有用户开放。

  8. Browser Use(@browser_use)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    browser-use 现已支持 Anthropic 新的 computer SDK

    browser-use 现已支持 Anthropic 新的 computer SDK。Anthropic 已将 computer use 与 browser use 工具集内置到 Claude 的 Python 和 TypeScript SDK 中,API 会告知 Claude 想点击或输入的位置,SDK 负责运行循环并将操作发送给驱动,无需再自行编写循环来映射点击和按键。

  9. TechcrunchAI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软发布搭载 Nvidia 芯片的 AI PC,配新版 Windows 11

    微软公布 Surface Laptop Ultra 的规格与价格,这款 AI PC 搭载 Nvidia 芯片,面向运行 AI 模型和智能体设计,并配备改版后的 Windows 11。

  10. NVIDIA AI(@NVIDIAAI)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 用 PivotOPD 训练 AI 智能体纠错与恢复

    NVIDIA 研究人员构建 PivotOPD,让 AI 智能体在任务早期出错后不再一路走偏,而是学会避免错误并在出错后恢复。训练时由教师模型向智能体演示更优动作,以及随后几步如何回到正轨。相关论文与研究细节已发布在 NVIDIA 官网研究页面。

  11. Amjad Masad(@amasad)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit 与 Microsoft 合作推出桌面应用预览,基于 NVIDIA OpenShell 沙箱

    Replit 宣布推出桌面应用预览版,与 Microsoft 合作,在 Windows 上本地构建和运行应用,每次构建都在由 Microsoft Execution Containers 和 NVIDIA OpenShell 驱动的独立沙箱中运行。该桌面体验主打安全与可靠性,旨在应对桌面 AI 应用面临的供应链攻击和智能体灾难性错误风险。目前已开放早期访问等待名单。

  12. Sam Altman(@sama)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT 上线 Intelligent UI,可为用户生成自定义界面

    ChatGPT 现在可以为用户生成自定义 UI。OpenAI 的 GPT-6 与 Intelligent UI 正在向所有 ChatGPT 用户推送。该功能提供快速、可交互的回答,让日常问题更直观、复杂主题更易理解,并可在对话中直接调用交互式工具完成任务。

    为什么值得看

    ChatGPT 面向所有用户上线 Intelligent UI,读者可了解这项功能对日常问答呈现方式的改变。

  13. Harrison Chase(@hwchase17)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain Interrupt London 下周二举行,Orange 与 OVO 分享智能体生产实践

    LangChain 的 Interrupt London 将于下周二举办,Orange 和 OVO 将分享智能体在生产环境中的实际落地经验。活动还设有 Deep Agents 和 Engine 的动手实践工作坊,报名入口为 interrupt.langchain.com/london。

  14. Satya Nadella(@satyanadella)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软为 Windows 版 Copilot 引入 Hybrid Intelligence

    微软 CEO Satya Nadella 宣布为 Windows 版 Copilot 引入 Hybrid Intelligence。经用户许可后,Copilot 可以调用 PC 上的上下文、代为执行操作,并在合适场景下使用本地模型,从而在提升能力的同时让 token 用得更省。

  15. GitHub(@github)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub Copilot 本地沙箱正式可用

    GitHub Copilot 的本地沙箱功能正式可用,让 Copilot 在隔离环境中运行命令,并控制其对文件、网络、系统能力和凭证的访问权限。该功能还为团队提供了集中管理策略的方式,可在 GitHub Copilot CLI、GitHub Copilot 应用或 VS Code 中试用。

  16. Alex Albert(@alexalbert__)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Haiku 5.5 发布,速度更快且价格降 75%

    Claude Haiku 5.5 发布,官方称其在编码、计算机使用和知识工作方面相比 Haiku 4.5 有明显提升,同时速度更快、价格便宜 75%。发帖者补充 Haiku 4.5 于 2025 年 10 月 15 日推出,两代发布时间间隔不到一年。

  17. OpenAI(@OpenAI)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 公布 ChatGPT for Teens 进展并预览 College Planner

    OpenAI 分享了面向 18 岁以下用户的 ChatGPT for Teens 进展,该体验会自动应用于被识别为未成年的账号,且防护默认开启。OpenAI 同时预览了 College Planner,将把美国高中生申请四年制大学的申请要求、截止日期、任务和助学金步骤集中在一起,并表示将持续构建这些工具、评估其与防护机制的实际表现。

  18. Runway(@runwayml)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Runway 直接接入 ChatGPT Astra,可在同一聊天窗口完成 brief 与反馈

    Runway 现已直接集成进 ChatGPT Astra,用户可在同一个聊天窗口内完成下达 brief、让其执行并给出反馈的全流程。官方提示可通过下方链接开始使用。

  19. Harrison Chase(@hwchase17)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    deepagents 支持加载技能时动态加载工具,兼容 OpenAI/Anthropic 模型且不破坏 prompt cache

    deepagents 现在支持在加载技能(skill)时动态加载工具,用于应对某些技能需要特定工具、但这些工具并非始终需要可用的场景。该机制与 OpenAI/Anthropic 模型配合时不会破坏 prompt cache。

  20. AWS Machine Learning BlogAI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AWS 上线 Claude Haiku 5.5

    AWS 宣布 Claude Haiku 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上线。据 Anthropic 介绍,它是 Claude 5.5 家族中速度最快、效率最高的模型,面向子智能体和高并发成本敏感场景,多数任务成本比 Claude Haiku 4.5 低约 75%。

  21. Feed: Artificial Intelligence LatestAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    三名工程师让 GPT、Claude 和 Grok 驾驶丰田卡罗拉去买 In-N-Out

    三名工程师把 GPT、Claude 和 Grok 接入一辆真实的丰田卡罗拉,让它们分别负责驾驶,目标是开到 In-N-Out。三家模型里只有一个成功完成任务。

  22. TechcrunchAI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta 的 AI 智能体 Muse 上线 iPad

    Meta 的 AI 智能体 Muse 现已登陆 iPad,距离其移动端首次亮相仅一个月。Meta 正快速扩展这款助手的覆盖范围和集成能力。

  23. Greg Brockman(@gdb)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 在 ChatGPT 推出 Intelligent UI,结合 GPT-6 提供交互式回答

    OpenAI 在 ChatGPT 中推出新能力 Intelligent UI,结合 GPT-6 现已向所有用户逐步上线。该能力用完全交互式的用户界面快速作答,让日常问题更直观、复杂话题更易理解,并可即时调用交互式工具。

    为什么值得看

    OpenAI 在 ChatGPT 中上线 Intelligent UI,读者可了解它与 GPT-6 结合后的交互形态变化。

  24. LangChain BlogAI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Managed Deep Agents v0.9 发布:支持自我调度、按运行配置与 Slack 表情回应

    LangChain 发布 Managed Deep Agents v0.9,公开测试版新增三项能力:Schedules SDK 让智能体在对话中自行创建提醒、跟进和周期性任务。

  25. 国际大厂AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Amazon 上线“About You”页面,展示它对你的一切推断

    Amazon 的“About You”页面今年 5 月上线后目前处于 beta,依据用户活动数据生成 Product Preferences、Interests & Hobbies、Home & Family 等类别的个人推断,用于个性化购物体验。该页面支持从其他 AI 聊天机器人导入个人数据来生成购物画像,但用户无法直接退出该功能,只能手动增删信息。

  26. OpenAI(@OpenAI)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 可在对话中直接创建互动工具,如游戏和预算计算器

    OpenAI 支持在对话中直接创建可用的互动工具,例如游戏或互动预算规划计算器,用户无需离开对话界面即可使用。该功能由 @OpenAI 发布,配文附带演示视频。

  27. AI SDK(@aisdk)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI SDK 新增 Claude 支持,Anthropic 模型接入 Vercel 生态

    AI SDK 现已支持 Anthropic 的 Claude 模型,可通过 Vercel 平台接入使用,详情见 ai-sdk.dev 的 provider 文档。该消息由 AI SDK 官方账号发布,并同步 @claudeai、@AnthropicAI 与 @vercel。

  28. 国际大厂AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软为 Copilot 开放本地文件访问与跨系统操作能力

    微软在 Windows and Surface 活动上宣布升级 Copilot,使其可访问 PC 本地文件并跨操作系统执行操作,属于其称为 Hybrid Intelligence 的本地与云端模型混合方案。

  29. Feed: Artificial Intelligence LatestAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 为所有用户更新 ChatGPT,推出更视觉化的 Intelligent UI

    OpenAI 面向所有用户更新 ChatGPT,加入名为 Intelligent UI 的界面,让聊天机器人在输出中直接生成交互式元素,整体呈现更偏视觉化。该报道指出这次更新的展示成分多于实际说明。

  30. Lovable(@lovable_dev)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lovable 上线 Chat:支持语音、了解你的应用与已连接工具且免费

    Lovable 推出 Chat 功能,用户可就任何话题与其对话,并支持语音输入。该功能对用户的 Lovable 应用及已连接工具具备深度上下文理解,且免费开放。

  31. 国际大厂AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软 Windows 与 Surface 发布会:Windows 智能体功能与 Surface Laptop Ultra 亮相

    微软在 Windows 与 Surface 发布会上公布 Windows 的智能体 AI 功能,并展示搭载 NVIDIA RTX Spark SOC 的 Surface Laptop Ultra。

  32. 国际大厂AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软把 Windows 搜索改造成聊天机器人式入口

    微软在秋季 Surface 活动上宣布,从今年秋季起 Windows 任务栏的搜索菜单将改造成聊天机器人式界面,用户可通过输入简短命令完成数千种操作,如开关深色模式和免打扰,也能不打开 Copilot 应用直接与其对话。

  33. eric zakariasson(@ericzakariasson)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布 grok @bot 0.68.1:可协作生成幻灯片并导出 PowerPoint 或 Google Slides

    xAI 的 grok @bot 升级至 0.68.1,Bot 可与你共同制作幻灯片,并直接交付为 PowerPoint 或 Google Slides。新版本还支持从草稿卡片直接发送格式化邮件,1:1 聊天中你的消息会显示该 Bot 的颜色,computer use 速度提升并支持 1920x1200 屏幕。

  34. Y Combinator(@ycombinator)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vitalize 完成 3100 万美元 A 轮融资,为医院排班打造 AI 操作系统

    YC W23 孵化的 Vitalize 完成 3100 万美元 A 轮融资,为医院护理排班、调度与床位容量打造 AI 操作系统。Vitalize 目前每周管理超 15 家医疗系统的数百万个班次,每天为临床管理者节省超 2000 小时;St. Luke's Health 在 12 周内将加班与派遣人力支出削减 54%。

  35. 核心模型与趋势AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 两份报告:仅 4.5% 美国消费者为 AI 付费,GPU 租金不降反升

    a16z 第七版消费级 AI 应用报告显示,只有 4.5% 的美国消费者为 ChatGPT、Gemini 或 Claude 付过个人订阅费,近一半人用过 AI 但每天使用的只有四分之一。

  36. hidecloud(@hidecloud)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    CueAgents 路演前两小时拿到新贴纸,让 ManusAI 把它做成动画

    CueAgents 在路演前两小时拿到全新贴纸,随后请 ManusAI 将其做成动画效果。相关推文由 alan chan 引用发布,称 Cue 拥有自己的身份和专属贴纸。

  37. The Cloudflare BlogAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cloudflare 打造基于证据的多 AI 智能体安全运营框架

    Cloudflare 推出内置多 AI 智能体安全运营框架 Managed Defense,先由确定性代码完成侦察、再由协调 AI 智能体并行调度流量分析、客户上下文。

  38. Perplexity(@perplexity_ai)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-OSS-120B 智能体在 BrowseComp+ 上以 64.0% 正确率领先 ColBERT 4.9 分

    在 agentic search 场景中,使用 9B 模型的 GPT-OSS-120B 智能体正确回答 64.0% 的 BrowseComp+ 问题,比排名第二的 ColBERT 模型高出 4.9 分,且搜索次数少于所有基线。

  39. Microsoft Research(@MSFTResearch)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软 Agent Lightning:把现有 AI 智能体接入强化学习训练

    微软推出 Agent Lightning,可将现有 AI 智能体接入强化学习训练。由于智能体的工具、上下文与决策由复杂框架管理,直接做 RL 训练存在难度,该方案无需重建智能体即可完成改进。

  40. NVIDIA Technical BlogAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用数字孪生和 AI 智能体验证 AI 工厂变更

    NVIDIA 提出用数字孪生与 AI 智能体验证 AI 工厂的变更:AI 工厂由 GPU、CPU、交换机、DPU 与 SuperNIC 组成,并叠加调度器、编排服务、安全控制和快速迭代的软件栈。这类基础设施、软件与策略是否能为目标负载协同工作,本身就难以验证。