NVIDIA Nemotron Labs 探讨如何评估 Agent Skills
NVIDIA Nemotron Labs 的 "Ask the Experts" 活动聚焦 AI 智能体技能(Agent Skills)的评估方法。内容以 x.com 直播形式发布,原帖互动为 7 条回复、14 次转发、65 次点赞,浏览量 12033。
NVIDIA Nemotron Labs 的 "Ask the Experts" 活动聚焦 AI 智能体技能(Agent Skills)的评估方法。内容以 x.com 直播形式发布,原帖互动为 7 条回复、14 次转发、65 次点赞,浏览量 12033。
Fish Audio MCP 新增图像与视频生成能力,用户可在 agent 内把一句 brief 做成广告:先生成画面、再编辑、最后生成视频,创作前还能看到成本。该功能支持 Claude、Codex、Cursor、Windsurf。
Lovable 宣布即日起其构建流程改用 Opus 5.5,质量与 Opus 5 持平。官方称在 0 到 1 构建与迭代修码上质量不变,在已有代码库上步骤最多减少 48%;自检测试得分高出 4-6%,达成同样结果所需步骤最多减少 57%。
HeyGen 的 Muse 上线两周已能代用户跑腿办事,接入 HeyGen 的 MCP 后还能一并处理内容:早上 7 点生成简报、以用户自己的声音写脚本并合成视频,在用户醒来前完成日语、德语和法语本地化。
v0 宣布用户现可在 v0 中使用 Claude Opus 5.5,并给出试用入口 v0.app/?opus55。所引用的 Anthropic 内容称,Claude Opus 5.5 是 Claude 5.5 系列的首个模型,多数任务上表现与 Claude Fable 5.1 持平,运行成本比 Opus 5 低 40%。
一个智能体记忆基准需满足三项属性:按行动评分、在准确率之外同时衡量成本与延迟、以及可解性认证(带历史能通过、不带历史则失败)。该观点用于对比现有的 Agent Memory Benchmarks。
DolphinBench 公布了两套测试框架(Hermes、Claude Code)与三个智能体模型(GPT-5.6-Luna、MiniMax M3、Claude Sonnet 5)的官方测试结果,实时榜单已在 dolphinbench.ai/leaderboard/ 上线。
mem0 发布 DolphinBench,这是一个面向 AI 智能体记忆的评测基准,把准确率、成本与延迟放在同一张榜单上。它不再像传统记忆评测那样只出题判分,而是考察长历史之后智能体能否在工具调用中采取正确行动。DolphinBench 已在 dolphinbench.ai 上线。
Claude Opus 5.5 现已成为 Claude Code 和 Claude 应用(含 Cowork)的默认模型,面向 Pro、Max 和 Team 套餐开放。
Browser Use 称开源 MiMo v2.6 系列模型成为新的帕累托前沿,其中 MiMo v2.6 Flash 得分 37.6,Grok 4.7 为 39.9。其记录的智能体成本比 Grok 4.7 低 57 倍,比 DeepSeek v4.1 Flash(low)便宜 27%,每任务 $0.10 对 $5.72,两项对比各跑 60 个任务。
Dify 发布新版 Agent,用户可从一句想法出发、通过对话完成构建,并在 Preview 中测试,一次构建即可在团队常用的多个场景中复用。官方同步放出一段两分钟演示视频,展示完整流程。
Anthropic 成立生命科学实验室,让 Claude 智能体在 DNA 数据库中自主搜索,发现了一种与重复序列关联的新型逆转录酶系统 ART,相关预印本已发布。
Alexandria 宣布完成 7500 万美元 B 轮融资,由 Smash Capital 领投,用于构建面向超级智能的全球最大知识库。该平台让 AI 智能体即时接入最强大的数据集与数据供应商。
Docker 在 9 月 23–25 日圣何塞 WeAreDevelopers World Congress North America 的 Docker Pavilion 带来合作伙伴与客户分享,覆盖模型提供商、MCP 工具与网关、身份安全、可观测性和代码质量。
Confido 正在为消费品牌构建 AI 员工,把会计、销售到需求预测等流程自动化,客户包括 Olipop、Dude Wipes 以及 Mars 和 Unilever 旗下部门。
10,000 个 AI 智能体在 Lean 中耗时 88 小时形式化复杂数学证明,围绕 Navier-Stokes 方程的结果引发争议。DeepLearning.AI 指出,智能体已能大规模形式化证明,但人类评估仍是解释证明为何成立的关键,企业数据隐私与零数据保留设置也是必需项。
小米团队正式发布并开源 Xiaomi MiMo-V2.6 系列,包含 Pro 和 Flash 两个原生全模态模型。
原文给出开源模型在AA综合指数上的位置与RL算力扩展的公开细节,便于比较开源与闭源差距。
前 OpenAI 核心研究员、TypeSafe AI 创始人 Diogo Almeida 在播客 Latent Space 完整访谈中,解释其新模型 Jev 为何完全不做文本生成,只向程序输出带概率和置信度的决策,并以代码作为唯一消费者。
阶跃星辰 Step 5 Preview 已在豆包旗下 AI 开发产品 TRAE 上线,可直接在 TRAE 中调用,覆盖 9 类任务、33 种编程语言,从复杂代码库理解、跨文件修改到 Bug 修复、重构、性能调优及数小时长程任务。官方公布 DeepSWE 67.7 分、ProgramBench 通过率 80.5%。
TypeSafe 于 9 月 15 日结束两年隐身期发布 Jev,并宣布完成由 DCVC 领投的 4000 万美元种子轮融资;创始人 Diogo Almeida 曾在 OpenAI 参与 InstructGPT、ChatGPT 和 GPT-4 研究,此次转向做一个不生成文字、只输出 Choice、Score、Noul 三种结构化判断与概率的 System 1 模型。
阿里千问办公发布 QwenNote 硬件产品线,包含带三轴云台、以手机为头的桌面机器人 Eva 和随身助理 A2,前者靠人脸与声纹识别用户,无需唤醒词即可直接对话并打断。
火山引擎存储分享 ADrive 跨产品协作实践,基于 ve-adrive-cli v1.0.2,展示如何选择一个正在进行的内容项目、跑通第一个文件协作闭环。ADrive CLI 已在 GitHub 发布并提供下载,开通 ADrive 需联系 ADrive 团队申请试用。
火山引擎推出 ADrive 智能网盘,让 Agent 直接读取项目资料并把成果保存回同一项目空间,团队成员再从熟悉的文件夹接手审阅。项目空间可挂载为本地盘符,人和 Agent 共用同一文件夹;未授权的写入尝试在演示中三次均被拒绝,操作留有审计记录。该产品已开放企业版试用申请。
拾象整理了一场与来自多家模型厂商的 AI Researchers 的线下闭门交流,讨论 Astra 的 Computer Use、RSI、模型蒸馏和训练数据等方向,保留其中的共识与分歧。
小米发布原生全模态模型 MiMo-V2.6 Pro 与 Flash 并开放 MIT 许可权重,API 沿用 V2.5 定价;Pro 与 Flash 在长程软件工程评测 DeepSWE v1.1 中分别达到 72.6 和 65.7,较本轮训练前提升约 14 分和 17 分。
乱翻书第276期邀请上海外国语大学学生金贤婷、港科大(广州)博士生李俊伟与欧莱雅徐轶凡,讨论AI时代年轻人的成长路径。嘉宾认为AI接管学徒工作、打断传统职业成长路径,但缩短试错流程不等于消灭试错,实习生需要证明自己不是AI答案的搬运工。欧莱雅美妆科技黑客松已在2026世界人工智能大会启动,以"用AI造点美"为题,鼓励青年用AI回应产业真实需求。
网易有道推出语音产品"叭哥说",把语音从"转文字"推进到"转意图",用户先说完整段内容再由系统整理成可用文本,PC 端已上线并承诺语音输入场景终身免费。同期升级的 Hi Echo 转向个性化口语学习系统,并已与启元机器人合作进入机器人场景。
辛顿在CNN访谈中表示,外界目前基本依靠内部员工爆料才能知道模型在哪些地方出了问题,他支持独立机构进入头部AI公司验证模型开发与测试过程。CNN调查指出,AI人才稀缺让研究人员当下拥有公开质疑公司和要求暂停发布的筹码,但当AI能参与生成训练数据、编写评测和改进下一代模型时,这种话语权可能被压缩。辛顿认为"关机键"只能应对部分风险,真正的问题是谁有权按下它。
第七届小米黑客马拉松于 9 月 22 日在北京小米科技园颁奖,284 支队伍报名、近千名选手参与,现场 149 支队伍进行 48 小时极限开发。本届首次开设高校赛区,覆盖北京大学、武汉大学、香港中文大学等 94 所高校,并新增"最佳 MiMo 应用奖",3 个项目获奖,分别探索智能家居服务、独居老人主动关怀和 AI 陪伴硬件。
小米正式发布并开源 Xiaomi MiMo-V2.6 系列,包含 Pro 和 Flash 两个原生全模态模型,定位为探索 RSI(递归自我改进)路径的关键一步。
小米开源 MiMo-V2.6 系列,公开 RL 算力扩展细节与 6 天 Live 训练实测数据,可观察开源模型追赶闭源的一条路径。
JetBrains 发布 JetBrains Air,将智能体开发相关产品整合为覆盖开发者、团队与组织的开放产品体系。
腾讯混元发布 WebCraftBench,通过让智能体实际操作线上应用、并用覆盖率引导的探索找出未被触达的部分,再从美观度、可用性和是否满足原始需求三个维度打分。该基准在 197 组人工验证样本上与人类偏好的一致率为 85.3%。论文已发布于 arxiv.org/abs/2609.15387。
腾讯云城市峰会圆桌讨论聚焦 AI 数字员工落地:企业用 AI 分“能对话、能干活、能上岗”三级,其中“能上岗”最难。科拓把停车场收费、抬杆等管理权交给 AI 岗亭,蝉妈妈将客服 AI 接管研发问题响应后,研发被打断比例降低 70% 以上、响应时间缩短 80% 以上;华祥苑的“店效 AI 经营官”已开 10 万次门店会议,覆盖近 1000 家门店。
AMD 软件副总裁 Anush Elangovan 在播客中介绍 ROCm——AMD 面向自家硬件加速器的统一开源软件层与工具链,并称智能体 AI 正在大幅降低底层硬件编程的门槛,软硬件开发周期的收敛也在加快。
METR 发布对 Claude Opus 5.5 的部署前评估摘要,认为该模型对 AI 研发的加速略高于 Fable 5.1,但不太可能完全自动化 AI 研发。
douchat.ai 开始内测,定位为"Agent 版微信",由 xgo.ing 提供支持。原文未披露模型版本、参数规模或开放范围等细节。
阿里在云栖大会集中发布 ROLL、RTP-LLM、Atrex Kernel Agent、OpenSandbox、Open Agent Auth、OpenCodeReview 六个开源项目,分别面向大规模强化学习、生产级推理、异构算子生成优化、Agent 沙箱运行、企业级授权和智能代码评审。
阿里巴巴集团CEO吴泳铭在2026杭州云栖大会上判断,未来机器供给的思考总量将达人类思考总量的1000倍以上,机器将承担99.9%的思考工作。他宣布平头哥发布新一代AI芯片真武V900,性能达M890的3倍,单一集群可扩展至50万卡;Qwen团队正探索递归式自我改进(RSI),计划训练5-10T参数规模的新模型。阿里云目标到2032年全球数据中心规模超20GW。
作者开源了awesome-seedance项目,用真金白银复现463条AI视频提示语,蒸馏出14个覆盖各类视频的提示语模版和25个Skills。项目每条提示语都经过实测复现并打分分类,用gpt、claude、grok、deepseek四个多模态模型复测打分、聚类和起标题,每天自动收录GitHub、抖音、小红书、X上带提示语的case。
小米发布 MiMo-V2.6 系列,含 Pro、Flash 和 20 倍速的 Pro-UltraSpeed 三个版本,AA 指数 46 分与同日发布的 Grok 4.7 打平,位列开源模型第一。
作者以实测视角对比 Grok 4.7 与 MiMo V2.6 的性能、价格和速度,呈现国产开源模型的实际能力边界。