跳到正文

#Agent

今日 0 条
9月23日周三
  1. NVIDIA AI(@NVIDIAAI)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA Nemotron Labs 探讨如何评估 Agent Skills

    NVIDIA Nemotron Labs 的 "Ask the Experts" 活动聚焦 AI 智能体技能(Agent Skills)的评估方法。内容以 x.com 直播形式发布,原帖互动为 7 条回复、14 次转发、65 次点赞,浏览量 12033。

  2. Fish Audio(@FishAudio)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio MCP 迎来重大升级:新增图像与视频生成

    Fish Audio MCP 新增图像与视频生成能力,用户可在 agent 内把一句 brief 做成广告:先生成画面、再编辑、最后生成视频,创作前还能看到成本。该功能支持 Claude、Codex、Cursor、Windsurf。

  3. Lovable(@lovable_dev)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lovable 改用 Opus 5.5 构建,步骤最多减少 48%

    Lovable 宣布即日起其构建流程改用 Opus 5.5,质量与 Opus 5 持平。官方称在 0 到 1 构建与迭代修码上质量不变,在已有代码库上步骤最多减少 48%;自检测试得分高出 4-6%,达成同样结果所需步骤最多减少 57%。

  4. HeyGen(@HeyGen_Official)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HeyGen Muse 发布两周,接入 MCP 后可自动生成并本地化视频内容

    HeyGen 的 Muse 上线两周已能代用户跑腿办事,接入 HeyGen 的 MCP 后还能一并处理内容:早上 7 点生成简报、以用户自己的声音写脚本并合成视频,在用户醒来前完成日语、德语和法语本地化。

  5. v0(@v0)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    v0 已支持使用 Claude Opus 5.5

    v0 宣布用户现可在 v0 中使用 Claude Opus 5.5,并给出试用入口 v0.app/?opus55。所引用的 Anthropic 内容称,Claude Opus 5.5 是 Claude 5.5 系列的首个模型,多数任务上表现与 Claude Fable 5.1 持平,运行成本比 Opus 5 低 40%。

  6. mem0(@mem0ai)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Agent Memory Benchmarks 对比:智能体记忆评测的三个关键属性

    一个智能体记忆基准需满足三项属性:按行动评分、在准确率之外同时衡量成本与延迟、以及可解性认证(带历史能通过、不带历史则失败)。该观点用于对比现有的 Agent Memory Benchmarks。

  7. mem0(@mem0ai)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DolphinBench 公布 Hermes 与 Claude Code 两套测试框架下 GPT-5.6-Luna、MiniMax M3、Claude Sonnet 5 的官方结果

    DolphinBench 公布了两套测试框架(Hermes、Claude Code)与三个智能体模型(GPT-5.6-Luna、MiniMax M3、Claude Sonnet 5)的官方测试结果,实时榜单已在 dolphinbench.ai/leaderboard/ 上线。

  8. mem0(@mem0ai)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    mem0 发布 DolphinBench:绘制 AI 智能体记忆的帕累托前沿

    mem0 发布 DolphinBench,这是一个面向 AI 智能体记忆的评测基准,把准确率、成本与延迟放在同一张榜单上。它不再像传统记忆评测那样只出题判分,而是考察长历史之后智能体能否在工具调用中采取正确行动。DolphinBench 已在 dolphinbench.ai 上线。

  9. cat(@_catwu)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5 成为 Claude Code 与 Claude 应用默认模型

    Claude Opus 5.5 现已成为 Claude Code 和 Claude 应用(含 Cowork)的默认模型,面向 Pro、Max 和 Team 套餐开放。

  10. Browser Use(@browser_use)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Browser Use 称开源 MiMo v2.6 模型成为新帕累托前沿

    Browser Use 称开源 MiMo v2.6 系列模型成为新的帕累托前沿,其中 MiMo v2.6 Flash 得分 37.6,Grok 4.7 为 39.9。其记录的智能体成本比 Grok 4.7 低 57 倍,比 DeepSeek v4.1 Flash(low)便宜 27%,每任务 $0.10 对 $5.72,两项对比各跑 60 个任务。

  11. Dify(@dify_ai)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Dify 新 Agent 发布:两分钟了解从想法到上线的体验

    Dify 发布新版 Agent,用户可从一句想法出发、通过对话完成构建,并在 Preview 中测试,一次构建即可在团队常用的多个场景中复用。官方同步放出一段两分钟演示视频,展示完整流程。

  12. Anthropic NewsAI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 用 Claude 发现类 CRISPR 的新型酶系统 ART

    Anthropic 成立生命科学实验室,让 Claude 智能体在 DNA 数据库中自主搜索,发现了一种与重复序列关联的新型逆转录酶系统 ART,相关预印本已发布。

9月22日周二
  1. Firecrawl(@firecrawl_dev)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Alexandria 完成 7500 万美元 B 轮融资,由 Smash Capital 领投,打造超级智能知识库

    Alexandria 宣布完成 7500 万美元 B 轮融资,由 Smash Capital 领投,用于构建面向超级智能的全球最大知识库。该平台让 AI 智能体即时接入最强大的数据集与数据供应商。

  2. DockerAI 评估 · 14/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Docker 在 WeAreDevelopers 大会展示 AI 智能体生态合作伙伴与客户阵容

    Docker 在 9 月 23–25 日圣何塞 WeAreDevelopers World Congress North America 的 Docker Pavilion 带来合作伙伴与客户分享,覆盖模型提供商、MCP 工具与网关、身份安全、可观测性和代码质量。

  3. Y Combinator(@ycombinator)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Confido 为消费品牌打造 AI 员工,完成 5500 万美元 B 轮融资

    Confido 正在为消费品牌构建 AI 员工,把会计、销售到需求预测等流程自动化,客户包括 Olipop、Dude Wipes 以及 Mars 和 Unilever 旗下部门。

  4. DeepLearning.AI(@DeepLearningAI)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    10,000 个 AI 智能体用 88 小时在 Lean 中攻克 Navier-Stokes 方程,引发的争议带来重要启示

    10,000 个 AI 智能体在 Lean 中耗时 88 小时形式化复杂数学证明,围绕 Navier-Stokes 方程的结果引发争议。DeepLearning.AI 指出,智能体已能大规模形式化证明,但人类评估仍是解释证明为何成立的关键,企业数据隐私与零数据保留设置也是必需项。

  5. 魔搭ModelScope社区AI 评估 · 87/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米发布并开源 Xiaomi MiMo-V2.6 系列,扩展强化学习规模

    小米团队正式发布并开源 Xiaomi MiMo-V2.6 系列,包含 Pro 和 Flash 两个原生全模态模型。

    为什么值得看

    原文给出开源模型在AA综合指数上的位置与RL算力扩展的公开细节,便于比较开源与闭源差距。

  6. AI科技大本营AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    “当年在 OpenAI 像在疯人院”:Jev 作者 Diogo Almeida 访谈谈反叛 RLHF 与可编程 AI

    前 OpenAI 核心研究员、TypeSafe AI 创始人 Diogo Almeida 在播客 Latent Space 完整访谈中,解释其新模型 Jev 为何完全不做文本生成,只向程序输出带概率和置信度的决策,并以代码作为唯一消费者。

  7. 阶跃星辰AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Step 5 Preview 现已上线 TRAE

    阶跃星辰 Step 5 Preview 已在豆包旗下 AI 开发产品 TRAE 上线,可直接在 TRAE 中调用,覆盖 9 类任务、33 种编程语言,从复杂代码库理解、跨文件修改到 Bug 修复、重构、性能调优及数小时长程任务。官方公布 DeepSWE 67.7 分、ProgramBench 通过率 80.5%。

  8. Founder ParkAI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 创始人 Diogo Almeida 谈为何做只做判断的 System 1 模型

    TypeSafe 于 9 月 15 日结束两年隐身期发布 Jev,并宣布完成由 DCVC 领投的 4000 万美元种子轮融资;创始人 Diogo Almeida 曾在 OpenAI 参与 InstructGPT、ChatGPT 和 GPT-4 研究,此次转向做一个不生成文字、只输出 Choice、Score、Noul 三种结构化判断与概率的 System 1 模型。

  9. 袋鼠帝AI客栈AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里千问办公发布 QwenNote Eva 桌面机器人和 A2 随身助理

    阿里千问办公发布 QwenNote 硬件产品线,包含带三轴云台、以手机为头的桌面机器人 Eva 和随身助理 A2,前者靠人脸与声纹识别用户,无需唤醒词即可直接对话并打断。

  10. 字节跳动技术团队AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    一图看懂 ADrive 跨产品协作实践:文件通了,Agent 就通了

    火山引擎存储分享 ADrive 跨产品协作实践,基于 ve-adrive-cli v1.0.2,展示如何选择一个正在进行的内容项目、跑通第一个文件协作闭环。ADrive CLI 已在 GitHub 发布并提供下载,开通 ADrive 需联系 ADrive 团队申请试用。

  11. 字节跳动技术团队AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    火山引擎 ADrive 智能网盘:让 Agent 直接读写团队项目文件夹

    火山引擎推出 ADrive 智能网盘,让 Agent 直接读取项目资料并把成果保存回同一项目空间,团队成员再从熟悉的文件夹接手审阅。项目空间可挂载为本地盘符,人和 Agent 共用同一文件夹;未授权的写入尝试在演示中三次均被拒绝,操作留有审计记录。该产品已开放企业版试用申请。

  12. 海外独角兽AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    和一线研究员的闭门讨论:蒸馏变难后,下一步的重点是什么?

    拾象整理了一场与来自多家模型厂商的 AI Researchers 的线下闭门交流,讨论 Astra 的 Computer Use、RSI、模型蒸馏和训练数据等方向,保留其中的共识与分歧。

  13. 机器之心SOTA模型AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米开源 MiMo-V2.6 Pro/Flash,xAI 发布 Grok 4.7,APUS 开源决策模型 OpenJev-v1

    小米发布原生全模态模型 MiMo-V2.6 Pro 与 Flash 并开放 MIT 许可权重,API 沿用 V2.5 定价;Pro 与 Flash 在长程软件工程评测 DeepSWE v1.1 中分别达到 72.6 和 65.7,较本轮训练前提升约 14 分和 17 分。

  14. 乱翻书AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    当AI给出所有答案,年轻人如何找到自己的问题?

    乱翻书第276期邀请上海外国语大学学生金贤婷、港科大(广州)博士生李俊伟与欧莱雅徐轶凡,讨论AI时代年轻人的成长路径。嘉宾认为AI接管学徒工作、打断传统职业成长路径,但缩短试错流程不等于消灭试错,实习生需要证明自己不是AI答案的搬运工。欧莱雅美妆科技黑客松已在2026世界人工智能大会启动,以"用AI造点美"为题,鼓励青年用AI回应产业真实需求。

  15. 网易科技AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    网易有道用 AI 重做语音输入:叭哥说、Hi Echo 与子曰模型矩阵

    网易有道推出语音产品"叭哥说",把语音从"转文字"推进到"转意图",用户先说完整段内容再由系统整理成可用文本,PC 端已上线并承诺语音输入场景终身免费。同期升级的 Hi Echo 转向个性化口语学习系统,并已与启元机器人合作进入机器人场景。

  16. 51CTO技术栈AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI教父辛顿:模型出问题现在还靠内部员工爆料,AI工程师最先失去的可能是说"不"的权力

    辛顿在CNN访谈中表示,外界目前基本依靠内部员工爆料才能知道模型在哪些地方出了问题,他支持独立机构进入头部AI公司验证模型开发与测试过程。CNN调查指出,AI人才稀缺让研究人员当下拥有公开质疑公司和要求暂停发布的筹码,但当AI能参与生成训练数据、编写评测和改进下一代模型时,这种话语权可能被压缩。辛顿认为"关机键"只能应对部分风险,真正的问题是谁有权按下它。

  17. 小米技术AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    第七届小米黑客马拉松收官:首设高校赛区,新增最佳 MiMo 应用奖

    第七届小米黑客马拉松于 9 月 22 日在北京小米科技园颁奖,284 支队伍报名、近千名选手参与,现场 149 支队伍进行 48 小时极限开发。本届首次开设高校赛区,覆盖北京大学、武汉大学、香港中文大学等 94 所高校,并新增"最佳 MiMo 应用奖",3 个项目获奖,分别探索智能家居服务、独居老人主动关怀和 AI 陪伴硬件。

  18. 小米技术AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米发布并开源 MiMo-V2.6 系列:扩展 RL 算力,含 Pro 与 Flash 两个全模态模型

    小米正式发布并开源 Xiaomi MiMo-V2.6 系列,包含 Pro 和 Flash 两个原生全模态模型,定位为探索 RSI(递归自我改进)路径的关键一步。

    为什么值得看

    小米开源 MiMo-V2.6 系列,公开 RL 算力扩展细节与 6 天 Live 训练实测数据,可观察开源模型追赶闭源的一条路径。

  19. The IntelliJ IDEA BlogAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    JetBrains 推出 JetBrains Air 智能体软件开发产品体系

    JetBrains 发布 JetBrains Air,将智能体开发相关产品整合为覆盖开发者、团队与组织的开放产品体系。

  20. Hunyuan(@TXhunyuan)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元推出 WebCraftBench:让智能体真正上手用应用来评测前端生成

    腾讯混元发布 WebCraftBench,通过让智能体实际操作线上应用、并用覆盖率引导的探索找出未被触达的部分,再从美观度、可用性和是否满足原始需求三个维度打分。该基准在 197 组人工验证样本上与人类偏好的一致率为 85.3%。论文已发布于 arxiv.org/abs/2609.15387。

  21. 腾讯研究院AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    当 AI 数字员工上岗,会带来什么?腾讯云峰会圆桌谈智能体落地

    腾讯云城市峰会圆桌讨论聚焦 AI 数字员工落地:企业用 AI 分“能对话、能干活、能上岗”三级,其中“能上岗”最难。科拓把停车场收费、抬杆等管理权交给 AI 岗亭,蝉妈妈将客服 AI 接管研发问题响应后,研发被打断比例降低 70% 以上、响应时间缩短 80% 以上;华祥苑的“店效 AI 经营官”已开 10 万次门店会议,覆盖近 1000 家门店。

  22. Stack Overflow BlogAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AMD 的 ROCm 如何让 AI 智能体写 GPU 代码

    AMD 软件副总裁 Anush Elangovan 在播客中介绍 ROCm——AMD 面向自家硬件加速器的统一开源软件层与工具链,并称智能体 AI 正在大幅降低底层硬件编程的门槛,软硬件开发周期的收敛也在加快。

  23. METRAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布 Claude Opus 5.5 部署前评估摘要

    METR 发布对 Claude Opus 5.5 的部署前评估摘要,认为该模型对 AI 研发的加速略高于 Fable 5.1,但不太可能完全自动化 AI 研发。

  24. idoubi(@idoubicc)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    douchat.ai 开启内测,定位"Agent 版微信"

    douchat.ai 开始内测,定位为"Agent 版微信",由 xgo.ing 提供支持。原文未披露模型版本、参数规模或开放范围等细节。

  25. 阿里技术AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里开源六个 AI 基础设施项目,覆盖强化学习到代码评审全链路

    阿里在云栖大会集中发布 ROLL、RTP-LLM、Atrex Kernel Agent、OpenSandbox、Open Agent Auth、OpenCodeReview 六个开源项目,分别面向大规模强化学习、生产级推理、异构算子生成优化、Agent 沙箱运行、企业级授权和智能代码评审。

  26. 阿里研究院AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴泳铭云栖演讲:未来机器思考总量将达人类的1000倍以上

    阿里巴巴集团CEO吴泳铭在2026杭州云栖大会上判断,未来机器供给的思考总量将达人类思考总量的1000倍以上,机器将承担99.9%的思考工作。他宣布平头哥发布新一代AI芯片真武V900,性能达M890的3倍,单一集群可扩展至50万卡;Qwen团队正探索递归式自我改进(RSI),计划训练5-10T参数规模的新模型。阿里云目标到2032年全球数据中心规模超20GW。

  27. 卡尔的AI沃茨AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    我把463个AI视频做成Skill和提示语模版,全都开源

    作者开源了awesome-seedance项目,用真金白银复现463条AI视频提示语,蒸馏出14个覆盖各类视频的提示语模版和25个Skills。项目每条提示语都经过实测复现并打分分类,用gpt、claude、grok、deepseek四个多模态模型复测打分、聚类和起标题,每天自动收录GitHub、抖音、小红书、X上带提示语的case。

  28. 数字生命卡兹克AI 评估 · 81/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米发布 MiMo V2.6 系列模型并全面开源

    小米发布 MiMo-V2.6 系列,含 Pro、Flash 和 20 倍速的 Pro-UltraSpeed 三个版本,AA 指数 46 分与同日发布的 Grok 4.7 打平,位列开源模型第一。

    为什么值得看

    作者以实测视角对比 Grok 4.7 与 MiMo V2.6 的性能、价格和速度,呈现国产开源模型的实际能力边界。