跳到正文

#推理

今日 17 条
9月29日周二
  1. Stack Overflow BlogAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么模型版本管理不足以支撑生产级 AI

    生产级 AI 应用仅靠模型版本无法保证可复现,检索、提示词、工具契约与推理服务配置都会独立改变行为。文章建议用版本化发布清单(含模型、提示词、索引、嵌入、运行时修订号)统一界定发布边界,并以覆盖端到端路径的评估门禁和经过演练的回滚路径作为 MLOps 起点。

9月28日周一
  1. Yangyi(@Yangyixxxx)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    要求 Qwen 诚实作答并压低 "wait / maybe / perhaps" 概率,测试集准确率反而提升

    有网友在 Qwen 上跑测试集发现,要求模型诚实作答、对自己说出的话负责,并在实验中压低 "wait / maybe / perhaps" 这几个词的概率后,Qwen 的准确率反而提高了。该实验由 Reddit 网友完成,相关帖子获得 2 条评论、2 次转发、7 个赞和 4109 次浏览。

  2. AI科技评论AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Naive AI 发布开源模型 Naive-N0.5-Flash,并披露两项 AI 研发任务

    Naive AI 发布开源模型 Naive-N0.5-Flash,权重与推理代码以 MIT 许可证开放,API 输入每百万 Token 0.6 元、输出每百万 2.6 元。

9月26日周六
  1. Thomas Wolf(@Thom_Wolf)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM 被教会在无人类引导下自主发现有趣数学定理

    Niket Patel 展示了一种教 LLM 自主发现有趣定理的方法,提出可量化的"有趣度"指标,使发现结果的有趣度提升 4.3×,并形成自我扩展的发现循环。研究者指出,LLM 已能证明困扰数学家数十年的结果,而无需人类引导地找到有趣定理正成为新的瓶颈。

  2. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 完成 N=4 超对称杨-米尔斯九圈计算,打破八圈纪录

    Anthropic 科学博客称 Claude 在平面 N=4 超对称杨-米尔斯模型中完成了九圈散射振幅计算,此前纪录是 SLAC 的 Lance Dixon 及合作者保持的八圈。

  3. Anthropic(@AnthropicAI)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 科学博客:Claude 完成九圈散射振幅计算

    Anthropic 科学博客发布消息称,Claude 在 Claude Science 中接收一个描述九圈问题的提示词后,基本无监督运行数天,用 Dixon 及同事发展的方法解决了九圈散射振幅计算,总成本为几千美元。

9月25日周五
  1. Latent.Space(@latentspacepod)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Runway 的世界模型豪赌:视频、机器人、实时 AI 与神经操作系统

    Runway 联合创始人兼联合 CEO Anastasios Germanidis 阐述 AI 视频的终局是世界模型:Sora 曾触发 Runway 内部的生死冲刺,而扩大视频模型规模或许足以学到物理规律。他进一步提出实时生成可让世界模型充当机器人模拟器,软件的未来可能是直接以像素而非 HTML 和代码生成的界面,Runway 正朝完全神经操作系统推进。

  2. Jerry Liu(@jerryjliu0)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 研究团队详解文档抽取中的置信度校准

    LlamaIndex 研究团队发布博客,讨论校准置信度分数对文档抽取和智能体决策的价值:设定置信度阈值后可自动接受高于阈值的取值、对低于阈值的做人工复核,阈值越高可保证的精度越高,例如置信度 0.7 对应 95% 精度、0.9 对应 98% 精度,代价是更多假阴性需要人工审核。

9月24日周四
  1. Latent.Space(@latentspacepod)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Latent.Space 播客对话 TypeSafe CEO:Jev、System One Model 与可靠 AI

    Latent.Space 发布对话 TypeSafe CEO @CompleteSkeptic 的播客,其打造的产品 Jev 被明确不称作「Decision Model」。他解释 AI 能解决极难问题却仍无法自动化基础工作,Jev 面向软件内的可靠决策而非聊天,TypeSafe 拒绝公开 benchmark 和 API 层的拒绝机制,并称即便有 10 亿美元也不会从头预训练模型。

  2. 网易科技AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    曦望王湛:Token 成本是 AI 普惠的最后一公里

    曦望Sunrise联席CEO王湛在2026网易未来大会上提出,AI产业的损益表正在被Token重写,Token价格直接决定智能经济规模。他援引国家数据局数据称国内日均Token调用量已从2024年初的1000亿增至今年3月的140万亿,并判断算力结构性缺口大概率延续到2028年。曦望为此推出专为推理设计的启望S3 GPU,单卡性能为上一代5倍,单Token成本降低90%。

  3. 腾讯云开发者AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    JEV 为什么拆出判断层:从 LLM 架构演化看快慢思考分工

    TypeSafe AI 于 2026 年 9 月 15 日发布 JEV 并获 4000 万美元种子轮(DCVC 领投),该模型不生成文本,只按预先定义的问题类型返回是否概率、枚举选择或量表分值,输入定价 $0.042/百万 token、输出免费。

  4. Modal BlogAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 发布 Quail 推理引擎,把 AI-SQL 查询规划与推理引擎联合优化

    Modal 发布面向 AI-SQL 的推理引擎 Quail,将 SQL 查询规划与推理执行联合优化,在单条多表连接查询上达到每 H100 GPU 每分钟处理超 10 亿 token,比同硬件的 vLLM 基线快 10 倍以上。

  5. Fireworks AI(@FireworksAI_HQ)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks 发布基于 Kimi K3 的专用模型 Ember-1

    Fireworks Research 发布 Ember-1,一个基于 Kimi K3 构建的专用模型,目标是让每个 token 发挥更大作用。官方称其推理链更短,token 用量约减少 40%,同时保持顶级质量,模型页面见 fireworks.ai/models/firewor…。

  6. Microsoft Research BlogAI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软研究:把物理 AI 推理卸载到边缘或云端,可提升机器人成功率与续航

    微软研究发现,将物理 AI 推理从机器人板载 GPU 卸载到边缘或云端 GPU,可显著提升移动操作任务的成功率、响应速度与电池续航。测试显示,较轻 GPU 下建图与规划最多变慢 383%,导航障碍及时检测下降 30%,VLA 模型准确率下降 50%;用树莓派 5 替代板载 GPU 后,Jetson Thor 一类板载 GPU 曾使续航最多减少 160%。

9月23日周三
  1. Aravind Srinivas(@AravSrinivas)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米发布 MiMo-V2.6 Pro 与 Flash 全模态开源模型

    小米发布 MiMo-V2.6,包含 Pro 和 Flash 两个全模态模型,通过规模化强化学习推进,并可开放获取模型权重、技术报告、强化学习环境与训练代码。Pro 在多数智能体基准上与 Claude Opus 5 和 GPT-5.6 Sol 表现相当,在 Artificial Analysis 智能指数上得分 46,为开源模型中最高,同时在编码、电脑操作、3D 推理和创作能力上更强。

    为什么值得看

    小米发布 MiMo-V2.6 双版本开源权重模型,并给出与闭源前沿模型在智能体基准上的对照成绩。

  2. 字节跳动技术团队AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    TWIST 入选 ACM CCS 2026:面向云上大模型服务的隐私保护新方案

    字节跳动安全研究团队与香港城市大学联合研究的 TWIST 被 ACM CCS 2026 接收,该方案用密钥将输入 Token 与模型权重映射到同一变换空间,使云端可沿用标准推理流程处理混淆态数据。

  3. Epoch AIAI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 发布宜家组装基准 FAB:GPT-6 Astra 得分 80%

    Epoch AI 发布家具组装基准 FAB,用 60 张宜家家具组装照片(含故意设置的错误)测试模型能否识别装配错误并获得装配手册与查看工具。

  4. Modal BlogAI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 如何为万亿参数编码智能体服务万亿 token:Kimi K2.6 推理优化实践

    Modal 分享了为 Moonshot AI 的 Kimi K2.6 模型优化推理服务以支撑编码智能体的实践,单副本每用户性能提升 2.8 倍、跨用户提升 5.6 倍。

  5. Simon Willison(@simonw)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison:GPT-6 Luna 价格仅为 5.6 Luna 的一半

    Simon Willison 指出 GPT-6 Luna 的价格是 5.6 Luna 的一半,而后者在能力表现下已经相当便宜。他称 Luna 因成本与速度是自己构建产品功能时最喜欢的模型。所引 OpenAI 内容称 GPT-6 Sol 与 GPT-6 Luna 基于 GPT-6 Astra 的技术进展,相比 GPT-5.6 促销价 API 价格降低 50%,同时提升了缓存与推理效率。

  6. Milvus(@milvusio)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Milvus 团队将 Jev 集成进 DeepSearcher、MemSearch 与 Vector Graph RAG 三个开源项目

    Milvus 团队把 Jev 集成进 DeepSearcher、MemSearch 和 Vector Graph RAG 三个开源项目做验证。在 DeepSearcher 的 100 道多跳问题上,Jev 以 93.25% Recall@5 追平 DeepSeek V4 Flash,中位决策延迟从 2.23s 降至 0.55s,API 成本约为其七分之一。

  7. Greg Brockman(@gdb)AI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,API 价格较 GPT-5.6 促销价低 50%

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,两款模型基于 GPT-6 Astra 的技术进展,定位更快、更实惠,覆盖专业工作、事实性、编码、电脑操作和对齐等能力。OpenAI 同时优化了缓存和推理效率,并将节省直接传递给用户,Sol 和 Luna 的 API 价格比 GPT-5.6 促销价低 50%。

    为什么值得看

    OpenAI 发布 GPT-6 Sol 和 Luna 两款更快更便宜的模型,API 价格比 GPT-5.6 促销价低 50%,可据此判断成本结构变化。

  8. Sam Altman(@sama)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman:GPT-6 Sol 与 Luna 在智能、对齐、代码等能力上大幅超越 5.6 系列,价格减半

    Sam Altman 称 GPT-6 Sol 和 Luna 在智能、对齐、工作产出、编程、计算机操作等方面均大幅超越 5.6 系列前代模型。两者每 token 价格为前代的一半,单任务成本更低。

  9. OpenAI(@OpenAI)AI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,二者基于 GPT-6 Astra 的技术进展,将部分能力带入更快、更经济的模型以支持规模化工作。OpenAI 还提升了缓存和推理效率,Sol 与 Luna 的 API 价格比 GPT-5.6 促销价低 50%。

    为什么值得看

    OpenAI 发布 GPT-6 两个新成员,同时下调 API 价格,读者可据此比较性价比与适用规模。

  10. 屠龙之术AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AICC2026 观察:从 Chat 到 Agent,智能、算力与芯片走向何处

    AICC2026 人工智能计算大会上,播客屠龙之术梳理出三条主线:从 Chat 到 Agent 的需求侧结构性跃迁、智能从概率拟合转向可信生产、以及算力与芯片在系统、器件、生态上的突围。会上 IDC 与浪潮信息联合发布《中国人工智能计算力发展评估报告》,并提到浪潮信息的智算系统双唯进化主张与新产品、芯算一体、让计算走进存储,以及 FlagOS 生态下的国产模型与国产芯片 Day 0 适配。

9月22日周二
  1. Interconnects AI — Nathan LambertAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 的 JS Denain 与 Nathan Lambert 辩论 RSI、中美差距与模型能力参差

    Epoch AI 洞察团队负责人 JS Denain 与 Nathan Lambert 在播客中辩论了 RSI、机器人对 AI 加速的作用、中国模型落后程度以及蒸馏是否能解释这一差距。

  2. DeepLearning.AI(@DeepLearningAI)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    10,000 个 AI 智能体用 88 小时在 Lean 中攻关 Navier-Stokes 方程,引发的争议给 AI 开发者上了重要一课

    10,000 个 AI 智能体耗时 88 小时在 Lean 中形式化 Navier-Stokes 方程相关证明,由此引发的争议给 AI 开发者带来关键启示。智能体已能大规模形式化复杂数学证明,但人类评估对解释证明为何成立仍不可替代。企业数据隐私与零数据保留设置也属必需。

  3. 魔搭ModelScope社区AI 评估 · 87/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米发布并开源 Xiaomi MiMo-V2.6 系列,扩展强化学习规模

    小米团队正式发布并开源 Xiaomi MiMo-V2.6 系列,包含 Pro 和 Flash 两个原生全模态模型。

    为什么值得看

    原文给出开源模型在AA综合指数上的位置与RL算力扩展的公开细节,便于比较开源与闭源差距。

  4. 硅谷101AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    推理芯片之战:Groq、Cerebras与OpenAI三大路径及Bill Dally的设计哲学

    硅谷101对话两位AI芯片创业者,拆解推理芯片三条路径:英伟达约200亿美元与Groq达成技术授权并吸纳Jonathan Ross等核心团队,Cerebras今年6月IPO市值达670亿美元,OpenAI联手博通推出首款自研推理芯片Jalapeño,从设计到流片仅9个月。

  5. Founder ParkAI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 创始人 Diogo Almeida 谈为何做只做判断的 System 1 模型

    TypeSafe 于 9 月 15 日结束两年隐身期发布 Jev,并宣布完成由 DCVC 领投的 4000 万美元种子轮融资;创始人 Diogo Almeida 曾在 OpenAI 参与 InstructGPT、ChatGPT 和 GPT-4 研究,此次转向做一个不生成文字、只输出 Choice、Score、Noul 三种结构化判断与概率的 System 1 模型。

  6. 腾讯技术工程AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯15年资深后台工程师,转战大模型推理的抉择

    腾讯T12资深搜索后台工程师吴银光在2025年初卸下管理头衔,转入大模型推理工程团队,从性能评测、服务部署等周边工作起步并深入阅读 SGLang 源码。他梳理出推理工程入门路径:建立 Transformer 结构认知、掌握 TTFT/TPOT/QPS 等评估指标、了解 MoE 与 MLA 等结构演进,再选 PD 分离、分布式 KV Cache、推测解码等方向深挖。

  7. METRAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布 Claude Opus 5.5 部署前评估摘要

    METR 发布对 Claude Opus 5.5 的部署前评估摘要,认为该模型对 AI 研发的加速略高于 Fable 5.1,但不太可能完全自动化 AI 研发。

  8. Epoch AIAI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:AI 推理成本每季度下降约 47%,快于 DNA 测序与算力

    Epoch AI 发布研究《The plunging price of thought》,测算达到同一性能水平的 AI 推理成本自 2023 年以来约每季度下降 47%,即每年约 13 倍。

  9. 有机大橘子AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 背后的野心:用校准决策取代 RLHF,实现完全自动化

    TypeSafe 于 9 月 15 日发布首个模型 Jev,它不生成文本、只输出带置信度的判断,速度比前沿大模型快两百倍、价格便宜四百倍。CEO Diogo Almeida 认为 RLHF 把人类偏好放进训练循环,导致谄媚与幻觉,AI 因此无法离开人实现自动化,Jev 选择优化"校准的决策"这条第三条路。

  10. clem 🤗(@ClementDelangue)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米发布开源模型 MiMo-V2.6-Pro,登顶 Artificial Analysis 开源智能指数

    小米发布开源权重模型 MiMo-V2.6-Pro,在 Artificial Analysis 智能指数上得 46,成为该榜单最高分开源模型,前代 MiMo-V2.5-Pro 为 26。

  11. Jeff Dean(@JeffDean)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jeff Dean 离开 Google 后首次公开对话:谈 RSI、自动化科研与 AI 安全

    Dawn Song 与 Jeff Dean 进行了他离开供职 27 年的 Google 后的首次公开对话,回顾 MapReduce、Bigtable、TensorFlow、Mixture-of-Experts、TPU 和 Gemini 等工作。

  12. SemiAnalysisAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MoE 推理的计算与数据搬运:Prefill、Midfill、Decode 四阶段解析

    SemiAnalysis 解析 MoE 推理的计算与数据搬运,将模型服务拆为 Prefill、Midfill、Decode attention、Decode experts 四种运行模式,各自对算力、内存和网络的需求不同。

9月21日周一
  1. AI科技大本营AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Research 负责人 Yossi Matias:AI 正终结岗位头衔,初级员工要一出道就硬抗判断力

    Google Research 副总裁 Yossi Matias 在官方播客《The Google Research Podcast》首期访谈中表示,AI 正在终结"岗位头衔",以往需要熬 15 年才练出的判断力,如今初级员工一出道就得硬抗。

  2. Vercel NewsAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米 MiMo V2.6 Pro、Flash 与 Pro UltraSpeed 上线 Vercel AI Gateway

    小米 MiMo V2.6 Pro、MiMo V2.6 Flash 和 MiMo V2.6 Pro UltraSpeed 已上线 Vercel AI Gateway。

  3. 十字路口CrossingAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对谈清华叉院助理教授徐梦迪:具身智能的 In-Context Learning、世界模型与 Scaling Law 信号

    清华交叉信息研究院助理教授徐梦迪的核心研究方向是机器人的 in-context learning:让机器人到新环境后通过一两次交互当场学会新任务,且越学越快。节目录制后第二周,Generalist 发布 GEN-1.5,仅给机器人看一段 3-12 秒动作示范作为 physical prompt,不做微调、不更新参数即可当场尝试新任务,10 项任务平均成功率约 59%。

9月20日周日
  1. Yann LeCun(@ylecun)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun:自回归 LLM 本身不会通向人类级 AI

    Yann LeCun 重申"自回归 LLM 本身不会通向人类级 AI"依然成立,理由包括当前推理依赖非自回归搜索、自我改进仅在数学和代码等可自动评分的领域有效、多模态助手多用独立训练的编码器。