跳到正文

#推理

今日 17 条
5月20日周三
  1. Monica_IM(@hey_im_monica)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.5 Flash 正式上线 Monica AI

    Gemini 3.5 Flash 已在 Monica AI 正式上线,主打极快响应速度,兼具顶级推理与多模态能力。用户可用于头脑风暴、文档分析或构建工作流,AI 助手速度显著提升。

5月16日周六
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM 架构新动向:KV 共享、mHC 与压缩注意力

    Sebastian Raschka 梳理近期开源权重模型的架构改动,指出长上下文效率成为设计重心。文章拆解 Gemma 4 的跨层 KV 共享与逐层嵌入、Laguna XS.2 的逐层注意力预算、ZAYA1-8B 的压缩卷积注意力,以及 DeepSeek V4 的 mHC 与 CSA/HCA 压缩注意力。

5月15日周五
  1. Andrew Ng(@AndrewYNg)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrew Ng 推出新课 Transformers in Practice,与 AMD 合作讲解 Transformer 推理

    Andrew Ng 推出新课程 Transformers in Practice,与 AMD 合作、由 Sharon Zhou 讲授,面向实践理解 Transformer 大语言模型的工作方式。课程涵盖 token 逐个生成、注意力机制、量化加速 GPU 推理,以及模型幻觉、RAG 与链式推理等内容,并配有交互式可视化。

5月12日周二
  1. Google DeepMind BlogAI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布基于 Gemini 的多智能体科研系统 Co-Scientist

    Google DeepMind 发布基于 Gemini 的多智能体 AI 系统 Co-Scientist,并在 Nature 发表研究,通过生成、辩论、进化三个阶段迭代产出科学假设。

  2. Citrini ResearchAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Citrini Research 半导体备忘录:供应链继承

    Citrini Research 在最新半导体备忘录中提出"供应链继承"逻辑:AI 数据中心资本开支正直接继承电动车与太阳能产业建成的功率半导体供应链,德州仪器(TXN)、NXP 等厂商不再扩产而是提价,ASP 上行。Nvidia 2025 年 5 月关于 800V DC 机架架构的技术博客已将底层技术归功于"电动车和太阳能产业"。

  3. Modal BlogAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 如何实现真正的无服务器 GPU:把推理冷启动从 2 千秒压到 50 秒

    Modal 介绍其五年工程积累,通过云缓冲、自定义文件系统 ImageFS、CPU 检查点/恢复和 CUDA 检查点/恢复四项优化,把推理服务副本的启动时间从约 2 千秒降到约 50 秒。

5月11日周一
  1. 语言即世界language is worldAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    独家对话姚顺宇:从Anthropic到Google DeepMind,AI个人英雄主义时代已过去

    前Anthropic、现Google DeepMind研究科学家姚顺宇参与过Claude 3.7、4.5和Gemini 3的开发,他在访谈中称AI个人英雄主义时代已经过去,现在是集体主义的故事,并对神话个体的叙事保持警惕。他认为"智能涌现"本身不科学,更多是主观感觉而非客观现象,本质是技术上实现了可水平提升所有能力的scale up。

5月8日周五
  1. Jim Fan(@DrJimFan)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 谈机器人终局:从 VLA 到世界动作模型 WAM 的 Physical AGI 路线图

    Jim Fan 在红杉 AI Ascent 演讲《Robotics: Endgame》中,把解决 Physical AGI 的路线类比 LLM 的成功路径,指出 VLA 的不足,并提出视频世界模型作为第二预训练范式、World Action Models(WAM)以及机器人数据飞轮等方向。

  2. Berkeley AI Research BlogAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    自适应并行推理:高效推理扩展的下一个范式

    推理模型的并行化决策、并行线程数和协调方式目前多由外部框架预先设定,而非模型自主决定。文章梳理了并行推理由固定并行走向自适应控制的最新进展,涵盖自一致性、Best-of-N、Tree/Graph of Thoughts、MCTS,以及 ParaThinker、GroupThink、Hogwild!

5月4日周一
  1. Modal BlogAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 用单个 Python 字典将 SGLang 多模态推理性能提升超 10%

    Modal 工程师在 H100 上压测 Qwen2.5-VL-3B-Instruct 时,发现 SGLang 调度器的多模态请求处理存在重复调用 torch.UntypedStorage._new_shared_cuda 的开销。

5月2日周六
  1. Demis Hassabis(@demishassabis)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Demis Hassabis 谈 AGI 缺失环节、记忆难题与 AlphaFold 之后的下一个突破

    Demis Hassabis 在 Y Combinator 的 How to Build the Future 节目中与 Garry Tan 对话,讨论通往 AGI 还缺什么,并指出记忆问题至今仍未解决。他还谈到 AlphaGo 如何影响 Gemini、小模型为何越来越强、持续学习与 AI 智能体的未来,以及从 AlphaFold 走向虚拟细胞。他建议创始人思考在 AGI 到来之前该构建什么。

5月1日周五
  1. 张小珺Jùn|商业访谈录AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    和苏煜聊 Agent 技术史:从 Logical Agent 到 Language Agent,以及 OpenClaw Moment

    俄亥俄州立大学计算机系教授、NeoCognition 创始人苏煜系统梳理了 Agent 技术演进史:从 Logical Agent(1960-90s)到 Neural Agent,再到 Semantic Parsing 与 Language Agent,并复盘最近三年 Language Agent 的关键工作。

  2. Andrej Karpathy(@karpathy)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy 谈 LLM 新前沿:menugen、.md 技能安装与 LLM 知识库

    Andrej Karpathy 在 Sequoia Ascent 2026 炉边谈话中提出,LLM 的意义远不止加速已有工作,并给出三个新前沿案例:可被 LLM 完全接管、无需传统代码的 menugen 应用;用 .md 技能替代 .sh 脚本的安装方式;以及处理非结构化数据、此前用传统代码根本无法实现的 LLM 知识库。

4月30日周四
  1. 宝玉的分享AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Demis Hassabis 谈 AGI 还缺什么、智能体行不行与下一个科学突破

    Google DeepMind CEO Demis Hassabis 在 Y Combinator 的直播访谈中表示,当前预训练加 RLHF 加思维链的范式几乎确定会成为 AGI 架构的一部分,但仍有 50% 概率需要一两个尚未发现的关键突破,持续学习、长程推理和记忆是三个未解问题。

4月29日周三
  1. Modal BlogAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    在 Modal 上构建基于强化学习的定理证明工作流

    AE Studio 在 Modal 上搭建了用强化学习训练 LLM 证明数学定理的工作流,通过 vLLM 生成 Lean 证明代码、Lean 编译器在 CPU 上验证并给出奖励信号,对比了 GRPO 与 Evolution Strategies 两种更新规则。该工作流用独立镜像分离 GPU 生成、Lean 验证与编排三种运行时,并用 .map() 并行分发每次迭代的大量独立评估。

  2. 宝玉的分享AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy 最新访谈:Vibe Coding 只是开始,真正重要的是 Agentic Engineering

    Andrej Karpathy 在 Sequoia Capital 的 AI Ascent 访谈中表示,2025 年 12 月后最新模型生成的代码已开始直接可用,他进入凭感觉让 AI 写代码的状态。

4月24日周五
  1. 语言即世界language is worldAI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    独家对话罗福莉:OpenClaw触发AI范式巨变,Agent时代1T基座只是入场券

    小米大模型团队负责人罗福莉在首次长访谈中表示,OpenClaw是一个划时代的Agent框架,它通过精细编排的Context、持久记忆与多模型调度弥补了模型的能力短板,把中层模型的上限激发了出来。

  2. DeepSeek(@deepseek_ai)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 公布注意力结构创新,1M 上下文成为官方服务默认

    DeepSeek 公布其模型的结构创新与超高上下文效率,其中包括新的注意力机制,采用 Token 级压缩与 DSA(DeepSeek Sparse Attention),官方称在长上下文下大幅降低计算与内存开销。同时 1M 上下文已成为所有 DeepSeek 官方服务的默认配置。

  3. DeepSeek(@deepseek_ai)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 V4-Flash 模型

    DeepSeek 发布 DeepSeek-V4-Flash,官方称其推理能力接近 V4-Pro,在简单 Agent 任务上与 V4-Pro 表现相当。该模型参数规模更小、响应更快,并提供高性价比的 API 定价。

    为什么值得看

    官方给出轻量版本与旗舰版本的推理对比和定价定位,读者可据此判断成本与能力的取舍。

  4. DeepSeek(@deepseek_ai)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 DeepSeek-V4-Pro,称在智能体编码基准上取得开源 SOTA

    DeepSeek 发布 DeepSeek-V4-Pro。官方称其在智能体编码(Agentic Coding)基准上达到开源 SOTA,世界知识在所有开源模型中领先、仅次于 Gemini-3.1-Pro,在数学、STEM 与编码推理上超过所有现有开源模型,可对标头部闭源模型。

  5. DeepSeekAI 评估 · 92/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布并开源 DeepSeek-V4 预览版,标配 1M 上下文

    DeepSeek 上线并同步开源 DeepSeek-V4 预览版,包含 DeepSeek-V4-Pro 与 DeepSeek-V4-Flash 两个版本,1M 上下文成为其所有官方服务标配。

    为什么值得看

    官方给出 V4 双版本的开源链接、API 与 1M 上下文配置,便于判断长上下文与 Agent 能力的实际边界。

4月20日周一
  1. Berkeley AI Research BlogAI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GRASP:面向世界模型的基于梯度的长时程规划方法

    伯克利 AI 研究博客提出 GRASP,一种针对学习动力学(世界模型)的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、直接向状态迭代注入随机性以探索,并重塑梯度让动作获得清晰信号同时避开高维视觉模型中的状态输入梯度。

4月17日周五
  1. 宝玉的分享AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    两小时激辩:黄仁勋为什么不怕 TPU、不怕华为、不怕出口管制?

    黄仁勋接受 Dwarkesh Patel 两小时专访,回应了 Nvidia 是否会被商品化、CUDA 是否为技术锁定、TPU 与 Trainium 的竞争以及对华出口管制等问题。他认为 Anthropic 使用 TPU 和 Trainium 是缺乏 Nvidia 早期投资的特殊个案,出口限制挡不住中国 AI 发展反而会推动其芯片自主化,并称推理市场已进入按响应速度分档定价的时代。

4月16日周四
  1. Alex Albert(@alexalbert__)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 4.7 发布:强化异步任务执行与 token 控制

    Anthropic 发布 Claude Opus 4.7,称为目前能力最强的 Opus 模型,能更严谨地处理长时间运行任务、更精确地遵循指令,并在汇报前自行核验输出结果。Alex Albert 补充了他喜欢的几点:擅长异步工作和遵循指令、努力等级(effort levels)让 token 控制更可预测并新增 xhigh 等级、不再对高分辨率图像做降采样、在 UI、幻灯片和文档上的品味明显提升。

4月10日周五
  1. Andrew Ng(@AndrewYNg)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrew Ng 新课:用 SGLang 实现高效的文本与图像生成推理

    Andrew Ng 推出与 LMSys、RadixArk 合作的新短课程《Efficient Inference with SGLang:文本与图像生成》,由 RadixArk 技术团队成员 Richard Chen 授课。课程围绕开源推理框架 SGLang 的缓存复用机制展开,讲解如何用 RadixAttention 让共享上下文只处理一次,并借助缓存与多 GPU 并行加速扩散模型图像生成。

4月9日周四
  1. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 内部模型一次解决五个 Erdős 问题,证明随模型进步愈发优雅

    OpenAI 用内部模型一次性解决了五个新的 Erdős 问题,相关论文已发布在 arXiv(2604.06609)。其中 Erdős Problem 1091 被解决:该猜想问的是色数为 4、且所有小子图色数不超过 3 的图是否必含带多条对角线的奇环,模型给出了反例。论文 Figure 5 由 Codex 生成,随模型进步,证明也变得更优雅。

4月4日周六
  1. Poe(@poe_platform)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemma 4 上线 Poe:31B 稠密参数、256K 上下文,Apache 2.0 授权

    Poe 宣布 Gemma 4 已在其平台上线,该模型被描述为 Google 目前能力最强的开放模型,拥有 31B 稠密参数、256K 上下文窗口、支持 140 多种语言。它支持多模态输入、内置思维链推理和函数调用,采用 Apache 2.0 许可,可在各平台的 Poe 应用及 Poe API 中使用。

4月3日周五
  1. Poe(@poe_platform)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.6 Plus 上线 Poe,强化智能体与前端编码

    Qwen3.6 Plus 已在 Poe 全平台及 Poe API 上线。该模型主打视觉-语言能力,在智能体、前端编码等代码密集型工作流中有明显提升,并增强了多模态理解,包括改进的 OCR 和精准目标定位,面向需要编码支持与视觉推理兼顾的开发者。

4月1日周三
  1. METRAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 实验:少量微调即可提升推理模型 CoT 可控性

    METR 对 GPT-OSS-20B、GPT-OSS-120B、Qwen-3-8B、Qwen-3-32B 四个推理模型做小样本微调(240 条样本、约 100K-300K tokens),在分布外 CoTControl 评测集上平均 CoT 可控性从 2.9% 升至 8.8%。

  2. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 内部模型解出三个 Erdős 问题,证明随模型改进更优雅

    Kevin Weil 引用 Mehtaab Sawhney 的推文称,一篇新论文解决了三个 Erdős 问题,每个解均由 OpenAI 内部模型找到,且证明简短优雅,论文见 arxiv.org/pdf/2603.29961。他表示不仅 AI 正在解决更多开放问题,随着模型改进其证明也变得更优雅。

  3. 宝玉的分享AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 总裁 Greg Brockman 谈砍掉 Sora、Super App、Spud 与 AGI 之路

    OpenAI 总裁 Greg Brockman 在 Big Technology Podcast 中证实下一代预训练基础模型 Spud 已完成预训练,凝聚约两年研究成果,同时将 ChatGPT、编程 Agent Codex 和浏览器 Atlas 合并为统一 Super App,预计未来几个月内交付。

3月28日周六
  1. Andrej Karpathy(@karpathy)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrej Karpathy:让 LLM 论证 4 小时,再让它反驳,自己反被说服

    Andrej Karpathy 用 LLM 花 4 小时细致打磨一篇博客文章的论证,效果令他满意;随后让 LLM 论证相反立场,结果 LLM 彻底推翻原论证并说服了他。他指出 LLM 被追问时会给出观点,却几乎能为任何方向出色论证,是形成个人观点的有用工具,但需多问不同方向并警惕谄媚倾向。

3月22日周日
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    现代 LLM 注意力变体视觉指南:MHA、GQA 与滑动窗口注意力

    Sebastian Raschka 发布 LLM 架构画廊,收录 45 个架构并配可视化模型卡,同时推出 Redbubble 海报版。文章借此梳理现代开源权重模型中的注意力变体,从标准多头注意力(MHA)讲起,示例架构包括 GPT-2、OLMo 2 7B 和 OLMo 3 7B,并延伸到分组查询注意力、滑动窗口注意力等概念。

3月21日周六
  1. Poe(@poe_platform)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米 MiMo V2 系列模型上线 Poe,含 Flash、Omni、Pro 三款

    小米 MiMo V2 系列模型已在 Poe 上线,包括主打快速低成本的 MiMo‑V2‑Flash、面向图文音视频混合媒体的 MiMo‑V2‑Omni,以及上下文最高 1M tokens 的 MiMo‑V2‑Pro。Pro 可读取大型代码库与长报告、规划多步智能体任务并执行深度研究,Flash 适合文档摘要、代码重构与批量工单处理等高吞吐场景。

3月19日周四
  1. Poe(@poe_platform)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral Small 4 上线 Poe:一个模型兼顾推理、视觉与智能体编程

    Mistral Small 4 已在 Poe 上线,用单一模型覆盖推理、视觉和智能体编程(agentic coding)。官方称其适合多步数学或研究问题求解、从图像或扫描文档中提取结构化数据、调试与浏览代码库、分析图表并总结要点、解析密集 PDF 并提取关键信息。用户可在各平台的 Poe app 和 Poe API 中使用。

3月17日周二
  1. FlowiseAI(@FlowiseAI)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Flowise 3.1.0 发布:支持 GPT-5.4、Claude 4.6、Gemini 3.1

    Flowise 发布 3.1.0 版本,距上版 3.0.13 已有一段时间,本次重点升级核心依赖与 AI SDK,新增对 GPT-5.4、Claude 4.6、Gemini 3.1 的支持,三者均支持内置工具。新版本还带来面向高级 AI 工作流的推理支持和 token 成本追踪,并大幅强化安全性,部分防护已默认开启,破坏性变更需查阅发布说明。

3月13日周五
  1. Berkeley AI Research BlogAI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Berkeley 提出 SPEX 与 ProxySPEX:大规模识别 LLM 关键交互

    伯克利 AI 研究团队提出 SPEX 与 ProxySPEX 算法,用于在特征、数据和模型组件三类归因中大规模识别 LLM 的关键交互。SPEX 利用交互的稀疏性与低阶性,将搜索问题转化为稀疏恢复问题;ProxySPEX 进一步利用层级结构,在约少 10 倍消融次数下达到 SPEX 的性能。

3月9日周一
  1. QdrantAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么稀疏嵌入在电商搜索中胜过 BM25:微调 SPLADE 教程第一部分

    稀疏嵌入经微调后在 Amazon ESCI 数据集上相对 BM25 实现 17% 的提升。稀疏向量维度约 3 万、每个商品仅 100-400 个非零值,用倒排索引做精确匹配,能区分「iPhone 15 Pro Max 256GB」与 128GB 这类稠密嵌入会混淆的细节。

2月25日周三
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    2026 年 1-2 月开源权重 LLM 十大架构盘点:Trinity Large、Kimi K2.5、GLM-5、Qwen 3.5 等

    Sebastian Raschka 按时间顺序盘点了 2026 年 1-2 月发布的 10 个开源权重模型架构,包括 Arcee AI Trinity Large(400B MoE。

  2. Andrew Ng(@AndrewYNg)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Inception Labs 发布 Mercury 2 推理扩散 LLM,称速度达同类 5 倍

    吴恩达转发并称赞 Inception Labs 的扩散 LLM 推理速度,认为扩散 LLM 是自回归 LLM 之外一条值得关注的替代路线。被引推文中 Stefano Ermon 宣布 Mercury 2 上线,称其为全球首个推理扩散 LLM,性能比主打速度优化的领先 LLM 快 5 倍。