Gemini 3.5 Flash 正式上线 Monica AI
Gemini 3.5 Flash 已在 Monica AI 正式上线,主打极快响应速度,兼具顶级推理与多模态能力。用户可用于头脑风暴、文档分析或构建工作流,AI 助手速度显著提升。
Gemini 3.5 Flash 已在 Monica AI 正式上线,主打极快响应速度,兼具顶级推理与多模态能力。用户可用于头脑风暴、文档分析或构建工作流,AI 助手速度显著提升。
Sebastian Raschka 梳理近期开源权重模型的架构改动,指出长上下文效率成为设计重心。文章拆解 Gemma 4 的跨层 KV 共享与逐层嵌入、Laguna XS.2 的逐层注意力预算、ZAYA1-8B 的压缩卷积注意力,以及 DeepSeek V4 的 mHC 与 CSA/HCA 压缩注意力。
Andrew Ng 推出新课程 Transformers in Practice,与 AMD 合作、由 Sharon Zhou 讲授,面向实践理解 Transformer 大语言模型的工作方式。课程涵盖 token 逐个生成、注意力机制、量化加速 GPU 推理,以及模型幻觉、RAG 与链式推理等内容,并配有交互式可视化。
Google DeepMind 发布基于 Gemini 的多智能体 AI 系统 Co-Scientist,并在 Nature 发表研究,通过生成、辩论、进化三个阶段迭代产出科学假设。
Citrini Research 在最新半导体备忘录中提出"供应链继承"逻辑:AI 数据中心资本开支正直接继承电动车与太阳能产业建成的功率半导体供应链,德州仪器(TXN)、NXP 等厂商不再扩产而是提价,ASP 上行。Nvidia 2025 年 5 月关于 800V DC 机架架构的技术博客已将底层技术归功于"电动车和太阳能产业"。
Modal 介绍其五年工程积累,通过云缓冲、自定义文件系统 ImageFS、CPU 检查点/恢复和 CUDA 检查点/恢复四项优化,把推理服务副本的启动时间从约 2 千秒降到约 50 秒。
前Anthropic、现Google DeepMind研究科学家姚顺宇参与过Claude 3.7、4.5和Gemini 3的开发,他在访谈中称AI个人英雄主义时代已经过去,现在是集体主义的故事,并对神话个体的叙事保持警惕。他认为"智能涌现"本身不科学,更多是主观感觉而非客观现象,本质是技术上实现了可水平提升所有能力的scale up。
Jim Fan 在红杉 AI Ascent 演讲《Robotics: Endgame》中,把解决 Physical AGI 的路线类比 LLM 的成功路径,指出 VLA 的不足,并提出视频世界模型作为第二预训练范式、World Action Models(WAM)以及机器人数据飞轮等方向。
推理模型的并行化决策、并行线程数和协调方式目前多由外部框架预先设定,而非模型自主决定。文章梳理了并行推理由固定并行走向自适应控制的最新进展,涵盖自一致性、Best-of-N、Tree/Graph of Thoughts、MCTS,以及 ParaThinker、GroupThink、Hogwild!
Modal 工程师在 H100 上压测 Qwen2.5-VL-3B-Instruct 时,发现 SGLang 调度器的多模态请求处理存在重复调用 torch.UntypedStorage._new_shared_cuda 的开销。
Demis Hassabis 在 Y Combinator 的 How to Build the Future 节目中与 Garry Tan 对话,讨论通往 AGI 还缺什么,并指出记忆问题至今仍未解决。他还谈到 AlphaGo 如何影响 Gemini、小模型为何越来越强、持续学习与 AI 智能体的未来,以及从 AlphaFold 走向虚拟细胞。他建议创始人思考在 AGI 到来之前该构建什么。
俄亥俄州立大学计算机系教授、NeoCognition 创始人苏煜系统梳理了 Agent 技术演进史:从 Logical Agent(1960-90s)到 Neural Agent,再到 Semantic Parsing 与 Language Agent,并复盘最近三年 Language Agent 的关键工作。
Andrej Karpathy 在 Sequoia Ascent 2026 炉边谈话中提出,LLM 的意义远不止加速已有工作,并给出三个新前沿案例:可被 LLM 完全接管、无需传统代码的 menugen 应用;用 .md 技能替代 .sh 脚本的安装方式;以及处理非结构化数据、此前用传统代码根本无法实现的 LLM 知识库。
Google DeepMind CEO Demis Hassabis 在 Y Combinator 的直播访谈中表示,当前预训练加 RLHF 加思维链的范式几乎确定会成为 AGI 架构的一部分,但仍有 50% 概率需要一两个尚未发现的关键突破,持续学习、长程推理和记忆是三个未解问题。
AE Studio 在 Modal 上搭建了用强化学习训练 LLM 证明数学定理的工作流,通过 vLLM 生成 Lean 证明代码、Lean 编译器在 CPU 上验证并给出奖励信号,对比了 GRPO 与 Evolution Strategies 两种更新规则。该工作流用独立镜像分离 GPU 生成、Lean 验证与编排三种运行时,并用 .map() 并行分发每次迭代的大量独立评估。
Andrej Karpathy 在 Sequoia Capital 的 AI Ascent 访谈中表示,2025 年 12 月后最新模型生成的代码已开始直接可用,他进入凭感觉让 AI 写代码的状态。
小米大模型团队负责人罗福莉在首次长访谈中表示,OpenClaw是一个划时代的Agent框架,它通过精细编排的Context、持久记忆与多模型调度弥补了模型的能力短板,把中层模型的上限激发了出来。
DeepSeek 公布其模型的结构创新与超高上下文效率,其中包括新的注意力机制,采用 Token 级压缩与 DSA(DeepSeek Sparse Attention),官方称在长上下文下大幅降低计算与内存开销。同时 1M 上下文已成为所有 DeepSeek 官方服务的默认配置。
DeepSeek 发布 DeepSeek-V4-Flash,官方称其推理能力接近 V4-Pro,在简单 Agent 任务上与 V4-Pro 表现相当。该模型参数规模更小、响应更快,并提供高性价比的 API 定价。
官方给出轻量版本与旗舰版本的推理对比和定价定位,读者可据此判断成本与能力的取舍。
DeepSeek 发布 DeepSeek-V4-Pro。官方称其在智能体编码(Agentic Coding)基准上达到开源 SOTA,世界知识在所有开源模型中领先、仅次于 Gemini-3.1-Pro,在数学、STEM 与编码推理上超过所有现有开源模型,可对标头部闭源模型。
DeepSeek 上线并同步开源 DeepSeek-V4 预览版,包含 DeepSeek-V4-Pro 与 DeepSeek-V4-Flash 两个版本,1M 上下文成为其所有官方服务标配。
官方给出 V4 双版本的开源链接、API 与 1M 上下文配置,便于判断长上下文与 Agent 能力的实际边界。
伯克利 AI 研究博客提出 GRASP,一种针对学习动力学(世界模型)的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、直接向状态迭代注入随机性以探索,并重塑梯度让动作获得清晰信号同时避开高维视觉模型中的状态输入梯度。
黄仁勋接受 Dwarkesh Patel 两小时专访,回应了 Nvidia 是否会被商品化、CUDA 是否为技术锁定、TPU 与 Trainium 的竞争以及对华出口管制等问题。他认为 Anthropic 使用 TPU 和 Trainium 是缺乏 Nvidia 早期投资的特殊个案,出口限制挡不住中国 AI 发展反而会推动其芯片自主化,并称推理市场已进入按响应速度分档定价的时代。
Anthropic 发布 Claude Opus 4.7,称为目前能力最强的 Opus 模型,能更严谨地处理长时间运行任务、更精确地遵循指令,并在汇报前自行核验输出结果。Alex Albert 补充了他喜欢的几点:擅长异步工作和遵循指令、努力等级(effort levels)让 token 控制更可预测并新增 xhigh 等级、不再对高分辨率图像做降采样、在 UI、幻灯片和文档上的品味明显提升。
Andrew Ng 推出与 LMSys、RadixArk 合作的新短课程《Efficient Inference with SGLang:文本与图像生成》,由 RadixArk 技术团队成员 Richard Chen 授课。课程围绕开源推理框架 SGLang 的缓存复用机制展开,讲解如何用 RadixAttention 让共享上下文只处理一次,并借助缓存与多 GPU 并行加速扩散模型图像生成。
OpenAI 用内部模型一次性解决了五个新的 Erdős 问题,相关论文已发布在 arXiv(2604.06609)。其中 Erdős Problem 1091 被解决:该猜想问的是色数为 4、且所有小子图色数不超过 3 的图是否必含带多条对角线的奇环,模型给出了反例。论文 Figure 5 由 Codex 生成,随模型进步,证明也变得更优雅。
Poe 宣布 Gemma 4 已在其平台上线,该模型被描述为 Google 目前能力最强的开放模型,拥有 31B 稠密参数、256K 上下文窗口、支持 140 多种语言。它支持多模态输入、内置思维链推理和函数调用,采用 Apache 2.0 许可,可在各平台的 Poe 应用及 Poe API 中使用。
Qwen3.6 Plus 已在 Poe 全平台及 Poe API 上线。该模型主打视觉-语言能力,在智能体、前端编码等代码密集型工作流中有明显提升,并增强了多模态理解,包括改进的 OCR 和精准目标定位,面向需要编码支持与视觉推理兼顾的开发者。
METR 对 GPT-OSS-20B、GPT-OSS-120B、Qwen-3-8B、Qwen-3-32B 四个推理模型做小样本微调(240 条样本、约 100K-300K tokens),在分布外 CoTControl 评测集上平均 CoT 可控性从 2.9% 升至 8.8%。
Kevin Weil 引用 Mehtaab Sawhney 的推文称,一篇新论文解决了三个 Erdős 问题,每个解均由 OpenAI 内部模型找到,且证明简短优雅,论文见 arxiv.org/pdf/2603.29961。他表示不仅 AI 正在解决更多开放问题,随着模型改进其证明也变得更优雅。
OpenAI 总裁 Greg Brockman 在 Big Technology Podcast 中证实下一代预训练基础模型 Spud 已完成预训练,凝聚约两年研究成果,同时将 ChatGPT、编程 Agent Codex 和浏览器 Atlas 合并为统一 Super App,预计未来几个月内交付。
Andrej Karpathy 用 LLM 花 4 小时细致打磨一篇博客文章的论证,效果令他满意;随后让 LLM 论证相反立场,结果 LLM 彻底推翻原论证并说服了他。他指出 LLM 被追问时会给出观点,却几乎能为任何方向出色论证,是形成个人观点的有用工具,但需多问不同方向并警惕谄媚倾向。
Sebastian Raschka 发布 LLM 架构画廊,收录 45 个架构并配可视化模型卡,同时推出 Redbubble 海报版。文章借此梳理现代开源权重模型中的注意力变体,从标准多头注意力(MHA)讲起,示例架构包括 GPT-2、OLMo 2 7B 和 OLMo 3 7B,并延伸到分组查询注意力、滑动窗口注意力等概念。
小米 MiMo V2 系列模型已在 Poe 上线,包括主打快速低成本的 MiMo‑V2‑Flash、面向图文音视频混合媒体的 MiMo‑V2‑Omni,以及上下文最高 1M tokens 的 MiMo‑V2‑Pro。Pro 可读取大型代码库与长报告、规划多步智能体任务并执行深度研究,Flash 适合文档摘要、代码重构与批量工单处理等高吞吐场景。
Mistral Small 4 已在 Poe 上线,用单一模型覆盖推理、视觉和智能体编程(agentic coding)。官方称其适合多步数学或研究问题求解、从图像或扫描文档中提取结构化数据、调试与浏览代码库、分析图表并总结要点、解析密集 PDF 并提取关键信息。用户可在各平台的 Poe app 和 Poe API 中使用。
Flowise 发布 3.1.0 版本,距上版 3.0.13 已有一段时间,本次重点升级核心依赖与 AI SDK,新增对 GPT-5.4、Claude 4.6、Gemini 3.1 的支持,三者均支持内置工具。新版本还带来面向高级 AI 工作流的推理支持和 token 成本追踪,并大幅强化安全性,部分防护已默认开启,破坏性变更需查阅发布说明。
伯克利 AI 研究团队提出 SPEX 与 ProxySPEX 算法,用于在特征、数据和模型组件三类归因中大规模识别 LLM 的关键交互。SPEX 利用交互的稀疏性与低阶性,将搜索问题转化为稀疏恢复问题;ProxySPEX 进一步利用层级结构,在约少 10 倍消融次数下达到 SPEX 的性能。
稀疏嵌入经微调后在 Amazon ESCI 数据集上相对 BM25 实现 17% 的提升。稀疏向量维度约 3 万、每个商品仅 100-400 个非零值,用倒排索引做精确匹配,能区分「iPhone 15 Pro Max 256GB」与 128GB 这类稠密嵌入会混淆的细节。
Sebastian Raschka 按时间顺序盘点了 2026 年 1-2 月发布的 10 个开源权重模型架构,包括 Arcee AI Trinity Large(400B MoE。
吴恩达转发并称赞 Inception Labs 的扩散 LLM 推理速度,认为扩散 LLM 是自回归 LLM 之外一条值得关注的替代路线。被引推文中 Stefano Ermon 宣布 Mercury 2 上线,称其为全球首个推理扩散 LLM,性能比主打速度优化的领先 LLM 快 5 倍。