从狩猎到"认知农业":推理正被农场化、包装与分发
我们曾靠狩猎为生,后来发明农业,如今牛肉已被预先屠宰、包装分发作"牛排"。类似地,人类正在发明"认知农业"——推理正被农场化、包装和分发,人们将像珍视把生食变成佳肴的厨师那样,珍视把原始智能转化为可消费内容的人。
我们曾靠狩猎为生,后来发明农业,如今牛肉已被预先屠宰、包装分发作"牛排"。类似地,人类正在发明"认知农业"——推理正被农场化、包装和分发,人们将像珍视把生食变成佳肴的厨师那样,珍视把原始智能转化为可消费内容的人。
Taalas Inc. 发布公司首款产品,并演示了聊天机器人与 API 接入入口。该推文引述其官方说法称价格为每 100 万 tokens 0.0075 美元,公司规模为 24 名专职人员,开发投入 3000 万美元,强调极端专用化、速度与能效。
一段演示显示,速度参照眨眼约 0.4 秒,一本完整小说约 7 秒、Harry Potter and the Goblet of Fire 约 16 秒、一部电影长片剧本约 2 秒、10 万行代码约 38 秒。该演示由 xgo.ing 提供支持。
具身智能正从规则驱动、数据驱动走向以 VLA 为代表的认知驱动,VLA 本质是「认知-推理-决策」框架。
Lex Fridman 与机器学习研究者 Sebastian Raschka、Nathan Lambert 展开一场覆盖 2026 年 AI 全景的对话,涵盖技术突破、scaling laws、开源与闭源 LLM、编程开发工具(Claude Code、Cursor)、中美竞争,以及预训练、中期训练、后训练流程。
推理时扩展已成为提升已部署 LLM 答案质量与准确率的最有效手段之一,通过在使用模型生成文本时投入更多算力和时间换取更好结果,当前各大 LLM 提供商均依赖某种形式的推理时扩展。
Aman Sanger 认为,距离出现一个「ChatGPT 智能门槛」只剩几个月——届时超过 95% 的同步编码查询不会因模型更聪明而明显改善,更多智能只对需开发者花费数小时的异步任务有意义。他指出,大量 UI 工作的瓶颈是用户意图而非智能或任务时长,速度因此重要得多,他期待达到 Composer-1 速度的前沿模型。
2025 年 LLM 发展由推理模型主导,DeepSeek R1 证明推理行为可通过强化学习培养,并以开放权重达到当时顶级专有模型水平。其采用的 RLVR 与 GRPO 成为年度核心训练方法,此后各主要厂商纷纷推出推理变体;DeepSeek V3 的 671B 参数训练成本估算约 500 万美元,R1 在其之上再训约 29.4 万美元。
Sebastian Raschka 整理并发布了 2025 年 7 月至 12 月的 LLM 研究论文书签清单,涵盖推理模型训练、推理时推理策略、LLM 评估与推理理解、其他强化学习方法、模型发布与技术报告、架构、高效训练、扩散语言模型、多模态与视觉语言模型、数据与预训练数据集等类别。
Sebastian Raschka 撰文梳理 DeepSeek V3 到 V3.2 的技术演进,核心变化是 V3.2 沿用 V3.2-Exp 的架构,加入 DeepSeek Sparse Attention(DSA)型稀疏注意力以降低长上下文下的训练与推理成本,注意力复杂度从 O(L²) 降到 O(Lk),其中 k 在官方代码中设为 2048。
梳理从 V3 到 V3.2 的架构与训练变化,读者可对照前代理解稀疏注意力和 RL 的具体改动。
DeepSeek 发布 DeepSeek-V3.2 与 DeepSeek-V3.2-Speciale 两款推理优先的模型,面向智能体场景。DeepSeek-V3.2 是 V3.2-Exp 的正式后继版本,已在 App、Web 和 API 上线;DeepSeek-V3.2-Speciale 进一步推高推理能力,目前仅提供 API。
DeepSeek 发布两个正式版模型 DeepSeek-V3.2 和 DeepSeek-V3.2-Speciale,网页端、App 与 API 均已升级为正式版 V3.2,Speciale 仅以临时 API 形式开放供评测研究。
官方给出两个版本的定位与评测差异,读者可据此判断日常使用与高难度任务该选哪一个。
Google DeepMind 机器人团队高级研究科学家兼技术负责人谭捷接受张小珺访谈,回顾其从图形学转向机器人、在 Google 第一篇 sim-to-real 强化学习论文,以及团队从 10 人扩至 150 人的过程。
Reducto 将 30+ 模型的推理负载迁移到 Modal 后,P90 延迟降低 3 倍,借助 GPU 内存快照把冷启动从约 70s 缩短到约 12s,降幅 83%。Reducto 通过按客户参数化独立扩缩容、按区域固定延迟敏感函数,实现各客户负载隔离。一次 100k 页/分钟的企业压测中,其摄入流水线在不到一小时内扩展到 1000+ GPU 并顺利缩容。
Gemini 3 Pro 相比 Gemini 2.5 Pro 实现输出保真度跃升,得益于更强的多模态理解与 3D 推理能力。该对比通过两款模型的最佳输出示例直观呈现了这一差距。
Modal 详解推理中的 host overhead:GPU 因等待 CPU 准备任务而空转,表现为 GPU kernel 利用率偏低。若 host overhead 达 50%,GPU 成本将翻倍,而 GPU 成本通常是推理成本的主要来源。
自动驾驶长期依赖数据飞轮与端到端模型,通过挖掘海量路测数据打补丁来提升能力,但这一数据优先路径正遭遇瓶颈:长尾场景成本剧增、泛化能力受限。作者主张从自动驾驶2.0的“数据优先”转向以推理为核心的3.0,需要推理能力、常识、长时程记忆与解释交互四大支柱。英伟达2025年10月发布Alpamayo-R1,将显式因果推理与轨迹规划整合进统一VLA架构;特斯拉也计划在下一代FSD中引入推理增强。
Decagon 与 Modal 合作训练紧凑开源模型并结合定制 draft 模型与运行时优化,使 Decagon Voice 2.0 延迟降低 65%,意图识别与回复质量显著提升。其定制 EAGLE3 draft 模型接受长度比开源基线高 38%,Modal 为 SGLang 构建异步调度器,消除 H200 GPU 空闲时间并将吞吐提升最高 12%,相关改动已向上游提交 PR。
当前最强的开源权重 LLM,从 DeepSeek R1 到 MiniMax-M2,仍基于自回归 decoder 式 Transformer 与多头注意力机制,但文本扩散模型、线性注意力混合架构等替代方案近年来不断涌现。
Berkeley AI Research 提出一种不基于时序差分(TD)学习的强化学习范式——分治法。该方法通过将轨迹对半切分、用两段子轨迹的值相乘来更新整体价值,理论上可将 Bellman 递归次数从线性降为对数级,缓解 TD 学习中误差随时长累积的问题。
Thinking Machines 发布最新文章,探讨 on-policy distillation 这一训练方法,将 RL 的纠错相关性与 SFT 的奖励密度结合。
Thinking Machines 发布文章系统讲解 on-policy 蒸馏,即从学生模型采样轨迹、再由教师模型对每个 token 打分,结合了 on-policy 训练的相关性与蒸馏的稠密奖励信号。
Monica AI 新增 Claude 4.5 Sonnet,主打复杂推理与编码的自主能力,同时上线 Google Nano Banana,定位超轻量、超快速的图像编辑并保持创作一致性。两款模型现已在 monica.im 开放试用。
DeepSeek 发布最新实验模型 DeepSeek-V3.2-Exp,基于 V3.1-Terminus 构建,首次引入 DeepSeek Sparse Attention(DSA),用于在长上下文场景下实现更快、更高效的训练和推理。该模型已在 App、Web 和 API 上线,API 价格下调 50% 以上。
DeepSeek 正式发布实验性模型 DeepSeek-V3.2-Exp,在 V3.1-Terminus 基础上引入 DeepSeek Sparse Attention 稀疏注意力机制,针对长文本训练和推理效率进行优化,公开评测集上表现与 V3.1-Terminus 基本持平。
官方说明稀疏注意力机制在长文本训练推理上的提效路径,以及 API 降价带来的成本变化。
Thinking Machines 发布文章解释 LLM 推理不确定性的真正来源并非浮点并发累加,而是 kernel 缺乏 batch invariance,负载变化导致 batch size 变化进而改变归约顺序。
METR 复现并扩展了 GDM 论文第 5 节的实验,用 Claude 4 Sonnet、Claude 3.7 Sonnet 和 GPT-4o 作为 actor 模型、用 GPT-4o、GPT-4o-mini、o3、Gemini 2.0 Flash 和 Gemini 2.5 Pro 作为监控模型,发现模型即使面对比自己弱的监控模型也难以在不显著损失准确率的情况下掩盖推理。
DeepSeek 发布 DeepSeek-V3.1,官方称这是其迈向智能体时代的第一步。该模型支持 Think 与 Non-Think 混合推理,一个模型两种模式;DeepSeek-V3.1-Think 相比 DeepSeek-R1-0528 用时更短即可给出答案,后训练增强了工具调用与多步智能体任务能力。
OpenAI 本周发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重模型,这是其自 2019 年 GPT-2 以来首次公开完整的开放权重模型。
METR 发布研究指出,LLM 的思维链(CoT)虽不总是忠实反映全部推理步骤,但在需要 CoT 才能完成的复杂推理中仍有很高信息量。
Lilian Weng 表示,智能与能力能否跨领域、跨技能迁移仍是未解之谜,从早期的元学习到近期"解数学题是否有助于写好文章"的问题都属此列。她称自己因所见证据不足而略感悲观,并在帖中征集关于泛化这一主题的论文与线索。
DeepSeek 发布 DeepSeek-R1-0528,称在基准性能、前端能力上有提升,并减少了模型幻觉。该版本支持 JSON 输出与函数调用,API 用法不变,模型已在 Hugging Face 开源,可通过 chat.deepseek.com 试用。
Lilian Weng 发布新文章《Why we think》,主题是让模型在预测前获得更多思考时间,例如通过 smart decoding、chain-of-thoughts 推理和 latent thoughts 等方式。她认为这类方法对解锁下一级智能相当有效。
OpenAI o3 可对复杂任务进行推理,并帮助自动化多步骤工作流。
Lilian Weng 撰文综述测试时计算与思维链推理的近期进展,解释让模型想更久为何有效。文章从心理学类比、算力资源和隐变量建模三方面给出动机,梳理并行采样与顺序修订两类解码策略,并分析 DeepSeek-R1 等基于 RL 的推理训练方法。文中还讨论思维链忠实性的失败模式,以及连续空间思考、思考 token 和测试时计算缩放规律等方向,并列出待解开放问题。
DeepSeek 发布 DeepSeek-V3-0324,在推理性能、前端开发能力和工具调用能力上均有提升。官方建议非复杂推理任务直接使用 V3 并关闭 DeepThink,API 用法保持不变。该版本模型已在 Hugging Face 开源,采用与 DeepSeek-R1 相同的 MIT License。
官方一次给出推理、前端开发与工具调用三项能力变化,并说明 API 不变、改用 MIT 许可,读者可据此判断接入成本。
前 OpenAI 研究员 Richard Ngo 离职后转向独立研究,主攻"无尺度智能能动性理论",并提出名为 coalitional agency 的新构想。他认为现有两大候选理论——期望效用最大化(EUM)和主动推理(active inference)都不够完善:EUM 将信念与目标割裂、难以刻画长期学习过程,主动推理则源自神经科学,以预测编码统一信念与目标。
DeepSeek 春节前夕发布的开源推理模型 DeepSeek R1,在数学、代码和推理能力上比肩 OpenAI o1 正式版,同时以极低训练推理成本和完全开源引发全球关注。OnBoard! 邀请 TinyZero 一作、CMU 研究 Long CoT 的研究员及 HuggingFace 资深工程师,从强化学习、Long CoT、infra 和开源角度解析其技术创新与生态影响。
DeepSeek 开源周第 6 天发布 DeepSeek-V3/R1 推理系统概览,通过跨节点 EP 批扩展、计算通信重叠和负载均衡优化吞吐与延迟。其在线服务统计显示,单个 H800 节点每秒输入 73.7k、输出 14.8k token,成本利润率 545%。
DeepSeek 推出 NSA(原生可训练的稀疏注意力机制),通过动态分层稀疏策略、粗粒度 token 压缩与细粒度 token 选择,加速长上下文训练与推理并降低预训练成本。NSA 在通用基准、长上下文任务和指令推理上匹配或超越 Full Attention 模型,论文见 arxiv.org/abs/2502.11089。