LLM 推理提升的推理时扩展方法分类:从 Chain-of-Thought 到验证器
推理时扩展已成为提升已部署 LLM 答案质量与准确率的最有效手段之一,通过在使用模型生成文本时投入更多算力和时间换取更好结果,当前各大 LLM 提供商均依赖某种形式的推理时扩展。
推理时扩展已成为提升已部署 LLM 答案质量与准确率的最有效手段之一,通过在使用模型生成文本时投入更多算力和时间换取更好结果,当前各大 LLM 提供商均依赖某种形式的推理时扩展。
Jina AI 提出在压缩前将嵌入向量转换为球坐标,可把嵌入存储从 240 GB 降到 160 GB,比最佳无损基线还好 25%。重建近似无损,误差低于 float32 机器 epsilon,检索质量不受影响,适用于文本、图像和多向量嵌入,且无需训练、无需码本。
OpenAI 发布小团队使用 ChatGPT 的实践指南,覆盖数据分析、营销素材制作、预算管理、会议组织和决策支持等场景。内容为操作方法层面的指引,未披露新模型、版本号或性能数据。
Turbopack 已成为 Next.js 的新默认打包器,靠细粒度缓存与增量计算实现近乎即时的构建和 React Fast Refresh 体验。它用“value cells”(Vc)自动追踪函数调用与依赖,文件变更时仅将读取该 cell 的函数标记为“dirty”并按需重新计算,内容未变则跳过更新。
OpenAI 发布《构建 AI 智能体实用指南》,覆盖用例、模型选择、工具设计、护栏机制与多智能体模式,面向智能体的设计、编排与部署全流程。
OpenAI 发布面向初创企业的 GPT-5 系列模型实用指南,讲解如何迁移到 Responses API、设计 Agent、调优提示词、引导 GPT-5 模型并构建可靠的 AI 工作流。
OpenAI 详解内部团队如何使用 Codex 理解代码、重构系统并提升性能与研发速度,同时优化工程工作流。文章覆盖了从代码理解到重构、性能改进和工程效率提升等多个具体场景。
MongoDB Blog 发布 Vision RAG 指南,用多模态嵌入让包含图表和表格的复杂文档变得可搜索,从而省去复杂且昂贵的文本提取。文中指出传统 RAG 主要面向纯文本,企业知识多存于 PDF、幻灯片和图形等多模态格式,用 OCR 或解析工具处理存在工程量大、精度不稳定、规模化成本高的问题;指南介绍 Voyage AI 最新模型如何支撑这一能力,并提供分步实现说明。
Modal 将其跨 AWS、GCP、Azure、OCI 的 GPU 工作池扩展到超过 2 万块并发 GPU,两年内启动超 400 万云实例。此次公开其 GPU 可靠性系统,涵盖实例类型测试选型、机器镜像与启动检查、被动与主动健康检查,以及可观测性与支持。模态还维护半自动基准测试 modal-host-bench,用于评估并规避特定实例类型的性能与可靠性问题。
Voyage AI by MongoDB 通过基于 token 计数的批处理策略,让查询嵌入推理用少 3 倍的 GPU 仍将 GPU 推理延迟降低 50%。该方案依托 vLLM 和 SGLang 支持的 padding removal,将短查询序列拼接成变长批次处理,替代按 B×S 补 padding 的传统做法,避免 padding token 白白消耗算力与显存带宽。
Eugene Yan 发布 2025 年度回顾,全年完成 6 篇长文与 4 个原型应用,其中 AI Reading Club 已上线 Kindle iOS app。
去哪儿网构建了一套分层解耦、端云协同的端智能基础设施,由引擎层、基建层、应用层组成,支持 XGBoost、LightGBM 及 RNN、CNN、Transformer 等模型端侧推理,单次推理耗时控制在毫秒级,推理成功率保持 99.9%。在用户流失预测挽留场景中,端侧模型直接利用实时微观行为特征,单次推理耗时≤10ms,预测准确率较天然不下单概率相对提升 12%。
播客「牛油果烤面包」本期邀请 AI 专家 Mengdi 讲解 AI Agent 智能体,内容涵盖智能体的定义、基本架构、技术难点与解决方案,并讨论修改提示词是否比微调模型更有效、RAG(检索增强生成)、自演化 AI 以及普通人构建智能体的门槛。节目还谈及大模型领域近期研究方向和智能体在未来科学研究上的发展方向。
Eugene Yan 总结了构建产品评测的三步方法:先标注小数据集,再对齐 LLM 评测器,最后在每次配置变更时运行实验与评测集。标注阶段建议使用二元的通过/失败或胜/负标签,并至少准备 50-100 个失败样本;对齐阶段建议每个维度单独建评测器、按 75/25 划分开发集与测试集,并用 precision、recall 和 Cohen's Kappa 评估评测器。
Reducto 将 30+ 模型的推理负载迁移到 Modal 后,P90 延迟降低 3 倍,借助 GPU 内存快照把冷启动从约 70s 缩短到约 12s,降幅 83%。Reducto 通过按客户参数化独立扩缩容、按区域固定延迟敏感函数,实现各客户负载隔离。一次 100k 页/分钟的企业压测中,其摄入流水线在不到一小时内扩展到 1000+ GPU 并顺利缩容。
Modal 详解推理中的 host overhead:GPU 因等待 CPU 准备任务而空转,表现为 GPU kernel 利用率偏低。若 host overhead 达 50%,GPU 成本将翻倍,而 GPU 成本通常是推理成本的主要来源。
Decagon 与 Modal 合作训练紧凑开源模型并结合定制 draft 模型与运行时优化,使 Decagon Voice 2.0 延迟降低 65%,意图识别与回复质量显著提升。其定制 EAGLE3 draft 模型接受长度比开源基线高 38%,Modal 为 SGLang 构建异步调度器,消除 H200 GPU 空闲时间并将吞吐提升最高 12%,相关改动已向上游提交 PR。
Modal、Pipecat 与开源权重模型搭建的语音 AI 聊天机器人实现了 1 秒级语音到语音延迟。方案以 Pipecat 作为有状态编排层,串联 STT、LLM、TTS 三步推理,并借助 Modal 按硬件需求独立自动扩缩 GPU 服务。
一位创业者先后申请 YC 七次、经历三轮面试才最终入选,他认为最好的 YC 申请读起来像诚实的对话而非投资人路演,核心是把问题、用户、机会和团队讲清楚。他在最后一次面试中用 60 秒概括产品、问题、意义、用户、进展与天花板,让后续对话自然展开,建议申请者以清晰优先于复杂。
Berkeley AI Research 提出一种不基于时序差分(TD)学习的强化学习范式——分治法。该方法通过将轨迹对半切分、用两段子轨迹的值相乘来更新整体价值,理论上可将 Bellman 递归次数从线性降为对数级,缓解 TD 学习中误差随时长累积的问题。
一段提示词演示展示了如何用 AI 生成"大制作动画电影"质感的短片:女主角穿短病号服在冷冻舱中醒来,走出实验室沿走廊爬上黑色梯子,从井盖钻出后置身萤火虫飞舞、鹿群跑过的茂密森林,远景是植物覆盖的废墟城市。画面强调干净线条与流畅动作,提示词由 @EccentrismArt 提供。
Thinking Machines 发布最新文章,探讨 on-policy distillation 这一训练方法,将 RL 的纠错相关性与 SFT 的奖励密度结合。
Thinking Machines 发布文章系统讲解 on-policy 蒸馏,即从学生模型采样轨迹、再由教师模型对每个 token 打分,结合了 on-policy 训练的相关性与蒸馏的稠密奖励信号。
LLM 评测在实践中主要分为四类:选择题基准(如包含 57 个学科、约 1.6 万道题的 MMLU,按准确率计分)、验证器、排行榜和 LLM 评判,前两者属基准评测,后两者属判断式评测。文章以纯 PyTorch 从零实现的 Qwen3 0.6B(仅需约 1.5 GB 内存)演示如何在 MMLU 上跑分,代码来自 reasoning_from_scratch 库。
数据科学家小组让 Langsmith、Braintrust 和 Arize Phoenix 完成同一评估作业,从工作流、人工介入、透明度与生态集成四方面进行比较。结论是没有一个工具在所有维度都最优,选择取决于团队技能、技术栈与成熟度。作者本人通常将这些工具用作后端数据存储,并配合 Jupyter notebook 和自建标注界面。
混合搜索将传统关键词搜索的精确性与向量搜索的上下文理解能力结合,成为满足当前用户期望的关键方案。随着 RAG 等生成式 AI 用例兴起,高质量检索需求推动向量搜索与词汇搜索走向融合,主要融合技术包括倒数排名融合(RRF)和相对分数融合(RSF),二者无需依赖可直接比较的分数尺度即可合并结果。
MongoDB Blog 提出 Canvas 框架,用于解决企业 AI 智能体项目大量停留在试点阶段的问题。文章援引数据称近八成公司使用生成式 AI,但部署用例中不到 10% 能走出试点,MIT 研究样本中失败率甚至高达 95%。
作者用 Semantic IDs 将商品编码进语言模型词表,在 Amazon Reviews 2023 视频游戏数据上训练出一个能在英文与 item ID 间"双语"对话的 LLM-推荐混合模型。数据经筛选后保留 66k 商品、737k 条行为记录,构建出 79k 条用户购买序列,平均长度 6.5 个商品。该模型推荐精度不及专门的多阶段推荐系统,但支持用自然语言操控推荐并对其选择给出推理与解释。
Thinking Machines 发布文章解释 LLM 推理不确定性的真正来源并非浮点并发累加,而是 kernel 缺乏 batch invariance,负载变化导致 batch size 变化进而改变归约顺序。
Sebastian Raschka 发布文章,用纯 PyTorch 从零讲解并实现 Qwen3 的稠密与 Mixture-of-Experts 架构。
牛油果烤面包播客几位主播圆桌闲聊各自用 AI 工具的感受,覆盖文本润色、心理咨询、知识学习、图像生成、育儿辅助、编程辅助、播客与音视频制作、工作流自动化、AI Agent、多层次搜索与内容整合、AI 导游、旅行规划、写段子与小说创作等场景,也谈到 AI 的另一面。
长上下文问答评估面临信息过载、位置偏差、"lost in the middle"、多跳推理与幻觉放大等挑战,评估需兼顾忠实性(答案仅依据原文、避免幻觉、正确说"不知道")与有用性(相关、全面且简洁)。忠实性对法律合同、医疗保险表单等场景尤为关键,QASPER 等基准还评估引用准确性;Xu et al.(2023)发现领域专家更偏好既忠实又全面的长回答,而众包工作者更看重简洁。
flomo 联合创始人少楠在与「AI炼金术」主理人任鑫的对谈中提出,Prompt 本身就是"很大的工程",是理解用户画像、满足需求的"古典"产品设计过程,Notion AI 即是例证。
作者基于 Amazon Q CLI 与 MCP 构建了一个 news-agents,用于生成每日新闻摘要,并用 tmux 为每个子智能体单独开窗展示其工作过程。
OpenAI 展示如何用 ChatGPT 的 canvas 从产品需求文档(PRD)直接生成可运行的 HTML/React 原型。演示覆盖从需求文档到可交互原型的完整流程,帮助用户快速验证产品想法。
ChatGPT 可用于支持战略规划,通过分析背景信息、生成多个选项,并将决策转化为后续行动步骤。
Eugene Yan 发布写作流程 FAQ,回应每月收到的关于如何起步、为何写作、为谁写作、如何选题与选择平台等问题。他把写作动机归为四类:为学习、为分享知识、为表达异议,以及把写作当作吸引同好的“蝙蝠信号”。他建议把写作当单机游戏,先专注提升沟通能力与学习效果,而非人脉与机会等联机收益。
Hamel Husain 基于为 30 多家公司提供咨询的经验,总结出快速改进 AI 产品的方法:核心不是选工具和框架,而是测量与迭代。
Eugene Yan 与 Chip 受邀在 NVIDIA GTC 2025 的"构建 LLM 应用的经验与教训"圆桌论坛上分享。录像已在 NVIDIA GTC 参会者门户上线,需登录观看,并将在 NVIDIA On-Demand 面向公众开放。
工业搜索与推荐系统正引入 LLM 与多模态能力改造传统 ID 架构。YouTube 用 transformer 视频编码器加 RQ-VAE 生成 Semantic IDs,N-gram 与 SPM 方法优于随机哈希,尤其缓解冷启动;快手 M3CSR 通过 K-means 将多模态嵌入聚类为可训练类别 ID,A/B 测试点击提升 3.4%、点赞 3.0%、关注 3.1%。