详解 LLM 评测的 4 种主要方法(附从零实现代码)
LLM 评测在实践中主要分为四类:选择题基准(如包含 57 个学科、约 1.6 万道题的 MMLU,按准确率计分)、验证器、排行榜和 LLM 评判,前两者属基准评测,后两者属判断式评测。文章以纯 PyTorch 从零实现的 Qwen3 0.6B(仅需约 1.5 GB 内存)演示如何在 MMLU 上跑分,代码来自 reasoning_from_scratch 库。
LLM 评测在实践中主要分为四类:选择题基准(如包含 57 个学科、约 1.6 万道题的 MMLU,按准确率计分)、验证器、排行榜和 LLM 评判,前两者属基准评测,后两者属判断式评测。文章以纯 PyTorch 从零实现的 Qwen3 0.6B(仅需约 1.5 GB 内存)演示如何在 MMLU 上跑分,代码来自 reasoning_from_scratch 库。
数据科学家小组让 Langsmith、Braintrust 和 Arize Phoenix 完成同一评估作业,从工作流、人工介入、透明度与生态集成四方面进行比较。结论是没有一个工具在所有维度都最优,选择取决于团队技能、技术栈与成熟度。作者本人通常将这些工具用作后端数据存储,并配合 Jupyter notebook 和自建标注界面。
混合搜索将传统关键词搜索的精确性与向量搜索的上下文理解能力结合,成为满足当前用户期望的关键方案。随着 RAG 等生成式 AI 用例兴起,高质量检索需求推动向量搜索与词汇搜索走向融合,主要融合技术包括倒数排名融合(RRF)和相对分数融合(RSF),二者无需依赖可直接比较的分数尺度即可合并结果。
Thinking Machines 发布研究《LoRA Without Regret》,用 Llama 3 与 Qwen3 系列模型在 Tulu3、OpenThoughts3 数据集的监督微调及数学推理强化学习实验,考察 LoRA 与全量微调(FullFT)的差距。
MongoDB Blog 提出 Canvas 框架,用于解决企业 AI 智能体项目大量停留在试点阶段的问题。文章援引数据称近八成公司使用生成式 AI,但部署用例中不到 10% 能走出试点,MIT 研究样本中失败率甚至高达 95%。
作者用 Semantic IDs 将商品编码进语言模型词表,在 Amazon Reviews 2023 视频游戏数据上训练出一个能在英文与 item ID 间"双语"对话的 LLM-推荐混合模型。数据经筛选后保留 66k 商品、737k 条行为记录,构建出 79k 条用户购买序列,平均长度 6.5 个商品。该模型推荐精度不及专门的多阶段推荐系统,但支持用自然语言操控推荐并对其选择给出推理与解释。
Thinking Machines 发布文章解释 LLM 推理不确定性的真正来源并非浮点并发累加,而是 kernel 缺乏 batch invariance,负载变化导致 batch size 变化进而改变归约顺序。
Sebastian Raschka 发布文章,用纯 PyTorch 从零讲解并实现 Qwen3 的稠密与 Mixture-of-Experts 架构。
OpenAI 本周发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重模型,这是其自 2019 年 GPT-2 以来首次公开完整的开放权重模型。
牛油果烤面包播客几位主播圆桌闲聊各自用 AI 工具的感受,覆盖文本润色、心理咨询、知识学习、图像生成、育儿辅助、编程辅助、播客与音视频制作、工作流自动化、AI Agent、多层次搜索与内容整合、AI 导游、旅行规划、写段子与小说创作等场景,也谈到 AI 的另一面。
长上下文问答评估面临信息过载、位置偏差、"lost in the middle"、多跳推理与幻觉放大等挑战,评估需兼顾忠实性(答案仅依据原文、避免幻觉、正确说"不知道")与有用性(相关、全面且简洁)。忠实性对法律合同、医疗保险表单等场景尤为关键,QASPER 等基准还评估引用准确性;Xu et al.(2023)发现领域专家更偏好既忠实又全面的长回答,而众包工作者更看重简洁。
作者基于 Amazon Q CLI 与 MCP 构建了一个 news-agents,用于生成每日新闻摘要,并用 tmux 为每个子智能体单独开窗展示其工作过程。
OpenAI 展示如何用 ChatGPT 的 canvas 从产品需求文档(PRD)直接生成可运行的 HTML/React 原型。演示覆盖从需求文档到可交互原型的完整流程,帮助用户快速验证产品想法。
ChatGPT 可用于支持战略规划,通过分析背景信息、生成多个选项,并将决策转化为后续行动步骤。
Hamel Husain 基于为 30 多家公司提供咨询的经验,总结出快速改进 AI 产品的方法:核心不是选工具和框架,而是测量与迭代。
Eugene Yan 与 Chip 受邀在 NVIDIA GTC 2025 的"构建 LLM 应用的经验与教训"圆桌论坛上分享。录像已在 NVIDIA GTC 参会者门户上线,需登录观看,并将在 NVIDIA On-Demand 面向公众开放。
工业搜索与推荐系统正引入 LLM 与多模态能力改造传统 ID 架构。YouTube 用 transformer 视频编码器加 RQ-VAE 生成 Semantic IDs,N-gram 与 SPM 方法优于随机哈希,尤其缓解冷启动;快手 M3CSR 通过 K-means 将多模态嵌入聚类为可训练类别 ID,A/B 测试点击提升 3.4%、点赞 3.0%、关注 3.1%。
Elastic、Comcast 和 Adobe 的 IT 高管分享 AI 采用经验:先从高价值业务问题出发,而非为 AI 而 AI,并鼓励员工在创新中心实验。要用 RAG 接入自有高质量数据,持续量化 NPS、响应时间等指标,同时警惕多供应商点状方案带来的技术债与数据孤岛。
DeepSeek 为部署 DeepSeek-R1 给出推荐设置:不使用 system prompt,Temperature 设为 0.6,并公布搜索与文件上传的官方提示词及缓解模型绕过思考的指南。官方部署与开源版本运行同一模型,可获得完整的 DeepSeek-R1 体验。
Hamel Husain 分享了在 AI 领域通过技术写作建立受众的 5 个策略:在他人优秀工作上做延伸、保持稳定输出、提升文案写作能力、搭建语音转内容流水线和善用独特视角。
Latent Space Paper Club 已连续 18 个月每周举办一次论文研读会,累计讨论至少 80 篇论文,覆盖 Attention、LoRA/QLoRA、RLHF、RAG 等主题。组织者建议固定每周三 12pm PST 举行一小时会议,提前预读可将讨论收获提升约 80%,并轮流由志愿者主持,偶尔邀请论文作者参与答疑。
Eugene Yan 将个人笔记本从 2019 Intel MacBook Pro 升级到 M4 MacBook Pro,选择不恢复备份而从零搭建极简开发环境。配置涵盖 macOS 设置、Homebrew、Warp、Fish、Cursor 等开发工具,以及用 Ollama + Open WebUI 本地运行 llama3.2 和 nemotron 模型。
Elastic Security 面向检测工程师梳理其检测工程工具集,内置超过 1,300 条 SIEM 检测规则、覆盖 54 种数据源,另有 70 多个机器学习任务。
Eugene Yan 整理了 2024 年机器学习会议笔记,归纳出 39 条构建机器学习系统的经验,涵盖奖励函数设计、评估框架、数据飞轮与规模化生产等主题。他指出,评估体系正在成为团队的差异化护城河,而数据本身不是竞争优势,能更快转动数据飞轮的一方才会赢。在规模化方面,他引用 Will Larson 的观点:最贵的 LLM 对 B2B 来说不算贵,最便宜的 LLM 对 C 端来说也不算便宜。
Hamel Husain 发布 LLM-as-a-Judge 评估完全指南,提出名为 Critique Shadowing 的方法,分七步搭建评估体系:找到核心领域专家、构建数据集、让专家做通过/失败判断并给出点评、修复错误、迭代构建 LLM 评判器、错误分析、按需创建更专门的评判器。
Next.js 官方博客回顾了 Next.js App Router 的缓存演进历程,梳理了其缓存机制的设计思路与实践经验。
OpenAI 基于数百次成功部署经验,总结了让 AI 真正投入工作的方法。内容面向企业落地场景,但正文未披露具体模型、版本或部署数据。
为比较 FastAPI、FastHTML、Next.js 和 SvelteKit,作者用每个框架各写了一个「Look at Your Data」应用,实现 CSV 上传建表、浏览、改字段、删行、下载的完整 CRUD。
Eugene Yan 基于二十余篇论文系统梳理了 LLM-evaluators(又称 LLM-as-a-Judge)的使用要点:直接评分适合忠实度、毒性等客观评估,成对比较在说服力、语气等主观评估上更稳定,与人类标注差异更小,基于参考的评估则依赖人工标注参考文本。
Hamel Husain 等人发布 Mastering LLMs,把此前付费课程的讲座整理成免费开放的课程,内容覆盖评测、RAG、微调、应用构建和提示工程,由 25 位以上从业者讲授,含 40 多小时内容,并按主题、章节摘要和讲义资源做了组织。课程面向有一定 LLM 经验、想改进 AI 产品的工程师和数据科学家,官方建议把所学应用到个人项目中巩固理解。
Eugene Yan 与 Jason 分享了面试和招聘 ML/AI 工程师的经验:评估技术能力之外,更看重候选人如何拆解问题、写可维护代码和回应反馈。数据素养是 ML/AI 岗位最易被忽视的关键技能,包括亲手理解数据、用分析直觉识别可疑结论。文章还给出电话筛选校准、面试 loop 与 debrief 的实操建议。
大语言模型幻觉被区分为上下文幻觉与外在幻觉两类,后者指模型输出无法被预训练数据所代表的世界知识所支撑。Gekhman et al. 2024 发现,模型学习含新知识的微调样本明显更慢,一旦学会这些样本,其幻觉倾向随之上升。
Eugene Yan 总结提示词工程的基础做法,指出做大规模提示词优化前需要可靠的评估,并给出“标注约100条评估样本、写初版提示词、跑评估并迭代、上线前在留出测试集上验证”的流程。
经过一年构建 LLM 应用的实践,经验覆盖从战术细节、日常运营到长期业务战略三个层面。
Hamel Husain 介绍用对抗验证检测 AI 数据漂移:给两组数据集分别打 0/1 标签,训练二分类器,AUC 达到 0.60 以上即说明存在漂移,再用特征重要性定位根因。他还发布 CLI 工具 ft_drift,可检测两个多轮对话 jsonl 文件之间 prompt 模板和 token 层面的漂移。
扩散模型已从图像合成扩展到视频生成,需额外处理帧间时序一致性并依赖更多世界知识。从零训练路线中,VDM 用 3D U-Net 将空间与时间操作分解处理,Imagen Video 则以 7 个扩散模型级联输出 1280x768、24 fps 视频,并通过渐进蒸馏将采样步数降至每个模型 8 步。OpenAI 的 Sora 则改用 DiT 架构,在视频与图像潜码的时空 patch 序列上运算。
作者 Eugene Yan 用 Vapi 平台和 claude-3-sonnet 搭建了一个可电话拨打的语音 AI 教练 Tara,并给出约 10 分钟的搭建指南。
Eugene Yan 总结了分类/抽取、摘要、翻译等任务中真正有效的 LLM 评估方法:分类用 recall、precision、ROC-AUC、PR-AUC,摘要用 NLI 测一致性并以 reward model 和长度检查测相关性,翻译用 chrF、BLEURT、COMET、COMETKiwi,另加版权逐字复现与毒性生成比例检测。他还提醒需通过人工评估校准评估标准,在潜在收益与风险间取得平衡。
机器学习代码学的是逻辑而非包含逻辑,因此单元测试不应像普通软件那样 mock 模型。建议用小型内联样本数据、随机或空权重测试输出形状与设备迁移,并对真实模型保留损失下降、过拟合、输出语义等关键测试并标记为 slow。
合成数据由模型或模拟环境生成,可在预训练、指令微调与偏好微调中使用,比人工标注更快更便宜,质量与多样性常超过人工标注者,并规避隐私与版权问题。生成方式主要有两种:从更强模型蒸馏,或基于模型自身输出自我改进;前者优化响应质量与计算效率,后者无需外部依赖但受限于模型初始能力并可能放大偏见与错误。