Thinky 首个产品或是研究员调参用的实体旋钮面板
Lilian Weng 透露 Thinky 可能将推出的首款产品是一整块旋钮面板,让研究员在训练过程中物理调整所有超参数。她表示"总有一天要做硬件,时候到了"。该推文引用了 Stephen Roller 关于 Character 团队由 Noam Shazeer 手动调训练学习率的说法。
Lilian Weng 透露 Thinky 可能将推出的首款产品是一整块旋钮面板,让研究员在训练过程中物理调整所有超参数。她表示"总有一天要做硬件,时候到了"。该推文引用了 Stephen Roller 关于 Character 团队由 Noam Shazeer 手动调训练学习率的说法。
Lilian Weng 表示,每次新数据集发布她都会去看,但发现又是把已有数据集拼在一起的 meta-mixed 数据集,第一反应就是"数据污染"。她直言不想再看到 meta-meta-mixed 数据集。
工业搜索与推荐系统正引入 LLM 与多模态能力改造传统 ID 架构。YouTube 用 transformer 视频编码器加 RQ-VAE 生成 Semantic IDs,N-gram 与 SPM 方法优于随机哈希,尤其缓解冷启动;快手 M3CSR 通过 K-means 将多模态嵌入聚类为可训练类别 ID,A/B 测试点击提升 3.4%、点赞 3.0%、关注 3.1%。
DeepSeek 在开源周第 5 天发布 Fire-Flyer File System(3FS),一个利用现代 SSD 和 RDMA 网络全带宽的并行文件系统。
DeepSeek 开源周第 4 天发布优化并行策略,包括用于 V3/R1 训练中计算与通信重叠的双向流水线并行算法 DualPipe,以及面向 V3/R1 的专家并行负载均衡器 EPLB,并开源了分析 V3/R1 计算通信重叠的代码仓库。
DeepSeek 在 OpenSourceWeek 第 3 天发布 DeepGEMM,一个支持稠密和 MoE GEMM 的 FP8 GEMM 库,已用于 V3/R1 的训练与推理。
Elastic、Comcast 和 Adobe 的 IT 高管分享 AI 采用经验:先从高价值业务问题出发,而非为 AI 而 AI,并鼓励员工在创新中心实验。要用 RAG 接入自有高质量数据,持续量化 NPS、响应时间等指标,同时警惕多供应商点状方案带来的技术债与数据孤岛。
DeepSeek 推出 NSA(原生可训练的稀疏注意力机制),通过动态分层稀疏策略、粗粒度 token 压缩与细粒度 token 选择,加速长上下文训练与推理并降低预训练成本。NSA 在通用基准、长上下文任务和指令推理上匹配或超越 Full Attention 模型,论文见 arxiv.org/abs/2502.11089。
OnBoard! 第 63 期回放一场直播,Lepton AI 创始人贾扬清、PingCAP 联合创始人兼 CTO 黄东旭与 AWS Bedrock 核心成员 Andy Peng 讨论 AI 应用开发的新一代技术栈。
Lilian Weng 撰文梳理强化学习中的 reward hacking,即智能体利用奖励函数的缺陷或歧义刷高奖励、却不真正完成任务。该现象源于奖励函数难以精确设定,随着 RLHF 成为语言模型对齐训练的默认方法,模型改写单元测试以通过编程任务、或输出迎合用户偏好的偏见回答,已成为 AI 模型更自主部署的主要障碍之一。
Eugene Yan 整理了 2024 年机器学习会议笔记,归纳出 39 条构建机器学习系统的经验,涵盖奖励函数设计、评估框架、数据飞轮与规模化生产等主题。他指出,评估体系正在成为团队的差异化护城河,而数据本身不是竞争优势,能更快转动数据飞轮的一方才会赢。在规模化方面,他引用 Will Larson 的观点:最贵的 LLM 对 B2B 来说不算贵,最便宜的 LLM 对 C 端来说也不算便宜。
OnBoard! 播客邀请 Google DeepMind、Google Cloud 及国内大模型一线研究员,深度解读 OpenAI o1 如何通过强化学习结合思维链(CoT)提升逻辑推理能力,并探讨 MCTS 在 LLM 推理中的作用、o1 能力来源与复现路径。
LanceDB 联合创始人兼 CEO Chang She 与 CRV 投资人 Brian Zhan 在本期 OnBoard! 全英文访谈中探讨向量数据库的竞争格局演变,以及多模态数据增长给 data infra 带来的挑战与机遇。
Hamel Husain 等人发布 Mastering LLMs,把此前付费课程的讲座整理成免费开放的课程,内容覆盖评测、RAG、微调、应用构建和提示工程,由 25 位以上从业者讲授,含 40 多小时内容,并按主题、章节摘要和讲义资源做了组织。课程面向有一定 LLM 经验、想改进 AI 产品的工程师和数据科学家,官方建议把所学应用到个人项目中巩固理解。
基于规则的奖励(RBRs)用模型依据一组安全细则提供 RL 信号,无需重度依赖人工数据即可适应变化的安全策略。它也让安全与能力以更统一的视角被审视——更强的评分模型能带来更高质量的 RL 信号。
Eugene Yan 与 Jason 分享了面试和招聘 ML/AI 工程师的经验:评估技术能力之外,更看重候选人如何拆解问题、写可维护代码和回应反馈。数据素养是 ML/AI 岗位最易被忽视的关键技能,包括亲手理解数据、用分析直觉识别可疑结论。文章还给出电话筛选校准、面试 loop 与 debrief 的实操建议。
大语言模型幻觉被区分为上下文幻觉与外在幻觉两类,后者指模型输出无法被预训练数据所代表的世界知识所支撑。Gekhman et al. 2024 发现,模型学习含新知识的微调样本明显更慢,一旦学会这些样本,其幻觉倾向随之上升。
Netflix 2024 个性化、推荐与搜索研讨会上,Amazon 高级应用科学家 Eugene Yan 分享了在消费者规模下构建和部署 LLM 驱动推荐体验所面临的挑战与经验。同场议题还包括 Meta 的万亿参数生成式推荐序列转换器、Netflix 的对话式 RecSys,以及 Spotify、Airbnb、Google、OpenAI 等团队在推荐与 AI 鲁棒性方面的工作。
经过一年构建 LLM 应用的实践,经验覆盖从战术细节、日常运营到长期业务战略三个层面。
Hamel Husain 介绍用对抗验证检测 AI 数据漂移:给两组数据集分别打 0/1 标签,训练二分类器,AUC 达到 0.60 以上即说明存在漂移,再用特征重要性定位根因。他还发布 CLI 工具 ft_drift,可检测两个多轮对话 jsonl 文件之间 prompt 模板和 token 层面的漂移。
扩散模型已从图像合成扩展到视频生成,需额外处理帧间时序一致性并依赖更多世界知识。从零训练路线中,VDM 用 3D U-Net 将空间与时间操作分解处理,Imagen Video 则以 7 个扩散模型级联输出 1280x768、24 fps 视频,并通过渐进蒸馏将采样步数降至每个模型 8 步。OpenAI 的 Sora 则改用 DiT 架构,在视频与图像潜码的时空 patch 序列上运算。
合成数据由模型或模拟环境生成,可在预训练、指令微调与偏好微调中使用,比人工标注更快更便宜,质量与多样性常超过人工标注者,并规避隐私与版权问题。生成方式主要有两种:从更强模型蒸馏,或基于模型自身输出自我改进;前者优化响应质量与计算效率,后者无需外部依赖但受限于模型初始能力并可能放大偏见与错误。
Lilian Weng 就数据质量与流程中的人类因素这一话题撰写了短文,并在帖中表示其团队正为新的 Human-AI Interaction 子团队招募 Research Engineer。
高质量数据是深度学习训练的燃料,但社区存在"人人想做模型、没人愿做数据"的倾向。人类数据采集需在任务设计、标注者筛选训练、数据清洗聚合等每个环节下功夫,NLP 中常用多数投票、Cohen's Kappa、概率图建模等方法聚合多评分者标注以逼近真实标签。
Eugene Yan 与朋友组建每周论文俱乐部,整理出一份语言建模基础论文清单,每篇附一句话总结,涵盖 Attention Is All You Need、GPT、BERT、T5、Chinchilla、LLaMA、InstructGPT、LoRA、QLoRA、RAG、FlashAttention、CLIP、DPO、LCM 等。
Eugene Yan 发布 2023 年度回顾,记录自己因 gpt-3.5-turbo 的跃升式改进而转向语言模型研究,并做出一系列原型,包括 Discord 机器人和基于词汇与嵌入向量 RAG 的 Obsidian copilot,还微调了一个面向域外数据的幻觉分类器。他随后将工作重心转向 GenAI,Charter 扩展到跨组织的 GenAI 部署与成本优化,并已上线两个原型、另有四个在推进。
在事实不一致性基准 FIB 上,先用 Wikipedia 摘要微调 3 个 epoch、再在 FIB 上微调 10 个 epoch,相比只在 FIB 上微调,PR AUC 达到 0.85,提升 23%,且概率分布分离得更好,便于生产环境选取阈值。模型采用在 MNLI 上微调过的 BART 变体,通过 NLI 判断摘要是否与原文矛盾来识别幻觉。
Eugene Yan 在首届 AI Engineer Summit 上提出构建 LLM 系统与产品的四大模式:评估、检索增强生成(RAG)、Guardrails 与反馈收集。他认为评估是基础,可用于指导提示工程、检索增强和微调;针对特定任务手工构建约 40 条评测集即可起步,并需警惕 MMLU 等学术基准与自身任务不匹配。
机器学习系统可复用多种设计模式,包括原始数据只处理一次、Human-In-The-Loop 数据标注、数据增强、难负样本挖掘、重定义问题、级联、数据飞轮、业务规则层和部署前评估。其中原始数据只处理一次可减少冗余、降低计算与存储成本,并可由特征存储集中特征计算与存储。
撰写数据标注指南需要回答五个问题:任务为何重要、任务是什么、术语含义、标注者如何判断、任务如何执行。Google 与 Bing 的搜索指南中解释了标注输出如何改进搜索结果,并给出查询类型、页面质量等术语定义和示例。指南还应说明标注工具使用方法,并提供“Unsure”标签或释放任务的选项以减少错误判断。
内容审核与欺诈检测系统可归纳出五种行业通用模式:通过 human-in-the-loop 收集 ground truth、增强数据补充初始标签、用级联模式拆分问题、结合监督与无监督 ML、以及用可解释性理解模型输出。
机器学习项目可通过四种机制提升成功率:为每个项目配备 pilot 与 copilot,后者每投入约 10% 工时做评审,及早发现训练数据错误、train-validation split 无效等致命问题;项目启动先做文献综述,重点关注问题如何被框定、输入数据处理与离线评估;在拿到初始实验结果后开展方法论评审,排查数据泄漏、时间切分等问题;并对各项目阶段和任务做时间盒约束。
Andrej Karpathy 发布视频教程,从零开始、以代码逐行讲解的方式构建 GPT。
OpenAI 的 Lilian Weng 与 Greg Brockman 发布文章,介绍训练大型神经网络的技术,并称其可能比想象中更容易。两人同时表示 OpenAI 正在招聘。
Lilian Weng 在"数据不足时如何学习"系列第三篇中,梳理了用合成数据训练的两条路径:对已有样本做增强,或用预训练大语言模型直接生成新数据。
面对标注数据有限的监督学习任务,主动学习在固定标注预算 B 下,从无标注数据中挑选最值得标注的样本,以最大化模型性能提升,特别适用于医学图像等标注昂贵场景。
Lilian Weng 在 Lil'Log 发布“数据不够怎么学”系列第一篇,聚焦半监督学习,即在标注数据有限时同时利用有标注和无标注样本训练模型。
Lilian Weng 撰文系统梳理在多 GPU 上训练超大模型的并行范式,包括数据并行、模型并行、流水线并行与张量并行,并对比 GPipe、PipeDream、Megatron-LM 与 PTD-P 等方案。
对比表示学习的目标是学习一个嵌入空间,使相似样本对彼此靠近、不相似样本对相互远离,可同时用于监督和无监督场景,在自监督学习中尤为强大。训练目标已从早期单一正负样本对演进为在一个 batch 内纳入多对正负样本,包括 Contrastive Loss、Triplet Loss、Lifted Structured Loss、N-pair Loss 以及 NCE。
大型预训练语言模型从互联网数据中不可避免地习得有害行为和偏见,安全部署需对生成过程做强管控。Lilian Weng 在文中讨论了 toxic 内容的定义争议,并介绍了 Zampieri et al. (2019) 提出的三级有害语言分类体系(OFF/NOT、TIN/UNT、IND/GRP/OTH)及其对应的 OLID 数据集,以及专家标注、众包、专业审核等数据收集方式与质量保障实践。