用域外微调引导幻觉检测:一项基于 FIB 的实验
在事实不一致性基准 FIB 上,先用 Wikipedia 摘要微调 3 个 epoch、再在 FIB 上微调 10 个 epoch,相比只在 FIB 上微调,PR AUC 达到 0.85,提升 23%,且概率分布分离得更好,便于生产环境选取阈值。模型采用在 MNLI 上微调过的 BART 变体,通过 NLI 判断摘要是否与原文矛盾来识别幻觉。
在事实不一致性基准 FIB 上,先用 Wikipedia 摘要微调 3 个 epoch、再在 FIB 上微调 10 个 epoch,相比只在 FIB 上微调,PR AUC 达到 0.85,提升 23%,且概率分布分离得更好,便于生产环境选取阈值。模型采用在 MNLI 上微调过的 BART 变体,通过 NLI 判断摘要是否与原文矛盾来识别幻觉。
Eugene Yan 在首届 AI Engineer Summit 上提出构建 LLM 系统与产品的四大模式:评估、检索增强生成(RAG)、Guardrails 与反馈收集。他认为评估是基础,可用于指导提示工程、检索增强和微调;针对特定任务手工构建约 40 条评测集即可起步,并需警惕 MMLU 等学术基准与自身任务不匹配。
机器学习系统可复用多种设计模式,包括原始数据只处理一次、Human-In-The-Loop 数据标注、数据增强、难负样本挖掘、重定义问题、级联、数据飞轮、业务规则层和部署前评估。其中原始数据只处理一次可减少冗余、降低计算与存储成本,并可由特征存储集中特征计算与存储。
撰写数据标注指南需要回答五个问题:任务为何重要、任务是什么、术语含义、标注者如何判断、任务如何执行。Google 与 Bing 的搜索指南中解释了标注输出如何改进搜索结果,并给出查询类型、页面质量等术语定义和示例。指南还应说明标注工具使用方法,并提供“Unsure”标签或释放任务的选项以减少错误判断。
内容审核与欺诈检测系统可归纳出五种行业通用模式:通过 human-in-the-loop 收集 ground truth、增强数据补充初始标签、用级联模式拆分问题、结合监督与无监督 ML、以及用可解释性理解模型输出。
机器学习项目可通过四种机制提升成功率:为每个项目配备 pilot 与 copilot,后者每投入约 10% 工时做评审,及早发现训练数据错误、train-validation split 无效等致命问题;项目启动先做文献综述,重点关注问题如何被框定、输入数据处理与离线评估;在拿到初始实验结果后开展方法论评审,排查数据泄漏、时间切分等问题;并对各项目阶段和任务做时间盒约束。
Andrej Karpathy 发布视频教程,从零开始、以代码逐行讲解的方式构建 GPT。
OpenAI 的 Lilian Weng 与 Greg Brockman 发布文章,介绍训练大型神经网络的技术,并称其可能比想象中更容易。两人同时表示 OpenAI 正在招聘。
Lilian Weng 在"数据不足时如何学习"系列第三篇中,梳理了用合成数据训练的两条路径:对已有样本做增强,或用预训练大语言模型直接生成新数据。
面对标注数据有限的监督学习任务,主动学习在固定标注预算 B 下,从无标注数据中挑选最值得标注的样本,以最大化模型性能提升,特别适用于医学图像等标注昂贵场景。
Lilian Weng 在 Lil'Log 发布“数据不够怎么学”系列第一篇,聚焦半监督学习,即在标注数据有限时同时利用有标注和无标注样本训练模型。
Lilian Weng 撰文系统梳理在多 GPU 上训练超大模型的并行范式,包括数据并行、模型并行、流水线并行与张量并行,并对比 GPipe、PipeDream、Megatron-LM 与 PTD-P 等方案。
对比表示学习的目标是学习一个嵌入空间,使相似样本对彼此靠近、不相似样本对相互远离,可同时用于监督和无监督场景,在自监督学习中尤为强大。训练目标已从早期单一正负样本对演进为在一个 batch 内纳入多对正负样本,包括 Contrastive Loss、Triplet Loss、Lifted Structured Loss、N-pair Loss 以及 NCE。
大型预训练语言模型从互联网数据中不可避免地习得有害行为和偏见,安全部署需对生成过程做强管控。Lilian Weng 在文中讨论了 toxic 内容的定义争议,并介绍了 Zampieri et al. (2019) 提出的三级有害语言分类体系(OFF/NOT、TIN/UNT、IND/GRP/OTH)及其对应的 OLID 数据集,以及专家标注、众包、专业审核等数据收集方式与质量保障实践。
神经架构搜索(Neural Architecture Search, NAS)被 Elsken 等人 2019 年的综述归纳为三大组件:定义卷积、全连接、池化等操作及其连接方式的搜索空间,采样候选架构并根据准确率、延迟等指标优化的搜索算法,以及评估大量候选模型性能的评估策略。
针对深度强化学习中"探索"这一尚未解决的开放问题,文章梳理了从 epsilon-greedy、UCB、Boltzmann 探索到 Thompson sampling 的经典策略,以及熵损失项和噪声注入等深度 RL 探索方法。
课程学习早在 1993 年就由 Jeffrey Elman 提出:先用简单数据训练、再逐步提升样本复杂度,否则模型可能完全学不会。
自监督学习通过让模型从数据本身生成监督信号,避免昂贵的人工标注,学到的中间表示可迁移到下游任务。图像领域常用前置任务包括对图像块施加平移、旋转、缩放等随机变换构造代理类别,以及整图旋转预测,用 ImageNet 分类准确率衡量表示质量。文中还介绍了对比预测编码、MoCo、SimCLR、BYOL 等方法。
元强化学习(meta-RL)将元学习引入强化学习,训练一个能快速解决未见任务的智能体。其策略输入除当前状态外还包含上一动作 $a_{t-1}$ 和上一奖励 $r_{t-1}$,并采用 LSTM 策略,用隐藏状态记忆轨迹特征,无需显式喂入上一状态。Wang et al.(2016)与 Duan et al.(2017)几乎同时提出该思路,后者称之为 RL²。
域随机化(DR)通过在仿真器中随机化视觉外观与物理动力学参数(如质量、摩擦、阻尼、关节限位、动作延迟),让策略在多样环境中训练,从而迁移到真实世界。相比需要真实数据的域适应,DR 几乎不需要真实样本;OpenAI Robotics 用视觉与动力学 DR 让机械手完成连续旋转物体的 50 次连续随机目标朝向任务。文章还把 DR 的随机化参数学习视为一种双层优化问题。
Lilian Weng 在 Lil'Log 发布《Generalized Language Models》综述,按时间顺序梳理了从 CoVe、ELMo、CVT、ULMFiT 到 GPT、BERT、ALBERT、GPT-2、RoBERTa、T5、GPT-3、XLNet、BART、ELECTRA 等模型的上下文词表征与预训练方法。
单阶段检测器跳过区域提议、直接在密集位置回归检测,速度更快但精度可能略降。YOLO 是首个实时目标检测器,将图像划分为 S×S 网格,每个网格预测 B 个边界框及其置信度与类别概率,最终输出张量形状为 S×S×(5B+K)。
自编码器通过中间狭窄的瓶颈层以无监督方式重建高维数据,其瓶颈层学到的压缩隐编码可作嵌入向量用于搜索、数据压缩或揭示数据的生成因子。去噪自编码器通过随机损坏输入再重建原始数据来提升鲁棒性,其思路比 dropout 早 4 年;稀疏自编码器则对隐藏单元激活施加稀疏约束。文章后经更新补充了 VQ-VAE、VQ-VAE-2 与 TD-VAE 章节。
"Object Detection for Dummies"系列第二篇回顾图像分类的经典 CNN 架构:AlexNet 用 5 层卷积加 2 层 MLP,VGG 为 19 层、只用 3x3 卷积和 2x2 池化,ResNet 达 152 层并靠残差块保持可训练。
Naftali Tishby 提出用信息瓶颈(IB)方法为深度神经网络给出新的学习界,因为参数量指数级增长使传统学习理论失效。他将 DNN 训练分为两个阶段:先充分表征输入并最小化泛化误差,再压缩表示以遗忘无关细节,并称"学习最重要的部分其实是遗忘"。
这篇教程演示如何用 TensorFlow 构建带 LSTM 单元的 RNN 模型,预测标普 500 指数价格,完整代码已开源在 GitHub。示例使用 1950 年 1 月 3 日至 2017 年 6 月 23 日的标普 500 日收盘价数据,并以均方误差为损失、RMSPropOptimizer 做优化,同时展示了如何用 TensorBoard 调试和跟踪模型。
2016 年 AlphaGo 以 1-4 击败九段棋手李世石,让深度学习和 AI 应用获得大量关注。深度学习的兴起源于两个条件:数据规模大幅增长,以及算力显著提升,使深层神经网络能够自动学习特征、在数据量增大后超越传统机器学习算法。文章随后介绍了几类经典模型,包括受视觉皮层启发的 CNN、Residual Net 的残差连接,以及适合处理长序列、应用于手写识别、语音识别和机器翻译的 RNN。