任务专属 LLM 评估:哪些有效,哪些无效
Eugene Yan 总结了分类/抽取、摘要、翻译等任务中真正有效的 LLM 评估方法:分类用 recall、precision、ROC-AUC、PR-AUC,摘要用 NLI 测一致性并以 reward model 和长度检查测相关性,翻译用 chrF、BLEURT、COMET、COMETKiwi,另加版权逐字复现与毒性生成比例检测。他还提醒需通过人工评估校准评估标准,在潜在收益与风险间取得平衡。
Eugene Yan 总结了分类/抽取、摘要、翻译等任务中真正有效的 LLM 评估方法:分类用 recall、precision、ROC-AUC、PR-AUC,摘要用 NLI 测一致性并以 reward model 和长度检查测相关性,翻译用 chrF、BLEURT、COMET、COMETKiwi,另加版权逐字复现与毒性生成比例检测。他还提醒需通过人工评估校准评估标准,在潜在收益与风险间取得平衡。
Lilian Weng 发布长文综述针对大语言模型的对抗攻击,按白盒与黑盒设定分类,涵盖 token 操纵、梯度攻击、越狱提示、人工红队与模型红队五类方法。梯度方法部分介绍了 GBDA、HotFlip、UAT、AutoPrompt、GCG 和 ARCA 等具体技术,越狱部分按竞争目标与泛化错配两种失效模式分析。
Amplify Partners 对 AI Engineering 的调研显示,在已收到的 800 多份回复中,评估(evals)与服务成本是 LLM 部署的最大痛点,而目前仍没有好的评估方法,介于确定但脆弱的断言检查和昂贵的三方 LLM 打分之间。
抽象摘要的评估难点在于幻觉:Kryściński et al. 发现 CNN/DailyMail 上多达 30% 的摘要存在幻觉,Pagnoni et al. 在该数据集上测得 43% 忠实性错误,XSum 高达 92%。
Lilian Weng 在这篇 Lil'Log 长文中梳理了 LLM 驱动的自主智能体系统的三大组件:规划、记忆与工具调用。
针对 ChatGPT、Bard、Claude 等聊天机器人带火大语言模型后涌入的圈外读者,Eugene Yan 撰文解释 Attention 与 Transformer 的核心直觉。
OpenAI 提出自动化可解释性新方法:让 GPT-4 解释 LLM 中单个神经元的激活模式,并对这些解释进行评分。相关研究已发布于 OpenAI 官网。
大型 Transformer 模型推理受限于巨大显存占用与难以并行:KV cache 在 batch size 512、上下文长度 2048 时可达 3TB,是模型体积的 3 倍,且注意力计算随输入长度呈平方增长。文章梳理并行化、内存卸载、智能批处理、剪枝、量化、知识蒸馏及注意力层架构改造等推理加速路径,并详解知识蒸馏与量化方法。
Neural Tangent Kernel(NTK)通过梯度下降描述神经网络训练过程的演化,解释了足够宽的神经网络为何能稳定收敛到全局最小值。文章深入拆解 NTK 的定义与动机,并证明无限宽网络在不同初始化下均可确定收敛。
Lilian Weng 在 Lil'Log 发布《可控神经文本生成》综述,梳理用无条件下预训练语言模型实现可控内容生成的三类路径:引导式解码在测试时筛选输出、优化提示词设计、以及微调基础模型或可操控层。文中还介绍了基于重要性重采样、能量模型(EBM)残差引导与 AutoPrompt 梯度搜索提示词等具体方法。
课程学习早在 1993 年就由 Jeffrey Elman 提出:先用简单数据训练、再逐步提升样本复杂度,否则模型可能完全学不会。
进化策略(ES)是一类黑盒优化算法,无法计算梯度时仍可评估目标函数,将解参数化为分布 p_θ(x) 并循环采样、评估适应度、按适应度更新 θ。Simple Gaussian ES 用各向同性高斯分布建模解,仅跟踪均值 μ 与标准差 σ;CMA-ES 引入协方差矩阵 C 追踪样本间两两依赖,解决 σ 无法快速调整探索空间的问题。
元强化学习(meta-RL)将元学习引入强化学习,训练一个能快速解决未见任务的智能体。其策略输入除当前状态外还包含上一动作 $a_{t-1}$ 和上一奖励 $r_{t-1}$,并采用 LSTM 策略,用隐藏状态记忆轨迹特征,无需显式喂入上一状态。Wang et al.(2016)与 Duan et al.(2017)几乎同时提出该思路,后者称之为 RL²。
单阶段检测器跳过区域提议、直接在密集位置回归检测,速度更快但精度可能略降。YOLO 是首个实时目标检测器,将图像划分为 S×S 网格,每个网格预测 B 个边界框及其置信度与类别概率,最终输出张量形状为 S×S×(5B+K)。
针对 seq2seq 模型固定长度上下文向量无法记住长句的缺陷,注意力机制通过在每个输出位置对全部编码器隐状态加权求和来生成上下文向量,权重由源词与目标词的对齐分数决定。该机制最早由 Bahdanau 等人于 2015 年提出,用于神经机器翻译,编码器采用双向 RNN 拼接前后向隐状态。
"Object Detection for Dummies"系列第二篇回顾图像分类的经典 CNN 架构:AlexNet 用 5 层卷积加 2 层 MLP,VGG 为 19 层、只用 3x3 卷积和 2x2 池化,ResNet 达 152 层并靠残差块保持可训练。
机器学习模型正进入医疗、司法与金融等关键领域,但深度神经网络天生是黑盒,难以解释其决策过程。文章梳理了可解释模型的方法,包括线性回归用系数或 $w_i x_i$ 衡量特征贡献、Naive Bayes 通过后验概率衡量单特征影响,以及决策树/决策列表(如 FRL、BRL、IDS)。作者还指出随机森林并非黑盒,可用平均不纯度下降衡量全局特征重要性。
2016 年 AlphaGo 以 1-4 击败九段棋手李世石,让深度学习和 AI 应用获得大量关注。深度学习的兴起源于两个条件:数据规模大幅增长,以及算力显著提升,使深层神经网络能够自动学习特征、在数据量增大后超越传统机器学习算法。文章随后介绍了几类经典模型,包括受视觉皮层启发的 CNN、Residual Net 的残差连接,以及适合处理长序列、应用于手写识别、语音识别和机器翻译的 RNN。