跳到正文

#推理

今日 17 条
3月31日周日
  1. Eugene YanAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    任务专属 LLM 评估:哪些有效,哪些无效

    Eugene Yan 总结了分类/抽取、摘要、翻译等任务中真正有效的 LLM 评估方法:分类用 recall、precision、ROC-AUC、PR-AUC,摘要用 NLI 测一致性并以 reward model 和长度检查测相关性,翻译用 chrF、BLEURT、COMET、COMETKiwi,另加版权逐字复现与毒性生成比例检测。他还提醒需通过人工评估校准评估标准,在潜在收益与风险间取得平衡。

10月25日周三
  1. Lilian Weng — Lil’LogAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lilian Weng 综述大语言模型的对抗攻击

    Lilian Weng 发布长文综述针对大语言模型的对抗攻击,按白盒与黑盒设定分类,涵盖 token 操纵、梯度攻击、越狱提示、人工红队与模型红队五类方法。梯度方法部分介绍了 GBDA、HotFlip、UAT、AutoPrompt、GCG 和 ARCA 等具体技术,越狱部分按竞争目标与泛化错配两种失效模式分析。

10月15日周日
  1. Eugene YanAI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Engineer Summit 2023 回顾:LLM 部署的评估与成本难题

    Amplify Partners 对 AI Engineering 的调研显示,在已收到的 800 多份回复中,评估(evals)与服务成本是 LLM 部署的最大痛点,而目前仍没有好的评估方法,介于确定但脆弱的断言检查和昂贵的三方 LLM 打分之间。

9月3日周日
  1. Eugene YanAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    抽象摘要的评估与幻觉检测:ROUGE、METEOR 与 NLI/QA 方法

    抽象摘要的评估难点在于幻觉:Kryściński et al. 发现 CNN/DailyMail 上多达 30% 的摘要存在幻觉,Pagnoni et al. 在该数据集上测得 43% 忠实性错误,XSum 高达 92%。

6月23日周五
  1. Lilian Weng — Lil’LogAI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM 驱动的自主智能体:规划、记忆与工具调用

    Lilian Weng 在这篇 Lil'Log 长文中梳理了 LLM 驱动的自主智能体系统的三大组件:规划、记忆与工具调用。

5月21日周日
  1. Eugene YanAI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    图解 Attention 与 Transformer 的直觉理解

    针对 ChatGPT、Bard、Claude 等聊天机器人带火大语言模型后涌入的圈外读者,Eugene Yan 撰文解释 Attention 与 Transformer 的核心直觉。

5月10日周三
  1. Jan Leike(@janleike)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 用 GPT-4 自动解释 LLM 神经元激活模式并打分

    OpenAI 提出自动化可解释性新方法:让 GPT-4 解释 LLM 中单个神经元的激活模式,并对这些解释进行评分。相关研究已发布于 OpenAI 官网。

1月11日周三
  1. Lilian Weng — Lil’LogAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    大型 Transformer 模型推理优化:蒸馏、量化与架构改进

    大型 Transformer 模型推理受限于巨大显存占用与难以并行:KV cache 在 batch size 512、上下文长度 2048 时可达 3TB,是模型体积的 3 倍,且注意力计算随输入长度呈平方增长。文章梳理并行化、内存卸载、智能批处理、剪枝、量化、知识蒸馏及注意力层架构改造等推理加速路径,并详解知识蒸馏与量化方法。

9月9日周五
  1. Lilian Weng — Lil’LogAI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从数学原理理解 Neural Tangent Kernel(NTK)

    Neural Tangent Kernel(NTK)通过梯度下降描述神经网络训练过程的演化,解释了足够宽的神经网络为何能稳定收敛到全局最小值。文章深入拆解 NTK 的定义与动机,并证明无限宽网络在不同初始化下均可确定收敛。

1月2日周六
  1. Lilian Weng — Lil’LogAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    可控神经文本生成:Lilian Weng 综述可控文本生成方法

    Lilian Weng 在 Lil'Log 发布《可控神经文本生成》综述,梳理用无条件下预训练语言模型实现可控内容生成的三类路径:引导式解码在测试时筛选输出、优化提示词设计、以及微调基础模型或可操控层。文中还介绍了基于重要性重采样、能量模型(EBM)残差引导与 AutoPrompt 梯度搜索提示词等具体方法。

1月29日周三
  1. Lilian Weng — Lil’LogAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    强化学习中的课程学习(Curriculum Learning)综述

    课程学习早在 1993 年就由 Jeffrey Elman 提出:先用简单数据训练、再逐步提升样本复杂度,否则模型可能完全学不会。

9月5日周四
  1. Lilian Weng — Lil’LogAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Evolution Strategies(进化策略)解析:从 Simple Gaussian ES 到 CMA-ES 及其在深度强化学习中的应用

    进化策略(ES)是一类黑盒优化算法,无法计算梯度时仍可评估目标函数,将解参数化为分布 p_θ(x) 并循环采样、评估适应度、按适应度更新 θ。Simple Gaussian ES 用各向同性高斯分布建模解,仅跟踪均值 μ 与标准差 σ;CMA-ES 引入协方差矩阵 C 追踪样本间两两依赖,解决 σ 无法快速调整探索空间的问题。

6月23日周日
  1. Lilian Weng — Lil’LogAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta Reinforcement Learning:元强化学习综述

    元强化学习(meta-RL)将元学习引入强化学习,训练一个能快速解决未见任务的智能体。其策略输入除当前状态外还包含上一动作 $a_{t-1}$ 和上一奖励 $r_{t-1}$,并采用 LSTM 策略,用隐藏状态记忆轨迹特征,无需显式喂入上一状态。Wang et al.(2016)与 Duan et al.(2017)几乎同时提出该思路,后者称之为 RL²。

12月27日周四
  1. Lilian Weng — Lil’LogAI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    YOLO、SSD 与 RetinaNet:快速目标检测模型解析

    单阶段检测器跳过区域提议、直接在密集位置回归检测,速度更快但精度可能略降。YOLO 是首个实时目标检测器,将图像划分为 S×S 网格,每个网格预测 B 个边界框及其置信度与类别概率,最终输出张量形状为 S×S×(5B+K)。

6月24日周日
  1. Lilian Weng — Lil’LogAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Attention 机制详解:从 Seq2Seq 瓶颈到神经机器翻译

    针对 seq2seq 模型固定长度上下文向量无法记住长句的缺陷,注意力机制通过在每个输出位置对全部编码器隐状态加权求和来生成上下文向量,权重由源词与目标词的对齐分数决定。该机制最早由 Bahdanau 等人于 2015 年提出,用于神经机器翻译,编码器采用双向 RNN 拼接前后向隐状态。

12月15日周五
  1. Lilian Weng — Lil’LogAI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    面向初学者的目标检测(二):CNN、DPM 与 Overfeat

    "Object Detection for Dummies"系列第二篇回顾图像分类的经典 CNN 架构:AlexNet 用 5 层卷积加 2 层 MLP,VGG 为 19 层、只用 3x3 卷积和 2x2 池化,ResNet 达 152 层并靠残差块保持可训练。

8月1日周二
  1. Lilian Weng — Lil’LogAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何解释机器学习模型的预测结果?

    机器学习模型正进入医疗、司法与金融等关键领域,但深度神经网络天生是黑盒,难以解释其决策过程。文章梳理了可解释模型的方法,包括线性回归用系数或 $w_i x_i$ 衡量特征贡献、Naive Bayes 通过后验概率衡量单特征影响,以及决策树/决策列表(如 FRL、BRL、IDS)。作者还指出随机森林并非黑盒,可用平均不纯度下降衡量全局特征重要性。

6月21日周三
  1. Lilian Weng — Lil’LogAI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    面向好奇者的深度学习概览:从 AlphaGo 到 CNN 与 RNN

    2016 年 AlphaGo 以 1-4 击败九段棋手李世石,让深度学习和 AI 应用获得大量关注。深度学习的兴起源于两个条件:数据规模大幅增长,以及算力显著提升,使深层神经网络能够自动学习特征、在数据量增大后超越传统机器学习算法。文章随后介绍了几类经典模型,包括受视觉皮层启发的 CNN、Residual Net 的残差连接,以及适合处理长序列、应用于手写识别、语音识别和机器翻译的 RNN。