DeepSeek 发布 V3/R1 推理系统概览
DeepSeek 开源周第 6 天发布 DeepSeek-V3/R1 推理系统概览,通过跨节点 EP 批扩展、计算通信重叠和负载均衡优化吞吐与延迟。其在线服务统计显示,单个 H800 节点每秒输入 73.7k、输出 14.8k token,成本利润率 545%。
DeepSeek 开源周第 6 天发布 DeepSeek-V3/R1 推理系统概览,通过跨节点 EP 批扩展、计算通信重叠和负载均衡优化吞吐与延迟。其在线服务统计显示,单个 H800 节点每秒输入 73.7k、输出 14.8k token,成本利润率 545%。
DeepSeek 推出 NSA(原生可训练的稀疏注意力机制),通过动态分层稀疏策略、粗粒度 token 压缩与细粒度 token 选择,加速长上下文训练与推理并降低预训练成本。NSA 在通用基准、长上下文任务和指令推理上匹配或超越 Full Attention 模型,论文见 arxiv.org/abs/2502.11089。
Eugene Yan 与朋友组建每周论文俱乐部,整理出一份语言建模基础论文清单,每篇附一句话总结,涵盖 Attention Is All You Need、GPT、BERT、T5、Chinchilla、LLaMA、InstructGPT、LoRA、QLoRA、RAG、FlashAttention、CLIP、DPO、LCM 等。
在事实不一致性基准 FIB 上,先用 Wikipedia 摘要微调 3 个 epoch、再在 FIB 上微调 10 个 epoch,相比只在 FIB 上微调,PR AUC 达到 0.85,提升 23%,且概率分布分离得更好,便于生产环境选取阈值。模型采用在 MNLI 上微调过的 BART 变体,通过 NLI 判断摘要是否与原文矛盾来识别幻觉。
Lilian Weng 发布长文综述针对大语言模型的对抗攻击,按白盒与黑盒设定分类,涵盖 token 操纵、梯度攻击、越狱提示、人工红队与模型红队五类方法。梯度方法部分介绍了 GBDA、HotFlip、UAT、AutoPrompt、GCG 和 ARCA 等具体技术,越狱部分按竞争目标与泛化错配两种失效模式分析。
OpenAI 提出自动化可解释性新方法:让 GPT-4 解释 LLM 中单个神经元的激活模式,并对这些解释进行评分。相关研究已发布于 OpenAI 官网。
扩散模型通过前向加噪、反向去噪生成图像,DALL·E、DALL·E 2、Imagen 到 Stable Diffusion 都基于这一思路。DDPM(2020)将反向过程建模为高斯分布,让神经网络从纯噪声中逐步去噪还原图像,训练时学习预测所加噪声,采样时每个时间步只减去一小部分噪声再补回少量噪声。
Neural Tangent Kernel(NTK)通过梯度下降描述神经网络训练过程的演化,解释了足够宽的神经网络为何能稳定收敛到全局最小值。文章深入拆解 NTK 的定义与动机,并证明无限宽网络在不同初始化下均可确定收敛。
Lilian Weng 在 Lil'Log 综述将视觉语言模型(VLM)归为四类:把图像转为可与 token 嵌入联合训练的嵌入向量、学习可作为冻结预训练语言模型前缀的图像嵌入、用专门设计的 cross-attention 机制把视觉信息融入语言模型各层,以及不做任何训练直接组合视觉与语言模型。
Geoffrey Hinton 发布新论文,探讨神经网络如何表示部分-整体层级,论文编号 arXiv:2102.12627。该论文提出了一种在神经网络中表征部分与整体层级关系的方法。
元强化学习(meta-RL)将元学习引入强化学习,训练一个能快速解决未见任务的智能体。其策略输入除当前状态外还包含上一动作 $a_{t-1}$ 和上一奖励 $r_{t-1}$,并采用 LSTM 策略,用隐藏状态记忆轨迹特征,无需显式喂入上一状态。Wang et al.(2016)与 Duan et al.(2017)几乎同时提出该思路,后者称之为 RL²。
Lilian Weng 撰文探讨深度神经网络参数极多却仍能泛化的问题,梳理了奥卡姆剃刀、最小描述长度(MDL)原理与 Kolmogorov 复杂度等经典压缩与模型选择理论,并借"生物学家能修好收音机吗"类比揭示局部观察难以还原系统全貌。文章后续更新增补了 Lottery Ticket Hypothesis 一节。
BAIR 提出让智能体自行设定目标并自主练习达成,从而直接从像素输入在真实机器人上实现样本高效的多任务深度强化学习。该工作由 Vitchyr 与 Ashvin Nair 在 BAIR 博客中介绍。
BAIR 发布博客,介绍时序差分模型(TDMs)如何结合基于模型与无模型强化学习两者的优势。该文由 Vitchyr 撰写,探讨智能体在规划与试错学习之间的取舍。
Naftali Tishby 提出用信息瓶颈(IB)方法为深度神经网络给出新的学习界,因为参数量指数级增长使传统学习理论失效。他将 DNN 训练分为两个阶段:先充分表征输入并最小化泛化误差,再压缩表示以遗忘无关细节,并称"学习最重要的部分其实是遗忘"。
生成对抗网络(GAN)由生成器和判别器两个模型构成,二者在训练中相互博弈、彼此增强,但存在训练不稳定、难以收敛等问题。文章梳理了 GAN 框架背后的数学原理,从 KL 散度与 JS 散度出发解释其训练困难的原因,并介绍了为解决这些问题而提出的 GAN 改进版本 WGAN。