跳到正文

#论文/研究

今日 11 条
3月1日周六
  1. DeepSeek(@deepseek_ai)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 V3/R1 推理系统概览

    DeepSeek 开源周第 6 天发布 DeepSeek-V3/R1 推理系统概览,通过跨节点 EP 批扩展、计算通信重叠和负载均衡优化吞吐与延迟。其在线服务统计显示,单个 H800 节点每秒输入 73.7k、输出 14.8k token,成本利润率 545%。

2月18日周二
  1. DeepSeek(@deepseek_ai)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 推出 NSA:硬件对齐、原生可训练的稀疏注意力机制

    DeepSeek 推出 NSA(原生可训练的稀疏注意力机制),通过动态分层稀疏策略、粗粒度 token 压缩与细粒度 token 选择,加速长上下文训练与推理并降低预训练成本。NSA 在通用基准、长上下文任务和指令推理上匹配或超越 Full Attention 模型,论文见 arxiv.org/abs/2502.11089。

1月7日周日
  1. Eugene YanAI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    语言建模论文阅读清单:从 Transformer 到 RAG 的一年份必读论文

    Eugene Yan 与朋友组建每周论文俱乐部,整理出一份语言建模基础论文清单,每篇附一句话总结,涵盖 Attention Is All You Need、GPT、BERT、T5、Chinchilla、LLaMA、InstructGPT、LoRA、QLoRA、RAG、FlashAttention、CLIP、DPO、LCM 等。

11月5日周日
  1. Eugene YanAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用域外微调引导幻觉检测:一项基于 FIB 的实验

    在事实不一致性基准 FIB 上,先用 Wikipedia 摘要微调 3 个 epoch、再在 FIB 上微调 10 个 epoch,相比只在 FIB 上微调,PR AUC 达到 0.85,提升 23%,且概率分布分离得更好,便于生产环境选取阈值。模型采用在 MNLI 上微调过的 BART 变体,通过 NLI 判断摘要是否与原文矛盾来识别幻觉。

10月25日周三
  1. Lilian Weng — Lil’LogAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lilian Weng 综述大语言模型的对抗攻击

    Lilian Weng 发布长文综述针对大语言模型的对抗攻击,按白盒与黑盒设定分类,涵盖 token 操纵、梯度攻击、越狱提示、人工红队与模型红队五类方法。梯度方法部分介绍了 GBDA、HotFlip、UAT、AutoPrompt、GCG 和 ARCA 等具体技术,越狱部分按竞争目标与泛化错配两种失效模式分析。

5月10日周三
  1. Jan Leike(@janleike)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 用 GPT-4 自动解释 LLM 神经元激活模式并打分

    OpenAI 提出自动化可解释性新方法:让 GPT-4 解释 LLM 中单个神经元的激活模式,并对这些解释进行评分。相关研究已发布于 OpenAI 官网。

11月27日周日
  1. Eugene YanAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 DALL·E 到 Stable Diffusion:扩散模型、文本条件、引导与潜空间的原理梳理

    扩散模型通过前向加噪、反向去噪生成图像,DALL·E、DALL·E 2、Imagen 到 Stable Diffusion 都基于这一思路。DDPM(2020)将反向过程建模为高斯分布,让神经网络从纯噪声中逐步去噪还原图像,训练时学习预测所加噪声,采样时每个时间步只减去一小部分噪声再补回少量噪声。

9月9日周五
  1. Lilian Weng — Lil’LogAI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从数学原理理解 Neural Tangent Kernel(NTK)

    Neural Tangent Kernel(NTK)通过梯度下降描述神经网络训练过程的演化,解释了足够宽的神经网络为何能稳定收敛到全局最小值。文章深入拆解 NTK 的定义与动机,并证明无限宽网络在不同初始化下均可确定收敛。

6月10日周五
  1. Lilian Weng — Lil’LogAI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    广义视觉语言模型:四类视觉与语言融合方法综述

    Lilian Weng 在 Lil'Log 综述将视觉语言模型(VLM)归为四类:把图像转为可与 token 嵌入联合训练的嵌入向量、学习可作为冻结预训练语言模型前缀的图像嵌入、用专门设计的 cross-attention 机制把视觉信息融入语言模型各层,以及不做任何训练直接组合视觉与语言模型。

2月26日周五
  1. Geoffrey Hinton(@geoffreyhinton)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Geoffrey Hinton 发布新论文:神经网络如何表示部分-整体层级

    Geoffrey Hinton 发布新论文,探讨神经网络如何表示部分-整体层级,论文编号 arXiv:2102.12627。该论文提出了一种在神经网络中表征部分与整体层级关系的方法。

6月23日周日
  1. Lilian Weng — Lil’LogAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta Reinforcement Learning:元强化学习综述

    元强化学习(meta-RL)将元学习引入强化学习,训练一个能快速解决未见任务的智能体。其策略输入除当前状态外还包含上一动作 $a_{t-1}$ 和上一奖励 $r_{t-1}$,并采用 LSTM 策略,用隐藏状态记忆轨迹特征,无需显式喂入上一状态。Wang et al.(2016)与 Duan et al.(2017)几乎同时提出该思路,后者称之为 RL²。

3月14日周四
  1. Lilian Weng — Lil’LogAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    深度神经网络真的严重过拟合了吗?

    Lilian Weng 撰文探讨深度神经网络参数极多却仍能泛化的问题,梳理了奥卡姆剃刀、最小描述长度(MDL)原理与 Kolmogorov 复杂度等经典压缩与模型选择理论,并借"生物学家能修好收音机吗"类比揭示局部观察难以还原系统全貌。文章后续更新增补了 Lottery Ticket Hypothesis 一节。

9月7日周五
  1. Berkeley AI Research(@berkeley_ai)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    BAIR 用真实机器人实现样本高效多任务深度强化学习

    BAIR 提出让智能体自行设定目标并自主练习达成,从而直接从像素输入在真实机器人上实现样本高效的多任务深度强化学习。该工作由 Vitchyr 与 Ashvin Nair 在 BAIR 博客中介绍。

4月27日周五
  1. Berkeley AI Research(@berkeley_ai)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    该提前规划还是试错学习?BAIR 博客解读时序差分模型(TDMs)

    BAIR 发布博客,介绍时序差分模型(TDMs)如何结合基于模型与无模型强化学习两者的优势。该文由 Vitchyr 撰写,探讨智能体在规划与试错学习之间的取舍。

9月28日周四
  1. Lilian Weng — Lil’LogAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用信息论剖析深度学习:Tishby 的信息瓶颈理论

    Naftali Tishby 提出用信息瓶颈(IB)方法为深度神经网络给出新的学习界,因为参数量指数级增长使传统学习理论失效。他将 DNN 训练分为两个阶段:先充分表征输入并最小化泛化误差,再压缩表示以遗忘无关细节,并称"学习最重要的部分其实是遗忘"。

8月20日周日
  1. Lilian Weng — Lil’LogAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 GAN 到 WGAN:生成对抗网络的数学原理与训练难题

    生成对抗网络(GAN)由生成器和判别器两个模型构成,二者在训练中相互博弈、彼此增强,但存在训练不稳定、难以收敛等问题。文章梳理了 GAN 框架背后的数学原理,从 KL 散度与 JS 散度出发解释其训练困难的原因,并介绍了为解决这些问题而提出的 GAN 改进版本 WGAN。