跳到正文

全部动态

今日 13 条
6月27日周五
  1. METRAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布 DeepSeek 与 Qwen 模型评测结果

    METR 对六个 DeepSeek 与 Qwen 模型做了初步自主能力评测,结果显示 2025 年中的 DeepSeek 模型能力接近 2024 年末的前沿模型。

2月18日周二
  1. DeepSeek(@deepseek_ai)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 推出 NSA:硬件对齐、原生可训练的稀疏注意力机制

    DeepSeek 推出 NSA(原生可训练的稀疏注意力机制),通过动态分层稀疏策略、粗粒度 token 压缩与细粒度 token 选择,加速长上下文训练与推理并降低预训练成本。NSA 在通用基准、长上下文任务和指令推理上匹配或超越 Full Attention 模型,论文见 arxiv.org/abs/2502.11089。

11月5日周日
  1. Eugene YanAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用域外微调引导幻觉检测:一项基于 FIB 的实验

    在事实不一致性基准 FIB 上,先用 Wikipedia 摘要微调 3 个 epoch、再在 FIB 上微调 10 个 epoch,相比只在 FIB 上微调,PR AUC 达到 0.85,提升 23%,且概率分布分离得更好,便于生产环境选取阈值。模型采用在 MNLI 上微调过的 BART 变体,通过 NLI 判断摘要是否与原文矛盾来识别幻觉。

5月10日周三
  1. Jan Leike(@janleike)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 用 GPT-4 自动解释 LLM 神经元激活模式并打分

    OpenAI 提出自动化可解释性新方法:让 GPT-4 解释 LLM 中单个神经元的激活模式,并对这些解释进行评分。相关研究已发布于 OpenAI 官网。

9月9日周五
  1. Lilian Weng — Lil’LogAI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从数学原理理解 Neural Tangent Kernel(NTK)

    Neural Tangent Kernel(NTK)通过梯度下降描述神经网络训练过程的演化,解释了足够宽的神经网络为何能稳定收敛到全局最小值。文章深入拆解 NTK 的定义与动机,并证明无限宽网络在不同初始化下均可确定收敛。

6月10日周五
  1. Lilian Weng — Lil’LogAI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    广义视觉语言模型:四类视觉与语言融合方法综述

    Lilian Weng 在 Lil'Log 综述将视觉语言模型(VLM)归为四类:把图像转为可与 token 嵌入联合训练的嵌入向量、学习可作为冻结预训练语言模型前缀的图像嵌入、用专门设计的 cross-attention 机制把视觉信息融入语言模型各层,以及不做任何训练直接组合视觉与语言模型。

2月26日周五
  1. Geoffrey Hinton(@geoffreyhinton)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Geoffrey Hinton 发布新论文:神经网络如何表示部分-整体层级

    Geoffrey Hinton 发布新论文,探讨神经网络如何表示部分-整体层级,论文编号 arXiv:2102.12627。该论文提出了一种在神经网络中表征部分与整体层级关系的方法。

6月23日周日
  1. Lilian Weng — Lil’LogAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta Reinforcement Learning:元强化学习综述

    元强化学习(meta-RL)将元学习引入强化学习,训练一个能快速解决未见任务的智能体。其策略输入除当前状态外还包含上一动作 $a_{t-1}$ 和上一奖励 $r_{t-1}$,并采用 LSTM 策略,用隐藏状态记忆轨迹特征,无需显式喂入上一状态。Wang et al.(2016)与 Duan et al.(2017)几乎同时提出该思路,后者称之为 RL²。

9月7日周五
  1. Berkeley AI Research(@berkeley_ai)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    BAIR 用真实机器人实现样本高效多任务深度强化学习

    BAIR 提出让智能体自行设定目标并自主练习达成,从而直接从像素输入在真实机器人上实现样本高效的多任务深度强化学习。该工作由 Vitchyr 与 Ashvin Nair 在 BAIR 博客中介绍。

4月27日周五
  1. Berkeley AI Research(@berkeley_ai)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    该提前规划还是试错学习?BAIR 博客解读时序差分模型(TDMs)

    BAIR 发布博客,介绍时序差分模型(TDMs)如何结合基于模型与无模型强化学习两者的优势。该文由 Vitchyr 撰写,探讨智能体在规划与试错学习之间的取舍。

9月28日周四
  1. Lilian Weng — Lil’LogAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用信息论剖析深度学习:Tishby 的信息瓶颈理论

    Naftali Tishby 提出用信息瓶颈(IB)方法为深度神经网络给出新的学习界,因为参数量指数级增长使传统学习理论失效。他将 DNN 训练分为两个阶段:先充分表征输入并最小化泛化误差,再压缩表示以遗忘无关细节,并称"学习最重要的部分其实是遗忘"。

8月20日周日
  1. Lilian Weng — Lil’LogAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 GAN 到 WGAN:生成对抗网络的数学原理与训练难题

    生成对抗网络(GAN)由生成器和判别器两个模型构成,二者在训练中相互博弈、彼此增强,但存在训练不稳定、难以收敛等问题。文章梳理了 GAN 框架背后的数学原理,从 KL 散度与 JS 散度出发解释其训练困难的原因,并介绍了为解决这些问题而提出的 GAN 改进版本 WGAN。