跳到正文
原文
Ahead of AI — Sebastian Raschka· Sebastian Raschka, PhD·· 2025-12-03精选AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

从 DeepSeek V3 到 V3.2:架构、稀疏注意力与 RL 更新

From DeepSeek V3 to V3.2: Architecture, Sparse Attention, and RL Updates

AI 导读

Sebastian Raschka 撰文梳理 DeepSeek V3 到 V3.2 的技术演进,核心变化是 V3.2 沿用 V3.2-Exp 的架构,加入 DeepSeek Sparse Attention(DSA)型稀疏注意力以降低长上下文下的训练与推理成本,注意力复杂度从 O(L²) 降到 O(Lk),其中 k 在官方代码中设为 2048。

推荐理由

梳理从 V3 到 V3.2 的架构与训练变化,读者可对照前代理解稀疏注意力和 RL 的具体改动。

来源:Ahead of AI — Sebastian Raschka · magazine.sebastianraschka.com