跳到正文
原文
Ahead of AI — Sebastian Raschka· Sebastian Raschka, PhD·· 2026-05-16AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

LLM 架构新动向:KV 共享、mHC 与压缩注意力

Recent Developments in LLM Architectures: KV Sharing, mHC, and Compressed Attention

AI 导读

Sebastian Raschka 梳理近期开源权重模型的架构改动,指出长上下文效率成为设计重心。文章拆解 Gemma 4 的跨层 KV 共享与逐层嵌入、Laguna XS.2 的逐层注意力预算、ZAYA1-8B 的压缩卷积注意力,以及 DeepSeek V4 的 mHC 与 CSA/HCA 压缩注意力。

来源:Ahead of AI — Sebastian Raschka · magazine.sebastianraschka.com