跳到正文
原文
Qwen(@Alibaba_Qwen)· Qwen (@Alibaba_Qwen)·· 2026-08-26AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

Qwen3.8-Flash-Next 的 QSA 注意力内核:1M 上下文下 prefill 提速 7.6×、decode 提速 4.9×

At a 1M-token context length, QSA’s attention kernel is up to 7.6× faster in prefill and 4.9× faster...

AI 导读

在 1M-token 上下文长度下,QSA 的注意力内核在 prefill 阶段最高提速 7.6×,decode 阶段提速 4.9×。当 prefix-cache 命中率为 90% 时,Qwen3.8-Flash-Next 的 prefill 吞吐量达到 Qwen3.7-Plus 的 8.6 倍。

来源:Qwen(@Alibaba_Qwen) · x.com