跳到正文
原文
DeepSeek(@deepseek_ai)· DeepSeek (@deepseek_ai)·· 2025-02-24AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

DeepSeek 开源 FlashMLA:面向 Hopper GPU 的 MLA 解码内核

🚀 Day 1 of #OpenSourceWeek: FlashMLA Honored to share FlashMLA - our efficient MLA decoding kernel...

AI 导读

DeepSeek 在开源周第一天发布 FlashMLA,这是面向 Hopper GPU 的高效 MLA 解码内核,针对可变长度序列优化并已投入生产使用。它支持 BF16 和 Paged KV cache(block size 64),在 H800 上达到内存受限 3000 GB/s、计算受限 580 TFLOPS,代码已在 GitHub 开源。

来源:DeepSeek(@deepseek_ai) · x.com