跳到正文
原文
meng shao(@shao__meng)· meng shao (@shao__meng)·· 3 小时前AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

LLM 推理性能框架:Prefill 拼算力,Decode 拼带宽

LLM 推理性能核心框架:同一个模型在"读"和"写"两个阶段,瓶颈完全不同,理解这一点是所有推理优化(量化、批处理、投机解码)的基础 文档:https://t.co/ppOMc83LsX # 核心...

AI 导读

这篇内容介绍 LLM 推理性能的核心框架:一次推理由 Prefill 和 Decode 两个阶段组成,Prefill 并行读入整个 prompt 并写入 KV 缓存、产出第一个 token,瓶颈在算力;Decode 自回归逐 token 生成、每次都要读权重和全部历史 KV,瓶颈在内存带宽。

来源:meng shao(@shao__meng) · x.com