Series: LLM 算法 LeetCode
All the articles in the "LLM 算法 LeetCode" series, in reading order.
-
LLM 算法 LeetCode(一):请求结构与推理指标
从 Attention 与 Transformer 的关系出发,梳理 MHA / MQA / GQA / MLA 的 KV cache 演进主线,并拆解一次推理请求的 Prefill / Decode 两阶段与 TTFT / TPOT 两大延迟指标。
-
LLM 算法 LeetCode(二):Prefill 与 Attention Kernel
FlashAttention 不改 attention 的计算复杂度,而是用 IO-aware 的分块 + 在线 softmax,把 N×N 中间矩阵从显存流量中拿掉,实现精确而非近似的加速。
-
LLM 算法 LeetCode(三):单请求 Decode 与生成策略
从 KV Cache 的近似账本公式出发,厘清为何它随序列长度线性而非平方增长,再梳理 KV 压力的八类优化手段、Greedy / Temperature / Top-k / Top-p 四种采样策略,以及投机解码中草稿模型与目标模型的分工。
-
LLM 算法 LeetCode(四):KV Cache 状态与生命周期
PagedAttention 管"内存怎么分配"(物理层),RadixAttention 管"哪些缓存内容能被跨请求复用"(逻辑层)。两者互补,RadixAttention 实际构建在分页式 KV 分配之上。