Tag: KV Cache
All the articles with the tag "KV Cache".
-
LLM 算法 LeetCode(四):KV Cache 状态与生命周期
PagedAttention 管"内存怎么分配"(物理层),RadixAttention 管"哪些缓存内容能被跨请求复用"(逻辑层)。两者互补,RadixAttention 实际构建在分页式 KV 分配之上。
-
LLM 算法 LeetCode(三):单请求 Decode 与生成策略
从 KV Cache 的近似账本公式出发,厘清为何它随序列长度线性而非平方增长,再梳理 KV 压力的八类优化手段、Greedy / Temperature / Top-k / Top-p 四种采样策略,以及投机解码中草稿模型与目标模型的分工。