Causal Attention:为什么 KV hit 后 Attention 按 1 - h² 缩放
用 causal attention 的下三角区域推导 prefix cache hit 后 attention 近似按 1-h² 缩放
Prefix cache 命中前 个 token 后,新 suffix 仍要访问 cached prefix。Attention 省掉的是 prefix-prefix 的二维三角区域,而不是简单省掉 比例的所有工作。
- 一句话:Dense causal prefill 的工作量像下三角;命中 prefix 后去掉左上角小三角,所以剩余比例近似为
1-h²。 - 三个判断:suffix-prefix 矩形仍需计算;逐 token projection/FFN 更接近
1-h;理论交互比例不等于 kernel 延迟比例。 - 核心模型:
W_hit = M·H + M(M+1)/2,其中H=hN、M=N-H,因此W_hit/W_0 ≈ 1-h²。 - 边界:只适用于复用连续 prefix 的 dense causal 可见区域;滑窗、稀疏、CSA/HCA、递推结构及拆分后的 projection 都需重建自己的缩放模型。
1. 0-hit 是一个下三角
对长度为 的 causal prompt,第 个 Query 只能看位置 :
key/value token
1 2 3 4 5 6 7 8
query
1 x
2 x x
3 x x x
4 x x x x
5 x x x x x
6 x x x x x x
7 x x x x x x x
8 x x x x x x x x
若把每个可见 Query-Key 交互记作一份工作:
这里讨论的是 attention 交互区域,不是整个 Transformer block 的 FLOPs 或实测时延。
2. Prefix hit 省掉哪一块
令命中长度为 ,未命中 suffix 长度为 。以 8 个 token、前 4 个命中为例:
1 2 3 4 | 5 6 7 8
1 .
2 . .
3 . . .
4 . . . .
-------------------------
5 x x x x | x
6 x x x x | x x
7 x x x x | x x x
8 x x x x | x x x x
. 是已复用的 prefix-prefix 区域。suffix 每一行仍需读 prefix K/V,因此剩余工作包含:
- suffix 对 prefix 的矩形:;
- suffix 内部的下三角:。
3. 1-h² 的推导
剩余交互量为:
也可以直接从完整三角减去命中三角:
所以精确离散比例为:
当 足够大且 :
因此常用一阶近似是:
它表达的是几何区域比例;是否能用于时间缩放,还要看 bucket 里包含哪些算子。
4. 为什么 FFN 更接近 1-h
FFN/MLP 以及 QKV/O projection 是逐新 token 执行的线性层。复用 个 prefix token 后,只需处理 个 suffix token,因此计算量更接近:
当 :
逐 token 线性部分:剩 50%
dense causal 交互:剩 75%
这解释了为什么不能对整个 prefill breakdown 统一乘 1-h,也不能把包含 projection 的总 “attention” bucket 全部无条件乘 1-h²。
5. 如何交给端到端模型
本页的输出只有一个局部控制量:
dense causal interaction scale ≈ 1 - h²
端到端 TTFT 还要加入 FFN/projection、固定开销、KV load、传输与计算 overlap,并与 decode chip-time 合并。这些内容由 KV Cache Hit Ratio 修正模型 负责,本页不再展开第二套模型。
6. 适用边界
使用 1-h² 前检查:
- 命中的是从位置 0 开始的连续 prefix,而不是离散块。
- 可见区域是标准 dense causal 下三角。
- 目标 bucket 是 Query-Key/Value 历史交互,而非全部 attention projections。
- 工作量近似与目标 kernel 的时延趋势经过校准。
- cache 已可用;若需从 Host/远端加载,传输时间单独进入 TTFT。
Sliding Window、Block Sparse、CSA/HCA 的可见区域不同;MLA 虽压缩 payload,但若仍访问完整历史,其 token 交互区域可以相同、每次交互的字节和 kernel 路径却不同。
相关页面
- KV Cache — Prefix 复用、分页和生命周期。
- KV Cache Hit Ratio 修正模型 — 从局部面积进入 TTFT 与 TPM。
- Attention 架构演化 — 哪些结构改变可见区域或状态形态。
- 模拟器建模指南 — 公式、作用域与校准合同。
← 被以下页面引用(4)
- Chunked Prefill 深入分析:调度、Chunk Size 与 Attention 形状ai-systems · synthesis
- KV Cache Hit Ratio 修正模型:从直觉到统一公式ai-systems · synthesis
- LLM 推理系统全栈地图ai-systems · synthesis
- KV Cache:推理性能的命根子ai-systems · concept
修改历史4 次提交
- docs: refine LLM inference knowledge systemxiaocheng··
f8756b9 - feat(wiki): enforce lifecycle metadata and search aliasesxiaocheng··
1dad7ef - feat(wiki): connect core topics and add reading seriesxiaocheng··
9fc9884 - docs: add inference profiling notesxiaocheng··
6885adf