KV Cache Hit Ratio 修正模型:从直觉到统一公式
在固定配置下把 KV prefix hit 映射到 compute、cache load、overlap、TTFT 与 Delivered/Physical TPM
KV prefix hit 同时减少重复计算、增加或复用 cache 读取,并可能改变瓶颈位置。端到端模型不能只把 TTFT 或 TPM 乘一个 1-h;它要把 compute、load、overlap、fixed 与 decode 分开。
- 一句话:Hit 的收益取决于省下的 prefill compute 能否覆盖 cache load;Delivered TPM 通过总 chip-time 传导,Physical TPM 还要修正计入的 token 分子。
- 三个判断:Attention 与逐 token 线性算子缩放不同;load 必须按来源层级和 per-rank bytes 计;Delivered TPM 与 Physical TPM 的分子含义不同。
- 核心模型:
TTFT = T_fixed + T_compute(h) + T_load(h) - α·min(T_compute,T_load),再与T_decode合成总 chip-time。 - 边界:这是固定配置下的一阶敏感性/兼容模型,不替代目标 hit 下的原生仿真、显存重算与候选配置重排;输入缺失时应返回不可比较,而不是补零。
适用边界:固定配置分析,不替代原生重跑
本页适合解释单个既有配置在 hit 变化下的方向、兼容历史上缺少 KV 建模的结果,或作为 native 实现的对照近似。它不证明后处理与仿真可交换:
KV hit 会改变有效 token 数、算子 shape、MoE 通信 payload、显存与 Batch 约束、overlap 关系,并可能改变最优 TP/DP/EP/MoE-TP 配置。因此生产模拟器必须把 作为场景输入,在模型层重新执行算子、通信、显存和候选配置搜索;编排层不应根据 breakdown 展示标签二次推断物理缩放。完整的参数归属与验收规则见模拟器建模指南。
1. 本页接收什么、输出什么
输入至少包括:
- 连续 prefix 的 token hit ratio ;
- 0-hit prefill breakdown;
- 命中 payload 的驻留层级与 per-rank bytes/token;
- 有效传输带宽与 overlap 假设;
- decode chip-time 及 ISL/OSL 口径。
输出是同一 workload identity、同一并行配置、同一可行性边界下的 TTFT 与 TPM 近似修正。它不能用于跨配置重排,也不能复用 0-hit 下已经失效的 Batch 或显存结论。若 是“命中请求比例”而不是“命中 token 比例”,必须先转换,二者不能直接代入同一公式。
2. Compute:按算子作用域缩放

Dense causal interaction 的剩余区域近似为 ;完整几何推导及适用条件见 Causal Attention 命中面积。这里直接使用它,不再重复证明。

有可用 breakdown 时:
| Bucket | 一阶缩放 | 说明 |
|---|---|---|
| causal QK/AV interaction | suffix 仍访问 cached prefix | |
| QKV/O projection、FFN/MoE | 只为 miss suffix 重算 | |
| communication/runtime | 单独建模 | 可能固定、分段或随 batch 改变 |
若 trace 只给一个混合 “attention” bucket,不能确定其中 projection 与 interaction 的占比。此时应保留区间或校准系数,而不是假装分解精确。
3. Load:命中不等于免费驻留

若命中的 prefix 已在 GPU HBM,额外 transfer 可以接近零;若在 Host、NVMe 或远端 cache,需要加载到执行设备。令 为本次确实迁移的 hit tokens:
简单场景可令 ,但共享驻留、局部命中、分层 cache 或压缩传输都会改变它。
MHA/GQA 的 per-rank payload 可从 KV Cache 的全局逻辑公式出发,并按已确认的 TP layout 修正;MLA、CSA/HCA 必须使用各自 schema。不要把全模型 bytes 除以单卡带宽,也不要把理论链路峰值当有效带宽。
4. Overlap 与 TTFT
令 表示 load 与可变 compute 的可重叠程度:
| 解释 | 可变部分 | |
|---|---|---|
| 0 | 不重叠的保守复刻 | |
| 1 | 充分重叠的上界 |
不是硬件常数。它受 chunk、prefetch、scheduler、并发和依赖链影响,应由 trace 或实验校准;配置目标只能标为假设。
5. 从 TTFT 到两种 TPM
设同一规范化请求的:
- :hit 修正后的 prefill chip-time。
- :decode chip-time。
若 prefix hit 不改变输出长度与 decode 执行, 可暂视为固定;若 scheduler、cache contention 或 batch 形态同时变化,必须重测。
| 口径 | 公式 | 回答的问题 |
|---|---|---|
| Delivered TPM | 单位 chip-time 向用户交付多少 token? | |
| Physical TPM | 按“新算 token”口径折算多少 token? |
单位要求 使用毫秒;若使用秒,分子应为 60。两种分子不可混用:
- cached input 仍属于用户请求,所以 Delivered TPM 保留完整 ISL。
- Physical TPM 去掉未重新执行的 prefix token,但它只是 token 记账口径;suffix 对 cached prefix 的 attention 与 cache load 仍消耗硬件,不能把它当能耗或 FLOPs 真值。
高 OSL 或 decode 占比高时,prefill 即使显著缩短,端到端 TPM 增益也会被 稀释。
6. 数据不足时如何退化
若没有算子 breakdown,可用单线性近似:
若进一步假设充分 overlap,并定义全量 cache load 与 0-hit compute 的时间比:
则可写成趋势模型:
它只用于说明“compute 下降、load 上升”的交叉点。相比完整模型,它没有显式固定开销、算子差异和 decode,不能用于承诺绝对容量或 SLO。
7. 从 measured hit 修正到 target hit
若压测已经在 下完成,而目标是 ,应使用同一校准模型分别求总 chip-time:
再按目标 hit 转为 Physical TPM:
这个相对修正要求模型、ISL/OSL、并行配置、并发和 cache 层级一致。若这些条件变化,不能把 hit 差异当唯一自变量。
8. 校准与误用检查
在输出结果前确认:
- 是 token-weighted 连续 prefix hit,还是其他统计?
- baseline 是 0-hit,还是已含 measured hit?
- attention bucket 是否拆出 projection?
- payload 是全局还是 per-rank,是否包含 Scale/对齐?
- 命中数据已经在 HBM,还是需要 Host/远端加载?
- 有效带宽和 来自实测还是配置假设?
- 输出是 Delivered 还是 Physical TPM?
- decode 是否确实可视为不变?
- 当前用途是固定配置敏感性分析,还是需要重新搜索候选配置?
缺失项应明确标记 missing、unavailable 或 not_comparable。估算值与校准值也应分栏展示。
相关页面
- Causal Attention 命中面积 —
1-h²的唯一推导页。 - KV Cache — bytes/token、per-rank、分页与驻留生命周期。
- DeepSeek MLA — latent KV 的 payload 与 kernel 边界。
- 模拟器建模指南 — 公式作用域、估算和校准合同。
← 被以下页面引用(5)
- 模拟器建模指南:显存与吞吐公式ai-systems · synthesis
- Chunked Prefill 深入分析:调度、Chunk Size 与 Attention 形状ai-systems · synthesis
- LLM 推理系统全栈地图ai-systems · synthesis
- Causal Attention:为什么 KV hit 后 Attention 按 1 - h² 缩放ai-systems · concept
- KV Cache:推理性能的命根子ai-systems · concept
修改历史5 次提交
- docs: distinguish simulation inputs from calibrationxiaocheng··
f034f37 - docs: refine LLM inference knowledge systemxiaocheng··
f8756b9 - feat(wiki): enforce lifecycle metadata and search aliasesxiaocheng··
1dad7ef - feat(wiki): connect core topics and add reading seriesxiaocheng··
9fc9884 - docs: add inference profiling notesxiaocheng··
6885adf