KV Cache 显存计算器:长上下文的成本
缓存大小 = 2 (K和V) × L × n_kv × d_k × 上下文 × 每元素字节 × batch。选模型预设或自己调,看一条请求要吃掉多少显存。
7B GQA
7B MHA
70B GQA
层数 L
32
KV 头数 n_kv
8
每头维度 d_k
64
上下文长度
8192
并发请求数 batch
8
KV 精度
FP16 (2B)
每请求缓存 = 2 ×
×
×
×
×
=
—
/ 请求 | batch 合计 =
—
权重 FP16
KV Cache
■ 权重
■ 缓存
80GB 卡上
可容纳并发
—
每 token 缓存
—
MB