KV Cache 显存计算器:长上下文的成本

缓存大小 = 2 (K和V) × L × n_kv × d_k × 上下文 × 每元素字节 × batch。选模型预设或自己调,看一条请求要吃掉多少显存。
每请求缓存 = 2 × × × × ×
= — / 请求 | batch 合计 = —
权重 FP16
KV Cache
■ 权重 ■ 缓存
80GB 卡上
可容纳并发—
每 token 缓存—MB