Roofline 实验台:batch 为什么是免费午餐
decode 每步 = 读一遍权重 + 算 2N×batch 次 FLOP。batch 越大,同样的搬运量摊给越多 token,算术强度线性上升——把 batch 滑块从 1 拉到 64,看点怎么爬上屋顶。
峰值算力
312
TFLOPS
显存带宽
2000
GB/s
模型权重
14
GB (FP16)
batch size
1
算术强度
—
FLOP/B
吞吐
—
tok/s
算力利用
—
%