Transformer 参数量 / 显存计算器
拖动滑块即时计算:注意力 2.5D²(GQA)/4D²(MHA)、FFN 3·D·d_ff、Embedding V·D,以及训练/推理显存。试试复现 Llama-2-7B ≈ 6.7B。
Llama-2-7B
Llama-3-8B
70B 级
层数 L
32
隐藏维 D
4096
d_ff / D
2.69
词表 V
32000
GQA(KV 头 = 1/4,注意力参数 2.5D²;不勾选为 MHA 4D²)
Embedding 与输出层共享(tied)
总参数量:
0
B
L 层注意力
L 层 FFN (3·D·d_ff)
Embedding
d_ff =
· FFN 占比
训练态 (AdamW, 16B/参数)
GB
推理 FP16 权重
GB
INT4 权重 (含开销)
GB