【示例】从 Scaling Law 看大模型训练算力账
示例内容:用一条公式估算训练一个大模型需要多少 GPU·天,顺便演示本站的公式、代码与表格排版。
示例内容:这是一篇用于演示排版与功能的占位内容,可直接删除或替换为真实内容。
一条经验公式
训练一个稠密 Transformer 的总计算量近似为:
其中 是参数量, 是训练 token 数,系数 6 来自前向(2)+ 反向(4)的乘加次数。若集群有效算力为 (FLOP/s),利用率为 ,则训练时长:
估算示例
| 参数量 | Token 数 | 计算量 |
|---|---|---|
| 7B | 2T | |
| 70B | 15T |
用代码算一遍
def train_days(n_params, n_tokens, gpus, flops_per_gpu=989e12, mfu=0.4):
"""估算训练天数(默认 H100 BF16 稠密峰值 & 40% MFU)"""
total = 6 * n_params * n_tokens
return total / (gpus * flops_per_gpu * mfu) / 86400
print(f"{train_days(70e9, 15e12, 8192):.1f} 天")
行内代码示例:torch.compile(model)。