【示例】从 Scaling Law 看大模型训练算力账

示例内容:用一条公式估算训练一个大模型需要多少 GPU·天,顺便演示本站的公式、代码与表格排版。

AI 文章 示例内容 约 1 分钟读完

示例内容:这是一篇用于演示排版与功能的占位内容,可直接删除或替换为真实内容。

一条经验公式

训练一个稠密 Transformer 的总计算量近似为:

其中 是参数量, 是训练 token 数,系数 6 来自前向(2)+ 反向(4)的乘加次数。若集群有效算力为 (FLOP/s),利用率为 ,则训练时长:

估算示例

参数量 Token 数 计算量
7B2T
70B15T

用代码算一遍

def train_days(n_params, n_tokens, gpus, flops_per_gpu=989e12, mfu=0.4):
    """估算训练天数(默认 H100 BF16 稠密峰值 & 40% MFU)"""
    total = 6 * n_params * n_tokens
    return total / (gpus * flops_per_gpu * mfu) / 86400

print(f"{train_days(70e9, 15e12, 8192):.1f} 天")

行内代码示例:torch.compile(model)。