返回主线PARALLEL HORIZONS
课程 06Transformer 扩展
阅读材料
  1. 01校准
  2. 02切分
  3. 03重叠
  4. 04完成

步骤 01 · 校准

位数变少之前,先让数值落进表示范围。

Transformer 的矩阵计算已经能使用 Tensor Core,但前向激活和反向梯度的分布并不相同。直接把所有张量改成同一种 FP8,会把范围之外的值截断或让小值消失。
TRANSFORMER ENGINE · FP8 RECIPEE4M3 FORWARD · E5M2 BACKWARD
01recipe = DelayedScaling(
02fp8_format=Format.E4M3,
03amax_history_len=0)
04with te.autocast(enabled=True, recipe=recipe):
05loss = transformer(tokens)
06loss.backward()
选择数值方案
前向 / 反向数值追踪CONCEPTUAL TENSOR DISTRIBUTION
等待选择 FP8 RECIPE0 / 6

低精度不是改一个 dtype:先观察张量分布,再为不同阶段选择格式、Scale 和保留高精度的状态。

柱形图只演示范围与缩放关系,不是实际模型张量或精度测量。生产训练必须验证损失、收敛和下游质量。