返回主线PARALLEL HORIZONS
课程 07机架级推理
阅读材料
  1. 01压缩
  2. 02分工
  3. 03恢复
  4. 04完成

步骤 01 · 压缩

四位数值很小,缩放策略必须更精细。

机架级推理首先受权重和 KV Cache 的存储、搬运成本约束。E2M1 只有四位,若整个张量共用过于粗糙的范围,局部离群值会挤压其它数值。
NVFP4 量化 RECIPETEACHING FLOW · VALIDATE QUALITY
01recipe = Float4()
02with te.autocast(enabled=True, recipe=recipe):
03logits = model(tokens)
04quality = validate(logits, reference)
选择四位缩放策略
量化权重微块6 × 16 TEACHING VALUES
等待选择四位缩放策略0 / 6

位数越低,Scale 的粒度越重要。压缩的目标不是最少比特,而是在容量、带宽和可接受误差之间建立可验证的交换。

代码与 96 个值是结构教学,不是特定模型 API 或质量数据。真实部署必须用支持的量化工具、校准集和目标任务验证。