混合精度下的梯度累积:loss 缩放、裁剪与 step 顺序DL2026年7月28日·18 分钟阅读混合精度下的梯度累积:loss 缩放、裁剪与 step 顺序沿 autocast、GradScaler、unscale_、裁剪与 optimizer.step 的数据流说明静默错误;区分 micro-batch 平均与求和,并用等价性测试验收。#深度学习#AMP#梯度累积#训练稳定性READ →
混合精度:溢出与缩放DL2026年6月21日·4 分钟阅读混合精度:溢出与缩放AMP fp16/bf16 加速训练,但 gradient underflow 会 NaN——GradScaler 动态缩放是标配,bf16 在 A100+ 上 often 更省心。#深度学习#训练#AMPREAD →