grad_norm spike 与 misclass gridDL2026年7月13日·3 分钟阅读grad_norm spike 与 misclass grid只看 train loss 不够——要 log lr、grad norm、val slice、GPU 利用率和样例可视化,异常通常是 loss 曲线先以外的信号。#深度学习#训练#监控READ →
视觉增广:别增到不合理CV2026年7月10日·3 分钟阅读视觉增广:别增到不合理几何增广要同步变换 bbox/mask;随机翻转对「文字/左右语义」数据集是毒药;ColorJitter 范围要在部署域内。#计算机视觉#训练#数据READ →
beta=0.999 与 eval 权重DL2026年7月4日·5 分钟阅读beta=0.999 与 eval 权重训练时对参数做指数滑动平均,验证和部署常用 EMA 权重——曲线更顺,有时泛化更好,但要与 optimizer 步和 checkpoint 策略一致。#深度学习#训练#EMAREAD →
use_reentrant=False 粒度DL2026年7月3日·5 分钟阅读use_reentrant=False 粒度Gradient checkpointing 用重算 forward 换显存——训练大模型或高分辨率输入时 OOM 的常用解法,wall-clock 涨 20–40% 要算进预算。#深度学习#显存#训练READ →
梯度裁剪:爆炸刹车DL2026年6月22日·3 分钟阅读梯度裁剪:爆炸刹车clip_grad_norm 能止住 NaN 连锁,但根因常是 LR 过大、loss scale 或 bad batch——裁剪是买时间,不是根治。#深度学习#训练#稳定READ →
混合精度:溢出与缩放DL2026年6月21日·4 分钟阅读混合精度:溢出与缩放AMP fp16/bf16 加速训练,但 gradient underflow 会 NaN——GradScaler 动态缩放是标配,bf16 在 A100+ 上 often 更省心。#深度学习#训练#AMPREAD →
初始化:训不动时DL2026年6月20日·5 分钟阅读初始化:训不动时换激活函数却不改初始化,或最后一层 init 过大,会导致 loss 不降或梯度爆炸——Kaiming/Xavier 和 zero init head 是基本配对方案。#深度学习#初始化#训练READ →
先过拟合一小撮DL2026年6月17日·3 分钟阅读先过拟合一小撮连 50 张训练子集都学不会,加数据和大模型没用——先 overfit tiny set 验证实现、标签和 loss 正确。#深度学习#训练#调试READ →
学习率与 warmupDL2026年6月16日·5 分钟阅读学习率与 warmup训练初期 LR 过大容易 loss spike——linear/cosine warmup 让优化稳定;peak LR 和 total steps 要匹配 batch size 和 optimizer。#深度学习#学习率#训练READ →
Adam 与 SGDDL2026年6月15日·3 分钟阅读Adam 与 SGDAdamW 收敛快、对 LR 不敏感;不少视觉任务里调好的 SGD+momentum 泛化更好——按数据规模和预算选,别迷信默认 optimizer。#深度学习#优化器#训练READ →