← archive

Tag

#训练

10 posts

beta=0.999 与 eval 权重
beta=0.999 与 eval 权重
·5 分钟阅读

beta=0.999 与 eval 权重

训练时对参数做指数滑动平均,验证和部署常用 EMA 权重——曲线更顺,有时泛化更好,但要与 optimizer 步和 checkpoint 策略一致。

READ →

use_reentrant=False 粒度
use_reentrant=False 粒度
·5 分钟阅读

use_reentrant=False 粒度

Gradient checkpointing 用重算 forward 换显存——训练大模型或高分辨率输入时 OOM 的常用解法,wall-clock 涨 20–40% 要算进预算。

READ →

初始化:训不动时
初始化:训不动时
·5 分钟阅读

初始化:训不动时

换激活函数却不改初始化,或最后一层 init 过大,会导致 loss 不降或梯度爆炸——Kaiming/Xavier 和 zero init head 是基本配对方案。

READ →

学习率与 warmup
学习率与 warmup
·5 分钟阅读

学习率与 warmup

训练初期 LR 过大容易 loss spike——linear/cosine warmup 让优化稳定;peak LR 和 total steps 要匹配 batch size 和 optimizer。

READ →

Adam 与 SGD
Adam 与 SGD
·3 分钟阅读

Adam 与 SGD

AdamW 收敛快、对 LR 不敏感;不少视觉任务里调好的 SGD+momentum 泛化更好——按数据规模和预算选,别迷信默认 optimizer。

READ →