← archive

Tag

#深度学习

43 posts

Temperature scaling 与 ECE
Temperature scaling 与 ECE
·3 分钟阅读

Temperature scaling 与 ECE

Softmax 分数不是概率——高置信度仍可能常错时,threshold 和 risk 决策会误导;ECE、温度缩放和 isotonic 要在部署域上评。

READ →

cudnn deterministic 全链路
cudnn deterministic 全链路
·4 分钟阅读

cudnn deterministic 全链路

固定 seed 只能控制部分随机性——DataLoader shuffle、cudnn benchmark、多线程和硬件仍会带来 run-to-run 差异,要 log 环境并报告 variance。

READ →

beta=0.999 与 eval 权重
beta=0.999 与 eval 权重
·5 分钟阅读

beta=0.999 与 eval 权重

训练时对参数做指数滑动平均,验证和部署常用 EMA 权重——曲线更顺,有时泛化更好,但要与 optimizer 步和 checkpoint 策略一致。

READ →

use_reentrant=False 粒度
use_reentrant=False 粒度
·5 分钟阅读

use_reentrant=False 粒度

Gradient checkpointing 用重算 forward 换显存——训练大模型或高分辨率输入时 OOM 的常用解法,wall-clock 涨 20–40% 要算进预算。

READ →

标签平滑
标签平滑
·4 分钟阅读

标签平滑

Label smoothing 把 one-hot 变成 soft target,减轻 overconfident logits——有时改善校准和泛化,过大 smoothing 会 hurt top-1 acc。

READ →

早停:盯验证集
早停:盯验证集
·4 分钟阅读

早停:盯验证集

Early stopping 防过拟合,但没有独立验证集或 val 泄漏时,早停只是在随机时刻停——split 诚实比 patience 数值更重要。

READ →

初始化:训不动时
初始化:训不动时
·5 分钟阅读

初始化:训不动时

换激活函数却不改初始化,或最后一层 init 过大,会导致 loss 不降或梯度爆炸——Kaiming/Xavier 和 zero init head 是基本配对方案。

READ →

学习率与 warmup
学习率与 warmup
·5 分钟阅读

学习率与 warmup

训练初期 LR 过大容易 loss spike——linear/cosine warmup 让优化稳定;peak LR 和 total steps 要匹配 batch size 和 optimizer。

READ →

Adam 与 SGD
Adam 与 SGD
·3 分钟阅读

Adam 与 SGD

AdamW 收敛快、对 LR 不敏感;不少视觉任务里调好的 SGD+momentum 泛化更好——按数据规模和预算选,别迷信默认 optimizer。

READ →

交叉熵和 Focal
交叉熵和 Focal
·3 分钟阅读

交叉熵和 Focal

类别极不均衡或 easy negative 淹没时,CE 梯度被 head 样本主导——Focal loss 下调 easy 样本权重,检测常用但 γ 过大也会伤 recall。

READ →