use_reentrant=False 粒度DL2026年7月3日·5 分钟阅读use_reentrant=False 粒度Gradient checkpointing 用重算 forward 换显存——训练大模型或高分辨率输入时 OOM 的常用解法,wall-clock 涨 20–40% 要算进预算。#深度学习#显存#训练READ →