Adam 与 SGDDL2026年6月15日·3 分钟阅读Adam 与 SGDAdamW 收敛快、对 LR 不敏感;不少视觉任务里调好的 SGD+momentum 泛化更好——按数据规模和预算选,别迷信默认 optimizer。#深度学习#优化器#训练READ →