peft target_modules 与 mergeDL2026年7月18日·5 分钟阅读peft target_modules 与 mergeLoRA 只训低秩增量矩阵,省显存防 catastrophic——rank 和 target modules 决定 capacity,全量微调仍可能在数据足时更强。#深度学习#LoRA#微调READ →
freeze_bn 与 target 域 statsDL2026年6月28日·4 分钟阅读freeze_bn 与 target 域 stats小 batch 微调时 BatchNorm 统计量噪声大——freeze backbone BN、换 SyncBN 或 GroupNorm 往往比盲目加大 batch 更实际。#深度学习#BatchNorm#微调READ →
微调:冻哪些层DL2026年6月25日·3 分钟阅读微调:冻哪些层数据少时一次解冻全网易过拟合+毁 pretrained 特征——先训 head、再逐层解冻是稳妥默认,LR 分组随解冻调整。#深度学习#迁移学习#微调READ →