
·3 分钟阅读
PyTorch SDPA 的两个静默坑:布尔 mask 与 eval dropout
拆清 scaled_dot_product_attention 的 keep-mask 语义、广播维度和 dropout_p 行为,用最小张量测试阻止注意力泄漏。
READ →

·5 分钟阅读
SDPA backend 与 FlashAttention
Self-attention 的 O(n²) 内存和算力随序列长度平方涨——长序列要算 FLOPs/activation 预算,FlashAttention 和线性近似是工程选项不是免费 lunch。
READ →

·4 分钟阅读
freeze_bn 与 target 域 stats
小 batch 微调时 BatchNorm 统计量噪声大——freeze backbone BN、换 SyncBN 或 GroupNorm 往往比盲目加大 batch 更实际。
READ →

·5 分钟阅读
Pre-LN 与 RMSNorm eps
LayerNorm 在 channel/ token 维归一化,不依赖 batch 统计——Transformer 和小 batch 场景比 BatchNorm 稳,但和 BN 的 inductive bias 不同。
READ →

·4 分钟阅读
BatchNorm:训练推理模式
model.train() 与 model.eval() 切换 BatchNorm 的统计量来源——忘了 eval 或 batch=1 时 running stats 与当前 batch 混用,推理结果会随机飘。
READ →





































