
·5 分钟阅读
Pre-LN 与 RMSNorm eps
LayerNorm 在 channel/ token 维归一化,不依赖 batch 统计——Transformer 和小 batch 场景比 BatchNorm 稳,但和 BN 的 inductive bias 不同。
READ →

LayerNorm 在 channel/ token 维归一化,不依赖 batch 统计——Transformer 和小 batch 场景比 BatchNorm 稳,但和 BN 的 inductive bias 不同。
READ →