返回报告库

AI / Technology

批归一化通过减少内部协变量偏移加速深度网络训练

关于这篇论文的三个关键问题

批归一化:通过减少内部协变量偏移加速深度网络训练 解决了什么问题?

随机梯度下降每更新一次前层参数,后层接收的激活分布就可能改变。论文认为,后层因此需要反复适应新的均值、方差与尺度;在 sigmoid 这类饱和非线性中,激活还可能滑到曲线两端的平坦区,使梯度变小。网络越深,这种连锁影响越难控制,训练便更依赖小学习率和谨慎初始化。来源:§1

批归一化:通过减少内部协变量偏移加速深度网络训练 的核心结论有哪些证据?

ImageNet 结果。 实验使用 1,000 类 ImageNet、批大小 32 的 Inception 变体。仅加入 BN 的 BN-Baseline 用不到原模型一半的步数达到 72.2%;调优后的 BN-x5 用少 14 倍的步数达到同一准确率;BN-x30 最终达到 74.8%。六模型集成在验证集报告 4.9% top-5 错误率,在测试集报告 4.82%。来源:§4.2.2–4.2.3、图 3–4

阅读 批归一化:通过减少内部协变量偏移加速深度网络训练 时最需要注意什么局限?

MNIST 机制观察。 作者用 28×28 二值图像、3 个各含 100 个 sigmoid 激活的全连接隐藏层、每批 60 个样本训练 50,000 步。加入 BN 后,测试准确率上升更快;最后一个隐藏层的典型 sigmoid 输入分布也随训练更稳定。这支持“BN 与更稳定的内部分布同时出现”,但单个激活的可视化并不能单独证明因果机制。来源:§4.1、图 1

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro