返回报告库

AI / Technology

AlexNet当深度学习第一次在大规模图像识别上拉开差距

关于这篇论文的三个关键问题

AlexNet:当深度学习第一次在大规模图像识别上拉开差距 解决了什么问题?

当时的矛盾是:数据终于够大,模型也可以更有容量,但高分辨率图像上的大型 CNN 计算昂贵,而且论文中的网络有 6000 万参数,即使面对 120 万张训练图仍会明显过拟合。[来源:§1、§4,印刷页 2、5]

AlexNet:当深度学习第一次在大规模图像识别上拉开差距 的核心结论有哪些证据?

最干净的同数据集对比来自 ILSVRC-2010 测试集:CNN 的 top-1 / top-5 错误率是 37.5% / 17.0%;当时已发表的 SIFT + Fisher Vector 方案是 45.7% / 25.7%。也就是说,top-5 错误率下降了 8.7 个百分点。[来源:表 1,印刷页 7]

阅读 AlexNet:当深度学习第一次在大规模图像识别上拉开差距 时最需要注意什么局限?

最大的未决风险有三类:结果依赖大量人工标注、两块 GPU 和多日训练;测试图仍与 ImageNet 的类别和采样方式同分布;论文没有系统评估分布外鲁棒性、公平性、校准、能耗或真实部署失败。定性检索示例说明高层表示能聚合不同姿态的相似对象,但不能替代这些评估。[来源:§5—7,印刷页 7—8;“不能替代”是本文判断]

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro