AI / Technology
FourCastNet使用自适应傅里叶神经算子的全球数据驱动高分辨率天气模型
粗细网格为何影响可见的天气结构
图 1|粗网格会抹平窄雨带、地形作用和气旋结构;0.25° 网格仍不是局地预报,但让全球模型保留更多小尺度信息。教学示意,不是论文原图。
- 它把全球天气预报变成“学会大气状态如何每 6 小时演化”的问题。 FourCastNet 直接在 ERA5 再分析数据上学习,从当前全球大气场预测下一时刻,再把预测结果喂回模型,滚动生成最长一周以上的预报。[来源:论文第 3、6–7 页]
- 关键改变是让神经网络既看得细,又算得动。 模型在 0.25° 网格(约 30 km、720×1440)上运行,用自适应傅里叶神经算子(AFNO)在频域混合远距离信息,把空间混合复杂度控制在约 。[来源:论文第 2、5 页]
- 最有力的价值不是“取代物理模式”,而是快速产生大量可能未来。 论文报告短时效下多项指标可接近 IFS,并能极快地产生集合预报;但它只建模 20 个变量、没有物理约束,而且对极端降水仍明显偏弱。[来源:论文第 4、11、16–17 页]
多个大气变量共同描述一个天气状态
图 2|模型不是只看风或雨,而是用多种大气场共同描述当前状态。教学示意。
每个时刻的输入不是一张普通天气图,而是 20 个彼此耦合的二维场:包括近地面风、2 米温度、地表气压、海平面气压,以及若干气压层上的温度、风、位势高度、相对湿度和整层水汽。每个变量被重网格化为 721×1440;训练时取每 6 小时一个快照。数据按时间切分:1979–2015 年训练,2016–2017 年验证,2018 年及以后做样本外测试。[来源:论文表 1 与第 6 页]
FourCastNet 的单步变换
图 3|“傅里叶”不是在频域直接预测天气,而是把它当作更高效的全局信息混合空间。教学示意。
直观地说,模型先把全球网格切成小块并编码成 token;然后用二维离散傅里叶变换,把空间图样转换为不同尺度的波。AFNO 在频域中对这些成分做可学习的加权与稀疏化,再逆变换回空间域,并加上残差连接。这样,一层就能让相距很远的区域交换信息,而不必逐点计算所有两两关系。技术上,这是在 ViT 骨架中以连续全局卷积替代标准自注意力的空间混合。[来源:论文第 5–6 页,式 1–3]
自回归滚动预报
图 4|每一步都使用上一步的预测,因此误差会随预报时效累积;两步微调只能缓解,不能消除这个问题。教学示意。
模型先学习 ,再用两步微调,让第一次预测也作为第二次输入,从而提前暴露误差累积。推理时重复这一过程,生成多步预报。降水由一个单独模型根据骨干网络预测的大气变量诊断得到。训练集含 54,020 个样本、验证集含 2,920 个样本;端到端训练在 64 张 NVIDIA A100 GPU 上约 16 小时。[来源:论文第 6–7 页]
速度如何转化为集合预报能力
图 5|速度的主要意义是能低成本展开更多可能轨迹;图中两条路径的能力范围不同,不能把数量直接当作质量。教学示意。
计算侧的结果尤其醒目:论文测得,单个含 4 张 A100 的节点可在 7 秒内完成 100 成员、24 小时集合预报,估算耗能约 8 kJ。与文献中的 IFS 配置按“节点时间”比较,30 km FourCastNet 约快 145,000 倍;但作者明确提醒,这不是严格的同类比较:硬件不同,IFS 分辨率约 18 km、变量和垂直层多一个数量级,并保证物理一致性。[来源:论文第 16–17 页与表 2]
研究附录
原文标题: FourCastNet: A Global Data-driven High-resolution Weather Model using Adaptive Fourier Neural Operators
作者: Jaideep Pathak 等 · 发表形式: arXiv 预印本(2022) · 论文: arXiv 2202.11214
核心结论
三句话记住这篇论文
- 它把全球天气预报变成“学会大气状态如何每 6 小时演化”的问题。 FourCastNet 直接在 ERA5 再分析数据上学习,从当前全球大气场预测下一时刻,再把预测结果喂回模型,滚动生成最长一周以上的预报。[来源:论文第 3、6–7 页]
- 关键改变是让神经网络既看得细,又算得动。 模型在 0.25° 网格(约 30 km、720×1440)上运行,用自适应傅里叶神经算子(AFNO)在频域混合远距离信息,把空间混合复杂度控制在约 。[来源:论文第 2、5 页]
- 最有力的价值不是“取代物理模式”,而是快速产生大量可能未来。 论文报告短时效下多项指标可接近 IFS,并能极快地产生集合预报;但它只建模 20 个变量、没有物理约束,而且对极端降水仍明显偏弱。[来源:论文第 4、11、16–17 页]
问题
为什么全球深度学习预报曾经“看不清”
早期数据驱动全球天气模型常用 5.625° 或 2° 网格;其中 5.625° 只把全球表示成 32×64 个像素,无法解析约 500 km 以下的现象。这样的分辨率也许足以描述较平滑的 500 hPa 位势高度,却容易丢失近地面风、降水、山脉影响和热带气旋等细节。FourCastNet 面对的核心问题因此不是“能否预测一个全球平均趋势”,而是:能否在百万级网格点上,同时保留跨洲联系与局地结构,并把计算成本压到可用范围? [来源:论文第 2 页]
传统注意力为什么难以直接放大
视觉 Transformer 的自注意力能建立远距离联系,但计算量会随 token 数量近似平方增长。把普通卷积网络直接放大也很昂贵:论文估算,同一 720×1440 输入、批量为 1 时,FourCastNet 约占 10 GB 显存,而将一个既有 19 层 ResNet 直接迁移到该分辨率约需 83 GB。这个估算说明架构选择受到真实硬件约束,但并不等于对所有卷积模型的全面比较。[来源:论文第 5 页]
方法
从一张全球“多层地图”开始
每个时刻的输入不是一张普通天气图,而是 20 个彼此耦合的二维场:包括近地面风、2 米温度、地表气压、海平面气压,以及若干气压层上的温度、风、位势高度、相对湿度和整层水汽。每个变量被重网格化为 721×1440;训练时取每 6 小时一个快照。数据按时间切分:1979–2015 年训练,2016–2017 年验证,2018 年及以后做样本外测试。[来源:论文表 1 与第 6 页]
AFNO:先换一种坐标系,再做全局混合
直观地说,模型先把全球网格切成小块并编码成 token;然后用二维离散傅里叶变换,把空间图样转换为不同尺度的波。AFNO 在频域中对这些成分做可学习的加权与稀疏化,再逆变换回空间域,并加上残差连接。这样,一层就能让相距很远的区域交换信息,而不必逐点计算所有两两关系。技术上,这是在 ViT 骨架中以连续全局卷积替代标准自注意力的空间混合。[来源:论文第 5–6 页,式 1–3]
从单步学习到滚动预报
模型先学习 ,再用两步微调,让第一次预测也作为第二次输入,从而提前暴露误差累积。推理时重复这一过程,生成多步预报。降水由一个单独模型根据骨干网络预测的大气变量诊断得到。训练集含 54,020 个样本、验证集含 2,920 个样本;端到端训练在 64 张 NVIDIA A100 GPU 上约 16 小时。[来源:论文第 6–7 页]
证据与局限
证据到底支持到哪里
论文在 2018 年样本外初始条件上,以纬度加权异常相关系数(ACC)和均方根误差(RMSE)评估,并与时间匹配的 IFS 预报比较。作者报告,在约 48 小时以内,降水、风和温度等关键变量的 ACC 或 RMSE 可优于 IFS;总体上数天内具有竞争力。一个 2018 年个案中,模型滚动 16 个 6 小时步骤后,仍能在 96 小时预报中呈现台风山竹及三场大西洋飓风的结构与路径;但这是案例证据,不能替代系统性的灾害预报检验。[来源:论文第 8、11 页]
计算侧的结果尤其醒目:论文测得,单个含 4 张 A100 的节点可在 7 秒内完成 100 成员、24 小时集合预报,估算耗能约 8 kJ。与文献中的 IFS 配置按“节点时间”比较,30 km FourCastNet 约快 145,000 倍;但作者明确提醒,这不是严格的同类比较:硬件不同,IFS 分辨率约 18 km、变量和垂直层多一个数量级,并保证物理一致性。[来源:论文第 16–17 页与表 2]
不应略过的失败与不确定性
- 极端降水被抹平。 在相对分位数误差(RQE)上,FourCastNet 对极端降水约低估 35%,IFS 约低估 15%;作者认为过于平滑的输出难以捕捉集中在极少网格中的峰值。[来源:论文第 16 页]
- 物理一致性没有保证。 当前模型不施加物理约束,而 IFS 会生成物理一致的预报;论文也承认 IFS 总体上通常更准确。[来源:论文第 17 页]
- 变量覆盖很窄。 FourCastNet 只建模 20 个变量、5 个垂直层附近的有限状态;IFS 则覆盖 150 多个变量和 50 个以上垂直层。它证明的是一个高分辨率数据驱动骨架的潜力,不是完整业务系统的等价替换。[来源:论文第 4、17 页]
- 极端事件结论仍属探索。 作者明确说,在深度学习可被视作成熟飓风预报技术前,需要更严格研究;个案轨迹和视觉相似不能单独证明预警可靠性。[来源:论文第 9 页]
实际意义
最合理的落点:补充,而非单独裁决
对气象业务,FourCastNet 最直接的意义是快速候选预报器:它可以在昂贵物理集合之外生成大量轨迹,用于筛选场景、敏感性分析或触发更高成本计算。对风电和灾害响应,它可能缩短试算周期并扩大不确定性探索范围。不过,论文并未证明这些轨迹已经概率校准,也未证明用简单高斯噪声扰动初始条件就能覆盖真实预报不确定性;这两点必须在部署前单独验证。
读者可以带走的判断框架
评价这类模型,不要只问“比传统模式快多少”,而应连续问四件事:输入是否来自可靠、及时的数据同化;目标变量和垂直层是否覆盖实际决策;极端值、分布漂移和物理守恒是否经过检验;速度收益是否真正转化为校准良好的集合概率。FourCastNet 的贡献,是证明高分辨率全球数据驱动预报在工程上可行;它留下的最大风险,是看起来清晰、运行很快的天气图,仍可能系统性漏掉最重要的极端峰值。
研究细节与复核问题
- 数据基准: ERA5 是观测与数值模式经数据同化得到的再分析,不等同于直接观测;以 ERA5 为“真值”会继承其误差。[来源:论文第 4 页]
- 比较口径: 2018 年 IFS 数据来自 TIGGE,初始时刻与 FourCastNet 匹配;不同模型的分辨率、变量范围和计算硬件仍不一致。[来源:论文第 8、16–17 页]
- 复核问题: 在独立年份与不同气候区,极端降水低估是否持续?集合成员是否可靠且校准?长期滚动是否违反质量、能量或水分约束?加入更多垂直层后,速度与准确率的优势还能保留多少?
关于这篇论文的三个关键问题
FourCastNet:使用自适应傅里叶神经算子的全球数据驱动高分辨率天气模型 解决了什么问题?
视觉 Transformer 的自注意力能建立远距离联系,但计算量会随 token 数量近似平方增长。把普通卷积网络直接放大也很昂贵:论文估算,同一 720×1440 输入、批量为 1 时,FourCastNet 约占 10 GB 显存,而将一个既有 19 层 ResNet 直接迁移到该分辨率约需 83 GB。这个估算说明架构选择受到真实硬件约束,但并不等于对所有卷积模型的全面比较。[来源:论文第 5 页]
FourCastNet:使用自适应傅里叶神经算子的全球数据驱动高分辨率天气模型 的核心结论有哪些证据?
计算侧的结果尤其醒目:论文测得,单个含 4 张 A100 的节点可在 7 秒内完成 100 成员、24 小时集合预报,估算耗能约 8 kJ。与文献中的 IFS 配置按“节点时间”比较,30 km FourCastNet 约快 145,000 倍;但作者明确提醒,这不是严格的同类比较:硬件不同,IFS 分辨率约 18 km、变量和垂直层多一个数量级,并保证物理一致性。[来源:论文第 16–17 页与表 2]
阅读 FourCastNet:使用自适应傅里叶神经算子的全球数据驱动高分辨率天气模型 时最需要注意什么局限?
论文在 2018 年样本外初始条件上,以纬度加权异常相关系数(ACC)和均方根误差(RMSE)评估,并与时间匹配的 IFS 预报比较。作者报告,在约 48 小时以内,降水、风和温度等关键变量的 ACC 或 RMSE 可优于 IFS;总体上数天内具有竞争力。一个 2018 年个案中,模型滚动 16 个 6 小时步骤后,仍能在 96 小时预报中呈现台风山竹及三场大西洋飓风的结构与路径;但这是案例证据,不能替代系统性的灾害预报检验。[来源:论文第 8、11 页]