返回报告库

AI / Technology

GraphCast学习高水平的全球中期天气预报

GraphCast 的一句话全景:两帧天气进入球面图,滚动得到十天预报

  1. 改变了什么: GraphCast 不在运行时求解整套物理方程,而是从 ERA5 历史再分析资料中学习“当前天气如何走到下一步”。
  2. 为什么有效: 它把经纬网格搬到均匀覆盖地球的多尺度球面图上,让邻近变化和远距离影响都能在较少的信息传递步骤中流动。
  3. 证据有多强: 它能在单个 Cloud TPU v4 上不到 1 分钟生成 10 天全球预报;在 1,380 个核验目标中,90% 显著优于当时最强的业务确定性系统 HRES。来源:摘要、GraphCast、Forecast verification results

传统数值预报与 GraphCast 的两条路径

传统数值天气预报把大气的物理方程离散化,再由超级计算机逐步求解。增加算力、改善方程和算法,通常能提高精度;但海量历史天气并不会像训练神经网络那样,直接更新其核心预报规则。论文以 ECMWF 的 HRES 为主要基线:它当时能生成全球 10 天预报,运行大约需要 1 小时。来源:Introduction

两帧输入如何滚动成 40 步天气轨迹

GraphCast 读取当前时刻和 6 小时前的全球状态,预测 6 小时后的状态。训练与推理都采用这种“用前两帧猜下一帧”的形式。得到新状态后,模型把自己的预测重新喂回去,重复 40 次形成 10 天轨迹;这叫自回归,但直观上就是连续推演下一帧。来源:GraphCast

多尺度球面图:短边负责局部,长边负责远距传播

经纬网格在两极附近会拥挤,不适合直接充当均匀的球面连接结构。GraphCast 从正二十面体出发,把每个三角面细分 6 次,得到 40,962 个最高分辨率节点;再合并各层网格的边,形成长短连接并存的“多尺度网格”。短边传递局部变化,长边帮助远距离信息更快到达。来源:GraphCast,Figure 1

结果与限制:领先区域、灾害场景和确定性预报盲点

GraphCast 没有专门针对灾害事件训练,却在 2018—2021 年热带气旋案例中,于 18 小时到 4.75 天的时效范围取得显著更低的路径误差。对大气河,它相对 HRES 的水汽输送预测改善从短时效约 25% 到长时效约 10%。极端高温分类中,GraphCast 在 5 天和 10 天领先,但 HRES 在 12 小时领先。来源:Severe event forecasting results

研究附录

官方标题: GraphCast: Learning skillful medium-range global weather forecasting
论文: Remi Lam 等,arXiv:2212.12794(v2,2023)
研究领域: 全球中期天气预报 · 图神经网络 · 学习型模拟器
一句话定位: 它不是把天气图当普通图片处理,而是把全球大气放到球面多尺度图上,学习每隔 6 小时如何变化。

核心结论

三句话记住这篇论文

  1. 改变了什么: GraphCast 不在运行时求解整套物理方程,而是从 ERA5 历史再分析资料中学习“当前天气如何走到下一步”。
  2. 为什么有效: 它把经纬网格搬到均匀覆盖地球的多尺度球面图上,让邻近变化和远距离影响都能在较少的信息传递步骤中流动。
  3. 证据有多强: 它能在单个 Cloud TPU v4 上不到 1 分钟生成 10 天全球预报;在 1,380 个核验目标中,90% 显著优于当时最强的业务确定性系统 HRES。来源:摘要、GraphCast、Forecast verification results

这项工作的关键不是“神经网络替代一切物理”。更准确的说法是:传统系统先用物理模型和观测同化产出高质量历史资料,GraphCast 再从这些资料学习一个快速预报器。作者明确提醒,它依赖数值天气预报体系提供的数据,更适合作为补充,而不是简单替代。来源:Conclusions

问题

数值天气预报为何又准又贵

传统数值天气预报把大气的物理方程离散化,再由超级计算机逐步求解。增加算力、改善方程和算法,通常能提高精度;但海量历史天气并不会像训练神经网络那样,直接更新其核心预报规则。论文以 ECMWF 的 HRES 为主要基线:它当时能生成全球 10 天预报,运行大约需要 1 小时。来源:Introduction

难点不只是一张全球地图

一次天气状态包含 5 个地表变量,以及 6 个大气变量在 37 个气压层上的取值,共 227 个“变量×层级”组合。模型既要看局部的风、温度、湿度如何变化,也要让跨区域影响快速传播;还要连续滚动 40 次,才能从 6 小时一步走到 10 天。每一步的小误差都可能在后面累积。来源:Table 1、GraphCast

方法

输入是相隔 6 小时的两帧天气

GraphCast 读取当前时刻和 6 小时前的全球状态,预测 6 小时后的状态。训练与推理都采用这种“用前两帧猜下一帧”的形式。得到新状态后,模型把自己的预测重新喂回去,重复 40 次形成 10 天轨迹;这叫自回归,但直观上就是连续推演下一帧。来源:GraphCast

多尺度球面图让近处与远处同时交流

经纬网格在两极附近会拥挤,不适合直接充当均匀的球面连接结构。GraphCast 从正二十面体出发,把每个三角面细分 6 次,得到 40,962 个最高分辨率节点;再合并各层网格的边,形成长短连接并存的“多尺度网格”。短边传递局部变化,长边帮助远距离信息更快到达。来源:GraphCast,Figure 1

编码、处理、解码各做一件事

编码器把经纬网格上的天气变量映射到球面图;处理器用 16 层不共享参数的图神经网络传递信息;解码器再把图上的结果写回经纬网格,并预测相对上一状态的增量。整个模型有 3,670 万参数。训练使用 1979—2017 年共 39 年 ERA5 数据,约在 32 个 Cloud TPU v4 上训练 4 周。来源:GraphCast

证据与局限

1,380 个目标上的总体结果

作者用 2018 年起的留出数据,对 69 个变量与气压层组合、20 个预报时效进行比较,共得到 1,380 个目标。指标包括均方根误差(越低越好)和异常相关系数(越高越好)。GraphCast 在其中 90% 的目标上显著优于 HRES;总降水因 ERA5 降水存在已知偏差而未纳入这项对比。来源:Verification methods、Forecast verification results、摘要

极端天气结果提供了更贴近使用场景的检查

GraphCast 没有专门针对灾害事件训练,却在 2018—2021 年热带气旋案例中,于 18 小时到 4.75 天的时效范围取得显著更低的路径误差。对大气河,它相对 HRES 的水汽输送预测改善从短时效约 25% 到长时效约 10%。极端高温分类中,GraphCast 在 5 天和 10 天领先,但 HRES 在 12 小时领先。来源:Severe event forecasting results

三个限制决定了结论边界

第一,GraphCast 是单次确定性预报,不能像集合预报那样展示多种可能未来;越往后,天气本身的不确定性越大。第二,均方误差会鼓励模型把不确定性表达成空间平滑,因此长时效结果可能更模糊。第三,它的 0.25° 水平分辨率、37 个气压层和 6 小时时间步,仍低于 HRES 发布产品的 137 层和最长 1 小时时间步;平流层也是其相对较弱区域。来源:Forecast verification results、Conclusions、补充材料 §7.2.2

实际意义

最直接的价值是速度和可迭代性

不到 1 分钟的 10 天全球预报,让研究者更容易反复试验、按场景开发下游工具,也能通过补入较新数据重新训练。论文的“训练到更近年份”实验显示,更新训练资料可改善 2021 年测试表现;作者把原因解释为可能捕捉到近期天气趋势,但这仍是推测,不是已经分离出的因果机制。来源:Effect of training data recency

真正的下一步是把不确定性也学出来

对防灾决策而言,一个看似精确的路径不如“有哪些可能路径、各自概率多大”可靠。因而最重要的后续方向不是只追求单次预报更快,而是建立概率式或集合式学习系统,并检验它在更高分辨率、更多垂直层和真实业务流程中的表现。论文已经证明学习型全球预报器能进入强基线竞争;它尚未证明物理模型、观测同化和集合预报可以被拿掉。来源:Conclusions

读论文时值得继续追问

  • 若按地区、变量、气压层拆开,优势是否集中在特定区域?
  • 模糊后的低误差,是否仍保留防灾所需的小尺度结构?
  • 与集合预报比较时,准确率、校准度、速度和成本怎样共同衡量?
  • 当气候分布变化时,多久重训一次才足够,旧数据应如何加权?

关于这篇论文的三个关键问题

GraphCast:学习高水平的全球中期天气预报 解决了什么问题?

传统数值天气预报把大气的物理方程离散化,再由超级计算机逐步求解。增加算力、改善方程和算法,通常能提高精度;但海量历史天气并不会像训练神经网络那样,直接更新其核心预报规则。论文以 ECMWF 的 HRES 为主要基线:它当时能生成全球 10 天预报,运行大约需要 1 小时。来源:Introduction

GraphCast:学习高水平的全球中期天气预报 的核心结论有哪些证据?

作者用 2018 年起的留出数据,对 69 个变量与气压层组合、20 个预报时效进行比较,共得到 1,380 个目标。指标包括均方根误差(越低越好)和异常相关系数(越高越好)。GraphCast 在其中 90% 的目标上显著优于 HRES;总降水因 ERA5 降水存在已知偏差而未纳入这项对比。来源:Verification methods、Forecast verification results、摘要

阅读 GraphCast:学习高水平的全球中期天气预报 时最需要注意什么局限?

第一,GraphCast 是单次确定性预报,不能像集合预报那样展示多种可能未来;越往后,天气本身的不确定性越大。第二,均方误差会鼓励模型把不确定性表达成空间平滑,因此长时效结果可能更模糊。第三,它的 0.25° 水平分辨率、37 个气压层和 6 小时时间步,仍低于 HRES 发布产品的 137 层和最长 1 小时时间步;平流层也是其相对较弱区域。来源:Forecast verification results、Conclusions、补充材料 §7.2.2

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro