Обучение навыкам составления глобальных прогнозов погоды на средние расстояния
(А) Входные погодные условия задаются на сетке широта-долгота 0,25°, состоящей из 721 × 1440 = 1 038 240 точек. Желтые слои во всплывающем окне представляют 5 поверхностных переменных, а синие слои - 6 атмосферных переменных, которые повторяются на 37 уровнях давления (5 + 6 × 37 = 227 переменных на точку в целом), в результате чего состояние представлено в виде 235 680 480 значений. (B) GraphCast предсказывает следующее состояние погоды на сетке. (C) Прогноз строится путем итеративного применения GraphCast к каждому предыдущему предсказанному состоянию, чтобы получить последовательность состояний, представляющих погоду в последовательные моменты времени. (D) Компонент Encoder архитектуры GraphCast отображает локальные области входного сигнала (зеленые ячейки) в узлы многосеточного графа (зеленые стрелки, направленные вверх, которые заканчиваются в зелено-голубом узле). (E) Процессорный компонент обновляет каждый узел многосеточного графа с помощью обученной передачи сообщений (синие стрелки, заканчивающиеся в узле). (F) Компонент декодера отображает обработанные мультисеточные характеристики (фиолетовые узлы) обратно на сеточное представление (красные нисходящие стрелки, заканчивающиеся в красной рамке). (G) Мультисетка формируется из икосаэдрических сеток с возрастающим разрешением, от базовой (M0, 12 узлов) до самой тонкой (M6, 40 962 узла), которая имеет равномерное разрешение по всему земному шару. Она содержит набор узлов из M6 и все ребра из M0 в M6. Обученная передача сообщений по ребрам различных сеток происходит одновременно, так что каждый узел обновляется по всем входящим в него ребрам. Текстура Земли на рисунке использована под лицензией CC~BY~4.0 с сайта https://www.solarsystemscope.com/textures/.
Глобальное прогнозирование погоды на средние расстояния является критически важным для принятия решений во многих социальных и экономических областях. Традиционное численное прогнозирование погоды использует повышенные вычислительные ресурсы для повышения точности прогноза, но не использует непосредственно исторические данные о погоде для улучшения базовой модели. Здесь мы представляем "GraphCast" - метод, основанный на машинном обучении и обучаемый непосредственно на данных реанализа. Он предсказывает сотни погодных переменных на 10 дней с глобальным разрешением 0,25° менее чем за одну минуту. GraphCast значительно превосходит наиболее точные оперативные детерминированные системы по 90% из 1380 верификационных задач, а его прогнозы позволяют лучше предсказывать серьезные события, включая слежение за тропическими циклонами, атмосферными реками и экстремальными температурами. GraphCast является ключевым достижением в области точного и эффективного прогнозирования погоды и помогает реализовать перспективы машинного обучения для моделирования сложных динамических систем.
Сейчас 05:45 UTC, середина октября 2022 г., в Болонье (Италия), в новом высокопроизводительном вычислительном комплексе Европейского центра прогнозов погоды на средние расстояния (ECMWF), который недавно был введен в эксплуатацию. В течение последних нескольких часов интегрированная система прогнозирования (IFS) проводит сложные расчеты для прогнозирования погоды на Земле на ближайшие дни и недели, и первые прогнозы только начали распространяться среди пользователей. Этот процесс повторяется ежедневно каждые шесть часов, обеспечивая мир самыми точными прогнозами погоды.
IFS, как и современное прогнозирование погоды в целом, - это триумф науки и техники. Динамика погодных систем относится к числу наиболее сложных физических явлений на Земле, и каждый день от точных прогнозов погоды зависит множество решений, принимаемых отдельными людьми, промышленными предприятиями и политиками: от того, надеть ли куртку или укрыться от опасного шторма. Доминирующим подходом к прогнозированию погоды сегодня является "численное прогнозирование погоды" (NWP), которое предполагает решение управляющих уравнений погоды с помощью суперкомпьютеров. Успех NWP заключается в тщательной и непрерывной исследовательской практике, позволяющей получать все более детальные описания погодных явлений, а также в том, насколько хорошо NWP масштабируется до более высокой точности при увеличении вычислительных ресурсов (1, 2). В результате точность прогнозов погоды растет год от года, вплоть до того, что траекторию урагана можно предсказать на много дней вперед, что было немыслимо еще несколько десятилетий назад.
Но хотя традиционная NWP хорошо масштабируется с помощью вычислений, использование огромного количества исторических метеорологических данных для повышения точности прогнозов не является простым делом. Скорее, методы СЗП совершенствуются за счет того, что высококвалифицированные специалисты разрабатывают более совершенные модели, алгоритмы и аппроксимации, что может быть трудоемким и дорогостоящим процессом.
Прогнозирование погоды на основе машинного обучения (MLWP) предлагает альтернативу традиционному NWP, когда модели прогноза могут быть обучены на основе исторических данных, включая данные наблюдений и анализа. Это позволяет повысить точность прогноза за счет выявления закономерностей в данных, которые нелегко представить в виде явных уравнений. MLWP также предоставляет возможности для повышения эффективности за счет использования современных аппаратных средств глубокого обучения, а не суперкомпьютеров, и достижения более выгодного компромисса между скоростью и точностью. Недавно MLWP помогла улучшить прогнозирование на основе NWP в режимах, где традиционная NWP относительно слаба, например, при прогнозировании субсезонных тепловых волн (3) и прогнозировании осадков по радарным изображениям (4-7), где точные уравнения и надежные численные методы не так доступны.
При прогнозировании погоды на средние расстояния, т.е. при прогнозировании атмосферных переменных на срок до 10 дней вперед, наиболее точными остаются системы на основе NWP, такие как IFS. Лучшей детерминированной оперативной системой в мире является ECMWF High RESolution forecast (HRES), представляющая собой конфигурацию IFS, которая позволяет получать глобальные 10-дневные прогнозы с разрешением 0,1° по широте/долготе примерно за час (8). Однако в течение последних нескольких лет методы MLWP для среднесрочного прогнозирования, обученные на данных реанализа, неуклонно развиваются, чему способствуют такие бенчмарки, как WeatherBench (8). Архитектуры глубокого обучения на основе сверточных нейронных сетей (9-11) и трансформеров (12) показали многообещающие результаты при разрешении по широте/долготе грубее 1,0°, а в последних работах, использующих графовые нейронные сети (ГНС), нейронные операторы Фурье и трансформеры (13-16), сообщается о производительности, которая начинает конкурировать с IFS при 1,0° и 0,25° для нескольких переменных, а время ожидания достигает семи дней.
Числа в скобках в заголовках столбцов означают количество записей в столбце. Жирным шрифтом выделены переменные и уровни, которые были включены в оценочную карту. Все атмосферные переменные представлены на каждом из уровней давления.
GraphCast
Здесь мы представляем MLWP-подход для глобального среднесрочного прогнозирования погоды под названием "GraphCast", который позволяет получить точный прогноз на 10 дней менее чем за минуту на одном устройстве Google Cloud TPU v4 и поддерживает такие приложения, как прогнозирование путей тропических циклонов, атмосферных рек и экстремальных температур.
В качестве исходных данных GraphCast принимает два последних состояния погоды на Земле - в текущий момент времени и шестью часами ранее - и предсказывает следующее состояние погоды на шесть часов вперед. Одно состояние погоды представлено сеткой 0,25° широты/долготы (721 × 1440), что соответствует разрешению 28 × 28 км на экваторе (рис. 1А), где каждая точка сетки представляет собой набор приземных и атмосферных переменных (перечисленных в табл. 1). Как и традиционные системы NWP, GraphCast является авторегрессионной системой: ее можно "развернуть", подавая на вход собственные прогнозы, и получить произвольно длинную траекторию погодных состояний (рис. 1, Б и В).
GraphCast реализован в виде нейросетевой архитектуры, основанной на GNN в конфигурации "кодирование-процесс-декодирование" (13, 17), с общим числом параметров 36,7 млн. (код, веса и демонстрационные примеры можно найти на сайте https://github.com/deepmind/graphcast). Предыдущие обучаемые симуляторы на основе GNN (18-20) оказались весьма эффективными при обучении сложной динамике жидких и других систем, моделируемых уравнениями в частных дифференциальных числах, что подтверждает их пригодность для моделирования динамики погоды.
Кодер (рис. 1D) использует один слой GNN для отображения переменных (нормированных на нулевую среднюю дисперсию), представленных в виде атрибутов узлов на входной сетке, на обучаемые атрибуты узлов на внутреннем "многосеточном" представлении.
Мультисетка (рис. 1Г) представляет собой пространственно однородный граф с высоким пространственным разрешением по всему земному шару. Он определяется путем шестикратного итеративного уточнения правильного икосаэдра (12 узлов, 20 граней, 30 ребер), при котором каждый треугольник делится на четыре меньших (что приводит к увеличению числа граней и ребер в четыре раза), и перепроектирования узлов на сферу. Мультисетка содержит 40 962 узла из сетки самого высокого разрешения (что примерно равно 1/25 числа точек сетки широты/долготы на 0,25°) и объединение всех граней, созданных в промежуточных графах, образуя плоскую иерархию граней различной длины.
Процессор (рис. 1E) использует 16 нераспределенных слоев GNN для выполнения обучаемой передачи сообщений на многосеточном графе, что позволяет эффективно передавать информацию на локальные и дальние расстояния при небольшом количестве шагов передачи сообщений.
Декодер (рис. 1F) сопоставляет выученные на последних процессорных слоях признаки из многосеточного представления обратно в широтно-долготную сетку. Он использует один слой GNN и прогнозирует выход как обновление остатка по последнему входному состоянию (с нормализацией выхода для достижения единичной дисперсии по целевому остатку). Более подробная информация об архитектуре приведена в разделе 3 дополнительных материалов.
При разработке модели использовались исторические данные за 39 лет (1979-2017 гг.) из архива реанализа ECMWF ERA5 (21). В качестве задачи обучения мы усредняли среднюю квадратичную ошибку (MSE) между предсказанными состояниями GraphCast за N шагов авторегрессии и соответствующими состояниями ERA5, причем ошибка взвешивалась по вертикальному уровню (см. дополнительные материалы, упр. 19). В процессе обучения значение N постепенно увеличивалось от 1 до 12 (т.е. от шести часов до трех суток), а градиент потерь вычислялся методом обратного распространения через время (22). Обучение GraphCast минимизации цели обучения методом градиентного спуска заняло около четырех недель на 32 устройствах Cloud TPU v4 с использованием пакетного параллелизма. Подробности обучения см. в разделе 4 дополнительных материалов.
В соответствии с реальными сценариями развертывания, когда будущая информация недоступна для разработки модели, мы оценивали GraphCast на отложенных данных за 2018 год и далее (см. дополнительные материалы, раздел 5.1).
Методы верификации
Мы всесторонне проверяем качество прогноза GraphCast, сравнивая его точность с точностью прогноза HRES по большому числу переменных, уровней и сроков. Мы количественно оцениваем мастерство GraphCast, HRES и базового ML с помощью двух показателей: среднеквадратичной ошибки (RMSE) и коэффициента корреляции аномалий (ACC).
Из 227 комбинаций переменных и уровней, предсказанных GraphCast в каждой точке сетки, мы оценивали его мастерство по сравнению с HRES по 69 из них, что соответствует 13 уровням WeatherBench (8) и переменным (23) из ECMWF Scorecard (24); см. выделенные жирным шрифтом переменные и уровни в табл. 1 и в разделе 1.2 дополнительных материалов, для которых цикл HRES работал в течение периода оценки. В дополнение к совокупным характеристикам, приведенным в основном тексте, в разделе 7 дополнительных материалов приводятся более подробные оценки, включая другие переменные, осадки, региональные характеристики, эффекты широты и уровня давления, спектральные свойства, размытие, смещения, сравнения с другими прогнозами на основе ML, а также влияние выбора дизайна модели.
При проведении этих сравнений два ключевых момента лежат в основе определения точности: (i) выбор базовой истины для сравнения и (ii) тщательный учет окон ассимиляции данных, используемых для получения этих данных из наблюдений. Мы используем ERA5 в качестве базовой истины для оценки GraphCast, поскольку он был обучен принимать данные ERA5 в качестве входных и прогнозировать данные ERA5 в качестве выходных. Однако оценка прогнозов HRES по сравнению с ERA5 привела бы к ненулевой ошибке на начальном шаге прогноза. Вместо этого мы создали набор данных "HRES-прогноз на шаге 0" (HRES-fc0), который использовался в качестве базовой истины для HRES. HRES-fc0 содержит исходные данные для прогнозов HRES при последующих инициализациях (см. раздел 1.2 дополнительных материалов), что гарантирует, что каждая точка данных обоснована последними наблюдениями и что нулевой шаг прогнозов HRES будет иметь нулевую ошибку.
Для корректного сравнения необходимо убедиться, что начальные условия ERA5 для GraphCast были получены из окон ассимиляции, которые заглядывают в будущее не дальше, чем окна, используемые HRES. Инициализации HRES (00z/06z/12z/18z, где 00z означает 00:00 UTC по зулусской конвенции) всегда ассимилируют наблюдения на 3 часа вперед, в то время как инициализации ERA5 ассимилируют наблюдения на 9 часов вперед в 00z/12z и на 3 часа вперед в 06z/18z. Это ограничивает выбор времени инициализации для GraphCast до 06z/18z во всех наших результатах. Мы используем те же инициализации для HRES при сравнении производительности до 3,75 суток. После этого архивные прогнозы HRES доступны только с инициализацией 00z/12z. Переход от инициализации 06z/18z к инициализации 00z/12z для HRES приводит к небольшому разрыву на наших графиках, который обозначен вертикальной пунктирной линией в соответствующее время ожидания. В разделе 5 дополнительных материалов приведены дополнительные сведения о проверке, включая детали протокола сравнения GraphCast и HRES (раздел 5.2 дополнительных материалов), а также влияние опережения инициализации на производительность обеих моделей (раздел 5.2.2 дополнительных материалов).
Результаты проверки прогнозов
Мы обнаружили, что GraphCast обладает более высокими навыками прогнозирования погоды, чем HRES, при оценке 10-дневных прогнозов с горизонтальным разрешением 0,25° по широте/долготе и на 13 вертикальных уровнях.
(A) RMSE мастерства (ось y) для GraphCast (синие линии) и HRES (черные линии) на Z500 в зависимости от времени опережения (ось x). Планки ошибок представляют собой 95% доверительные интервалы. Вертикальная пунктирная линия обозначает 3,5 дня, что является последним 12-часовым приращением прогнозов HRES 06z/18z. Черная линия представляет HRES, где время опережения раньше и позже 3,5 суток относится к инициализации 06z/18z и 00z/12z, соответственно. (B) Оценка RMSE (ось y) для GraphCast в сравнении с HRES на Z500 в зависимости от времени опережения (ось x). Планки ошибок представляют собой 95% доверительные интервалы для оценки мастерства. Мы наблюдаем разрыв в кривой GraphCast, поскольку до 3,5 суток оценки мастерства вычисляются между GraphCast (инициализированным в 06z/18z) и инициализацией HRES в 06z/18z, а после 3,5 суток оценки мастерства вычисляются относительно инициализации HRES в 00z/12z. (C) Мастерство ACC (ось y) для GraphCast (синие линии) и HRES (черные линии) на Z500 в зависимости от времени ожидания (ось x). (D) Карта оценок мастерства RMSE для GraphCast по отношению к HRES. Каждая подплощадка соответствует одной переменной: U, V, Z, T, Q, 2T, 10U, 10V, MSL, соответственно. Строки каждой тепловой карты соответствуют 13 уровням давления (для атмосферных переменных), от 50 гПа вверху до 1000 гПа внизу. Столбцы каждой тепловой карты соответствуют 20 временам опережения с интервалом в 12 часов, от 12 часов слева до 10 дней справа. Цвет каждой ячейки представляет собой оценку квалификации, как показано в (B), где синим цветом обозначены отрицательные значения (GraphCast имеет лучшую квалификацию), а красным - положительные значения (HRES имеет лучшую квалификацию).
На рис. 2, А - С, показано, как GraphCast (синие линии) превосходит HRES (черные линии) по "головному" полю Z500 (геопотенциал на 500 гПа) с точки зрения мастерства RMSE, RMSE skill score (т.е. нормализованная разница RMSE между моделью A и базовой моделью B, определяемая как (RMSEA - RMSEB)/(RMSEB), и мастерства ACC. Использование Z500, который кодирует распределение давления в синоптическом масштабе, является общепринятым в литературе, поскольку имеет большое метеорологическое значение [8]. Графики показывают, что GraphCast имеет более высокие оценки мастерства на всех временных интервалах, причем улучшение мастерства составляет примерно 7%-14%. Графики для дополнительных основных переменных приведены в разделе 7.1 дополнительных материалов.
На рис. 2D приведены оценки RMSE для всех 1380 оцениваемых переменных и уровней давления по 10-дневным прогнозам в формате, аналогичном оценочной карте ECMWF. Цвет ячеек пропорционален оценке мастерства, где синий цвет означает, что ГрафКаст имеет более высокую степень мастерства, а красный - что HRES имеет более высокую степень мастерства. GraphCast превзошел HRES по 90,3% из 1380 целей, причем значительно (p ≤ 0,05, номинальный объем выборки n ∈{729, 730}) превзошел HRES по 89,9% целей. Методология описана в разделе 5.4 дополнительных материалов, а p-значения, тестовая статистика и эффективные размеры выборки приведены в таблице S4.
Области атмосферы, в которых HRES показал лучшие результаты, чем GraphCast (верхние строки красного цвета в таблицах результатов), были непропорционально локализованы в стратосфере и имели наименьший вес потерь при обучении (см. дополнительные материалы, раздел 7.2.2). При исключении уровня 50 гПа GraphCast значительно превосходит HRES по 96,9% из оставшихся 1280 целей. При исключении уровней 50 и 100 гПа GraphCast значительно превосходит HRES по 99,7% из 1180 оставшихся целей. При оценке по регионам мы обнаружили, что предыдущие результаты в целом сохраняются по всему земному шару, как показано на рис. S14 - S16.
Мы обнаружили, что увеличение числа шагов авторегрессии в потерях MSE улучшает работу GraphCast при больших временах ожидания (см. дополнительные материалы, раздел 7.3.2). Это также способствует тому, что GraphCast в некоторой степени размывается при больших временах ожидания (см. рис. S38), что означает, что его прогнозы будут находиться где-то между традиционным детерминированным прогнозом и ансамблевым средним. Однако физические уравнения, лежащие в основе HRES, не приводят к размытию прогноза. Чтобы оценить, связано ли относительное преимущество GraphCast над HRES по показателю RMSE с тем, что более размытые прогнозы лучше оптимизируют RMSE, мы искусственно размыли прогнозы HRES с помощью фильтров размытия. Мы подобрали фильтры для GraphCast и HRES, минимизировав RMSE между отфильтрованными прогнозами и соответствующими "истинными" моделями. Мы обнаружили, что оптимизированное по RMSE размытие, примененное к GraphCast, оказалось более эффективным, чем аналогичное размытие, примененное к HRES, для 88,0% из 1380 верификационных целей, что в целом согласуется с нашими выводами (см. дополнительные материалы, раздел 7.4). Тем не менее, более размытые прогнозы могут оказаться нежелательными для некоторых приложений, что мы обсуждаем далее в разделе "Выводы".
Мы также сравнили производительность GraphCast с лучшей конкурирующей ML-моделью погоды Pangu-Weather (16) и обнаружили, что GraphCast превзошел ее на 99,2% из 252 представленных задач (подробнее см. раздел 6 дополнительных материалов).
Результаты прогнозирования сильных событий
Помимо оценки мастерства прогноза GraphCast в сравнении с HRES по широкому спектру переменных и времени ожидания, мы также оцениваем, как его прогнозы помогают предсказывать серьезные события, включая следы тропических циклонов, атмосферные реки и экстремальные температуры. Это ключевые приложения, для которых GraphCast не имеет специальной подготовки, но которые очень важны для человеческой деятельности.
(A) Характеристики отслеживания циклонов для GraphCast и HRES. По оси x показано время ожидания (в днях), а по оси y - медианная ошибка отслеживания (в км). Планки ошибок представляют собой бутстрепные 95% доверительные интервалы для медианы. (B) Разница парных ошибок слежения за циклонами между GraphCast и HRES. На оси x представлено время прослеживания (в днях), на оси y - медианная разность парных ошибок (в км). Планки ошибок представляют собой бутстрепные 95% доверительные интервалы для медианной разницы (см. дополнительные материалы, раздел 8.1). (C) Навыки прогнозирования атмосферных рек (IVT) для GraphCast и HRES. По оси x показано время ожидания (в днях), а по оси y - RMSE. Планки ошибок представляют собой 95% доверительные интервалы. (D) Точность прогнозирования экстремальной жары по методу GraphCast и HRES. По оси x показан отзыв, а по оси y - точность. Кривые представляют собой различные компромиссы между точностью и запоминанием при применении коэффициента усиления к сигналам прогноза (см. дополнительные материалы, раздел 8.3).
Следы тропических циклонов
Повышение точности отслеживания тропических циклонов может помочь избежать травм и человеческих жертв, а также снизить экономический ущерб (25). Существование и траектория движения циклона предсказываются путем применения алгоритма слежения к прогнозам геопотенциала (Z), горизонтального ветра (10U/10V, U/V) и среднего давления на уровне моря (MSL). Мы реализовали алгоритм слежения, основанный на опубликованных протоколах ECMWF [26], и применили его к прогнозам GraphCast для получения прогнозов пути циклонов (см. дополнительные материалы, раздел 8.1). В качестве базового уровня для сравнения мы использовали оперативные треки, полученные на основе прогнозов HRES с углом 0,1° с использованием собственного трекера ECMWF, хранящегося в архиве TIGGE (27, 28). Для каждой модели, использующей трекер, дающий наилучшие результаты, измерялись ошибки для обеих моделей по сравнению с треками из IBTrACS (29, 30) - отдельного реаналитического набора данных о треках циклонов, агрегированных из различных источников анализа и наблюдений. В соответствии с принятой оценкой прогнозирования тропических циклонов (26), мы оцениваем все треки, когда и GraphCast, и HRES обнаруживают циклон, что обеспечивает оценку обеих моделей на одних и тех же событиях, и проверяем, что показатели истинных положительных результатов у каждой модели одинаковы.
На рис. 3А показано, что в 2018-2021 гг. медианная ошибка треков у GraphCast ниже, чем у HRES (медиана была выбрана для исключения выбросов). Поскольку ошибки на трек для HRES и GraphCast коррелируют, мы также измерили разницу парных ошибок на трек между двумя моделями и обнаружили, что GraphCast значительно лучше HRES для времени подготовки от 18 часов до 4,75 дня, как показано на рис. 3B. Планки ошибок показывают бутстрепные 95% доверительные интервалы для медианы (подробнее см. раздел 8.1 дополнительных материалов).
Атмосферные реки
Атмосферные реки - это узкие области атмосферы, которые отвечают за большую часть переноса водяного пара в направлении полюса через средние широты и генерируют 30-65% годовых осадков на западном побережье США (31). Их сила может быть охарактеризована вертикально интегрированным переносом водяного пара IVT (32, 33), показывающим, принесет ли данное событие благоприятные осадки или будет связано с катастрофическими разрушениями (34). IVT может быть рассчитан на основе нелинейной комбинации горизонтальной скорости ветра U и V) и удельной влажности (Q), которые прогнозирует GraphCast. Мы оцениваем прогнозы GraphCast над прибрежными районами Северной Америки и восточной части Тихого океана в холодные месяцы (октябрь-апрель), когда атмосферные реки наиболее часты. Несмотря на отсутствие специального обучения для определения характеристик атмосферных рек, рис. 3C показывает, что GraphCast улучшает прогноз IVT по сравнению с HRES с 25% при малом времени ожидания до 10% при больших горизонтах (подробнее см. раздел 8.2 дополнительных материалов).
Экстремальная жара и холод
Экстремальная жара и холод характеризуются большими аномалиями по отношению к типичной климатологии (3, 35, 36), которые могут быть опасны и нарушать жизнедеятельность человека. Мы оценили способность HRES и GraphCast предсказывать события, превышающие верхние 2% климатологии, в зависимости от местоположения, времени суток и месяца года, для 2T при 12-часовом, 5-дневном и 10-дневном времени ожидания, для регионов северного и южного полушария в соответствующие летние месяцы. Мы построили кривые "точность-отзыв" (37), чтобы отразить различные возможные компромиссы между уменьшением количества ложных срабатываний (высокая точность) и уменьшением количества ложных отрицательных результатов (высокий отзыв). Для каждого прогноза мы получаем кривую, изменяя параметр "gain", который масштабирует отклонения прогноза 2Т относительно медианной климатологии.
На рис. 3D показано, что кривые "точность-отзыв" GraphCast выше кривых HRES для 5- и 10-дневного времени ожидания, что говорит о том, что прогнозы GraphCast в целом превосходят HRES в классификации экстремальных ситуаций на более длительных горизонтах. Напротив, HRES имеет лучшую точность-отзыв при 12-часовом времени ожидания, что согласуется с тем, что оценка 2T мастерства GraphCast по сравнению с HRES близка к нулю, как показано на рис. 2D. В целом мы считаем, что эти результаты согласуются и с другими переменными, имеющими отношение к экстремальной жаре, такими как T850 и Z500 (36), другими экстремальными порогами (5%, 2% и 0,5%), а также с прогнозированием экстремальных холодов в зимний период. Подробности см. в разделе 8.3 дополнительных материалов.
Влияние периодичности обучающих данных
Каждая цветная линия представляет собой GraphCast, обученный на данных, закончившихся в разные годы, от 2018 (синий) до 2021 (фиолетовый). По оси y показаны значения RMSE на тестовых данных 2021 года для Z500 по отношению к GraphCast, обученному до 2018 года, за время опережения (ось x). Вертикальная пунктирная линия обозначает 3,5 суток, на которых заканчивается прогноз HRES 06z/18z. Черная линия представляет HRES, где времена опережения раньше и позже 3,5 суток относятся к инициализации 06z/18z и 00z/12z, соответственно.
GraphCast можно периодически переобучать на свежих данных, что, в принципе, позволяет отражать погодные закономерности, изменяющиеся во времени, такие как последствия изменения климата и длительные климатические колебания. Мы обучили четыре варианта GraphCast с нуля на данных, которые всегда начинались в 1979 году, а заканчивались в 2017, 2018, 2019 и 2020 годах соответственно (вариант, заканчивающийся в 2017 году, мы обозначили как "GraphCast: <2018" и т.д.). Мы сравнили их показатели с HRES на тестовых данных 2021 года.
На рис. 4 показаны оценки мастерства (нормированные на GraphCast:<2018) четырех вариантов и HRES для Z500. Мы обнаружили, что, хотя производительность GraphCast при обучении до 2018 года остается конкурентоспособной по сравнению с HRES в 2021 году, обучение до 2021 года еще больше улучшает его показатели (см. дополнительные материалы, раздел 7.1.3). Мы предполагаем, что этот эффект давности позволяет улавливать последние погодные тенденции для повышения точности. Это показывает, что производительность GraphCast может быть улучшена путем повторного обучения на более свежих данных.
Выводы
Прогнозные способности и эффективность GraphCast по сравнению с HRES показывают, что методы MLWP теперь конкурентоспособны с традиционными методами прогнозирования погоды. Кроме того, результаты работы GraphCast при прогнозировании сложных явлений, для которых он не был непосредственно обучен, демонстрируют его устойчивость и потенциал для дальнейшего использования. Мы считаем, что это знаменует собой переломный момент в прогнозировании погоды, который поможет открыть новые возможности для более широкого принятия решений, зависящих от погоды, как отдельными людьми, так и отраслями, сделав дешевые прогнозы более точными, более доступными и подходящими для конкретных приложений".
GraphCast имеет 36,7 млн. параметров и является относительно небольшой моделью по современным стандартам ML, выбранной для того, чтобы не занимать много памяти. И если HRES выпускается с разрешением 0,1°, 137 уровнями и временным шагом до 1 часа, то GraphCast работает с разрешением 0,25° по широте и долготе, 37 вертикальными уровнями и временным шагом 6 часов, что обусловлено собственным разрешением обучающих данных ERA5 0,25° и инженерными проблемами, связанными с установкой данных более высокого разрешения на оборудование. В целом GraphCast следует рассматривать как семейство моделей, причем текущая версия является самой большой из тех, которые мы можем практически приспособить к текущим инженерным ограничениям, но которые потенциально могут быть масштабированы гораздо больше в будущем при наличии больших вычислительных ресурсов и данных более высокого разрешения.
Одно из ключевых ограничений нашего подхода заключается в том, как обрабатывается неопределенность. Мы сосредоточились на детерминированных прогнозах и сравнили их с HRES, однако другая составляющая IFS ECMWF - система ансамблевого прогнозирования ENS - особенно важна для количественной оценки вероятности экстремальных явлений, поскольку при более длительном времени ожидания мастерство прогноза снижается. Нелинейность динамики погоды означает, что на больших временных интервалах возрастает неопределенность, которая плохо отражается в одном детерминированном прогнозе. ENS решает эту проблему путем генерации множества стохастических прогнозов, которые приближенно отражают прогнозное распределение будущей погоды, однако генерация множества прогнозов требует больших затрат. Напротив, цель обучения GraphCast по MSE побуждает его к пространственному размыванию прогнозов в условиях неопределенности, что может быть нежелательным для некоторых приложений, где важно знать хвостовые или совместные вероятности событий. Построение вероятностных прогнозов с более явным моделированием неопределенности, подобно ансамблевым прогнозам, является важным следующим шагом.
Важно подчеркнуть, что MLWP, основанная на данных, в значительной степени опирается на большие объемы данных и их качество, от которого в случае моделей, обученных на реанализе, зависит достоверность NWP. Поэтому такие богатые источники высококачественных данных, как архив MARS (38), принадлежащий ECMWF, имеют неоценимое значение. Наш подход не следует рассматривать как замену традиционных методов прогнозирования погоды, которые разрабатывались в течение десятилетий, прошли тщательную проверку во многих реальных условиях и обладают многими еще не изученными нами возможностями. Напротив, нашу работу следует рассматривать как свидетельство того, что MLWP способен решать задачи прогнозирования в реальном мире и имеет потенциал для дополнения и улучшения существующих лучших методов.
Помимо прогнозирования погоды, GraphCast может открыть новые направления для решения других важных задач геопространственно-временного прогнозирования, включая проблемы климата и экологии, энергетики, сельского хозяйства, жизнедеятельности человека и биологии, а также других сложных динамических систем. Мы считаем, что симуляторы, обученные на богатых реальных данных, будут иметь решающее значение для повышения роли машинного обучения в физических науках.
