Могут ли модели прогнозирования погоды, основанные на искусственном интеллекте, имитировать эффект бабочки?

Исследование рассматривает рост погрешности в прогнозировании погоды при малоамплитудных возмущениях начальных условий, смоделированных с помощью модели на основе искусственного интеллекта. Стандартные физически обоснованные модели и теоретические соображения показывают, что такие возмущения быстро растут, устанавливая предел предсказуемости, известный как эффект бабочки. Однако модель на основе ИИ не способна воспроизвести быстрый рост и неправильно предсказывает неограниченную предсказуемость атмосферы. Если начальные возмущения значительны и сравнимы с неопределенностями в оценке начального состояния, то модель на основе ИИ почти согласуется с физическим моделированием, но все же имеет некоторые недостатки.

Даже при наличии совершенных наблюдений и моделей временной интервал, на котором прогнозы погоды могут быть точными, ограничен. Это ограничение связано с фундаментальными физическими характеристиками земной атмосферы, из-за которых небольшие ошибки растут очень быстро и распространяются, что известно как эффект бабочки. В данной статье мы проверяем, способна ли модель прогнозирования погоды на основе искусственного интеллекта воспроизвести этот эффект бабочки. Для этого мы рассчитали несколько прогнозов погоды, которые очень незначительно отличались друг от друга по начальным условиям. Мы обнаружили, что, в отличие от стандартных моделей прогнозирования погоды, в модели на основе искусственного интеллекта начальные различия растут очень медленно, а эффект бабочки вообще не проявляется. Это дает пример того, как модели машинного обучения могут не воспроизводить фундаментальные физические принципы, хотя они могут точно имитировать многие наблюдаемые модели поведения.

Эффект бабочки" относится к хорошо известному и печально известному свойству атмосферной циркуляции: Крошечные неопределенности или ошибки в начальных условиях быстро усиливаются, создавая фундаментальный, внутренний предел предсказуемости для прогнозирования погоды, который невозможно преодолеть. Этот предел был впервые выявлен Лоренцем (1969) и с тех пор подробно изучается с помощью различных методов, включая сложные численные модели прогноза погоды с очень высоким разрешением или стохастическими параметризациями (например, Judt, 2018; Selz, 2019; Zhang et al., 2019). Фундаментальной причиной существования этого предела является взаимодействие масштабов (Lorenz, 1969; Palmer et al., 2014), особенно в конвективном масштабе, где крайне нелинейная динамика, обусловленная выделением скрытого тепла, может приводить к очень быстрому росту погрешности (Selz & Craig, 2015b; Zhang et al., 2007).
Если амплитуда начального возмущения достаточно мала, то его пространственная структура (т.е. масштаб "бабочки") уже не имеет значения, а крошечные ошибки на любом масштабе приведут к быстрому росту, насыщению мелкомасштабных ошибок и последующему распространению ошибки вверх по масштабу (Durran & Gingrich, 2014; Sun & Zhang, 2016). Однако крупномасштабные неопределенности в синоптических и планетарных масштабах растут по другому механизму, который иногда называют ростом вверх по амплитуде, когда ошибки растут экспоненциально во времени с одинаковой скоростью для всех масштабов до насыщения (Durran & Gingrich, 2014; Rotunno & Snyder, 2008). В среднем начальная неопределенность, присутствующая в современных оперативных системах прогнозирования погоды, достаточно велика, чтобы доминировал последний механизм (Selz et al., 2022). Однако переход к первому механизму произойдет уже при снижении начальной неопределенности до 10%-20% от ее текущего уровня. В связи с этим возникает вероятность того, что для некоторых погодных ситуаций эффект бабочки уже может существенно ограничивать качество прогноза, что является предметом активных исследований (например, Craig et al., 2021).
В современной практике прогнозы погоды рассчитываются на основе набора частичных дифференциальных уравнений (ЧДУ), которые представляют собой математические формулировки законов физики. Затем эти ЧДУ дискретизируются, аппроксимируются и оптимизируются с помощью различных численных методов и, как правило, решаются на массивно-параллельных вычислительных архитектурах. В последнее время применяется новый подход, при котором прогнозы погоды рассчитываются с помощью методов, основанных на искусственном интеллекте (ИИ) и управляемых данными. В этих методах используются глубокие нейронные сети, обученные на ряде исторических состояний атмосферы (например, Bi et al., 2023; Lam et al., 2022; Pathak et al., 2022; Weyn et al., 2019), обычно получаемых из наборов данных реанализа, таких как ERA5 (Hersbach et al., 2020). Нейронные сети оценивают будущее состояние атмосферы путем интерполяции и комбинирования событий, произошедших в прошлом, без непосредственного знания физических законов или ограничений. Последние результаты показали, что точность прогноза сопоставима или даже превосходит традиционные модели прогнозирования (например, Bi et al., 2023; Lam et al., 2022), при этом модели ИИ обладают огромным преимуществом: после обучения им требуется гораздо меньше вычислительных усилий для расчета прогноза погоды. Это может помочь снизить стоимость и энергопотребление при прогнозировании погоды и/или высвободить ресурсы для увеличения размеров ансамбля или ассимиляции данных.
В данной работе мы исследуем способность современной модели на основе искусственного интеллекта (Pangu) имитировать эффект бабочки, т.е. очень быстрый рост ошибки от возмущений начальных условий с очень малой амплитудой. Мы сравниваем эти результаты с результатами моделирования с помощью современной модели численного прогнозирования, основанной на дискретизации PDE (ICON), включая моделирование с разрешением, допускающим конвекцию. Мы также исследуем, способна ли модель AI точно имитировать рост ошибки от текущих оценок неопределенности начальных условий.

В качестве представителя класса моделей на основе ИИ, основанных на данных, мы используем модель "Pangu-Weather" (Bi et al., 2023), которая была опубликована совсем недавно и свободна для использования в исследовательских целях. Было показано, что она дает несколько лучшие детерминированные прогнозы, чем ведущая оперативная модель прогнозирования погоды (IFS), оцениваемая по стандартным метрикам, таким как среднеквадратичная ошибка или корреляция аномалий по отношению к реанализу ERA5. Pangu состоит из трехмерной глубокой нейронной сети, которая была обучена на 39-летних данных ERA5. Модельное состояние Pangu состоит из 13 уровней давления (от 1000 до 50 гПа) с 5 переменными верхнего слоя воздуха (горизонтальный ветер, температура, геопотенциал и удельная влажность), которые дополняются 4 поверхностными переменными (10-метровый горизонтальный ветер, 2-метровая температура и среднее давление на уровне моря). Дополнительные переменные, такие как осадки, не рассчитываются. Все переменные определяются на регулярной сетке 0,25° по широте и долготе. Эти переменные распространяются во времени вперед, причем для 4 различных временных шагов (1 час, 3 часа, 6 часов, 24 часа) предусмотрены 4 различные сети. Более длинные временные шаги дают лучшие прогнозы, поэтому используется метод "иерархического временного агрегирования", когда сначала последовательно применяется самый длинный временной шаг (24 часа), затем следующий более короткий и так далее, пока не будет достигнуто желаемое временное разрешение. Например, для получения набора почасовых прогнозов на три дня используется 24-часовая сеть для получения прогнозов на 24, 48 и 72 часа, затем используется сеть с временным шагом 6 часов для заполнения времени 6 часов, 12 часов, 18 часов, 30 часов, 36 часов и т.д., после чего применяются сети с временным шагом 3 часа и затем 1 час, таким образом, прогноз доступен для каждого часа.

Моделирование в Pangu будет сравниваться с моделированием в ICON (ICOsahedral Non-hydrostatic model; Zängl et al., 2015), которая представляет собой сложную численную модель прогноза погоды, основанную на PDE. Таким образом, она решает дискретизированную и аппроксимированную версию математических уравнений, описывающих атмосферу. ICON состоит из негидростатического динамического ядра и работает на икосаэдрической сетке с уровнями высоты, соответствующими рельефу местности. Процессы, которые не могут быть корректно разрешены при таком разрешении сетки или не входят в уравнения жидкости, параметризуются, то есть оцениваются упрощенными и приближенными методами. К таким процессам относятся конвекция, а также микрофизика облаков, радиационное взаимодействие, турбулентность, гравитационное волновое сопротивление и взаимодействие с границей поверхности.

Для экспериментов, проводимых в данной работе, мы сосредоточились на моделировании, инициализированном на 26 июня 2021 года в 00 UT. Изначально этот случай был выбран потому, что в последующие дни над Северной Америкой наблюдались значительные объемы континентальной конвекции в летнее время, что могло бы привести к быстрому росту погрешности от малых неопределенностей. Однако, поскольку моделирование носит глобальный характер, в атмосфере в это время также присутствуют условия морского и зимнего времени, и применяемая здесь глобальная диагностика будет усредненной по многим различным погодным системам. Для инициализации Pangu и ICON мы используем оперативный анализ Европейского центра среднесрочных прогнозов погоды (ECMWF). Инициализация Pangu реанализом ERA5, на котором он был обучен, привела лишь к незначительным и несущественным различиям.
Для получения оценки неопределенности начальных условий в современных системах прогнозирования погоды начальные возмущения извлекаются из системы ансамблевого усвоения данных (EDA) в ECMWF (Isaksen et al., 2010). Система EDA использует возмущенные наблюдения и схему представления неопределенности модели для оценки неопределенности начальных условий, взятых из 50-членного ансамбля. Эти возмущения интерполируются на сетки Pangu и ICON, масштабируются (см. ниже) и добавляются к анализируемому состоянию для создания ансамбля начальных условий.

В данной работе мы провели пять различных экспериментов, которые будем обозначать как Pangu-100%, Pangu-0,1%, ICON-LR-100%, ICON-LR-0,1% и ICON-HR-0,1%. Первый термин характеризует используемую модель (Pangu или ICON). Если в модели Pangu пространственное разрешение фиксировано, то в модели ICON мы моделируем два различных разрешения: LR (низкое разрешение) и HR (высокое разрешение). Для прогонов с низким разрешением ICON устанавливается с шагом сетки около 20 км (R2B7-grid), т.е. горизонтальное разрешение аналогично Pangu. Такое разрешение требует временного шага в динамическом ядре 36 с, поскольку ICON явно разрешает горизонтально распространяющиеся звуковые волны. В экспериментах с высоким разрешением используется сетка с шагом 2,5 км (R2B10-grid) и временным шагом 4,5 с, что позволяет проводить моделирование с разрешением конвекции при отключенной схеме параметризации глубокой конвекции. Считается, что этот эксперимент дает наилучшую из имеющихся на сегодняшний день оценок роста ошибок конвективного масштаба и эффекта бабочки. Он явно разрешает конвективные движения и больше не опирается на параметризацию конвекции, которая, как было показано, замедляет рост ошибок (Selz & Craig, 2015a).
Процентный коэффициент (100% или 0,1%) указывает на изменение масштаба возмущений начальных условий, полученных из системы EDA. 100% означает, что мы приняли их без изменений и они представляют собой оценку текущего уровня неопределенности начального состояния. 0,1% означает, что мы уменьшили их амплитуду в 1000 раз, что приводит к очень малой неопределенности в ансамбле начальных условий. Эти эксперименты будут представлять собой возмущения типа "бабочки" и позволят получить оценки внутреннего предела. Их также иногда называют экспериментами "идентичных близнецов". Отметим, что начальные возмущения не включают сингулярных векторов, а модели, используемые в данном исследовании, являются детерминированными и не содержат стохастической параметризации или представления неопределенности модели. Поэтому данные эксперименты предназначены для оценки основных свойств роста ошибок в атмосфере в контексте идеальной модели и не рассчитаны на получение надежных вероятностных прогнозов.
Если запуск Pangu очень дешев, а запуск ICON с низким разрешением вполне доступен, то моделирование ICON с высоким разрешением при глобальном разрешении, допускающем конвекцию, очень дорого. В результате мы смогли смоделировать только 5 членов ансамбля из 50 и с трехдневным временем интеграции. Мы также воздержались от моделирования ICON с высоким разрешением для 100%-ных начальных возмущений, поскольку предыдущие исследования показывают, что мелкомасштабные процессы, которые более точно отражает HR-моделирование, не имеют там решающего значения (Selz et al., 2022). Все эксперименты вычислялись на центральных процессорах, эксперименты ICON - на компьютере Atos в ECMWF. Вычислительные затраты составили 16 ядро-часов для каждого эксперимента Pangu, 2 900 ядро-часов для каждого эксперимента ICON-LR и 1 300 000 ядро-часов для эксперимента ICON-HR.
Постановка HR-симуляций осложняется тем, что анализы ECMWF (обеспечивающие начальные условия) не содержат конвективных движений, поскольку их разрешение аналогично разрешению Pangu и ICON-LR. Поэтому в эксперименте ICON-HR необходимо сначала раскрутить эти малые масштабы, а запуск эксперимента только на основе анализа возмущений не даст правильного роста возмущений. Чтобы дать возможность малым масштабам раскрутиться, мы запустили одну симуляцию ICON-HR на день раньше (с анализа 25 июня 2021 г., 00 UT) и прогнали ее в течение 24 ч. Затем полное состояние модели было записано на диск, добавлены пересчитанные возмущения EDA и запущен ансамбль из 5 членов на три дня вперед. Мы считаем, что небольшое отличие в начальном состоянии на 26 июня 2021 г. в 00 UT гораздо менее существенно, чем исследование роста ошибок в моделировании HR, где малые масштабы не присутствуют в начальных условиях.

Во-первых, мы рассмотрели ошибки среднего ансамблевого значения симуляций по отношению к реанализу ERA5. Это сделано только для проверки правильности реализации всех моделей, поскольку детерминированная точность прогноза не является предметом рассмотрения в данной работе. Среднеквадратичная ошибка (RMSE) ансамблевого среднего зонального ветра на высоте 300 гПа при времени прогноза 72 часа одинакова для всех экспериментов и составляет от 4,6 до 4,9 м с-1 , причем Pangu незначительно лучше. Это сопоставимо со средней ошибкой, приведенной в работе Bi et al. (2023) для зонального ветра на 500 гПа, и свидетельствует о том, что все использованные здесь модели способны обеспечить сходное качество прогноза ветра верхнего уровня.

Основным преимуществом новых моделей на основе ИИ перед стандартными моделями на основе PDE является их очень низкая вычислительная стоимость, и часто утверждается, что это открывает возможность создания гораздо большего числа участников ансамбля (например, Bi et al., 2023). Действительно, большие ансамбли значительно уменьшат неопределенность выборки и смогут обеспечить гораздо более надежные прогнозы вероятности экстремальных событий (Tempest et al., 2023). Однако такие большие ансамбли имеют смысл только в том случае, если свойства роста ошибок модели реалистичны. В данном случае протестированная нами модель Pangu-Weather на основе ИИ способна воспроизводить основные свойства роста ошибок при запуске со 100%-ными возмущениями начальных условий, хотя при этом наблюдаются и существенные недостатки. Однако при малых значениях неопределенности начальных условий она полностью отказывается от моделирования эффекта "бабочки" и не способна воспроизвести ни одного признака ускоренного роста ошибки и присущей ей ограниченной предсказуемости.
Такая неспособность имитировать эффект бабочки, пожалуй, неудивительна для моделей на основе ИИ: Хотя внутренне присущий предел предсказуемости является основным физическим свойством земной атмосферы, его нельзя измерить или наблюдать. В принципе, необходимо было бы создать точную копию Земли и Солнечной системы, затем применить к ней небольшое возмущение и наблюдать за будущими последствиями. В исследованиях, подобных данной работе, мы пытаемся оценить внутренний предел путем моделирования таких квазиидентичных копий, делая вид, что нам точно известно начальное состояние атмосферы, и предполагая, что модель обеспечивает достаточно точную аппроксимацию атмосферы (предположение о совершенстве модели). Однако такие анализы, как ERA5 (да и любой другой анализ), никогда не приблизятся к истинному состоянию настолько, чтобы можно было наблюдать эффект бабочки, поскольку наша современная система наблюдений и ассимиляции все еще имеет очень значительные ошибки.
Таким образом, нейронная сеть в процессе обучения может лишь приближенно изучить развитие атмосферы в пределах текущих погрешностей ассимиляции. Величина этих неопределенностей представлена 100%-ными возмущениями в ансамбле начальных условий, поэтому модели на основе ИИ могут только предполагать, как будут расти эти неопределенности. В связи с этими ограничениями мы считаем маловероятным, что другие доступные в настоящее время модели на основе искусственного интеллекта, такие как FourCastNet (Pathak et al., 2022) или GraphCast (Lam et al., 2022), обученные на аналогичных данных, дадут результаты, существенно отличающиеся от результатов модели Pangu, протестированной здесь. Однако такие модели, как GraphCast или модель, использованная в работе Weyn et al. (2021), принимают на вход два начальных условия, разделенных определенным временным интервалом (например, 6 ч). Было бы интересно посмотреть, смогут ли такие модели распространить быстрые темпы роста, связанные с внутренним пределом, дальше в будущее, если они присутствуют в двух начальных условиях. Но для этого потребуется модель на основе PDE, например ICON-HR-0,1%, которая будет генерировать начальные условия и, таким образом, по сути, "информировать" нейронную сеть о существовании эффекта бабочки.
Как уже говорилось во введении, суть эффекта бабочки заключается в распространении вверх по шкале быстро растущих неопределенностей на малых масштабах, в основном связанных с конвекцией и осадками. В моделях с более грубым разрешением (как на основе ИИ, так и на основе PDE) необходимая мелкомасштабная изменчивость отсутствует. В прошлом исследовании мы вернули недостающую изменчивость в модели с грубым разрешением, используя стохастическую схему конвекции, что привело к более быстрому росту ошибок и потенциально более реалистичному моделированию эффекта бабочки и более точной оценке внутреннего предела (Selz, 2019; Selz & Craig, 2015a; Selz et al., 2022). Аналогичные методы могут быть использованы в моделях на основе ИИ. Например, Вейн и др. (2021) создали набор (немного) различных моделей путем рандомизации затравки в процессе обучения ИИ. Этот набор различных моделей впоследствии может быть использован для генерации ансамбля прогнозов, аналогично стохастической параметризации в современных оперативных ансамблевых системах. Другим подходом может быть стохастический вывод недостающей мелкомасштабной изменчивости путем применения методов суперразрешения (Harris et al., 2022; Leinonen et al., 2020), в которых метрики мастерства ансамбля являются частью функции потерь. Интересно будет выяснить, улучшают ли системы глобального прогнозирования, основанные на этих методах, моделирование эффекта бабочки и характерной амплитудной зависимости скорости роста ошибки.

В любом случае неспособность моделей на основе ИИ имитировать эффект бабочки сама по себе не лишает их возможности создавать надежные ансамбли в оперативном прогнозировании погоды, поскольку неясно, насколько эта способность актуальна для прогнозов погоды при текущем уровне неопределенности начальных условий (см. введение). Наше предыдущее исследование показало, что процессы роста ошибок в верхнем масштабе от конвекции в настоящее время в среднем несущественны, поскольку они перекрываются ростом в синоптических масштабах от относительно больших начальных неопределенностей там (Selz et al., 2022). Такой рост погрешностей достаточно хорошо имитируется моделью на основе ИИ. Но поскольку эта картина отражает только средние условия в средних широтах, она может быть иной в некоторых экстремальных метеорологических ситуациях, как, например, описано в работе Rodwell et al. (2013). Она также может быть иной в тропиках, где конвективные процессы гораздо сильнее и заметнее, а крупномасштабные процессы относительно слабы и линейны (Judt, 2020).

526 views·1 share