0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

WeatherNext 3の降水評価が示す、改善率を「最大60%」で括れない理由

0
Posted at

雨量予測を配送や設備運用に使うなら、「最大60%改善」という数字だけでは採用を決められない。
2026年9月3日発表のWeatherNext 3では、降水の確率予測を測るCRPSの改善幅が、照合する観測データによって最大60%、30%、10%と変わる。[1]
違いを理解する鍵は、予測モデルに加え、正解データの作られ方と雨量の集計時間にある。

Google DeepMindとGoogle Researchの発表・論文を出発点に、同じ予測を異なる観測で評価する意味を考える。対象は2026年9月3日提出の論文v1であり、本稿で予報モデルの再学習や観測データを使った追試は行っていない。以下の性能値は著者らの報告、数式による説明と導入手順は本稿の整理である。[1・2]

比較表から消してはいけない「6時間」と「24時間」

論文の図4aと第4.3節は、PARDIGと呼ばれる出力ヘッドの降水予測を、WeatherNext 2やECMWF ENSという既存の確率予報と比較する。報告された短い予報リードタイムでの改善幅を整理すると、次のようになる。リードタイムは、予報の基準時刻から何時間先を予測するかを指す。[2]

照合する観測データ 図4aの雨量集計 報告されたCRPS低下率 数字を読む際の条件
IMERG Final:衛星を中心とした降水推定 6時間積算 最大60% IMERGはモデルの学習ターゲットにも含まれる
MRMS:地上レーダーを中心とした降水推定 6時間積算 最大30% 評価範囲は米国本土に限られる
雨量計による観測 24時間積算 最大10% 観測地点の分布に偏りがある

出典は公式発表および論文の図4a・第3.1節。数値は各条件での最大改善幅であり、全地域・全予報時間の平均ではない。[1・2]

この表は「地上で測ると、本当の改善率は10%だった」とも読めない。衛星と雨量計では空間的な測り方が異なり、この比較では積算時間も違うからだ。60%と10%の差を、そのままモデルの過大評価分として引き算することはできない。

例えば、強い雨が短時間だけ降る場合、6時間積算と24時間積算では、ピークの時刻ずれがスコアへ及ぼす影響も変わる。改善率を比較する前に、何を一つの予測事例として数えたかを揃える必要がある。

「正解の雨量」も計測と推定のパイプラインから生まれる

IMERGは、空から雨を直接数えた完全な正解表ではない。NASAの説明では、複数衛星のマイクロ波による降水推定や、それに合わせた赤外線推定を統合・補間する。Final Runでは月次の雨量計解析も利用して補正する。[3]

したがって、評価上の問いは「実際の大気をどれだけ再現したか」だけでなく、「その観測製品が表す雨量に、どれだけ一致したか」でもある。推定製品に系統的な偏りがあれば、それをよく再現した予測が高く評価される可能性がある。

MRMSも単独センサーの生値ではない。NOAAのシステムは、複数レーダー、地上観測などを統合して降水量を推定する。レーダーは広い範囲を覆える一方、地表そのものを直接走査できず、観測の良さは場所や降雨の状況に左右される。雨量計には、その地点の雨を測れる強みがあるが、点の間に降った雨は捉えきれない。[4・5]

ここから導ける実務上の方針は、一つのデータを無条件に「真値」と呼ぶことを避け、計測方法の異なるデータでも結果の方向が一致するかを確認することだ。ただし、別製品でも雨量計などを共有していれば、誤差まで統計的に独立とは限らない。

WeatherNext 3の論文も、IMERGを学習ターゲットに使う以上、独立な照合先ではないと明記する。IMERGとPARDIGの出力は共同学習されるため、この影響はPARDIG側にも及び得る。これは未知の日付での評価が無意味という意味ではなく、時間を分離した評価と、測定系を変えた評価は、確かめるものが違うということだ。[2]

改善の仕組みは、観測を入力と教師の両方に加えること

WeatherNext 3は、ECMWF HRESの解析データに静止衛星の観測を組み合わせる。解析データとは、観測と数値予報モデルを使って推定した大気の状態である。衛星だけから将来の天気を生成する構成ではない。公式仕様では、FGN(Functional Generative Network)のmesh transformerを使い、64メンバーのアンサンブルを出力する。[6]

アンサンブルは、将来について複数の候補を出す方法だ。雨量を一つに決め打ちする代わりに、候補の分布から中央値や閾値を超える確率を求められる。

学習先にも役割分担がある。降水については解析データに加え、NASAのIMERGとGoogleの衛星レーダー由来の推定を使う。地上観測を学ぶ気温・露点の出力と、格子状の降水出力は分けられている。公式仕様の約5kmは気温・露点の出力で、降水を含む地表格子は約10kmだ。[6]

入力に新しい観測を足せば、現在の雲や大気の状態を条件として利用できる。教師を変えれば、何に一致する予測を学ぶかが変わる。この二つを区別すると、今回の進歩を単に「解像度を上げたから正確になった」と説明するだけでは足りないことが分かる。

一方、公開されたモデル全体の比較だけから、衛星入力・学習ターゲット・モデルの変更がそれぞれ何%を生んだかは算出できない。寄与を分けるには、他の条件を固定して一要素ずつ変更する追加実験が必要になる。

CRPSが60%下がっても、的中率が60ポイント増えるわけではない

CRPS(Continuous Ranked Probability Score)は、予測分布と観測値のずれを測る。ECMWFの解説も、予報と観測の累積分布を比較する指標として説明している。[7]

雨量の予測累積分布を $F(z)$、観測雨量を $y$ とすると、定義は次のように書ける。

$$
\operatorname{CRPS}(F,y)
=\int_{-\infty}^{\infty}
\left(F(z)-\mathbf{1}{y\le z}\right)^2,dz
$$

$F(z)$ は「雨量が $z$ 以下になる」と予測した確率、$\mathbf{1}{y\le z}$ は観測値に対応する0か1の値だ。低いほどよく、雨量をmmで扱うならCRPSもmmの次元を持つ。0〜100%の的中率ではない。

比較対象の平均スコアを $S_{\mathrm{base}}>0$、新モデルを $S_{\mathrm{new}}$ とすれば、相対的な低下率は

$$
100\left(1-\frac{S_{\mathrm{new}}}{S_{\mathrm{base}}}\right)%
$$

である。説明用に、同じ評価事例でスコアが1.0から0.4へ下がれば60%低下となる。この計算は、雨の日を当てた回数や、降水確率に60ポイントを加える操作とは結び付かない。

また、各地点のCRPSがよくても、複数地点の雨が同時に強まる関係まで正しいとは限らない。例えば流域全体の雨量を使う用途なら、各地点の評価に加え、アンサンブルの各メンバーを流域単位で集計して、その分布を観測と比較する必要がある。これは周辺分布と同時分布を分けて考える、一般的な確率予測の要件だ。

公開結果から言える範囲と、残る限界

本稿で扱った図4の評価期間は2024年で、評価用モデルの学習は2023年末までである。論文公開日が2026年9月3日でも、この表が同年9月の運用成績を示すわけではない。[2]

さらに、論文の閾値別の降水評価は最大4mm/6時間までで、極端な降水の評価は今後の課題とされている。通常の雨の確率予測で改善があっても、それだけで豪雨時の見逃し率を保証することはできない。[2]

用途へ移す際には、少なくとも次の制約が残る。

  • 米国のレーダー評価の改善を、日本や東南アジアの局地的な雨へそのまま移せるとは限らない。
  • 最大改善率は、比較対象とリードタイムに依存する。自社で使う予報時間における差を確認する必要がある。
  • モデル開発者による評価報告を読んだ段階であり、本稿は独立した追試結果を提供していない。

導入前の評価仕様を、用途から決める

ここからは本稿の提案である。例えば「翌日の配送計画に使う」という目的なら、最初に対象地域、予測を取り出す時刻、必要な積算雨量、許容する見逃しを決める。目的が曖昧なままモデル名だけを選んでも、公開スコアと業務成果を結び付けにくい。

決める項目 評価仕様に残す内容
予報の利用時点 実際に入手可能だった予報の発行時刻・取得時刻
照合する量 降水強度か積算雨量か、単位、積算の開始・終了時刻
空間の対応 格子と観測地点の対応方法、対象地域、欠測の扱い
比較の公平性 同じ日時・地点を予測した既存予報と新予報の組
成績の不確かさ 平均差に加え、降雨イベント単位などの再標本化による幅
業務への効果 行動を変える雨量閾値での確率校正と、見逃し・空振りの負担

雨量データでは、mm/hの降水強度とmmの積算雨量の取り違えにも注意したい。NASAも製品ごとに単位が異なることを案内している。単位や時間窓が違えば、モデルの比較以前に照合が成立しない。[8]

WeatherNext 3の報告を導入判断へつなげるには、「最大60%」を一つの性能ラベルとして保存するより、観測製品・積算時間・予報時間・比較対象と一緒に保存する。その形で初めて、自分たちが必要とする雨の予測が改善したのかを検証できる。

参考リンク

[1]Google:Introducing WeatherNext 3, our most advanced and accurate global weather AI model(2026年9月3日)

[2]Rasp et al.:WeatherNext 3: Increasing resolution and performance of global weather models with raw observations(2026年9月3日、v1。図4、第3.1・3.3・4.3節)

[3]NASA:IMERG Final Run(観測製品の定義。2026年9月11日確認)

[4]NOAA NSSL:Multi-Radar/Multi-Sensor System(観測製品の定義。2026年9月11日確認)

[5]NOAA NSSL:CI-FLOW: Rainfall(レーダーと雨量計の性質。2026年9月11日確認)

[6]Google for Developers:WeatherNext 3(モデル仕様。2026年9月11日確認)

[7]ECMWF:12.B Statistical Concepts - Probabilistic Data(評価指標の背景資料。2026年9月11日確認)

[8]NASA:IMERG: Integrated Multi-satellitE Retrievals for GPM(データの単位。2026年9月11日確認)

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?