雨量予測を配送や設備運用に使うなら、「最大60%改善」という数字だけでは採用を決められない。
2026年9月3日発表のWeatherNext 3では、降水の確率予測を測るCRPSの改善幅が、照合する観測データによって最大60%、30%、10%と変わる。[1]
違いを理解する鍵は、予測モデルに加え、正解データの作られ方と雨量の集計時間にある。
Google DeepMindとGoogle Researchの発表・論文を出発点に、同じ予測を異なる観測で評価する意味を考える。対象は2026年9月3日提出の論文v1であり、本稿で予報モデルの再学習や観測データを使った追試は行っていない。以下の性能値は著者らの報告、数式による説明と導入手順は本稿の整理である。[1・2]
比較表から消してはいけない「6時間」と「24時間」
論文の図4aと第4.3節は、PARDIGと呼ばれる出力ヘッドの降水予測を、WeatherNext 2やECMWF ENSという既存の確率予報と比較する。報告された短い予報リードタイムでの改善幅を整理すると、次のようになる。リードタイムは、予報の基準時刻から何時間先を予測するかを指す。[2]
| 照合する観測データ | 図4aの雨量集計 | 報告されたCRPS低下率 | 数字を読む際の条件 |
|---|---|---|---|
| IMERG Final:衛星を中心とした降水推定 | 6時間積算 | 最大60% | IMERGはモデルの学習ターゲットにも含まれる |
| MRMS:地上レーダーを中心とした降水推定 | 6時間積算 | 最大30% | 評価範囲は米国本土に限られる |
| 雨量計による観測 | 24時間積算 | 最大10% | 観測地点の分布に偏りがある |
出典は公式発表および論文の図4a・第3.1節。数値は各条件での最大改善幅であり、全地域・全予報時間の平均ではない。[1・2]
この表は「地上で測ると、本当の改善率は10%だった」とも読めない。衛星と雨量計では空間的な測り方が異なり、この比較では積算時間も違うからだ。60%と10%の差を、そのままモデルの過大評価分として引き算することはできない。
例えば、強い雨が短時間だけ降る場合、6時間積算と24時間積算では、ピークの時刻ずれがスコアへ及ぼす影響も変わる。改善率を比較する前に、何を一つの予測事例として数えたかを揃える必要がある。
「正解の雨量」も計測と推定のパイプラインから生まれる
IMERGは、空から雨を直接数えた完全な正解表ではない。NASAの説明では、複数衛星のマイクロ波による降水推定や、それに合わせた赤外線推定を統合・補間する。Final Runでは月次の雨量計解析も利用して補正する。[3]
したがって、評価上の問いは「実際の大気をどれだけ再現したか」だけでなく、「その観測製品が表す雨量に、どれだけ一致したか」でもある。推定製品に系統的な偏りがあれば、それをよく再現した予測が高く評価される可能性がある。
MRMSも単独センサーの生値ではない。NOAAのシステムは、複数レーダー、地上観測などを統合して降水量を推定する。レーダーは広い範囲を覆える一方、地表そのものを直接走査できず、観測の良さは場所や降雨の状況に左右される。雨量計には、その地点の雨を測れる強みがあるが、点の間に降った雨は捉えきれない。[4・5]
ここから導ける実務上の方針は、一つのデータを無条件に「真値」と呼ぶことを避け、計測方法の異なるデータでも結果の方向が一致するかを確認することだ。ただし、別製品でも雨量計などを共有していれば、誤差まで統計的に独立とは限らない。
WeatherNext 3の論文も、IMERGを学習ターゲットに使う以上、独立な照合先ではないと明記する。IMERGとPARDIGの出力は共同学習されるため、この影響はPARDIG側にも及び得る。これは未知の日付での評価が無意味という意味ではなく、時間を分離した評価と、測定系を変えた評価は、確かめるものが違うということだ。[2]
改善の仕組みは、観測を入力と教師の両方に加えること
WeatherNext 3は、ECMWF HRESの解析データに静止衛星の観測を組み合わせる。解析データとは、観測と数値予報モデルを使って推定した大気の状態である。衛星だけから将来の天気を生成する構成ではない。公式仕様では、FGN(Functional Generative Network)のmesh transformerを使い、64メンバーのアンサンブルを出力する。[6]
アンサンブルは、将来について複数の候補を出す方法だ。雨量を一つに決め打ちする代わりに、候補の分布から中央値や閾値を超える確率を求められる。
学習先にも役割分担がある。降水については解析データに加え、NASAのIMERGとGoogleの衛星レーダー由来の推定を使う。地上観測を学ぶ気温・露点の出力と、格子状の降水出力は分けられている。公式仕様の約5kmは気温・露点の出力で、降水を含む地表格子は約10kmだ。[6]
入力に新しい観測を足せば、現在の雲や大気の状態を条件として利用できる。教師を変えれば、何に一致する予測を学ぶかが変わる。この二つを区別すると、今回の進歩を単に「解像度を上げたから正確になった」と説明するだけでは足りないことが分かる。
一方、公開されたモデル全体の比較だけから、衛星入力・学習ターゲット・モデルの変更がそれぞれ何%を生んだかは算出できない。寄与を分けるには、他の条件を固定して一要素ずつ変更する追加実験が必要になる。
CRPSが60%下がっても、的中率が60ポイント増えるわけではない
CRPS(Continuous Ranked Probability Score)は、予測分布と観測値のずれを測る。ECMWFの解説も、予報と観測の累積分布を比較する指標として説明している。[7]
雨量の予測累積分布を $F(z)$、観測雨量を $y$ とすると、定義は次のように書ける。
$$
\operatorname{CRPS}(F,y)
=\int_{-\infty}^{\infty}
\left(F(z)-\mathbf{1}{y\le z}\right)^2,dz
$$
$F(z)$ は「雨量が $z$ 以下になる」と予測した確率、$\mathbf{1}{y\le z}$ は観測値に対応する0か1の値だ。低いほどよく、雨量をmmで扱うならCRPSもmmの次元を持つ。0〜100%の的中率ではない。
比較対象の平均スコアを $S_{\mathrm{base}}>0$、新モデルを $S_{\mathrm{new}}$ とすれば、相対的な低下率は
$$
100\left(1-\frac{S_{\mathrm{new}}}{S_{\mathrm{base}}}\right)%
$$
である。説明用に、同じ評価事例でスコアが1.0から0.4へ下がれば60%低下となる。この計算は、雨の日を当てた回数や、降水確率に60ポイントを加える操作とは結び付かない。
また、各地点のCRPSがよくても、複数地点の雨が同時に強まる関係まで正しいとは限らない。例えば流域全体の雨量を使う用途なら、各地点の評価に加え、アンサンブルの各メンバーを流域単位で集計して、その分布を観測と比較する必要がある。これは周辺分布と同時分布を分けて考える、一般的な確率予測の要件だ。
公開結果から言える範囲と、残る限界
本稿で扱った図4の評価期間は2024年で、評価用モデルの学習は2023年末までである。論文公開日が2026年9月3日でも、この表が同年9月の運用成績を示すわけではない。[2]
さらに、論文の閾値別の降水評価は最大4mm/6時間までで、極端な降水の評価は今後の課題とされている。通常の雨の確率予測で改善があっても、それだけで豪雨時の見逃し率を保証することはできない。[2]
用途へ移す際には、少なくとも次の制約が残る。
- 米国のレーダー評価の改善を、日本や東南アジアの局地的な雨へそのまま移せるとは限らない。
- 最大改善率は、比較対象とリードタイムに依存する。自社で使う予報時間における差を確認する必要がある。
- モデル開発者による評価報告を読んだ段階であり、本稿は独立した追試結果を提供していない。
導入前の評価仕様を、用途から決める
ここからは本稿の提案である。例えば「翌日の配送計画に使う」という目的なら、最初に対象地域、予測を取り出す時刻、必要な積算雨量、許容する見逃しを決める。目的が曖昧なままモデル名だけを選んでも、公開スコアと業務成果を結び付けにくい。
| 決める項目 | 評価仕様に残す内容 |
|---|---|
| 予報の利用時点 | 実際に入手可能だった予報の発行時刻・取得時刻 |
| 照合する量 | 降水強度か積算雨量か、単位、積算の開始・終了時刻 |
| 空間の対応 | 格子と観測地点の対応方法、対象地域、欠測の扱い |
| 比較の公平性 | 同じ日時・地点を予測した既存予報と新予報の組 |
| 成績の不確かさ | 平均差に加え、降雨イベント単位などの再標本化による幅 |
| 業務への効果 | 行動を変える雨量閾値での確率校正と、見逃し・空振りの負担 |
雨量データでは、mm/hの降水強度とmmの積算雨量の取り違えにも注意したい。NASAも製品ごとに単位が異なることを案内している。単位や時間窓が違えば、モデルの比較以前に照合が成立しない。[8]
WeatherNext 3の報告を導入判断へつなげるには、「最大60%」を一つの性能ラベルとして保存するより、観測製品・積算時間・予報時間・比較対象と一緒に保存する。その形で初めて、自分たちが必要とする雨の予測が改善したのかを検証できる。
参考リンク
[1]Google:Introducing WeatherNext 3, our most advanced and accurate global weather AI model(2026年9月3日)
[2]Rasp et al.:WeatherNext 3: Increasing resolution and performance of global weather models with raw observations(2026年9月3日、v1。図4、第3.1・3.3・4.3節)
[3]NASA:IMERG Final Run(観測製品の定義。2026年9月11日確認)
[4]NOAA NSSL:Multi-Radar/Multi-Sensor System(観測製品の定義。2026年9月11日確認)
[5]NOAA NSSL:CI-FLOW: Rainfall(レーダーと雨量計の性質。2026年9月11日確認)
[6]Google for Developers:WeatherNext 3(モデル仕様。2026年9月11日確認)
[7]ECMWF:12.B Statistical Concepts - Probabilistic Data(評価指標の背景資料。2026年9月11日確認)
[8]NASA:IMERG: Integrated Multi-satellitE Retrievals for GPM(データの単位。2026年9月11日確認)