미국 연구진, 위성 강수로 AI 비 예보 손봤다…인도 폭풍 10건에서 구조적 차이 확인
구글·칼텍·스탠퍼드 연구진, ECMWF AIFS 구조 유지한 채 강수 학습 목표만 IMERG로 교체
2024년 전 지구 평가에서 1일 선행 CRPS 19.3% 낮아져…하루 300mm 초과 초극한 비는 여전히 물리모델 우세
AI 날씨 모델의 성능은 보통 더 큰 모델, 더 긴 학습, 더 많은 연산으로 설명되곤 한다. 그러나 미국 연구진이 9월 23일 수정 공개한 사전공개 논문은 다른 답을 내놨다. 모델의 뼈대는 거의 그대로 두고, 무엇을 정답으로 학습시키느냐를 바꾸자 비 예보의 확률 성능이 의미 있게 개선됐다는 것이다.
논문의 핵심은 ECMWF의 AI 예보 시스템 AIFS를 다시 훈련시키면서 강수 정답 자료를 ERA5 재분석 대신 NASA의 IMERG 위성 강수 자료로 바꾼 데 있다. 연구팀은 이 새 모델을 ‘락슈미(Laxmi)’라고 불렀고, 2024년 평가에서 24시간 누적 강수의 1일 선행 CRPS가 AIFS-CRPS보다 19.3% 낮았다고 보고했다. CRPS는 확률예보가 실제 관측과 얼마나 잘 맞는지 보는 지표라서 낮을수록 좋다.
모델을 키우기보다 ‘무엇을 관측했는가’가 바뀌었다
AIFS는 이미 현업에 들어간 ECMWF의 AI 예보 체계다. 0.25도 격자에서 최대 15일까지 예보하는 개방형 머신러닝 시스템으로, 단일 예보와 앙상블 예보를 제공한다. 이번 연구가 흥미로운 이유는 이 기반 구조를 갈아엎지 않았다는 점이다. 연구팀은 같은 계열의 확률 예보 구조를 유지한 채 강수 타깃만 바꿔, 비 예보 오차의 상당 부분이 모델 크기보다 학습 데이터의 편향에서 왔을 수 있다고 제시했다.
여기서 비교 대상인 ERA5는 관측과 수치모델을 결합해 과거 대기 상태를 재구성한 재분석 자료다. 기상 연구의 표준에 가깝지만, 강수는 대류와 미세물리 과정을 직접 관측한 값이 아니라 모델과 동화 체계를 거쳐 만들어진 결과물이어서 구조적 편향이 남을 수 있다. 논문은 이런 편향 때문에 기존 AI 모델이 약한 비를 너무 자주 뿌리고, 강한 비는 덜 예측하는 경향을 학습했을 가능성을 문제로 삼았다.
위성 강수 IMERG가 바꾼 것은 평균이 아니라 분포였다
IMERG는 GPM 위성군의 관측을 결합해 전 지구 강수를 추정하는 자료다. 바다와 관측소가 드문 지역까지 넓게 덮는 장점이 있지만, 이것 역시 추정과 보정의 산물이어서 절대적 진실로 볼 수는 없다. NASA 문서도 위성 마이크로파·적외선 추정과 우량계 보정이 함께 들어간다고 설명한다.
그럼에도 연구팀이 IMERG를 택한 이유는 강수의 ‘분포’를 더 현실적으로 반영하기 위해서다. 논문에 따르면 락슈미는 하루 3mm 미만의 약한 비 과다예측을 33% 줄였고, 95백분위 강수에 대한 Brier skill score는 AIFS-CRPS보다 57.2% 개선됐다. 이는 평균 강수량 예측이 조금 나아졌다는 차원이 아니라, 비가 오는 빈도와 강도가 실제 관측 분포에 더 가깝게 이동했다는 뜻에 가깝다.
연구팀은 2024년 한 해 동안 주간 초기화 94회, 앙상블 50개 구성으로 전 지구 성능을 비교했다. 또 저해상도 변형 모델까지 함께 놓고 봤을 때, 해상도 상승만이 아니라 IMERG로 학습한 사실 자체가 성능 차이에 기여한다고 해석했다. 독자의 질문으로 돌아가면, 적어도 이 논문 범위에서는 모델을 무조건 더 크게 만드는 것보다 비의 정답 데이터를 바꾸는 일이 실제 개선으로 이어졌다고 볼 근거가 있다.
인도 상륙 폭풍 10건, 현장에서 중요한 임계값을 따로 봤다
평균 점수만으로는 재난 대응 가치를 설명하기 어렵다는 점도 이 연구의 설계에 들어 있다. 연구팀은 2024년 2월 8일부터 2025년 9월 30일까지 인도에 상륙한 열대 몬순계 폭풍 10건을 골라, 상륙 72시간 이상 전에 초기화된 예보로 4일 누적 강수를 비교했다. 그 결과 150mm 사건 누적 강수 임계값에서 락슈미가 10건 중 7건에서 가장 정확한 예보를 냈고, AIFS는 1건, 물리 기반 IFS는 2건이었다.
이 대목은 산업적 의미도 분명하다. 농업, 배수 운영, 저수지 관리, 지역 재난대응은 평균 오차보다 특정 임계값을 넘는 비를 얼마나 일찍, 얼마나 그럴듯하게 확률로 제시하느냐에 더 민감하다. 락슈미의 성과는 AI 날씨 예측이 기온·기압 같은 매끈한 변수에서 강하다는 기존 인식을 넘어, 강수처럼 드문 극값 변수에도 데이터 설계에 따라 개선 여지가 있음을 보여준다.
남은 한계는 더 극단적인 비와 독립 검증이다
다만 이 결과를 과장해 읽으면 곤란하다. 첫째, 논문은 동료심사를 끝낸 확정 성과가 아니라 9월 2일 제출되고 23일 v3로 수정된 사전공개 논문이다. 둘째, 19.3% 개선은 2024년 평가에서 1일 선행 24시간 누적 강수 CRPS 기준이지, 모든 지역과 모든 예보기간의 정확도가 그만큼 좋아졌다는 뜻이 아니다.
셋째, 초극한 강수에서는 여전히 물리모델의 역할이 남아 있다. 논문은 하루 100mm 이상에서는 락슈미가 관측 사건의 38%를 포착해 IFS와 AIFS-MSE보다 낫다고 했지만, 300mm를 넘는 꼬리 구간에서는 락슈미가 강수를 거의 만들어내지 못했다고 적었다. 이 영역에서는 IFS가 관측 빈도의 약 10%를 포착해 여전히 필요하다고 연구팀도 인정했다.
결국 이번 연구가 던지는 답은 단순하다. AI 날씨 모델을 더 크게 만드는 일보다 학습할 비 관측 자료를 바꾸는 일이 중요할 수 있느냐는 질문에, 이번 사례의 답은 “그럴 수 있다”에 가깝다. 다만 그 답이 보편적 결론이 되려면 위성 자료의 자체 오차, 지상관측과의 독립 검증, 실제 현업 의사결정에서의 성능이 추가로 확인돼야 한다. 락슈미의 성과는 AI가 날씨를 더 잘 ‘계산’했다기보다, 무엇을 비의 정답으로 삼을지 다시 묻기 시작했다는 데 의미가 있다.
