氣象海洋運算 GPU 加速指南:模式移植、AI 天氣模型與研究單位算力租用成本解析
365天全年無休服務專線 0800-003-191

氣象海洋數值模擬的 GPU 加速:研究單位的算力租用指南

💡 快速答案:氣象海洋數值模擬可以用 GPU 加速嗎?

可以,而且已進入實用階段。傳統數值模式方面,ICON 已完成 GPU 移植並用於業務預報,WRF 也有部分模組與第三方 GPU 版本,但動力核心需要 FP64 或混合精度,建議選 H100 這類資料中心級 GPU。另一條路是 GraphCast、Pangu-Weather 等 AI 天氣模型,單卡數十秒到數分鐘即可產出全球預報,比數值模式快數千倍。台灣研究單位若只在颱風季需要大量算力,採月租尖峰擴充,成本通常比自建叢集低三到五成。

颱風還在千里之外的海面上,預報作業已經開跑。氣象與海洋數值模擬是少數「算得慢就等於白算」的科學計算:未來 24 小時的降雨分布,若得花 30 小時才算出來,再精確也沒有決策價值。這種與大氣賽跑的天性,讓氣象海洋運算長年占據各國超級電腦的使用排行榜,也讓愈來愈多研究單位開始盤算:在動輒數千核心的 CPU 叢集之外,GPU 加速與彈性租用,能不能讓有限的計畫經費發揮更大價值?這篇指南從模式移植現況、解析度成本結構、AI 天氣模型的衝擊,一路談到台灣研究單位的實務決策,提供計畫主持人一份可以直接拿來編預算的參考。

一頭吞噬算力的巨獸:氣象海洋模式在算什麼

攤開全球主流模式清單,大氣這一側有學研圈最普及的區域模式 WRF、採用非結構網格的新世代全球模式 MPAS,以及德國氣象局與馬克斯普朗克研究所主導的 ICON;海洋這一側則有區域海洋模式 ROMS、擅長近岸複雜地形的非結構網格模式 FVCOM,以及歐洲全球海洋模擬的主力 NEMO。名字各異,骨子裡做的事情相同:把大氣或海洋切成數以億計的格點,在每個格點上求解流體力學與熱力學方程,一個時間步接著一個時間步向未來推進。

這件事有三個特性註定燒錢:

  • 逐步積分:方程組必須一步一步向前推進,無法跳過中間過程直接得到答案,而預報時效又卡在那裡,業務作業通常要求一輪預報在 1 到 2 小時內算完;
  • 物理參數化:輻射傳送、雲微物理、邊界層亂流、海氣交換等方案,在每個格點、每個時間步重複計算,常占整體計算量的三到五成;
  • 資料同化:把衛星、雷達、浮標與探空觀測融合成最佳初始場,本身就是計算密集的最佳化問題,4DVar 這類變分方法要反覆執行正向與伴隨模式,計算量常是單次預報的好幾倍。

也因此,傳統氣象海洋運算的標準配備是 CPU 叢集加上 MPI 平行化:把地球切成數百到數千塊子區域,分派給對應數量的 CPU 核心,靠高速網路交換邊界資料。這套架構成熟穩定,但採購與維運門檻極高,對非業務單位的研究團隊往往是難以承受之重。對 HPC 叢集架構還不熟的讀者,可以先讀 HPC 高效能運算入門,再回頭看 GPU 在這個領域扮演的角色。

氣象海洋數值模擬的 GPU 加速:研究單位的算力租用指南
▲ GraphCast 單卡數十秒出全球預報;數值模式選 H100 級

數值模式的 GPU 移植:ICON 領跑,WRF 與海洋模式跟進

GPU 進入氣象海洋領域的速度,比深度學習圈慢了將近十年,關鍵不在硬體而在程式碼:這些模式動輒數十萬行 Fortran,承載數十年的科學驗證,重寫的風險與成本都極高。目前進度最快的是 ICON,透過 OpenACC 指示詞完成移植,瑞士的氣象業務單位已在超級電腦中心以 GPU 節點執行每日例行預報,是全球最早把 GPU 用進正式天氣預報作業的團隊之一。WRF 的官方主線仍以 CPU 為主,但雲微物理等計算最重的模組已有 GPU 加速實作,市場上也出現整套移植的第三方 GPU 版本;美國新一代統一預報系統 UFS 同樣把 GPU 納入探索路線。海洋模式腳步稍慢,NEMO 與 ROMS 社群的移植工作都在進行,距離全面業務化還有一段路。

選硬體前有一個關鍵事實必須弄清楚:數值模式的動力核心對浮點精度極其敏感,多數採用 FP64 雙精度或經嚴謹驗證的混合精度,否則長時間積分後捨入誤差會累積放大,輕則預報品質劣化,重則模式直接發散。這決定了選卡邏輯——消費級顯示卡的 FP64 效能被限制在單精度的六十四分之一,RTX 4090 的 FP64 僅約 1.3 TFLOPS;資料中心級的 H100 則有約 34 TFLOPS 的 FP64 算力,動用 Tensor Core 還能再翻倍。跑深度學習租 RTX 很划算,跑數值模式的動力核心,H100、A100 這一級的卡才是正確答案,選型前不妨先比對 GPU 主機的規格與方案。這套「FP64 門檻」的邏輯與結構、流體等工程模擬如出一轍,兩者常可共用同一套租用策略,細節可參考 CAE 工程模擬要什麼 GPU

另一個常被忽略的現實是通訊。數值模式的平行化建立在相鄰子區域交換邊界資料之上,多卡執行時,卡與卡之間的頻寬與延遲直接決定擴展效率,這正是資料中心級 GPU 主機普遍配備 NVLink 與高速網路的原因。此外,格點資料與物理場動輒占用數十 GB 記憶體,GPU 的 HBM 容量(H100 單卡為 80 GB)決定一張卡塞得下多大的網域;記憶體不夠就得切更多卡,通訊成本又隨之上升,這是規劃多卡配置時必須一起精算的三角習題。混合精度則是另一條省錢路線:把對精度不敏感的部分運算降到 FP32,已有團隊在幾乎不影響預報品質的前提下省下約三成計算時間,但每一步都需要嚴謹的數值驗證,不能貿然全面降精度。

解析度的代價:從 10 公里到 1 公里,漲的不是十倍是千倍

研究者編預算時最常低估的,是解析度對成本的非線性衝擊。把水平解析度提高一倍(格距減半),東西向與南北向格點數各增為兩倍,計算量先乘以四;同時受數值穩定性的 CFL 條件約束,時間步長也必須跟著減半,總計算量因此變成約八倍。照這個規律推算,把區域模式從 10 公里格距推進到 1 公里,水平格點數增加約 100 倍、時間步數再多 10 倍,整體計算量放大約 1,000 倍——這還沒計入高解析度模擬通常需要的更多垂直層數與更精細的物理方案。

更現實的是,實務上很少只跑一次。颱風路徑與定量降雨預報講究不確定性量化,主流做法是集合預報:用擾動過的初始場把同一段預報跑 20 到 50 個成員,成本直接乘上成員數;再加上每個循環都要做資料同化,一輪完整的高解析度預報作業,算力需求可以是單次確定性預報的數十倍。台灣的地形讓這道題更難迴避:中央山脈對降雨的增幅效應,要到 2 到 3 公里以下的格距才捕捉得像樣,想把梅雨鋒面與颱風外圍環流的雨量算準,高解析度幾乎是必選項。這就是為什麼「把格距推進到 1 公里」在計畫書上只是一行字,落到機房裡卻是一整排機櫃。

還有一筆常被漏算的帳:資料量。格距細十倍,單一時間步的輸出就大上百倍,一場 20 個成員、一週長度的高解析度集合實驗,產出數十 TB 資料並不罕見,儲存、搬運與後處理的時間會反過來吃掉研究人力。評估算力方案時,把儲存空間與網路頻寬一併問清楚,和問 GPU 型號一樣重要。

AI 天氣模型:數十秒算完全球十天預報的新物種

2022 年之後,棋局出現戲劇性變化。DeepMind 的 GraphCast 以圖神經網路,在全球 0.25 度解析度上把十天預報的多數指標推到與頂尖數值模式相當;華為的 Pangu-Weather 採用三維 Transformer 架構;NVIDIA 的 FourCastNet 走傅立葉神經算子路線;後續發表的 GenCast 更以擴散模型直接產生機率式的集合預報。它們的共同點是:用數十年的再分析資料在大型 GPU 叢集上完成訓練,之後推論只需一張 GPU、數十秒到數分鐘,就能產出一份全球十天預報,比傳統數值模式快上數千倍,耗電量更是天壤之別。

但快不等於取代。AI 天氣模型目前的定位是與傳統模式互補:初始場仍仰賴傳統資料同化系統提供;0.25 度(約 25 公里)的解析度,對颱風內部結構、台灣地形降雨這類細尺度現象力有未逮;極端事件的強度也常被平滑低估。不過各大氣象中心並未把它當成玩具:歐美業務單位已將 AI 模型納入平行測試,與數值模式一起出圖比對,而它的速度優勢讓集合成員數有機會放大一個量級,對颱風這類高不確定性系統特別有價值。對研究單位的實務意義反而在門檻:訓練要大叢集,微調與推論的硬體需求卻不高,主流模型多已開源釋出權重,一位熟悉深度學習框架的研究生,通常一到兩週就能在單卡環境把推論流程建起來,與自家 WRF 結果互相對照,是投資報酬率極高的研究題目。

比較面向 傳統數值模式(WRF、ICON、NEMO) AI 天氣模型(GraphCast、Pangu-Weather)
運算精度需求 動力核心需 FP64 或混合精度,數值穩定性優先 訓練用 BF16 或 FP16,推論精度要求寬鬆
硬體主力 CPU 叢集加 MPI,正逐步導入 GPU GPU 原生:訓練需叢集,推論單卡可行
產出全球十天預報 數千 CPU 核心跑約 1 到 2 小時 單張 GPU 數十秒到數分鐘
有效解析度 全球約 9 到 25 公里,區域可細至 1 到 3 公里 多為 0.25 度,約 25 公里
成熟度與角色 逾半世紀業務驗證,物理過程可解釋 2022 年後快速演進,目前與數值模式互補

台灣的颱風季難題:一所大學實驗室的算力帳本

對台灣而言,這一切都不抽象。中央氣象署要在颱風逼近時滾動更新路徑與定量降雨預報,水利單位要評估淹水風險,海洋研究與離岸風電團隊盯著風場、波浪與海流,學研單位則承接大量相關計畫。這股需求還在擴大:西部海域的離岸風場一座接一座併網,風能預測直接影響電力調度;航運、海洋工程與海域遊憩安全,也都仰賴波浪與海流的即時預報。對學研團隊而言,承接這些計畫的第一道門檻往往不是方法,而是算力從哪裡來。共同的痛點是需求高度季節性:颱風季約從 7 月延續到 10 月,期間要跑高解析度區域模式加集合預報,算力需求是平時的數倍到十倍;偏偏國內共用的高速計算資源在尖峰期人人搶,排程未必等得到;自建叢集則意味著其餘八個月機器大半閒置,還得以台灣工業電價每度約 NT$3 到 4 元(夏季更貴)的價格,替閒置的機器持續付電費與冷卻費。

以一所國立大學的海洋大氣實驗室為例。團隊在颱風季要以 2 公里格距的 WRF 搭配 ROMS 海流耦合,執行 20 個成員的集合預報,估算需要 8 張 H100 等級 GPU 連續運轉四個月;平時只需 2 張卡做程式開發、個案重跑與研究生訓練。若走自建:一台 8 卡 H100 伺服器含儲存、網路與機房整備約 NT$1,200 萬,以五年攤提每年 240 萬,加上滿載近 10 kW 的電費與冷卻年估 20 到 30 萬,再算入兼任的管理人力,年化成本逼近 300 萬;而且資本門採購要走招標、議價與財產列管,從經費核定到設備上線往往超過半年,趕不上下一個颱風季。

改採租用的算盤是:颱風季四個月租 8 張 H100 等級 GPU,其餘月份僅保留 2 張 RTX 等級卡供開發,全年支出估約 NT$150 到 200 萬,較自建的年化成本省下三到五成;經費走業務費科目,核銷單純,季末退租後不必替閒置機器付一毛電費。更關鍵的是彈性:若某一年颱風特別活躍,臨時追加 2 張卡是幾天內能解決的事,而不是下一個年度預算週期的事。這種「平時精簡、尖峰擴充」的節奏,正是租用模式相對自建最大的結構性優勢。

氣象海洋數值模擬的 GPU 加速:研究單位的算力租用指南
▲ 研究單位的算力租用路線

找台灣在地的 GPU 主機夥伴

氣象海洋運算的專案節奏天生適合彈性租用,前提是供應商要能在你需要時立刻調度出卡,機房又離資料與團隊夠近。戰國策 GPU 主機提供 NVIDIA H100 與 RTX 系列多種規格,主機放在台灣機房,資料不出境、延遲低,月租 NT$15,000 元起,並提供 7×24 中文技術支援,颱風季前擴充、季後縮編都能快速完成。研究團隊可以先從單卡開始,驗證模式移植與 AI 天氣模型推論,再逐步擴大到多卡集合預報。詳情請見官網 https://www.nss.com.tw/gpu,或加 LINE 帳號 @119m 諮詢,免費專線 0800-003-191。

常見問題 FAQ

氣象海洋數值模式一定要用 FP64 雙精度嗎?

動力核心大多需要 FP64 或經嚴謹驗證的混合精度,因為長時間積分會累積捨入誤差,嚴重時模式會直接發散。這代表選卡要先看 FP64 算力:H100 約 34 TFLOPS,消費級 RTX 4090 僅約 1.3 TFLOPS,相差超過 20 倍,跑動力核心應優先選擇資料中心級 GPU,消費卡則留給後處理與 AI 實驗。

WRF 現在可以直接用 GPU 跑嗎?

官方主線版本仍以 CPU 叢集加 MPI 為主,但雲微物理等計算密集模組已有 GPU 加速實作,市面上也有整套移植的第三方 GPU 版本。建議先租 1 到 2 張卡,用自己的網域設定實際測試加速比與相容性,一般 2 到 4 週可完成初步評估,再決定是否把整條作業流程搬上 GPU。

解析度從 10 公里提高到 1 公里,算力需求會增加多少?

粗估約 1,000 倍。水平格距縮小 10 倍,格點數增加約 100 倍;受 CFL 數值穩定性條件限制,時間步長也要縮短約 10 倍,兩者相乘就是千倍等級,而且還沒計入更多垂直層數與更精細物理方案的額外開銷。這是高解析度模擬幾乎都得仰賴大規模平行運算或多卡 GPU 的根本原因。

AI 天氣模型會取代傳統數值天氣預報嗎?

短期內是互補而非取代。GraphCast、Pangu-Weather 等模型推論只需數十秒到數分鐘,比數值模式快數千倍,但解析度多停留在 0.25 度(約 25 公里),初始場仍依賴傳統資料同化,颱風強度等極端值也常被低估。目前主要氣象中心的做法是兩者並行,互相校驗與補位。

跑 GraphCast 或 Pangu-Weather 推論需要什麼等級的 GPU?

門檻比想像低,一張 24 GB 以上記憶體的高階 GPU 通常就能執行全球推論,數十秒到數分鐘產出十天預報;需要微調或重新訓練時才用得到多卡叢集。研究單位可以先租 1 張卡把流程跑通,每月成本數萬元以內,相較於架設傳統數值模式所需的叢集,是非常低的入門投資。

研究單位租 GPU 跑氣象海洋運算,每月費用大概多少?

依卡種與規模而定:RTX 系列單卡月租約 NT$15,000 起,適合模式開發、後處理與 AI 模型推論;H100 等級單卡每月數萬元起。以颱風季租 8 張高階卡連跑 4 個月的集合預報估算,總預算約百餘萬元,通常比自建同級叢集的年化成本低三到五成,且不必負擔電費與維運。

集合預報為什麼特別花錢?有沒有省錢的做法?

因為要用擾動過的初始場把同一段預報重複跑 20 到 50 個成員,成本直接乘上成員數。務實的省錢做法包括:平時只維持小規模開發環境、尖峰期再擴充租卡;先用較粗解析度篩選重點情境;或用 AI 天氣模型快速產生大量集合成員,再用數值模式細算關鍵個案,整體可省下五成以上算力。

資料同化為什麼這麼吃算力?

資料同化要把衛星、雷達、浮標等海量觀測與模式背景場融合成最佳初始條件,本質是大型最佳化問題。4DVar 需在同化窗內反覆執行正向與伴隨模式,計算量常達單次預報的 3 到 10 倍;集合式方法則要同時維護數十個成員。不少業務單位花在同化的算力,比預報本身還多。

研究單位該自建 GPU 叢集還是租用?

關鍵看使用率與經費科目。若全年平均使用率能穩定超過六到七成,自建的長期單位成本較低;若像颱風季那樣一年只有 3 到 4 個月尖峰,租用通常省三到五成,還能走業務費核銷,避開資本門招標與財產列管流程,對執行期 1 到 3 年的計畫特別有利,設備汰舊風險也由供應商承擔。

ROMS、NEMO 這類海洋模式也能用 GPU 加速嗎?

海洋模式的 GPU 移植進度比大氣慢,NEMO 與 ROMS 社群的移植工作持續進行,部分模組已能受益,但尚未全面業務化。務實做法是既有海流、波浪流程續留 CPU,先把 GPU 用於後處理、資料同化實驗與 AI 代理模型;租 1 到 2 張卡、花 1 個月做小規模概念驗證,就能評估值不值得深入。

               

戰國策 AI 客服系統,可1抵5位真人客服成本!自動回覆 80% 常見問題,支援串接官網、LINE、FB、IG等主流平台。24小時秒回不漏單!立即免費試用

邀請你免費加入我們的LINE社群 : 【戰國策戰勝學院】,和一群真正想搞懂商業、提升營收的老闆一起成長!