💡 快速答案:HPC 高效能運算是什麼?和一般電腦運算有什麼不同?
HPC 高效能運算是用超級電腦或運算叢集,把單一大問題拆成大量小塊,交給成千上萬個處理器核心同時計算的技術,效能以 FLOPS(每秒浮點運算次數)衡量:一般桌機約數 TFLOPS,頂級超級電腦已達每秒 10 的 18 次方次的 ExaFLOPS 等級。它適合氣象模擬、分子動力學、CAE 工程模擬與 AI 訓練等可平行化的題目,常見作法是用 GPU 叢集搭配 InfiniBand 高速互連,把數週的運算壓縮到數天甚至數小時。
想像一個場景:一位氣象研究員要模擬颱風登陸前七十二小時的路徑,網格細到一公里一格,變數涵蓋風速、氣壓、濕度與海溫。這種題目丟給再頂級的個人電腦,等算出結果,颱風早就離境了。HPC 高效能運算(High-Performance Computing)要解的,正是這種「單機一輩子也算不完」的問題:把大問題拆成成千上萬個小塊,交給超級電腦或運算叢集裡的大量處理器同時計算,讓以月計的等待縮短成以天、以小時計。這篇文章用研究人員與 IT 決策者都能消化的語言,講清楚 HPC 的核心概念、GPU 加速的原理、叢集互連與精度的門道,並回到台灣的學研現場:當國網中心的資源排不上隊,你還有哪些務實的選擇。
HPC 高效能運算是什麼?千人搬磚的藝術
HPC 高效能運算的本質,講白了就是「平行化」三個字。一道題目如果只能一步接著一步算,處理器再快都有物理極限;但多數科學與工程問題其實拆得開——大氣可以切成上百萬個網格、分子系統可以拆成數億個粒子、一批影像可以分給不同核心各自處理——拆開之後,就能讓幾千、幾萬個運算核心各自認領一小塊,同時開工。超級電腦並不是一顆神奇的巨無霸 CPU,而是成百上千台「節點」組成的叢集:每個節點有自己的處理器與記憶體,靠高速網路彼此交換資料,像一支分工精密的工程部隊。之所以走向這條路,是因為過去二十年單核心時脈成長趨緩、散熱撞上物理牆,整個產業只好轉向多核心與平行化,而 HPC 正是這條路線的極致展現。
用搬磚來比喻:要搬走一座磚山,一個工人得搬上一年,一千個工人理論上幾天內完工——前提是磚可以分裝、工人不必一直停下來開會對進度。HPC 的學問幾乎都圍繞這兩件事:怎麼把題目拆得漂亮(演算法與平行化),以及怎麼讓工人之間的溝通夠快(互連與同步)。典型應用包括氣候與氣象模擬、分子動力學與藥物開發、結構與流體等 CAE 工程模擬、金融風險運算,以及近年最熱的 AI 模型訓練。如果你的題目屬於工程模擬這一支,建議搭配閱讀同系列的CAE 工程模擬 GPU 選擇指南,那一篇對求解器與顯卡的對應關係有更細的拆解。

效能怎麼量?從 TFLOPS 到 ExaFLOPS 的量級之旅
HPC 世界衡量效能的標準單位是 FLOPS,也就是每秒浮點運算次數,一次浮點運算大致等於一次帶小數點的乘法或加法。你桌上那台工作站,CPU 加一張中高階顯示卡,大約落在數 TFLOPS 的量級,即每秒數兆次;而目前全球排名最前面的超級電腦,已經跨過 ExaFLOPS 門檻,也就是每秒 10 的 18 次方次浮點運算,是桌機的數十萬倍以上。數字大到失去直覺時,不妨換算成人力:讓全台灣兩千三百萬人每人每秒做一次乘法、不眠不休,得算超過一千年,才抵得上 ExaFLOPS 等級機器一秒鐘的工作量。
下表整理常見的效能量級,方便你看規格表時快速對位:
| 單位 | 每秒運算次數 | 常見載體 | 直觀感受 |
|---|---|---|---|
| GFLOPS | 10 的 9 次方 | 手機、嵌入式裝置 | 應付日常影音與輕量運算 |
| TFLOPS | 10 的 12 次方 | 桌上型電腦、單張消費級 GPU | 個人研究與開發的主力區間 |
| PFLOPS | 10 的 15 次方 | 企業級 GPU 叢集、國家級超算 | 數百到數千張 GPU 協同作戰 |
| EFLOPS | 10 的 18 次方 | 全球前幾名的超級電腦 | 全人類手算上千年的一秒工作量 |
一個重要提醒:同一台機器用不同精度測出來的 FLOPS 可以差好幾倍,規格表上的漂亮數字,得先確認標的是 FP64 還是 FP16,這個門道我們後面細講。
GPU 為什麼快?數千核心的資料平行
早年的超級電腦靠 CPU 堆疊,現代 HPC 的加速主角則是 GPU,兩者的設計哲學南轅北轍。CPU 是「少量而聰明的核心」:數十個核心,每個都擅長複雜邏輯、分支預測與亂序執行,像一群資深工程師,什麼疑難雜症都能處理。GPU 則是「海量而單純的核心」:一張現代 NVIDIA 資料中心級 GPU 上有數千到上萬個 CUDA 核心,採用 SIMT(單指令多執行緒)的資料平行架構——同一道指令,同一個節拍,套用在成千上萬筆不同的資料上,像一支口令一致的千人儀隊。
這種架構天生適合「規則而大量」的運算:AI 訓練的核心是矩陣乘法,結構與流體模擬的骨架是網格,分子動力學處理的是數億個粒子。這些題目的共同點,是每筆資料要做的事幾乎相同、彼此依賴不深,正好整批餵進 GPU 的數千個核心。此外,資料中心級 GPU 還搭載 HBM 高頻寬記憶體,餵資料的速度是一般伺服器記憶體的數倍,對頻寬飢渴的模擬題目尤其關鍵。反過來說,充滿條件分支、資料彼此糾纏的循序程式,GPU 就幫不上忙。一條實用的經驗法則:能改寫成大矩陣、大網格、大批粒子的題目,GPU 加速常見 5 到 50 倍;拆不開的循序邏輯,乖乖留給 CPU 處理。
一張卡不夠用,幾百張卡怎麼串?
當單卡的記憶體或算力不夠,就得多卡、多節點,這時瓶頸會從「算」轉移到「傳」。節點內部,多張 GPU 之間靠 NVLink 高速直連,或用 NVSwitch 把八張卡織成全互連網路,頻寬遠高於傳統 PCIe,GPU 彼此交換資料不必繞道 CPU。節點與節點之間,主流互連是 InfiniBand:頻寬可達數百 Gb/s、延遲低到微秒等級,還支援遠端直接記憶體存取(RDMA),資料可以不驚動對方的 CPU,直接寫進對方的記憶體。
互連為什麼是命脈?因為平行運算免不了「開會」。氣象模擬裡,每個節點負責一塊天空,但每個時間步都要和鄰居交換邊界資料;AI 分散式訓練裡,每一步所有 GPU 都要同步梯度。溝通一慢,幾百張卡就集體罰站等資料。同一批 GPU,用一般乙太網路串接與用 InfiniBand 串接,實測擴展效率可能差出三成以上——這也是入門團隊最常低估的一筆預算。
精度分工與加卡的極限:認識 Amdahl 定律
浮點數有不同的精度等級。FP64(雙精度)用 64 位元表示一個數,是科學計算的黃金標準:結構分析、氣候模擬、計算化學這類題目,誤差會隨時間步不斷累積,必須靠 FP64 保住數值穩定。AI 訓練則發現神經網路對精度寬容得多,於是 FP16、BF16、TF32 乃至 FP8 陸續登場:位元數砍半再砍半,同一張卡的吞吐量翻倍再翻倍。同一張 H100,FP64 與 FP8 的帳面效能可以差出數十倍——選卡之前,先弄清楚自己的軟體吃哪種精度,方向錯了,預算就白花了。
軟體端的地圖也不複雜:直接駕馭 GPU 的主流語言是 NVIDIA 的 CUDA;不想大改程式,可以用 OpenACC 或 OpenMP 以編譯器指示詞標註平行區段;跨節點的訊息傳遞則交給 MPI,這是超算世界三十多年來的通用語。多數真實專案採混搭策略:節點內用 CUDA 榨效能,跨節點用 MPI 做協調。
接著要潑一盆重要的冷水:加卡不等於等比例變快。衡量擴展性有兩把尺,strong scaling 問「題目固定,處理器加倍,時間能不能砍半」;weak scaling 問「題目與處理器一起加倍,時間能不能維持不變」。現實中兩者都會撞牆,元凶是節點間的通訊開銷,以及著名的 Amdahl 定律:只要程式有 5% 無法平行化,理論加速上限就是 20 倍,卡堆得再多也突破不了。換句話說,即使一口氣租下 100 張卡,這支程式實際只能加速約 17 倍,多付的租金等於直接蒸發。老練的團隊在擴充前,一定先做小規模的擴展測試,找出自己程式的甜蜜點,而不是直接下單一整櫃設備。
下表把 CPU 叢集與 GPU 叢集的分工整理成速查表:
| 面向 | CPU 叢集 | GPU 叢集 |
|---|---|---|
| 單節點核心數 | 數十到上百個複雜核心 | 數千到上萬個精簡核心 |
| 擅長任務 | 分支邏輯、前後處理、循序流程 | 矩陣、網格、粒子等規則大量運算 |
| 精度取向 | FP64 為主 | FP64 到 FP8 全譜,依卡型而異 |
| 互連重點 | 節點間 InfiniBand | 節點內 NVLink 或 NVSwitch,節點間 InfiniBand |
| 適用情境 | 網格生成、工作排程、部分隱式求解器 | AI 訓練、分子動力學、顯式模擬 |
台灣的學研現場:台灣杉、排隊,以及租用這條路
回到台灣。學研圈最主要的公共算力,來自國家高速網路與計算中心(國網中心 NCHC)的「台灣杉」系列超級電腦:台灣杉一號以 CPU 為主力,服務傳統 HPC 工作;台灣杉二號以 GPU 為主,撐起島內大量 AI 研究。具學研身分即可申請計算資源,費率遠低於商業雲端,是台灣研究者最重要的靠山。但公共資源沒有不排隊的:申請要提計畫、額度有上限,尖峰期(學期末、大型計畫結案前)一個工作在佇列裡等上數小時到數天並不罕見。對「模型下週要交、實驗每天要跑」的團隊來說,排隊本身就是最貴的成本。何況多數實驗室的經費結構,一年能動用的設備費常在百萬元上下,想自購一台八卡 H100 伺服器——含主機、機櫃、電力與冷卻,總建置成本輕易突破千萬元——並不現實。自建還有一筆常被低估的帳:八卡伺服器滿載功耗可達 10 kW 上下,以台灣工業電價每度約 NT$3 到 4 元、夏季更貴來估,光電費一年就數十萬元起跳,尚未計入冷卻與值班人力。
看一個有真實感的案例。南部某大學的計算化學實驗室,長期用系上共用的 CPU 叢集(約 200 個核心)跑分子動力學:一個 500 萬原子的系統,一條軌跡要跑整整七天;改投台灣杉,尖峰期光排隊就等了兩天多。後來團隊把軟體換成支援 GPU 的版本,向業者短租 4 張 H100:同樣的軌跡,一天出頭就跑完,速度接近原本的七倍。成本怎麼算?以每卡月租約 NT$50,000 到 60,000 元的行情,4 張卡一個月約 NT$200,000 到 240,000 元;團隊只在論文衝刺期租三個月,總支出約 NT$600,000 到 720,000 元,不到自建同級主機的十分之一,還省下機房、電費與三年後的折舊煩惱。環境搬遷也只花了兩天:主流分子動力學套件的 GPU 版本已相當成熟,轉換成本比多數人想像中低。指導教授事後的評語很實在:用租的,研究生的畢業時程第一次掌握在自己手上。
簡單的決策準則:偶爾要跑超大規模、時程可以等,申請國網中心最省錢;需求長期穩定、自有機房與維運人力,自購划算;需求波動大、時程緊、不想養機房,租用最有彈性。市面上像戰國策的 GPU 主機租用方案,就是為第三種情境設計的。若你的主場在校園,同系列的大專院校 AI 研究算力指南整理了學研額度申請與租用備援的完整策略,值得搭配服用。

找台灣在地的 GPU 主機夥伴
如果評估後你屬於「租用最划算」的那一群——需求會波動、不想自建機房、希望出問題時能用中文即時溝通——戰國策集團的 GPU 主機值得放進候選清單。卡型涵蓋 NVIDIA H100 與 RTX 系列,可依 FP64 科學計算或混合精度 AI 訓練的需求挑選;主機放在台灣機房,延遲低、資料不出境;月租 NT$15,000 元起,可隨專案彈性升降配置;搭配 7×24 中文技術支援,從驅動安裝、框架建置到多卡效能調校都有工程師接手。對照國網中心的排隊時間與上千萬元的自建門檻,先租後買、小步快跑,往往是研究團隊與企業 IT 最穩健的起手式。詳細方案請見官網 https://www.nss.com.tw/gpu,或加入 LINE 官方帳號 @119m,也可撥打免費專線 0800-003-191,由顧問依你的工作負載,規劃最合適的機型與配置。
常見問題 FAQ
HPC 高效能運算和一般伺服器運算有什麼不同?
核心差異在平行的規模與目的。一般伺服器服務網站、資料庫等大量彼此獨立的小請求,重點是同時服務更多使用者;HPC 則是把單一個大題目拆給成百上千個核心同時計算,重點是把一件事算得更快。例如氣象模擬可拆到 1 萬個以上的核心,靠 200 Gb/s 以上的低延遲網路交換資料,把數週的運算壓進數小時完成。
FLOPS 是什麼?TFLOPS 和 PFLOPS 差多少?
FLOPS 是每秒浮點運算次數,是衡量超級電腦與 GPU 效能的標準單位。1 TFLOPS 代表每秒 10 的 12 次方次浮點運算,1 PFLOPS 是 10 的 15 次方次,兩者相差 1,000 倍;頂級超級電腦已達 ExaFLOPS,即每秒 10 的 18 次方次。一般桌機約數 TFLOPS,超算一秒鐘的工作量,桌機得不眠不休算上十天以上。
為什麼 GPU 特別適合科學計算與 AI 訓練?
因為 GPU 有數千個 CUDA 核心,採 SIMT 資料平行架構,同一道指令可同時處理上萬筆資料,天生適合矩陣、網格、粒子這類規則且大量的運算。以矩陣乘法為主的 AI 訓練或分子動力學,GPU 常比純 CPU 快 5 到 50 倍;但邏輯分支多、難以拆解的循序程式,GPU 反而幫不上忙,仍應留在 CPU 上執行。
InfiniBand 和一般乙太網路差在哪?小型叢集需要嗎?
InfiniBand 頻寬可達 200 至 400 Gb/s、延遲低到微秒等級,並支援 RDMA,讓資料不經對方 CPU 直接寫入記憶體。單節點作業完全用不到;但跨 2 個節點以上的緊耦合模擬或多機訓練,互連太慢會讓 GPU 集體停工等資料,實測擴展效率可能掉三成以上,等於白租了好幾張卡。
FP64 和 FP16 差在哪?我的題目該選哪種精度?
FP64 以 64 位元表示一個數值,精度最高,是結構分析、氣候模擬這類誤差會累積的科學計算標準;FP16、BF16、TF32、FP8 位元數較少、吞吐量更高,適合對精度寬容的神經網路訓練。同一張卡在不同精度下的帳面效能可差數十倍,選卡前先確認軟體的精度需求,方向錯了預算就白花了。
GPU 從 4 張加到 8 張,速度會直接翻倍嗎?
通常不會。受通訊開銷與 Amdahl 定律限制,只要程式有 5% 無法平行化,理論加速上限就是 20 倍;實務上 4 卡擴到 8 卡,常只快 1.6 到 1.9 倍,取決於程式擴展性與互連品質。建議先做小規模的 strong scaling 測試,確認效益再加卡,避免付了雙倍租金只換到六成加速。
國網中心的台灣杉怎麼申請?通常要排多久?
具學研身分者可向國網中心(NCHC)申請台灣杉的計算資源,以計畫為單位核給額度,費率遠低於商業雲端。但熱門時段需要排隊:尖峰期一個工作在佇列中等上數小時到 2、3 天都有可能。時程緊的團隊常採雙軌制:大規模正式計算排台灣杉,日常開發與趕工改用租用的 GPU 主機分流。
自購 GPU 伺服器和租用,到底怎麼選?
關鍵看使用率與資金。一台 8 卡 H100 伺服器連同機電、冷卻與網路,建置成本上看千萬元,適合未來 3 年以上長期滿載的單位;租用則月租 NT$15,000 元起、高階卡另計,適合專案制、需求波動大的團隊。經驗法則:平均使用率低於五成,租用幾乎都比自購划算,還省下維運人力。
實驗室經費有限,怎麼低成本入門 HPC?
建議分三步:先用現有工作站加 1 張消費級 GPU,驗證程式能有效平行化;再申請國網中心台灣杉的學研額度,跑中型規模的測試;論文或產品衝刺期,短租 2 到 4 張資料中心級 GPU 衝刺。如此前期現金投入可壓在數萬元內,避免一開始就砸數百萬元購置設備,結果使用率不到三成。
程式目前只支援 CPU,改用 GPU 一定要重寫嗎?
不一定。GROMACS、LAMMPS 等主流套件已內建 GPU 支援,改幾個參數即可啟用;自行開發的程式可先用 OpenACC 或 OpenMP 指示詞標註熱點,常常改動不到 10% 的程式碼就能獲得數倍加速;只有要榨出極限效能時,才需要用 CUDA 重寫核心演算法,投入可以分階段進行。