CAE 工程模擬 GPU 選型指南:CST、HFSS、FDTD、FEM 要多少 FP64 與 VRAM 一次講清楚
365天全年無休服務專線 0800-003-191

CAE 工程模擬要什麼 GPU?CST、HFSS、FDTD、FEM 的算力需求完整指南

💡 快速答案:CAE 電磁模擬用 CST、HFSS 該選什麼 GPU?

看你跑哪一類求解器:HFSS 這類頻域有限元素法吃雙精度與大記憶體,建議選 A100、H100 等 80 GB 資料中心卡;CST 時域與 FDTD 以單精度為主、吃平行度,48 GB 的 RTX 6000 Ada 專業卡就很划算。消費級電競卡雙精度被閹割到三十二分之一以下、又沒有 ECC,不適合長時間高精度求解;大型電磁模型常需要 48 至 80 GB 顯示記憶體,預算有限的團隊可評估台灣在地月租 NT$15,000 元起的 GPU 主機,先租後買降低決策風險。

去年秋天,一位新竹網通廠的研發副理拿著採購單來找我:團隊要導入毫米波天線模擬,IT 部門建議買四張旗艦電競卡,一張不到七萬元,規格表上的浮點效能數字漂亮得很。我只問了一句:你們跑的是 HFSS 的頻域直接法求解器,還是 CST 的時域求解器?他愣住了。這一題答不出來,採購單就不該送出去。CAE 工程模擬的 GPU 選型,和 AI 訓練、遊戲繪圖是三套完全不同的邏輯:精度、記憶體、平行度的優先順序全都不一樣。同樣一筆預算,配對了是研發加速器,配錯了就是一台昂貴的暖氣。本文把 CST、HFSS、FDTD、FEM 這幾個關鍵字背後的算力需求一次拆開,給研發主管與模擬工程師一份可以直接對照採購或租用決策的指南。

電磁模擬為什麼是最挑硬體的 CAE 工作負載

CAE(電腦輔助工程)是一把大傘,底下有結構力學、計算流體力學、電磁場模擬等分支,其中對硬體最挑剔的,往往是電磁場求解。CST Studio Suite 與 Ansys HFSS 這兩套業界主流的電磁場求解器,要在三維空間裡把麥克斯韋方程組解到工程可信的精度:網格動輒數百萬、未知數上千萬,S 參數要收斂到負六十 dB 的動態範圍,對浮點精度與記憶體的要求,遠比多數人想像的嚴苛。

技術路線上,HFSS 以頻域有限元素法(FEM)為主,一次解一個頻率點,把整個結構的場分布透過大型矩陣一口氣解出來;CST 則同時提供時域與頻域求解器,其時域求解器採用有限積分技術(FIT),行為與 FDTD(時域有限差分法)同屬一族,靠時間步推進讓電磁波在網格裡傳播。FDTD 這條路線除了天線設計,也大量用於光電元件與高速電路的訊號完整性(SI/PI)分析。兩條路線的數學性格不同,吃硬體的方式也完全不同,這正是選 GPU 之前必須先弄清楚的第一件事。若你對 GPU 與 CPU 的架構差異還不熟,建議先讀GPU 與 CPU 差異解析,再回來看本文的選型邏輯會更有感。

還有一個要先建立的觀念:GPU 並不是把整套模擬流程都搬走。建模、佈網格、自適應網格加密這些前處理步驟,仍以 CPU 與系統記憶體為主,GPU 加速的是最耗時的求解階段;所以一台合格的模擬主機,除了對的 GPU,還要有足夠的 CPU 核心數與 256 GB 以上的系統記憶體,三者缺一,瓶頸就會轉移到最弱的那一環,這也是很多團隊換了卡卻沒變快的原因。

CAE 工程模擬要什麼 GPU?CST、HFSS、FDTD、FEM 的算力需求完整指南
▲ HFSS 頻域吃雙精度大記憶體;CST/FDTD 單精度吃平行度

CST、HFSS、FDTD、FEM:四個名詞一次講清楚

FEM(有限元素法)把連續的結構切成數百萬個四面體元素,在每個元素上用多項式逼近場的變化,最後組裝成一個巨大的稀疏矩陣方程。頻域 FEM 求解器(HFSS 是代表)常用直接法分解矩陣:好處是對高 Q 值的共振結構,像濾波器、腔體、封裝內的諧振,收斂又快又穩;代價是矩陣分解過程會產生大量填充元素,記憶體用量隨問題規模暴衝,一個數百萬未知數的模型,直接法可能吃掉數百 GB 記憶體。一句話記住它的胃口:直接法矩陣求解吃記憶體。

FDTD(時域有限差分法)走完全不同的路:把空間切成規則的 Yee 網格,電場與磁場交錯排列,按時間步一格一格往前推。每個網格點的更新只依賴鄰居,天生就是平行運算的完美形狀,數千個 GPU 核心可以同時各算各的,互不等待。一句話記住它:時域法吃平行度。這也是為什麼 FDTD 與 CST 時域求解器是 GPU 加速最成熟、成效最顯著的一群:寬頻天線、EMC 電磁相容、光波導、超穎介面、高速板級 SI/PI,都是它們的主場。

把名詞對回產品就清楚了:HFSS 是頻域 FEM 的代表;CST 一套軟體裡同時有時域(FIT,行為類 FDTD)與頻域(FEM)求解器,工程師依結構特性切換;光電領域常見的獨立 FDTD 工具,則幾乎是為 GPU 而生。還有一個常被忽略的變數:網格收斂。工程上為了確認結果可信,通常要把網格加密再算一次、比對 S 參數變化是否夠小,這代表同一個案子至少要跑數輪、每輪規模更大;硬體如果只剛好塞得下第一輪,收斂測試就會把你逼到牆角,規劃記憶體時建議直接抓 1.5 至 2 倍的餘裕。

FP64 與 VRAM:兩個決定成敗、行銷卻最少講的規格

顯卡行銷喜歡講 FP32 單精度與 AI 算力,但高精度 CAE 的世界裡,真正的關鍵是 FP64 雙精度浮點。頻域 FEM 的矩陣分解對數值誤差極度敏感,誤差會在數千萬次浮點運算中累積放大,FP32 大約七位的十進位有效位數常常不夠用,輕則收斂變慢,重則解出一個看起來合理、其實錯掉的場分布。這是消費級顯卡的第一個陷阱:GeForce RTX 系列的 FP64 吞吐是被刻意閹割的,通常只有 FP32 的三十二分之一到六十四分之一;一張 FP32 帳面 80 TFLOPS 的旗艦電競卡,FP64 可能只剩一點多 TFLOPS,跑雙精度矩陣求解時,昂貴的核心多數時間在旁邊看戲。

第二個陷阱是記憶體。消費卡 VRAM 普遍只有 16 至 24 GB,而且沒有 ECC 錯誤更正機制;一場跑 48 小時的求解,宇宙射線造成的單一位元翻轉,就可能讓結果悄悄偏掉,而你不會收到任何警告。大型電磁模型,像毫米波陣列天線、整機 EMC、先進封裝的 SI/PI,需要 48 GB 到 80 GB VRAM 是常態;裝不下的時候只有兩條路:把模型切分,增加工程負擔與收斂風險;或退回 CPU 搭配大容量系統 RAM 硬解,速度可能慢上一個量級。

容量之外,頻寬同樣是勝負手。稀疏矩陣運算與 FDTD 的網格更新,都屬於記憶體頻寬受限的工作:每做一次乘加,就要從記憶體搬進搬出好幾筆資料,核心再多,資料餵不進來也只能空轉。資料中心卡配的 HBM 高頻寬記憶體可達每秒 2 至 3 TB,消費卡的 GDDR 多在每秒 1 TB 上下甚至更低;同一套求解器在兩者上的實際表現差距,常常比帳面算力的差距更大,這一點在規格表上看不到,只有跑過的人知道。

答案因此很清楚:高精度電磁求解應該用資料中心級或專業卡。NVIDIA A100 的 FP64 約 9.7 TFLOPS,透過 Tensor Core 可達 19.5 TFLOPS;H100 依版本約 26 至 34 TFLOPS,兩者都配 80 GB HBM 高頻寬記憶體與 ECC,是頻域 FEM 直接法的正解。RTX 6000 Ada 這類專業卡的 FP64 一樣偏弱,但 48 GB ECC VRAM 加上強悍的 FP32,對吃平行度、以單精度為主的時域 FDTD 工作負載非常划算。也要替預算把關:並非所有 CAE 都吃 FP64,顯式動力學、多數 CFD 生產流程、AI 代理模型用 FP32 或混合精度就能跑出可用結果。一個好記的比喻:FP64 像手術刀,FP32 像菜刀;切菜用手術刀是浪費,開刀用菜刀是災難。把工作負載分類清楚,才不會為用不到的精度多付一倍的錢。

對照表:四類求解器的精度、記憶體與建議卡型

下表把常見電磁與 CAE 工作負載的硬體需求整理成一頁,建議直接拿著你手上的專案清單來對照:

求解器與方法 典型應用 精度需求 VRAM 建議 建議卡型
HFSS(頻域 FEM) 高 Q 濾波器、毫米波天線、IC 封裝 FP64 為主 48 至 80 GB,特大模型另需數百 GB 系統 RAM A100 80GB、H100
CST 時域求解器(FIT,類 FDTD) 寬頻天線、EMC、板級 SI/PI FP32 為主,關鍵驗證用 FP64 24 至 48 GB RTX 6000 Ada 48GB、A100
獨立 FDTD(光電、光子) 光波導、超穎介面、影像感測 FP32 或混合精度 16 至 48 GB RTX 6000 Ada、A100
結構隱式 FEM 靜力、模態、諧響應 FP64 為主 32 至 80 GB A100、H100
顯式動力學、CFD、AI 代理模型 碰撞、流場、快速設計迭代 FP32 或混合精度 16 至 48 GB RTX 6000 Ada,入門可用消費卡但無 ECC

兩個閱讀提醒:第一,表中 VRAM 是單卡建議值,多卡切分雖可分攤,但跨卡通訊會吃掉部分效率;第二,CST 與 HFSS 的授權費用往往比硬體更貴,一套年費數十萬到數百萬元的求解器,卡在一張不對的 GPU 上,等於讓最貴的資產閒置。此外,專業卡與資料中心卡還有一層價值:通過主要 CAE 軟體商的 ISV 認證,驅動穩定性經過驗證,出問題時原廠支援也認帳,對生產環境是實實在在的保險。

台灣的現實:射頻含量越來越高,算力門檻也越來越高

台灣的產業結構讓電磁模擬需求特別旺:半導體先進封裝要看 SI/PI 與電源完整性,網通與手機供應鏈要做 5G 毫米波與 WiFi 7 天線,車用雷達進入 77 GHz 世代,連伺服器與電動車的機構件都要做 EMC 預模擬。需求端火熱,供給端卻很殘酷:一張 H100 80GB 市價常在新台幣百萬元上下,A100 80GB 也要數十萬元,加上伺服器平台、UPS 與機房空調,一套像樣的模擬主機輕鬆突破兩百萬元。營運成本同樣不能忽視:台灣工業電價每度約 NT$3 至 4 元、夏季更貴,一台滿載的多 GPU 伺服器連同空調,全年電費可能接近十萬元;再算上維運人力與三年折舊,中小型團隊很難只用「買」來解這一題。學研端也一樣:國家級超算資源要排隊,尖峰期一排就是數天,不少實驗室乾脆把計畫經費轉向租用,租期對齊專案,錢花在刀口上。

舉一個輔導過的實例(細節經過改寫):新竹一家網通公司的八人 RF 團隊,要為 28 GHz 毫米波模組做封裝天線設計,HFSS 模型未知數約兩千萬,原本 64 核心、512 GB RAM 的 CPU 工作站單次掃頻要 11 個小時,一天只能迭代一次,時程眼看要爆。他們評估自購雙 A100 伺服器,含平台報價約 NT$180 萬,機房空調還要追加數十萬元;最後改租台灣在地的 GPU 主機,六個月專案期總支出不到 NT$40 萬,同一個模型的求解時間壓到 2 至 3 小時,一天能跑三輪參數迭代,天線增益規格提前三週收斂。研發主管事後說了一句很傳神的話:我們買的不是卡,是迭代次數。這樣的劇本,在台灣的網通、車用電子與封測聚落裡,每一季都在重演。

自購還是租用?給研發主管的三個判斷點

這一題沒有標準答案,但有標準算法。建議把下面三個指標攤在桌上逐一檢視:

  • 稼動率:模擬負載全年平均跑不到五成,自購的折舊與維運就攤不平;專案型、峰值型的需求,租用幾乎必然便宜。
  • 記憶體天花板:今天 24 GB 夠用,下一代產品上到毫米波或更大陣列時,模型規模往往一口氣翻倍;租用讓你隨專案換到 48 GB、80 GB 的卡,不必賭三年後的規格。
  • 人與時間:自購要處理驅動、韌體、散熱、備援與資安,這些隱形成本常被低估;把機房的事交給機房,工程師的時間留給模型本身。

另一個常見的折衷是混合配置:平日的網格收斂測試與小型參數掃描,放在自有的一張 48 GB 專業卡上;專案衝刺期再租用 80 GB 級的機型放大火力,尖峰一過就退租,現金流壓力小很多,也不會在三年後留下一批過時的資產。

把三年總持有成本(硬體、電費、機房、人力)攤開與租金對比,多數二十人以下的研發團隊會發現租用更划算,而且風險低得多。想把 HPC 叢集、排程與平行運算的基礎一次補齊,可以延伸閱讀HPC 高效能運算入門指南;想直接看台灣在地可租用的機型與規格,可參考戰國策 GPU 主機方案,對照上面的表格,挑出適合你求解器的卡型與記憶體等級。

CAE 工程模擬要什麼 GPU?CST、HFSS、FDTD、FEM 的算力需求完整指南
▲ 照求解器類型對號選卡

找台灣在地的 GPU 主機夥伴

如果你的團隊正在為 CST、HFSS 或 FDTD 工作負載尋找算力,又不想一次背下數百萬元的採購與機房投資,戰國策 GPU 主機是務實的起點:提供 NVIDIA H100 與 RTX 系列多種機型,主機放在台灣機房,低延遲、資料不出境,月租 NT$15,000 元起,搭配 7×24 中文技術支援,從驅動環境、求解器相容性到多卡配置,都有工程師陪你處理。歡迎到官網 https://www.nss.com.tw/gpu 查看機型與價格,或加 LINE 帳號 @119m 聊聊你的模型規模與精度需求,免費專線 0800-003-191 隨時為你服務。

常見問題 FAQ

跑 HFSS 一定要用 FP64 很強的 GPU 嗎?

建議是。頻域有限元素法的直接法矩陣求解對數值誤差極敏感,雙精度是業界常規,適合 A100(FP64 約 9.7 TFLOPS)或 H100 這類資料中心卡。消費卡雙精度只有單精度的三十二分之一到六十四分之一,長時間高精度求解既慢又有風險;小模型可先用 CPU 驗證,再決定算力等級。

RTX 4090 這類電競卡能拿來跑 CST 嗎?

跑 CST 時域求解器技術上可行,因為它以單精度為主,加速也有感;但 24 GB 記憶體上限與缺少 ECC 是硬傷,模型一大就裝不下,連續跑 48 小時以上也有位元翻轉風險。正式生產環境建議至少用 48 GB 的專業卡,例如 RTX 6000 Ada,穩定性差很多。

電磁模擬到底需要多少 VRAM 才夠?

中小型天線或濾波器模型,16 至 24 GB 可以起步;毫米波陣列、整機 EMC、先進封裝這類大型模型,常態需要 48 至 80 GB。記憶體不足時只能切分模型或退回 CPU 加大系統記憶體,後者速度可能慢 5 至 10 倍,時程緊的專案不建議走這條路。

A100 與 H100 該怎麼選?

兩者都配 80 GB 高頻寬記憶體與 ECC。A100 雙精度約 9.7 TFLOPS,H100 依版本約 26 至 34 TFLOPS,記憶體頻寬也從約 2 TB/s 提升到 3 TB/s 以上。模型大、每天都要跑、預算充足就選 H100;A100 價格較低,對多數頻域有限元素法專案已相當夠用;預算有限又非雙精度不可,先選 A100 是穩健的起手式。

顯示記憶體裝不下模型時有哪些解法?

常見三條路:利用對稱性或切分模型,常可省下三成到五成記憶體;改用迭代法求解器,用收斂穩健性換空間;或退回 CPU 搭配 512 GB 以上系統記憶體硬解,最穩但可能慢一個量級。長期而言,升級到 80 GB 級的卡或租用大記憶體機型才是正解。

GPU 加速電磁模擬實際能快多少?

取決於求解器類型。時域 FDTD 與 FIT 平行度高,單卡對單顆 CPU 常見 10 至 30 倍加速;頻域有限元素法的矩陣求解保守許多,常見 2 至 8 倍,且受記憶體頻寬影響大。最準的做法是拿自家代表性模型實測,再決定買或租哪一個等級。

自購一台能跑大型電磁模型的 GPU 伺服器要多少錢?

雙 A100 80GB 伺服器含平台,常見報價落在 NT$150 萬至 250 萬,H100 機型更高;還要加機房空調、UPS 與維運人力,以及台灣工業電價每度約 NT$3 至 4 元的長期電費。三年總持有成本常是採購價的 1.3 至 1.5 倍;多數團隊把總帳攤開之後,才回頭認真評估租用方案。

租用 GPU 主機的費用大概是什麼等級?

台灣在地方案入門月租約 NT$15,000 元起,H100 等級依規格與租期另議。以六個月專案估算,租用總支出常僅為自購方案的兩成到四成,而且不必扛折舊、機房與維運;稼動率低於五成、或需求集中在特定專案期的團隊,租用通常更划算。

ECC 記憶體對 CAE 模擬真的重要嗎?

重要。一場 48 至 72 小時的長時間求解,單一位元翻轉就可能讓結果悄悄偏掉而不報錯,ECC 能偵測並更正單位元錯誤,把風險降到接近零。這是專業卡與消費卡的關鍵差異之一;對授權年費動輒數十萬元的商用求解器,沒道理在這層保險上省錢。

所有 CAE 都需要 FP64 雙精度嗎?

不是。顯式動力學、多數 CFD 生產流程與 AI 代理模型,用單精度或混合精度即可,速度常快 2 倍以上;真正離不開雙精度的是頻域有限元素法這類直接法矩陣求解與高 Q 共振結構。先把工作負載分類,再決定精度等級,往往能省下一半以上的硬體預算。

               

戰國策 AI 客服系統,可1抵5位真人客服成本!自動回覆 80% 常見問題,支援串接官網、LINE、FB、IG等主流平台。24小時秒回不漏單!立即免費試用

邀請你免費加入我們的LINE社群 : 【戰國策戰勝學院】,和一群真正想搞懂商業、提升營收的老闆一起成長!