💡 快速答案:SXM5 版和 PCIe 版 GPU 到底差在哪裡?
差在封裝、功耗與互連三件事。以 H100 為例:SXM5 版直接焊在 HGX 基板上,TDP 開到 700W,顯存頻寬 3,350GB/s,並透過 NVLink 與 NVSwitch 提供任兩卡 900GB/s 的全互連;PCIe 版是標準插卡,TDP 350W、頻寬約 2,000GB/s,卡間主要走 PCIe 5.0 的 128GB/s,約為 NVLink 的七分之一。單卡推論兩者體驗接近,PCIe 便宜三到五成更划算;4 卡以上的分散式訓練與張量並行,SXM 的擴展效率高出兩到三成,規模越大差距越明顯。租用前用 nccl-tests 實測互連頻寬,是最保險的驗收動作。
租 GPU 主機時,很多人盯著「H100」三個字看,卻沒注意後面跟的是 SXM5 還是 PCIe,結果同樣的預算租到的效能差了三、四成。這兩個版本用的是同一顆晶片,但封裝形式、功耗上限、以及最關鍵的卡間互連完全是兩個世界。這篇把差異拆到底,並且用分散式訓練的通訊模式,講清楚 NVLink 到底在什麼時候值錢、什麼時候是你付了錢也用不到的裝飾品。先給結論:互連規格的錢,只有在卡與卡需要頻繁交換資料的時候才花得有意義,而你的工作負載話多話少,是可以量出來的;文末附上驗證指令,照著做,十分鐘就能確認你租到的互連是不是真材實料。
封裝與供電:插卡與焊板的本質差異
PCIe 版就是大家熟悉的插卡:插進標準伺服器的 PCIe 插槽,吃插槽加外接電源的供電,H100 PCIe 的 TDP 上限是 350W,散熱靠伺服器風道解決,好處是任何規格相容的機器都能裝,部署彈性最大。SXM5 版則是一塊直接鎖在 HGX 基板上的運算模組,沒有插槽的供電與尺寸限制,TDP 直接開到 700W,搭配大面積散熱器或液冷冷板,時脈與持續輸出都比插卡版高一截。
功耗差一倍,效能自然有感:同樣是 H100,SXM5 的 FP16 算力約 990 TFLOPS(dense),PCIe 版約 756 TFLOPS,差距約三成;顯存頻寬 3,350GB/s 對 2,000GB/s,差距四成。所以就算完全不談多卡互連,SXM 版的單卡輸出就已經領先,只是這個領先要用整機租賃的價格去換。
散熱行為的差異也很實際:PCIe 插卡在標準伺服器風道裡,長時間滿載常在功耗牆與溫度牆之間擺盪,時脈會小幅波動;SXM 模組配大面積冷板或液冷,持續輸出穩定,長訓練的每一步時間幾乎不抖。跑基準測試五分鐘看不出差別,連續跑三週的訓練就會在總時程上顯現。台灣夏季機房的進風溫度普遍偏高,氣冷伺服器的降頻風險又比溫帶市場明顯一些,長訓練的團隊要把這個在地變數放進評估。
| 項目 | H100 SXM5 | H100 PCIe |
|---|---|---|
| 部署形式 | HGX 基板直焊模組 | 標準 PCIe 插卡 |
| TDP | 700W | 350W |
| FP16 算力(dense) | 約 990 TFLOPS | 約 756 TFLOPS |
| 顯存頻寬 | 3,350GB/s(HBM3) | 約 2,000GB/s(HBM2e) |
| 卡間互連 | NVLink 900GB/s、NVSwitch 全互連 | PCIe 5.0 約 128GB/s,兩卡可橋接 600GB/s |
| 台灣租金相對水位 | 貴 30% 至 50%(整機攤提) | 基準 |

NVLink 900GB/s 對 PCIe 128GB/s:7 倍差距發生在哪裡
先把數字校準。PCIe 5.0 x16 的雙向頻寬約 128GB/s;第四代 NVLink 給每張 H100 提供 900GB/s 的雙向互連頻寬,7 倍差距。更關鍵的是拓撲:HGX 平台上 4 顆 NVSwitch 讓 8 張卡形成全互連,任兩卡之間都是 900GB/s,而且不經過 CPU 與系統記憶體;PCIe 平台上多卡通訊要走 PCIe 交換器或跨 NUMA 節點,實際可用頻寬常常比帳面更低。PCIe 版可以用 NVLink 橋接器補救,但僅限兩張卡一組、600GB/s,四卡以上就無解。
這 7 倍差距不是永遠都痛。單卡推論完全用不到卡間頻寬;模型放得進單卡的訓練也幾乎無感。它痛在「卡與卡必須頻繁交換大量資料」的時刻,而這正是分散式訓練的日常。
這裡補一個常被搞混的觀念:NVLink 解決的是「GPU 對 GPU」的直達路徑,傳統 PCIe 架構下,跨卡資料常要繞經 CPU 與系統記憶體,一來一回延遲翻倍;NVSwitch 再把直達路徑升級成全互連交換網,8 張卡彼此等距。所以 SXM 平台的優勢不只頻寬數字,還有延遲與拓撲的一致性,NCCL 的集合通訊在等距拓撲上排程效率最高,這部分的收益疊在 7 倍頻寬之上。實測上,8 卡 all-reduce 的有效頻寬(busbw)在 SXM 平台可以跑到 400GB/s 以上,純 PCIe 平台常見 20 至 60GB/s,量級差距肉眼可辨。
三種並行策略,三種吃頻寬的方式
資料並行(DP)是最普遍的模式:每張卡拿完整模型副本、各跑一份資料,每個 step 結束要做梯度 all-reduce。7B 模型的梯度量約 14GB,8 卡 ring all-reduce 的有效交換量約 24GB:在 PCIe 上這輪通訊要 0.2 至 0.4 秒,NVLink 上只要 0.03 至 0.05 秒。如果每 step 的計算時間是 1 秒,通訊佔比就是「25% 對 4%」的差距,訓練越久這筆稅越重,即使框架做了計算與通訊重疊,也只能遮掉一部分。
張量並行(TP)更殘酷:單層權重被切到多張卡上,每一層的前向與反向都要做 activation 的 all-reduce,通訊頻率是每層一次而不是每 step 一次。這種模式在 PCIe 上基本不能用,效率崩到五成以下;NVLink 域內的 TP 才是可行解,這也是為什麼 70B 以上模型的訓練與高效推論幾乎都綁定 SXM 平台。管線並行(PP)最省頻寬,只在階段交界傳 activation,PCIe 平台想跑大模型,PP 加 ZeRO 是相對務實的組合,代價是氣泡時間與調校複雜度。
收斂成經驗數字:8 卡資料並行訓練,SXM 平台的擴展效率通常有 90% 至 95%,PCIe 平台依模型大小落在 65% 至 85%;帶 TP 的大模型訓練,兩者差距會再拉大。付 SXM 溢價前,先確認你的並行策略真的吃得到這個頻寬。
用 ZeRO 家族補完這張地圖:ZeRO-1 只切優化器狀態,通訊量與一般資料並行相當;ZeRO-2 加切梯度,通訊量約 1.5 倍;ZeRO-3 連權重都切,每步通訊量直接翻倍以上,對互連頻寬最敏感。很多團隊在 PCIe 平台上開 ZeRO-3 硬跑大模型,速度掉到連一半都不到,這不是框架的錯,是把高通訊策略放在低頻寬管道上的必然結果。順序應該是先估通訊量、選定並行策略,再決定租哪種平台,而不是先租了再想怎麼榨出效能;策略與硬體要成對選,單獨升級任何一邊都是浪費。
什麼時候 PCIe 版就夠:別為用不到的頻寬付錢
三種場景 PCIe 版是明確的正解。一,單卡推論與微調:模型放得進 80GB,卡間頻寬是零需求,PCIe 版租金便宜三到五成,每一塊錢都花在運算本體上。二,雙卡張量並行推論:70B FP8 模型用兩張 PCIe 卡加 NVLink 橋接(600GB/s)就能服務,推論的通訊量比訓練小一個量級,橋接頻寬綽綽有餘。三,多個獨立工作負載:四張 PCIe 卡各跑各的服務,彼此不通訊,全互連毫無用武之地,租 SXM 整機純屬浪費。
價差的絕對值也幫你算好:4 張 H100 PCIe 的月租約 NT$40 萬上下,而 8 卡 SXM 整機月租 NT$70 萬起跳,就算只用其中 4 卡的算力,攤提也要 NT$35 萬以上,還綁著你用不到的另外 4 卡。工作負載彼此獨立的公司,租 PCIe 配置一年可以省下六到七位數的租金,這筆錢拿去養半個工程師都有找。當然,如果半年後你的路線圖上會出現 34B 以上的訓練,提前選 SXM 省下的遷移成本也要放進天平,規劃期的視野比省當月租金重要。
台灣中小團隊還有一種很常見的混用型態:白天跑推論服務、夜間跑訓練或批次任務,一套硬體兩班制。這種節奏其實偏向 PCIe 陣營,因為推論本來就不吃互連,夜間訓練若是單卡放得下的模型,互連同樣閒著;把省下的租金差拿去多租一張卡,兩班制的排程還更寬鬆。要注意的只有切換紀律:推論服務要能優雅下線、訓練任務要設好資源上限,避免早上八點訓練還沒跑完、客服系統起不來的窘境。這種型態在台灣的接案公司與新創特別普遍,一套硬體的使用率能拉到七成以上,攤提下來最划算。工具面用容器加簡單的排程腳本就夠,不需要為此上一整套叢集管理系統。
判斷公式簡化成三個問題:模型是否大於單卡顯存?需要張量並行訓練嗎?通訊時間佔比是否超過 15%?三題有兩題答「是」,就上 SXM;全部「否」,PCIe 版把省下的預算拿去升級儲存或多租一張卡,效益高得多。把這三個問題寫進採購流程的第一頁,每次擴充算力前重新回答一次,硬體預算的浪費率會肉眼可見地下降。順帶提醒,完整的 8 卡 SXM 主機長什麼樣子、電力與租金怎麼算,可以接著看 8-GPU 主機架構全解析。
台灣租金差距與兩個在地案例
台灣 2026 年的行情:H100 PCIe 單卡主機月租約 NT$80,000 至 130,000;SXM 版以 HGX 整機出租為主,8 卡月租 NT$700,000 至 1,200,000,攤提到單卡等於貴 30% 至 50%。案例一:高雄一家影像分析公司,訓練 ViT-L 等級的視覺模型,資料並行為主、模型單卡放得下,選了 4 張 PCIe 卡的配置,月租約 NT$400,000,擴展效率實測 82%,對他們的訓練節奏完全夠用,比租 8 卡 SXM 整機省下超過 NT$40 萬。
案例二:台北一個 LLM 團隊要對 34B 模型做全參數微調,TP=4 加 DP=2 的混合並行,一開始貪便宜用 PCIe 平台,單 step 時間比預期慢 55%,換到 SXM 整機後訓練時程從估計的 31 天壓到 19 天,多付的租金差被提早 12 天交付的價值蓋過去。兩個案例放在一起看結論就很清楚:版本沒有絕對好壞,對齊並行策略才是省錢的本體。想自己驗證通訊佔比,工具鏈很現成:PyTorch Profiler 看 NCCL kernel 的時間佔比,nsys 拉時間軸看計算與通訊的重疊程度,DCGM 監控 NVLink 或 PCIe 的實際流量。量測一個典型訓練日,通訊佔比低於 10%,你就是 PCIe 平台的目標客群;高於 20%,SXM 的溢價會用時間還給你。用數據做決定,比聽任何供應商的說法都可靠。選型拿不準的話,H100 租用指南有更完整的卡數與版本對照。
租用前的四個確認動作
第一,要求供應商白紙黑字寫明版本與形態:SXM5 或 PCIe、幾卡、有無 NVSwitch,「H100 主機」四個字的資訊量是零。第二,多卡配置要求提供 nccl-tests 的 all-reduce 實測數據,8 卡 SXM 的 busbw 應該要在 400GB/s 以上量級,PCIe 平台常常只有幾十 GB/s,一跑就現形。第三,確認 PCIe 平台的拓撲:卡是不是都掛在同一顆 CPU 下、有沒有跨 NUMA,這對通訊效率的影響可達兩成。第四,問清楚升級路徑:從 PCIe 換 SXM 是否能轉約、資料搬遷誰負責,把未來的擴展成本先鎖住。這四個動作花你半天,省下的可能是每月六位數的錯配租金。多說一句合約面:台灣市場上「H100 主機」的報價從 NT$8 萬到 NT$15 萬都有,價差的大宗就是版本與互連配置,而不是誰比較佛心。把四個確認動作走完,你就有足夠的資訊判斷報價合不合理;供應商若對 nccl-tests 的要求支支吾吾,直接換一家,這個測試對正常機房是舉手之勞。

找台灣在地的 GPU 主機夥伴
版本選擇的本質是把錢花在自己用得到的頻寬上,而這需要有人跟你一起看工作負載。戰國策集團的 GPU 主機服務提供 NVIDIA H100 與 RTX 全系列、單卡到多卡整機的配置,台灣機房低延遲、資料不出境,彈性月租 NT$15,000 起,7×24 中文技術支援。把你的模型規模與並行策略告訴顧問,直接幫你對出最省的版本組合:官網 https://www.nss.com.tw/gpu 、LINE 官方帳號 @119m、免費專線 0800-003-191。
常見問題 FAQ
SXM 和 PCIe 版的效能差多少?
以 H100 為例,單卡就有差:SXM5 的 TDP 700W 對 PCIe 350W,FP16 算力約 990 對 756 TFLOPS(差三成),顯存頻寬 3,350 對 2,000GB/s(差四成)。多卡場景差距再放大:NVLink 900GB/s 對 PCIe 5.0 的 128GB/s,8 卡訓練擴展效率約 90% 至 95% 對 65% 至 85%。選擇邏輯很直接:單卡或互不通訊的多服務選 PCIe,省三到五成租金;四卡以上的分散式訓練選 SXM,時間才是最大的成本。
NVLink 的 900GB/s 是怎麼來的?
第四代 NVLink 每條鏈路雙向 50GB/s,H100 配置 18 條,合計 900GB/s;搭配 HGX 基板上的 4 顆 NVSwitch,8 張卡形成任兩卡皆 900GB/s 的全互連,不經過 CPU。對照 PCIe 5.0 x16 的雙向約 128GB/s,頻寬差 7 倍,而且 PCIe 還要與其他裝置共享通道,實際差距常更大。這也是多卡訓練在 SXM 平台能把擴展效率穩在九成以上的底層原因。
什麼工作負載一定要 SXM 平台?
兩類:一是張量並行的訓練與推論,例如 70B 以上模型的全參數微調,每層都要跨卡交換 activation,PCIe 頻寬下效率崩到五成以下;二是通訊佔比高的大規模資料並行,例如 8 卡以上、每 step 梯度交換數十 GB 的場景。訓練時程直接影響商業價值的專案,SXM 貴出的三到五成通常划算。
PCIe 版 H100 可以用 NVLink 嗎?
可以,但有限制:透過 NVLink 橋接器讓兩張卡形成 600GB/s 的點對點互連,僅支援成對配置,無法做到 4 卡或 8 卡全互連。這個配置對雙卡張量並行推論很實用,例如 70B FP8 模型的服務;但要做 4 卡以上的高效訓練,只有 SXM 加 NVSwitch 的架構做得到。
資料並行訓練在 PCIe 平台會慢多少?
取決於模型大小與 step 時間。以 7B 模型 8 卡為例,每 step 梯度 all-reduce 的有效交換量約 24GB,PCIe 上耗時 0.2 至 0.4 秒,NVLink 上 0.03 至 0.05 秒;若計算時間 1 秒,擴展效率大約是 75% 對 95%。模型越大、卡數越多,PCIe 的通訊稅越重,30B 級以上通常不建議硬跑。計算與通訊重疊做得好可以遮掉部分開銷,但遮不掉量級差距,這是物理限制。
單卡使用有必要選 SXM 嗎?
通常不必。單卡推論與微調用不到卡間互連,PCIe 版租金便宜三到五成,是明確更優的選擇;SXM 單卡輸出雖高三成,但以每元效能計算反而較差。例外是需要極致單卡吞吐、且機房已有 HGX 整機的場景。預算有限時,把 SXM 的差價拿去升級 NVMe 或加租一張 PCIe 卡,效益更高。
台灣租 SXM 和 PCIe 的價差是多少?
H100 PCIe 單卡主機月租約 NT$80,000 至 130,000;SXM 幾乎都以 HGX 8 卡整機出租,月租 NT$700,000 至 1,200,000,攤到單卡貴 30% 至 50%。SXM 整機通常綁高規儲存與 InfiniBand 網路,價差有一部分反映在配套上;預算試算時建議用「每卡有效吞吐」比價,而不是每卡標價;有效吞吐的量測基準用 nccl-tests 的 busbw,比帳面規格誠實得多。
怎麼驗證租到的多卡主機互連沒問題?
上機第一件事跑 nccl-tests 的 all_reduce_perf:8 卡 SXM 平台的 busbw 應在 400GB/s 以上量級,兩卡 NVLink 橋接約 500GB/s 上下,純 PCIe 平台常只有 20 至 60GB/s。再用 nvidia-smi topo -m 確認拓撲,看到 NV18 代表 NVLink 全連,只有 PIX 或 NODE 就是走 PCIe。這兩個指令十分鐘做完,能避開九成的互連地雷。若供應商無法配合提供這兩項數據,合理懷疑平台配置有問題,換一家詢價不會吃虧。
張量並行和資料並行對頻寬的需求差在哪?
資料並行每個 step 通訊一次,交換量等於梯度大小,頻寬需求中等,可與計算重疊;張量並行每一層前向與反向都要 all-reduce activation,通訊頻率高數十倍且難以完全重疊,對延遲與頻寬都極度敏感。所以業界慣例是 TP 只在 NVLink 域內做(單機 8 卡內),跨機才用 DP 或管線並行。
A100 的 SXM 版也是同樣的邏輯嗎?
邏輯相同,數字不同。A100 SXM4 的 NVLink 是 600GB/s,PCIe 4.0 x16 約 64GB/s,差距約 9 倍;TDP 是 400W 對 300W,算力差距約 10% 至 25%,比 H100 世代的版本差距小。A100 的租金已跌到單卡月租 NT$40,000 至 70,000,預算型多卡訓練選 A100 SXM 整機,常是被忽略的高 CP 值組合,4 卡整機月租約 NT$20 萬出頭就談得到,訓練型負載幾乎都值得補這個差價。