💡 快速答案:NVIDIA H200 和 H100 差在哪裡,誰需要它?
H200 與 H100 用同一顆 Hopper 核心,算力規格相同,差別全在記憶體:HBM3e 141GB 對 80GB(多 76%)、頻寬 4.8TB/s 對 3.35TB/s(多 43%)。大模型推論這種頻寬綁定的負載,H200 快 1.4 至 1.9 倍,且 70B 模型 FP8 單卡就放得下,省掉跨卡並行的成本;訓練場景提升僅一成上下。台灣租金比 H100 貴約 20% 至 35%,長上下文、高併發推論的團隊付這筆溢價最划算,訓練為主的團隊租 H100 就好。供貨自 2025 下半年起穩定,台灣已有整機現貨可租。
H200 常被誤會成 H100 的下一代,其實它是「同一顆引擎、換更大油箱」的升級版:GPU 核心與 H100 完全相同,算力規格一個數字都沒變,變的是記憶體,141GB 的 HBM3e、4.8TB/s 的頻寬,分別比 H100 多 76% 與 43%。聽起來像小改款?對訓練來說是,對大模型推論來說卻是質變。這篇講清楚 H200 到底解決什麼問題、實測快多少、台灣租金貴多少,以及最重要的:你的工作負載到底需不需要它。先破題:H200 對推論重的團隊是效率倍增器,對訓練重的團隊是溢價陷阱,同一張卡兩種評價都對,差別只在你的負載形狀。
H200 是什麼:規格上的一句話總覽
H200 採用與 H100 相同的 Hopper 架構 GH100 核心,FP8 約 1,979 TFLOPS、FP16 約 990 TFLOPS(dense)的算力規格完全一致,NVLink 一樣是 900GB/s,TDP 一樣是 700W,同樣以 HGX 8 卡整機為主要形態。唯二的改變:顯存從 80GB HBM3 換成 141GB HBM3e,頻寬從 3,350GB/s 拉到 4,800GB/s。一台 HGX H200 8 卡整機的總顯存來到 1,128GB,首次讓「單機塞進 400B 級模型」變成日常。
| 項目 | H100 SXM5 | H200 SXM | 差距 |
|---|---|---|---|
| 架構 / 算力 | Hopper / FP8 約 1,979 TFLOPS | 相同 | 0% |
| 顯存 | 80GB HBM3 | 141GB HBM3e | +76% |
| 記憶體頻寬 | 約 3,350GB/s | 約 4,800GB/s | +43% |
| NVLink | 900GB/s | 900GB/s | 0% |
| TDP | 700W | 700W | 0% |
| 8 卡整機總顯存 | 640GB | 1,128GB | +76% |
看懂這張表就看懂 H200 的定位:它不是拿來「算得更快」,是拿來「裝得更多、餵得更飽」。你的瓶頸如果在算力,H200 幫不上忙;瓶頸在顯存容量或頻寬,它就是目前 Hopper 家族的頂規解。
一個規格冷知識順帶解惑:H200 的 141GB 看起來是個怪數字,因為它實體上是六顆 24GB 的 HBM3e 堆疊、共 144GB,保留部分容量作為良率與穩定性裕度後,開放給使用者的就是 141GB。這個設計也透露了 HBM 供應的緊張程度,每一顆堆疊都被壓榨到極限;供應商以 SK 海力士與美光為主,產能到 2026 年都還是賣方市場。對租用者的意義是,H200 的價格不太可能出現 A100 那種雪崩,供需結構撐著,議價要靠合約長度而不是等跌價。

141GB 為什麼是分水嶺:用顯存帳算給你看
拿最主流的 70B 級模型當例子。FP8 精度的權重約 70GB:H100 的 80GB 裝下權重後只剩 10GB 出頭給 KV cache,併發一高就見底,實務上得靠 2 卡張量並行;H200 裝完權重還剩約 70GB,KV cache 的空間直接翻六倍,單卡就能撐起像樣的生產服務。再往上,110B 級模型 4-bit 量化後約 60GB,H200 單卡輕鬆;甚至 Llama 405B 的 FP8 版本,8 卡 H200 整機(1,128GB)不用跨機就放得下,H100 整機(640GB)就得動用兩台。
長上下文是另一個主戰場。KV cache 的量隨上下文長度線性成長,70B 級模型(GQA 架構)在 128K 上下文時,單一序列的 cache 就要吃掉 35 至 45GB。做長文件分析、程式碼庫理解、多輪對話記憶這類應用,顯存不夠的症狀不是變慢,是直接拒絕服務或瘋狂重算。141GB 的意義就在這裡:把「上下文長度乘以併發數」的天花板拉高一倍以上。HBM 顯存為什麼對這類負載如此關鍵,可以配著 GDDR7 與 HBM 的對照解析一起讀。
把 KV cache 的帳再算細一點:GQA 架構的 70B 模型,每 1K token 的 cache 約 300 至 350MB,32K 上下文單序列約 10 至 11GB,128K 就是 40GB 上下。用 H100 跑 FP8 70B,裝完權重剩 10GB 出頭,等於一路 32K 就滿了;H200 剩約 70GB,同樣條件能撐六到七路,或單路開到極限上下文。這不是效能差幾成的問題,是產品能不能開這個規格的問題。如果你的路線圖上寫著「支援整本文件上傳」或「Agent 長工作流」,這筆容量帳建議現在就算,等撞牆再換卡,遷移的急迫性會讓你付出更差的議價條件。
實測數字:推論快 1.4 至 1.9 倍,訓練只快一成
公開基準與部署經驗給出一致的圖像:Llama 70B 級推論,H200 的吞吐是 H100 的 1.4 至 1.9 倍,上下文越長、批次越大,領先越明顯,因為這是純粹的頻寬與容量遊戲;175B 級模型約 1.6 倍。反觀訓練場景,瓶頸多半在算力與卡間通訊,而這兩項 H200 與 H100 完全相同,實測提升通常只有 10% 至 15%,來自資料搬運的邊際改善。
換句話說,H200 的溢價買的是「推論吞吐與模型容量」,不是「訓練速度」。這個結論直接決定花錢策略:推論服務量大的公司,H200 每 token 成本可以比 H100 低兩到四成,溢價很快賺回來;訓練為主的團隊,同樣預算多租幾張 H100 比升級 H200 有效得多。HPC 領域另計,CFD、氣象模擬這類記憶體頻寬敏感的科學運算,H200 可以看到 1.3 至 1.9 倍的改善,是被行銷聲量埋沒的受益者。
MoE 模型是另一個放大鏡:以 8x22B 這類架構為例,單次推論啟用的參數雖然只有 40B 上下,但全部專家權重都得住在顯存裡,FP8 也要 140GB 上下,H100 單卡直接出局,H200 剛好一卡收下。隨著 2025 年後開源模型大量走向 MoE 路線,141GB 的實用價值比帳面又高了一截;還有一個常被問的組合:同預算下「一台 HGX H200」對「一台半 HGX H100」怎麼選?訓練密集選後者,算力總量大;推論與長上下文選前者,單卡容量才是硬通貨。
把推論的成本帳算一次給你看。假設要服務一個尖峰三十路併發、平均上下文三萬字符的七十億參數級應用:H100 方案需要兩卡張量並行,月租抓二十二萬,還要付出跨卡通訊的效率折損與較複雜的部署;H200 方案單卡搞定,月租抓十五萬,吞吐反而高出兩到三成。換算下來,每百萬 token 的算力成本,H200 方案大約只有 H100 雙卡方案的六成,溢價買的容量在這種負載形狀下,回收速度比多數人直覺想的快。反過來,如果同樣預算拿去跑訓練,H200 的帳就完全不成立,這也呼應前面的判斷:先弄清楚自己的負載形狀,再決定要不要付這筆錢。
誰真的需要 H200:三種對號入座的負載
第一種:長上下文 RAG 與文件智能。法律合約審閱、財報分析、程式碼庫問答這類動輒 64K 至 128K 上下文的應用,KV cache 是吃顯存的主力,H200 單卡能做到 H100 要兩卡並行才有的服務水位,架構簡單一截,故障點也少一半。第二種:70B 至 110B 模型的高併發生產服務,141GB 讓你在單卡上同時塞進權重與大批次 KV cache,tokens/s 與延遲表現都明顯占優。第三種:MoE 混合專家模型,參數總量大但啟用稀疏,容量比算力重要,天生是 H200 的形狀。
反過來,三種人不需要:模型在 34B 以下的(H100 甚至更便宜的卡就綽綽有餘)、以訓練為主要負載的(把預算投在卡數而非單卡容量)、以及預算敏感的初創驗證期團隊(先用 H100 租用方案驗證商業價值,再決定要不要為效能付溢價)。
自測三題:一,你的服務是否經常跑 32K 以上的上下文?二,尖峰併發乘以上下文長度,KV cache 是否會超過 10GB?三,模型規模是否在 70B 以上或走 MoE 架構?三題中兩題為是,H200 的溢價就回收得快;三題全否,把錢留給 H100 或更便宜的卡,半年後再重新評估也不遲。順帶一提,34B 以下的模型就別湊熱鬧了,RTX PRO 6000 的 96GB 加上月租 NT$55,000 起的價位,把這個級距的性價比守得死死的。
台灣租用行情與供貨現況
價格面,2026 年台灣市場 H200 的租金比同配置 H100 高約 20% 至 35%:8 卡 HGX H200 整機月租大致落在 NT$900,000 至 1,500,000 的區間,單卡形態的選擇比 H100 少,因為 H200 幾乎都以 SXM 整機形式流通。供貨面反而是好消息:Blackwell 吸走了超大型買家的訂單,H200 在 2025 下半年開始供需鬆動,台灣在地業者陸續有現貨機位,交期從過去的口頭排隊變成數週內可上線。合約長度的建議跟 H100 不太一樣:H200 的租金曲線還在高原期,B200 世代在台灣鋪開後才會有明顯下修,所以 12 個月內的合約都算安全;真的要簽長約,把「租期內免費升級同級新卡」的選項談進去,供應商在去化舊機的壓力下,這條其實不難談成。另外,台灣的 H200 機源以 8 卡整機為主,想要 2 卡、4 卡的彈性配置,選擇比 H100 少,詢價時多留兩週前置時間。
台灣情境還有一筆帳要算:電力。H200 的 TDP 與 H100 同為 700W,8 卡整機一樣是 10 至 12kW 的量級,月電費約 NT$40,000 至 55,000(含冷卻、以工業電價估),租用模式下內含於月租。也就是說,從 H100 升級 H200,電力成本不變、吞吐提升四到九成,對機房空間與供電額度吃緊的台灣企業來說,「同樣一櫃電,多一倍推論量」本身就是升級的理由之一。
實際案例:法律科技新創的單卡勝雙卡
台北一家法律科技新創,產品是合約審閱助手,核心需求是 128K 上下文讀完整份併購合約,尖峰 30 路併發。原架構是 2 張 H100 跑張量並行,月租約 NT$220,000,痛點是跨卡並行的推論框架調校吃人力,而且任一卡故障整個服務就停。改到單卡 H200 之後(月租約 NT$150,000),權重加 KV cache 全部塞進 141GB,吞吐反而比雙卡並行高出約三成,因為省掉了卡間通訊的開銷;月租省 NT$70,000,架構簡化省下的維運時間是額外賺到的。
這個案例的通用教訓:當你的服務規模剛好卡在「H100 單卡不夠、兩卡才夠」的尷尬區間,H200 單卡經常是總成本更低的解,把「用更多卡」和「用更大的卡」兩個方案都拿出來試算,答案常常反直覺。遷移過程也給個現實參考:他們從雙卡 H100 換到單卡 H200,vLLM 設定拿掉張量並行參數、重新校準 FP8 的 KV cache 配置,加上迴歸測試總共花了兩個工作天,沒改一行業務程式碼。從多卡收斂回單卡的工程風險,比多數團隊想像的低;反方向從單卡拆成多卡才是大工程,這也是「容量買大一點」在架構上的隱形價值。
部署層面再給三個提醒。一,FP8 不是開了就好,上線前用自己的評測集跑一輪品質校準,尤其中文任務的數值敏感度和英文不完全一樣,驗證過再全量切換。二,長上下文服務的排程器設定要重調,預設參數多半為短請求優化,長請求一進來容易把整條佇列堵死,記得開啟分段預填充之類的機制。三,監控指標抓兩個就夠日常用:首字延遲與每字延遲,前者影響體感、後者影響吞吐,兩條曲線一惡化就是容量預警,比等使用者抱怨早得多。這些細節做齊,141GB 的價值才會完整變成產品體驗。

找台灣在地的 GPU 主機夥伴
H200 適不適合你的負載,一通電話的顧問對談常常比三天的網路爬文更快有結論。戰國策集團的 GPU 主機服務提供 NVIDIA H100 與 RTX 全系列機種,並可依需求評估 H200 等級的配置,台灣機房低延遲、資料不出境,彈性月租 NT$15,000 起,7×24 中文技術支援。官網 https://www.nss.com.tw/gpu 、LINE 官方帳號 @119m、免費專線 0800-003-191,把你的模型與併發數字帶來,我們幫你把帳算清楚。
常見問題 FAQ
H200 的顯存規格是什麼?
141GB HBM3e,記憶體頻寬約 4,800GB/s,分別比 H100 的 80GB HBM3 與 3,350GB/s 多出 76% 與 43%。GPU 核心本身與 H100 相同,FP8 約 1,979 TFLOPS、NVLink 900GB/s、TDP 700W 都沒變。8 卡 HGX H200 整機的總顯存達 1,128GB,是目前 Hopper 家族單機容量的頂點。因為核心相同,現有 CUDA 程式與推論框架不用改就能直接遷移,升級成本主要在租金差而不是工程工時,這是它比跨代升級友善的地方。
H200 比 H100 快多少?
推論快很多,訓練快很少。Llama 70B 級推論吞吐為 H100 的 1.4 至 1.9 倍,175B 級約 1.6 倍,上下文越長領先越大;訓練因為算力與 NVLink 規格相同,提升只有 10% 至 15%。記憶體頻寬敏感的 HPC 應用如 CFD、氣象模擬,可見 1.3 至 1.9 倍改善。買它是買容量與頻寬,不是買算力。
70B 模型在 H200 上可以單卡跑嗎?
可以,而且跑得舒服。FP8 精度權重約 70GB,H200 裝完還剩約 70GB 給 KV cache,足以支撐 30 路以上併發的生產服務;H100 的 80GB 裝完權重只剩 10GB 出頭,實務上要 2 卡並行。單卡架構省掉跨卡通訊開銷與框架調校,吞吐常反超雙卡 H100,故障點也少一半。
什麼是 HBM3e,和 HBM3 差在哪?
HBM3e 是 HBM3 的增速版,單腳位速率從約 6.4Gbps 拉到 8Gbps 以上,並支援更高的單顆堆疊容量(24GB 對 16GB)。落在 H200 上的結果就是頻寬 4.8TB/s 對 3.35TB/s、容量 141GB 對 80GB。對每個 token 都要掃過全部權重的大模型推論,這兩個數字幾乎線性反映在 tokens/s 上。對照消費卡 GDDR7 的 1,792GB/s,HBM3e 的頻寬仍是 2.7 倍,量級差距沒有被追上。
H200 在台灣的租金行情如何?
比同配置 H100 貴約 20% 至 35%。8 卡 HGX H200 整機月租約 NT$900,000 至 1,500,000,單卡形態流通量少,因為 H200 幾乎都以 SXM 整機出貨。2025 下半年起供貨明顯鬆動,台灣業者陸續有機位,交期縮到數週。年約通常可談 15% 至 25% 折扣,議價空間比缺貨期大得多。想要 2 卡、4 卡彈性配置的話機源較少,建議提前詢價預留檔期。
做長上下文應用,H200 的優勢具體在哪?
KV cache 隨上下文線性成長,70B 級模型在 128K 上下文時單一序列就吃 35 至 45GB。H100 裝完權重後的剩餘空間撐不起幾路長上下文併發,H200 多出的 61GB 直接把「上下文乘以併發」的上限拉高一倍以上。法律文件審閱、程式碼庫分析、長對話記憶這類應用,體感差距是「能服務」與「不能服務」的差別。
訓練工作負載值得從 H100 升級 H200 嗎?
多數情況不值得。訓練瓶頸在算力與卡間通訊,這兩項 H200 與 H100 完全相同,實測只快 10% 至 15%,租金卻貴 20% 至 35%,每元效能反而變差。同樣預算拿去多租 H100 卡數,例如 8 卡變 10 卡,對訓練時程的幫助大得多。例外是模型大到 640GB 整機裝不下的場景,容量本身就是硬需求。
H200 和 B200 之間怎麼選?
B200 是 Blackwell 新架構,192GB HBM3e、頻寬 8TB/s,算力也大幅提升,紙面全面領先;但 2026 年供貨集中在超大雲端業者,台灣租賃市場量少價高且交期不穩。務實建議:推論需求現在就上 H200,生態成熟、隨租隨用;沒有急迫需求的可以等 B 系列在地供應穩定,預期 2027 年前後價格才會進入合理區間。
H200 的功耗和 H100 一樣嗎,機房需求有差嗎?
一樣,單卡 TDP 700W,8 卡整機滿載 10 至 12kW,需要 15kW 級高密度機櫃與對應冷卻,月電費含冷卻約 NT$40,000 至 55,000。這代表從 H100 升級 H200 不用動任何機房基礎設施,同一櫃電力換來四到九成的推論吞吐提升,對台灣供電額度吃緊的機房環境是很實際的優勢。
哪些團隊建議跳過 H200?
三類:模型 34B 以下的團隊,H100 甚至 RTX PRO 6000(96GB、月租 NT$55,000 至 85,000)就吃得下,成本低一大截;訓練為主的團隊,預算該投在 H100 卡數而非單卡容量;還在驗證商業價值的早期團隊,先用月租低的方案把產品跑起來,等併發與上下文需求真的撞牆,再升級也來得及。