💡 快速答案:8-GPU 主機是什麼,和 8 台單卡主機差在哪?
8-GPU 主機是把 8 張 SXM 模組焊在同一塊 HGX 基板上、以 NVSwitch 形成任兩卡 900GB/s 全互連的單一系統,以 H100 版本為例,聚合出 640GB HBM3 顯存與約 16 PFLOPS 的 FP8 算力,軟體可以把它當一張巨型 GPU 用。8 台單卡主機只能靠乙太網路互連,頻寬差上百倍,跑不了大模型的張量並行。台灣租用行情:8 卡整機月租約 NT$700,000 至 1,200,000,單機獨佔代表整台硬體只服務你一家,效能穩定且資料隔離。
AI 圈講算力常用「幾台 8 卡機」當單位,原因很實際:8-GPU 主機是資料中心 AI 的原子單位,買是一台一台買,租也是一台一台租。但一台 8 卡機到底是什麼構造?為什麼是 8 張不是 6 張或 10 張?電力吃多兇?單機獨佔租下來要多少錢、跟雲端切片差在哪?這篇從架構拆到帳單,把你評估時需要的數字一次備齊,全部以 2026 年台灣市場的實際行情為準,可以直接拿去做預算簡報;如果你正在評估的是「要不要為公司租下第一台八卡機」,這篇的每一段都是為你寫的。
為什麼是 8 張卡:一個架構上的甜蜜點
8 這個數字不是隨便定的。NVIDIA 的 HGX 標準基板以 4 顆 NVSwitch 晶片為交換核心,8 張 SXM 模組剛好可以形成「任兩卡之間都有 900GB/s」的全互連拓撲,再多就需要更多層交換,延遲與成本都會跳階。同時,8 張 700W 的卡加上 CPU、記憶體與風扇,整機功耗剛好逼近單一機櫃供電與散熱的工程極限,8 卡是「一台機器能塞進一個熱封套」的甜蜜點。於是整個生態都圍著它標準化:框架的並行策略預設 8 卡一組、機房以 8 卡機為部署單位、租賃市場以整機為報價單位。
對照組是 PCIe 版的 8 卡伺服器:一樣塞 8 張卡,但卡間走 PCIe 交換器,頻寬是 NVLink 的七分之一,定位是「8 個獨立工作負載的集裝箱」而不是「一張巨型 GPU」。兩種 8 卡機的差異,本質上就是 SXM 與 PCIe 的互連差異,選錯的代價我們在那篇有完整拆解。
市場上也有 4 卡的 HGX 基板與各種 PCIe 8 卡變體,定位是入門與推論密集場景;但租賃市場的報價、二手殘值、框架預設值全部圍繞 8 卡 SXM 整機打轉,流通性最好、規格最標準。這也是我們建議企業以 8 卡為規劃單位的務實理由:未來不管是擴充、轉租還是換供應商,標準品的路最寬。換句話說,8 卡不只是技術上的甜蜜點,也是市場流動性的甜蜜點。

解剖一台 HGX H100 8-GPU 整機
| 子系統 | 典型規格 | 備註 |
|---|---|---|
| GPU | 8 張 H100 SXM5 80GB | 聚合 640GB HBM3 |
| GPU 互連 | 4 顆 NVSwitch | 任兩卡 900GB/s |
| CPU | 雙路 64 核以上 | 資料前處理與排程 |
| 系統記憶體 | 1TB 至 2TB | 建議為顯存 1.5 至 3 倍 |
| 本機儲存 | NVMe 15TB 至 30TB | 訓練資料快取,讀取 5GB/s 起 |
| 對外網路 | 8 張 400Gb/s InfiniBand 或 RoCE | 跨機擴展用 |
| 功耗與體積 | 滿載 10 至 12kW,4U 至 8U | 含機櫃常超過 300 公斤 |
幾個容易被低估的配套:系統記憶體不足會讓資料載入卡住 GPU 空轉,NVMe 吞吐不夠會讓一個 epoch 的資料讀取拖垮整體時程,8 張 400G 網卡則是未來跨機擴展的保命符。租用報價之間差的那一兩成,常常就差在這些看不見的地方,比價時記得把配套規格逐項攤開。
效能的意義:單機就是一個訓練叢集
把數字聚合起來看:8 張 H100 SXM5 等於 640GB HBM3 顯存、約 26.8TB/s 的聚合顯存頻寬、FP8 約 16 PFLOPS 的 dense 算力。這是什麼概念?70B 模型的 LoRA 微調可以整組塞進單機,全參數微調搭配 ZeRO 也能在單機起跑;FP8 精度的 405B 模型推論,兩台就撐得起來。而因為 8 卡之間是 NVSwitch 全互連,張量並行切 8 份的擴展效率有九成以上,單機內幾乎感覺不到「卡是分開的」。
單機的天花板也要講清楚:再往上就是跨機,通訊從 900GB/s 的 NVLink 掉到 400Gb/s(50GB/s)的 InfiniBand,速度差 18 倍,並行策略要重新設計。所以行內的鐵律是:能在一台 8 卡機內解決的問題,就不要跨機;要跨機的規模,InfiniBand 網路的品質比 GPU 本身更值得你盯。
實際功耗曲線比銘牌溫和一點:全力訓練時整機通常吃 85% 至 100% 的額定功耗,推論服務依併發量在 40% 至 70% 之間浮動,深夜離峰可以壓更低。這對電費與散熱都是好消息,但機房的供電設計仍然要按滿載抓,因為訓練任務一排下去就是連續數週的滿載,沒有僥倖空間。
電力與散熱:台灣機房的現實考題
一台 8 卡機滿載 10 至 12kW,大約等於 3 到 4 戶台灣家庭的夏季用電。台灣多數既有機房的機櫃供電規格是 3 至 5kW,一台 8 卡機直接爆表兩倍,所以它只能住進 15kW 以上的高密度機櫃,搭配水冷背板,或者乾脆上直接液冷;能供應這種櫃位的機房集中在雙北、桃園、台中的新建案,櫃位費比一般機櫃高 50% 以上。這是很多企業自購 8 卡機之後才發現的第二筆帳:機器 NT$2,000 多萬,還要花數百萬改造機房,或者根本找不到地方放。
電費一樣算給你看:滿載 10.5kW 一個月是 7,560 度,台灣工業電價每度 NT$3.5 至 4.5,加上 PUE 1.4 的冷卻開銷,月電費約 NT$37,000 至 48,000,夏季尖峰再加一成。租用模式把這些全部內含,月租單一數字就是總成本;自建則要自己扛電價調漲與散熱工程,2022 年以來台灣工業電價累計漲幅已超過五成,這個風險放進五年 TCO 裡非常有感。
櫃位市場的現況也給個座標:台灣高密度機櫃的月租含電約 NT$60,000 至 120,000 一櫃,液冷櫃更高,而且新建案的釋出速度追不上 AI 需求,2026 年熱門機房的高密櫃普遍要排隊。自建還會撞上台電契約容量的關卡,增容從申請到施工常要半年起跳;租用則把這一整串問題外包掉,時程風險直接歸零。這也是整機租用方案興起的結構性原因:業者手上有櫃位與電力配額,對單一企業來說,租算力比自己去搶櫃位實際得多。
單機獨佔對上雲端切片:錢和資料的兩本帳
先講錢。國際雲端租 8 卡 H100 叢集,2026 年 on-demand 行情約每 GPU 每小時 US$2 至 4,整機月費換算約 NT$37 萬至 75 萬,再加儲存費與每 GB US$0.05 以上的資料傳出費;台灣在地的單機獨佔月租約 NT$700,000 至 1,200,000,含電力、頻寬與儲存,年約再折 15% 至 25%。粗看雲端便宜,但只要利用率超過五成、資料集以 TB 計,兩者的總成本就會交叉,重度使用下在地獨佔反而省。
再講資料這本帳。單機獨佔的意思是整台硬體只服務你一家:沒有鄰居搶頻寬的效能抖動,跑基準測試的數字就是你每天拿到的數字;資料從頭到尾不離開台灣機房,金融、醫療、政府案的法遵審查直接過關;要裝什麼系統、怎麼切虛擬化、要不要開 MIG,全由你決定。對照雲端切片的共享底層與出境疑慮,這本帳對很多台灣企業比價格那本更重。合規這條再往下挖一層:金融業的委外作業規範、醫療的個資要求,審查時都會問「實體主機是否與其他租戶共用」「資料儲存位置是否在境內」,單機獨佔加台灣機房,這兩題的答案乾淨俐落;共用雲平台則要準備一疊補充說明,審查時程常多拖一兩個月。我們看過不只一個案子,技術評估三天就完成,法遵文件來回改了六週,提前把架構選在容易解釋的那一邊,是專案經理的自保之道。整機租用的完整行情與合約眉角,可以搭配 H100 租用指南服用。
實際案例:遊戲公司的三個月訓練衝刺
台北內湖一家遊戲公司要做 NPC 對話模型,基底是 34B 開源模型加上自家世界觀語料的持續預訓練與微調。需求很典型:訓練期三個月要火力全開,上線後只需要推論算力。他們的配置是租一台 8 卡 H100 整機(月租約 NT$880,000)衝訓練,同步用兩張 H100 PCIe(月租約 NT$200,000)搭建推論與評測環境;三個月後訓練結束,整機退租,推論環境擴到四張卡,月支出從尖峰的 NT$108 萬降到 NT$40 萬上下。
對照自購方案:一台 8 卡機採購價約 NT$2,200 萬至 2,600 萬,加上機房改造與維運人力,三個月的專案根本不可能回本,而且訓練結束後那台機器的算力就閒置了。「訓練尖峰租整機、常態負載養小機」的節奏,是目前台灣中型團隊被驗證過最省的打法,租賃市場的價值就在讓算力跟著專案的心跳走。
他們有一個排程細節值得抄:訓練後期把 checkpoint 頻率從每四小時拉密到每一小時,退租日前完成最後一輪評測後,所有權重與資料當天搬回自有儲存,隔天準時退租,一天租金都沒浪費。八卡機的日租攤提接近 NT$30,000,把退場排程當成專案的一部分來管理,省下來的都是淨利。
租用 8-GPU 主機的檢查清單
詢價時把這六項逐一問清楚:一,GPU 版本與互連,SXM5 加 NVSwitch 才是完全體,要求提供 nvidia-smi topo 與 nccl-tests 實測;二,機櫃供電與冷卻方式,15kW 櫃或液冷,關係到長時間滿載的穩定性;三,儲存效能白紙黑字,NVMe 讀取 5GB/s 是訓練的及格線;四,網路配置,對外頻寬是否獨享、跨機擴展有沒有 InfiniBand 選項;五,SLA 與換卡時效,建議 4 至 8 小時,並確認備品在台灣不用等進口;六,合約彈性,訓練專案結束後能否降規轉租、退租時的資料抹除證明。這六題全部有明確答案的供應商,才值得把七位數的月租交給他。另外把「開機率承諾」與「效能衰退處理」也放進清單:GPU 長期滿載下偶發的單卡效能衰退(例如 HBM 溫度異常導致降頻)不算完全故障,但會拖慢整體訓練,合約裡要定義這種情況的認定標準與處理時效。願意把這條寫清楚的供應商,通常也是維運能力最扎實的那一群。
日常維運的節奏也先有個底:每天看一眼監控面板的溫度、功耗與記憶體錯誤計數,每週對訓練吞吐做一次基準比對,每月讓業者出一份健檢報告,韌體與驅動的更新則挑訓練空檔的維護窗口做,不要在長任務中途手癢。這些事聽起來繁瑣,實際上大多可以自動化,重點是出問題時你手上有歷史數據可以比對,爭議處理的速度會完全不同。八卡機是重資產服務,把維運當成租金的一部分來經營,才能把每一分月租的價值榨乾。

找台灣在地的 GPU 主機夥伴
8-GPU 主機是重裝備,從機房電力到合約條款每一環都有專業門檻,找在地夥伴把關最省心。戰國策集團的 GPU 主機服務提供 NVIDIA H100 與 RTX 全系列、從單卡到多卡整機的彈性配置,台灣機房低延遲、資料不出境,彈性月租 NT$15,000 起,7×24 中文技術支援。專案要衝刺、預算要精算,都歡迎直接找顧問聊:官網 https://www.nss.com.tw/gpu 、LINE 官方帳號 @119m、免費專線 0800-003-191。
常見問題 FAQ
一台 8-GPU 主機的總體效能有多強?
以 HGX H100 為例:640GB HBM3 顯存、聚合顯存頻寬約 26.8TB/s、FP8 算力約 16 PFLOPS(dense),8 卡間由 NVSwitch 提供任兩卡 900GB/s 互連。實務上可單機完成 70B 模型微調、支撐 405B 級模型的推論分片,張量並行擴展效率達九成以上,等於把一個小型訓練叢集裝進一台 4U 至 8U 的機箱。這個機內互連水位,是任何乙太網路串起來的多機叢集都追不上的。
為什麼 AI 主機都是 8 卡,不是 6 卡或 12 卡?
8 卡是 NVSwitch 全互連拓撲與機櫃熱功耗的雙重甜蜜點:4 顆 NVSwitch 剛好支撐 8 張 SXM 模組任兩卡 900GB/s,再多要加交換層數;8 張 700W 的卡加平台約 10 至 12kW,逼近單櫃供電與散熱極限。生態也隨之標準化,HGX 基板、並行框架、租賃報價都以 8 卡為單位,4 卡版是次要規格。
8-GPU 主機在台灣的月租行情是多少?
HGX H100 8 卡整機月租約 NT$700,000 至 1,200,000,含電力、機櫃、基本頻寬與儲存,年約可談 15% 至 25% 折扣;H200 版本貴約 20% 至 35%。對照採購價 NT$2,200 萬至 2,600 萬加機房改造,租用的損益平衡點約在連續使用 24 至 30 個月,專案型需求幾乎都是租比買划算。簽約前確認月租是否含儲存與流量,這兩項是不同業者報價差異的常見來源。
單機獨佔和雲端 GPU 切片的差別是什麼?
獨佔代表整台硬體只服務一個客戶:效能無鄰居干擾、基準數字穩定重現、資料不與他人共享底層、系統與虛擬化自主。雲端切片則共享實體資源,尖峰時段可能出現效能抖動,資料多半存放境外。價格上雲端 on-demand 靈活但加上儲存與傳出流量費後,利用率超過五成時獨佔整機的總成本通常更低。
一台 8 卡機的耗電量和電費是多少?
滿載約 10 至 12kW,相當於 3 到 4 戶家庭的夏季用電;月耗電 7,200 至 8,600 度,以台灣工業電價每度 NT$3.5 至 4.5 加 PUE 1.4 計,月電費約 NT$37,000 至 55,000。租用時全數內含於月租;自建則需自行承擔電價調漲風險,台灣工業電價自 2022 年以來累計漲幅已超過五成。
台灣一般機房放得下 8-GPU 主機嗎?
多數放不下。傳統機櫃供電 3 至 5kW,一台 8 卡機就需要 15kW 以上的高密度櫃位加水冷背板或液冷,這種櫃位集中在雙北、桃園、台中的新建機房,櫃位費比一般機櫃貴 50% 以上且常要排隊。這也是租用整機服務的核心價值之一:電力、冷卻、樓板承重(整櫃常超過 300 公斤)全由業者處理。
什麼樣的工作負載需要獨佔一台 8 卡機?
三類最典型:34B 至 70B 模型的持續預訓練或全參數微調,單機 NVSwitch 互連是效率關鍵;100B 級以上模型的生產推論,需要多卡張量並行分片;以及對資料隔離有法遵要求的金融、醫療、政府專案。若只是多個獨立小服務,租多台單卡主機的彈性更高,不必為用不到的互連付錢。
跨到兩台以上 8 卡機時要注意什麼?
通訊頻寬會從機內 NVLink 的 900GB/s 掉到機間 InfiniBand 400Gb/s(約 50GB/s),差 18 倍,並行策略必須改成機內張量並行、機間資料或管線並行。租用時要確認 8 張 400G 網卡是否全數接上獨立交換機、是否支援 GPUDirect RDMA;網路沒配好的跨機叢集,擴展效率可能直接掉三成。
租 8 卡機一定要搭配什麼周邊規格?
四項及格線:系統記憶體 1TB 起(建議為總顯存的 1.5 至 3 倍),NVMe 本機儲存 15TB 起且讀取 5GB/s 以上,CPU 雙路 64 核以上供資料前處理,對外頻寬 10Gbps 起。任何一項不及格都會讓 GPU 空轉等資料,等於七位數月租在燒空氣,詢價時要求列出實測數據而非型錄規格。
訓練專案結束後,8 卡機的租約怎麼收尾最省?
簽約時就把退場寫進條款:訓練期用整機(例如 3 至 6 個月),結束後轉租 2 至 4 張單卡等級主機跑推論,月支出可從七位數降到 NT$20 萬至 40 萬;同時要求業者提供退租資料抹除證明(NIST 800-88 等級)。有規劃退場的專案,總算力支出通常比一路租整機省四到六成。