💡 快速答案:RTX 4090、RTX 5090、RTX PRO 6000 三張卡該怎麼選?
用顯存需求決定八成答案。模型或場景在 24GB 內、預算優先,選 4090,台灣月租約 NT$15,000 起;需要 32B 級量化模型、高頻寬推論或影片生成,選 32GB 的 5090,月租約 NT$25,000 至 40,000;要跑 70B 量化推論、大型場景渲染或需要 ECC 與 MIG 切分,直接上 96GB 的 RTX PRO 6000,月租約 NT$55,000 至 85,000。先量測顯存用量再選卡,是最不會後悔的順序。若同時有多個小服務要隔離,PRO 6000 還能用 MIG 切成 4 份 24GB,一台當四台用,這是消費卡沒有的彈性。
2026 年在台灣租 GPU 主機,工作站等級的選單上通常就是這三張:RTX 4090、RTX 5090、RTX PRO 6000。月租價位大約是 1 倍、1.6 倍、4 倍的階梯,但效能與容量的差距並不是等比放大,選錯的代價要嘛是預算浪費四成,要嘛是專案卡在顯存不足動彈不得。這篇把算圖、訓練、推論三大場景逐一對號入座,順便給你一套三分鐘就能套用的決策順序。先講答案的形狀:多數團隊的正解不是「哪張最強」,而是「哪張剛好」,我們把機房裡三種卡的實際出租數據和客戶的踩雷紀錄整理成這篇,你可以直接抄作業。
三張卡的定位與規格總表
先把身世講清楚。RTX 4090 是 2022 年的 Ada Lovelace 消費旗艦,24GB GDDR6X,便宜大碗,至今仍是全球算圖農場的主力;RTX 5090 是 2025 年的 Blackwell 消費旗艦,32GB GDDR7,頻寬直接拉到 1,792GB/s;RTX PRO 6000 則是 Blackwell 世代的專業工作站與伺服器卡,96GB GDDR7 帶 ECC 錯誤修正,CUDA 核心 24,064 個比 5090 還多,並支援 MIG 切分,一張卡可以切成最多 4 個獨立執行個體。
| 項目 | RTX 4090 | RTX 5090 | RTX PRO 6000 |
|---|---|---|---|
| 架構 | Ada Lovelace | Blackwell | Blackwell |
| CUDA 核心 | 16,384 | 21,760 | 24,064 |
| 顯存 | 24GB GDDR6X | 32GB GDDR7 | 96GB GDDR7 ECC |
| 記憶體頻寬 | 1,008GB/s | 1,792GB/s | 約 1,790GB/s |
| TDP | 450W | 575W | 600W(另有 300W 版) |
| ECC / MIG | 無 / 無 | 無 / 無 | 有 / 最多切 4 份 |
| 台灣主機月租行情 | NT$15,000 至 25,000 | NT$25,000 至 40,000 | NT$55,000 至 85,000 |
注意一個容易誤讀的點:PRO 6000 的頻寬和 5090 幾乎一樣,算力也只多一成上下,它貴出兩倍多的理由是 96GB 容量、ECC、MIG 與企業級驅動認證,而不是「跑得比較快」。如果你付 PRO 6000 的錢只用到它的速度,那筆溢價全數浪費。
生命週期也放進考量。4090 已停產,租賃市場靠存量機在跑,價格穩定但機齡漸高,簽約時記得確認保固與換卡條件;5090 正值當打之年,供貨與價格都在甜蜜點;PRO 6000 是 2025 年中才鋪貨的新卡,租金還有議價空間但機源相對少,熱門時段要提前兩到四週預約。三張卡的驅動也不同層級:消費卡走 GeForce 分支,PRO 6000 走企業長期支援分支,對穩定性挑剔的生產環境,這個差異值得列入評分表。

算圖與渲染場景:先看場景大小,再看每元效能
Blender、V-Ray、Octane 這類 GPU 渲染,4090 的每元效能至今無人能敵,單張月租 NT$15,000 出頭就能吃下多數產品視覺與建築外觀案。5090 渲染速度快約 30% 到 40%,適合交期壓死人的動畫與影視案,渲染農場每提早一天交件都是真金白銀。PRO 6000 的主場是「單一場景超過 30GB」的重量級專案:影視級 look-dev、8K 材質的完整廠區數位孿生、GI 烘焙一次吃 60GB 的那種,24GB 或 32GB 的卡連場景都載不進去,再快都沒用。
經驗法則給一個:先用你現有場景在 24GB 卡上跑一次,如果 out-of-core 或切 tile 的頻率超過兩成,升 PRO 6000 省下的人力調校時間就值回價差;如果從來沒爆過顯存,乖乖用 4090,把省下的月租拿去多租一張卡平行渲染,總吞吐還比較高。
多卡農場的算法也提一下:GPU 渲染的幀與幀之間幾乎零通訊,擴展效率接近線性,所以「兩台 4090」的總吞吐大約是「一台 5090」的 1.5 倍,月租還便宜一成,純渲染農場堆 4090 至今仍是最優解;例外是單張超大場景,爆顯存就是爆顯存,多卡救不了,只能上 96GB。把這條規則記住,渲染選卡九成的情況不會錯。
農場化配置還有幾個管理面的細節,順手一起講。渲染排程建議上一套簡單的佇列系統,把案子切成幀段自動派工,斷點續算要先驗證過,不然半夜斷線隔天早上才發現,交期直接開天窗;渲染器的授權計費方式也要看清楚,有些按節點數收費,堆卡之前先算授權費會不會反咬一口。經驗上,兩台雙卡機的維運負擔比四台單卡機輕得多,插卡密度和機器數量之間,取中間值通常最省心。這些細節聽起來瑣碎,但渲染業務的毛利就是被這種地方一點一點吃掉的,選卡只是第一步,把整條產線調順才是本體。
模型訓練場景:顯存容量決定你能不能上桌
訓練的顯存估算有公式可循:全參數微調用 AdamW 時,每個參數大約要吃 16 到 18 bytes(權重、梯度、優化器狀態加總),7B 模型就是 120GB 上下,三張卡單卡都跑不了,得靠多卡或 offload;LoRA 與 QLoRA 把需求砍到每參數 1 至 3 bytes,於是格局變成:7B 至 13B 的 LoRA 微調,24GB 的 4090 可以勝任;32B 級 QLoRA 需要 20 至 28GB 工作空間,32GB 的 5090 剛好站上門檻;70B 級 QLoRA 至少要 48GB 起跳,只有 96GB 的 PRO 6000 單卡吃得下,還能順便把批次開大讓訓練曲線穩一點。
速度面,5090 比 4090 快 1.3 至 1.5 倍,PRO 6000 再快 5% 至 15%,差距不誇張。所以訓練場景的選卡邏輯很單純:容量先決,速度次之。花 4 倍月租買 PRO 6000 卻只跑 13B LoRA,是我們最常看到的錯配,那筆預算拿去租兩張 5090 做平行實驗,研發迭代速度快一倍不止。
把常用對照表寫成文字版:7B 全參數微調約需 120GB(得靠多卡或 offload)、7B LoRA 約 18 至 22GB、13B LoRA 約 28 至 34GB(24GB 卡要改 QLoRA)、32B QLoRA 約 22 至 26GB、70B QLoRA 約 46 至 55GB。對照三張卡的容量會發現,5090 的 32GB 其實卡在一個微妙位置:比 24GB 多出的空間,主要換到「32B QLoRA 跑得動」這一項,如果你的路線圖裡沒有 32B 級模型,這級容量的邊際價值不高。另外,實測時把 micro-batch 塞到顯存九成再回退一檔,是最快找到穩定配置的土法,比理論計算省時間。
推論部署場景:KV cache 與併發數才是主角
推論的顯存帳不能只算權重。vLLM 這類服務框架的吞吐來自把 KV cache 塞好塞滿,上下文越長、併發越高,cache 吃的顯存越兇。實務區間長這樣:8B 模型 FP16 服務,4090 可以撐 20 至 40 路併發;32B 模型 4-bit 量化後權重約 18GB,5090 剩 14GB 給 cache,中低併發可用,但上下文拉到 32K 就開始捉襟見肘;70B 模型 4-bit 權重約 40GB,只有 PRO 6000 放得下,而且還剩 50GB 以上給 KV cache,單卡就能撐起一個部門級的內部服務。
PRO 6000 還有一張隱藏牌:MIG。把 96GB 切成 4 份 24GB,各自跑獨立的推論服務,故障與資源互不干擾,對「一台主機要服務四個團隊」的公司來說,比買四張消費卡省電省空間,也省了三台主機的維運。延遲敏感的服務還要算一筆 KV cache 帳:FP8 量化的 cache 比 FP16 省一半空間,主流框架都已支援,等於把併發上限直接翻倍,這對 32GB 的 5090 特別關鍵;以 32B FP8 模型為例,PRO 6000 的 96GB 裝完約 34GB 權重後,還能養 50GB 以上的 cache,32K 上下文可以撐 40 路上下的穩定併發,這個水位已經夠一個兩百人企業的內部助理使用。預估併發時記得用 p95 流量而不是平均值,很多服務半夜沒人用、上班時間全擠在一起,平均值會騙人。單張卡的高可用細節與更上層的 H100 選項,可以參考 戰國策 GPU 主機服務頁的完整規格表。
台灣情境與真實案例:新竹 AI 顧問公司的三段式升級
新竹一家八人 AI 顧問公司,幫製造業客戶做知識庫問答系統,路徑很有代表性。第一階段 POC,租兩台 4090 主機跑 13B 模型加 RAG,月租共約 NT$36,000,兩週內驗證可行;第二階段客戶要上線,要求換 32B 模型並保證回應品質,團隊改租一台 5090 跑量化 32B,月租 NT$32,000,結果上下文開到 16K 之後 KV cache 吃緊,尖峰時段排隊明顯;第三階段直接換一台 PRO 6000,70B 量化模型加 32K 上下文,45 路併發穩定跑,月租 NT$68,000,客戶按人頭數付的授權費完全蓋得過去。
回頭看,這家公司在每個階段的月租都花在刀口上,關鍵是他們每階段都先量測顯存用量與併發曲線才換卡,而不是一開始就「買未來性」。台灣的租賃市場月租制彈性高,超規格預租的舊思維其實可以丟掉了,需求到了再升級,中間省下的差價就是淨利。
這個案子後來還有一段:客戶數量成長後,他們把 PRO 6000 開了 MIG,切成 4 份 24GB 給四個客戶的 POC 環境同時用,白天隔離跑展示、晚上合併回整卡跑批次評測,一台機器當四台用。這種彈性是消費卡給不了的,也是 PRO 6000 的溢價在服務型公司身上最容易回收的方式。
選卡決策順序與兩個常見錯配
把決策壓縮成三個問題。第一題:你的模型或場景量化後要吃多少顯存?超過 30GB 直接 PRO 6000,20 至 30GB 選 5090,20GB 以下選 4090。第二題:負載是頻寬敏感型嗎?LLM 推論與影片生成是,選 GDDR7 的 5090 收益最大,詳細差距可以看 5090 與 4090 的實測比較。第三題:有沒有 ECC、MIG、長時間無人值守的企業需求?有,PRO 6000 的溢價才算花得有道理。
兩個最常見的錯配也點名一下。錯配一:為了「未來可能會用到」直接租 PRO 6000,結果一年後顯存平均使用率 35%,多繳的 NT$40 萬月租差額夠請半個工程師。錯配二:為了省錢硬把 32B 模型塞進 24GB,工程師花兩週調量化與 offload 參數,省下的月租差 NT$10,000,還不到那兩週薪資成本的五分之一。租卡跟買保險一樣,保額要對齊風險,不是越大越好,也不是越省越聰明。
順手補一筆租買比較:RTX PRO 6000 單卡市價約 NT$25 萬至 30 萬,自購加上主機平台約 NT$40 萬,對照月租 NT$68,000,帳面六到七個月打平;但自購要吃保固期外的故障風險、殘值下跌與機房電力,把這些攤進去,實際損益兩平點通常落在 14 至 18 個月。用不滿一年半的需求,租比買穩;打算跑三年的常態負載,買斷加托管才開始有優勢。台灣還有電價與空間的變數,自購前先確認辦公室的電力與冷氣扛不扛得住 600W 等級的整機長時間滿載,很多團隊是機器買了才發現冷氣先投降。
還有一個場景之外的維度值得放進決策:團隊的工作型態。研究導向的團隊,實驗多而雜,兩三張中階卡的並行實驗產能,遠勝一張大卡的排隊使用,因為研究的瓶頸在迭代次數,不在單次速度;交付導向的團隊剛好相反,客戶合約綁著單一大型服務的品質與延遲,一張規格對齊的大卡比一堆小卡好管理。多專案併行的公司,建議把卡的分配權集中管理,搭配簡單的預約制度,我們看過太多團隊卡很多但使用率不到四成,因為每個人都守著自己那張不放。硬體的錢好算,協作的損耗難算,而後者常常更大。

找台灣在地的 GPU 主機夥伴
三張卡都看完還是拿不定主意的話,讓在地團隊幫你把關。戰國策集團的 GPU 主機服務涵蓋 NVIDIA H100 與 RTX 全系列,4090、5090、PRO 6000 都有現成機種,台灣機房低延遲、資料留在境內,彈性月租 NT$15,000 起,7×24 中文技術支援隨時在線。把你的模型規模與併發需求丟過來,顧問會直接給你建議配置與試算:官網 https://www.nss.com.tw/gpu 、LINE 官方帳號 @119m、免費專線 0800-003-191。
常見問題 FAQ
RTX 4090、5090、PRO 6000 的月租價差多少?
台灣 2026 年行情:4090 主機月租約 NT$15,000 至 25,000,5090 約 NT$25,000 至 40,000,PRO 6000 約 NT$55,000 至 85,000,大致是 1 比 1.6 比 4 的階梯。價差主要反映顯存容量 24GB、32GB、96GB 與企業功能,而非速度;三張卡的純算力差距其實只有三到五成。另外 PRO 6000 常搭配更高階的 CPU 與記憶體平台,整機報價的級距比單看卡價更明顯,詢價時建議直接比整機規格與配套。
RTX PRO 6000 為什麼比 5090 貴這麼多?
貴在容量與企業功能,不是速度。PRO 6000 的 96GB GDDR7 是 5090 的三倍,支援 ECC 錯誤修正與 MIG 切分(最多 4 個獨立執行個體),並通過專業軟體的驅動認證,適合長時間無人值守運行。速度只比 5090 快 5% 至 15%,若用不到 32GB 以上顯存,這筆溢價等於白付。
跑 70B 大語言模型該選哪張卡?
只有 RTX PRO 6000 單卡辦得到。70B 模型 4-bit 量化後權重約 40GB,96GB 顯存放得下且還剩 50GB 以上給 KV cache,可以撐 30 至 50 路併發;4090 的 24GB 與 5090 的 32GB 都塞不進去。若需要 FP8 或 FP16 精度跑 70B,則要 2 張 H100 80GB 以上的配置,月租預算要拉到 NT$160,000 以上。如果只是想驗證 70B 的效果,先租單卡跑 4-bit 版本測品質,確認有商業價值再上高精度多卡,是最省的路徑。
ECC 記憶體對 AI 工作真的重要嗎?
看任務時長與正確性要求。訓練一跑 72 小時以上,無 ECC 的卡遇到記憶體位元翻轉可能讓 loss 曲線異常或直接崩潰,重跑的時間成本遠超過月租差;金融、醫療等合規場景通常直接要求 ECC。反之,渲染與短時推論偶發錯誤影響有限,消費卡就夠。經驗上連續訓練超過 3 天的團隊,九成會選 ECC 機種。
MIG 切分實際上怎麼用?
RTX PRO 6000 可切成最多 4 個各約 24GB 的獨立執行個體,每份有隔離的運算與記憶體資源,一個服務當掉不影響其他三個。典型用法是一台主機服務 4 個團隊或 4 個微服務,比租四台 4090 主機省下約 NT$20,000 至 30,000 月租與三台機器的維運。要注意 MIG 模式下不支援圖形輸出,純運算場景才適用。
純做 3D 算圖,三張卡怎麼選最划算?
場景在 20GB 以內,4090 每元效能最高,多數建築與產品渲染案首選;交期極緊的影視案選 5090,單卡快 30% 至 40%;單場景超過 30GB 或需要 8K 材質全載,才需要 PRO 6000 的 96GB。同預算下,兩張 4090 平行渲染的總吞吐通常勝過一張 5090,農場化配置比單卡升級更有效率。
三張卡的功耗與散熱需求差多少?
4090 是 450W,5090 是 575W,PRO 6000 工作站版 600W,另有 300W 的精簡版供高密度部署。以台灣電價與機房冷卻成本估算,每月電力成本分別約 NT$1,600、2,200、2,400。租用時電費幾乎都內含;自建的話 5090 與 PRO 6000 建議搭 1000W 以上電源,機櫃散熱也要預留每卡 600W 的餘裕。托管的話,建議每櫃預留兩成供電裕度,避免台灣夏季高溫時觸發降頻,拖累整體產出。
驅動程式上三張卡有差別嗎?
有。4090 與 5090 用 GeForce 或 Studio 驅動,授權不允許資料中心大規模部署,租賃業者以單租戶專用主機形式提供;PRO 6000 用 NVIDIA RTX Enterprise 驅動,有 ISV 認證與較長的穩定分支支援,SolidWorks、Maya 等專業軟體遇到的相容性問題明顯較少。跑開源 AI 框架的話,三者體驗差距不大,CUDA 12.8 以上都支援。
可以先租 4090 之後再升級嗎,會不會很麻煩?
台灣月租制下升級成本很低,多數業者支援月底轉約換機種,資料搬遷透過內網或直接換卡保留系統碟,停機時間通常在 2 至 6 小時內。建議的路徑是 POC 用 4090、上線前用實際流量壓測,再決定升 5090 或 PRO 6000;比一開始就租大卡,平均可省下三成以上的前期成本。
什麼情況該跳過這三張卡直接看 H100?
三個訊號:一是模型量化後仍超過 90GB,例如 FP8 精度的 100B 級模型;二是需要 4 卡以上張量並行訓練,消費卡與 PRO 6000 都沒有 NVLink,PCIe 互連會讓擴展效率掉到七成以下;三是推論併發破百且有嚴格延遲 SLA。H100 單卡月租約 NT$80,000 起,貴一倍多但互連與 HBM3 頻寬是另一個量級。