💡 快速答案:2026 年 NVIDIA A100 還值得租用嗎?
值得,但僅限特定場景。A100 80GB 在台灣月租已跌到約 NT$40,000 至 70,000,是 H100 的一半以下;H100 訓練快 2.2 至 3.1 倍、配 FP8 推論快 3 至 4 倍,時間敏感的大型訓練仍該選 H100。反過來說,電腦視覺、推薦系統、13B 以下模型微調、FP64 科學運算這類吃不滿 Hopper 新特性的負載,A100 的每元效能反而更高。判斷關鍵是工作負載能否用到 FP8 與高頻寬,用不到就租 A100 省一半預算。拿不準就先量測一週 GPU 使用率,數據會直接告訴你答案。
A100 是 2020 年發表的產品,放在 GPU 世界已經是六年的老將,照理說早該退場,但 2026 年它在租賃市場反而迎來第二春:價格跌到歷史低點,而全球還有大量工作負載根本用不到 H100 的新特性。這篇把 A100 與 H100 的規格差距、實際效能差距、以及台灣租金行情攤開來算,幫你找出「付一半的錢、拿到夠用的算力」的甜蜜點,也講清楚哪些情況省這筆錢會害到自己。先說結論的形狀:這不是「新卡舊卡」的信仰題,是一道可以算出交叉點的數學題,而 2026 年的交叉點位置,對很多台灣團隊來說剛好落在 A100 這一側。
A100 租賃市場現況:價格雪崩後的第二春
先看行情。國際雲端市場的 A100 80GB 時租,已經從 2023 年高峰的每小時 US$2 以上,跌到 2026 年的 US$0.8 至 1.5;台灣在地租賃的 A100 80GB 單卡月租大約落在 NT$40,000 至 70,000,40GB 版更便宜,NT$30,000 上下就找得到。對照 H100 單卡月租 NT$80,000 至 150,000 的行情,價差直接是一倍以上。
為什麼跌這麼兇?供給面,大型雲端業者汰換下來的 A100 大量流入二手與租賃市場;需求面,追最新算力的錢全部湧向 H100、H200 與 Blackwell 世代。但這正是精打細算的团隊撿便宜的窗口:A100 的 CUDA 生態支援還很長,Ampere 架構在 CUDA 12 世代依然是一級公民,PyTorch、vLLM、TensorRT 的支援沒有任何縮水,跌的只有價格,不是能力。
挑 A100 還有一個版本細節:40GB 與 80GB 除了容量,頻寬也不同,40GB 版約 1,555GB/s,80GB 版拉到 2,000GB/s 上下。跑電腦視覺、推薦系統這類模型不大的負載,40GB 版月租便宜三成左右,是更精準的省法;要碰語言模型就直上 80GB,容量與頻寬的雙重差距會直接反映在能不能跑、跑多快上。另外 PCIe 與 SXM 版的差價約兩成,多卡訓練才需要為 SXM 的 600GB/s NVLink 加錢。台灣目前的 A100 機源以 PCIe 單卡與 4 卡、8 卡 SXM 整機為主,單卡幾乎隨租隨有,整機建議提前兩週詢問。順帶提醒一件小事:同樣是八十的容量,不同批次機器的散熱模組與韌體版本會影響穩定度,租用前請業者提供近三個月的故障與更換紀錄,老卡挑得好,穩定度其實不輸新卡;挑不好,就是天天跟告警打交道。
規格對照:差距在哪裡,一張表看完
| 項目 | A100 80GB(SXM) | H100 80GB(SXM5) |
|---|---|---|
| 架構 / 製程 | Ampere / 台積電 7nm | Hopper / 台積電 4N |
| 顯存 | 80GB HBM2e | 80GB HBM3 |
| 記憶體頻寬 | 約 2,000GB/s | 約 3,350GB/s |
| FP16 Tensor(dense) | 312 TFLOPS | 約 990 TFLOPS |
| FP8 支援 | 無 | 有,約 1,979 TFLOPS |
| NVLink 頻寬 | 600GB/s | 900GB/s |
| TDP | 400W | 700W |
| 台灣單卡月租行情 | NT$40,000 至 70,000 | NT$80,000 至 150,000 |
紙面上 H100 的 FP16 算力是 A100 的 3.2 倍,再加上 A100 完全沒有的 FP8 與 Transformer Engine,帳面差距可以拉到 6 倍。但帳面歸帳面,實際工作負載跑起來是另一回事,這正是甜蜜點存在的原因。

實測差距的真相:2.2 倍到 4 倍之間,看你吃不吃得滿
公開的 MLPerf 訓練測試與我們機房的實際經驗一致:大型 Transformer 訓練,H100 比 A100 快 2.2 至 3.1 倍;搭配 FP8 與 TensorRT-LLM 的推論場景,可以拉到 3 至 4 倍。但注意,這是「模型夠大、批次夠滿、軟體棧全面優化」的前提下。換成 3B 以下的小模型、傳統 CNN、或資料管線本身就是瓶頸的場景,差距會縮到 1.8 至 2.2 倍,因為 H100 的新單元根本吃不滿,你付的溢價在空轉。
一個常被忽略的事實:FP8 的效益需要工程投入才拿得到,模型要做量化感知的調校、框架要用對版本、kernel 要驗證數值穩定性。團隊如果沒有餘裕做這些,H100 實際跑 FP16 的差距就是 2.5 倍上下,而不是行銷簡報上的 6 倍。這時候「兩張 A100 對一張 H100」的等價交換,常常是預算表上更漂亮的答案。
多卡場景還要補一刀:A100 的 NVLink 是 600GB/s,H100 拉到 900GB/s,加上 NVSwitch 世代更新,8 卡訓練的通訊開銷差距比單卡數字更大。如果你的計畫是 4 卡以上的長期訓練,把互連差距也算進去,H100 的實際領先會比 MLPerf 單項數字再多一成上下;反之單卡或雙卡用途,這條差距可以直接忽略,別讓它干擾決策。
A100 依然划算的四種場景
場景一:電腦視覺與推薦系統。YOLO 系列、缺陷檢測、CTR 模型這類負載,運算密度吃不滿 Hopper 的 Tensor Core,A100 的 312 TFLOPS 綽綽有餘,瓶頸多半在資料載入而非算力。場景二:13B 以下模型的微調與實驗,80GB 顯存做 LoRA 遊刃有餘,訓練時間差距在小模型上絕對值很小,H100 快 2.5 倍省下的可能只是「4 小時變 1.6 小時」,月租差 NT$50,000 買這個不划算。場景三:FP64 科學運算,A100 的 19.5 TFLOPS(Tensor)對 CFD、分子動力學這類 HPC 負載依然夠用,而這類程式碼多半十年沒改,用不到 FP8。場景四:MIG 多租戶,A100 可切成最多 7 個獨立執行個體,拿來做教學環境、多團隊共享的開發機,每個座位的成本比任何新卡都低。
這四種場景有個共同的判斷技巧:打開 nvidia-smi 或 DCGM 看兩個數字,SM 使用率與記憶體頻寬使用率。如果你現在的卡跑起來 SM 長期低於六成,代表算力根本沒吃滿,換 H100 只是把「沒吃滿的算力」變成三倍,浪費得更快;這種負載租 A100 把使用率墊高,才是把錢花對地方。租卡之前先量測一週,勝過看一百篇評測文。
反過來,三種情況請直接放棄 A100:70B 以上模型的生產級推論(頻寬差距會直接反映在 tokens/s 與延遲上)、動輒兩週以上的大型訓練(時間成本壓過租金差)、以及需要長上下文高併發的服務(KV cache 對頻寬更敏感)。這些場景乖乖看 H100 租用指南,或者評估顯存更大的 H200。
甜蜜點試算:每 GB 顯存與每單位工時的成本
用兩把尺量。第一把尺是每 GB 顯存的月成本:A100 80GB 月租抓 NT$50,000,就是每 GB NT$625;H100 80GB 月租抓 NT$110,000,每 GB NT$1,375,差 2.2 倍。如果你的負載是「顯存綁定」而非「算力綁定」,例如塞好幾個中型模型做推論服務,A100 每 GB 成本便宜一半以上,答案很明顯。
第二把尺是含人力的總工時成本。假設一個訓練專案在 A100 上要跑 22 天,H100 上 8 天:A100 方案租金省 NT$60,000,但工程師薪資以月薪 NT$120,000 計,多等 14 天的機會成本約 NT$56,000,還沒算產品晚上市的商業損失,兩案打平甚至 H100 勝出。所以口訣是:一次性的長訓練看總工時,常態性的推論與小型實驗看每 GB 成本。把自己的數字套進去,五分鐘就有答案,不用聽任何人的信仰。
還有一種混搭策略值得考慮:開發與實驗用 A100,生產訓練衝刺用 H100 短租。例如平常養一張 A100 80GB(月租約 NT$50,000)跑資料處理、消融實驗與小規模驗證,重大版本要全量訓練時,再短租 H100 多卡一到兩個月。這種配置比全程 H100 省三到四成,比全程 A100 快,兩頭的好處都拿到,台灣月租制的彈性剛好支援這種打法。唯一要注意的是兩邊環境的一致性:CUDA 與框架版本鎖同一組,模型權重與資料管線放共享儲存,切換成本才會趨近於零。
台灣案例:醫療影像團隊的省法
台北一個和醫學中心合作的影像 AI 團隊,做 3D MRI 分割與病理切片分類,模型是 nnU-Net 加上一個 8B 的報告生成模型。他們評估過 H100 單卡方案(月租約 NT$110,000)與 2 張 A100 80GB 方案(月租合計約 NT$95,000),實測後選了後者:3D 分割訓練的瓶頸卡在資料 IO 與前處理,H100 的算力優勢只剩 1.9 倍,而兩張 A100 可以一張跑訓練、一張同時跑推論驗證,研究節奏反而更順。
省下來的月租差額,他們投資在 NVMe 快取碟與標註人力上,半年後模型指標的進步大部分來自資料品質,而不是算力。這個案例的教訓很實在:在算力採購上省下的每一塊錢,只有投資到真正的瓶頸上才算數。順帶一提,醫療資料的合規要求讓他們只考慮台灣在地機房,資料出境的法遵成本比租金差額大得多,這是台灣團隊選機房時常見的隱形決策因子。
後日談:一年後這個團隊的報告生成模型要對外上線,推論端補租了一張 H100 PCIe(月租約 NT$95,000)跑 FP8,訓練端維持兩張 A100 不動。新舊卡各司其職,總月租控制在 NT$19 萬以內,比全面換代省了快四成。老卡配新卡的混編,在 2026 年的台灣機房裡其實是最常見的隊形,別被「一步到位」的說法綁架。
2026 年的租用建議與退場時機
給三條具體建議。第一,A100 合約不要簽超過 12 個月:Blackwell 世代放量後,H100 租金在 2026 到 2027 年還有下修空間,屆時甜蜜點會往上移一個世代,把彈性留在手上。第二,新專案如果預期會用到 FP8、長上下文或 70B 以上模型,直接從 H100 起步,省去中途搬遷的陣痛;搬一次生產環境的工程成本,通常比省下的租金差多。第三,議價時拿雲端 spot 價格當籌碼,A100 的市場價格透明,台灣在地業者多半願意在長約上讓利 10% 至 20%。
至於「A100 什麼時候該徹底退場」,盯兩個訊號就好:一是你的核心框架宣布新版本停止 Ampere 優化(短期內看不到跡象,CUDA 對 Ampere 的支援預期至少延續到 2028 年),二是 H100 月租跌破 A100 的 1.5 倍,屆時每元效能全面反轉,就沒有理由再戀棧了。
供貨面的小提醒:A100 已停產,租賃機源全靠存量,熱門的 80GB SXM 整機偶爾要排隊兩到三週;議約時記得確認業者的備品庫存與換卡時效,老卡故障率雖然只是略高,但沒有備品的話,一次故障就可能停擺一週,這個風險比租金差可怕得多。把「備品在台、4 至 8 小時換卡」寫進合約,老卡的風險大致就被馴服了。
還有一個很少被寫進評估表、但實際影響很大的因素:人與生態。市場上熟悉這一代平台的工程師基數最大,踩坑文章、調校範本、除錯經驗俯拾皆是,新人接手幾乎沒有學習曲線;反觀最新平台的細部優化,常常要自己當白老鼠。對人力吃緊的中小團隊,這種「查得到答案」的成熟度,價值不輸帳面效能。混編部署時倒是有一個工程紀律要守:同一個訓練或服務叢集內,盡量讓同代卡同組,跨代混組時框架雖然能跑,但速度會被最慢的那張卡拖著走,量化格式的支援差異也容易埋雷。把新舊卡分開編組、各司其職,是混編省錢卻不惹麻煩的關鍵。

找台灣在地的 GPU 主機夥伴
不管你的答案是 A100 還是 H100,重點是找一個能陪你算這筆帳的供應商。戰國策集團的 GPU 主機服務提供 NVIDIA H100 與 RTX 全系列機種,台灣機房低延遲、資料不出境,彈性月租 NT$15,000 起,7×24 中文技術支援,顧問可以依你的模型規模與訓練排程直接試算兩代卡的總成本。官網 https://www.nss.com.tw/gpu 、LINE 官方帳號 @119m、免費專線 0800-003-191,把需求丟過來就對了。
常見問題 FAQ
2026 年 A100 在台灣的租金行情是多少?
A100 80GB 單卡月租約 NT$40,000 至 70,000,40GB 版約 NT$30,000 起,比 2023 年高峰便宜了四到六成;國際雲端時租也跌到每小時 US$0.8 至 1.5。對照 H100 單卡月租 NT$80,000 至 150,000,A100 的價格已經是一半以下,這正是它 2026 年重新有吸引力的原因。議價時可拿國際現貨價當基準,台灣業者的長約折扣空間通常還有一到兩成,在地支援的價值另計。
H100 實際上比 A100 快多少?
看負載。大型 Transformer 訓練依 MLPerf 與實務經驗快 2.2 至 3.1 倍;搭配 FP8 與 TensorRT-LLM 的推論可達 3 至 4 倍;但小模型、CNN、資料管線受限的場景會縮到 1.8 至 2.2 倍。帳面上 FP16 算力差 3.2 倍(990 對 312 TFLOPS),實際差距取決於你能不能把新硬體餵飽。建議拿自己的工作負載實測半天再決定,不同模型結構跑出來的差距可以差到一倍。
A100 的 HBM2e 和 H100 的 HBM3 差在哪?
頻寬差約 68%:A100 80GB 約 2,000GB/s,H100 SXM5 約 3,350GB/s。容量同為 80GB,所以「放不放得下」兩者相同,差在「搬多快」。大模型推論每個 token 都要掃過全部權重,頻寬直接決定 tokens/s,這是 70B 級推論建議上 H100 的主因;訓練或小模型場景頻寬差距的影響就小得多。若需求是長上下文加高併發,直接評估 141GB 的 H200 反而更省事。
A100 不支援 FP8 影響大嗎?
對大模型推論影響大,對其他場景有限。FP8 讓 H100 推論吞吐再翻近一倍,70B 模型可用約 70GB 顯存跑 FP8 精度;A100 只能用 INT8 或 FP16,量化工程更費工。但電腦視覺、推薦系統、FP64 科學運算根本用不到 FP8,這些負載租 A100 省下 50% 月租完全沒有代價。
什麼工作負載最適合撿 A100 的便宜?
四類:一是 YOLO、缺陷檢測等電腦視覺任務,312 TFLOPS 已供過於求;二是 13B 以下模型微調,80GB 跑 LoRA 綽綽有餘;三是 FP64 的 HPC 運算,19.5 TFLOPS 依然稱職;四是 MIG 多租戶場景,一卡切最多 7 份做開發機或教學環境,每席成本壓到最低。共通點是都吃不滿 H100 的新特性。
訓練專案怎麼判斷該租 A100 還是 H100?
算總成本而不是租金。公式:租金差額對比(縮短的天數乘以人力與商機成本)。例如訓練在 A100 跑 22 天、H100 跑 8 天,租金省 NT$60,000,但工程師月薪 NT$120,000 的 14 天機會成本約 NT$56,000,基本打平,H100 還讓產品早上市。一次性長訓練偏向 H100,常態性短實驗偏向 A100。
A100 的 MIG 功能可以怎麼運用?
A100 可切成最多 7 個獨立執行個體,每個有隔離的算力與顯存(80GB 版每份約 10GB),適合企業內部多團隊共享:白天切 7 份給開發與教學,晚上合併成整卡跑批次訓練。以單卡月租 NT$50,000 計,每個座位月成本僅約 NT$7,000,比每人配一張工作站卡便宜一半以上。
現在簽 A100 長約安全嗎,會不會很快被淘汰?
建議合約以 6 至 12 個月為限。軟體面風險低,CUDA 對 Ampere 的完整支援預期至少到 2028 年,PyTorch 與 vLLM 都沒有降級跡象;風險在價格面,Blackwell 放量後 H100 租金持續下修,若跌到 A100 的 1.5 倍以內,每元效能就全面反轉。短約保留轉換彈性,議價時還能拿雲端 spot 價當籌碼。
A100 適合跑 70B 大模型推論嗎?
能跑,但不建議當生產服務。70B 模型 4-bit 量化後約 40GB,單張 A100 80GB 放得下,拿來做內部測試沒問題;但生產級服務的吞吐受 2,000GB/s 頻寬限制,tokens/s 只有 H100 的六成左右,長上下文高併發下延遲更明顯。對外服務建議 H100 或 141GB 的 H200,體驗差距用戶感受得到。
租 A100 時要確認哪些配套規格?
四項:一是 PCIe 或 SXM 版本,SXM 有 600GB/s NVLink,多卡訓練效率高很多;二是搭配的 CPU 與記憶體,建議每卡至少 16 核與 128GB RAM,避免前處理卡脖子;三是 NVMe 空間與讀取速度,資料集大的團隊建議 7GB/s 等級;四是故障換卡 SLA,老卡故障率略高,4 至 8 小時內換卡的承諾要白紙黑字。