DeepSeek R1 版本怎麼選?7B 到 671B GPU 需求對照與部署實測
365天全年無休服務專線 0800-003-191

DeepSeek R1 該選哪個版本?7B/32B/70B/671B 的 GPU 需求對照表與部署實測

💡 快速答案:DeepSeek R1 各版本分別需要什麼 GPU 才能跑?

蒸餾版 7B/8B 需 14-16GB 顯存,一張 RTX 4090 可跑;32B 的 INT4 量化約 18-20GB、FP16 要 64-70GB;70B 要 140-150GB,建議雙 H100。滿血 671B 是 MoE 架構,FP8 需 700GB 以上、8×H200 等級。多數企業從 32B 蒸餾版起手。

DeepSeek R1 在 2025 年初用一紙 MIT 授權和逼近閉源旗艦的推理能力,把「企業自建 AI」的門檻直接砍了一截。一年多過去,它仍是台灣企業私有部署詢問度最高的模型家族——但也是版本誤會最多的一個。很多人以為自己要部署的是「那個 671B 的 DeepSeek」,實際上多數場景該用的是 7B 到 70B 的蒸餾版,兩者的硬體需求差了一個數量級,月租差距可以從一萬五到七位數。這篇把每個版本的 GPU 需求、實測速度、適用場景一次對照清楚,再給出台灣企業的選版決策路徑,幫你把預算花在真正需要的推理能力上。

R1 為什麼紅:推理模型加 MIT 授權

R1 屬於推理模型(reasoning model):回答前會先生成一長段思考鏈,把問題拆解、驗算、自我修正,再給出答案。這讓它在數學、程式、邏輯分析、複雜文件比對這類任務上,表現遠超同尺寸的一般指令模型。對企業更關鍵的是授權:MIT 授權幾乎沒有商用限制,可以改、可以蒸餾、可以包進產品賣,法務審查的阻力比社群授權的模型小得多。

代價也要先講明:思考鏈是用 token 買來的。同一個問題,一般模型 300 字收工,R1 可能先「想」2,000 到 8,000 個 token 才開始回答,輸出總量常是 3-10 倍,回應時間以十秒到分鐘計,KV cache 的顯存占用也跟著暴增。簡單的分類、摘要、格式轉換用 R1 是浪費——更慢、更貴、還不見得更準;R1 的主場是「答錯成本很高、值得讓它想久一點」的題目:合約條款衝突檢查、財務數字勾稽、程式除錯、多條件的方案評估。

務實的部署形態因此很清楚:R1 幾乎不會是企業唯一的模型,而是跟一般指令模型並排,由應用層按任務路由——日常雜務走快的,難題走 R1。這個「雙模型」前提會影響你後面每一個規格決策。

判斷哪些任務值得導到 R1,有個很土但有效的方法:把過去三個月人工修改率最高的十類任務攤開,圈出「錯了會賠錢」的那幾類——對帳異常分析、報價條件檢核、程式碼審查、合約風險標記。以一家導入過的公司為例,R1 只接手全系統 15% 的流量,卻消化掉了返工與客訴成本的大宗;剩下 85% 的摘要翻譯雜務,繼續讓一般模型用三分之一的成本跑。

DeepSeek R1 該選哪個版本?7B/32B/70B/671B 的 GPU 需求對照表與部署實測
▲ 蒸餾版 7B/8B 需 14-16GB;滿血 671B FP8 需 700GB 以上

版本釐清:滿血 671B 與蒸餾版是兩回事

DeepSeek R1 本尊是 671B 參數的 MoE(混合專家)模型。MoE 的特性是每次推論只「啟用」約 37B 參數,計算量像個中型模型,但路由器隨時可能點名任何一組專家,所以全部 671B 的權重都得待在顯存裡——這就是為什麼它計算不算太重、顯存需求卻是怪獸級:FP8 精度下要 700GB 以上,屬於 8×H200 單機或雙節點 8×H100 的世界。

官方同步釋出了一整排蒸餾版:以 Qwen 為底的 1.5B、7B、14B、32B,和以 Llama 為底的 8B、70B,用 R1 生成的推理資料訓練,學到了思考鏈的行為模式,能力隨尺寸遞減。底模血統有實務意義:Qwen 底的版本中文表現通常較穩,Llama 底的英文生態工具較齊,做繁中應用的台灣企業多半從 Qwen 底的 14B 或 32B 開始測。

坊間常見的誤解是「蒸餾版是閹割品,沒有價值」。實測結論恰好相反:32B 蒸餾版在多數企業推理任務上已能交付可用的品質,而部署成本只要滿血版的二十分之一。務實的問法不是「要不要上 671B」,而是「32B 夠不夠、什麼題目才值得升 70B」。

下載時的命名陷阱也提醒一下:模型倉庫上叫 DeepSeek-R1 的是 671B 本尊,蒸餾版的全名是 DeepSeek-R1-Distill-Qwen-32B 這種格式,少看一眼就會下錯檔案;社群還流通大量第三方微調與量化變體,品質參差不齊。企業部署建議認官方帳號的權重,量化版挑下載量大、附評測數據的來源,並把檔案雜湊值記進部署文件,日後出現怪行為才有辦法追查到底是模型的問題還是自己的問題。

GPU 需求對照表:1.5B 到 671B

版本 FP16 顯存需求 INT4 量化顯存 建議配置 單流速度參考
R1-Distill 1.5B 3-4GB 1-2GB 任何現代 GPU 100+ token/s
R1-Distill 7B/8B 14-16GB 5-6GB 1×RTX 4090 60-100 token/s
R1-Distill 14B 28-32GB 9-11GB 1×RTX 4090(INT4) 35-60 token/s
R1-Distill 32B 64-70GB 18-20GB 1×4090(INT4)或 1×H100(FP16) 25-45 token/s
R1-Distill 70B 140-150GB 40-45GB 2×H100(FP16)或 2×4090(INT4) 15-30 token/s
R1 滿血 671B(MoE) FP8 700GB 以上 約 350-400GB 8×H200 或雙節點 8×H100 依配置 10-25 token/s

表中速度是單使用者連續生成的區間值,實際會隨推論引擎、context 長度與量化方式浮動。另外提醒:R1 系列因為思考鏈很長,顯存要在權重之外多留 20-40% 給 KV cache,尤其是 32B 以上搭配 8K-32K context 的場景,這筆帳漏算是部署後 OOM(顯存不足)的頭號原因。

量化格式的選擇也交代一下:走 vLLM 生產部署,選 AWQ 或 GPTQ 的 4-bit 版本,吞吐與相容性最好;用 Ollama 快速起步,抓 GGUF 格式的 Q4_K_M 等級即可,品質與體積的平衡點很成熟。同一個 32B,不同量化等級的顯存可以差出 5GB 以上,下載前先看清楚檔名後綴,別拿 Q8 的檔案塞 24GB 的卡。

context 長度對顯存的影響值得單獨講:同樣是 32B INT4,限制 8K context 的服務跟開放 32K 的服務,KV cache 預算差了四倍。文件分析型應用——把整份合約或規格書丟進去那種——幾乎都要 16K 起跳,這時單卡 24GB 就不夠看了,直接規劃 48GB 卡或雙卡配置,省得上線一週就被顯存不足的警報追著跑。

部署實測筆記:三種常見配置的真實表現

我們在台灣機房實際部署過的三種典型配置,數字給你參考。配置一:單張 RTX 4090 跑 32B 的 INT4 量化版(AWQ),Ollama 起服務,單流輸出 25-35 token/s,一題需要完整思考鏈的分析題約 40-90 秒跑完,適合 10-30 人的內部使用。配置二:單張 H100 80GB 跑 32B FP16 配 vLLM,單流 40-55 token/s,continuous batching 下同時服務 15-20 路併發仍能維持每路 20 token/s 以上,適合百人級企業或對外服務。

配置三:雙 4090 跑 70B INT4,張量平行切兩卡,單流 15-22 token/s。品質上,70B 對 32B 的優勢集中在長鏈推理與艱深領域題,一般企業問答的盲測勝率差距約一成;但速度慢了四成,月租多一倍。這也是為什麼我們最常給的建議是:32B 起手,用你自己的題目測,證明不夠再升級。

兩個實測才會知道的細節。TTFT(第一個字出現的時間)在 R1 上要重新理解:如果你把思考鏈隱藏、只給最終答案,使用者會盯著空白畫面等一兩分鐘,體驗極差——建議至少顯示「思考中」的進度或摘要。還有思考長度的長尾:同一個模型,九成題目 2,000 token 內想完,偶爾一題會想到 10,000 token 以上,不設上限的話,尖峰時段一題就能拖垮整條佇列,上線前一定要配 token 預算與逾時截斷。完整的模型挑選方法論可以參考 私有 LLM 部署完整攻略

上線前的壓測劇本照抄即可:用歷史真題組一個 100 題的混合集,短題七成、長題三成,以目標併發數灌進去跑半小時,記錄 p50/p95 延遲、總吞吐與截斷率;再故意塞進三題已知會想很久的難題,確認佇列調度不會被單題塞死。這套流程一個下午跑得完,能提前抓出九成的容量問題,比上線後被使用者抓到便宜太多。

台灣企業怎麼選:法遵是加分題,任務是必考題

R1 對台灣企業還有一層現實意義:它讓「資料不出境的高階推理能力」變成可負擔的選項。金融業要分析內部審計報告、製造業要比對製程異常紀錄、律所要跑合約條款審閱——這些資料按個資法與各行業主管機關的要求,出境都是麻煩事,而 R1 蒸餾版讓這類任務可以完全在台灣機房內完成,MIT 授權也讓法務不用再為商用條款開好幾輪會。

一家新竹的 IC 設計服務公司是很典型的樣板:他們用單張 H100 跑 32B 蒸餾版,做內部技術文件的推理問答與規格衝突檢查,規格書與客戶資料全程不落地到任何境外服務,法遵審查兩週過件。導入時他們拿 50 題歷史案例盲測,32B 在「找出兩版規格書的矛盾點」這類題目的命中率約八成五,資深工程師的平均審閱時間從 50 分鐘降到 15 分鐘——剩下的一成五漏網,由人工複核補上,人機分工反而比全自動更受工程師信任。

金融場景再給一個輪廓:某投顧團隊把 32B 蒸餾版接進晨會流程,清晨自動比對前一日的公告與研究底稿,標記數字不一致或說法矛盾的段落,供研究員開盤前複核。跑在單張 H100 上,每天處理約 300 份文件,負載尖峰集中在清晨 6 到 8 點,其餘時段這張卡就轉去服務一般的內部問答——推理模型與指令模型共用硬體、分時排程,是把 H100 月租攤薄的標準做法,值得直接抄進你的架構。

選版的決策樹很短:預算單卡 24GB 以內,選 7B/8B 做輔助性任務;要正經的推理品質,32B INT4 是性價比之王;唯有當你用 50 題實際業務題盲測、確認 32B 明顯不夠,才考慮 70B;至於滿血 671B,除非你要對外提供旗艦級 AI 服務或做模型研究,否則多數企業碰不到需要它的那一天。

從模型到服務:上線前的最後三關

選好版本只是一半,R1 上線還有三個特有的坑。思考鏈的顯示策略:內部工具可以顯示完整推理過程輔助查核,對外服務通常隱藏、只回最終答案,兩者的 token 成本與體驗設計差好幾倍,要在產品設計時就決定。context 與併發的預算:R1 一題思考動輒數千 token,32B FP16 每路 4K context 的 KV cache 約再吃 1-2GB,併發數要按這個帳去乘。超時與截斷機制:給思考鏈設 token 上限(常見 4K-8K)與逾時保護,避免個別難題把整個服務卡死。

監控也要為推理模型調整:除了常規的延遲與吞吐,多看兩個指標——平均思考 token 數(突然變長常代表題型漂移或 prompt 被改壞)與截斷率(超過 5% 就該檢討上限設定或題目分流)。搭配每月一次的答案品質抽查,R1 服務才能長期穩定。版本更新也要守紀律:新版蒸餾模型先進影子環境跑一週,對同一批題目比較思考長度與答案品質,確認沒有回歸再切流量;思考鏈行為對系統提示詞極度敏感,任何一行改動都要走同一套回歸,別讓小改動把平均思考長度翻倍,延遲跟成本一起爆炸。這些服務化細節——OpenAI 相容 API、批次策略、告警設計——的完整做法,見 AI 推論 API 自建教學。把這三關過完,R1 才算真正從「跑得動」變成「用得住」。

DeepSeek R1 該選哪個版本?7B/32B/70B/671B 的 GPU 需求對照表與部署實測
▲ DeepSeek R1 版本對照

找台灣在地的 GPU 主機夥伴

部署 R1 蒸餾版,從單張 RTX 4090 跑 32B INT4,到雙 H100 跑 70B FP16,規格彈性很大。戰國策 GPU 主機提供 NVIDIA H100 與 RTX 系列多種配置,台灣機房、資料不出境,月租 NT$15,000 起,7×24 中文技術支援,可以先租單卡驗證、確認版本後再升級。方案細節見 戰國策 GPU 主機,或加 LINE @119m、撥免費專線 0800-003-191,顧問會依你的任務類型建議 R1 版本與對應規格。

常見問題 FAQ

DeepSeek R1 滿血版和蒸餾版差在哪?

滿血版是 671B 的 MoE 模型,推理能力最強,但 FP8 就要 700GB 以上顯存,屬於 8×H200 等級的部署;蒸餾版是把 R1 的推理風格訓進 Qwen/Llama 底模,有 1.5B 到 70B 六個尺寸,一張 RTX 4090 就能起步。多數企業任務用 32B 蒸餾版已可交付。

一張 RTX 4090 可以跑哪個版本的 R1?

24GB 可跑:7B/8B 的 FP16 版(14-16GB)、14B 的 INT4 版(9-11GB)、32B 的 INT4 版(18-20GB,較緊)。跑 32B 時建議把 context 控制在 8K 內,留足 KV cache 空間,單流速度約 25-35 token/s,內部使用夠流暢。

部署滿血 671B 需要什麼等級的硬體?

FP8 精度需要 700GB 以上顯存,對應 8×H200(1,128GB)單機,或雙節點 8×H100 加高速互連;INT4 量化可壓到 350-400GB,單機 8×H100(640GB)勉強可行。這是月租七位數的等級,建議先確認 32B/70B 蒸餾版真的不敷使用再評估。

R1 是推理模型,和一般 LLM 用起來差在哪?

R1 回答前會先輸出思考鏈,自我拆解與驗算,數學、程式、邏輯題的正確率明顯高於同尺寸一般模型;代價是輸出 token 常多 3-10 倍、回應時間以十秒計。簡單的摘要分類任務用一般模型更划算,R1 適合答錯成本高的分析型任務。

R1 蒸餾版的實際生成速度多快?

單使用者:7B 在 4090 上約 60-100 token/s,32B INT4 約 25-35,H100 跑 32B FP16 約 40-55,70B INT4 雙 4090 約 15-22。加上思考鏈長度,一題完整推理常需 30 秒到 2 分鐘,設計使用者體驗時要把等待時間納入。

為什麼說 32B 是企業部署的甜蜜點?

32B 蒸餾版的推理品質已足夠處理多數企業分析任務,INT4 量化後 18-20GB 顯存讓單張 24GB 卡就能服務,月租成本約 NT$15,000-25,000;升到 70B 品質提升約一成,成本卻翻倍。先用 32B 搭配自家題庫實測,確認不足再升級,是最省錢的路徑。

R1 的 KV cache 為什麼特別吃顯存?

思考鏈讓每次生成的 token 數暴增,context 累積得比一般模型快。以 32B FP16 為例,每路 4K context 的 KV cache 約 1-2GB,10 路併發就要再多 10-20GB。部署時顯存要在權重外預留 20-40%,並給思考鏈設 4K-8K 的 token 上限。

R1 可以商用嗎?授權有什麼限制?

R1 與其蒸餾版採 MIT 授權,可商用、可修改、可再散布,幾乎沒有附帶條件,是目前主流開源模型中授權最寬鬆的之一。注意蒸餾版的底模授權仍要一併確認:Qwen 底的多為 Apache 2.0,Llama 底的要遵循 Meta 社群授權條款。

用 R1 做繁體中文任務,表現如何?

R1 系列的中文能力整體優秀,繁中輸出偶有簡繁混用,可用系統提示詞強制繁體並搭配後處理修正,實務上處理後的繁中可用率在 95% 以上。對用字精確度要求極高的場景(法律、公文),建議在評測集加入用字檢查項目再決定版本。

從下載模型到上線服務,大概要多久?

單卡跑蒸餾版的話很快:權重下載數十 GB 約半天,Ollama 或 vLLM 起服務 1-2 小時,加上內部評測與提示詞調校,一週內可完成 POC。正式上線含權限、日誌與監控,常見時程是 3-6 週。滿血版因涉及多卡多節點調校,要另抓 2-4 週。

               

戰國策 AI 客服系統,可1抵5位真人客服成本!自動回覆 80% 常見問題,支援串接官網、LINE、FB、IG等主流平台。24小時秒回不漏單!立即免費試用

邀請你免費加入我們的LINE社群 : 【戰國策戰勝學院】,和一群真正想搞懂商業、提升營收的老闆一起成長!