💡 快速答案:企業要私有部署 LLM,該怎麼選模型和 GPU 規格?
依任務難度選模型:內部問答用 7B-14B,進階分析用 32B——INT4 量化後約 18-20GB 顯存,24GB 卡可跑;70B 需 140GB 以上、至少雙 H100。授權上 Qwen 是 Apache 2.0、DeepSeek 是 MIT 最單純。台灣機房單卡月租 NT$15,000 起,POC 兩到四週。
過去兩年,台灣企業對生成式 AI 的態度走了一個完整的弧線:從「先用 ChatGPT 試試」,到法務跳出來擋下所有把客戶資料貼進境外服務的行為,再到現在——「我們能不能自己架一套?」答案是可以,而且 2026 年的開源模型生態已經成熟到,多數企業任務用開放權重模型就能做到商用等級。這篇攻略把私有 LLM 部署的完整決策鏈走一遍:為什麼要私有化、模型怎麼挑、GPU 規格怎麼配、推論引擎怎麼選,以及一個台灣金融業的實際導入時程與成本。讀完你可以直接拿著這份清單跟主機商或內部團隊開需求會議,每一個環節都有可以驗證的數字。
三個回不去的理由:法遵、成本、延遲
企業選擇私有部署,理由通常不是情懷。第一個是資料主權與法遵:個資法對當事人資料的利用有明確界線,金管會對金融機構使用雲端服務另有委外規範,醫療則有醫療法與人體研究的資料限制。把病歷、對帳單、客訴紀錄送進境外 API,法遵部門要背的評估與舉證成本,常常比 GPU 還貴。私有部署把整條資料流關在自家或台灣機房內,稽核時一句「資料不出境」能省掉大半文書工作。
第二個是成本結構:API 按 token 計費,用量成長帳單跟著失控;自建是固定月租,量越大單位成本越低。一個內部工具從 50 人試用擴大到全公司 800 人,API 帳單會長 16 倍,自建主機可能只需要從單卡升級成雙卡。第三個是延遲與可控性:台灣機房內網往返 5ms 以內,海外 API 動輒 100ms 起跳,還要承受對方改版、限流、模型下架的風險——2025 年幾波商用模型無預警調價與版本汰換,讓不少把 LLM 綁進核心流程的公司吃過悶虧。當你的產品把 LLM 當成核心元件而不是玩具,這三點遲早會把你推向私有化。
要不要「全部」私有化則是另一題。務實的答案常是分流:敏感資料與高頻任務走私有模型,偶發的長尾雜務留在商用 API,兩邊用同一套 OpenAI 相容介面切換。這種混合架構讓你不必為了 5% 的特殊需求,把私有叢集規格拉到天上。

模型怎麼挑:授權先看,再看中文能力
2026 年可商用的開放權重模型主要三個家族。Qwen2.5 系列(0.5B 到 72B)多數尺寸採 Apache 2.0 授權,商用最乾淨,繁體中文能力在開源陣營裡屬第一梯隊,是台灣企業的預設起點。DeepSeek 系列採 MIT 授權,R1 推理模型與其蒸餾版(7B 到 70B)在數學、程式、多步推理任務上表現突出,各版本的顯存需求整理在 DeepSeek R1 GPU 需求對照。Llama 3.x 系列生態工具最完整,但用的是 Meta 社群授權,有月活躍用戶數等附帶條件,法務過件前要看清楚。
繁體中文有幾個實測才會浮現的細節:部分模型輸出會夾雜簡體字或中國用語(「軟件」「視頻」這類),對外文件不能接受,解法是系統提示詞強制台灣用語加後處理檢查,或直接挑繁中表現穩定的模型版本;金融與法律的專有名詞理解也要專門測,「附買回」「融資融券」這種詞彙,不同模型的表現差距很大。建議的做法是準備 50-100 題你自己領域的測題,拉兩三個候選模型做盲測,由業務單位而不是工程師評分。
挑尺寸的原則比挑家族簡單:內部問答、摘要、格式轉換,7B-14B 就夠;涉及多步推理、長文分析、程式生成,32B 是品質與成本的甜蜜點;70B 留給對答案品質錙銖必較的場景。別迷信參數量——盲測常常發現 14B 在你的任務上跟 32B 打平,一年省下的月租差價是六位數。另外記得看模型的「款式」:一般指令模型反應快、適合日常任務;推理模型(如 R1 系列)會先輸出思考過程,難題正確率高但 token 消耗數倍,兩種各架一個、按任務路由,是越來越主流的配置。
下載與供應鏈也別隨便:權重一律從官方 Hugging Face 帳號或可信鏡像取得,核對雜湊值並記錄版本;推論框架與相依套件鎖定版本,進了內網就不隨意更新。曾有企業從來路不明的鏡像抓了號稱加速版的權重,行為跟官方版有出入,查了兩週才找到源頭。私有部署的安全紅利,建立在你對每一個元件的來源都有掌握的前提上,這份清單值得放進資安檢核表。
GPU 規格對照:從 7B 到 70B 的顯存帳
| 模型規模 | FP16 推論顯存 | INT4 量化顯存 | 建議配置(含 KV cache 餘裕) |
|---|---|---|---|
| 7B-8B | 14-16GB | 5-6GB | 1×RTX 4090 24GB |
| 14B | 28-32GB | 9-11GB | 1×RTX 4090(INT4)或 1×L40S 48GB(FP16) |
| 32B | 64-70GB | 18-20GB | 1×RTX 4090(INT4)或 1×H100 80GB(FP16) |
| 70B-72B | 140-150GB | 40-45GB | 2×H100(FP16)或 2×RTX 4090 / 1×L40S+(INT4) |
三個規劃要點。量化是私有部署的好朋友:INT4 讓顯存需求砍半再砍半,主流任務的品質損失多在 2-3% 內,先上量化版、有預算再升 FP16 是務實路線。KV cache 要另外算:表中權重之外,每一路併發、每 4K token 的上下文,依模型會再吃 0.5-2GB,對外服務至少預留 30% 顯存。還有升級路徑:用支援張量平行的推論引擎,之後從單卡換雙卡、雙卡換 H100,服務層程式碼幾乎不用改。
用一個情境把 KV cache 講得更白:你部署 32B INT4(權重 20GB)在一張 24GB 卡上,單人使用一切正常;開放給 50 人後,尖峰 6 路併發、每路 8K 上下文,KV cache 需要 6-12GB,這張卡立刻爆。同一個模型,規格卻要看「誰在用、怎麼用」,這就是為什麼報規格前要先回答併發數與上下文長度兩個問題,而不是只報模型名字。長文件分析場景(動輒 32K 上下文)更要特別小心,單路的 KV cache 就可能吃掉 4-8GB。
推論引擎與服務化:從 Ollama 到 vLLM
模型下載下來只是權重檔,要變成服務還缺一層推論引擎。POC 階段用 Ollama 最快,一行指令拉起模型,適合給內部小規模試用;要上生產環境,vLLM 或 SGLang 才是正解——它們的 continuous batching 與 PagedAttention 能把同一張卡的吞吐拉高 5-10 倍,並提供 OpenAI 相容 API,前端應用只要改一行 base_url 就能從商用 API 無縫切換過來。
服務化的細節——延遲怎麼壓、併發怎麼估、要不要開多副本——是另一篇的主題,見 AI 推論 API 自建教學。這裡只強調一件最常被忘掉的事:私有部署不等於裸奔。API key 的發放與輪替、請求與回應日誌(含個資遮罩)、輸入輸出的敏感詞過濾、每月用量報表——這些治理機制要在第一天就做,不然「私有」只是把風險從供應商搬回自己家。金融業的稽核尤其會查日誌完整性與權限分離,補做的成本是先做的三倍起跳。
維運面給一個誠實的預期:私有 LLM 上線後的常態工作量,約是每週半天到一天——看監控、處理個案、每月演練一次故障重啟、每季評估一次新模型。這不需要專職團隊,但需要一個明確的負責人;完全沒有 Linux 維運能力的公司,建議把這層外包給主機商的託管服務,別讓系統變成沒人敢動的孤兒。
台灣案例:投信公司的內部文件助理
一家台北的投信公司,120 名員工,想讓研究員用自然語言查詢內部研究報告、公開說明書與法遵文件。資料屬性決定一切:這些文件不能離開公司控制範圍,金管會的雲端委外規範也讓境外 API 直接出局。他們的做法是在台灣機房租一台 H100 80GB 主機,跑 Qwen2.5-32B FP16 配 vLLM,前面接 RAG 檢索層,月租約 NT$70,000。
時程走得很典型:第 1-2 週用一張 4090 主機(月租 NT$18,000)做 POC,拿 80 題研究員實際會問的問題盲測 7B、14B、32B 三個尺寸,結論是 32B 在跨文件比對題上正確率高出 14B 約 12 個百分點,值得上;第 3-6 週建正式環境、接 SSO 權限與稽核日誌;第 7-8 週試營運。POC 用小卡、正式上大卡的兩段式做法,讓他們在只花 1.8 萬的階段就修正了兩個方向性決策——原本想用 70B,盲測發現對他們的題型增益不到 3 個百分點,直接省下一半月租。
上線三個月的營運數字:研究員平均每天問 340 次,尖峰併發 8 路,p95 回應延遲 2.1 秒;使用率最高的不是原本設想的報告查詢,而是「幫我把這段英文法遵函釋整理成繁中重點」這類翻譯摘要任務,佔了四成流量——這也是私有部署的隱藏優勢,用量爆了也不心疼,員工才敢把它用進日常。法遵部門的評語比任何跑分都有說服力:資料流全程在境內,稽核一次過。
導入時程與總成本怎麼抓
綜合幾十個案子的經驗,私有 LLM 部署的合理時程是:POC 兩到四週(單卡主機、量化模型、內部評測集),試營運四到六週(正式規格、權限與日誌、小範圍開放),然後全面上線。硬體之外的成本大頭是人:需要一位能維運 Linux 與容器的工程師兼職照顧,加上業務單位一位懂資料的窗口。全案抓下來,中型企業第一年的總持有成本多落在 NT$50 萬到 200 萬之間,對比動輒七八位數的商用授權案,這個數字通常過得了董事會。時程的最大變數在資料:文件散亂、權限歸屬不明的公司,前置整理常吃掉一半時間,這部分請誠實評估。
驗收建議寫成里程碑:POC 結束要有盲測分數與規格建議書;試營運結束要有 p95 延遲、可用率與使用量報表;全面上線滿一個月,要有部門滲透率與滿意度數字。每一關都有可驗證的產出,預算追加才有依據,專案也不會走著走著變成沒人敢驗收的懸案。
把第一年 TCO 拆開看會更好談預算:主機月租(單卡 NT$15,000-25,000 或 H100 級 NT$60,000-80,000)占五到七成,導入期的顧問或工程工時占兩到三成,剩下是評測、資安檢測與雜項。第二年起只剩月租與少量維運,成本曲線是前高後低。至於「租還是買」:買一台 H100 等級主機資本支出數百萬,加上機房、電力、備品與三年折舊,只有在負載長期滿載時才划算;先租十二個月把規格試到收斂,再拿真實使用率去算買斷的回本期,是財務上最站得住腳的順序。
最容易被砍掉重練的錯誤只有一個:第一天就買卡。模型迭代太快,今天為 70B 買的 8 卡機,半年後可能被 32B 的新模型追平。用台灣機房的月租主機把規格試到收斂,再決定要不要自建,是風險最低的路。

找台灣在地的 GPU 主機夥伴
私有 LLM 部署的每個階段需要的火力不同:POC 用單張 RTX 4090,正式環境可能要 H100 多卡。戰國策 GPU 主機提供 NVIDIA H100 與 RTX 系列多種配置,台灣機房、資料不出境,月租 NT$15,000 起,7×24 中文技術支援,規格可隨導入階段升級。方案細節見 戰國策 GPU 主機,或加 LINE @119m、撥免費專線 0800-003-191,顧問會依你的資料敏感度與任務需求試算規格。
常見問題 FAQ
私有部署 LLM 最低的硬體門檻是多少?
一張 24GB 的 RTX 4090 就能起步:7B 模型 FP16 推論占 14-16GB,或 32B 的 INT4 量化版占 18-20GB,都放得下。台灣機房這種單卡主機月租約 NT$15,000-25,000,足夠支撐數十人的內部使用,是最常見的 POC 起點。
開源模型商用,授權上要注意什麼?
Qwen2.5 多數尺寸是 Apache 2.0、DeepSeek 是 MIT,商用幾乎沒有附帶條件;Llama 3.x 用 Meta 社群授權,有大型平台月活門檻與再散布規定,需要法務確認。另外注意部分模型的量化版與衍生版授權可能與原版不同,下載來源要留紀錄備查。
7B、32B、70B 模型的能力差距到底多大?
以企業任務實測,7B 足以應付摘要、分類、格式轉換;32B 在多步推理與跨文件分析上,正確率常比 7B 高 15-25 個百分點;70B 再往上的增幅通常剩 3-8 個百分點,但顯存需求翻倍。建議用自己的 50-100 題測題盲測,而不是看排行榜。
INT4 量化會讓模型變笨嗎?
主流 GPTQ、AWQ 量化在常見任務上的品質損失約 1-3%,多數使用者感覺不出來;顯存卻能省 70% 以上,32B 從 64-70GB 壓到 18-20GB。要求最高的場景(法律條款比對、程式生成)可以 FP16 與 INT4 各架一套 A/B 實測再決定。
私有部署後,模型多久要更新一次?
開源模型大約每 3-6 個月出現一波明顯升級。建議每季用固定評測集重測一次新模型,分數高出 5 個百分點以上再換,避免追版本疲勞。換模型的成本主要在重跑評測與回歸測試,權重本身下載替換半天內可完成。
vLLM 和 Ollama 該用哪個?
POC 與個人使用選 Ollama,安裝到起服務 10 分鐘搞定;正式環境選 vLLM 或 SGLang,continuous batching 可把同卡吞吐拉高 5-10 倍,多人併發下的 p95 延遲差距非常明顯。兩者都有 OpenAI 相容 API,前期驗證、上線切換很順。
金融業用私有 LLM,法遵上可行嗎?
可行,而且私有化正是為了過法遵:資料全程留在境內機房,滿足個資法與金管會對委外及資料治理的要求,搭配存取控制與完整日誌即可受檢。台灣已有投信、銀行把內部文件助理跑在自建或租用 GPU 主機上的案例,稽核重點是資料流向與權限紀錄。
私有 LLM 的回應速度大概多快?
單使用者:7B 在 RTX 4090 上約每秒 60-100 個 token,32B INT4 約 25-40 個,一段 300 字回答 10 秒內完成;上 vLLM 後 10-20 路併發仍可維持每人每秒 20 個 token 以上。台灣機房網路往返約 5ms,體感比海外 API 快得多。
除了 GPU,主機的 CPU 和記憶體要怎麼配?
推論主機的通則是:系統記憶體至少是總顯存的 1.5-2 倍(載入與轉檔時要用),CPU 8-16 核心即可,硬碟建議 NVMe SSD 500GB 起跳放多版本權重。RAG 場景另外加向量資料庫的 16-32GB 記憶體。這些在租用方案裡通常已包含,確認規格單即可。
一年的總持有成本大概多少?
以 120 人企業、32B 模型、單張 H100 規格估:主機月租約 NT$60,000-80,000,一年 72-96 萬;加上工程師兼職維運與前期導入顧問,第一年總成本常落在 NT$100-200 萬。同樣用量走商用 API,帳單加法遵評估往往不會比較便宜,且資料須出境。