
私有 LLM 部署完整攻略:資料不出門的企業 AI,從模型挑選到 GPU 規格
💡 快速答案:企業要私有部署 LLM,該怎麼選模型和 GPU 規格? 依任務難度選模型:內部問答用 7B-14B,進階分析用 32B——INT4 量化後約 18-20GB 顯存,24GB 卡可跑;70B 需 140GB 以上、至少雙 H100。授權上 Qwen 是 Apache 2.0、DeepSeek 是 MIT 最單純。台灣機房單卡月租 NT$15,000 起,POC 兩到四週。 過去兩年,台灣企業對生成式 AI 的態度走了一個完整的弧線:從「先用 ChatGPT 試試」,到法務跳出來擋下所有把客戶資料貼進境外服務的行為,再到現在——「我們能不能自己架一套?」答案是可以,而且 2026 年的開源模型生態已經成熟到,多數企業任務用開放權重模型就能做到商用等級。這篇攻略把私有 LLM 部署的完整決策鏈走一遍:為什麼要私有化、模型怎麼挑、GPU 規格怎麼配、推論引擎怎麼選,以及一個台灣金融業的實際導入時程與成本。讀完你可以直接拿著這份清單跟主機商或內部團隊開需求會議,每一個環節都有可以驗證的數字。 三個回不去的理由:法遵、成本、延遲 企業選擇私有部署,理由通常不是情懷。第一個是資料主權與法遵:個資法對當事人資料的利用有明確界線,金管會對金融機構使用雲端服務另有委外規範,醫療則有醫療法與人體研究的資料限制。把病歷、對帳單、客訴紀錄送進境外 API,法遵部門要背的評估與舉證成本,常常比 GPU 還貴。私有部署把整條資料流關在自家或台灣機房內,稽核時一句「資料不出境」能省掉大半文書工作。 第二個是成本結構:API 按 token 計費,用量成長帳單跟著失控;自建是固定月租,量越大單位成本越低。一個內部工具從 50 人試用擴大到全公司 800 人,API 帳單會長 16 倍,自建主機可能只需要從單卡升級成雙卡。第三個是延遲與可控性:台灣機房內網往返 5ms 以內,海外 API 動輒 100ms 起跳,還要承受對方改版、限流、模型下架的風險——2025 年幾波商用模型無預警調價與版本汰換,讓不少把 LLM 綁進核心流程的公司吃過悶虧。當你的產品把 LLM 當成核心元件而不是玩具,這三點遲早會把你推向私有化。 要不要「全部」私有化則是另一題。務實的答案常是分流:敏感資料與高頻任務走私有模型,偶發的長尾雜務留在商用 API,兩邊用同一套 OpenAI 相容介面切換


















