💡 快速答案:LLM 微調該選 LoRA 還是 Full Fine-tuning?
八成企業場景用 LoRA 就夠:凍結原模型、只訓練低秩適配層,顯存約全參數微調的 1/3-1/10,7B 模型一張 RTX 4090 就能跑。Full Fine-tuning 效果上限較高,但 7B 就要 110GB 以上顯存、成本高 5-10 倍。建議先用 QLoRA 花半天驗證資料有訊號,再決定要不要加碼。
「我們想微調一個自己的模型」,這大概是 2026 年台灣企業 AI 導入會議上出現頻率最高的一句話。但再往下追問,十個團隊有八個說不清楚要微調什麼、需要幾張 GPU、預算該抓多少,甚至分不清自己要解的問題到底需不需要微調。這篇文章把 LLM 微調的兩條主要路線——LoRA 與 Full Fine-tuning(全參數微調)——的原理、顯存需求、訓練時間與租用成本一次算清,並附上一個台灣電商團隊從 POC 到上線的完整時程。先講立場:除非你已經用 LoRA 驗證過效果而且確定不夠,否則不要從全參數微調開始,這條原則能替多數團隊省下第一筆冤枉錢。
先確認你要解的是「行為問題」還是「知識問題」
微調改變的是模型的「行為」:輸出格式、語氣、領域用語、任務套路。它並不擅長把新知識塞進模型腦袋。想讓 LLM 回答公司內部文件、產品規格、常變動的政策條文,正確工具是 RAG(檢索增強生成),不用重訓模型,知識更新也是即時的,做法可以參考 RAG 企業知識庫方案指南。
那什麼情境值得微調?幾個典型:客服回覆必須完全符合品牌語氣與 SOP;輸出要是嚴格的 JSON 或報表格式,prompt 調到極限仍有 5% 上下的格式錯誤;醫療、法律、精密製造這類術語密集的領域,通用模型講話「不像內行人」;或者你想把原本要 70B 模型才穩定的任務壓進 7B 小模型,推論成本直接砍到三分之一以下——這是最容易回本的一種。
一個花半天就能做完的自我檢查:拿 20-30 題實際業務問題,用你手上最強的模型加上能寫出的最好 prompt 跑一遍。如果錯的是「答案內容」,例如模型不知道你們的產品規格,那是知識問題,微調救不了;如果錯的是「表達方式」——格式跑掉、語氣不對、廢話太多——才輪到微調上場。另外記住成本結構:prompt 迭代的邊際成本趨近於零,微調一輪動輒數千元機時起跳,能用 prompt 解決的問題,永遠優先用 prompt。多數企業最後的架構是混合的:RAG 管知識,微調管行為,兩邊各司其職。

Full Fine-tuning:效果上限最高,顯存是無底洞
全參數微調就是把模型每一個權重都拿出來更新。效果上限最高,但顯存開銷驚人,因為訓練期間要同時擺四樣東西:模型權重(FP16 每參數 2 bytes)、梯度(2 bytes)、AdamW 優化器狀態(FP32 動量加變異數,8 bytes),再加上隨序列長度與 batch size 成長的激活值。
經驗法則:全參數訓練的顯存需求,大約是「FP16 權重容量」的 8 到 10 倍。7B 模型權重約 14GB,全參數訓練就要 110-140GB,單張 H100 80GB 裝不下,2 張起跳,還得搭配 DeepSpeed ZeRO 或 FSDP 把狀態切到多卡。32B 約 500GB 上下,70B 直接衝破 700GB,進入多節點叢集的世界——那是另一門學問,可見 多節點分散式訓練入門。
激活值是最容易被低估的一項:它隨 batch 與序列長度線性成長,4K 序列、batch 8 的設定下,7B 的激活值可以再吃掉 30-60GB,所以實務估算永遠要留緩衝。另一筆隱性成本是實驗管理——全參數微調的每個 checkpoint 都是完整模型,7B 一份 14GB,訓練途中存十份就是 140GB 儲存;超參數掃五組,機時與儲存全部乘以五。這些帳在報價單上看不到,卻真實反映在時程與月結帳單上。
資料需求同樣是門檻:全參數微調通常要上萬到數十萬筆高品質資料才不容易過擬合,一輪訓練以天計。對多數企業,這條路的合理時機只有一個:LoRA 已經證明有效,而你需要再擠出最後幾個百分點,或者要做深度的領域續訓。
LoRA:凍結原模型,只訓練低秩適配層
LoRA(Low-Rank Adaptation)的思路完全不同:原模型權重全部凍結,在注意力層旁邊掛上兩個低秩矩陣(rank 一般取 8-64),只訓練這一小撮新增參數,通常僅占原模型參數量的 0.1% 到 1%。
因為梯度與優化器狀態只需要為這不到 1% 的參數保留,整體顯存需求大約降到全參數微調的 1/3 到 1/10。7B 模型跑 FP16 LoRA 約需 18-24GB,一張 RTX 4090(24GB)剛好能吃下;QLoRA 更進一步把凍結的底模量化成 4-bit,7B 只要 8-12GB,16GB 的消費卡都能拿來做實驗。
幾個實務參數直接給你抄:rank 從 16 或 32 起手,純風格任務 8 就有感,複雜任務再往 64-128 試;適配層先只掛注意力層的 Q、K、V、O 四個投影矩陣,效果不足再加 MLP 層,代價是參數量與顯存多三四成;學習率抓 1e-4 到 2e-4,比全參數微調高一個數量級。還有個反直覺的優點:當你的資料只有幾千筆,LoRA 因為可訓練參數少,反而比全參數更不容易過擬合——小資料集的企業場景等於天然適配。
工程面的好處也別忽略。訓練產出的 adapter 檔案只有幾十到幾百 MB,版本管理與回滾都輕鬆;同一個底模可以掛多組 adapter,客服、翻譯、摘要各練一個,推論時動態切換,一台主機同時服務多個任務。對人力有限的台灣中小團隊,這種可維運性比跑分高一兩分重要得多。
GPU 需求對照表:7B 到 70B 一次看清
| 模型規模 | Full Fine-tuning | LoRA(FP16) | QLoRA(4-bit) |
|---|---|---|---|
| 7B | 110-140GB,2×H100 80GB | 18-24GB,1×RTX 4090 | 8-12GB,1×RTX 4090 有餘裕 |
| 14B | 220-280GB,4×H100 | 36-48GB,1×L40S 48GB 或 2×4090 | 14-18GB,1×RTX 4090 |
| 32B | 500GB 上下,8×H100 | 75-95GB,2×H100 或 2×L40S | 26-34GB,1×L40S 或 2×4090 |
| 70B | 700GB 以上,多節點 | 150-190GB,3×H100 | 42-50GB,2×4090 或 1×L40S(緊) |
兩個實務提醒。表中數字以 2K-4K 序列長度、小 batch 估算,序列拉到 8K 以上或 batch 加大,激活值會讓顯存再多吃 20-50%;另外,開 gradient checkpointing 可以省下 30-50% 顯存,代價是訓練慢兩到三成,當顯存卡在門檻邊緣時,這是最划算的交換。
訓練時間也給個基準,以 2 萬筆、平均 1K token 的指令資料跑 3 個 epoch 估算:7B LoRA 在 RTX 4090 上約 6-10 小時,H100 約 2-4 小時;14B 大致乘以二;32B 的 QLoRA 在雙 4090 上要 15-25 小時。換算成錢:台灣機房 4090 主機月租 NT$15,000-25,000,攤下來一輪訓練的機時成本不過幾百元——真正貴的是工程師指揮機器的時間,所以把迭代週期縮短,比省那一點機時重要得多。
用這張表抓預算的流程很直接:先定模型規模(絕大多數企業從 7B-14B 起步),再定訓練方式(預設 QLoRA),最後對出顯存與卡數。容易被忽略的是主機配套:載入與轉檔階段很吃系統記憶體,RAM 建議抓總顯存的 1.5-2 倍;資料集加上多版本 checkpoint,硬碟建議 NVMe SSD 500GB 起跳。這些在正規的租用方案裡通常已包含,自組機器時卻最常漏算,開訓當天才發現 RAM 不夠是很常見的慘劇。
成本試算與導入案例:兩週從 POC 到上線
先看租用行情。海外雲端 H100 每小時約 US$2.5-6,一次 6 小時的 7B LoRA 訓練折合 NT$500-1,500,單看很便宜。但實務上一個案子會迭代數十次,加上資料前處理、失敗重跑與除錯占用的機時,月帳單很容易衝到 NT$40,000-80,000,而且企業資料得出境。台灣在地 GPU 主機走包月制,RTX 4090 等級月租約 NT$15,000-25,000,吃到飽迭代,資料留在台灣機房,個資法遵評估也單純得多。
看一個實際案例。台北一家 35 人的跨境電商,想把客服 email 草擬自動化,選了 Qwen2.5-7B-Instruct 做 QLoRA,資料是 2.3 萬筆去識別化的歷史工單。時程是:第 1-2 天環境建置與資料清理;第 3 天跑通第一輪訓練,單輪約 4 小時;第 4-10 天共迭代 11 輪,主要在調資料配比與 rank;第 11-14 天做離線評測與上線。設備就是台灣機房一台單卡 4090 主機,整個專案的硬體成本等於一個月月租 NT$18,000。上線兩個月後,客服首次回覆時間從平均 4 小時降到 18 分鐘,AI 草稿採用率 76%。同樣的迭代量若按小時租海外 H100,估 NT$35,000-60,000,還沒算個資出境評估的隱形成本。
這個案子有兩個值得抄的細節。資料清理占掉整個專案約六成工時:他們把 5 萬筆原始工單去重、濾掉罐頭回覆、遮罩個資後只剩 2.3 萬筆可用,但正是這一步讓效果跳上來——第一版直接拿全量原始資料訓練的模型,盲測分數比底模還差。評測做得樸素而有效:上線前用 50 題真實客服情境做人工盲測,上線後每週抽 100 封 AI 草稿人工複核,採用率與修改幅度都進儀表板,「76% 採用率」這個數字就是這樣來的,不是感覺。
雲端與在地的比較,還有兩筆帳常被漏掉。上傳與下載的時間成本:幾十 GB 的資料集與模型權重在跨海頻寬上來回,每次迭代多等半小時起跳,兩週的專案硬是被拖成三週。還有法遵文件成本:客戶資料要出境,法務得做傳輸影響評估與契約檢核,這些人力成本往往超過機時費本身。台灣機房把這兩筆直接歸零,這才是月租數字之外真正的差異。
再補一個時程上的提醒:兩週上線的前提是資料已經存在、只需要清理。如果工單還散在個人信箱、客服系統沒有匯出機制,請先花兩到四週把資料管線建起來再開案,否則 GPU 租了只能空轉。評估微調專案時,「資料在哪、誰能拿到、乾不乾淨」這三個問題,永遠比「要租哪張卡」優先。
LoRA 的極限:什麼時候該誠實加碼
LoRA 不是萬靈丹。三種情況它會明顯不夠力:語言或領域移轉幅度太大,例如要讓英文底模深度學會台語文書寫;需要動到模型底層能力,像長推理鏈或更換 tokenizer;以及大規模續訓與蒸餾。此時的升級路徑通常是把 rank 拉高到 128-256 並套用到更多層,再不行才解凍部分層,最後才是全參數微調。
順帶回答一個常見的進階問題:DPO、RLHF 這些對齊技術呢?它們解的是「在多個可行回答之間挑更好的那個」,通常接在監督式微調(SFT)之後,資料要成對的偏好標註,顯存需求與 LoRA SFT 同級或略高。多數企業案子做到 LoRA SFT 就能交付,對齊訓練留給有專職 ML 團隊的公司;至於資料量以十億 token 計的領域續訓,進場前先確認你真的有那個量級的語料,多數產業其實沒有。
我們給客戶的標準建議是反過來走:先用 QLoRA 花半天、幾百元機時,驗證「你的資料有沒有訊號」。有效果,八成的案子就停在 LoRA 直接上線;有效果但不夠力,才值得討論全參數與更大的 GPU 配置。從第一天就上全參數微調的團隊,多數是把預算燒在還沒驗證過的假設上。預算排序也很直觀:先花錢整資料,再花錢租卡,買卡永遠放最後。
給一張可以直接對照的判斷清單:資料少於 5,000 筆、任務屬於格式語氣類、預算在六位數以內——停在 LoRA;盲測顯示模型能力天花板明顯、可用資料超過 10 萬筆、團隊有專職 ML 人力——才值得進全參數。拿這五條對照你的專案,九成的情況答案已經出來了,剩下一成,先跑一輪 QLoRA 再說。

找台灣在地的 GPU 主機夥伴
微調專案的 GPU 需求有明顯階段性:POC 期一張 4090 就夠,放大期可能要 H100 多卡。戰國策 GPU 主機提供 NVIDIA H100 與 RTX 系列多種配置,機器放在台灣機房、資料不出境,月租 NT$15,000 起,7×24 中文技術支援,可以隨專案階段彈性升級。方案細節見 戰國策 GPU 主機,或加 LINE @119m、撥免費專線 0800-003-191,由顧問依你的模型規模與資料量試算配置。
常見問題 FAQ
用 LoRA 微調 7B 模型最少需要多少顯存?
FP16 LoRA 約需 18-24GB,一張 RTX 4090(24GB)可以執行;QLoRA 把底模量化成 4-bit 後只要 8-12GB。若序列長度超過 4K 或 batch 加大,建議直接抓 24GB 以上,搭配 gradient checkpointing 還能再省 30-50% 顯存。
LoRA 的效果會比全參數微調差很多嗎?
在指令跟隨、語氣風格、格式控制這類任務上,LoRA 與全參數微調的差距多在 1-3% 以內,人工盲測常分不出來。差距明顯的是深度領域移轉與新語言學習。建議先用 LoRA 驗證方向,確認有效再評估是否值得多花 5-10 倍成本上全參數。
微調需要準備多少訓練資料?
風格與格式類任務約 500-3,000 筆高品質樣本就有感;任務型指令微調常見 5,000-50,000 筆;全參數領域續訓以十萬筆起跳。資料品質比數量重要,1,000 筆人工校對過的乾淨樣本,效果往往勝過 3 萬筆帶雜訊的原始資料。
7B 模型 LoRA 微調一輪要跑多久?
以 2 萬筆、平均 1K token 的指令資料訓練 3 個 epoch 估算:RTX 4090 約 6-10 小時,H100 約 2-4 小時;QLoRA 因量化運算反而慢 10-20%。整個專案含迭代通常要跑 10-20 輪,所以包月主機會比按小時計費划算。
該選微調還是 RAG?
要模型「知道最新內部知識」選 RAG,知識更新即時、回答可附來源;要改變「行為與語氣」選微調。實務上七成企業案子從 RAG 起步,最成熟的架構是 RAG 管知識、LoRA 管格式語氣,兩者並用,總成本反而比硬用單一方案低。
QLoRA 是什麼?量化會不會犧牲效果?
QLoRA 把凍結的底模用 NF4 格式壓到 4-bit,只有 LoRA 適配層維持高精度,7B 的訓練顯存從 18-24GB 降到 8-12GB。多數公開評測顯示效果損失在 1-2% 內,對預算有限的團隊是首選起點,驗證有效後再換 FP16 LoRA 收尾即可。
微調後模型會不會忘記原本的能力?
會,術語叫災難性遺忘。全參數微調最嚴重,LoRA 因為凍結原權重,影響小得多。實務解法是在訓練資料混入 5-10% 通用指令資料,並在驗證集加入通用能力測項;若通用分數掉超過 3-5%,通常是學習率太高或 epoch 太多。
一張 RTX 4090 能微調 70B 模型嗎?
單張 24GB 不行。70B 即使用 QLoRA 也需要 42-50GB 顯存,至少要 2 張 4090 合計 48GB 搭配分片,或一張 48GB 的 L40S 勉強容納。認真做 70B 建議 2-3 張 H100 跑 FP16 LoRA,訓練速度與穩定度跟消費卡是兩個世界。
微調專案該租 GPU 還是買卡?
迭代期建議用租的:台灣機房 4090 主機月租約 NT$15,000-25,000,免押金、硬體故障有人處理,兩三個月專案期的總成本遠低於購置。等你有全年不間斷的訓練需求且用量穩定,再評估買斷,回本週期一般抓 12-18 個月。
訓練資料要整理成什麼格式?
主流是 JSONL,每行一筆,含 instruction、input、output 欄位,或 OpenAI 式的 messages 對話格式。真正花時間的是去識別化、去重與品質篩選,這部分通常占專案 40-60% 的工時,比訓練本身還重,建議一開始就排進時程。