RAG 是什麼?企業知識庫免重訓方案:GPU 配置與導入成本指南
365天全年無休服務專線 0800-003-191

RAG 是什麼?不用重訓模型的企業知識庫方案,GPU 配置與導入成本指南

💡 快速答案:RAG 是什麼、企業導入需要什麼 GPU 配置?

RAG(檢索增強生成)先把文件切塊轉成向量索引,提問時檢索出最相關段落,交給 LLM 生成附來源的回答,模型不必重訓,知識更新是分鐘級。50 人內用 7B-14B 模型,一張 RTX 4090 主機就能起步,台灣機房月租約 NT$15,000-25,000;200 人以上建議 32B 模型與 48-80GB 顯存。

企業想讓 AI 回答內部知識,第一直覺常是「微調一個自己的模型」。但 2026 年的實務標準答案,八成是 RAG。原因很直接:公司的知識天天在變,產品規格改版、SOP 更新、法規修正,你不可能每次都重訓模型;而 RAG 只要更新索引,幾分鐘內新知識就上線。這篇文章講清楚 RAG 的運作原理、三段式的 GPU 需求怎麼估、導入成本落在什麼區間,並用一個台灣製造業的案例展示從評估到上線的完整過程。看完你應該能自己畫出第一版架構圖,並且對「這件事要花多少錢」有一個誤差不超過三成的估計。

RAG 是什麼?一條「檢索加生成」的流水線

RAG 的全名是 Retrieval-Augmented Generation,檢索增強生成。流程拆開看只有四步:把企業文件切成 300-800 字的小塊(chunking),用 embedding 模型把每一塊轉成向量存進向量資料庫;使用者提問時,問題同樣轉成向量,到資料庫裡找出最相近的 3-8 個段落;可以再加一層 reranker 模型精排,把真正相關的段落挑到前面;最後把這些段落連同問題一起塞進 prompt,讓 LLM 生成回答,並附上引用來源。

用一個具體例子走一遍。員工問「特休沒休完可以換錢嗎?」系統把這句話轉成向量,從索引裡撈出人事規章第 3.2 節與勞基法相關段落,reranker 確認這兩段最相關,LLM 讀完後回答:「依公司人事規章 3.2 條,年度未休畢特休依比例折算工資……」並在答案下方列出出處。使用者點開出處就是原始文件,這條「可驗證」的路徑,正是企業敢把 RAG 交給全公司用的原因。

規模感也給一下:一份 200 頁的 PDF 大約切成 400-800 個 chunk;一萬份文件、百萬級 chunk 的向量索引(1024 維、FP16)本體約 2-4GB,加上原文與中繼資料,整套索引通常在 10-20GB 之間——對現代主機來說是很輕的負擔。關鍵在於:模型本身完全不用動,LLM 負責閱讀理解與寫作,知識全部放在外部索引,加新文件的邊際成本趨近於零。

RAG 是什麼?不用重訓模型的企業知識庫方案,GPU 配置與導入成本指南
▲ 檢索增強生成:不重訓模型,回答自帶來源

為什麼企業知識庫首選 RAG 而不是微調

把知識「訓進」模型有兩個結構性問題。一是更新成本:每次文件異動都要重跑訓練,一輪動輒數小時到數天,而企業知識的半衰期很短——電商的品規週週改,製造業的製程參數月月調,金融業的法遵函釋隨時來。二是不可追溯:模型答錯了,你不知道它是從哪筆資料學歪的,對需要稽核軌跡的產業是致命傷。RAG 剛好相反,答案旁邊就掛著來源文件,稽核人員點開就能核對。

成本差距也很具體。維護一套 RAG 索引,新增文件是增量更新、秒級完成,全量重建一次的 GPU 機時通常不到一小時;而同等知識量的微調,單輪訓練成本是它的數十倍,還要先把文件改寫成上萬筆問答格式的訓練資料,這道工序本身就是一個小專案。

還有一個很少被講白的面向:RAG 會逼你把知識治理做起來。哪些文件是現行版、誰有權看哪一類、過期文件怎麼下架——這些問題在建索引的第一週全部會浮出來,而它們本來就該被回答。反過來看,微調把知識揉進權重裡,版本與權限完全無從管理,答案對錯只能事後抽查,對受監理的金融、醫療產業幾乎是不可接受的黑盒。很多公司做完 RAG 之後回頭感謝的,其實是這一段被迫完成的文件大掃除。

當然,RAG 也有做不到的事:它改不了模型的語氣、輸出格式與任務行為,那是微調的守備範圍,兩者的分工可以參考 LLM 微調實戰。成熟團隊的終局架構多半是混合式:RAG 管知識、LoRA 管行為,先做 RAG 驗證價值,半年後再視需要補一層微調,投資順序不要反過來。

GPU 需求拆解:embedding、reranker、LLM 三段

RAG 系統的顯存消耗來自三個模型,量級差很多。embedding 模型(如 bge-m3、multilingual-e5 這類 0.3-2B 參數的模型)推論只要 2-6GB;reranker 模型同樣輕,2-4GB 就夠;真正的大戶是負責生成的 LLM——7B 模型 FP16 推論約需 14-16GB,14B 約 28-32GB,32B 約 64-70GB,若用 INT4 量化可以再省一半以上,32B 壓到 18-20GB,一張 24GB 卡就裝得下。

延遲的組成也值得認識:embedding 一次查詢 10-30ms,向量搜尋 10-50ms,reranker 50-150ms,而 LLM 生成占掉九成時間——一段 300 字的回答,以每秒 30-60 個 token 的速度要跑 10-20 秒。所以優化體感的重點永遠在生成段:開串流輸出讓使用者邊生成邊閱讀,體感延遲立刻從「等 15 秒」變成「等 1 秒」。建索引的吞吐則看 embedding:一張 4090 每秒可處理數百到數千個 chunk,百萬級索引初次建置約 1-3 小時,夜間排程綽綽有餘。

併發的速算法也給一個:內部工具的尖峰併發約是總人數的 5-10%,100 人公司抓 5-10 路。7B 模型配一張 4090,撐 10-20 路沒問題;32B INT4 因為權重就占掉 18-20GB,單卡併發建議壓在 5-8 路,超過就分雙卡或升 48GB 卡。先用保守配置上線、看兩週監控數據再決定加不加卡,永遠比一次到位便宜。

三段可以塞在同一張卡,也可以分開。50 人以內的內部知識庫,一張 RTX 4090 同時跑 7B INT4 生成加 embedding 綽綽有餘;使用者破兩百人、尖峰併發 10-20 路時,建議把 embedding 與 reranker 留在小卡或 CPU,生成模型獨占一張 48GB 以上的卡,否則檢索尖峰會跟生成搶資源,延遲直接翻倍。另一個常被忽略的顯存項目是 KV cache:併發越高、對話越長,占用越大,規劃時要在模型權重之外預留 20-40% 顯存。

規模對照表與成本區間

使用規模 建議模型組合 GPU 配置 月租行情(台灣機房)
POC 驗證 7B INT4 + bge-m3 1×RTX 4090 24GB NT$15,000-20,000
50 人內部使用 7B-14B + embedding + reranker 1×RTX 4090 或 1×L40S 48GB NT$18,000-35,000
200 人、併發 10-20 32B INT4 + 完整檢索鏈 2×RTX 4090 或 1×H100 80GB NT$40,000-80,000
500 人以上或對外服務 32B-70B、多副本負載均衡 2×H100 起跳 NT$120,000 起

讀表時注意三件事。規模看的是「尖峰併發」而不是員工總數,一般內部工具的併發約是總人數的 5-10%;模型尺寸決定答案品質的天花板,32B 對 7B 的優勢在跨文件推理題上特別明顯,常有 15-20 個百分點的正確率差距;GPU 之外還有配角成本——向量資料庫吃的是 CPU 與 16-32GB 記憶體、索引與日誌的儲存、以及建置評測集的人力,這些加總約占專案總成本一到兩成。

對照雲端 API 的帳:呼叫商用模型 API 每百萬 token 約 US$0.5-15,小量使用便宜;但企業知識庫的痛點通常不是錢,而是文件必須送到境外模型商手上。自建 RAG 的月租是固定成本,量再大都不會爆,敏感文件也從頭到尾不離開機房,這兩點才是台灣企業選擇自建的主因。

拿數字算個分水嶺:一次問答連同檢索段落約消耗 3,000-6,000 個 token,200 人公司每天 500 次問答,月消耗大約 3,000-9,000 萬 token。走中階商用 API 月費看起來還可控,但前提是「文件可以出境」而且「用量不再成長」;一旦任一前提破掉——來了敏感專案、或使用量隨導入深化翻了三倍——自建的固定月租立刻反超。多數企業算完這筆帳,就把 API 留給不敏感的雜務,核心知識庫走自建。

台灣案例:精密加工廠的 SOP 知識庫

台中一家 280 人的精密加工廠,累積了 1.2 萬份文件:ISO 程序書、設備原廠手冊、工安 SOP、歷年異常處理紀錄。痛點很典型——新人找一份正確版本的 SOP 平均要 20 分鐘,夜班遇到設備異常只能打電話吵醒資深工程師。而這些文件混著客戶 NDA 與製程參數,受營業秘密法保護,法務直接否決任何「上傳到境外雲端 AI」的方案。

他們最後在台灣機房租了一台雙 4090 主機,跑 Qwen2.5-32B 的 INT4 量化版,配 bge-m3 做繁中檢索,月租約 NT$45,000。導入花了兩個月:第一個月清文件、建索引、跑 150 題內部評測集把命中率從 71% 調到 93%;第二個月試營運與權限分級。過程中真正難的不是模型,是文件工程——三成的手冊是掃描檔,要先過 OCR 與人工抽驗;製程參數表不能直接切塊,得整表保留並補上表頭說明;不同部門的文件還要掛權限標籤,業務看不到製程資料,產線查不到報價單,這些前置工作占掉全案一半以上的工時。

上線後新人查 SOP 的時間從 20 分鐘縮到 2 分鐘內,夜班打給資深工程師的次數少了六成。附帶的好處是延遲:機房在台灣,問答往返網路延遲 5ms 上下,比呼叫海外服務的 60-150ms 順暢得多,產線平板上用起來像即時對話。廠長事後的評語很實在:這套系統最大的價值不是 AI 多聰明,是它終於逼公司把二十年的文件整理成一套有版本、有權限的資產。

成本結構也值得記下來:這個案子的外部支出就是兩個月機器月租共約 9 萬元,其餘全是內部工時;同樣範圍交給系統整合商從零客製,市場報價常落在 NT$150-300 萬。自建加租機的組合,把試錯成本壓到外包報價的零頭,這也是我們一貫建議企業「先小做、驗證了再放大」的底氣。

常見翻車點:九成的爛 RAG 都是檢索的錯

導入 RAG 失敗的專案,問題極少出在 LLM,幾乎都出在檢索。常見的坑排下來:chunk 切太大或太小——300-800 字、前後保留 10-20% 重疊是穩健起點,表格與條列要特殊處理;embedding 模型不擅長繁體中文——選 bge-m3 或 multilingual-e5 這類多語模型,別拿純英文模型硬上;沒放 reranker——多這一層 2-4GB 顯存的小模型,常常就是命中率從七成到九成的差距;以及沒有評測集——上線前準備 50-200 題有標準答案的內部問題,每次調參數都重跑,不然你永遠在憑感覺調。

幻覺控制也有標準做法:在 prompt 裡強制「只能根據提供的段落回答,並列出引用編號」,檢索相似度低於門檻時直接回「資料庫中查無相關內容」,寧可不答也不要瞎掰。這些設定做齊,企業內部問答的可用率把握做到九成以上。

上線不是終點,RAG 是要養的。固定的維運節奏建議:新文件自動進索引(每日或每週排程)、每月跑一次評測集回歸確認沒有品質飄移、每季檢視一次「查無資料」與低分回答的清單,回頭補文件或調切塊。這些工作每月大約半人日,卻是系統一年後還好用的關鍵。想再深入私有化部署的模型選型與服務化細節,可以接著讀 私有 LLM 部署完整攻略

RAG 是什麼?不用重訓模型的企業知識庫方案,GPU 配置與導入成本指南
▲ RAG 導入的規模對照表

找台灣在地的 GPU 主機夥伴

RAG 是企業 AI 裡投資報酬最好算的一種:GPU 需求從單張 4090 起步,隨使用人數線性成長,不會一開始就逼你上重裝備。戰國策 GPU 主機提供 NVIDIA H100 與 RTX 系列配置,台灣機房、資料不出境,月租 NT$15,000 起,7×24 中文技術支援,POC 到正式環境可以無痛升級。方案與規格見 戰國策 GPU 主機,或加 LINE @119m、撥免費專線 0800-003-191,顧問會依你的文件量與使用人數建議配置。

常見問題 FAQ

RAG 和微調最大的差別是什麼?

RAG 把知識放在外部向量索引,模型不動,文件更新後幾分鐘就生效,回答還能附上來源;微調是把行為訓進模型,適合改語氣與格式,但知識一變就要重訓,單輪成本是重建索引的數十倍。企業知識庫九成情境應該先做 RAG。

導入 RAG 最低的 GPU 門檻是多少?

POC 等級只要一張 24GB 的 RTX 4090:跑 7B 模型的 INT4 量化版約占 5-6GB,加上 bge-m3 embedding 的 2-4GB 與 KV cache,單卡綽綽有餘。台灣機房這種主機月租約 NT$15,000-20,000,兩週內可以搭出能給主管試用的版本。

RAG 一定需要 GPU 嗎?用 CPU 不行嗎?

檢索段可以用 CPU,但 embedding 建索引會慢 10 倍以上;生成段用 CPU 跑 7B 模型每秒只有個位數 token,一個回答要等一兩分鐘,基本不可用。實務上一張入門 GPU 就能讓回答速度到每秒 30-60 個 token,體驗完全不同。

文件要怎麼切塊(chunking)比較好?

通用起點是每塊 300-800 字、前後重疊 10-20%,依標題與段落邊界切而不是硬切字數。表格建議整張保留並附上表頭說明,條列式 SOP 以步驟為單位。切法對命中率的影響常達 10-20 個百分點,值得花一天實驗。

向量資料庫該選哪一套?

百萬級以下向量,Qdrant、Milvus、pgvector 都夠用,差異主要在維運習慣:已有 PostgreSQL 的團隊用 pgvector 最省事,獨立部署選 Qdrant 輕量好管。向量檢索通常吃 CPU 與記憶體,抓 16-32GB RAM 起步即可,不占 GPU 顯存。

RAG 的回答品質要怎麼量化?

上線前建 50-200 題有標準答案的評測集,追兩個數字:檢索命中率(正確段落有沒有進前 5)與答案正確率(人工或 LLM 評分)。健康的系統命中率要 85% 以上、正確率 90% 上下;每次調 chunk、換模型都重跑,才知道是變好還變壞。

怎麼降低 RAG 的幻覺?

三件事做齊:prompt 強制只依提供段落回答並附引用編號;檢索相似度低於門檻就回「查無資料」,不硬答;加 reranker 把不相關段落擋在生成之前。實務上這樣可以把幻覺率壓到 5% 以下,剩下的靠評測集持續抓漏。

200 人規模的公司,RAG 主機月費大概多少?

尖峰併發 10-20 路、用 32B INT4 模型加完整檢索鏈,建議 2×RTX 4090 或一張 H100 80GB,台灣機房月租約 NT$40,000-80,000。比起呼叫雲端 API,固定月租的好處是用量再大帳單也不會失控,且文件全程不出機房。

RAG 適合處理 Excel 和圖面這類非文字資料嗎?

表格類資料要先轉成結構化文字或用表格感知的解析器處理,效果才穩;工程圖面、照片則需要多模態模型(如 Qwen-VL 系列),顯存需求會多 30-50%。建議第一期先做純文字文件,驗證價值後再擴充多模態,風險最低。

資料完全不能出公司,RAG 做得到嗎?

可以,這正是自建 RAG 的主場:embedding、向量資料庫、LLM 全部跑在你租用或自有的主機上,文件與問答紀錄都不離開機房。台灣機房方案還能滿足個資法與客戶 NDA 的稽核要求,金融與製造業已有大量落地案例。

               

戰國策 AI 客服系統,可1抵5位真人客服成本!自動回覆 80% 常見問題,支援串接官網、LINE、FB、IG等主流平台。24小時秒回不漏單!立即免費試用

邀請你免費加入我們的LINE社群 : 【戰國策戰勝學院】,和一群真正想搞懂商業、提升營收的老闆一起成長!