💡 快速答案:商用部署 Stable Diffusion 需要什麼 GPU、出圖速度多快?
SD 1.5 只要 4-6GB 顯存,SDXL 建議 10-12GB,SD3.5 與 FLUX.1 要 16-24GB,一張 RTX 4090 通吃。4090 出一張 1024 的 SDXL 圖約 4-6 秒,批次月產能 15 萬張以上。台灣機房單卡月租約 NT$15,000-25,000,商用前務必逐版本確認授權。
生成式 AI 的討論度都被 LLM 占走了,但真正在台灣企業裡默默賺錢的,常常是圖像生成。電商去背改景、廣告素材 A/B 量產、遊戲美術概念圖、產品打樣視覺——這些工作流一旦導入 Stable Diffusion 系列模型,產能是用「倍」在算的。不過商用部署跟玩家在自己電腦上跑圖是兩回事:顯存要抓多少、出圖速度怎麼估產能、授權條款哪些版本能商用、服務怎麼撐住多人同時用,每一題都有具體答案。這篇指南一次講完。
先盤點場景:你要的是「快」還是「多」
商用圖像生成的需求分兩型。互動型:設計師在工作流裡即時生圖改圖,重點是單張延遲,最好 10 秒內出圖,不然創作節奏會斷;批次型:半夜排程量產上千張商品圖或素材變體,重點是每小時吞吐與單張成本,延遲無所謂。兩型的 GPU 配置邏輯不同——互動型值得上單卡效能最強的卡,批次型看的是「每萬張成本」,有時兩張中階卡比一張旗艦卡划算。訓練自家風格模型(LoRA)又是第三種負載,吃的資源結構不一樣,可參考 訓練與推理的 GPU 配置邏輯。
開需求會議時,把三個問題先問清楚,規格自然浮現:每月要產多少張、誰在什麼流程裡用(設計師即時創作還是系統自動批次)、素材與成品的保密等級。第三題常被跳過,卻最關鍵——未上市商品照、客戶提供的原始素材,一旦流進境外生圖服務,合約上的保密條款就破了。這也是為什麼台灣的電商、遊戲與代理商,這兩年紛紛把出圖工作流搬回自建或租用的在地主機。
台灣市場的需求輪廓大致是:電商與代營運要商品情境圖量產,遊戲與 IP 產業要概念圖與宣傳素材,製造業拿它做產品外觀提案與型錄視覺,行銷代理商則是廣告素材的 A/B 變體海量測試。共通點是量大、風格要穩、交期以天計——正好是自建 GPU 產線最擅長的三件事,也是按張計費的境外服務最貴的三件事。

模型版本與顯存需求:從 SD 1.5 到 FLUX
2026 年還在商用戰場上的主力模型,顯存需求差距很大。SD 1.5 最老但生態最肥,512×512 原生解析度,推論只要 4-6GB,大量現成 LoRA 與 ControlNet 可用,適合量產小圖與風格固定的素材線。SDXL 是目前商用主流,1024×1024 原生解析度,推論建議 10-12GB,畫質與提示詞理解力都上一個檔次。SD 3.5 Large(8B 參數)與 FLUX.1(12B 參數)是畫質天花板,文字渲染與人手細節明顯進步,但 FP16 推論要 16-24GB,加上 ControlNet 或高解析修復流程,24GB 卡會逼近上限,FP8 量化可壓回 12-16GB,畫質損失輕微。
經驗上的配卡建議:純 SD 1.5 產線用 12-16GB 卡就夠;SDXL 為主、偶爾跑 FLUX,一張 RTX 4090(24GB)是甜蜜點;FLUX 全流程加訓練 LoRA,直上 48GB 的 L40S 或 RTX 6000 Ada,省去顯存調度的所有麻煩。
選版本時別只看畫質,要看「生態資產」。SDXL 的社群累積最厚:上千個風格 checkpoint、數萬個 LoRA、成熟的 ControlNet 全家桶(姿勢、深度、線稿、佈局控制)與 IP-Adapter 參考圖機制,商用工作流需要的「可控性」幾乎都靠這些配件堆出來,而新模型的配件生態要再等半年到一年才會齊。這就是為什麼 2026 年的商業產線上,SDXL 仍然是主力、FLUX 負責高規格單張輸出的分工格局。
硬體配套也交代一下:模型 checkpoint 一個 2-7GB,加上 LoRA 庫與 ControlNet 權重,硬碟直接抓 1TB NVMe 起跳;系統記憶體 32-64GB,模型切換與批次排程時吃得兇;輸出圖的儲存與備份另外算,量產線一個月幾百 GB 很正常。這些配套在租用方案裡先確認清楚,比事後加購省事。
出圖速度對照:秒數背後是產能與成本
| GPU | SDXL 1024×1024(30 步) | FLUX.1 dev(20 步) | 批次月產能估算(SDXL) |
|---|---|---|---|
| RTX 4090 24GB | 約 4-6 秒/張 | 約 15-25 秒/張 | 15-25 萬張 |
| L40S 48GB | 約 5-8 秒/張 | 約 18-30 秒/張 | 12-20 萬張 |
| H100 80GB | 約 2.5-4 秒/張 | 約 8-15 秒/張 | 25-40 萬張 |
幾個讓數字更準的細節。步數影響線性:20 步的時間約是 30 步的三分之二,搭配 LCM/Turbo 類加速技術可壓到 4-8 步,速度翻好幾倍,適合先快速出草稿再精修的流程。高解析放大(upscale)與 ControlNet 每加一層,時間多 30-100%。還有排隊時間:多人共用時真正的體感延遲是「生成時間加排隊」,這就是下一節服務化要解的問題。用月產能回推,一張 4090 主機月租 NT$15,000-25,000,量產情境的單張成本不到 NT$0.2,跟按張計費的雲端生圖 API(單張約 NT$0.5-4)差距一個數量級。
還想再壓速度,加速堆疊照這個順序上:先確認 FP16 與高效注意力機制(新版框架多半預設開啟),再套 LCM 或 Turbo 類的少步數模型,最後才是 TensorRT 編譯——它能再快 30-50%,但每換一個模型或解析度都要重新編譯,適合模型固定的量產線,不適合天天換風格的創作環境。互動與批次的參數也不同:互動用 batch 1 求快,批次拉 batch 4-8 榨吞吐,同一張卡兩種設定的時薪產能差三成以上。
解析度是另一個常被低估的變數:同一張卡,SDXL 從 1024 拉到 1536 見方,時間接近翻倍;要 2048 以上的大圖,先出 1024 再走放大流程,品質更穩、總時間反而更短。至於負向提示詞與 CFG 這類參數,對速度影響輕微,放心按品質需求調,產能規劃時不用把它們算進變數。
商用授權地雷:每個版本規則都不一樣
技術選型前,先讓法務看授權,這是圖像生成商用化最常翻車的地方。SD 1.5 與 SDXL 用 CreativeML OpenRAIL 系授權,商用基本開放,但有禁止用途清單;SD 3.5 用 Stability AI 社群授權,年營收 100 萬美元以下企業可免費商用,超過要買企業授權;FLUX.1 要特別小心:schnell 版是 Apache 2.0 隨便用,dev 版是非商用授權,拿 dev 直接做商業服務就是違約,商用要走 BFL 的授權方案。
另外兩件事一起交代:生成內容的著作權在台灣現行實務下,純 AI 產出難以主張著作權保護,商業使用要靠人工參與創作與合約安排;訓練自家 LoRA 用的素材,確認你有權利使用,拿客戶圖庫訓練前先把授權條款寫進合約。這些功課做在前面,比出事後補救便宜太多。
管理上建議建一張「授權清冊」:表列每個在用的模型與 LoRA、授權類型、可否商用、來源連結與下載日期,新模型進產線前先過這張表。特別注意合併模型(merge)與微調衍生版——它們繼承原始模型的授權,拿非商用底模 merge 出來的東西照樣不能商用;社群下載的風格 LoRA 更是重災區,訓練素材來路不明的,商業案子直接避開。這張清冊花一天建立,能擋掉未來九成的授權糾紛。
再往前看一步:主要平台與廣告通路陸續要求 AI 生成內容標示,台灣的主管機關也在跟進研議。把「AI 生成、人工審核」的標示與紀錄機制先做進流程,產出的每張圖都留有模型版本與參數的中繼資料,未來法規落地時你只需要開個開關,而不是回頭補三個月的資料。
台灣案例:電商代營運的出圖農場
一家台北的電商代營運公司,替 40 多個品牌管商品頁,長期痛點是攝影棚產能:一檔活動要 300-500 張情境圖,外包攝影單張 NT$300-800、來回兩週。他們在台灣機房租了兩台 RTX 4090 主機(月租合計約 NT$40,000)建出圖農場:白天設計師用 ComfyUI 做互動創作與修圖,晚上跑批次——商品去背後套 SDXL 情境模板,自動生成不同場景、光線、節慶主題的變體,隔天早上人工挑圖。
三個月後的數字:每月產出約 6 萬張候選圖、採用約 4,500 張,單張採用成本從外包的數百元降到十位數;一檔活動的素材製作週期從兩週壓到三天。品牌客戶在意的資料問題也順帶解決——商品原始圖與未上市新品照全部留在台灣機房,不經過任何境外生圖服務,代營運合約裡的保密條款直接過關。機器在台灣還有個實際好處:傳輸大批 PSD 與成品圖走內網或國內頻寬,幾 GB 的檔案分鐘級搞定,不用跟跨海頻寬搏鬥。
他們的批次工作流值得拆開看:商品圖先自動去背與構圖對位,套用預先調好的 SDXL 情境模板(棚拍、居家、戶外、節慶四大類),ControlNet 鎖住商品輪廓避免變形,生成後自動跑一輪放大與色彩校正,再進人工挑圖。每個商品產 12 個變體、人工挑留 1-2 張,挑圖率穩定在一成上下——這個數字很重要,產能規劃時要用「候選張數」而不是「採用張數」去算 GPU 需求,兩者差了十倍。
服務化:讓一張卡服務一個部門
單機跑 ComfyUI 或 WebUI 是個人用法,商用部署要加三層。佇列層:用 Redis 或內建 queue 把請求排隊,尖峰時設計師看到的是「排隊中第 3 位」而不是逾時錯誤;API 層:把常用工作流(去背、換景、放大)固化成參數化 API,讓 PM 與行銷不碰節點圖也能出圖;資產層:模型、LoRA、工作流版本化管理,不然三個月後沒人知道哪個 checkpoint 配哪個 LoRA 才能重現當初的風格。這套 API 化的思路與 LLM 服務共通,可參考 AI 推論 API 自建教學。
容量規劃的粗略公式:一張 4090 跑 SDXL 約每分鐘 10-15 張,一個 10 人設計團隊的互動使用加上夜間批次,單卡通常夠;超過 20 人或有對外服務,再加卡做負載分流。從一張卡開始,用佇列長度數據決定何時擴充,比一次到位猜規格務實。
維運面把四件事自動化就很省心:任務失敗自動重試(顯存偶發不足、模型載入逾時是常客)、每日產能與佇列報表、輸出內容的安全過濾(商用環境必開,尤其是開放自由 prompt 的內部工具)、以及模型與工作流的版本備份。監控指標盯兩個就夠——平均單張生成時間(飆高代表有人塞了超大解析度或掛錯模型)與佇列等待 p95(超過一分鐘就是擴充訊號)。這套機制建好,一個設計部門的出圖農場,每週維運時間可以壓在兩小時內。
若農場要服務多個部門或多個客戶,再加一層簡單的配額管理:每個專案有月度張數配額與優先級,超額走申請流程。這不是官僚,是讓產能衝突浮上檯面的機制——沒有配額的共用農場,三個月後一定演變成先搶先贏,協調的隱形成本比寫這層邏輯高得多。

找台灣在地的 GPU 主機夥伴
圖像生成的商用部署,從單張 RTX 4090 的設計部門共用機,到多卡 H100 的量產農場,規格跨度很大。戰國策 GPU 主機提供 NVIDIA H100 與 RTX 系列多種配置,台灣機房、素材與商業資料不出境,月租 NT$15,000 起,7×24 中文技術支援,產能不夠隨時加卡。方案細節見 戰國策 GPU 主機,或加 LINE @119m、撥免費專線 0800-003-191,顧問可依你的出圖量與工作流建議配置。
常見問題 FAQ
跑 Stable Diffusion 最少需要多少顯存?
SD 1.5 推論 4-6GB 就能跑,SDXL 建議 10-12GB,SD 3.5 Large 與 FLUX.1 需要 16-24GB(FP8 量化可壓到 12-16GB)。商用環境建議直接配 24GB 的 RTX 4090:主流模型全部通吃,還留得下 ControlNet 與放大流程的空間。
RTX 4090 出一張圖要幾秒?
SDXL 1024×1024、30 步約 4-6 秒;SD 1.5 的 512 小圖 1-2 秒;FLUX.1 dev 20 步約 15-25 秒。搭配 LCM/Turbo 加速可把步數壓到 4-8 步,SDXL 能進到 2 秒內。批次量產時單卡每小時穩定產出 600-900 張 SDXL 圖。
哪些 Stable Diffusion 版本可以商用?
SD 1.5 與 SDXL 走 OpenRAIL 系授權,商用開放但有禁止用途;SD 3.5 對年營收 100 萬美元以下企業免費商用,超過需企業授權;FLUX.1 schnell 是 Apache 2.0 可自由商用,dev 版為非商用授權,商業服務必須另購授權。上線前務必逐版本核對。
商用出圖該自建 GPU 還是用生圖 API?
月出圖量是分水嶺。雲端 API 單張約 NT$0.5-4,月產一萬張就要 NT$5,000-40,000 且素材要上傳境外;自建單卡 4090 主機月租 NT$15,000-25,000,月產能 15 萬張以上,單張成本壓到 NT$0.2 以下。月量破萬張或素材敏感,自建幾乎必勝。
SDXL 和 FLUX 該選哪個?
量產與生態優先選 SDXL:速度快 3-5 倍、LoRA 與 ControlNet 資源最齊,商品圖情境圖綽綽有餘。文字渲染、手部細節、複雜構圖要求高的主視覺,才用 FLUX 或 SD 3.5。多數團隊的實務解是雙軌:SDXL 跑量、FLUX 出精稿,一張 24GB 卡就能切換。
一個 10 人設計團隊需要幾張卡?
通常一張 RTX 4090 就夠:互動使用尖峰約 3-5 人同時排隊,SDXL 每張 4-6 秒,佇列體感仍順;夜間再排批次任務把閒置時段用滿。建議先單卡上線、監控佇列長度,平均等待常態超過 30 秒再加第二張卡,擴充有數據依據。
訓練自己風格的 LoRA 需要什麼規格?
SDXL LoRA 用 20-100 張標註圖、24GB 顯存的卡訓練 1-3 小時就有可用結果;FLUX LoRA 建議 24-48GB 顯存、時間再多五成。重點反而在素材權利:訓練圖要有合法使用權,替客戶訓練品牌風格模型時,把素材授權與產出歸屬寫進合約。
出圖服務多人共用要怎麼架?
標準架構三層:ComfyUI 或 Diffusers 當生成核心,前面加佇列(Redis/RabbitMQ)吸收尖峰,再包一層參數化 API 讓非技術同事直接用固定工作流。搭配任務優先級(互動優先、批次讓路),單卡就能同時服務設計部門與夜間量產線。
生成的圖片著作權歸誰?可以商用嗎?
台灣現行實務上,無人類創作參與的純 AI 產出難以取得著作權保護;有實質人為創作(構圖指導、後製合成)的成品較有主張空間。商用本身可行,但建議以合約約定產出的使用權歸屬,並保留創作過程紀錄,以降低爭議風險。
顯存不足會發生什麼事?怎麼緩解?
輕則自動切到 CPU/RAM 分流讓速度掉 5-10 倍,重則直接 OOM 中斷任務。緩解手段依序:改用 FP8/半精度、降批次數、關閉不必要的 ControlNet、用 tiled VAE 分塊處理高解析圖。若每天都在用這些手段,就是該升 48GB 卡的訊號。