GPU 與 CPU 差異是什麼?圖解什麼是 GPU 伺服器與平行運算,大廚與流水線一次看懂
365天全年無休服務專線 0800-003-191

GPU 與 CPU 到底差在哪?用工廠流水線一次講懂平行運算【圖解】

💡 快速答案:GPU 與 CPU 的差異是什麼,為什麼 AI 訓練都用 GPU?

CPU 只有數個到數十個強大核心,擅長複雜邏輯、分支判斷與一步接一步的序列任務,像幾位十項全能的大廚;GPU 有數千到上萬個小核心,能同時對大量資料做一模一樣的簡單運算,像整條工廠流水線。AI 訓練的本質是巨量矩陣乘加,幾乎沒有分支,正好能拆給幾千個核心同時算,所以 GPU 常比 CPU 快數十倍。兩者是分工:CPU 負責指揮與邏輯,GPU 負責平行算力。

為什麼一講到 AI,大家都在搶 GPU?

如果你最近看過任何一則科技新聞,大概都遇過同一句話:「AI 需要大量 GPU。」奇怪的是,你的筆電裡明明有一顆不便宜的 CPU,課本還說它是電腦的大腦,為什麼一算 AI,大家卻搶著要另一種晶片?這篇文章用最白話的方式,把 GPU 與 CPU 差異一次講清楚,也順便回答另一個常被搜尋的問題:什麼是 GPU 伺服器。你不需要資工背景,只要想像過餐廳的廚房和工廠的流水線,就能看懂現代運算世界最重要的一次分工。讀完之後,下次家人問起新聞裡的 AI 晶片之亂,你可以用一頓晚餐的時間講給他們聽。

先給最短版本的答案:CPU 像幾位十項全能的大廚,人數少,但再刁鑽的菜都做得出來;GPU 像幾千名只負責一道簡單工序的作業員,單看一個人不起眼,整條線動起來的產量卻嚇死人。難的菜交給大廚,大量重複的簡單工作交給流水線,這就是兩顆晶片的分工。接下來我們把比喻拆開,看看它們在晶片層面各自對應什麼。

GPU 與 CPU 到底差在哪?用工廠流水線一次講懂平行運算【圖解】
▲ CPU 擅長邏輯與序列;GPU 同時對巨量資料做相同運算

CPU:少而精的十項全能大廚

一顆現代 CPU 通常只有數個到數十個核心:家用桌機常見 6 到 16 核,伺服器等級可以到 64 核、96 核,頂多一百出頭。但每個核心都非常強:時脈動輒 3 到 5 GHz,等於每秒數十億個節拍;核心旁邊配了層層快取(L1、L2、L3),容量從幾十 KB 到上百 MB,讓最常用的資料幾乎不用等待就能取用,延遲極低;再加上分支預測、亂序執行這類聰明機制,專門對付「充滿判斷與跳轉」的程式。

換成廚房語言:CPU 核心就是米其林等級的大廚。客人臨時改單,他當場改流程,這叫分支判斷;一道功夫菜十個步驟環環相扣,少一步都不行,這叫序列任務;煮到一半要嚐味道再決定加不加鹽,這叫邏輯控制。作業系統的排程、資料庫的交易、網站後端的商業邏輯、程式裡一層又一層的條件式,都是「下一步取決於上一步結果」的工作,天生屬於 CPU。你隨手開個網頁、切個視窗,背後就是 CPU 在毫秒之間完成成千上萬次這種判斷,這也是它被稱為電腦大腦的原因。

但大廚再神,人數就是少。假設今天的任務是把一萬顆馬鈴薯削皮,五位大廚削得再快,也贏不了五百個人同時動手。這就是 CPU 的天花板:單筆極快、延遲極低,但同一時刻能並行的工作數量有限。

GPU:幾千人同時開工的工廠流水線

GPU 走完全相反的路線。一張現代 GPU 塞了數千到上萬個小核心:消費級旗艦卡有超過 16,000 個 CUDA 核心,資料中心等級的 NVIDIA H100 也有上萬個運算單元。每個核心都比 CPU 核心弱:時脈多半只有 1 到 2 GHz,不擅長複雜判斷,分到的快取也小。但它的設計哲學是人海戰術:同一道指令,讓成千上萬個執行緒同時套用在不同的資料上。這個模式的正式名稱叫 SIMT(單指令、多執行緒),更白話的說法是資料平行:資料被切成幾千份,每一份做的動作一模一樣。有趣的是,GPU 一開始只是為了畫遊戲畫面而生,直到 2007 年前後通用運算框架普及,工程師才發現這支流水線大軍拿來算科學與 AI 一樣好用,從此顯卡不再只是遊戲配件。

回到比喻,GPU 像操場上集合了幾千名學生,老師在黑板寫一題「把你手上的兩個數字相加」,哨音一響,幾千人同時算完各自那題。我們做個粗略算術:一位大廚一分鐘能完成 30 筆複雜計算,五位大廚就是每分鐘 150 筆;一名學生一分鐘只能算 5 筆簡單加法,但 3,000 名學生同時動手,每分鐘就是 15,000 筆,是大廚隊的 100 倍。這就是延遲與吞吐量的差別:問單筆多快,大廚贏;問整批多快,流水線壓倒性獲勝,而 GPU 的世界在乎的通常是整批。不過人多還得餵得飽:幾千名學生同時伸手要考卷,發卷的速度就成了關鍵,所以 GPU 都配上超寬的記憶體通道,像一條一次能開進幾十台餐車的超大走道。

巧的是,世界上有一大類重要工作,正好就是大量一模一樣的簡單計算。螢幕上幾百萬個像素的顏色要同時算出來,這是 GPU 名字的由來(圖形處理器);影像濾鏡、影片轉檔、3D 遊戲的幾何與光影,全是同類;現在最紅的 AI 更是如此:深度學習的核心是矩陣乘法,把幾十億個數字排成表格反覆做乘加,幾乎沒有分支,一張卡上萬個核心一起算,一秒可完成數十兆次浮點運算。這也是近十年HPC 高效能運算大量改用 GPU 加速的原因:氣象模擬、分子動力學、金融風險計算,骨子裡都是巨量數值運算。

一張表看懂 GPU 與 CPU 差異

把故事整理成一張球員卡,兩邊的取捨一目了然:

項目 CPU(大廚隊) GPU(流水線)
核心數量 數個到數十個,伺服器級可破百核 數千到上萬個,旗艦卡逾 16,000 個 CUDA 核心
單核能力 極強,會處理複雜邏輯與分支 較弱,只做簡單重複運算
時脈 約 3 到 5 GHz 約 1 到 2 GHz
快取與延遲 多層大快取,延遲極低 快取小,靠每秒數 TB 高頻寬記憶體餵資料
擅長任務 作業系統、資料庫、邏輯控制、序列程式 矩陣運算、影像繪圖、AI 訓練與推論
不擅長 巨量重複的簡單運算 分支多、步步相依、資料量小的工作
一句話比喻 幾位十項全能的大廚 幾千名同時算加法的學生

要提醒的是,表格裡的弱項不是設計失誤,而是取捨。你可能會問:為什麼不造一顆又聰明、人又多的晶片?因為晶片面積與功耗是硬預算,大快取與分支預測這些聰明機制非常占地方,塞了聰明就塞不下人海。工程沒有魔法,只有取捨:CPU 把預算花在深度,GPU 把預算花在寬度,兩者從來不是誰淘汰誰,而是一組互補的分工。

什麼是 GPU 伺服器?跟你桌機的顯卡差在哪

講完晶片,來定義另一個主角。所謂 GPU 伺服器,就是安裝了一張以上專業級 GPU 的伺服器:在 CPU、記憶體、硬碟這些標準配備之外,再裝上 NVIDIA H100 或 RTX 專業系列這類加速卡,搭配高速記憶體、數千瓦等級的供電與強化散熱,通常放在資料中心全年無休運轉,使用者透過網路遠端連線使用,就像租了一間隨時開火的雲端廚房:你在自己的筆電上寫程式、按下執行,真正流汗的是機房裡那台機器,筆電只負責當遙控器。一台典型的 GPU 伺服器包含:

  • 運算卡:1 到 8 張專業 GPU,單張 H100 的功耗就達 700 W
  • 顯示記憶體:資料中心卡動輒 80 GB 起跳,頻寬達每秒 2 到 3 TB,餵得飽上萬個核心
  • 供電與散熱:數千瓦電源加上強力風道或液冷,確保全年滿載不降速
  • 高速通道:PCIe 或 NVLink 互連,讓 CPU 與多張卡之間的資料搬運不塞車
  • 機房環境:恆溫恆濕、不斷電系統與備援網路,這是一般辦公室給不了的

對照之下,桌機消費卡通常只有 16 到 24 GB 記憶體,不支援 ECC 錯誤修正與 NVLink 高速串接,電源與散熱也不是為 7 天 24 小時滿載設計。打遊戲、學習、跑小模型,消費卡綽綽有餘;要長時間訓練大模型或對外提供服務,就是資料中心等級的主場。

這裡有個很多台灣團隊都踩過的坑。不少中小企業或個人開發者一聽到 AI 要用 GPU,第一反應是自己買顯卡,結果要嘛發現記憶體不夠、模型載不進去,要嘛專案結束後卡就閒置,利用率不到兩成。電費也很實際:台灣工業電價每度約 NT$3 到 4 元,夏季更貴,一台八卡伺服器滿載功耗可達 10 kW,一個月電費就可能落在 NT$2 到 3 萬,空調還要另計。大學實驗室也有類似難處:研究計畫經費一年常常只有幾十萬到一兩百萬元,一次砸在買卡上,兩三年後規格落伍、經費卻已用罄。所以愈來愈多台灣團隊選擇先租GPU 主機把需求跑清楚,再決定要不要自建,風險低得多。從新竹的 IC 設計公司、台中的精密機械廠到台北的軟體新創,許多團隊的第一個 AI 專案都是這樣起步的。

常見迷思:不是所有工作丟給 GPU 都會變快

這是全文最重要的澄清:GPU 不是萬靈丹,它只擅長能切成大量獨立小塊的運算。三種情況用 CPU 反而更快:一、高度序列相依的任務,下一步要等上一步的答案,幾千個核心只能排隊乾等;二、分支判斷很多的程式,GPU 同一批執行緒被迫走同一條路,遇到岔路整批停擺;三、資料量太小的工作,把資料從主記憶體搬進 GPU 再搬回來的時間,比計算本身還久,得不償失。舉個例子:熬一鍋高湯要先熬骨、再過濾、然後調味,順序綁死了,找一萬個廚師來也無法把三小時縮成一秒,因為每一步都在等上一步。工程師之間有個經驗法則:程式中無法平行化的部分,決定了加速的天花板;如果有一半的工作註定要排隊,核心再多整體頂多快兩倍。

所以實務的標準答案是異質運算:CPU 當指揮官,負責讀資料、做邏輯、發號施令;GPU 當算力大隊,接手矩陣運算這類重活。像CAE 工程模擬就是典型例子:求解器裡的大型矩陣交給 GPU,前處理與網格邏輯仍由 CPU 掌舵。你的手機、筆電、資料中心,全都是這種混合編制。下次不確定任務該給誰,用三個問題快速判斷:

  • 這件事能切成幾千份同時做嗎?能,GPU 加分
  • 資料量夠大嗎?大到值得搬進顯示記憶體再算,GPU 加分
  • 過程要不斷判斷、等待前一步結果嗎?是的話,乖乖交給 CPU

舉一個真實感十足的例子。去年一位剛接觸 AI 的資工系大四學生來諮詢,他想微調一個 70 億參數的開源語言模型當畢業專題,原本的計畫是花 NT$15,000 把桌機 CPU 從 8 核升級到 16 核。顧問只問了三個問題:程式大部分時間在做什麼?答案是矩陣運算;需要多少顯示記憶體?粗估就算用省記憶體的微調技巧也要 20 GB 上下,而他那張舊卡只有 8 GB;要用多久?專題期間約 3 個月。診斷立刻清楚:瓶頸在 GPU,升級 CPU 幾乎無感。兩條路擺在眼前:買一張 24 GB 的新消費卡加電源升級,一次噴掉近 NT$8 萬,專題結束後多半閒置;或租一台資料中心等級的 GPU 主機,月租 NT$15,000 元起,3 個月總花費不到 NT$5 萬,結案就退租。他選了後者,單輪訓練時間從舊卡估算的十幾天縮到 3 天上下,總預算省下超過三成,還不用煩惱夏天機殼過熱當機。這個案例的重點不是租用一定贏,而是先搞清楚瓶頸在哪,再讓每一塊錢花在刀口上;那三個問題,你也可以照抄拿去問自己的專案。

GPU 與 CPU 到底差在哪?用工廠流水線一次講懂平行運算【圖解】
▲ 用工廠流水線一次講懂

找台灣在地的 GPU 主機夥伴

看懂 GPU 與 CPU 的分工之後,下一個問題往往是:我的任務適合哪種卡、要幾張、租還是買?這時候,有一個講中文、在台灣、隨時找得到人的夥伴很重要。戰國策 GPU 主機提供 NVIDIA H100 與 RTX 系列多種規格,主機放在台灣機房,連線延遲低、資料不出境,月租 NT$15,000 元起,搭配 7×24 中文技術支援,從選卡、環境安裝到模型上線都有工程師陪你走。歡迎到官網 https://www.nss.com.tw/gpu 查看方案,或加 LINE 帳號 @119m 線上諮詢,也可撥打免費專線 0800-003-191,讓顧問幫你判斷:你的預算,該花在大廚,還是流水線。

常見問題 FAQ

GPU 與 CPU 差異最簡單的說法是什麼?

CPU 是少數強者:通常只有 6 到 64 個核心,每個都很聰明,擅長邏輯判斷與一步接一步的序列工作;GPU 是人海戰術:塞進數千到上萬個小核心,同時對大量資料做一模一樣的簡單運算。所以作業系統與商業邏輯靠 CPU,矩陣運算、影像與 AI 訓練靠 GPU,兩者是分工不是取代。

什麼是 GPU 伺服器?

GPU 伺服器是安裝了一張以上專業級 GPU 的伺服器,例如 NVIDIA H100 或 RTX 專業卡,搭配大容量高頻寬記憶體、數千瓦等級供電與強化散熱,通常放在資料中心全天候運轉。以八卡機種為例,滿載功耗可達 10 kW,遠超過一般辦公室電力能負荷,所以多數團隊用租用方式取得。

打電動的顯卡和 AI 用的資料中心 GPU 一樣嗎?

架構同源但定位不同。消費卡顯示記憶體多為 16 到 24 GB,不支援 ECC 與 NVLink,設計上也不是為全年無休滿載;資料中心卡如 H100 有 80 GB 高頻寬記憶體、頻寬每秒 2 到 3 TB,可多卡高速互連,適合長時間訓練。學習階段消費卡足夠,正式服務建議用資料中心等級。

為什麼 AI 訓練用 GPU 比 CPU 快這麼多?

深度學習九成以上的計算是矩陣乘加,屬於大量重複、彼此獨立的簡單運算,正好能拆給 GPU 上數千到上萬個核心同時做。CPU 核心雖強,但數量通常不到 100 個,吞吐量差了好幾個數量級。同一個訓練任務,GPU 常比純 CPU 快數十倍,訓練時間可從數週縮成數天。

是不是所有程式搬到 GPU 上都會變快?

不是。GPU 只對可平行的大量運算有效;高度序列相依、分支判斷多、或資料量太小的任務,搬上 GPU 反而因為資料搬運與啟動成本變慢。經驗上,若程式中可平行的部分不到五成,整體加速上限連 2 倍都不到;先分析任務型態再決定,比直接砸錢買卡重要得多。

CPU 核心數一直增加,能不能取代 GPU?

很難。伺服器 CPU 目前頂多一百多核,GPU 單卡就有上萬個運算單元,吞吐量差距是數十倍到百倍等級;而且 GPU 搭配的高頻寬記憶體每秒可搬 2 到 3 TB 資料,是一般 CPU 記憶體頻寬的 10 倍以上。反過來,GPU 也取代不了 CPU 的邏輯控制角色,實務是兩者協同的異質運算。

學生想入門 AI,該先買顯卡還是租 GPU 主機?

看使用時間與規模。若只是學框架、跑小模型,一張 8 到 16 GB 的消費卡或免費雲端資源就夠;要微調數十億參數的模型、專題只有 2 到 3 個月,租用通常更划算:月租 NT$15,000 元起,三個月約 NT$4.5 萬,不必一次掏 NT$6 萬以上買卡,結束退租、零閒置成本。

GPU 伺服器在台灣的電費大概是多少?

台灣工業電價每度約 NT$3 到 4 元,夏季較高。以一台八卡伺服器滿載 10 kW 估算,一個月用電約 7,200 度,電費約 NT$2 到 3 萬,機房空調通常還要再多三到五成。這是自建機房最常被低估的成本;改租 GPU 主機時,電費與空調多半已包含在月租費內。

GPU 的幾千個核心和 CPU 核心是同一種東西嗎?

不是,別被同一個「核心」字眼騙了。CPU 核心是完整的通用處理器,有大快取與分支預測,時脈約 3 到 5 GHz,可獨立執行複雜程式;GPU 的核心是精簡的運算單元,時脈約 1 到 2 GHz,必須成群結隊、由同一道指令帶著大批資料一起跑,單獨拿出來幾乎做不了事。

租一台 GPU 主機在台灣大概多少錢?

依卡的等級與數量差很大。入門的 RTX 系列單卡主機月租約 NT$15,000 元起,中階專業卡月租數萬元,H100 等級單卡月租常見十幾萬元起。相比自購:一張 H100 卡價超過 NT$100 萬,還要加伺服器、機房與電費,若使用期不滿 1 年,租用幾乎都比較划算。

               

戰國策 AI 客服系統,可1抵5位真人客服成本!自動回覆 80% 常見問題,支援串接官網、LINE、FB、IG等主流平台。24小時秒回不漏單!立即免費試用

邀請你免費加入我們的LINE社群 : 【戰國策戰勝學院】,和一群真正想搞懂商業、提升營收的老闆一起成長!