💡 快速答案:雲端遊戲和 VR 串流的延遲要壓到多少毫秒才不會有感?
雲端遊戲從按鍵到畫面反應的總延遲壓在 100 毫秒以內即可順暢遊玩,50 毫秒以下多數玩家已感覺不出與本機差異;VR 串流更嚴苛,從轉頭到畫面更新需低於約 20 毫秒,否則容易暈眩。實務作法是三管齊下:把 GPU 放在靠近玩家的在地邊緣機房,將網路來回時間從跨海的 40 毫秒壓到 10 毫秒內;用 NVENC 硬體編碼把壓縮延遲降到毫秒級;再以 90 到 120Hz 高更新率縮短每格等待時間。
想像你在台北家裡按下手把的攻擊鍵,而真正算出那一刀畫面的顯示卡,其實在幾十公里外的機房裡。它必須在你眨一次眼的十分之一時間內,把指令收進來、畫面算出來、壓縮成影片、傳回你的螢幕。這就是雲端遊戲每秒鐘重複六十次以上的魔術,而魔術成敗只有一位評審:延遲。
人類對延遲的忍耐力,比多數工程師想像的低。實務經驗指向幾個門檻:總延遲超過 100 毫秒,玩家會覺得手感「怪怪的」;壓到 50 毫秒以下,多數人分不出雲端與本機的差別;而戴上頭盔的虛擬實境(VR)更殘酷,從你轉頭到畫面跟上若超過 20 毫秒,內耳前庭系統就會抗議,輕則出戲,重則暈眩想吐。這篇文章用顧問視角拆開整條延遲鏈:每一毫秒花在哪裡、怎麼省回來,以及為什麼對台灣團隊而言,機房位置比算力大小更關鍵。
雲端遊戲的架構:GPU 在機房,手把在你家
先把管線攤開。雲端遊戲的本質是「把遊戲主機搬進資料中心」:伺服器端的 GPU 即時算出遊戲畫面,再由 GPU 內建的硬體編碼器 NVENC 把每張畫面壓縮成影像串流,格式可用 H.264、HEVC 或最新的 AV1,經網路送到玩家的手機、電視或筆電;終端裝置解碼顯示,玩家的按鍵與搖桿輸入則反向回傳雲端,驅動下一張畫面。這條迴圈每秒要跑 60 到 120 次,任何一站塞車,整條線就跟著慢。
這個架構的美妙之處在於終端可以很弱:三年前的中階手機也能玩 3A 大作,因為它只負責解影片。難處則全部集中到伺服器與網路上——GPU 要算得快、編碼要壓得快、封包要跑得快,任何一環拖慢,玩家的手感就會像「隔著一層果凍出拳」。至於 GPU 為什麼天生擅長這種每秒上百張的即時算圖工作,可以參考我們寫過的 GPU 與 CPU 差異解析,這裡不重複展開。
值得單獨介紹的是 NVENC 這顆低調的功臣。它是獨立於算圖核心之外的專用編碼電路,工作時幾乎不佔遊戲效能,把一張 1080p 畫面壓縮成串流片段只需 1 到 5 毫秒;新一代 GPU 的 AV1 編碼,還能在同樣畫質下比 H.264 省下約三到四成頻寬。對行動網路或頻寬受限的家庭用戶,這直接決定了畫質上限與流量成本。

延遲預算:每一毫秒都要記帳
顧問看延遲的方式跟財務長看預算一樣:先列科目,再逐項砍。從玩家按鍵到畫面亮起,業界稱為 click-to-photon(VR 則稱 motion-to-photon),中間至少經過八個環節。下表是一份典型的延遲帳本,中欄是常見配置的數字,右欄是各環節優化後可達的水準:
| 延遲環節 | 一般配置(毫秒) | 優化後(毫秒) | 主要優化手段 |
|---|---|---|---|
| 輸入取樣與上行傳送 | 5-10 | 2-4 | 高輪詢率、精簡協定 |
| 網路來回(RTT) | 30-50(跨海) | 5-12(在地邊緣) | 機房靠近玩家 |
| 伺服器排隊與調度 | 5-10 | 1-3 | 專屬實例、避免超賣 |
| GPU 算圖 | 16.7(60fps) | 8.3(120fps) | 提高更新率 |
| 硬體編碼(NVENC) | 5-10 | 1-4 | 低延遲模式、AV1 |
| 傳輸與抖動緩衝 | 10-20 | 3-6 | 自適應碼率、邊緣節點 |
| 終端解碼 | 4-8 | 2-4 | 硬體解碼器 |
| 顯示掃描輸出 | 8-16 | 4-8 | 高更新率螢幕 |
| 合計 | 約 84 到 141 | 約 26 到 49 | 環環相扣、逐項優化 |
這張表講了兩件殘酷的事。第一,世界上沒有一個單獨的零件叫「延遲」,它是八筆小帳的總和,只優化其中一項的方案多半是安慰劑。第二,帳本裡最肥的科目是網路 RTT:跨海連線動輒 30 到 50 毫秒起跳,一口氣吃掉 100 毫秒預算的三分之一以上;更麻煩的是,這筆帳付給的是光在光纖裡的飛行時間,再貴的 GPU 都買不回來。
想知道自家產品的帳本長怎樣,方法比想像中平民:拿一支支援 240fps 慢動作錄影的手機,同框拍下手把與螢幕,從按鍵瞬間數到畫面反應,影格數乘以 4.17 毫秒就是總延遲。工程端再用時間戳記把每個環節拆開,先量測、再優化,順序不能反過來——沒有量測就動手優化,跟閉著眼睛減肥一樣,只是心裡舒服。
把延遲壓到無感的四種武器
知道錢花在哪,接下來是省錢。業界實戰中最有效的手段有四種,而且效果可以彼此疊加:
- 邊緣機房:把 GPU 搬到離玩家夠近的地方,是唯一能大砍 RTT 的方法。台灣本島內任兩點的網路來回多在 5 到 10 毫秒,跨海到東京則要 32 到 45 毫秒——選址一次做對,勝過後面所有微調。
- 硬體編碼:開啟 NVENC 的低延遲模式、關閉 B 幀,讓編碼從「等一批畫面再壓」變成「來一張壓一張」,單張延遲可以壓進 1 到 4 毫秒。
- 高更新率:60fps 時每張畫面間隔 16.7 毫秒,提高到 120fps 就縮成 8.3 毫秒,玩家的輸入平均少等一半時間,體感立刻變「跟手」。
- 畫格預測與插補:用客戶端預測先畫出最可能的下一格,或在終端做畫格插補補足中間影格,遮蔽網路抖動造成的空窗。
預測那一招值得多講一句,它的直覺跟棒球外野手一樣:好的外野手不是看球落地才跑,而是在擊球瞬間就預判落點。系統拿玩家最近的操作軌跡預測下一步,猜對了就白賺幾十毫秒,猜錯了再用新資料快速修正——只要修正幅度夠小,玩家幾乎察覺不到。
另一個常被忽略的敵人是抖動:平均延遲 40 毫秒但忽快忽慢的線路,體感往往比穩定的 60 毫秒更糟,因為畫面會一頓一頓地跳。解法是自適應碼率搭配小而聰明的緩衝——網路變差時先降畫質保流暢,而不是死守解析度讓畫面凍結;緩衝只留 1 到 2 格就好,每多留一格,就是預先欠下 8 到 16 毫秒的債。
VR 串流:20 毫秒的生死線
VR 是這門學問的極限運動,門檻直接砍到五分之一。原因藏在你的內耳:半規管感知頭部轉動幾乎零延遲,當眼睛看到的畫面落後身體感覺超過約 20 毫秒,大腦會判定「環境不對勁」,動暈症狀隨之而來——這就是許多人玩 VR 十分鐘就冒冷汗的原因。所以 VR 的 motion-to-photon 預算不是 100 毫秒,而是 20 毫秒。
預算砍到五分之一,工作量卻更大:更新率要 90 到 120Hz,每張畫面只剩 8.3 到 11.1 毫秒可算;而且要同時渲染左右兩眼,單眼解析度動輒 2K 等級,總像素量是 1080p 平面遊戲的三到四倍,對 GPU 算力與傳輸頻寬都是加倍嚴苛的考驗。下表把兩種場景的需求並排,差距一目了然:
| 項目 | 雲端遊戲 | VR 串流 |
|---|---|---|
| 延遲門檻 | 低於 100 毫秒,理想低於 50 | 低於約 20 毫秒 |
| 更新率 | 60 到 120fps | 90 到 120Hz |
| 解析度 | 單畫面 1080p 到 4K | 雙眼各約 2K |
| GPU 負載 | 中到高 | 極高(像素量三到四倍) |
| 合理部署距離 | 同國家或區域邊緣節點 | 同城市甚至同棟建築 |
頻寬也要一起算:雙眼 2K、90Hz 的 VR 串流,即使用 HEVC 或 AV1 壓縮,碼率也常落在 50 到 100Mbps 等級,是 1080p 平面串流的三到五倍。這也是為什麼 VR 串流對無線環境特別挑剔,實務上會建議 Wi-Fi 6 以上或乾脆走有線回程,把不確定性留給可以控制的環節。
工程上的救命招是「先斬後奏」:頭盔端的非同步時間扭曲(ATW)拿最新的頭部姿態,把上一張畫面重新投影,讓轉頭的視覺回饋幾乎即時;雲端只需負責內容本身的更新。這一招把「轉頭暈不暈」跟「網路快不快」部分解耦,是雲端 VR 得以成立的關鍵。但它救不了跨海:台灣到美西來回約 110 到 150 毫秒,是暈眩門檻的六倍以上,物理上就不成立。
vGPU 與 MIG:把一張卡切給多位玩家
談完體驗,回到成本。一張資料中心等級的 GPU 對單條 1080p 串流來說太大了,整張卡服務一個玩家,像租一輛遊覽車只載一位乘客。NVIDIA 給了兩條路:vGPU 在軟體層把實體卡虛擬成多張,分配給不同虛擬機各跑各的遊戲;MIG(Multi-Instance GPU)更徹底,直接在硬體層把 H100、A100 這類卡切成最多 7 個彼此隔離的實例,算力與記憶體物理分割,一個實例出狀況也不影響鄰居。
對營運方而言,這是單位經濟學的分水嶺:同一張卡從服務 1 人變成同時服務 3 到 7 人,每條串流的攤提成本直接除以好幾倍;再搭配尖離峰調度——白天把卡撥給 AI 推論或算圖農場,晚上切回遊戲串流——一張卡的稼動率能從三成拉到七成以上。高密度部署隨之而來的散熱壓力,業界也已有成熟解法,可延伸閱讀浸沒式液冷 GPU 伺服器一文。切卡之前也要想清楚服務等級:試玩活動可以接受尖峰時段排隊 30 秒,訂閱制服務就不行——密度與體驗的平衡點,最好用實際玩家數據回推,而不是拍腦袋決定。
台灣戰場:機房位置比算力更關鍵
回到台灣。我們手上其實有兩張好牌:一是網路底子,光纖到府普及、行動網路覆蓋完整,本島內 RTT 普遍在 5 到 10 毫秒;二是社群能量,電競文化成熟、獨立遊戲開發活躍,從台北電玩展到各地 Game Jam,測試玩家與開發人才都不難找。這兩張牌對雲端遊戲與 VR 串流都是天生優勢,加上台灣玩家付費意願高、對新形態遊戲體驗接受度強,願意做在地優化的團隊,面對的是一個回報率很好的市場。
但不少團隊選基礎設施時犯同一個錯:打開海外雲的價目表比較 GPU 型號與時租,卻忘了把地理放進延遲帳本。數字很直白:台灣到東京 RTT 約 32 到 45 毫秒、到新加坡約 45 到 60 毫秒、到美國西岸約 110 到 150 毫秒。對照前面的帳本,光「跨海」這一個決定就花掉 100 毫秒預算的三到五成,之後每個環節都得勒緊褲帶;反過來,把 GPU 放進台灣在地機房,RTT 科目從 40 毫秒變 8 毫秒,白撿 30 幾毫秒,等於整個系統免費升級一輪。評估台灣在地的 GPU 主機方案時,建議把「機房到主要玩家群的實測 RTT」列為第一個問題,規格表反而可以晚點再看。
一個實際案例:台北一個 12 人的獨立遊戲團隊,去年為了線上遊戲展檔期推出雲端試玩——玩家點開網頁就能直接玩 15 分鐘,免下載免安裝。他們做的是節奏明快的動作遊戲,內部把規格訂死:台灣玩家 click-to-photon 中位數必須低於 50 毫秒,否則手感盡失,試玩反而扣分。團隊先用東京區域的雲端 GPU 實例做原型,實測台灣玩家總延遲中位數約 92 毫秒,參數怎麼調都降不進 70;改租台灣在地機房的 RTX 等級 GPU 主機後,同一套軟體堆疊實測中位數 48 毫秒,一次達標。成本同樣有感:活動檔期兩個月,租 6 張卡、以 vGPU 每卡切 3 條 1080p 串流,同時容納 18 位玩家,總支出約 NT$25 萬;若自購同級硬體得一次投入超過 NT$120 萬,活動結束設備還會閒置。附帶一提,台灣工業電價每度約 NT$3 到 4 元、夏季更貴,自建機房的電費與空調成本常被低估,租用方案把這些全包進月費,對短期專案友善許多。
找台灣在地的 GPU 主機夥伴
延遲這門生意,說到底是地理與工程的乘積:算力可以用錢加購,光速沒得談判。如果你的玩家在台灣,GPU 就應該在台灣。戰國策 GPU 主機提供 NVIDIA H100 與 RTX 系列多種規格,機器就放在台灣機房,天生把 RTT 壓到個位數毫秒;月租 NT$15,000 元起,可短租、可隨活動檔期彈性擴充,搭配 7×24 中文技術支援,從串流架構、NVENC 編碼參數到頻寬調校,都有工程師能用中文直接對話。想讓你的雲端試玩、遊戲伺服器或 VR 專案把延遲壓到玩家無感,歡迎到 https://www.nss.com.tw/gpu 了解方案,加 LINE 帳號 @119m 聊聊需求,或撥免費專線 0800-003-191,讓在地團隊陪你一起把每一毫秒省回來。

常見問題 FAQ
雲端遊戲跟一般線上遊戲的延遲有什麼不同?
一般線上遊戲的畫面在本機算,網路只傳同步資料,延遲主要影響對戰判定;雲端遊戲連畫面都在雲端算,從按鍵、算圖、編碼到回傳全部走網路,總延遲要壓在 100 毫秒內、理想 50 毫秒以下才有好手感,對網路品質的敏感度高出一個量級。
延遲要多低,玩家才真的感覺不出來?
實務門檻大致是:總延遲 100 毫秒內可順暢遊玩,70 毫秒以下多數人不易察覺,50 毫秒以下幾乎與本機無異。格鬥、節奏音樂類對延遲最敏感,建議以 50 毫秒為目標;回合制與策略類寬鬆許多,120 毫秒內通常仍可接受。
VR 為什麼要求 20 毫秒?超過會怎樣?
內耳前庭系統感知頭部轉動幾乎零延遲,若眼前畫面落後體感超過約 20 毫秒,視覺與平衡訊號打架,就會出現冒冷汗、暈眩、噁心等動暈症狀。因此 VR 串流除了壓低網路延遲,還要靠 90 到 120Hz 高更新率與時間扭曲重投影技術補救。
NVENC 是什麼?跟用 CPU 壓縮影片差在哪?
NVENC 是 NVIDIA GPU 內建的專用編碼電路,獨立於算圖核心,支援 H.264、HEVC 與 AV1,壓一張 1080p 畫面約 1 到 5 毫秒,且幾乎不吃遊戲效能;CPU 軟體編碼要達到同樣畫質往往需要數十毫秒,還會佔用遊戲本身的運算資源,因此即時串流服務幾乎一律採用硬體編碼,讓 CPU 專心處理遊戲邏輯與網路封包。
台灣玩家連海外伺服器,延遲大概多少?
概略實測值:台灣到東京網路來回約 32 到 45 毫秒,到新加坡約 45 到 60 毫秒,到美國西岸約 110 到 150 毫秒。這還只是 RTT 一個科目,加上算圖、編碼、解碼之後,跨海方案很難把總延遲壓進 50 毫秒,想做好體驗幾乎必須在地部署。
vGPU 和 MIG 有什麼差別?該怎麼選?
vGPU 是軟體層虛擬化,把一張卡分時共享給多個虛擬機,密度與彈性高;MIG 是 H100、A100 等資料中心卡的硬體切分,最多切成 7 個實例,算力與記憶體物理隔離。追求串流密度與成本攤提用 vGPU,重視隔離與服務品質保證則選 MIG。
做雲端試玩串流,需要什麼等級的 GPU?
單條 1080p60 串流用 RTX 4000 系列等級即可,一張卡搭 vGPU 常可同時服務 2 到 4 條;要上 4K 或 120fps 則建議單卡專屬,避免多條串流互搶資源。選卡重點是新版 NVENC:支援 AV1 編碼的卡在同樣畫質下,可比 H.264 節省約 30 到 40% 頻寬,對行動網路玩家的畫質與流暢度影響非常明顯。
自建 GPU 伺服器跟租用,哪個划算?
短期活動或需求未明時租用明顯划算:台灣在地 GPU 主機月租約 NT$15,000 起,用多久付多久,不必養硬體與維運人力;自建一台高階 RTX 伺服器動輒 NT$20 到 40 萬,還要加上機房空間、頻寬與每度約 NT$3 到 4 元的電費。一般把 18 到 24 個月的使用期當作損益平衡參考點。
5G 對雲端遊戲有幫助嗎?
有,但它只解決無線最後一哩:5G 空中介面延遲可壓到 10 毫秒上下,比 4G 的 30 到 50 毫秒好很多。不過骨幹網路的距離延遲不會因 5G 消失,伺服器若在海外,總延遲照樣破 100 毫秒;5G 要搭配在地邊緣機房,價值才會真正兌現。
一張 GPU 可以同時服務幾位玩家?
看畫質與卡的等級:1080p60 串流下,高階 RTX 卡配 vGPU 常見切 2 到 4 條,資料中心卡用 MIG 最多切 7 個隔離實例。密度越高單位成本越低,但建議保留 20 到 30% 的效能餘裕吸收負載尖峰,否則玩家一多就開始排隊,體驗變差的代價會把省下的成本整個吃回去,得不償失。