Why VRAM Matters More Than CPU for Running Local LLMs
內容目錄
這一年很多人開始在自己的電腦、公司內網或工作站上跑 Local LLM,例如 Ollama、LM Studio、llama.cpp、vLLM,或是把 Qwen、Llama、Mistral、Gemma 等模型放進內部環境使用。
一開始大家通常會問:「我要買哪一顆 CPU?」、「RAM 要不要直上 64GB?」但實際開始跑模型後,很常發現一件事:CPU 很新、記憶體很多,模型卻還是載不進去,或者回應速度慢到沒辦法實際使用。
問題通常不在 CPU,而在 GPU 的 VRAM(顯示記憶體)容量與記憶體頻寬。
這篇不是硬體採購指南,只是整理自己在部署地端 AI 模型、測試 Local LLM 時,最容易踩到的幾個現實問題。尤其是準備買設備、規劃企業內部 AI 環境的人,真的建議先把 VRAM 這件事算清楚。

為什麼 RAM 很大,模型還是跑不順?
傳統電腦使用情境中,RAM 容量很重要。開很多瀏覽器分頁、跑 VM、編譯程式、開大型專案,記憶體不夠都會直接影響體驗。
但 Local LLM 的推論核心,多數情況是交給 GPU 執行。模型權重如果能完整放在 GPU VRAM 裡,速度通常會比純 CPU 推論快非常多。
當 VRAM 不夠時,系統可能出現幾種情況:
- 模型根本載不進 GPU
- 部分模型被卸載到 RAM 或 CPU
- GPU 與系統記憶體之間頻繁搬資料
- Token 生成速度明顯下降
- 上下文一拉長就爆記憶體
- 多人同時使用時服務不穩定或延遲飆高
所以,64GB RAM 不代表你就能流暢跑大模型;它只代表你有較多空間讓 CPU 或系統記憶體接手。但「能跑」和「跑得能用」是兩件不同的事。
先用一個簡單公式估算模型需要多少 VRAM
最基礎的模型權重估算方式如下:
模型權重容量 ≒ 參數量 × 每個參數的位元數 ÷ 8
例如一個 7B 模型:
- FP16:7B × 16 bits ÷ 8
約需要 14GB - INT8:7B × 8 bits ÷ 8
約需要 7GB - 4-bit 量化:7B × 4 bits ÷ 8
理論約 3.5GB
但實務上不能只看這個數字。
因為執行模型時,VRAM 還要放:
- 模型執行額外開銷
- KV Cache(對話上下文越長,占用越大)
- CUDA / 驅動程式與框架空間
- 批次處理 Batch Size
- Embedding、Reranker 或其他模型
- 多使用者併發需求
因此,如果一個 7B 模型的 4-bit 權重看起來只要 4GB,不代表你用 4GB VRAM 就能舒服地跑。實務上通常還要保留安全空間。
我自己的原則是:
VRAM 不要只剛好塞下模型,最好保留至少 20%~30% 的餘裕。
否則模型一遇到長對話、文件 RAG、多人使用或服務重啟,就很容易開始出現效能不穩定。
VRAM 容量決定「跑不跑得下」,頻寬決定「回得快不快」
很多人只看顯卡有幾 GB VRAM,但 VRAM 容量與頻寬要分開看。
- VRAM 容量: 決定模型、上下文與服務能不能放進去。
- VRAM 頻寬: 影響模型每秒可以生成多少 Token,也就是回答速度。
LLM 推論本質上要持續讀取大量模型權重。模型越大,對記憶體頻寬的需求越明顯。
這也是為什麼有時候兩張顯卡 VRAM 接近,但跑模型體感差很多。不是 GPU 核心數字不好看,而是模型推論常常卡在資料搬運速度。
可以把它想像成….
- CPU 是廚房管理者
- RAM 是倉庫
- SSD 是物流中心
- GPU 是廚師
- VRAM 是廚師手邊的工作檯
倉庫再大,如果廚師手邊工作檯太小,食材一直要跑回倉庫拿,出餐速度自然快不起來。

常見模型與 VRAM 的實務抓法
以下是比較保守、偏實用的估算,不同量化格式、Context Length、推論框架都會有差異,但可以作為選硬體時的第一輪判斷。
| 使用情境 | 建議 VRAM | 可考慮模型範圍 |
|---|---|---|
| 個人嘗鮮、聊天、寫程式輔助 | 8GB | 3B~8B 的 4-bit 模型 |
| 想穩定跑 7B~14B | 12GB~16GB | Qwen 7B/14B、Llama 8B 等量化模型 |
| RAG、長上下文、程式碼與多模型並行 | 24GB | 14B~32B 的量化模型,較適合實務使用 |
| 部門內部 PoC、小型服務 | 24GB~48GB | 32B 左右量化模型、較長 Context |
| 企業多人服務或大型模型 | 48GB 以上 | 70B 量化模型、多使用者併發推論 |
這裡要特別提醒:模型標示的參數量,不等於實際 VRAM 用量。
例如同樣是 14B 模型…..
- 4-bit 與 8-bit 的需求不同
- Context Window 開 4K、16K、32K,KV Cache 差異很大
- 單人聊天與 20 人同時問問題,需求完全不同
- Ollama、LM Studio、vLLM、TensorRT-LLM 的記憶體管理方式也不同
所以看到「某顯卡可以跑 70B」這種說法時,要先問清楚:是能載入、能對話,還是能讓多人穩定使用?
不要誤會「共享 GPU 記憶體」
Windows 工作管理員常會顯示「專用 GPU 記憶體」與「共享 GPU 記憶體」。
不少人看到共享記憶體很大,以為 8GB 顯卡加上 32GB RAM,就等於有 40GB 可以給 AI 用。這是很常見的誤會。
共享記憶體本質上仍然是系統 RAM,資料要經過 PCIe 在 CPU/RAM 與 GPU 之間搬運。它不是原生 VRAM,速度差距非常大。
當模型大量使用共享記憶體時,通常代表:
- 可以勉強載入
- 但生成速度可能明顯變慢
- 長對話或高併發時容易卡頓
- 體驗未必適合正式工作流程
如果你的目標只是偶爾測試,CPU + RAM 推論當然可以接受;但如果是每天寫程式、處理文件、做內部知識庫問答,VRAM 還是最該優先投資的地方。
我的硬體投資排序:先顯卡,再決定其他零件
如果預算有限,我會把地端 AI 工作站的優先順序排成…..
VRAM 容量→GPU 頻寬與推論效能→系統 RAM → CPU → SSD 容量與速度
因為…..
- VRAM 決定你能使用什麼等級的模型
- GPU 效能與頻寬決定等待時間
- RAM 決定你能否同時處理多個服務、文件與模型
- CPU 影響前後處理、向量化、文件解析、服務管理
- SSD 影響模型載入與資料讀取,但通常不是 Token 生成的最大瓶頸
不是說 CPU 不重要,而是多數人做 Local LLM 時,常常把預算花在高階 CPU、主機板或超大 RAM,最後顯卡只買到 8GB 或 12GB。這樣的配置拿來做一般桌機很好,但對地端 AI 來說,常常是最可惜的預算分配。
企業導入時,不要只問「能不能跑」
企業在評估地端 AI 時,最常出現的問題是:「這台機器能不能跑某某模型?」
更應該問的是……
- 同時幾個人使用?
- 預期回覆速度是多少?
- 文件問答的 Context 要開多長?
- 是否需要 RAG、Embedding、Reranker?
- 是否要跑 OCR、語音、圖片模型?
- 是否有資料不能離開內網的要求?
- 模型更新後,硬體還有沒有擴充空間?
一台只有 12GB VRAM 的設備,也許可以讓工程師做模型測試;但若要作為部門共用的知識庫問答服務,通常很快就會遇到併發、上下文和效能問題。
企業採購最怕的不是買太貴,而是買了一台「Demo 看起來可以、正式上線就不夠」的設備。
結語:先決定你要跑哪種 AI,再回頭買硬體
Local LLM 的硬體選擇,不是「CPU 越高階越好」,而是要先釐清模型大小、量化格式、上下文長度與使用人數。
如果只是本機聊天、寫程式、測試模型,8GB~16GB VRAM 仍有很多可玩的空間;但若開始做 RAG、長文件分析、內部知識庫或多人服務,24GB VRAM 往往才是比較實際的分水嶺。
買硬體前,先問自己一句….
我要的是「模型能跑」,還是「模型跑起來真的能用」?
這兩者之間,往往就差在那幾 GB 的 VRAM。
更多文章…
LLM其實還蠻多家推出的,來搞懂LLM,我再想想規劃搜尋工具
打造一個完全屬於自己的 AI 助理…一毛錢都不用花
為什麼越來越多人提起開源 AI?是趨勢嗎?
AI PC,真的只是多一顆 NPU?
AI 真的需要一直連網嗎?
地端 AI 落地關鍵..別只看 CPU 與 RAM,VRAM 才是 Local LLM 的硬體瓶頸
發表迴響