跑 Local LLM 先別急著換 CPU… VRAM 才是本地 AI 模型跑不動的主因

Why VRAM Matters More Than CPU for Running Local LLMs

這一年很多人開始在自己的電腦、公司內網或工作站上跑 Local LLM,例如 Ollama、LM Studio、llama.cpp、vLLM,或是把 Qwen、Llama、Mistral、Gemma 等模型放進內部環境使用。

一開始大家通常會問:「我要買哪一顆 CPU?」、「RAM 要不要直上 64GB?」但實際開始跑模型後,很常發現一件事:CPU 很新、記憶體很多,模型卻還是載不進去,或者回應速度慢到沒辦法實際使用。

問題通常不在 CPU,而在 GPUVRAM(顯示記憶體)容量與記憶體頻寬。

這篇不是硬體採購指南,只是整理自己在部署地端 AI 模型、測試 Local LLM 時,最容易踩到的幾個現實問題。尤其是準備買設備、規劃企業內部 AI 環境的人,真的建議先把 VRAM 這件事算清楚。

AI 模型-PC演進與AI工作站架構圖

為什麼 RAM 很大,模型還是跑不順?

傳統電腦使用情境中,RAM 容量很重要。開很多瀏覽器分頁、跑 VM、編譯程式、開大型專案,記憶體不夠都會直接影響體驗。

但 Local LLM 的推論核心,多數情況是交給 GPU 執行。模型權重如果能完整放在 GPU VRAM 裡,速度通常會比純 CPU 推論快非常多。

當 VRAM 不夠時,系統可能出現幾種情況:

  1. 模型根本載不進 GPU
  2. 部分模型被卸載到 RAM 或 CPU
  3. GPU 與系統記憶體之間頻繁搬資料
  4. Token 生成速度明顯下降
  5. 上下文一拉長就爆記憶體
  6. 多人同時使用時服務不穩定或延遲飆高

所以,64GB RAM 不代表你就能流暢跑大模型;它只代表你有較多空間讓 CPU 或系統記憶體接手。但「能跑」和「跑得能用」是兩件不同的事。

先用一個簡單公式估算模型需要多少 VRAM

最基礎的模型權重估算方式如下:

模型權重容量 ≒ 參數量 × 每個參數的位元數 ÷ 8

例如一個 7B 模型:

  • FP16:7B × 16 bits ÷ 8
    約需要 14GB
  • INT8:7B × 8 bits ÷ 8
    約需要 7GB
  • 4-bit 量化:7B × 4 bits ÷ 8
    理論約 3.5GB

但實務上不能只看這個數字。

因為執行模型時,VRAM 還要放:

  • 模型執行額外開銷
  • KV Cache(對話上下文越長,占用越大)
  • CUDA / 驅動程式與框架空間
  • 批次處理 Batch Size
  • Embedding、Reranker 或其他模型
  • 多使用者併發需求

因此,如果一個 7B 模型的 4-bit 權重看起來只要 4GB,不代表你用 4GB VRAM 就能舒服地跑。實務上通常還要保留安全空間。

我自己的原則是:

VRAM 不要只剛好塞下模型,最好保留至少 20%~30% 的餘裕。

否則模型一遇到長對話、文件 RAG、多人使用或服務重啟,就很容易開始出現效能不穩定。

VRAM 容量決定「跑不跑得下」,頻寬決定「回得快不快」

很多人只看顯卡有幾 GB VRAM,但 VRAM 容量與頻寬要分開看。

  • VRAM 容量: 決定模型、上下文與服務能不能放進去。
  • VRAM 頻寬: 影響模型每秒可以生成多少 Token,也就是回答速度。

LLM 推論本質上要持續讀取大量模型權重。模型越大,對記憶體頻寬的需求越明顯。

這也是為什麼有時候兩張顯卡 VRAM 接近,但跑模型體感差很多。不是 GPU 核心數字不好看,而是模型推論常常卡在資料搬運速度。

可以把它想像成….

  • CPU 是廚房管理者
  • RAM 是倉庫
  • SSD 是物流中心
  • GPU 是廚師
  • VRAM 是廚師手邊的工作檯

倉庫再大,如果廚師手邊工作檯太小,食材一直要跑回倉庫拿,出餐速度自然快不起來。

常見模型與 VRAM 的實務抓法

以下是比較保守、偏實用的估算,不同量化格式、Context Length、推論框架都會有差異,但可以作為選硬體時的第一輪判斷。

使用情境建議 VRAM可考慮模型範圍
個人嘗鮮、聊天、寫程式輔助8GB3B~8B 的 4-bit 模型
想穩定跑 7B~14B12GB~16GBQwen 7B/14B、Llama 8B 等量化模型
RAG、長上下文、程式碼與多模型並行24GB14B~32B 的量化模型,較適合實務使用
部門內部 PoC、小型服務24GB~48GB32B 左右量化模型、較長 Context
企業多人服務或大型模型48GB 以上70B 量化模型、多使用者併發推論

這裡要特別提醒:模型標示的參數量,不等於實際 VRAM 用量。

例如同樣是 14B 模型…..

  • 4-bit 與 8-bit 的需求不同
  • Context Window 開 4K、16K、32K,KV Cache 差異很大
  • 單人聊天與 20 人同時問問題,需求完全不同
  • Ollama、LM Studio、vLLM、TensorRT-LLM 的記憶體管理方式也不同

所以看到「某顯卡可以跑 70B」這種說法時,要先問清楚:是能載入、能對話,還是能讓多人穩定使用?

不要誤會「共享 GPU 記憶體」

Windows 工作管理員常會顯示「專用 GPU 記憶體」與「共享 GPU 記憶體」。

不少人看到共享記憶體很大,以為 8GB 顯卡加上 32GB RAM,就等於有 40GB 可以給 AI 用。這是很常見的誤會。

共享記憶體本質上仍然是系統 RAM,資料要經過 PCIe 在 CPU/RAM 與 GPU 之間搬運。它不是原生 VRAM,速度差距非常大。

當模型大量使用共享記憶體時,通常代表:

  • 可以勉強載入
  • 但生成速度可能明顯變慢
  • 長對話或高併發時容易卡頓
  • 體驗未必適合正式工作流程

如果你的目標只是偶爾測試,CPU + RAM 推論當然可以接受;但如果是每天寫程式、處理文件、做內部知識庫問答,VRAM 還是最該優先投資的地方。

我的硬體投資排序:先顯卡,再決定其他零件

如果預算有限,我會把地端 AI 工作站的優先順序排成…..

VRAM 容量→GPU 頻寬與推論效能→系統 RAM → CPU → SSD 容量與速度

因為…..

  • VRAM 決定你能使用什麼等級的模型
  • GPU 效能與頻寬決定等待時間
  • RAM 決定你能否同時處理多個服務、文件與模型
  • CPU 影響前後處理、向量化、文件解析、服務管理
  • SSD 影響模型載入與資料讀取,但通常不是 Token 生成的最大瓶頸

不是說 CPU 不重要,而是多數人做 Local LLM 時,常常把預算花在高階 CPU、主機板或超大 RAM,最後顯卡只買到 8GB 或 12GB。這樣的配置拿來做一般桌機很好,但對地端 AI 來說,常常是最可惜的預算分配。

企業導入時,不要只問「能不能跑」

企業在評估地端 AI 時,最常出現的問題是:「這台機器能不能跑某某模型?」

更應該問的是……

  • 同時幾個人使用?
  • 預期回覆速度是多少?
  • 文件問答的 Context 要開多長?
  • 是否需要 RAG、Embedding、Reranker?
  • 是否要跑 OCR、語音、圖片模型?
  • 是否有資料不能離開內網的要求?
  • 模型更新後,硬體還有沒有擴充空間?

一台只有 12GB VRAM 的設備,也許可以讓工程師做模型測試;但若要作為部門共用的知識庫問答服務,通常很快就會遇到併發、上下文和效能問題。

企業採購最怕的不是買太貴,而是買了一台「Demo 看起來可以、正式上線就不夠」的設備。


結語:先決定你要跑哪種 AI,再回頭買硬體

Local LLM 的硬體選擇,不是「CPU 越高階越好」,而是要先釐清模型大小、量化格式、上下文長度與使用人數。

如果只是本機聊天、寫程式、測試模型,8GB~16GB VRAM 仍有很多可玩的空間;但若開始做 RAG、長文件分析、內部知識庫或多人服務,24GB VRAM 往往才是比較實際的分水嶺。

買硬體前,先問自己一句….

我要的是「模型能跑」,還是「模型跑起來真的能用」?
這兩者之間,往往就差在那幾 GB 的 VRAM。

更多文章…
LLM其實還蠻多家推出的,來搞懂LLM,我再想想規劃搜尋工具
打造一個完全屬於自己的 AI 助理…一毛錢都不用花
為什麼越來越多人提起開源 AI?是趨勢嗎?
AI PC,真的只是多一顆 NPU?
AI 真的需要一直連網嗎?
地端 AI 落地關鍵..別只看 CPU 與 RAM,VRAM 才是 Local LLM 的硬體瓶頸


探索更多來自 YinOnMars 的內容

訂閱即可透過電子郵件收到最新文章。

發表迴響

探索更多來自 YinOnMars 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀