GGUF 量化實戰:在 Raspberry Pi 上跑 Qwen3 7B 的完整流程
前言:把 AI 塞進信用卡大小的電腦 你大概聽過「大語言模型要跑在顯卡上」,但你有沒有想過,一台只要 35 美元的 Raspberry Pi 也能跑 70 億參數的 Qwen3? 這聽起來像魔法,但背後的技術其實很樸實——GGUF 量化(GPT-Generated Unified Format)。它把原本需要 16 GB 記憶體的模型壓縮到 4 GB,還不需要任何獨顯,純粹用 CPU 就能跑。 這篇文章會帶你走完整流程:從模型下載、量化選擇、到在 Raspberry Pi 上實際跑起來。無論你是硬體玩家、邊緣運算愛好者,還是單純想省錢跑 AI 的窮人,這篇都適合你。 什麼是 GGUF?為什麼它能讓你省記憶體? GGUF 是 llama.cpp 專案開發的模型格式。它的核心思想很直接:把模型的權重用更少的 bit 來表示。 一般 PyTorch 模型用的是 FP16(16 位元浮點數),一個參數佔 2 bytes。但如果你把精度降到 4 bit(也就是 0.5 bytes),模型檔案就能縮小到原來的四分之一。 不過別急著喊「砍掉重練」——GGUF 的量化不是「一刀切」。它採用混合精度量化(K-quants),讓重要權重保持高精度、不重要的權重用低精度。這就像用不同粗細的筆來畫畫:重要的線條用細筆、背景用粗筆,整體看起來幾乎沒差。 量化格式 7B 模型大小 所需記憶體 品質損失 BF16(原始) ~15.6 GB ~17 GB 無 Q8_0 ~8.3 GB ~10 GB <0.1% Q6_K ~6.4 GB ~8 GB ~0.1% Q4_K_M ~4.8 GB ~6 GB ~1.7% Q3_K_M ~3.9 GB ~5 GB ~6% Q2_K ~3.1 GB ~4 GB ~15% 來源:llama.cpp 官方 perplexity 測試。Q4_K_M 是品質與大小的最佳平衡點,也是這篇文章的推薦格式。 ...