Qwen3-0.6B 本地部署教學:在樹莓派上跑大型語言模型

前言 你以為跑大型語言模型(LLM)一定要有一張 expensive 的顯卡、一台配備頂級 CPU 的伺服器嗎?錯了。 阿里巴巴的 Qwen3 系列在 2025 年 4 月發表時,最引人注目的不是那個 235B 參數的 MoE 旗艦模型,而是那個只有 0.6B(6 億)參數 的迷你版本——Qwen3-0.6B。它體積小到什麼程度?量化後只有約 523 MB,連你的手機都能裝。 而這篇文章要帶你用一台樹莓派(Raspberry Pi),在本地跑起這個「麻雀雖小,五臟俱全」的語言模型。不需要雲端、不需要網路、隱私全在自己手上。 - 廣告 - 什麼是 Qwen3-0.6B? Qwen3-0.6B 是 Qwen3 系列中最輕量的稠密(Dense)模型,於 2025 年 4 月 29 日由阿里巴巴 Qwen 團隊發布,採用 Apache 2.0 授權,可自由商用。 核心規格 項目 規格 參數數量 0.6B(0.44B 非嵌入層) Transformer 層數 28 層 注意力機制 GQA(16 個 Query heads / 8 個 KV heads) 上下文長度 32,768 tokens 詞彙表大小 151,669 tokens 訓練語料 約 36 兆 tokens(119 種語言) 授權 Apache 2.0 為什麼 0.6B 值得關注? 別看它參數少,Qwen3-0.6B 經歷了從大模型(Qwen3-32B 和 Qwen3-235B-A22B)到小模型的知識蒸餾過程,继承了思考模式切換和推理能力。 ...

GGUF 量化實戰:在 Raspberry Pi 上跑 Qwen3 7B 的完整流程

前言:把 AI 塞進信用卡大小的電腦 你大概聽過「大語言模型要跑在顯卡上」,但你有沒有想過,一台只要 35 美元的 Raspberry Pi 也能跑 70 億參數的 Qwen3? 這聽起來像魔法,但背後的技術其實很樸實——GGUF 量化(GPT-Generated Unified Format)。它把原本需要 16 GB 記憶體的模型壓縮到 4 GB,還不需要任何獨顯,純粹用 CPU 就能跑。 這篇文章會帶你走完整流程:從模型下載、量化選擇、到在 Raspberry Pi 上實際跑起來。無論你是硬體玩家、邊緣運算愛好者,還是單純想省錢跑 AI 的窮人,這篇都適合你。 - 廣告 - 什麼是 GGUF?為什麼它能讓你省記憶體? GGUF 是 llama.cpp 專案開發的模型格式。它的核心思想很直接:把模型的權重用更少的 bit 來表示。 一般 PyTorch 模型用的是 FP16(16 位元浮點數),一個參數佔 2 bytes。但如果你把精度降到 4 bit(也就是 0.5 bytes),模型檔案就能縮小到原來的四分之一。 ...