今年七月,Lucebox 團隊在 AMD Ryzen AI MAX+ 395 (內部代號 Strix Halo)這顆消費級 APU 上跑起了 DeepSeek V4 Flash——一個總引數 284B、每 token 僅啟用約 13B 的 MoE 大模型。測試結果已提交至 LocalMaxxing 排行榜,在 Ryzen AI Max 395 硬體組別中排名第一。
沒有獨立顯示卡、不依賴雲端推理服務,純靠 CPU 與 Radeon 8060S GPU 共用的 128 GB LPDDR5X 記憶體,decode 速度最高跑到 32.0 tok/s(greedy decode, temperature=0)。這個數字在 LocalMaxxing 的 Strix Halo 排行榜上是第一名——第二名是 HipFire 引擎的 18.99 tok/s,Lucebox 快了約 68.5%。
ROCmFPX:把 284B 塞進 128 GB RAM
DeepSeek V4 Flash 原始權重用 FP16 算約 568 GB(284B × 2 bytes),即便是 Q4_K_M 量化也要近 174 GB。一般消費級電腦根本沒地方放。Lucebox 的解法是用自訂的 ROCmFPX 混合精度量化格式,把整體位元率壓到平均 2.88 bits/parameter,最終模型檔案只剩 102.3 GB(約 95.3 GiB)。
這個量化家族不是單一格式,而是按矩陣區塊分配不同 bit-width:expert gate 和 up 矩陣用 2.50 bits(ROCmFP2),expert down projection 用 3.50 bits(ROCmFP3),密集或敏感投影層則保留到 4.25 bits(ROCmFP4)。算下來,扣除 DSpark draft 模型(11.3 GB)、作業系統與 ROCm 執行時期的佔用後,記憶體裡只剩約 14.4 GB的緩衝空間——勉強夠用。
這種做法的好處是敏感層保留較高位寬、不重要的區塊大膽壓縮,在極低 bit-width 下維持模型品質。對 MoE 架構來說,expert 路由和 projection 矩陣佔了最大比重——針對這些區域個別量化剛好命中要害。
值得注意的是,ROCmFPX 不是單一量化格式,而是一個家族。每個區塊包含 32 個權重,打包成低 bit code 加上一到兩個 scale 值。ROCmFP2 將一個區塊壓到 10 bytes(即 2.50 bits/weight),ROCmFP3 用 3.50 bits,ROCmFP4 則用 4.25 bits。量化時 Lucebox 使用了 importance matrix,並保留了模型的 MTP(Multi-Token Prediction)head。
DSpark:在記憶體頻寬受限的 APU 上做 speculative decoding
不使用任何推測解碼時,Lucebox 的純自回歸(autoregressive)decode 速度為 25.31 tok/s。透過 DSpark 推測解碼(speculative decoding),最終達到 32.0 tok/s,加速約 26.4%。
APU 跑大模型的最大瓶頸是記憶體頻寬。自回歸 decode 一個 token 就要讀一次完整的模型權重——128 GB LPDDR5X 的理論頻寬為 256 GB/s(實測約 215 GB/s),架不住 284B 的龐大體積。
DSpark 的做法是用一個輕量級的三層 draft 模型來預測接下來可能出現的 token,然後目標模型一次性驗證多個位置。具體流程:
- Propose:DSpark draft 模型從目標模型的隱藏特徵中提取資訊,提出最多三個新 token
- Verify:以 q=4 batch 的方式讓 284B 目標模型透過 fused HIP graph 一次檢查四個位置(包含當前 seed)
- Commit:正確的提案一次性提交,第一個出錯的位置由目標模型修正
在 q=4 上限且關閉 adaptive width 的設定下,Lucebox 達成了 32.0 tok/s。實際加速比例會隨 DSpark 提案被目標模型接受的數量而變化。
在 CPU 或記憶體頻寬受限的環境裡,speculative decoding 的效果往往比在 GPU 上更明顯——因為驗證步驟一次處理多個 token 的 amortized 成本更低。Lucebox 同時與 Geometric 合作,由 DeanoC 最佳化 HIP routing path,加入專屬的 ROCm TOP_K 和 ARGSORT kernels,使 expert selection 在 microbenchmark 中快了 3.5–7×(此最佳化未計入公開的 32 tok/s 成績)。
Sparse Prefill:快是快,但不保證精確等價
DeepSeek V4 Flash 內建一個學習型索引器(learned indexer),用於壓縮歷史記憶體的注意力計算。啟用 sparse prefill 模式後,prefill 速度從約 23 tok/s 暴升到近 250 tok/s,差了一個數量級。
不過這個加速是有代價的。Sparse prefill 逐 layer batch 處理,浮點數運算順序跟 token-wise exact prefill 不同,所以輸出不是 byte-for-byte 一致——需要 opt-in 使用。
Lucebox 在小規模 GSM8K 測試拿了 10/10、HumanEval smoke test 也過了 3/3,但大規模的品質影響還待確認。
另一個限制是 context length——在 Lucebox 的公開測試設定中僅設為 8,192 tokens。需要注意的是,DeepSeek V4 Flash 原始模型本身支援到 1M context(與 V4-Pro 同架構),但 Strix Halo 上的 ROCmFPX + DSpark 實作目前只驗證到 8K。
另外在 Long request(約 24K tokens)的測試中,sparse prefill 速度降至約 221.9 tok/s。
Strix Halo:消費級 AI 推理的新選項
這則報告最值得關注的不是某個單一技術細節,而是它代表的意義——本地執行大型 MoE 模型已經從「可行」走向「實用」。
過去跑 200B+ 模型通常需要多張高階 GPU 或 Mac Studio 這種高頻寬記憶體裝置。現在一顆約兩千美元的 Strix Halo APU 就能搞定。MoE 架構因為每個 token 只啟用少量引數(DeepSeek V4 Flash 每個 token 僅啟用約 13B),在共用記憶體平臺上特別吃香——不需要獨立顯示卡,全放 RAM 就好。
當然還有不少未解問題:
- Windows HIP 支援:目前公開的復現步驟基於 Linux + ROCm,Windows 上的完整支援狀態尚待確認。
--ds4-expert-top-k從預設值 6 降到 4:這確實改變了模型執行路徑,在速度上換取了些許品質空間。建議針對特定 workload 與 six-expert autoregressive 輸出做對比測試。- **DSpark draft 模型的接受率(acceptance rate)**在不同任務上的表現如何?官方僅給出 q=4 cap 下的整體 decode tok/s,未提供各任務的詳細 accept/reject 統計。
- Sparse prefill 的品質邊界:目前只有小規模 regression check,尚未有全面的 accuracy benchmark。
不過整體來看,Strix Halo + ROCmFPX + DSpark 這套組合拳打出了一條消費級跑大模型的新路徑。對預算有限但想在本機體驗頂級 MoE 模型的使用者來說,確實是當前價效比最高的選擇之一。
重現步驟摘要
有興趣自己跑的人,大致流程如下:
以下是根據 Lucebox 官方部落格整理的復現步驟(基於 Linux + ROCm):
- 安裝依賴:ROCm 7.2.4、build-essential、cmake、git、ninja-build、hipblas-dev、rocblas-dev 等。
- Clone Lucebox 原始碼:
git clone --branch main --recurse-submodules https://github.com/Luce-Org/lucebox.git - 編譯:使用 CMake + Ninja,指定
DDFLASH27B_GPU_BACKEND=hip、DDFLASH27B_HIP_ARCHITECTURES=gfx1151等引數編譯dflash_server。 - 下載權重:
- ROCmFPX target:DeepSeek-V4-Flash-ROCMFP2-STRIX.gguf (102.3 GB)
- DSpark draft:DeepSeek-V4-Flash-DSpark-draft-Q4RMFP4-denseF16.gguf (11.3 GB)
- 設定時脈與環境變數:將 ACPI platform profile 設為
performance,Radeon performance level 設為high(GPU 時脈約 2.9 GHz),並設定DFLASH_DS4_SPEC=1、DFLASH_DS4_SPEC_Q=4等。 - 啟動伺服器:加上
--ds4-fused-decode、--ds4-expert-top-k 4、--ds4-prefill sparse、--max-ctx 8192等引數。
整個專案採用 Apache-2.0 授權,完全開源可重現。官方強調:上述 ROCmFPX format、fused decode path、DSpark verifier、sparse prefill 與 q=4 weight reuse 全部包含在 main branch 中,不需要 integration branch 或 private patch。
整個專案採用 Apache-2.0 授權,完全開源可重現。對於熟悉 ROCm 生態的使用者來說,門檻不算高。
小結
DeepSeek V4 Flash 在 Strix Halo APU 上的表現證明瞭一件事:大模型推理已經從「可行」走向「實用」。混合量化把體積壓到能放進消費級記憶體,speculative decoding 把速度推到可用範圍,sparse prefill 讓推理效率再上一層。
8K context 是目前最大的短板——但請注意原始模型本身支援到 1M,Lucebox 的實作只是先驗證了 8K 設定。考慮到這還是第一波公開測試,後續版本應該會逐步改善。
如果你手邊剛好有一臺 Strix Halo 裝置(例如 $1,499 的 GMKtec EVO-X2、$1,899 的 Beelink GTR9 Pro),或者打算買一臺來玩本地 AI——現在確實是個不錯的時機。