今年七月,Lucebox 團隊在 AMD Ryzen AI MAX+ 395 (內部代號 Strix Halo)這顆消費級 APU 上跑起了 DeepSeek V4 Flash——一個總引數 284B、每 token 僅啟用約 13B 的 MoE 大模型。測試結果已提交至 LocalMaxxing 排行榜,在 Ryzen AI Max 395 硬體組別中排名第一。

沒有獨立顯示卡、不依賴雲端推理服務,純靠 CPU 與 Radeon 8060S GPU 共用的 128 GB LPDDR5X 記憶體,decode 速度最高跑到 32.0 tok/s(greedy decode, temperature=0)。這個數字在 LocalMaxxing 的 Strix Halo 排行榜上是第一名——第二名是 HipFire 引擎的 18.99 tok/s,Lucebox 快了約 68.5%

ROCmFPX:把 284B 塞進 128 GB RAM

DeepSeek V4 Flash 原始權重用 FP16 算約 568 GB(284B × 2 bytes),即便是 Q4_K_M 量化也要近 174 GB。一般消費級電腦根本沒地方放。Lucebox 的解法是用自訂的 ROCmFPX 混合精度量化格式,把整體位元率壓到平均 2.88 bits/parameter,最終模型檔案只剩 102.3 GB(約 95.3 GiB)。

這個量化家族不是單一格式,而是按矩陣區塊分配不同 bit-width:expert gate 和 up 矩陣用 2.50 bits(ROCmFP2),expert down projection 用 3.50 bits(ROCmFP3),密集或敏感投影層則保留到 4.25 bits(ROCmFP4)。算下來,扣除 DSpark draft 模型(11.3 GB)、作業系統與 ROCm 執行時期的佔用後,記憶體裡只剩約 14.4 GB的緩衝空間——勉強夠用。

ROCmFPX 混合精度量化分配

這種做法的好處是敏感層保留較高位寬、不重要的區塊大膽壓縮,在極低 bit-width 下維持模型品質。對 MoE 架構來說,expert 路由和 projection 矩陣佔了最大比重——針對這些區域個別量化剛好命中要害。

值得注意的是,ROCmFPX 不是單一量化格式,而是一個家族。每個區塊包含 32 個權重,打包成低 bit code 加上一到兩個 scale 值。ROCmFP2 將一個區塊壓到 10 bytes(即 2.50 bits/weight),ROCmFP3 用 3.50 bits,ROCmFP4 則用 4.25 bits。量化時 Lucebox 使用了 importance matrix,並保留了模型的 MTP(Multi-Token Prediction)head。

DSpark:在記憶體頻寬受限的 APU 上做 speculative decoding

不使用任何推測解碼時,Lucebox 的純自回歸(autoregressive)decode 速度為 25.31 tok/s。透過 DSpark 推測解碼(speculative decoding),最終達到 32.0 tok/s,加速約 26.4%

APU 跑大模型的最大瓶頸是記憶體頻寬。自回歸 decode 一個 token 就要讀一次完整的模型權重——128 GB LPDDR5X 的理論頻寬為 256 GB/s(實測約 215 GB/s),架不住 284B 的龐大體積。

DSpark 的做法是用一個輕量級的三層 draft 模型來預測接下來可能出現的 token,然後目標模型一次性驗證多個位置。具體流程:

  1. Propose:DSpark draft 模型從目標模型的隱藏特徵中提取資訊,提出最多三個新 token
  2. Verify:以 q=4 batch 的方式讓 284B 目標模型透過 fused HIP graph 一次檢查四個位置(包含當前 seed)
  3. Commit:正確的提案一次性提交,第一個出錯的位置由目標模型修正

q=4 上限且關閉 adaptive width 的設定下,Lucebox 達成了 32.0 tok/s。實際加速比例會隨 DSpark 提案被目標模型接受的數量而變化。

在 CPU 或記憶體頻寬受限的環境裡,speculative decoding 的效果往往比在 GPU 上更明顯——因為驗證步驟一次處理多個 token 的 amortized 成本更低。Lucebox 同時與 Geometric 合作,由 DeanoC 最佳化 HIP routing path,加入專屬的 ROCm TOP_K 和 ARGSORT kernels,使 expert selection 在 microbenchmark 中快了 3.5–7×(此最佳化未計入公開的 32 tok/s 成績)。

Sparse Prefill:快是快,但不保證精確等價

DeepSeek V4 Flash 內建一個學習型索引器(learned indexer),用於壓縮歷史記憶體的注意力計算。啟用 sparse prefill 模式後,prefill 速度從約 23 tok/s 暴升到近 250 tok/s,差了一個數量級。

不過這個加速是有代價的。Sparse prefill 逐 layer batch 處理,浮點數運算順序跟 token-wise exact prefill 不同,所以輸出不是 byte-for-byte 一致——需要 opt-in 使用。

Lucebox 在小規模 GSM8K 測試拿了 10/10、HumanEval smoke test 也過了 3/3,但大規模的品質影響還待確認。

另一個限制是 context length——在 Lucebox 的公開測試設定中僅設為 8,192 tokens。需要注意的是,DeepSeek V4 Flash 原始模型本身支援到 1M context(與 V4-Pro 同架構),但 Strix Halo 上的 ROCmFPX + DSpark 實作目前只驗證到 8K。

另外在 Long request(約 24K tokens)的測試中,sparse prefill 速度降至約 221.9 tok/s

Strix Halo:消費級 AI 推理的新選項

這則報告最值得關注的不是某個單一技術細節,而是它代表的意義——本地執行大型 MoE 模型已經從「可行」走向「實用」。

過去跑 200B+ 模型通常需要多張高階 GPU 或 Mac Studio 這種高頻寬記憶體裝置。現在一顆約兩千美元的 Strix Halo APU 就能搞定。MoE 架構因為每個 token 只啟用少量引數(DeepSeek V4 Flash 每個 token 僅啟用約 13B),在共用記憶體平臺上特別吃香——不需要獨立顯示卡,全放 RAM 就好。

當然還有不少未解問題:

  • Windows HIP 支援:目前公開的復現步驟基於 Linux + ROCm,Windows 上的完整支援狀態尚待確認。
  • --ds4-expert-top-k 從預設值 6 降到 4:這確實改變了模型執行路徑,在速度上換取了些許品質空間。建議針對特定 workload 與 six-expert autoregressive 輸出做對比測試。
  • **DSpark draft 模型的接受率(acceptance rate)**在不同任務上的表現如何?官方僅給出 q=4 cap 下的整體 decode tok/s,未提供各任務的詳細 accept/reject 統計。
  • Sparse prefill 的品質邊界:目前只有小規模 regression check,尚未有全面的 accuracy benchmark。

不過整體來看,Strix Halo + ROCmFPX + DSpark 這套組合拳打出了一條消費級跑大模型的新路徑。對預算有限但想在本機體驗頂級 MoE 模型的使用者來說,確實是當前價效比最高的選擇之一。

- 廣告 -

重現步驟摘要

有興趣自己跑的人,大致流程如下:

以下是根據 Lucebox 官方部落格整理的復現步驟(基於 Linux + ROCm):

  1. 安裝依賴:ROCm 7.2.4、build-essential、cmake、git、ninja-build、hipblas-dev、rocblas-dev 等。
  2. Clone Lucebox 原始碼git clone --branch main --recurse-submodules https://github.com/Luce-Org/lucebox.git
  3. 編譯:使用 CMake + Ninja,指定 DDFLASH27B_GPU_BACKEND=hipDDFLASH27B_HIP_ARCHITECTURES=gfx1151 等引數編譯 dflash_server
  4. 下載權重
  5. 設定時脈與環境變數:將 ACPI platform profile 設為 performance,Radeon performance level 設為 high(GPU 時脈約 2.9 GHz),並設定 DFLASH_DS4_SPEC=1DFLASH_DS4_SPEC_Q=4 等。
  6. 啟動伺服器:加上 --ds4-fused-decode--ds4-expert-top-k 4--ds4-prefill sparse--max-ctx 8192 等引數。

整個專案採用 Apache-2.0 授權,完全開源可重現。官方強調:上述 ROCmFPX format、fused decode path、DSpark verifier、sparse prefill 與 q=4 weight reuse 全部包含在 main branch 中,不需要 integration branch 或 private patch。

整個專案採用 Apache-2.0 授權,完全開源可重現。對於熟悉 ROCm 生態的使用者來說,門檻不算高。

小結

DeepSeek V4 Flash 在 Strix Halo APU 上的表現證明瞭一件事:大模型推理已經從「可行」走向「實用」。混合量化把體積壓到能放進消費級記憶體,speculative decoding 把速度推到可用範圍,sparse prefill 讓推理效率再上一層。

8K context 是目前最大的短板——但請注意原始模型本身支援到 1M,Lucebox 的實作只是先驗證了 8K 設定。考慮到這還是第一波公開測試,後續版本應該會逐步改善。

如果你手邊剛好有一臺 Strix Halo 裝置(例如 $1,499 的 GMKtec EVO-X2、$1,899 的 Beelink GTR9 Pro),或者打算買一臺來玩本地 AI——現在確實是個不錯的時機。