前言

7 月 26 日,Moonshot AI 把他們最強的 Kimi K3 模型以完整權重開放。不是剪枝版、不是蒸餾版、也不是 API-only——整整 2.8 TB MoE 架構,附帶 MXFP4 原生量化和技術報告一併公開。

研究團隊 totheagi 在 X 上發文,說他們用 80 張 RTX 5090 就把完整的 K3 跑起來了,單串流每秒 20 token,還沒調過超引數。沒有 HBM,只有 GDDR7 消費級視訊記憶體、普通乙太網路線和官方 MXFP4 權重。

「地球上最強開源模型,跑在地球上最 abundant 的 GPU 上。」這句話聽起來像行銷口號,但背後的技術細節值得拆解。

- 廣告 -

Kimi K3 是什麼?

Kimi K3 是 Moonshot AI 於 2026 年 7 月 16 日透過 API 率先發布的旗艦模型(ID:kimi-k3),7 月 26 日開放完整權重下載。它是目前世界上最大的開源 3T 級別模型,引數規模達 2.8 TB。

K3 建立在兩個核心創新上:**Kimi Delta Attention(KDA)**與 Attention Residuals(AttnRes)。KDA 提供高效的可擴充套件注意力機制;AttnRes 在網路深度中選擇性地檢索表示,而不是均勻累加。兩者結合起來專為突破兆引數界線而設計。

MoE 方面,K3 採用 Stable LatentMoE 框架,從 896 個專家中有效啟用 16 個(加上 2 個共享專家),稀疏度比前代 K2 更高。搭配混合注意力(每四個區塊中包含三層 KDA 加一層 Gated MLA),模型在處理超長上下文時能保持效率。

官方說法是這些結構改進讓 K3 的整體擴充套件效率達到 K2 的約 2.5 倍,同樣的運算量能轉換出更高的智力表現。

硬體部署:RTX 5090 真的行嗎?

這才是這篇文章真正想聊的重點。

K3 的 MXFP4 權重檔案總大小約為 1.56 TB(Hugging Face 上共 96 個 safetensors shard)。以 vLLM 推理時所需的 VRAM 估算,最低需要約 1,680 GB 的視訊記憶體容量。單張 RTX 5090 有 32 GB GDDR7——理論上需要 53 張才能湊齊,但實際上因為拓撲和通訊開銷,totheagi 團隊用了 80 張

硬體方案GPU 數量總 VRAM備註
NVIDIA B200 (per-node)8~2.3 TB最簡部署,每卡 288 GB HBM
RTX 5090 叢集802.56 TBGDDR7、無 NVLink、普通乙太網路
Mac Studio (4×512GB)42 TB非官方 MLX,未達支援標準

RTX 5090 方案的核心優勢在於沒有 HBM。HBM 是目前 AI 晶片最稀缺的元件,價格和供貨都不穩定。而 RTX 5090 是消費級市場上 VRAM 最大的 GPU,80 張堆起來雖然龐大,但供應相對充裕、單價親民。

totheagi 團隊還提到一個有趣的比較:他們上週在同一批機器上把 GLM-5.2 從每秒 30 token 最佳化到 110 token。「這個數字還會往上爬。」

K3 的 MoE 稀疏設計意味著每個 token 實際上只觸發約 1,040 億引數(2.8 TB × 16/896),所以推理品質很高。但你仍然需要把完整的 1.56 TB 權重留在記憶體中,這是無法跳過的固定成本。

Kimi K3 硬體部署方案比較

RTX 5090 方案的真正價值不在單卡效能,而在去 HBM 化帶來的可及性。當一個 2.8T 模型不再仰賴最稀缺的記憶體頻寬,有足夠 PCIe 匯流排和網路頻寬的實驗室或新創都能自建。

基準測試:K3 在什麼位置?

Moonshot 官方公佈的資料顯示 K3 處於旗艦級別,但獨立評估的結果提供了更立體的畫像。

基準測試Kimi K3Claude Fable 5GPT-5.6 Sol
GDPval-AA v2 (Elo)1,6861,7471,736
BrowseComp91.2%
Terminal Bench 2.188.384.688.8
DeepSWE67.570.073.0
FrontierSWE81.286.6
GPQA-Diamond93.594.1

注意:這些數字來自 Moonshot 的官方表格,且不同模型的評估條件略有差異(K3 使用 KimiCode、Fable 可能搭配 Claude Code + Opus fallback)。獨立測試普遍將 K3 定位為比 Fable 5 低一個等級,但在 Terminal Bench 等終端操作基準上已經非常接近 Sol。

Coding 方面,K3 在 SWE Marathon 和 Program Bench 上都領先所有模型。它支援 1M token 上下文、能理解整個程式碼庫——這跟它的領先地位吻合。Moonshot 還展示了一個案例:K3 用 56 個原始片段編輯了一支自己的預覽影片,包含選片、動態匹配剪接、幀精確節奏同步、音訊處理和多輪修改。一個經驗豐富的剪輯師需要一到兩個工作天才能完成。

不過坦率說,在對話流暢度和使用者體驗上,K3 目前仍落後 Claude Fable 5 和 GPT-5.6 Sol。多輪對話的自然度差距尤其明顯。

MXFP4:不只是量化,是原生訓練

K3 的量化策略有一個關鍵細節:它不是從 BF16 權重事後量化(post-hoc quantize)出來的。整個後訓練階段——包括 SFT 和 RL——都是帶著 MXFP4 做量化感知訓練。模型在訓練時就適應了低精度數值,不存在訓練與推理的不匹配問題。

具體的精度分配如下:

  • MoE 專家權重(佔引數最大宗)→ MXFP4
  • 啟用值 → MXFP8
  • 非專家部分(注意力投影、潛在 MoE 投影、共享專家、路由器)→ 更高精度

這種混合精度策略在壓榨記憶體空間的同時,保留了關鍵路徑的計算精確度。Moonshot 還從頭開發了一個 MiniTriton——類似 Triton 的編譯器,使用 MLIR tile IR——在 roofline 基準測試中與 NVIDIA Triton 抗衡。K3 早期版本的 AttnRes 在 H200 上需要 283.6 ms,經過 MiniTriton 最佳化後降到 114.4 ms。

授權條款:Kimi K3 License

K3 的授權並非 MIT 或 Apache——而是一份名為 Kimi K3 License 的客製化合約。對一般開發者而言影響不大,但高階使用者需注意兩項條件:

  • Model-as-a-Service 營收門檻:若以 K3 提供推理或微調服務給第三方,且年營收超過 2,000 萬美元,需與 Moonshot 另行簽署協議。
  • 品牌標示義務:月活躍使用者超過 1 億或月營收超過 2,000 萬美元的產品,需在介面上顯著標示「Kimi K3」。

純內部使用不受上述限制。這份授權對個人開發者、新創和學術單位幾乎沒有影響,但大型雲端供應商若以 K3 提供推理服務則需額外談判。

API 定價與自架成本分析

Moonshot 的 API 定價相對友善:每百萬 token $3(輸入)/ $15(輸出),無論上下文長度一律同價。作為對比,Claude Fable 5 是 $10/$50 per M tokens,GPT-5.6 Sol 也接近這個水準。

以 RTX 5090 方案為例的自架成本:

  • 單卡價格約 $2,000 USD(預估),80 張約 $160,000
  • 加上主機板、CPU、記憶體、網路裝置和散熱,總成本可能在 $200K-$250K 之間
  • 功耗方面,80 張 RTX 5090 的 TDP 合計可達約 128 kW(峰值),需要工業級電力和冷卻

如果你只是偶爾跑 K3,API 可能更划算。但如果你是研究機構、大學實驗室或需要長期部署 K3 的新創,自建叢集在一年到一年半內就能回本。關鍵取決於你的推理量和使用場景。

Moonshot 也提醒了一點:如果任務不需要 1M 上下文、視覺能力或頂級推理品質,選更小的模型會便宜得多,也能跑在更便宜的硬體上。把模型和任務匹配,而不是一味追求最大的模型。

對開源社群的意義

研究層面:896 個專家的 MoE 架構讓研究者可以直接探測每個專家是否按語言、領域或任務型別特化。這能直接指導未來 MoE 設計的方向。也有團隊在嘗試將 896 個專家壓縮到 256 甚至 128 個,看看品質和運算的 trade-off 曲線在哪裡。

部署層面:沒有 HBM、不需要 requantization、官方 MXFP4 權重直接可用——K3 可能是第一個真正「誰都能跑」的邊界級開源模型。vLLM 已經支援,社群工具鏈正在快速成熟。

生態層面:K3 之前,Moonshot 已經發布了 K2.5(視覺代理模型)和一系列較小的開源模型。K3 補齊了旗艦版圖,讓整個 Kimi 產品線形成完整閉環。從 API 到開放權重,Moonshot 在開源生態中的佈局正變得越來越清晰。

小結

Kimi K3 不只是一個更大的模型——它在架構設計(KDA + AttnRes + LatentMoE)、量化策略(原生 MXFP4)和部署可及性(無 HBM 的 RTX 5090 方案)上都做了有意義的創新。它可能還不是最強的(Fable 5 和 Sol 仍有優勢),但它可能是第一個真正讓「任何實驗室都能擁有邊界智慧」成為現實的開源模型。

totheagi 團隊的那句「這個數字還會往上爬」,大概不只是指 token/s——而是指整個開源 AI 生態正在加速靠近閉源巨頭的天花板。

- 廣告 -

參考資料