2026 年 7 月 16 日,中國 AI 公司 Moonshot AI(月之暗面)正式上線了他們的旗艦模型 Kimi K3。這款定位為「開放型前沿智慧」的模型直接對標 Anthropic 的 Claude Opus 4.8 與 OpenAI 的 GPT-5.6 Sol,宣稱是目前全球最大的開權重 AI 模型。

作為一款參數高達 2.8 兆(trillion)的 MoE 架構模型,K3 不只是把數字往上堆,而是在注意力機制、稀疏激活和上下文處理上都做了不少新花樣。這篇文章整理 K3 的核心規格、基準表現、價格結構以及實際使用體驗,幫你判斷它值不值得進你的開發工具鏈。

2.8 兆參數的架構門道

Kimi K3 採用 MoE(Mixture of Experts)架構,總參數量約 2.8 兆,但每處理一個 token 只激活 16 個專家——在全部 896 個路由專家中挑出最相關的。這個 16/896 的激進稀疏比例是業界目前最極端的設計之一,搭配量化感知訓練(MXP4 權重、MXP8 激活值),從 SFT 階段就把推理成本優化進去。

Moonshot 為 K3 設計了三項核心技術來支撐這個龐大體型。

第一項是 Kimi Delta Attention(KDA),一種混合線性注意力機制,專門解決長序列處理時的記憶體與速度瓶頸。官方宣稱在百萬 token 情境下解碼速度提升了 6.3 倍。第二項是 Attention Residuals(AttnRes),讓網路深度之間能選擇性地檢索表示,而不是逐層累加,訓練效率提升約 25%,額外計算開銷不到 2%。第三項則是整體縮放效率——Moonshot 宣稱 K3 相較前代 K2 的縮放效率提升了約 2.5 倍,也就是說同樣的計算資源下,K3 能產生更多可用智慧。

Kimi K3 技術架構總覽

程式能力:前端與長程任務的強者

在程式設計相關的基準測試中,K3 的表現有幾個值得注意的亮點。

最搶眼的是 SWE Marathon——這個 benchmark 測量的是模型「持續數小時的長程工程能力」。K3 拿到 42.0 分,大幅領先第二名 GPT-5.6 Sol 的 39.0 分和 Opus 4.8 的 40.0 分。這意味著如果你的專案需要模型長時間保持上下文、串聯多個工具完成複雜任務,K3 確實有實力。

Terminal-Bench 2.1 中 K3 拿到 88.3 分,僅落後 GPT-5.6 Sol(88.8)不到 0.5 分,競爭激烈程度可見一斑。而在 Program Bench 上,K3 以 77.8 分拿下第一名,壓過 Claude Fable 5 的 76.8 分。

Arena.ai 的前端程式盲測結果也很有意思——K3 以 1,679 分排名第一,擊敗了 Claude Fable 5(1,631)和 GPT-5.6 Sol(1,618)。在六個前端領域中拿下五個第一,僅 Gaming 項目落後第二名。這不是官方自吹,而是盲測結果,說明了 K3 在前端輸出品質上的確有獨到之處。

獨立測試還發現了一個令人印象深刻的案例:K3 自行構建了類似 Triton 的 GPU 程式系統,包含 MLIR tile-level IR、優化 passes、PTX 編碼管線和 runtime。更誇張的是,它在 48 小時無人值守的情況下完成了小型晶片設計與驗證,使用的是開放源碼 EDA 工具和 45nm 函式庫。

智慧推理:幾個 benchmark 的冠軍

除了程式能力,K3 在一般智慧推理上也拿下好成績。BrowseComp 拿到 91.2 分(第一名),超過 GPT-5.6 Sol 的 90.4 分和 Claude Fable 5 的 88.0 分。SpreadsheetBench 2 以 34.8 分壓過 Claude Fable 5 的 34.7 分。Automation Bench 則以 30.8 分領先所有對手。

GPQA Diamond 部分,K3 達到 93.5%,是開權重模型中的最佳表現。不過這裡要補充的是,Artificial Analysis 的獨立 Intelligence Index 測試中,K3 排名第四(共 189 個模型),與 Claude Opus 4.8、GPT-5.5 並列。這提醒我們:官方 benchmark 和獨立測試之間可能有落差,多參考幾個來源比較保險。

價格結構:便宜輸入背後的輸出陷阱

K3 的定價表長這樣:

Token 類型每百萬 tokens 價格
快取命中輸入(Cache-hit)$0.30
未命中輸入(Uncached)$3.00
輸出(Output)$15.00
網頁搜尋$0.015 / 次呼叫

乍看之下,快取命中的輸入只要 $0.30/百萬 tokens,看起來很親切。但真正的大宗開銷在輸出——每百萬 tokens $15.00。根據獨立測試,K3 有個「比較啰嗦」的特性,也就是產生較多的 output tokens,實際任務成本可能遠高於輸入成本。

Artificial Analysis 的測試數據很有參考價值:他們用 K3 完成整個 Intelligence Index 耗資 $2,690.80,輸出 token 使用量約為比較平均值的兩倍。這意味著 K3 雖然輸入價格相對低(尤其快取命中時),但高輸出品質伴隨的高 output token 消耗才是成本關鍵。

跟前代比價的話,K3 的定價是 Kimi K2 系列的 3 到 4 倍,明顯屬於高端產品線:

模型輸入/百萬 tokens輸出/百萬 tokens
Kimi K3$3.00(快取命中 $0.30)$15.00
Kimi K2.7 Code$0.95$4.00
Kimi K2.6$0.95$4.00

如果你的日常編碼需求不需要最前沿的能力,K2.6 或 K2.7 Code 的性價比明顯更高。只有當你確切需要百萬 token 上下文、長程工程任務或前端盲測等級的輸出品質時,多花的錢才值得。

- 廣告 -

自架部署:開源不等於能在桌上型跑

Moonshot 承諾在 2026 年 7 月 27 日前開放完整權重下載,但「開源」不等於「可以在一般工作站上運行」。K3 建議的硬體配置是 64+ GPU 的 supernode,需要載入全部 2.8T 參數的 VRAM。

即使每 token 只激活 16/896 個專家,所有權重仍然需要存在於記憶體中才能進行路由選擇。換句話說,自架 K3 是企業級遊戲,不是一般開發者能輕鬆上手的。如果你只是想測試 MoE 架構的極限,等權重發布後可以評估;但如果追求的是日常可用、輕量部署,目前 Kimi K2.6(已開源)還是更實際的選擇。

獨立測試的一個小教訓

Digital Life Kha’Zix 在真實產品環境中測試 K3 時遇到了一個值得注意的案例:處理趨勢排名功能時,K3 複製了既有的回填模式,將約 9,000 筆資料載入只能同時處理 6 筆的管線。正常新內容因此排隊近一小時無法更新。CI 通過是因為錯誤是架構性(容量限制)而非語法或單元測試問題。

這個案例揭示了一個常見的 agent 限制:系統能正確執行局部模式,但可能忽略全局容量約束。長上下文和多個 agents 不等於自動理解未明確說明的營運常數。生產環境中仍然需要明確的預算、速率限制、隊列策略和回滾機制。別以為把任務丟給模型就萬事大吉了。

該不該用?看你的需求對照

綜合以上資訊,K3 適合這些情境:長程編碼專案(需要處理完整程式庫上下文)、前端或 3D 視覺導向工作(受益于圖片輸入回饋)、Agentic 研究任務(結合瀏覽、文件分析、程式碼生成和報告產出),以及大上下文需求的團隊。

不建議優先考慮的情境則包括:成本敏感型日常使用、即時性要求高的任務(K3 輸出速度約 62 tokens/秒,低於比較平均水準)、輕量部署場景,以及需要免費層級的用戶。

如果你正在評估是否正式採用 K3,一個務實的做法是選 5 到 10 個代表性任務——包含至少一個易失敗的生產環境場景——統一測試條件後記錄完整指標:tokens 消耗、實壁時間、API 成本、人工審查時間和回歸數量。等 7/27 權重發布後,再評估自架可行性與授權條款,做最終的技術棧決策。

結語

Kimi K3 確實是一款值得關注的旗艦級模型,在編碼(尤其前端)和長程知識工作方面表現突出。但「能力強」不等於「適合所有人」。它的定價偏高、自架門檻高、輸出速度偏慢,這些都不是小問題。

對於一般使用者而言,先透過 Playground 或 API 免費試用感受其長上下文和推理能力,同時保留經過驗證的其他模型作為備援方案,會是比較穩健的做法。等權重正式發布、獨立基準測試更完整後,再做最終決定也不遲。


本文基於 Moonshot AI 官方公告、Artificial Analysis、Arena WebDev Leaderboard、The Decoder 及多個技術媒體與獨立測試整理而成,數據截至 2026 年 7 月 18 日。實際價格和規格以官方為準。