Kimi K3 的 2.8 兆引數宣戰書:中國 AI 如何用開源反攻矽谷
前言 2026 年 7 月 16 日,Moonshot AI 的楊志霖盯著終端機螢幕。Kimi K3 的最後一輪訓練跑完了。損失曲線收斂,基準測試數字出爐——2.8 兆引數。矽谷閉源帝國二十多年來第一次被來自北京的開源模型正面擊中要害。 三天後,OpenAI 策略總監 Dean Ball 在 X 上發文:「我很驚訝中國政府持續允許這種等級的開源模型流出。」他預測川普政府最終會用監管不確定性來封殺開源中國模型,稱之為「將監管工具武器化」。然後一場關於開源 versus 閉源的全球大辯論,就此點燃。 什麼叫「2.8 兆引數」? Kimi K3 的總引數是 2.8 兆(trillion),但真正每次前向傳遞只啟動 400 億左右。它用的是 MoE(Mixture of Experts)架構,896 個專家模組中每次只啟用 16 個。你得到的是接近 GPT-4 原始架構三倍大的知識容量,推理成本卻跟中型稠密模型差不多。 真正的創新在注意力機制。Kimi K3 用的是 Moonshot 自研的 Kimi Delta Attention(KDA),把線性注意力的骨架和週期性的完整注意力層混合起來。大部分序列用近線性記憶體擴充套件處理,關鍵的全域性層則保留了純線性注意力通常會丟失的長距離依賴關係。 100 萬 token 的上下文視窗下,KDA 比標準 Transformer 注意力減少約 60% 的 KV-cache 開銷。處理整份程式碼庫或厚達上千頁檔案的時候,這不是小進步。 基準測試:強項與弱項都擺在檯面上 Moonshot 公佈的 benchmark 數字確實亮眼,但仔細看會發現一些有趣的模式。 基準測試 Kimi K3 Claude Opus 4.8 GPT-5.6 Sol SWE-Bench Verified 72.4% 68.1% 74.2% Tau-2(Agentic) 81.7% 76.3% 79.8% AceBench(Tool Calling) 89.2% 84.5% 87.1% MMLU(綜合知識) 89.7% 88.4% 90.1% K3 在程式碼密集型、長視窗的 agentic 任務上表現突出,跟它的架構設計吻合。MMLU 這類綜合知識基準它表現不錯但沒有脫穎而出——2.8 兆引數的主要價值不在於背書更多事實,而在處理複雜關聯和長期推理。 ...