Kimi K3 開放權重:2.8 TB 的邊界智慧,用 80 張 RTX 5090 把完整的 K3 跑起來

前言 7 月 26 日,Moonshot AI 把他們最強的 Kimi K3 模型以完整權重開放。不是剪枝版、不是蒸餾版、也不是 API-only——整整 2.8 TB MoE 架構,附帶 MXFP4 原生量化和技術報告一併公開。 研究團隊 totheagi 在 X 上發文,說他們用 80 張 RTX 5090 就把完整的 K3 跑起來了,單串流每秒 20 token,還沒調過超引數。沒有 HBM,只有 GDDR7 消費級視訊記憶體、普通乙太網路線和官方 MXFP4 權重。 「地球上最強開源模型,跑在地球上最 abundant 的 GPU 上。」這句話聽起來像行銷口號,但背後的技術細節值得拆解。 Kimi K3 是什麼? Kimi K3 是 Moonshot AI 於 2026 年 7 月 16 日透過 API 率先發布的旗艦模型(ID:kimi-k3),7 月 26 日開放完整權重下載。它是目前世界上最大的開源 3T 級別模型,引數規模達 2.8 TB。 K3 建立在兩個核心創新上:**Kimi Delta Attention(KDA)**與 Attention Residuals(AttnRes)。KDA 提供高效的可擴充套件注意力機制;AttnRes 在網路深度中選擇性地檢索表示,而不是均勻累加。兩者結合起來專為突破兆引數界線而設計。 ...

Kimi K3 的 2.8 兆引數宣戰書:中國 AI 如何用開源反攻矽谷

前言 2026 年 7 月 16 日,Moonshot AI 的楊志霖盯著終端機螢幕。Kimi K3 的最後一輪訓練跑完了。損失曲線收斂,基準測試數字出爐——2.8 兆引數。矽谷閉源帝國二十多年來第一次被來自北京的開源模型正面擊中要害。 三天後,OpenAI 策略總監 Dean Ball 在 X 上發文:「我很驚訝中國政府持續允許這種等級的開源模型流出。」他預測川普政府最終會用監管不確定性來封殺開源中國模型,稱之為「將監管工具武器化」。然後一場關於開源 versus 閉源的全球大辯論,就此點燃。 什麼叫「2.8 兆引數」? Kimi K3 的總引數是 2.8 兆(trillion),但真正每次前向傳遞只啟動 400 億左右。它用的是 MoE(Mixture of Experts)架構,896 個專家模組中每次只啟用 16 個。你得到的是接近 GPT-4 原始架構三倍大的知識容量,推理成本卻跟中型稠密模型差不多。 真正的創新在注意力機制。Kimi K3 用的是 Moonshot 自研的 Kimi Delta Attention(KDA),把線性注意力的骨架和週期性的完整注意力層混合起來。大部分序列用近線性記憶體擴充套件處理,關鍵的全域性層則保留了純線性注意力通常會丟失的長距離依賴關係。 100 萬 token 的上下文視窗下,KDA 比標準 Transformer 注意力減少約 60% 的 KV-cache 開銷。處理整份程式碼庫或厚達上千頁檔案的時候,這不是小進步。 基準測試:強項與弱項都擺在檯面上 Moonshot 公佈的 benchmark 數字確實亮眼,但仔細看會發現一些有趣的模式。 基準測試 Kimi K3 Claude Opus 4.8 GPT-5.6 Sol SWE-Bench Verified 72.4% 68.1% 74.2% Tau-2(Agentic) 81.7% 76.3% 79.8% AceBench(Tool Calling) 89.2% 84.5% 87.1% MMLU(綜合知識) 89.7% 88.4% 90.1% K3 在程式碼密集型、長視窗的 agentic 任務上表現突出,跟它的架構設計吻合。MMLU 這類綜合知識基準它表現不錯但沒有脫穎而出——2.8 兆引數的主要價值不在於背書更多事實,而在處理複雜關聯和長期推理。 ...

Kimi K3 上線:全球最大開權重模型,前端開發者該升級武器庫了嗎?

2026 年 7 月 16 日,中國 AI 公司 Moonshot AI(月之暗面)正式上線了他們的旗艦模型 Kimi K3。這款定位為「開放型前沿智慧」的模型直接對標 Anthropic 的 Claude Opus 4.8 與 OpenAI 的 GPT-5.6 Sol,宣稱是目前全球最大的開權重 AI 模型。 作為一款參數高達 2.8 兆(trillion)的 MoE 架構模型,K3 不只是把數字往上堆,而是在注意力機制、稀疏激活和上下文處理上都做了不少新花樣。這篇文章整理 K3 的核心規格、基準表現、價格結構以及實際使用體驗,幫你判斷它值不值得進你的開發工具鏈。 2.8 兆參數的架構門道 Kimi K3 採用 MoE(Mixture of Experts)架構,總參數量約 2.8 兆,但每處理一個 token 只激活 16 個專家——在全部 896 個路由專家中挑出最相關的。這個 16/896 的激進稀疏比例是業界目前最極端的設計之一,搭配量化感知訓練(MXP4 權重、MXP8 激活值),從 SFT 階段就把推理成本優化進去。 Moonshot 為 K3 設計了三項核心技術來支撐這個龐大體型。 第一項是 Kimi Delta Attention(KDA),一種混合線性注意力機制,專門解決長序列處理時的記憶體與速度瓶頸。官方宣稱在百萬 token 情境下解碼速度提升了 6.3 倍。第二項是 Attention Residuals(AttnRes),讓網路深度之間能選擇性地檢索表示,而不是逐層累加,訓練效率提升約 25%,額外計算開銷不到 2%。第三項則是整體縮放效率——Moonshot 宣稱 K3 相較前代 K2 的縮放效率提升了約 2.5 倍,也就是說同樣的計算資源下,K3 能產生更多可用智慧。 ...

Kimi K2.7 Code 正式登上 GitHub Copilot:中國 AI 模型首次打入主流開發者工具生態

前言 2026 年 7 月 1 日,GitHub 在官方更新日誌中丟了一顆震撼彈:月之暗面(Moonshot AI)的 Kimi K2.7 Code 模型正式在 GitHub Copilot 中全面可用(GA)。 這不僅僅是又一個新模型上架——這是中國 AI 模型首次進入主流開發者工具生態,也是 Copilot 有史以來第一個納入的「開權重」(open-weight)模型。 想象一下:你正在 VS Code 裡用 Copilot 補完程式碼,下拉選單裡除了 GPT、Claude、Gemini,現在還多了一個來自北京的選項。這象徵意義有多大?我們慢慢說。 什麼是 Kimi K2.7 Code? Kimi K2.7 Code 是 Moonshot AI 於 2026 年 6 月 12 日發布的編程專用 Agentic 模型,專為長週期軟體工程任務(long-horizon coding tasks)設計。簡單來說,它不是用來寫「Hello World」的——它是來處理跨檔案重構、多步驟除錯、以及需要同時理解整個程式碼庫的複雜任務的。 核心技術規格 規格 數值 架構 MoE(Mixture-of-Experts) 總參數 1 兆(1 Trillion) 單次激活參數 320 億(32 Billion) 上下文視窗 256K tokens 多模態 支援(MoonViT 400M 參數視覺編碼器) 授權 Modified MIT(可商用,需註明出處) 思考模式 強制啟用(無非思考模式) MoE 架構的關鍵優勢在於:1 兆參數的知識容量,但每次推理只激活 320 億。這讓它在保持強大能力的同時,大幅降低了計算成本和延遲。 ...