Kimi K3 的 2.8 兆引數宣戰書:中國 AI 如何用開源反攻矽谷

前言 2026 年 7 月 16 日,Moonshot AI 的楊志霖盯著終端機螢幕。Kimi K3 的最後一輪訓練跑完了。損失曲線收斂,基準測試數字出爐——2.8 兆引數。矽谷閉源帝國二十多年來第一次被來自北京的開源模型正面擊中要害。 三天後,OpenAI 策略總監 Dean Ball 在 X 上發文:「我很驚訝中國政府持續允許這種等級的開源模型流出。」他預測川普政府最終會用監管不確定性來封殺開源中國模型,稱之為「將監管工具武器化」。然後一場關於開源 versus 閉源的全球大辯論,就此點燃。 什麼叫「2.8 兆引數」? Kimi K3 的總引數是 2.8 兆(trillion),但真正每次前向傳遞只啟動 400 億左右。它用的是 MoE(Mixture of Experts)架構,896 個專家模組中每次只啟用 16 個。你得到的是接近 GPT-4 原始架構三倍大的知識容量,推理成本卻跟中型稠密模型差不多。 真正的創新在注意力機制。Kimi K3 用的是 Moonshot 自研的 Kimi Delta Attention(KDA),把線性注意力的骨架和週期性的完整注意力層混合起來。大部分序列用近線性記憶體擴充套件處理,關鍵的全域性層則保留了純線性注意力通常會丟失的長距離依賴關係。 100 萬 token 的上下文視窗下,KDA 比標準 Transformer 注意力減少約 60% 的 KV-cache 開銷。處理整份程式碼庫或厚達上千頁檔案的時候,這不是小進步。 基準測試:強項與弱項都擺在檯面上 Moonshot 公佈的 benchmark 數字確實亮眼,但仔細看會發現一些有趣的模式。 基準測試 Kimi K3 Claude Opus 4.8 GPT-5.6 Sol SWE-Bench Verified 72.4% 68.1% 74.2% Tau-2(Agentic) 81.7% 76.3% 79.8% AceBench(Tool Calling) 89.2% 84.5% 87.1% MMLU(綜合知識) 89.7% 88.4% 90.1% K3 在程式碼密集型、長視窗的 agentic 任務上表現突出,跟它的架構設計吻合。MMLU 這類綜合知識基準它表現不錯但沒有脫穎而出——2.8 兆引數的主要價值不在於背書更多事實,而在處理複雜關聯和長期推理。 ...

Claude Fable 5 全面評測:能力超強還是性價比陷阱?

Claude Fable 5 全面評測:能力超強還是性價比陷阱? 2026 年 6 月 9 日,Anthropic 推出了他們全新的 Mythos-class 旗艦模型——Claude Fable 5。這是 Anthropic 首次將「Mythos 級」intelligence 開放給公眾使用,號稱在軟體工程、知識工作、視覺理解和科學研究等領域都是「state-of-the-art」。 然而,這個模型的上線過程一波三折:首發僅一週就因美國政府出口管制被強制下架,經過 13 天的沉默期後,終於在 7 月 1 日以「強化安全防護」的版本重新回歸。 這篇文章整合了 CodeRabbit、Simon Willison、Lenny’s Newsletter、Endor Labs、Vellum、DataCamp 等專業評測,以及 Reddit、Hacker News 等社群的大量真實反饋,帶你完整認識 Fable 5 到底值不值得用。 模型基本規格 項目 規格 模型系列 Mythos-class(Anthropic 新旗艦級) API ID claude-fable-5 Context Window 1,000,000 tokens 最大輸出 128,000 tokens 知識截止 2026 年 1 月 定價 $10/1M input / $50/1M output(是 Opus 4.x 的 2 倍) Batch 定價 $5/1M input / $25/1M output 上線日期 2026/6/9 首發 → 6/12 因出口管制暫停 → 7/1 重新上線 安全策略 觸發 classifier 時靜默回退到 Opus 4.8(<5% 的 session) ⚠️ 訂閱方案注意: Pro/Max/Team 僅到 2026/7/7 前含 Fable 5 使用額度,之後需額外扣 credit。 ...