Kimi K3 的 2.8 兆引數宣戰書:中國 AI 如何用開源反攻矽谷

前言 2026 年 7 月 16 日,Moonshot AI 的楊志霖盯著終端機螢幕。Kimi K3 的最後一輪訓練跑完了。損失曲線收斂,基準測試數字出爐——2.8 兆引數。矽谷閉源帝國二十多年來第一次被來自北京的開源模型正面擊中要害。 三天後,OpenAI 策略總監 Dean Ball 在 X 上發文:「我很驚訝中國政府持續允許這種等級的開源模型流出。」他預測川普政府最終會用監管不確定性來封殺開源中國模型,稱之為「將監管工具武器化」。然後一場關於開源 versus 閉源的全球大辯論,就此點燃。 什麼叫「2.8 兆引數」? Kimi K3 的總引數是 2.8 兆(trillion),但真正每次前向傳遞只啟動 400 億左右。它用的是 MoE(Mixture of Experts)架構,896 個專家模組中每次只啟用 16 個。你得到的是接近 GPT-4 原始架構三倍大的知識容量,推理成本卻跟中型稠密模型差不多。 真正的創新在注意力機制。Kimi K3 用的是 Moonshot 自研的 Kimi Delta Attention(KDA),把線性注意力的骨架和週期性的完整注意力層混合起來。大部分序列用近線性記憶體擴充套件處理,關鍵的全域性層則保留了純線性注意力通常會丟失的長距離依賴關係。 100 萬 token 的上下文視窗下,KDA 比標準 Transformer 注意力減少約 60% 的 KV-cache 開銷。處理整份程式碼庫或厚達上千頁檔案的時候,這不是小進步。 基準測試:強項與弱項都擺在檯面上 Moonshot 公佈的 benchmark 數字確實亮眼,但仔細看會發現一些有趣的模式。 基準測試 Kimi K3 Claude Opus 4.8 GPT-5.6 Sol SWE-Bench Verified 72.4% 68.1% 74.2% Tau-2(Agentic) 81.7% 76.3% 79.8% AceBench(Tool Calling) 89.2% 84.5% 87.1% MMLU(綜合知識) 89.7% 88.4% 90.1% K3 在程式碼密集型、長視窗的 agentic 任務上表現突出,跟它的架構設計吻合。MMLU 這類綜合知識基準它表現不錯但沒有脫穎而出——2.8 兆引數的主要價值不在於背書更多事實,而在處理複雜關聯和長期推理。 ...

Codex Mini 深度調查:輕量化模型到底能幫你做到什麼程度

前陣子 OpenAI 把 Codex Mini 推到台前,社群討論熱度不低。有人說它是開發者的效率神器,也有人吐槽推理深度不夠用。我花了點時間整理了一份詳細調查報告,從技術規格、Benchmark 數據到實際應用場景都涵蓋了,看看這個輕量化模型到底值不值得你花時間了解。 - 廣告 - Codex Mini 是什麼?為什麼有這麼多版本? Codex Mini 不是單一產品,而是一系列專為程式開發設計的輕量化 AI 模型。目前市面上能接觸到的主要分為三個版本: 第一個是 codex-mini-latest,這是 OpenAI API 用的 CLI 專用版,基底模型基於 o4-mini 微調而來,2025 年 6 月正式推出。它的定位很明確——低延遲、高速的程式碼問答與編輯,API ID 是 codex-mini-latest。 第二個版本比較新,GPT-5.1-Codex Mini,2025 年 11 月 13 日推出,基底模型基於 GPT-5.1。這個版本主要給 ChatGPT Plus 和 Pro 用戶用,當你的使用上限到了,可以切換到 Mini 繼續工作。它的 API ID 是 gpt-5.1-codex-mini,成本效益比第一個版本更高。 ...

OpenAI GPT-5.6 正式登場:Sol、Terra、Luna 三模型家族全面解析,AI 戰局再度洗牌

最近 AI 圈最夯的消息,絕對非 OpenAI 在 6 月底發布的 GPT-5.6 系列莫屬。如果你還沒跟上進度,這篇就是為你準備的——我會用盡量淺白的語言,帶你一次搞懂這個新家族到底強在哪、該選哪一款、以及它對你我這樣的日常使用者有什麼實際影響。 先講重點:GPT-5.6 不是「又一個新版本」,而是 OpenAI 有史以來第一次正式從「單一模型」轉向「多層能力家族」策略。這意味著什麼?簡單說,以後 OpenAI 不再只推一個「最強的」,而是根據你的需求,提供不同層級的模型選擇。 三劍合璧:Sol、Terra、Luna 各有所長 GPT-5.6 系列一次推出三款模型,名字分別取自拉丁文的太陽(Sol)、地球(Terra)和月亮(Luna)。這不是單純的行銷包裝,每個型號都有明確的定位: Sol(太陽)—— 旗艦級戰力 Sol 是整個系列中最強大的模型,專為極度複雜的「自主代理工作」(Agentic Work)設計。你可以把它想像成團隊裡的「首席工程師」——遇到需要多步驟推理、跨工具調用、長期記憶追蹤的任務時,Sol 能可靠地完成。在 Terminal-Bench 2.1(一個測試 AI 寫程式能力的基準)中,Sol 在 Ultra 模式下取得了 91.9% 的 SOTA 分數,超越了 Anthropic 的 Claude Fable 5(88.0%)。 Terra(地球)—— 日常工作的最佳拍檔 Terra 的定位很聰明:它的性能跟上一代的 GPT-5.5 差不多,但運行成本直接砍半。如果你不是每天都要跑超複雜的代理任務,Terra 就是性價比之王。對於企業 API 調用來說,這意味著同樣的預算可以跑兩倍的量。 Luna(月亮)—— 快速又便宜的效率機器 Luna 主打極致低成本和高速度,適合大規模重複性任務。想像一下你需要處理成千上萬筆資料分類、簡短回答生成、或批量文本處理——Luna 就是那個默默把活幹完、還不會讓你心疼帳單的角色。 定價策略:從 $1 到 $30,總有一款適合你 OpenAI 這次採用了非常明確的分級定價(每百萬 Token): 模型 輸入價格 輸出價格 Sol $5.00 $30.00 Terra $2.50 $15.00 Luna $1.00 $6.00 作為對比,Anthropic 的 Claude Fable 5 定價是 $10 輸入 / $50 輸出。也就是說,同樣的預算,用 GPT-5.6 系列可以跑大約兩倍的量。這在商業應用上是非常具侵略性的定價策略。 ...

OpenAI 發布 GPT-5.6 Sol:全新命名策略、三大模型家族與實戰分析

前言 2026 年 6 月 26 日,OpenAI 正式對外公布了 GPT-5.6 系列的預覽版本,其中最受矚目的旗艦模型 GPT-5.6 Sol 一登場就引爆了整個 AI 社群的討論。這次不僅帶來了性能的大幅躍升,更引入了全新的「天體命名法」與多層式安全防護機制。 這篇文章將帶你完整認識 GPT-5.6 Sol 的核心能力、三大模型差異、實測 benchmark 數據,以及 METR 獨立評估報告中的關鍵發現。 - 廣告 - 為什麼要改名?全新「天體命名法」解讀 這次 GPT-5.6 最引人注目的變化之一,是 OpenAI 放棄了過去「Instant」系列的命名方式,改以 Sol(太陽)、Terra(地球)、Luna(月亮) 這三個天體來代表不同的能力階層。 OpenAI 的官方解釋是:數字代表模型的世代(generation),而天體名稱代表「持久化的能力階層」(durable capability tiers),這些階層可以各自獨立演進,不受世代更新的限制。 簡單來說,未來的 GPT-6 系列可能會有 Sol v2、Terra v2,它們的性能會隨著時間自然成長,而不需要等到下一個世代號更新。這個策略讓產品線更具彈性,也讓開發者能更精準地選擇適合的模型。 模型 定位 適用場景 Sol 旗艦級 高難度編程、Agentic 工作、進階推理、網路安全與生物研究 Terra 均衡型 日常任務,性能與 GPT-5.5 競爭,價格低一半 Luna 高效型 高吞吐量任務、分類/摘要、延遲敏感型應用 定價策略:每百萬 token 的帳單 先來看大家最關心的價格(以每百萬 token 計價): ...