<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>MoE 架構 on 凱凱的技術筆記</title><link>https://kaikai365.com/tags/moe-%E6%9E%B6%E6%A7%8B/</link><description>Recent content in MoE 架構 on 凱凱的技術筆記</description><generator>Hugo</generator><language>zh-TW</language><lastBuildDate>Fri, 17 Jul 2026 19:48:09 +0800</lastBuildDate><atom:link href="https://kaikai365.com/tags/moe-%E6%9E%B6%E6%A7%8B/index.xml" rel="self" type="application/rss+xml"/><item><title>Kimi K3 上線：全球最大開權重模型，前端開發者該升級武器庫了嗎？</title><link>https://kaikai365.com/posts/2026-07-17-kimi-k3-open-frontier-flagship/</link><pubDate>Fri, 17 Jul 2026 19:48:09 +0800</pubDate><guid>https://kaikai365.com/posts/2026-07-17-kimi-k3-open-frontier-flagship/</guid><description>&lt;p>2026 年 7 月 16 日，中國 AI 公司 Moonshot AI（月之暗面）正式上線了他們的旗艦模型 Kimi K3。這款定位為「開放型前沿智慧」的模型直接對標 Anthropic 的 Claude Opus 4.8 與 OpenAI 的 GPT-5.6 Sol，宣稱是目前全球最大的開權重 AI 模型。&lt;/p>
&lt;p>作為一款參數高達 2.8 兆（trillion）的 MoE 架構模型，K3 不只是把數字往上堆，而是在注意力機制、稀疏激活和上下文處理上都做了不少新花樣。這篇文章整理 K3 的核心規格、基準表現、價格結構以及實際使用體驗，幫你判斷它值不值得進你的開發工具鏈。&lt;/p>
&lt;h2 id="28-兆參數的架構門道">2.8 兆參數的架構門道&lt;/h2>
&lt;p>Kimi K3 採用 MoE（Mixture of Experts）架構，總參數量約 2.8 兆，但每處理一個 token 只激活 16 個專家——在全部 896 個路由專家中挑出最相關的。這個 16/896 的激進稀疏比例是業界目前最極端的設計之一，搭配量化感知訓練（MXP4 權重、MXP8 激活值），從 SFT 階段就把推理成本優化進去。&lt;/p>
&lt;p>Moonshot 為 K3 設計了三項核心技術來支撐這個龐大體型。&lt;/p>
&lt;p>第一項是 Kimi Delta Attention（KDA），一種混合線性注意力機制，專門解決長序列處理時的記憶體與速度瓶頸。官方宣稱在百萬 token 情境下解碼速度提升了 6.3 倍。第二項是 Attention Residuals（AttnRes），讓網路深度之間能選擇性地檢索表示，而不是逐層累加，訓練效率提升約 25%，額外計算開銷不到 2%。第三項則是整體縮放效率——Moonshot 宣稱 K3 相較前代 K2 的縮放效率提升了約 2.5 倍，也就是說同樣的計算資源下，K3 能產生更多可用智慧。&lt;/p></description></item></channel></rss>