DeepSeek V4 Flash 一天吃掉 8T token,為什麼突然漲價

七月三十一號,DeepSeek 悄悄釋出了 V4 Flash 正式版。沒有發表會、沒有宣傳海報,但 AI 圈當晚就炸了。Hacker News 上有一篇熱帖的標題直白到刺眼:「智慧便宜到你不忍心再按量計費。」 八月六號,DeepSeek 透過 Bloomberg 等媒體發布通知:將上調 API 整體價格。在 DeepSeek 的定價史上這很少見——他們之前的策略幾乎都是降價,或僅在高峰時段實施雙倍定價。不到一個月內第二次調整價格,多少讓人有點意外。 這篇文章想聊的不只是「為什麼漲價」,而是 Agent 自動化怎麼把 Token 消耗拉爆,逼得整個 AI 產業重新算帳。 引數沒動,後訓練把 Agent 能力拉爆七倍半 V4-Flash-0731 的模型結構跟此前的 Flash 預覽版完全一樣——二百八十四億總引數、一百三十億啟用的 MoE 架構、一百萬 token 超長上下文,一個沒改。真正的升級來自後訓練和 Agent 框架最佳化。 這次公測最嚇人的是幾個硬指標的躍遷: 基準測試 預覽版 V4 Flash-0731 增幅 DeepSWE(軟體工程) 7.3 54.4 +7.5 倍 Terminal-Bench 2.1(終端操作) — 82.7 逼近 Claude Opus 4.8 的 85 CyberGym(網路安全攻防) — 76.7 較預覽版翻倍 Toolathlon Verified(工具呼叫) — 70.3 — DSBench-FullStack(全棧開發) — 68.7 — 換句話說,一個定價只有 Opus 幾十分之一的模型,在「寫程式、跑命令、調 API」這類 Agent 核心任務上,已經逼近了被公認最強的閉源模型。 ...

在 $2,000 的 APU 上跑 284B MoE:DeepSeek V4 Flash 本地部署實測

今年七月,Lucebox 團隊在 AMD Ryzen AI MAX+ 395 (內部代號 Strix Halo)這顆消費級 APU 上跑起了 DeepSeek V4 Flash——一個總引數 284B、每 token 僅啟用約 13B 的 MoE 大模型。測試結果已提交至 LocalMaxxing 排行榜,在 Ryzen AI Max 395 硬體組別中排名第一。 沒有獨立顯示卡、不依賴雲端推理服務,純靠 CPU 與 Radeon 8060S GPU 共用的 128 GB LPDDR5X 記憶體,decode 速度最高跑到 32.0 tok/s(greedy decode, temperature=0)。這個數字在 LocalMaxxing 的 Strix Halo 排行榜上是第一名——第二名是 HipFire 引擎的 18.99 tok/s,Lucebox 快了約 68.5%。 ROCmFPX:把 284B 塞進 128 GB RAM DeepSeek V4 Flash 原始權重用 FP16 算約 568 GB(284B × 2 bytes),即便是 Q4_K_M 量化也要近 174 GB。一般消費級電腦根本沒地方放。Lucebox 的解法是用自訂的 ROCmFPX 混合精度量化格式,把整體位元率壓到平均 2.88 bits/parameter,最終模型檔案只剩 102.3 GB(約 95.3 GiB)。 ...

Kimi K3 的 2.8 兆引數宣戰書:中國 AI 如何用開源反攻矽谷

前言 2026 年 7 月 16 日,Moonshot AI 的楊志霖盯著終端機螢幕。Kimi K3 的最後一輪訓練跑完了。損失曲線收斂,基準測試數字出爐——2.8 兆引數。矽谷閉源帝國二十多年來第一次被來自北京的開源模型正面擊中要害。 三天後,OpenAI 策略總監 Dean Ball 在 X 上發文:「我很驚訝中國政府持續允許這種等級的開源模型流出。」他預測川普政府最終會用監管不確定性來封殺開源中國模型,稱之為「將監管工具武器化」。然後一場關於開源 versus 閉源的全球大辯論,就此點燃。 什麼叫「2.8 兆引數」? Kimi K3 的總引數是 2.8 兆(trillion),但真正每次前向傳遞只啟動 400 億左右。它用的是 MoE(Mixture of Experts)架構,896 個專家模組中每次只啟用 16 個。你得到的是接近 GPT-4 原始架構三倍大的知識容量,推理成本卻跟中型稠密模型差不多。 真正的創新在注意力機制。Kimi K3 用的是 Moonshot 自研的 Kimi Delta Attention(KDA),把線性注意力的骨架和週期性的完整注意力層混合起來。大部分序列用近線性記憶體擴充套件處理,關鍵的全域性層則保留了純線性注意力通常會丟失的長距離依賴關係。 100 萬 token 的上下文視窗下,KDA 比標準 Transformer 注意力減少約 60% 的 KV-cache 開銷。處理整份程式碼庫或厚達上千頁檔案的時候,這不是小進步。 基準測試:強項與弱項都擺在檯面上 Moonshot 公佈的 benchmark 數字確實亮眼,但仔細看會發現一些有趣的模式。 基準測試 Kimi K3 Claude Opus 4.8 GPT-5.6 Sol SWE-Bench Verified 72.4% 68.1% 74.2% Tau-2(Agentic) 81.7% 76.3% 79.8% AceBench(Tool Calling) 89.2% 84.5% 87.1% MMLU(綜合知識) 89.7% 88.4% 90.1% K3 在程式碼密集型、長視窗的 agentic 任務上表現突出,跟它的架構設計吻合。MMLU 這類綜合知識基準它表現不錯但沒有脫穎而出——2.8 兆引數的主要價值不在於背書更多事實,而在處理複雜關聯和長期推理。 ...