七月三十一號,DeepSeek 悄悄釋出了 V4 Flash 正式版。沒有發表會、沒有宣傳海報,但 AI 圈當晚就炸了。Hacker News 上有一篇熱帖的標題直白到刺眼:「智慧便宜到你不忍心再按量計費。」
八月六號,DeepSeek 透過 Bloomberg 等媒體發布通知:將上調 API 整體價格。在 DeepSeek 的定價史上這很少見——他們之前的策略幾乎都是降價,或僅在高峰時段實施雙倍定價。不到一個月內第二次調整價格,多少讓人有點意外。
這篇文章想聊的不只是「為什麼漲價」,而是 Agent 自動化怎麼把 Token 消耗拉爆,逼得整個 AI 產業重新算帳。
引數沒動,後訓練把 Agent 能力拉爆七倍半
V4-Flash-0731 的模型結構跟此前的 Flash 預覽版完全一樣——二百八十四億總引數、一百三十億啟用的 MoE 架構、一百萬 token 超長上下文,一個沒改。真正的升級來自後訓練和 Agent 框架最佳化。
這次公測最嚇人的是幾個硬指標的躍遷:
| 基準測試 | 預覽版 | V4 Flash-0731 | 增幅 |
|---|---|---|---|
| DeepSWE(軟體工程) | 7.3 | 54.4 | +7.5 倍 |
| Terminal-Bench 2.1(終端操作) | — | 82.7 | 逼近 Claude Opus 4.8 的 85 |
| CyberGym(網路安全攻防) | — | 76.7 | 較預覽版翻倍 |
| Toolathlon Verified(工具呼叫) | — | 70.3 | — |
| DSBench-FullStack(全棧開發) | — | 68.7 | — |
換句話說,一個定價只有 Opus 幾十分之一的模型,在「寫程式、跑命令、調 API」這類 Agent 核心任務上,已經逼近了被公認最強的閉源模型。
更狠的是,V4 Flash 以 MIT 許可在 Hugging Face 開放權重。不過要釐清一點:Hugging Face 上的 deepseek-ai/DeepSeek-V4-Flash 倉庫在發布後的三個月內,實際上仍只有四月預覽版的權重。真正的 V4-Flash-0731 權重直到近期才以 deepseek-ai/DeepSeek-V4-Flash-0731 獨立發布。一百三十億的啟用引數意味著它在消費級顯示卡上也能跑起來——這對追求「資料不出域、模型可審計」的企業來說,是比「能力強」更關鍵的一張牌。
價格屠夫:從「每百萬 token 一塊錢」到「智慧免費化」
DeepSeek 的定價一直以來都是業界的地雷:
| 專案 | V4 Flash | V4 Pro |
|---|---|---|
| 輸入(cache miss) | $0.14 / MTok | $0.435 / MTok |
| 輸入(cache hit) | $0.0028 / MTok | $0.003625 / MTok |
| 輸出 | $0.28 / MTok | $0.87 / MTok |
| 上下文視窗 | 1M | 1M |
八月六號更新:DeepSeek 宣佈將進行「大幅」整體價格上調,上述費率可能很快改變。詳情待官方公佈。
在程式碼編寫情境下,快取命中率可達百分之九十五以上——折算後百萬 Token 綜合單價僅約六分錢。
一個生產級 RAG 系統每天跑一千萬 cache-hit 輸入 token,在 V4 Flash 上僅需二十八美元。同樣的負載跑在 Claude Fable 5 上則要一百五十美元——基礎價差之上再乘以五倍。
當同樣跑一個中等複雜度的程式 Agent 任務,用 Claude Opus 4.8 可能要花幾美元,用 V4 Flash 只要幾毛錢人民幣。儘管 DeepSeek 自己的基準測試顯示 Opus 4.8 在全部九項代理任務上都領先 V4 Flash(平均差距約五點七分),但考慮到 V4 Flash 的單次呼叫成本僅約為 Opus 的五十四分之一,「把複雜任務路由給大模型」這套商業架構確實開始面臨嚴峻挑戰。
Agent 引爆需求:一天八兆 token 是什麼概念?
V4 Flash 的 Agent 能力暴漲,直接引爆了 API 呼叫量。這裡有一個讓業界震驚的數字:
OpenCode 在八月一號,V4 Flash 正式發布的隔天,一天消耗了八兆 token。其中五兆來自免費版、三兆來自付費版 OpenCode Go。
根據 OpenCode 官方在 X(Twitter)上發布的資料,八月一號當天 DeepSeek Flash 處理了八兆 token。這僅是 OpenCode 平臺的內部測量資料,不代表 DeepSeek 全球總用量。
這對全球最大模型託管平臺意味著什麼?OpenRouter 全平臺一天消耗約三兆 token,單單 OpenCode 一個工具呼叫 DeepSeek V4 Flash,一天的消耗量就是整個 OpenRouter 的五倍。一個單一工具的用量,就超過了其他所有小平臺的總和。
為什麼漲價?算力不足的現實面
DeepSeek 近期的定價調整可分為兩個階段。七月月中引入了峰谷定價,高峰時段輸出價格為正常的兩倍。八月六號這天,則正式宣佈將進行更大幅度的整體價格上調,但尚未公佈具體漲幅與生效日期。
核心原因很簡單:需求爆炸對上擴容速度。Token 消耗量暴增,Agent 自動化任務讓 V4 Flash 成為真正的 Token 熔爐——工具迴圈、重試機制、長上下文、自我批判,每一輪 Agent 對話都在消耗 Token。同時 GPU 採購、機櫃部署、網路除錯都需要週期,價格成了最直接的調節槓桿。
目前尚不清楚漲幅幅度、是否適用於 cache-hit 定價,以及是否會影響推理模型的費率。
峰谷定價的運作方式
| 時段 | 北京時間 | UTC 時間 | V4 Flash 輸出價格(現行) |
|---|---|---|---|
| 高峰 | 09:00–12:00 | 01:00–04:00 | $0.56 / MTok(2×) |
| 高峰 | 14:00–18:00 | 06:00–10:00 | $0.56 / MTok(2×) |
| 離峰 | 其他時段 | 其他 UTC 時段 | $0.28 / MTok |
以上為現行峰谷定價。八月六號 DeepSeek 宣佈將進行「大幅」整體漲價,具體數額尚未公佈。上表可能很快失效。
值得注意的是,美國工作時間(美東九點到下午五點)完全落在離峰時段。也就是說,美國開發者的日常互動負載自動享受便宜價格。

Token 經濟學的反饋迴圈
V4 Flash 的爆紅不只是單一產品的成功,它觸發了一條完整的 Token 經濟學反饋迴圈。極致便宜的模型讓開發者願意嘗試更多 Agent 迴圈和更長的上下文,更高的使用頻率又推高 Token 總消耗量,超出基礎設施預期的增長曲線。供應端跟不上的短暫擁堵迫使 DeepSeek 用價格機制調節需求,而競爭對手如 Kimi、GLM 等國產模型被重新定位,OpenAI 和 Anthropic 也面臨定價壓力。最終的結果是產業標準重設——「夠強且夠便宜」成為新的衡量基準,而非「誰引數最多」。
行業觀察家將此現象稱為 AI 產業的「執行線」——無法在能力上顯著超越 V4 Flash 的模型,將被價格戰淘汰。因為它的超低成本讓競爭對手沒有空間在「微小的效能優勢」上生存。
根據 Memeburn 的分析,V4 Flash-0731 在 DeepSeek 自己公佈的九項基準測試中,全部落後於 Claude Opus 4.8。差距從 Terminal Bench 的二點三分到 NL2Repo 的十五點五分不等。真正讓 V4 Flash 具備競爭力的是其極致的價效比,而非絕對效能領先。
對開發者和企業的建議
便宜為主、貴價為輔。將大部分的探索、修復、測試迴圈路由給 V4 Flash,僅在合併關鍵的 diff 上才使用 Claude Opus 或 GPT 級模型。
在每百萬 token 兩點八分與一毛四的價差下,Harness 設計——穩定的 system prompt、prompt 快取——比節省幾個輸出 token 更重要。OpenCode 公開的 Flash 資料顯示快取率可達約百分之九十六。
當單一模型佔據 harness 的百分之五十以上 Token 份額時,停服和政策變更都成為產品風險。雙供應商備援是務實的做法。
批處理任務安排在離峰視窗,可獲得額外百分之五十成本節省。V4 Flash 在評估套件中表現出較高的輸出 token 生成量,建議在 Agent 配置中設定 max_tokens 上限。
一個上週還要花數百元的週末 Agent 探索,現在可能只要幾元——把省下來的錢投入評估和審查,而非盲目的更多迴圈。需要注意的是,DeepSeek 的推理 token(thinking tokens)以輸出費率計費,可能使實際成本超出預期。
結語
DeepSeek V4 Flash 的爆紅,表面看是一個模型的更新,實則是對「大模型必須又大又貴」這一行業潛規則的又一次擊穿。
當後訓練能把 Agent 能力拉爆七倍半、MIT 把權重徹底開源、價格壓到每百萬 token 一毛四,開發者和企業真正該問的問題變成了:我的任務,真的還需要那個最貴的模型嗎?
二〇二六年下半年的 AI 產業主旋律,可能不是「誰最強」,而是「誰夠強又夠便宜」。DeepSeek 用 V4 Flash 把這條線畫到了新高度——而這次漲價,不過是需求爆炸後的短暫陣痛。
真正的長期趨勢只有一個方向:智慧正在變得越來越便宜。
參考資料:DeepSeek 官方 API 檔案與定價頁、Bloomberg(2026-08-06)、Dataconomy(2026-08-06)、Memeburn 深度分析、explainx.ai 報導、TechTimes、Geeky Gadgets、OpenCode 官方資料、Hugging Face 模型頁