八月初,阿里 Qwen 團隊放了一顆炸彈。Qwen3.8-Max,2.4 兆引數的 MoE 架構,950 億活躍引數每 token,一百萬 token 上下文。 headline 讀起來像科技新聞——數字很大,但真正有意思的不是數字本身,而是這代產品定位的微妙轉變。
Qwen3.8-Max 不再只是一個「會寫程式的聊天機器人」。它的核心定位是 cowork——一個能在長週期任務中自主執行、自我修正、最終交付可運作成果的 agent。聽起來像行銷話術,但這次拿出來的案例確實有東西可看。
從「回答問題」到「完成任務」
過去一年,我們已經見識過不少 AI coding agent 的演示:寫一段程式碼、修一個 bug,或者生成一個小工具。這些展示都很好看,但現實中的工作往往比這複雜得多。
Qwen3.8-Max 的三個自主任務案例把門檻拉高了。第一個是讓模型從零開始建立一個叫 oh-my-cli 的 CLI 框架,完全自主運作超過十天。到七月三十日為止,這個專案累積了 265 個 commit、127 個 pull request 和 151 個 issue。模型自己把使用者回饋轉成 issue、分配給 agent、跑測試、修 bug,形成一個自我進化的迴圈。
第二個案例更誇張:給它一篇研究論文的連結和 GPU 資源,讓它自己重現實驗然後做得更好。模型花了大約五天、寫了七千六百行程式碼、跑了三十三輪 GPU 訓練,最後在 AIME24 數學基準上比原論文的方法又提升了 2.7 分。這不是寫一篇漂亮的分析報告,而是真正產出可執行的程式碼、訓練模型、驗證結果。
第三個案例是讓模型參加一個真實的競賽——天貓平臺的多模態對話意圖識別挑戰,526 個真人團隊競爭。模型在二十四小時內自己讀規則、寫程式、微調 BERT 和 RoBERTa 語言模型、結合視覺模型做整合,最後以 0.853 的準確率擊敗了 458 個團隊,排在第八十七名。
這些案例的共通點是:模型不是在回答一個明確的問題,而是在一個開放目標下持續運作、自我修正、最終交付成果。這跟過去我們對 LLM 的想像不太一樣。

Benchmark:看著好看,但別全信
Qwen 隨發布公佈了完整的基準分數表,涵蓋編碼代理、通用代理和一般能力三大類。不過這些分數全部是阿里內部跑出來的結果,沒有第三方獨立驗證。
Terminal-Bench 2.1 拿到 86.6,超過了 Claude Opus 4.8 和 Fable 5 的 84.6,但低於 GPT-5.6 Sol 的 88.8。PaperBench 拿到 93.0,超越所有對手。GPQA Diamond 是 92.6,跟上一代 Qwen3.7-Max 的 92.4 幾乎一樣,成長幅度不大。
比較值得注意的躍升在 DeepSWE 1.1:從 21.6 跳到 56.6,提升了超過兩倍。FrontierSWE 從 40.7 跳到 73.5。這些躍升幅度確實驚人,但 benchmark 的評估方式、timeout、工具存取許可權和提示模板都會大幅影響結果。而且 Qwen 在某些 benchmark 上是跟 Qwen3.7-Plus 比,不是跟 Max 版比,這會放大世代差距。
還有一個值得注意的細節:Qwen 自己的 RL 擴充套件曲線在約四千個訓練環境達到峰值 0.725 之後開始下降(後續降至 0.719、0.689)。這意味著模型的 RL 能力可能已經接近這個架構的邊界,進一步增加訓練環境數量反而會導致效能退化。
價格:貴了但更省?
Qwen3.8-Max 的 API 定價為每百萬輸入 token 兩美元、輸出六美元,比上一代 Qwen3.7-Max(輸入 $1.25/M、輸出 $3.75/M)貴了 60%。不過,阿里官方在發布時提到了一個關鍵變化:3.8-Max 的思考效率大幅提升。根據早期使用者的測試,在同樣的簡單提示下,3.8-Max 每次呼叫平均消耗的 token 數遠低於 3.7-Max——有些場景下總費用反而更低。
原因很直觀:3.7-Max 在回答一個簡單的程式問題時,產出了上千個 reasoning token;而 3.8-Max 的推理路徑明顯更精簡。思考效率的提升部分抵消了單 token 價格的上漲,雖然具體節省幅度因任務而異。
當然這只在短提示下成立。如果你的輸入 token 超過三萬,3.8-Max 的單價比較高,而且長上下文負載下總費用還是會更高。
另外,3.8-Max 引入了 reasoning_effort 引數(xhigh、medium、low),讓你可以主動控制推理深度和成本。這在 3.7-Max 上是不存在的功能,也是實際使用時控制花費的重要工具。
多模態輸入:這一代真正的新東西
Qwen3.7-Max 是純文字模型,不支援圖片或影片輸入。Qwen3.8-Max 則原生支援文字、圖片和影片輸入,這是這代真正的亮點之一。
根據官方測試,模型能正確讀取圖片內容、理解影片結構,並將其整合到任務執行中。不過實際使用時有一些需要注意的細節:某些外部影片 URL 可能因為阿里伺服器無法下載而失敗;另外,目前影片的 token 計費尚未完全透明化,在 usage.prompt_tokens_details 中的顯示方式與文字 token 不同。如果你需要精確控制多模態成本,建議先在少量請求上測試實際消耗。
開源重量級彈藥:2.4T 和 27B 兩個選擇
阿里在八月三日宣佈開放權重,預計八月十日在 Hugging Face 和 ModelScope 上線。這是 Qwen 第一次把 Max 級別的模型開源,意義不小。過去兩代(3.7-Max)都是 API-only 的閉源旗艦,這次終於把最大的模型放出來了。
但這裡有兩個關鍵點要注意。第一,權重還沒真的上線,八月初的報導說「即將開源」不等於已經可以下載。第二,授權條款還沒公佈。Qwen 3.5 和 3.6 都是 Apache 2.0,但如果這次在 2.4T 的模型上用了更限制性的授權,那「開源」的意義就會大打折扣。
除了 2.4T 的 Max,阿里同時也在準備一個 Qwen3.8-27B 的開源版本。這個模型只有 270 億引數,屬於 dense 架構,才是真正適合一般企業自己部署的版本。一臺配備雙 RTX 4090(48GB VRAM)或單張 A100 的伺服器就能跑,不需要資料中心等級的硬體。
所以開源的意義是雙重的:2.4T 的 Max 給研究者和雲端推理業者用,27B 的版本給需要資料主權和本地部署的企業用。
能不能自己跑?現實一點說,不能。
即使權重開放下載了,你也不可能在自己的機器上跑 Qwen3.8-Max。2.4 兆引數意味著什麼?DeepSeek-V3.2 的 6850 億引數已經被跑過的人形容為「真正的基礎設施專案」了。Qwen3.8-Max 是它的三到四倍大。
如果你真的想自己部署,27B 的版本才是你要看的。FP8 量化後大約需要 27GB VRAM,INT4 甚至可以到 14GB 左右。這跟 Max 版完全是兩個世界的事。
值得切換嗎?看你的使用場景
如果你目前用的是 Qwen3.7-Max 且主要處理短提示,直接切換到 3.8-Max 應該會省錢也更快。如果你的工作負載包含大量長文字輸入,3.8-Max 的單價比較高,而且我們測試的結果是它在長上下文檢索上的表現跟 3.7-Max 幾乎一樣。
需要圖片或影片輸入?這是換到 3.8-Max 的最強理由之一,因為 3.7-Max 完全不支援多模態輸入。
如果你現在用的是 Claude 或 GPT,阿里這代的基準分數沒有獨立驗證,單憑這些數字還不足以構成遷移的理由。而且 Qwen3.8-Max 在編碼代理基準上(如 SWE-bench Pro、FrontierSWE)仍然落後於 Claude Fable 5 和 GPT-5.6 Sol。每個模型的實際表現都跟你的 prompt、程式碼和對錯誤的容忍度有關,benchmark 上的排名跟生產環境的體驗完全是兩回事。
總結:這代 Qwen 真正值得關注的不是引數數量
Qwen3.8-Max 的發布有三個關鍵訊號:
AI agent 的演進方向正在從「一次性的智慧回答」轉向「長週期的自主工作流」。模型不再只是回答你的問題,而是被設計成能在一個開放目標下持續運作、自我修正、最終交付成果。
首次 Max 級別模型開源。過去幾代 Qwen-Max 都是 API-only,這次把 2.4T 的模型權重放出來,對研究和自部署市場有實質意義。
原生多模態能力。文字、圖片、影片輸入的整合不像是補丁,而是架構級的設計。這讓 Qwen3.8-Max 在多模態代理場景中有了明顯優勢。
這跟過去一年我們看到的所有 AI agent 演示方向是一致的——真正的價值不在於模型有多聰明,而在於它能不能在一個有外部驗證的環境中持續改進自己的輸出。測試框架、CI pipeline、量化指標,這些才是讓 agent 從玩具變成工具的關鍵。
權重預計八月十日開放下載,授權條款尚未公佈(Qwen 過往版本多為 Apache 2.0),benchmark 沒有獨立驗證。在這些事情確定之前,保持關注但不衝動是比較穩妥的做法。等八月十日的權重開放下載確認之後,再實際測試會比較有意義。
