Qwen3.8-Max 開源了,但真正有意思的不在數字

八月初,阿里 Qwen 團隊放了一顆炸彈。Qwen3.8-Max,2.4 兆引數的 MoE 架構,950 億活躍引數每 token,一百萬 token 上下文。 headline 讀起來像科技新聞——數字很大,但真正有意思的不是數字本身,而是這代產品定位的微妙轉變。 Qwen3.8-Max 不再只是一個「會寫程式的聊天機器人」。它的核心定位是 cowork——一個能在長週期任務中自主執行、自我修正、最終交付可運作成果的 agent。聽起來像行銷話術,但這次拿出來的案例確實有東西可看。 從「回答問題」到「完成任務」 過去一年,我們已經見識過不少 AI coding agent 的演示:寫一段程式碼、修一個 bug,或者生成一個小工具。這些展示都很好看,但現實中的工作往往比這複雜得多。 Qwen3.8-Max 的三個自主任務案例把門檻拉高了。第一個是讓模型從零開始建立一個叫 oh-my-cli 的 CLI 框架,完全自主運作超過十天。到七月三十日為止,這個專案累積了 265 個 commit、127 個 pull request 和 151 個 issue。模型自己把使用者回饋轉成 issue、分配給 agent、跑測試、修 bug,形成一個自我進化的迴圈。 第二個案例更誇張:給它一篇研究論文的連結和 GPU 資源,讓它自己重現實驗然後做得更好。模型花了大約五天、寫了七千六百行程式碼、跑了三十三輪 GPU 訓練,最後在 AIME24 數學基準上比原論文的方法又提升了 2.7 分。這不是寫一篇漂亮的分析報告,而是真正產出可執行的程式碼、訓練模型、驗證結果。 第三個案例是讓模型參加一個真實的競賽——天貓平臺的多模態對話意圖識別挑戰,526 個真人團隊競爭。模型在二十四小時內自己讀規則、寫程式、微調 BERT 和 RoBERTa 語言模型、結合視覺模型做整合,最後以 0.853 的準確率擊敗了 458 個團隊,排在第八十七名。 這些案例的共通點是:模型不是在回答一個明確的問題,而是在一個開放目標下持續運作、自我修正、最終交付成果。這跟過去我們對 LLM 的想像不太一樣。 Benchmark:看著好看,但別全信 Qwen 隨發布公佈了完整的基準分數表,涵蓋編碼代理、通用代理和一般能力三大類。不過這些分數全部是阿里內部跑出來的結果,沒有第三方獨立驗證。 Terminal-Bench 2.1 拿到 86.6,超過了 Claude Opus 4.8 和 Fable 5 的 84.6,但低於 GPT-5.6 Sol 的 88.8。PaperBench 拿到 93.0,超越所有對手。GPQA Diamond 是 92.6,跟上一代 Qwen3.7-Max 的 92.4 幾乎一樣,成長幅度不大。 ...

在 $2,000 的 APU 上跑 284B MoE:DeepSeek V4 Flash 本地部署實測

今年七月,Lucebox 團隊在 AMD Ryzen AI MAX+ 395 (內部代號 Strix Halo)這顆消費級 APU 上跑起了 DeepSeek V4 Flash——一個總引數 284B、每 token 僅啟用約 13B 的 MoE 大模型。測試結果已提交至 LocalMaxxing 排行榜,在 Ryzen AI Max 395 硬體組別中排名第一。 沒有獨立顯示卡、不依賴雲端推理服務,純靠 CPU 與 Radeon 8060S GPU 共用的 128 GB LPDDR5X 記憶體,decode 速度最高跑到 32.0 tok/s(greedy decode, temperature=0)。這個數字在 LocalMaxxing 的 Strix Halo 排行榜上是第一名——第二名是 HipFire 引擎的 18.99 tok/s,Lucebox 快了約 68.5%。 ROCmFPX:把 284B 塞進 128 GB RAM DeepSeek V4 Flash 原始權重用 FP16 算約 568 GB(284B × 2 bytes),即便是 Q4_K_M 量化也要近 174 GB。一般消費級電腦根本沒地方放。Lucebox 的解法是用自訂的 ROCmFPX 混合精度量化格式,把整體位元率壓到平均 2.88 bits/parameter,最終模型檔案只剩 102.3 GB(約 95.3 GiB)。 ...

Kimi K3 開放權重:2.8 TB 的邊界智慧,用 80 張 RTX 5090 把完整的 K3 跑起來

前言 7 月 26 日,Moonshot AI 把他們最強的 Kimi K3 模型以完整權重開放。不是剪枝版、不是蒸餾版、也不是 API-only——整整 2.8 TB MoE 架構,附帶 MXFP4 原生量化和技術報告一併公開。 研究團隊 totheagi 在 X 上發文,說他們用 80 張 RTX 5090 就把完整的 K3 跑起來了,單串流每秒 20 token,還沒調過超引數。沒有 HBM,只有 GDDR7 消費級視訊記憶體、普通乙太網路線和官方 MXFP4 權重。 「地球上最強開源模型,跑在地球上最 abundant 的 GPU 上。」這句話聽起來像行銷口號,但背後的技術細節值得拆解。 Kimi K3 是什麼? Kimi K3 是 Moonshot AI 於 2026 年 7 月 16 日透過 API 率先發布的旗艦模型(ID:kimi-k3),7 月 26 日開放完整權重下載。它是目前世界上最大的開源 3T 級別模型,引數規模達 2.8 TB。 K3 建立在兩個核心創新上:**Kimi Delta Attention(KDA)**與 Attention Residuals(AttnRes)。KDA 提供高效的可擴充套件注意力機制;AttnRes 在網路深度中選擇性地檢索表示,而不是均勻累加。兩者結合起來專為突破兆引數界線而設計。 ...

阿里 Qwen3-Max Preview 登場 2.4 兆引數首創多模態但 benchmarks 在哪裡

阿里巴巴在 2026 年 7 月 19 日的 Shanghai WAIC(世界人工智慧大會)上,正式揭開了 Qwen3-Max Preview 的面紗。這個被社群廣泛稱為 Qwen3.8-Max-Preview 的模型擁有 2.4 兆引數,採用稀疏混合專家(MoE)架構,是 Qwen 系列首款突破一兆引數門檻且具備原生多模態輸入能力的旗艦——文字、圖片、影片、檔案都能在同一個模型內處理。 阿里把它定位在「僅次於 Fable 5」。問題是:這個說法站得住嗎?下面的內容整理了多個獨立來源,拆解它的規格、能力、定價,還有對開發者可能造成的影響。 基本規格速覽 專案 規格 發布日期 2026 年 7 月 19 日(Preview) 總引數 2.4 兆(sparse MoE,活躍引數未公佈) 上下文視窗 100 萬 token 多模態支援 文字、圖片、影片、檔案輸入 思考模式 Thinking Mode + Function Calling + Built-in Tools API 相容性 OpenAI & Anthropic Messages API 目前可用性 Token Plan、Qoder、QoderWork(阿里自有平臺) 開放權重 「即將推出」,無具體日期或授權條款 發布背景:為什麼是現在? 這個發布時機選得有意思。Kimi K3(2.8T)7/16 才出,Grok 4.5 和 GPT-5.6 Sol 分別是 7/8 和 7/9。Qwen3-Max Preview 卡在 Fable 5 促銷期結束的同一天亮相——開發者正在換模型的時候推新東西,時機抓得準。另外,中國監管機構 7/15 批准了 Apple–Alibaba Qwen 整合案,那時候 Qwen 的關注度本來就高。 ...

Thinking Machines Lab 推出首款開源模型 Inkling:定位自訂化的多模態 MoE 大語言模型

Thinking Machines Lab 推出首款開源模型 Inkling:定位自訂化的多模態 MoE 大語言模型 2026 年 7 月 15 日,前 OpenAI 首席技術官 Mira Murati 創立的 AI 新創公司 Thinking Machines Lab 正式發布了他們的首款產品——開權重(open-weights)多模態基礎模型 Inkling。這款採用混合專家(Mixture-of-Experts, MoE)架構的模型,定位為「適合自訂化」的通用模型,而非追求單一基準測試的最高分。 公司背景:從 OpenAI 到 Thinking Machines Lab Thinking Machines Lab 成立於 2025 年 2 月,總部位於美國加州舊金山。創始團隊陣容堅強,包括前 OpenAI 研究副總裁 Barret Zoph、前 OpenAI VP Lilian Weng,以及 OpenAI 共同創辦人 John Schulman(此前短暫加入 Anthropic)。公司核心成員約 100 人(截至 2026 年),並聘請了來自 OpenAI、Meta AI、Mistral AI 等競爭對手的頂尖研究員與工程師。 在資金方面,Thinking Machines Lab 於 2025 年 7 月完成了由 Andreessen Horowitz (a16z) 領輪的早期融資,金額高達 20 億美元,估值達 120 億美元。投資方包括 Nvidia、AMD、Cisco 和 Jane Street Capital。值得一提的是,Mira Murati 的祖國阿爾巴尼亞政府也透過預算修正案投入了 1,000 萬美元。 ...

萬億參數大陸國產大模型 LongCat-2.0:從架構設計到 Agent 實戰的全面解析

前言 2026 年 6 月 30 日,美團低調而重磅地發佈了新一代萬億參數大模型 LongCat-2.0,並同步開源。這不是一個普通的模型更新——它是業界第一個在五萬卡中國算力集群上完成全流程訓練與推理的萬億參數模型,預訓練數據規模超過 30T tokens,原生支援 100 萬 Token 的超長上下文。 更引人注目的是,在正式版開源前,LongCat-2.0 的 Preview 版本已經透過 OpenRouter 平台面向全球開放,並躋身 OpenRouter 全球大模型調用量前三名——在 Hermes、Claude Code 和 OpenClaw 等 Agent 工具的分榜中,分別拿下全球第一、第二和第三的成績。 這篇文章將從架構、訓練、推理、應用四個維度,帶你全面理解 LongCat-2.0 到底強在哪裡,以及它對 AI Agent 開發者意味著什麼。 架構核心:1.6 萬億參數,但只喚醒 480 億 LongCat-2.0 採用的是 MoE(Mixture of Experts,混合專家)架構,總參數達到驚人的 1.6 兆(1.6T),但每個 token 實際激活的參數約為 480 億(48B),動態範圍在 330 億到 560 億之間。 這個設計的精妙之處在於「零計算專家」機制。代碼任務中,token 的複雜度差異極大——定義一個變數名和推導一個遞歸算法,對算力的需求完全不在一個量級。LongCat-2.0 在專家池中增設了「零計算專家」,當簡單 token(標點符號、功能詞等)被路由到該專家時,直接返回輸入,不消耗任何計算資源。 配合 ScMoE(Sparse Mixture of Experts)動態路由,系統透過 PID 控制器自動調節專家偏置,維持平均激活參數在目標範圍內。簡單說:算力被精準地花在刀刃上。 LongCat Sparse Attention(LSA):100 萬 Token 不是口號 傳統 Transformer 的注意力機制計算量是序列長度的平方級($O(n^2)$),上下文一到 100K 就開始「遺忘」前面的內容。LongCat-2.0 自研的 LSA 稀疏注意力機制將計算量降至線性級($O(n)$),核心有三招: ...