Qwen3.8-Max 開源了,但真正有意思的不在數字

八月初,阿里 Qwen 團隊放了一顆炸彈。Qwen3.8-Max,2.4 兆引數的 MoE 架構,950 億活躍引數每 token,一百萬 token 上下文。 headline 讀起來像科技新聞——數字很大,但真正有意思的不是數字本身,而是這代產品定位的微妙轉變。 Qwen3.8-Max 不再只是一個「會寫程式的聊天機器人」。它的核心定位是 cowork——一個能在長週期任務中自主執行、自我修正、最終交付可運作成果的 agent。聽起來像行銷話術,但這次拿出來的案例確實有東西可看。 從「回答問題」到「完成任務」 過去一年,我們已經見識過不少 AI coding agent 的演示:寫一段程式碼、修一個 bug,或者生成一個小工具。這些展示都很好看,但現實中的工作往往比這複雜得多。 Qwen3.8-Max 的三個自主任務案例把門檻拉高了。第一個是讓模型從零開始建立一個叫 oh-my-cli 的 CLI 框架,完全自主運作超過十天。到七月三十日為止,這個專案累積了 265 個 commit、127 個 pull request 和 151 個 issue。模型自己把使用者回饋轉成 issue、分配給 agent、跑測試、修 bug,形成一個自我進化的迴圈。 第二個案例更誇張:給它一篇研究論文的連結和 GPU 資源,讓它自己重現實驗然後做得更好。模型花了大約五天、寫了七千六百行程式碼、跑了三十三輪 GPU 訓練,最後在 AIME24 數學基準上比原論文的方法又提升了 2.7 分。這不是寫一篇漂亮的分析報告,而是真正產出可執行的程式碼、訓練模型、驗證結果。 第三個案例是讓模型參加一個真實的競賽——天貓平臺的多模態對話意圖識別挑戰,526 個真人團隊競爭。模型在二十四小時內自己讀規則、寫程式、微調 BERT 和 RoBERTa 語言模型、結合視覺模型做整合,最後以 0.853 的準確率擊敗了 458 個團隊,排在第八十七名。 這些案例的共通點是:模型不是在回答一個明確的問題,而是在一個開放目標下持續運作、自我修正、最終交付成果。這跟過去我們對 LLM 的想像不太一樣。 Benchmark:看著好看,但別全信 Qwen 隨發布公佈了完整的基準分數表,涵蓋編碼代理、通用代理和一般能力三大類。不過這些分數全部是阿里內部跑出來的結果,沒有第三方獨立驗證。 Terminal-Bench 2.1 拿到 86.6,超過了 Claude Opus 4.8 和 Fable 5 的 84.6,但低於 GPT-5.6 Sol 的 88.8。PaperBench 拿到 93.0,超越所有對手。GPQA Diamond 是 92.6,跟上一代 Qwen3.7-Max 的 92.4 幾乎一樣,成長幅度不大。 ...

Kimi K3 上線:全球最大開權重模型,前端開發者該升級武器庫了嗎?

2026 年 7 月 16 日,中國 AI 公司 Moonshot AI(月之暗面)正式上線了他們的旗艦模型 Kimi K3。這款定位為「開放型前沿智慧」的模型直接對標 Anthropic 的 Claude Opus 4.8 與 OpenAI 的 GPT-5.6 Sol,宣稱是目前全球最大的開權重 AI 模型。 作為一款參數高達 2.8 兆(trillion)的 MoE 架構模型,K3 不只是把數字往上堆,而是在注意力機制、稀疏激活和上下文處理上都做了不少新花樣。這篇文章整理 K3 的核心規格、基準表現、價格結構以及實際使用體驗,幫你判斷它值不值得進你的開發工具鏈。 2.8 兆參數的架構門道 Kimi K3 採用 MoE(Mixture of Experts)架構,總參數量約 2.8 兆,但每處理一個 token 只激活 16 個專家——在全部 896 個路由專家中挑出最相關的。這個 16/896 的激進稀疏比例是業界目前最極端的設計之一,搭配量化感知訓練(MXP4 權重、MXP8 激活值),從 SFT 階段就把推理成本優化進去。 Moonshot 為 K3 設計了三項核心技術來支撐這個龐大體型。 第一項是 Kimi Delta Attention(KDA),一種混合線性注意力機制,專門解決長序列處理時的記憶體與速度瓶頸。官方宣稱在百萬 token 情境下解碼速度提升了 6.3 倍。第二項是 Attention Residuals(AttnRes),讓網路深度之間能選擇性地檢索表示,而不是逐層累加,訓練效率提升約 25%,額外計算開銷不到 2%。第三項則是整體縮放效率——Moonshot 宣稱 K3 相較前代 K2 的縮放效率提升了約 2.5 倍,也就是說同樣的計算資源下,K3 能產生更多可用智慧。 ...

小米 MiMo-V2.5-ASR 開源語音辨識模型:方言、噪音、多語切換全搞定

前言 前陣子收到小米 MiMo Open Platform 的 Email 通知,說他們的語音辨識模型 MiMo-V2.5-ASR 正式上線了。身為一個對語音辨識技術一直有觀察的人,這下忍不住去挖了更多資料。 簡單來說,小米這次推出的不是一個「乾淨環境下跑分漂亮」的模型,而是專門為真實世界複雜聲學場景設計的語音辨識引擎。支援粵語、閩南語、四川話等方言,還能處理中英混說、歌詞辨識、多人對話交疊等高難度場景。 這篇就來好好聊聊這個模型到底強在哪裡,以及它跟目前主流方案(特別是 OpenAI Whisper)的比較。 什麼是 MiMo-V2.5-ASR? MiMo-V2.5-ASR 是小米 MiMo 團隊開發的端到端自動語音辨識(ASR)模型,屬於小米完整語音模型系列(ASR → TTS → 多模態)的「聽覺基礎層」。 這個模型的特色在於: 開源:權重放在 Hugging Face 和 ModelScope,GitHub 也有完整程式碼 多語言 + 多方言:中文、英文,加上粵語、吳語、閩南語、四川話、河南話、東北話、陝西話等 中英混說(Code-Switching):不需要預先設定語言標籤,模型自動判斷 知識感知:對古詩詞、專業術語、人名地名有特別強化 原生標點:直接從語調和語意輸出標點,不需要後處理 技術上,模型透過大規模中期訓練(mid-training)、高品質監督微調(SFT),以及一套新的強化學習演算法來達成這些能力。 跑分數據:跟 Whisper 比誰比較強? 小米在官方頁面上放了一組相當完整的 Benchmark 數據,以下整理幾個關鍵指標: 中文語音辨識(WER 越低越好) 模型 AiShell-2 Fleurs-Zh Wenet Meeting CommonVoice-Zh MiMo-V2.5-ASR 2.52 2.41 5.92 4.90 FunASR-1.5 2.57 2.75 5.95 4.57 英文語音辨識(Open ASR Leaderboard) 模型 平均 WER LS Clean SPGISpeech Tedlium MiMo-V2.5-ASR 5.73 1.45 1.85 2.4 Qwen3-ASR-1.7B 5.76 1.63 2.84 2.28 Whisper-large-v3 7.44 2.01 2.94 3.86 方言辨識 模型 CommonVoice-Taiwan WeNet-Wu Fleurs-Yue MiMo-V2.5-ASR 3.65 19.55 3.28 Qwen3-ASR-1.7B 3.7 24.29 3.53 從數據來看,幾個重點: ...

LTX 2.3 + ComfyUI Video Builder:從極客玩具到專業工具,AI 影片生成的下一波浪潮

前幾天在 r/comfyui 上看到一則貼文,標題平平無奇——「LTX 2.3 Video Builder UI for ComfyUI - High Level Beta Overview」,點進去看完整個 Demo 影片後,我第一個念頭是:AI 影片生成工具終於要從「極客的玩具」變成「創作者的武器」了。 這篇文章不只是想介紹這個工具,我想帶你從 LTX 2.3 模型本身聊到 ComfyUI 上的 Video Builder 工作流程,再聊聊它對整個 AI 影片生態的意義。如果你曾經用過 Runway、Pika 或 Sora,但苦於不夠靈活;或者你已經在用 ComfyUI 做影像生成,卻覺得影片流程太零散——這篇文章應該會讓你眼睛一亮。 LTX 2.3 是什麼?為什麼它值得關注? LTX 2.3 是以色列公司 Lightricks 推出的開源影片生成模型,架構上採用 Diffusion Transformer(DiT),是目前高階生成式影片的主流架構。它的最大賣點可以用一句話概括:「一個模型,搞定影片+同步音訊。」 核心規格亮點 能力 說明 最高解析度 4K(4096×2160) 最高幀率 50 FPS 影片長度 最長 20 秒 畫幅比例 16:9、9:16(原生支援)、1:1 音訊 原生同步生成 授權 年營收低於 1000 萬美元的企業可免費商用 這裡有幾個關鍵升級值得注意: 1. 重新設計的潛在空間(Latent Space) LTX 2.3 訓練了一個更高品質的 Video VAE,意味著細部表現(髮絲、文字、邊緣)比前代 LTX-2 更銳利。簡單來說,生成的畫面不會再有一層「AI 糊感」。 ...

Qwen 3.6 深度解析:27B 稠密模型 vs 35B MoE,誰才是本地部署的王者?

前言 前陣子看到一篇來自 Quesma 的文章,作者在他的 MacBook Max M5(128GB RAM)上跑了 Qwen 3.6 系列模型後,得出一個頗具爭議的結論:27B 稠密模型在本地開發中才是最佳選擇,而不是 35B MoE 版本。 這個說法在 Reddit 的 LocalLLaMA 社群引發了熱烈討論——有人認同、有人反對。作為一個長期關注開源模型本地部署的人,我覺得這正是個好機會,把 Qwen 3.6 整個系列徹底盤點一遍,讓大家在實際部署前有個清晰的認知。 Qwen 3.6 家族全覽 Qwen 3.6 是阿里通義千問團隊在 2026 年 4 月推出的新一代模型家族,主要分為三大版本: 1. Qwen 3.6-Plus(旗艦閉源版) 透過阿里雲百煉 / DashScope API 提供 預設 100 萬 token 上下文視窗 採用混合線性注意力(Linear Attention)+ MoE 架構 估計活躍參數超過 4000 億 定價約 $0.29/100 萬輸入 token、$1.65/100 萬輸出 token,比 Claude Opus 4.6 便宜約 12 倍、GPT-5.4 便宜約 6 倍 2. Qwen 3.6-35B-A3B(開源 MoE 版) ...

Ornith-1.0 釋出:開源智慧體編碼模型的新里程碑

近期開源 AI 圈迎來了一項引人注目的發布——由 DeepReinforce 推出的 Ornith-1.0 模型系列。這組專為 Agentic Coding(智慧體編碼)設計的開源模型,在發布後迅速成為社群討論的焦點。本文將從模型架構、基準測試表現、核心技術創新與部署可行性等面向,客觀分析 Ornith-1.0 的亮點與潛在價值。 模型背景與版本架構 Ornith-1.0 系列建立在 Gemma 4 與 Qwen 3.5 的預訓練模型之上,共推出四個參數量版本: 模型版本 架構類型 適用場景 Ornith-1.0-9B Dense(稠密) 邊緣裝置、IDE 整合 Ornith-1.0-31B Dense(稠密) 均衡效能與資源 Ornith-1.0-35B MoE MoE(混合專家) 本地部署首選 Ornith-1.0-397B MoE MoE(混合專家) 旗艦級雲端部署 其中,397B MoE 是本次發布的旗艦模型,僅有 17B 的活躍參數(active parameters)。而 35B MoE 版本則被視為「甜蜜點」——參數量遠低於旗艦版,但在多項編碼基準測試中卻能逼近甚至超越 397B 大模型的表現。 所有模型均採用 MIT 授權協議,允許商業與研究用途,無任何額外限制。 基準測試表現 根據官方公布的數據,Ornith-1.0 在多個主流編碼智慧體基準測試中取得了亮眼的成績。以下整理主要結果: 旗艦版(397B MoE) 測試項目 Ornith-1.0-397B Claude Opus 4.7 Claude Opus 4.8 Terminal-Bench 2.1 77.5 70.3 85.0 SWE-Bench Verified 82.4 80.8 87.6 SWE-Bench Pro 62.2 — 69.2 SWE-Bench Multilingual 78.9 — — NL2Repo 48.2 — — ClawEval 77.1 — — 在 Terminal-Bench 2.1 與 SWE-Bench Verified 兩項測試中,397B 版本超越了 Claude Opus 4.7,展現了開源模型在編碼智慧體任務上的競爭力。 ...

Qwythos-9B 深度解析:1M 上下文 + 無限制推理,9B 級開源模型的天花板在哪裡?

前言 2026 年 6 月底,AI 開源圈丟出一顆炸彈——Empero AI 發布了 Qwythos-9B-Claude-Mythos-5-1M。短短幾天內,這個模型在 Hugging Face 上衝上熱門榜,Reddit 的 SelfHostedAI 社群也沸騰了。 為什麼一個 9B 參數的模型能引起這麼大關注?簡單說:它在 9B 級別中,同時拿下了 1M token 上下文窗口、無限制推理能力、以及 原生工具調用——三個通常不會出現在同一個模型身上的標籤。 但它的訓練數據來自閉源的 Claude Mythos,效能表現有強項也有弱項,部署還不算太友善。這篇文章會帶你從技術規格、效能表現、社群反饋到業界爭議,完整拆解 Qwythos-9B 到底值不值得關注。 一、模型是什麼?誰做的? Qwythos-9B 是由 Empero AI(一家中國 AI 實驗室)開發的開源推理模型。它的基座是 Qwen3.5-9B,經過全參數微調(不是 LoRA 那種輕量微調),目標是打造一個「在專業領域不跳 boilerplate、能自主驗證事實、能處理超長上下文的推理模型」。 授權是 Apache-2.0,意味著你可以自由商用、修改、再分發。 這裡有個有趣的命名細節:「Qwythos」這個名字,應該是取自 Claude 的 Mythos 系列(Mythos + Fable),再加上 Qwen 的「Q」字頭,暗示它與這兩者的淵源。 二、核心技術規格 我們直接看重點: 項目 規格 基座模型 Qwen3.5-9B(深度無限制版) 訓練數據 5 億+ tokens 的 Claude Mythos / Fable traces 上下文窗口 1,048,576 tokens(1M,YaRN rope-scaling ×4) 架構 混合 Gated-DeltaNet(次二次方記憶體增長) License Apache-2.0 推理模式 文字為主(基座多模態,但只訓練了文字路徑) 1M 上下文是什麼概念? 大約等於 75-80 萬個中文字。換句話說,你可以把一個中型專案的整個程式碼庫、幾十篇學術論文、或者一整天的 Agentic 工作流記錄,全部塞進它的上下文裡。 ...

Krea 2 Turbo 深度解析:2 秒出圖的新一代 AI 繪圖模型,ComfyUI 原生部署完整指南

前言 2026 年 5 月,AI 繪圖圈丟了一顆重磅炸彈——Krea 團隊發布了他們第一款從零自建的基礎影像模型 Krea 2,並在短短一個月後推出了速度優化版 Krea 2 Turbo。 更令人興奮的是,隨著 ComfyUI 0.25.0 的發布,Krea 2 終於迎來了原生支援,搭配社群製作的 FP8 量化權重,讓一般消費者等級的顯卡(16GB–24GB VRAM)也能在本機流暢運行。 這篇文章將帶你完整認識 Krea 2 Turbo 的核心特色、技術架構、與其他主流模型的比較,以及如何在 ComfyUI 中部署運行。 Krea 2 Turbo 是什麼? Krea 2 Turbo 是 Krea 2 系列中的「速度優先」變體,主打約 2 秒內生成高品質影像。它保留了 Krea 2 核心的創意控制能力(風格參考、Moodboard、LoRA),同時將生成速度提升了數倍。 簡單來說,如果你想要「快速試探創意方向、大量迭代」,Turbo 是你的首選;如果你需要「最終成品的極致細節與風格忠實度」,則應升級到 Krea 2 Medium 或 Large。 核心規格一覽 項目 Krea 2 Turbo Krea 2 Medium Krea 2 Large 生成速度 ~2 秒(本地)/ ~4 秒(API) ~15 秒 ~15 秒+ 推理步數 8 步 8 步 8 步 CFG Scale 1.0(推薦) 1.0 1.0 支援風格參考 ✅ 最多 4 張 ✅ ✅ 支援 Moodboard ✅ ✅ ✅ 支援 LoRA ✅ ✅ ✅ 支援 Generative Sliders ✅ ✅ ✅ 原始權重大小 24.76 GB (BF16) 較小 2 倍以上 Medium FP8 量化後 12.01 GB — — 推薦顯卡 16GB+ VRAM 12GB+ VRAM 24GB+ VRAM Krea 2 的核心特色 1. 「風格控制」而非「提示詞依賴」 這是 Krea 2 與 Midjourney、Stable Diffusion 等模型最大的差異點。 ...

GLM-5.2 vs Claude Opus 4.8:最強開源模型真的追上來了嗎?

前言 2026 年 6 月 13 日,中國 AI 公司智譜(Zhipu AI / Z.ai)發布了最新一代旗艦模型 GLM-5.2,同時推出了自研的 ZCode 3.0 編程工具。官方宣稱它是「最強開源模型」,緊追在 Mythos 與 GPT-5.5 之後。 消息一出,社群沸騰。尤其是 Anthropic 因美國出口管制撤下 Claude Fable 5 和 Mythos 5 後,市場急需一個能替代的頂級模型。GLM-5.2 恰好在此時登場,搭載 1M Token 上下文、MIT 開源協議,以及被稱為「前沿級編程能力」的表現。 那麼,它到底有沒有那麼強?跟目前公認的編程天花板 Claude Opus 4.8 相比,差距在哪?這篇文章將從基準測試、實測表現、架構創新、價格策略到生態部署,為你一次拆解清楚。 GLM-5.2 是什麼?一張表看懂核心規格 在深入之前,先來認識一下這位主角。GLM-5.2 是智譜面向「長程任務時代」打造的旗艦模型,核心定位是 Agentic Engineering(智能體工程)——也就是說,它不是用來聊天的,而是用來「長時間自主完成編程專案」的。 維度 GLM-5.2 Claude Opus 4.8 開發商 智譜 AI(Z.ai) Anthropic 授權 MIT 開源 閉源(僅 API) 架構 753B 參數 MoE(256 路由專家 + 1 共享,78 層,每 token 激活 8 個專家) 閉源 上下文窗口 1M tokens(真正可用) 1M tokens 最大輸出 131,072 tokens 高(未公開上限) 多模態 純文字 支援視覺(圖像、UI 截圖等) 自部署 支援(MIT 協議) 不支援 看到這裡,第一個震撼彈來了:GLM-5.2 是純文字模型,沒有視覺能力。 這在後續的實測中會成為關鍵差異。 ...