Google 大換血:Hassabis 專攻 AGI、Jeff Dean 出走,AI 格局重新洗牌

2026 年 8 月 5 日,Google 和 Alphabet 同時甩出一顆震撼彈:DeepMind 創辦人 Demis Hassabis 卸下 CEO 職務,轉任 DeepMind 主席兼 Alphabet 首席科學家;而 Google 首席科學家 Jeff Dean 則直接離職,跟 Sanjay Ghemawat、Quoc Le、Oriol Vinyals 等人創辦新創公司 Discovery Loop。 把過去三年的時間線拉開來看會比較清楚——Geoffrey Hinton 2023 年離開、Yann LeCun 2025 年底出走 Meta、2026 年 6 月一週內四名 Gemini 核心成員相繼離職、加上這次 Jeff Dean 的離任。Google 正在經歷一場結構性的 AI 人才大流失。 人事改組到底怎麼變? Hassabis 從 DeepMind CEO 轉任 DeepMind 主席和 Alphabet 首席科學家,同時兼管 Isomorphic Labs。他的新角色不再管日常營運,而是專注在 AGI 戰略方向和科學研究。 接棒 DeepMind 的是 Koray Kavukcuoglu,他從原本的 CTO 和 Google 首席 AI 架構師升任 DeepMind SVP,直接向 CEO Sundar Pichai 報告。Koray 在 DeepMind 待了 13 年,技術底子深厚。不過前 Google 高管的說法是——他不是那種能鼓舞人心的領袖型別。 ...

GPT-5.6 Luna 免費開放了,Gemini 3.6 Flash 還值得用嗎?

八月初 OpenAI 把 GPT-5.6 Luna 放給免費使用者用了。 現在你不用花錢就能同時用兩個頂級模型:Google 的 Gemini 3.6 Flash(七月底上線)跟 OpenAI 新出的 Luna。兩者都提供無限文字對話,免費使用者直接上手。 問題是:既然都不用錢,該選誰?還是兩個都留著看場合用? 先講結論 編碼跟實用任務選 Luna,多模態跟生態整合選 Gemini。 下面拆開講。我假設你跟我一樣,不想花錢但也不想犧牲太多功能。 規格對比 先看基礎規格。兩邊都在拼上下文視窗,但 Luna 在輸出上限上更大膽: 專案 Gemini 3.6 Flash GPT-5.6 Luna 免費平臺 gemini.google.com chatgpt.com 文字對話 ✅ 無限 ✅ 無限 Think/深度推理 內建自動判斷 Think 按鈕(手動觸發) 圖片輸入 ✅ ✅ 音訊輸入 ✅(8 小時) ❌ 影片輸入 ✅(1 小時) ❌ 圖片生成 ✅ Nano Banana 2 ✅ GPT-Image 程式碼執行 ✅ 沙盒環境 ❌(需外部工具) 桌面自動化 ❌ ✅ Computer Use 編碼能力(Terminal-Bench) 78.0% 84.7% 上下文視窗 ~1M tokens ~1.05M tokens 最大輸出長度 65K tokens 128K tokens 知識截止 2026-03-31 2026-02-16 Luna 的輸出上限是 Gemini 兩倍多。處理長程式碼或檔案的時候,這差異會很明顯。Gemini 的知識截止日期比較新,如果你在意資訊時效性,這算一個小加分。 ...

ChatGPT 免費用戶終於可以無限聊天了

OpenAI 在 8 月 6 日正式公告了一則對免費用戶相當友好的更新。簡單來說,ChatGPT 的免費使用者終於可以無限文字聊天了,不再被速率限制卡著。同時,預設模型也從 GPT-5.5 Instant 升級到全新的 GPT-5.6 Luna。 這條消息的來源是 OpenAI 官方部落格,MacRumors 等科技媒體也同步報導。以下整理重點。 GPT-5.6 家族:Sol、Terra、Luna GPT-5.6 是 OpenAI 在 2026 年 7 月推出的新一代模型家族,分成三個層級: Sol — 旗艦版,主打最可靠的事實回答與深度推理,目前為 Plus 和 Pro 訂閱用戶使用。 Terra — 平衡型,價格約為 Sol 的一半,適合日常使用。 Luna — 最快也最便宜的版本,這次直接成為免費用戶的預設模型。 這三款模型都已經上線 API,但這次公告的重點主要在 ChatGPT 網頁版和 App 的體驗調整。 從上圖可以看出,Luna 的定位是輕量高效,這也解釋了為什麼 OpenAI 敢讓免費用戶無限使用——成本可控。 免費用戶的三大變化 1. 無限文字聊天,不再有速率限制 這是這次最直接的福利。免費用戶現在可以持續進行文字對話,不會因為次數或時間而中斷。不過要注意,「無限」指的是純文字聊天。上傳檔案、圖片生成、語音等功能仍然各自有使用次數限制。 另外,無限聊天仍然受到防濫用機制的約束,不是完全無條件。正常使用完全沒問題,但惡意刷量或濫用行為還是會被限制。 2. 預設模型升級到 GPT-5.6 Luna Free 和 Go 用戶的預設模型從 GPT-5.5 Instant 換成了 GPT-5.6 Luna。根據 OpenAI 的內部評估數據,Luna 的事實錯誤率比舊版 Instant 少了約 62%,Sol 則少了 68%。換句話說,不僅聊天次數沒有限制,回答品質也提升了。 ...

DeepSeek V4 Flash 一天吃掉 8T token,為什麼突然漲價

七月三十一號,DeepSeek 悄悄釋出了 V4 Flash 正式版。沒有發表會、沒有宣傳海報,但 AI 圈當晚就炸了。Hacker News 上有一篇熱帖的標題直白到刺眼:「智慧便宜到你不忍心再按量計費。」 八月六號,DeepSeek 透過 Bloomberg 等媒體發布通知:將上調 API 整體價格。在 DeepSeek 的定價史上這很少見——他們之前的策略幾乎都是降價,或僅在高峰時段實施雙倍定價。不到一個月內第二次調整價格,多少讓人有點意外。 這篇文章想聊的不只是「為什麼漲價」,而是 Agent 自動化怎麼把 Token 消耗拉爆,逼得整個 AI 產業重新算帳。 引數沒動,後訓練把 Agent 能力拉爆七倍半 V4-Flash-0731 的模型結構跟此前的 Flash 預覽版完全一樣——二百八十四億總引數、一百三十億啟用的 MoE 架構、一百萬 token 超長上下文,一個沒改。真正的升級來自後訓練和 Agent 框架最佳化。 這次公測最嚇人的是幾個硬指標的躍遷: 基準測試 預覽版 V4 Flash-0731 增幅 DeepSWE(軟體工程) 7.3 54.4 +7.5 倍 Terminal-Bench 2.1(終端操作) — 82.7 逼近 Claude Opus 4.8 的 85 CyberGym(網路安全攻防) — 76.7 較預覽版翻倍 Toolathlon Verified(工具呼叫) — 70.3 — DSBench-FullStack(全棧開發) — 68.7 — 換句話說,一個定價只有 Opus 幾十分之一的模型,在「寫程式、跑命令、調 API」這類 Agent 核心任務上,已經逼近了被公認最強的閉源模型。 ...

Qwen3.8-Max 開源了,但真正有意思的不在數字

八月初,阿里 Qwen 團隊放了一顆炸彈。Qwen3.8-Max,2.4 兆引數的 MoE 架構,950 億活躍引數每 token,一百萬 token 上下文。 headline 讀起來像科技新聞——數字很大,但真正有意思的不是數字本身,而是這代產品定位的微妙轉變。 Qwen3.8-Max 不再只是一個「會寫程式的聊天機器人」。它的核心定位是 cowork——一個能在長週期任務中自主執行、自我修正、最終交付可運作成果的 agent。聽起來像行銷話術,但這次拿出來的案例確實有東西可看。 從「回答問題」到「完成任務」 過去一年,我們已經見識過不少 AI coding agent 的演示:寫一段程式碼、修一個 bug,或者生成一個小工具。這些展示都很好看,但現實中的工作往往比這複雜得多。 Qwen3.8-Max 的三個自主任務案例把門檻拉高了。第一個是讓模型從零開始建立一個叫 oh-my-cli 的 CLI 框架,完全自主運作超過十天。到七月三十日為止,這個專案累積了 265 個 commit、127 個 pull request 和 151 個 issue。模型自己把使用者回饋轉成 issue、分配給 agent、跑測試、修 bug,形成一個自我進化的迴圈。 第二個案例更誇張:給它一篇研究論文的連結和 GPU 資源,讓它自己重現實驗然後做得更好。模型花了大約五天、寫了七千六百行程式碼、跑了三十三輪 GPU 訓練,最後在 AIME24 數學基準上比原論文的方法又提升了 2.7 分。這不是寫一篇漂亮的分析報告,而是真正產出可執行的程式碼、訓練模型、驗證結果。 第三個案例是讓模型參加一個真實的競賽——天貓平臺的多模態對話意圖識別挑戰,526 個真人團隊競爭。模型在二十四小時內自己讀規則、寫程式、微調 BERT 和 RoBERTa 語言模型、結合視覺模型做整合,最後以 0.853 的準確率擊敗了 458 個團隊,排在第八十七名。 這些案例的共通點是:模型不是在回答一個明確的問題,而是在一個開放目標下持續運作、自我修正、最終交付成果。這跟過去我們對 LLM 的想像不太一樣。 Benchmark:看著好看,但別全信 Qwen 隨發布公佈了完整的基準分數表,涵蓋編碼代理、通用代理和一般能力三大類。不過這些分數全部是阿里內部跑出來的結果,沒有第三方獨立驗證。 Terminal-Bench 2.1 拿到 86.6,超過了 Claude Opus 4.8 和 Fable 5 的 84.6,但低於 GPT-5.6 Sol 的 88.8。PaperBench 拿到 93.0,超越所有對手。GPQA Diamond 是 92.6,跟上一代 Qwen3.7-Max 的 92.4 幾乎一樣,成長幅度不大。 ...

在 $2,000 的 APU 上跑 284B MoE:DeepSeek V4 Flash 本地部署實測

今年七月,Lucebox 團隊在 AMD Ryzen AI MAX+ 395 (內部代號 Strix Halo)這顆消費級 APU 上跑起了 DeepSeek V4 Flash——一個總引數 284B、每 token 僅啟用約 13B 的 MoE 大模型。測試結果已提交至 LocalMaxxing 排行榜,在 Ryzen AI Max 395 硬體組別中排名第一。 沒有獨立顯示卡、不依賴雲端推理服務,純靠 CPU 與 Radeon 8060S GPU 共用的 128 GB LPDDR5X 記憶體,decode 速度最高跑到 32.0 tok/s(greedy decode, temperature=0)。這個數字在 LocalMaxxing 的 Strix Halo 排行榜上是第一名——第二名是 HipFire 引擎的 18.99 tok/s,Lucebox 快了約 68.5%。 ROCmFPX:把 284B 塞進 128 GB RAM DeepSeek V4 Flash 原始權重用 FP16 算約 568 GB(284B × 2 bytes),即便是 Q4_K_M 量化也要近 174 GB。一般消費級電腦根本沒地方放。Lucebox 的解法是用自訂的 ROCmFPX 混合精度量化格式,把整體位元率壓到平均 2.88 bits/parameter,最終模型檔案只剩 102.3 GB(約 95.3 GiB)。 ...

Kimi K3 開放權重:2.8 TB 的邊界智慧,用 80 張 RTX 5090 把完整的 K3 跑起來

前言 7 月 26 日,Moonshot AI 把他們最強的 Kimi K3 模型以完整權重開放。不是剪枝版、不是蒸餾版、也不是 API-only——整整 2.8 TB MoE 架構,附帶 MXFP4 原生量化和技術報告一併公開。 研究團隊 totheagi 在 X 上發文,說他們用 80 張 RTX 5090 就把完整的 K3 跑起來了,單串流每秒 20 token,還沒調過超引數。沒有 HBM,只有 GDDR7 消費級視訊記憶體、普通乙太網路線和官方 MXFP4 權重。 「地球上最強開源模型,跑在地球上最 abundant 的 GPU 上。」這句話聽起來像行銷口號,但背後的技術細節值得拆解。 Kimi K3 是什麼? Kimi K3 是 Moonshot AI 於 2026 年 7 月 16 日透過 API 率先發布的旗艦模型(ID:kimi-k3),7 月 26 日開放完整權重下載。它是目前世界上最大的開源 3T 級別模型,引數規模達 2.8 TB。 K3 建立在兩個核心創新上:**Kimi Delta Attention(KDA)**與 Attention Residuals(AttnRes)。KDA 提供高效的可擴充套件注意力機制;AttnRes 在網路深度中選擇性地檢索表示,而不是均勻累加。兩者結合起來專為突破兆引數界線而設計。 ...

Google vs. SerpApi DMCA 爬蟲戰爭

2026年7月20日,北加州聯邦地區法院做了一個對整個開放網路都意義重大的裁決——全面駁回 Google 對爬蟲公司 SerpApi 的 DMCA 訴訟。這是近年來平臺嘗試用版權法打壓網頁爬蟲的最大敗仗之一。 簡單說:Google 開發了一套反爬蟲系統 SearchGuard,然後告訴法院「別人繞過它去抓搜尋結果,就是侵犯 DMCA 版權」。法官聽完笑了——SearchGuard 防的是爬蟲,不是版權;而且你抓到的東西根本不受版權保護。 這個案子不只是 SerpApi 的勝利,更是對「公開網路重新圈地」趨勢的一次重要攔截。 Google 為什麼選擇 DMCA? 要理解這場戰爭,得先搞清楚平臺在訴訟策略上的困境演變。 2022年第九巡迴上訴法院在 hiQ v. LinkedIn 案中確立了一個對爬蟲友善的先例:爬取公開網頁不違反 CFAA(電腦詐欺與濫用法)。這讓 Google 的訴訟工具箱少了一把利器。版權侵權?搜尋結果主要是事實性內容,通常屬於第三方。違約之訴?州法契約爭議,執行力弱、補償有限。 DMCA §1201 成了最佳選擇。它是聯邦法,有法定損害賠償,而且不需要證明特定作品的侵權——只要證明別人「繞過技術保護措施」就行。 Google 的戰略很明確:把反爬蟲系統重新定義為 DMCA 意義下的「版權存取控制措施」。若成功,任何網站的反爬蟲機制都能成為聯邦版權法下的鎖,爬蟲等於破鎖。這將徹底改變網路的開放性。 SearchGuard 到底是什麼? 事情從 2025年1月說起。Google 在那時開發並部署了 SearchGuard——一套基於 JavaScript Challenge 的反爬蟲系統。它的運作方式不複雜:當瀏覽器或爬蟲存取 Google 搜尋結果時,SearchGuard 會要求執行一段 JS 程式碼來驗證「你是真人」。沒透過的請求會被擋下。 同年9月,Google 開始收緊手腳。它取消了長期支援的 num=100 SERP 引數(一次回傳一百筆結果),SEO 工具的成本暴增十倍。月底更限制 SerpApi 的 Light Fast API 僅回傳前三筆結果,DataForSEO 甚至連八零%成本的方案都在五天內被識別並封殺。 SerpApi 當時已經在 Google 搜尋結果上運作多年,它的商業模式就是幫開發者繞過 SearchGuard,把結構化的搜尋資料透過 API 賣出去。客戶包括 Nvidia、Uber、Adobe 等科技巨頭。SearchGuard 一收緊,SerpApi 的營運成本直接暴漲。 ...

OpenConnector 讓 AI Agent 一次連線、 everywhere 使用

前陣子幫團隊搭一個內嵌式 AI Agent,最頭痛的不是模型選型或 prompt engineering,而是「Agent 要怎麼連使用者的 Gmail、GitHub、Notion」。傳統做法是讓使用者在 App 裡填 API Key,或者走一輪 OAuth2 流程,把 token 存在自己的資料庫。每加一個服務提供者,就要多寫一套認證邏輯、token 重新整理機制、許可權管理。做三個服務還勉強撐得住,做到十個以上就是維護噩夢。 OpenConnector 解決的就是這個問題。它是一套開源的「聯結器閘道」,定位跟 Composio 類似,但走的路線不太一樣——憑證、許可權範圍、執行記錄全都留在閘道層,Agent 只拿到中繼資料和結果,不用碰金鑰。 它到底在做什麼 OpenConnector 讓你「連一次帳號,就能讓 Agent 隨處使用」。 你部署一臺 OpenConnector Gateway(跑在本機 Docker、Fly.io、Cloudflare Workers,或者直接上 OOMOL SaaS),然後在儀錶板裡把 Gmail、GitHub、Slack 這些服務一一連線。之後你的 Agent 透過 SDK、CLI、MCP 或 HTTP API 呼叫 Action,閘道自動處理憑證注入、token 重新整理、許可權檢查,最後回傳結果。 Agent 永遠不知道 OAuth token 長什麼樣子。金鑰只存在閘道內。 Agent 和使用者應用程式之間多了一層「憑證邊界」。這在 SaaS 產品裡特別好用——不用把每個使用者的 API Key 存在自己的資料庫,也不用擔心 token 過期時 Agent 卡住。閘道自動處理 refresh token、重新授權。 部署選項 OpenConnector 有四條路可以走。 最輕量的是跑在本機 Docker 上。docker compose up 一行指令就起來了,儀錶板在 localhost:3000,MCP endpoint 也在同一個 port。適合開發階段或內部工具用。 ...

阿里 Qwen3-Max Preview 登場 2.4 兆引數首創多模態但 benchmarks 在哪裡

阿里巴巴在 2026 年 7 月 19 日的 Shanghai WAIC(世界人工智慧大會)上,正式揭開了 Qwen3-Max Preview 的面紗。這個被社群廣泛稱為 Qwen3.8-Max-Preview 的模型擁有 2.4 兆引數,採用稀疏混合專家(MoE)架構,是 Qwen 系列首款突破一兆引數門檻且具備原生多模態輸入能力的旗艦——文字、圖片、影片、檔案都能在同一個模型內處理。 阿里把它定位在「僅次於 Fable 5」。問題是:這個說法站得住嗎?下面的內容整理了多個獨立來源,拆解它的規格、能力、定價,還有對開發者可能造成的影響。 基本規格速覽 專案 規格 發布日期 2026 年 7 月 19 日(Preview) 總引數 2.4 兆(sparse MoE,活躍引數未公佈) 上下文視窗 100 萬 token 多模態支援 文字、圖片、影片、檔案輸入 思考模式 Thinking Mode + Function Calling + Built-in Tools API 相容性 OpenAI & Anthropic Messages API 目前可用性 Token Plan、Qoder、QoderWork(阿里自有平臺) 開放權重 「即將推出」,無具體日期或授權條款 發布背景:為什麼是現在? 這個發布時機選得有意思。Kimi K3(2.8T)7/16 才出,Grok 4.5 和 GPT-5.6 Sol 分別是 7/8 和 7/9。Qwen3-Max Preview 卡在 Fable 5 促銷期結束的同一天亮相——開發者正在換模型的時候推新東西,時機抓得準。另外,中國監管機構 7/15 批准了 Apple–Alibaba Qwen 整合案,那時候 Qwen 的關注度本來就高。 ...