ClaviSay:從真實網頁閱讀中學習英語的 AI 助手

前言:你也有這個經驗嗎? 每天讀英文技術文件、論文、產品說明,遇到不認識的字就查一下、複製到筆記本、隔天就忘。 這大概是所有科技從業人員的共同痛點:「查過的字,為什麼還是記不住?」 傳統背詞 App(像是 Anki、Quizlet)的問題在於,它們把單字從原文中抽離出來,變成孤立的卡片。你背了「ubiquitous」,但下次在文章看到它,還是不知道作者到底在表達什麼語氣、什麼語境。 今天要介紹的 ClaviSay,就是為了解決這個「閱讀—理解—保存—複習」斷裂的問題而生的。 - 廣告 - ClaviSay 是什麼? ClaviSay 是一個 AI 驅動的語言學習平台,核心概念非常直白:「從你每天已經在讀的內容中學習語言。」 它不是另一個背單字 App,而是一套「學習工作流」——涵蓋瀏覽器擴充功能、Web 端工作台、iOS 和 Android App,支援 PDF、網頁文章、影片字幕、工作郵件等多種格式。 簡單來說,你讀什麼,它就幫你學什麼。 核心功能拆解 1. AI 雙語閱讀模式 這是 ClaviSay 最直覺的功能。安裝瀏覽器擴充功能後,開啟任何英文網頁,它可以即時生成雙語對照視圖——原文和翻譯並排顯示,同時保留原始文件的排版結構。 很多翻譯工具(像是 Google Translate 的網頁翻譯)會直接替換原文,導致你忘記原始用詞。ClaviSay 的雙語模式讓你可以隨時切換回原文,不會「讀著讀著就忘了原本寫什麼」。 2. 一鍵保存生詞與上下文 看到不認識的字?不需要複製貼上到別處。直接在原文上選取,ClaviSay 會: 提供即時翻譯 給出基於當前段落的 AI 語境解釋(不只是字典定義,而是這個字在這句話裡的語氣、用法) 一鍵保存到個人詞庫 這個「語境解釋」功能很關鍵。同樣一個字,在技術文件裡和在小說裡的用法可能完全不同。ClaviSay 的 AI 會根據你正在讀的段落來給出解釋,而不是丟給你一個萬能定義。 ...

OpenAI GPT-5.6 正式登場:Sol、Terra、Luna 三模型家族全面解析,AI 戰局再度洗牌

最近 AI 圈最夯的消息,絕對非 OpenAI 在 6 月底發布的 GPT-5.6 系列莫屬。如果你還沒跟上進度,這篇就是為你準備的——我會用盡量淺白的語言,帶你一次搞懂這個新家族到底強在哪、該選哪一款、以及它對你我這樣的日常使用者有什麼實際影響。 先講重點:GPT-5.6 不是「又一個新版本」,而是 OpenAI 有史以來第一次正式從「單一模型」轉向「多層能力家族」策略。這意味著什麼?簡單說,以後 OpenAI 不再只推一個「最強的」,而是根據你的需求,提供不同層級的模型選擇。 三劍合璧:Sol、Terra、Luna 各有所長 GPT-5.6 系列一次推出三款模型,名字分別取自拉丁文的太陽(Sol)、地球(Terra)和月亮(Luna)。這不是單純的行銷包裝,每個型號都有明確的定位: Sol(太陽)—— 旗艦級戰力 Sol 是整個系列中最強大的模型,專為極度複雜的「自主代理工作」(Agentic Work)設計。你可以把它想像成團隊裡的「首席工程師」——遇到需要多步驟推理、跨工具調用、長期記憶追蹤的任務時,Sol 能可靠地完成。在 Terminal-Bench 2.1(一個測試 AI 寫程式能力的基準)中,Sol 在 Ultra 模式下取得了 91.9% 的 SOTA 分數,超越了 Anthropic 的 Claude Fable 5(88.0%)。 Terra(地球)—— 日常工作的最佳拍檔 Terra 的定位很聰明:它的性能跟上一代的 GPT-5.5 差不多,但運行成本直接砍半。如果你不是每天都要跑超複雜的代理任務,Terra 就是性價比之王。對於企業 API 調用來說,這意味著同樣的預算可以跑兩倍的量。 Luna(月亮)—— 快速又便宜的效率機器 Luna 主打極致低成本和高速度,適合大規模重複性任務。想像一下你需要處理成千上萬筆資料分類、簡短回答生成、或批量文本處理——Luna 就是那個默默把活幹完、還不會讓你心疼帳單的角色。 定價策略:從 $1 到 $30,總有一款適合你 OpenAI 這次採用了非常明確的分級定價(每百萬 Token): 模型 輸入價格 輸出價格 Sol $5.00 $30.00 Terra $2.50 $15.00 Luna $1.00 $6.00 作為對比,Anthropic 的 Claude Fable 5 定價是 $10 輸入 / $50 輸出。也就是說,同樣的預算,用 GPT-5.6 系列可以跑大約兩倍的量。這在商業應用上是非常具侵略性的定價策略。 ...

OpenCode Go 接入 Claude Code 完全指南:省錢、避坑、實測體驗

前言 如果你最近有在用 Claude Code,但每個月訂閱費讓你肉痛,或者你只是想在 Claude Code 的新功能上實驗看看,又不想花 Opus 的錢——那麼這篇文章就是為你準備的。 OpenCode Go 是 OpenCode 平台提供的付費 API 服務,支援超過 75 個 LLM 供應商。它的亮點之一是:部分模型支援 Anthropic 的 Messages API(/v1/messages),這意味著你可以把它接上 Claude Code,用更低的成本體驗 Claude Code 的完整功能。 本文綜合了多篇實測文章與社群經驗,整理出一份完整的入門指南,包含模型選擇、設定檔撰寫、兩個經典坑位,以及除錯技巧。 - 廣告 - 什麼是 OpenCode Go? OpenCode 是一個開源(MIT 授權)的 AI 程式碼代理(Coding Agent),可以在終端機、桌面應用或 IDE(VS Code / Cursor)中使用。它與 Claude Code 最大的不同在於模型無關——Claude Code 綁定 Anthropic,而 OpenCode 可以接 75+ 個後端。 ...

Qwen 3.6 27B 在 Agentic Work 崩潰?一文搞懂原因與完整修復指南

前言:當「單次提示完美」遇上「多輪對話崩潰」 最近 r/LocalLLaMA 上有一篇帖子引發了廣泛共鳴——一位使用者在 RTX 6000 上跑 Qwen 3.6 27B,發現它在單一提示(single prompt)下表現驚人,能輸出漂亮的 HTML 頁面、生成长內容;但一旦進入 Agentic Work(多輪工具呼叫代理工作),每四輪左右就會出現一次「完全腦死」的行為:亂改檔案、跳錯路徑、重複走相同流程…… 「它在單次提示下很優秀,但在 agentic work 中絕對崩潰。每隔幾輪就做一件完全腦殘的事。」 這篇文章的討論串長達數百則回覆,匯聚了數十位在地端部署 Qwen 系列模型的實戰經驗者。今天我們就來系統性地整理:Qwen 3.6 27B 在 Agentic Work 中為什麼會崩潰?核心原因是什麼?又該如何修復? - 廣告 - 一、問題全貌:什麼叫「四輪腦死」? 根據原始帖者的描述,典型的崩潰行為包括: 症狀 具體表現 工具呼叫失敗 多工具呼叫時產生 malformed JSON,污染後續 context 思考區塊洩漏 </think> tag 遺失,導致 reasoning block 跨輪堆積 路徑跳躍 突然 cd / 到根目錄、讀取不存在的 .tokenring/linters/ 路徑 內容覆蓋錯誤 無視指導原則,直接覆寫既有文件 循環執行的 重複走相同決策路徑,無法自我修正 最關鍵的觀察是:這些問題不是隨機的,而是系統性的。 一位 vLLM 開發者指出:「每當模型有自由選擇工具/格式/參數的機會,就等於多擲一次骰子;8-12 輪之後,你幾乎保證會遇到一次壞結果。」 ...

小米 MiMo-V2.5-ASR 開源語音辨識模型:方言、噪音、多語切換全搞定

前言 前陣子收到小米 MiMo Open Platform 的 Email 通知,說他們的語音辨識模型 MiMo-V2.5-ASR 正式上線了。身為一個對語音辨識技術一直有觀察的人,這下忍不住去挖了更多資料。 簡單來說,小米這次推出的不是一個「乾淨環境下跑分漂亮」的模型,而是專門為真實世界複雜聲學場景設計的語音辨識引擎。支援粵語、閩南語、四川話等方言,還能處理中英混說、歌詞辨識、多人對話交疊等高難度場景。 這篇就來好好聊聊這個模型到底強在哪裡,以及它跟目前主流方案(特別是 OpenAI Whisper)的比較。 - 廣告 - 什麼是 MiMo-V2.5-ASR? MiMo-V2.5-ASR 是小米 MiMo 團隊開發的端到端自動語音辨識(ASR)模型,屬於小米完整語音模型系列(ASR → TTS → 多模態)的「聽覺基礎層」。 這個模型的特色在於: 開源:權重放在 Hugging Face 和 ModelScope,GitHub 也有完整程式碼 多語言 + 多方言:中文、英文,加上粵語、吳語、閩南語、四川話、河南話、東北話、陝西話等 中英混說(Code-Switching):不需要預先設定語言標籤,模型自動判斷 知識感知:對古詩詞、專業術語、人名地名有特別強化 原生標點:直接從語調和語意輸出標點,不需要後處理 技術上,模型透過大規模中期訓練(mid-training)、高品質監督微調(SFT),以及一套新的強化學習演算法來達成這些能力。 跑分數據:跟 Whisper 比誰比較強? 小米在官方頁面上放了一組相當完整的 Benchmark 數據,以下整理幾個關鍵指標: 中文語音辨識(WER 越低越好) 模型 AiShell-2 Fleurs-Zh Wenet Meeting CommonVoice-Zh MiMo-V2.5-ASR 2.52 2.41 5.92 4.90 FunASR-1.5 2.57 2.75 5.95 4.57 英文語音辨識(Open ASR Leaderboard) 模型 平均 WER LS Clean SPGISpeech Tedlium MiMo-V2.5-ASR 5.73 1.45 1.85 2.4 Qwen3-ASR-1.7B 5.76 1.63 2.84 2.28 Whisper-large-v3 7.44 2.01 2.94 3.86 方言辨識 模型 CommonVoice-Taiwan WeNet-Wu Fleurs-Yue MiMo-V2.5-ASR 3.65 19.55 3.28 Qwen3-ASR-1.7B 3.7 24.29 3.53 從數據來看,幾個重點: ...

電視盒子改造(四):Android TV 變身輕量級家用 NAS 與檔案伺服器實作筆記

本筆記完整記錄如何利用 Onn 4k Android TV 電視盒子 搭配 Termux 與外接 128 GB USB 隨身碟,建置包含 SSH/SFTP、Filebrowser 網頁網碟與 Rclone WebDAV 的輕量級個人 NAS 系統。 其他電視盒子同樣適用下面方法 也可以插入大容量例如 2TB 或 4TB 的外接硬碟,但需注意外接硬碟需要額外供電。 一、 硬體準備與前期排查 1. 硬體連接 (OTG) Onn 4k 盒子僅有一個 Micro USB 供電孔。必須使用 OTG 供電分接線 (OTG Y-Cable) 或帶供電功能的 USB Hub,才能在為盒充分供電的同時,外接 USB 隨身碟。 2. 磁碟相容性關鍵(重要發現) ext4 格式:插入未 Root 的 Onn 盒子後,系統與第三方檔案管理員(如 CX 檔案總管)完全無法讀取。 NTFS 格式:CX 檔案總管可讀取(因自備驅動),但 Android 系統底層通常僅給予唯讀權限,Termux 無法寫入。 錯誤徵兆:若隨身碟插入電視盒子後,進入系統「儲存空間」僅顯示「USB 隨身碟」且只有**「退出」選項(無格式化選項),且 CX 檔案總管找不到,代表磁碟分割表格式不相容(通常為 GPT)**。 終極解法:必須將隨身碟重新做成 MBR (MS-DOS) 分割表 + exFAT 檔案系統。 二、 在電腦重做隨身碟 (MBR + exFAT) 根據讀者使用的作業系統不同,請選擇對應的格式化方法: ...

Gemma 4 × Cerebras 聯手打造即時語音 AI:從聊天機器人到會『聽』會『說』的對話體驗

前陣子 Google DeepMind 推出了全新世代的開源模型 Gemma 4,緊接著 Hugging Face 與 AI 晶片新貴 Cerebras 聯手,打造了一套完整的「即時語音 AI 對話管道」(Speech-to-Speech Pipeline)。這套系統不只是讓 AI 說話更快,而是徹底改變了人機對話的「節奏感」——從原本像聊天的「你一句、我停三秒」,變成了真正流暢的雙向交流。 這篇文章會帶大家深入理解這套架構的每個環節、Cerebras 晶片的硬體優勢,以及它對機器人、語音助手和未來 AI 產品的實際意義。 - 廣告 - 為什麼語音 AI 的「延遲」這麼重要? 想像一下這個場景:你跟 AI 助手對話,你說完「幫我查一下明天的天氣」,然後沉默了三秒鐘,AI 才開口回答。這不是什麼大事,但那種「跟軟體聊天」的割裂感會一直存在。 這就是目前語音 AI 最大的痛點——延遲(Latency)。 開發者在模型品質上已經取得了巨大進步,但使用者體驗往往被「回應速度」拖垮。更糟的是,很多系統雖然中位數延遲(Median Latency)看起來還不錯,但在第 95 百分位(P95)卻會出現數秒的延遲。當系統需要進行工具呼叫(Tool Call)或多輪對話時,這些延遲會疊加,讓對話變得更加斷斷續續。 對於機器人、語音助手和具身 AI(Embodied AI)來說,低延遲不是「加分項」,而是讓互動「感覺活過來」的關鍵。 「對機器人來說,聲音的 Responsiveness 不是裝飾品。它是讓互動感覺有生命力的東西。」 架構拆解:一套完全開源的「串聯式」語音管道 這次 Hugging Face 和 Cerebras 展示的核心成果,是一套 Speech-to-Speech Pipeline——從你的聲音輸入,到 AI 的聲音回應,全程不需要人工介入。整套架構採用「串聯式」(Cascaded)設計,每個組件都是模組化的、開源的,可以獨立替換。 ...

電視盒子改造(三):裝 Termux 讓盒子變身 SSH 與 SFTP 服務端

前言 接這篇 電視盒子改造(二):用 Tailscale 打造免費家用 IP 出口 後,接下來要讓它發揮更大作用——裝上 Termux,讓盒子同時變成一台 SSH 和 SFTP 伺服器。 什麼意思呢?簡單說,裝好之後你可以從電腦或手機用終端機直接連進電視盒子,像在 Linux 伺服器上一樣操作;也可以用 SFTP 客戶端(比如 FileZilla)直接拖曳檔案,把盒子外接的 USB 硬碟當成家用 NAS 用。 這系列改造的核心精神就一個字:榨。一台幾百塊的二手電視盒子,跑個 Android App 就能變身開發機、中繼站、檔案伺服器,CP 值高到我自己都覺得有點奢侈。 - 廣告 - 什麼是 Termux? Termux 是一個 Android 終端模擬器加 Linux 環境套件。裝好之後你在手機或電視盒子上就能跑 bash、裝 apt 套件、跑 Python、啟服務——基本上就是一台縮在 Android 底下的迷你 Linux 伺服器。 跟傳統 Android 的「Shell 應用程式」不同,Termux 有自己的套件庫(package repository),不依賴 root 權限,安裝的套件也只會存在 Termux 的目錄裡,不會跟系統其他 App 衝突。對電視盒子來說,這代表你不需要刷機、不需要 root,就能擁有一台真正的 Linux 環境。 ...

電視盒子改造(二):用 Tailscale 打造免費家用 IP 出口

前言 手上有台電視盒子,除了看影劇好像也沒什麼大用處?別急著吃灰——只要它能跑 Android App,就能化身成你的「家用流量出口」。 想像一下這些場景: 人在國外或大陸,手機 VPN 連回家裡,IP 瞬間變回台灣,串流、購物、銀行網站隨你刷。 家裡沒有公用 IP,但你想從外頭存取 NAS、Home Assistant 或任何內網設備。 出差在外,卻能像在家裡一樣上網,所有流量都從你家路由器出去。 這些都不需要花錢買 VPS,只要一台會連 Wi-Fi 的電視盒子,加上免費的 Tailscale 就好。 - 廣告 - 什麼是 Tailscale?為什麼推薦它? Tailscale 是一套基於 WireGuard 協議的零配置 VPN 解決方案。簡單來說,它能把分散在全球的裝置安全地串成一個虛擬區域網路(LAN),裝置之間就像在同一條網路線上一樣。 Tailscale 的幾個核心優勢 特點 說明 零配置 不需要手動設定 Port Forwarding、DDNS 或 DNS 記錄,點兩下就能連 免費個人版 支援最多 5 個使用者、無限制裝置數量,對個人用戶完全夠用 內建 NAT 穿透 即使兩端都在路由器後面,也能自動打洞建立直連(DERP 中繼備援) Exit Node 功能 可指定某台裝置作為流量出口,所有流量都從那台裝置出去 MagicDNS 內建 DNS 解析,可以用裝置名稱存取內網設備,不用記 IP 多平台支援 Windows、macOS、Linux、Android、iOS、路由器都有官方客戶端 免費版的限制對個人用戶來說幾乎可以忽略:最多 5 個使用者帳號、50 個 tagged resource、每月 1000 分鐘的臨時資源(Ephemeral Resources),這些數字對家庭使用來說綽綽有餘。 ...

用 ADB 工具管理你的 Android TV 盒子:從開啟開發者選項到遠端桌面

前言 家裡那台 Android TV 盒子,除了看串流影片,其實還有超多潛能等你發掘——但前提是,你得先有辦法「控制」它。 今天這篇文章,我會以我在用的 Onn 4K TV Box 為例,帶你從零開始設定 ADB 連線,學會最常用的幾條指令,最後還能用開源的 scrcpy 把電視盒子畫面直接投影到電腦上操控。全程不需要線材,WiFi 連過去就好。 不管你用的是 Google TV、Android TV,還是其他品牌的電視盒子,這篇文章的步驟幾乎都能套用。 第一步:開啟開發者選項與 USB 偵錯 Android TV 的開發者選項預設是隱藏的,而且介面跟手機不太一樣。以下是完整步驟: 打開電視盒子的 設定(Settings) 進入 裝置偏好設定(Device Preferences) 選擇 關於(About) 找到 版次(Build)這個項目,用遙控器 連續按 OK 鍵 7 次 畫面會提示「您已處於開發者模式」,恭喜,開發者選項已解鎖 接下來回到 裝置偏好設定,你會看到一個新的選項 開發者選項(Developer Options),點進去: 開啟 USB 偵錯(USB Debugging) - 廣告 - 小提醒: 這裡的「USB 偵錯」不只是給有線連接用的,開啟之後就能透過 WiFi 用 ADB 連線到盒子,這也是我們這篇文章的核心。 ...