AI Daily Digest

📰 每日 AI 彙整

2026-06-29  ·  共 5 則報導
T1 爆炸重要T2 值得關注T3 一般資訊T4 參考用T5 可略過
T2
T2
後訓練崛起:小模型撼動大模型

這篇文章探討一個正在發生的趨勢:用「後訓練」(Post-Training,也就是在已經訓練好的 AI 模型基礎上,再用特定領域的資料進行額外訓練)來打造比大型商業 AI 模型更適合特定任務的小型模型。過去的觀念是模型越大越強,但現在愈來愈多案例顯示,針對特定用途(例如寫程式、做搜尋)做後訓練的小模型,可以在該領域超越通用的大型商業模型。文章以 Cursor 程式碼編輯器的事件為核心案例——Cursor 承認他們的模型是以開源模型 Kimi K2.5 為基礎,但投入了四分之三的運算資源自行後訓練,最終打造出比直接呼叫大型 API(如 GPT-4)更划算的程式碼專用 AI。文章也介紹了幾種主流後訓練方法:DPO(直接從「哪個回答較好」的配對資料學習,不用另外訓練評分模型)、ORPO(把基礎訓練和偏好最佳化合而為一,適合小量資料)、KTO(只需要「好」或「不好」的簡單回饋,容易收集),以及更進階的 PARL(讓多個 AI agent 協同合作的強化學習框架)。來自 Google 的開源模型 Gemma 系列搭配 TraceGen 工具(從大模型萃取思考過程來訓練小模型),被社群視為入門後訓練的最佳起點。

想像你經營一家電商客服團隊,每天要回覆數千則退貨詢問。典型的做法是花錢買 OpenAI 或 Claude 的 API 用量——每次回覆都要付費,且通用模型不一定懂你的退貨政策細節。另一條路線是:下載開源的 Gemma 3 4B 模型(一個 40 億參數的小模型,檔案大小約 8GB,一般筆電就能跑),蒐集過去一年你公司所有的客服對話(哪種狀況可以退、哪種不行),用 DPO 技術教這個小模型「正確的回覆長這樣、不好的回覆長那樣」。訓練完成後,這個 4B 小模型在處理你的退貨詢問時,回答品質可以接近甚至超越大型商業模型,但每次查詢成本從幾角錢降到幾乎零(因為它可以在你自己的伺服器上執行)。對比舊做法:用大模型 API 每個月可能要花數萬元的 API 費用,而後訓練小模型只需要一次性的訓練成本和後續極低的運算成本。前提是你必須有明確的任務範圍和足夠的歷史對話資料。

T3
T3
Codex 敏感檔案過濾功能卡關

OpenAI Codex 是一款 AI 程式碼輔助工具(類似 GitHub Copilot,開發者寫程式時它會自動建議程式碼,也能直接跟它對話修改程式),但長期以來缺乏一個關鍵安全功能:讓使用者可以指定哪些檔案「絕對不能」被讀取或傳送給 AI。目前已經有 GitHub issue(功能建議討論串)提出要在 Codex 中加入類似 `.gitignore` 的排除機制,例如在專案裡放一份 `.codexignore` 設定檔,明確寫出 `.env`(環境變數檔,常含 API 金鑰和密碼)、`*.pem`(私鑰憑證檔案)、`.ssh/`(SSH 連線金鑰目錄)等敏感路徑,讓 Codex 繞過這些檔案。這個 issue 從 2025 年 8 月開到現在已近一年,雖然在 Hacker News(開發者社群論壇)獲得 213 分推和 134 則討論,但 OpenAI 至今未分配開發人員,也沒有具體進度,讓不少開發者感到憂心。

假設你是一個使用 Codex 的全端工程師,負責一個電商網站專案。專案裡有一個 `.env` 檔案存放資料庫密碼、第三方 API 金鑰、Stripe 付款金鑰等敏感資訊。你叫 Codex 幫忙修改某個金流模組的程式碼,它掃描整個專案資料夾時,連 `.env` 的內容一併讀取並送到 OpenAI 伺服器做分析——這等於把金鑰直接交給外部 AI 系統。現在的做法:你只能靠「自己記得不要把敏感資料夾放進專案」或「每次手動提醒 Codex 避開某資料夾」,但遲早會出包。如果 `.codexignore` 功能上線,你只需在專案根目錄寫一行 `.env`,Codex 就永遠不會讀取或傳送那個檔案,等同把你的帳號密碼鎖在保險箱裡,AI 根本看不見它。

T3
96GB 改裝 GPU 全是騙局

這篇文章揭露市面上標榜「96GB 記憶體升級版」的 RTX 4090 和 RTX 5090 顯示卡(顯示卡,就是電腦裡負責畫圖和運算的零件),絕大多數都是詐騙。作者是一位實際做過這類改裝的專家,他解釋為什麼 96GB 版本在物理上根本不可能存在——因為現有的記憶體晶片(GDDR6X,一種高速記憶體規格)每顆最大隻有 2GB,要把 RTX 4090 從原本的 24GB 擴充到 96GB,需要每顆 4GB 的晶片,但市面上根本沒有這種產品。即使退而求其次的 48GB 改裝版真的做出來了,對跑 AI 模型(像是你在本地電腦自己跑 ChatGPT 那種模型)的速度也完全沒有幫助,因為 AI 生成文字的速度取決於記憶體頻寬(記憶體讀寫資料的速率,類似水管粗細),而非記憶體容量。此外,改裝卡的故障率高達 15% 到 20%,而且沒有原廠保固,壞了就完全報廢。文章也提供了用 GPU-Z 和 HWiNFO 等免費工具驗證顯示卡真偽的具體方法。

假設你想買一張顯示卡來在家裡跑一個需要 70GB 記憶體的 AI 模型(大約是 GPT-3 等級的開源模型,像 Llama 3 70B)。你在拍賣網站上看到一張號稱「48GB 升級版 RTX 4090」只賣 2,500 美元,比正規管道便宜很多。你買來後,用 GPU-Z(一個免費的硬體檢測軟體)查看,發現 BIOS 版本格式不對、記憶體通道數顯示 24 而非原廠的 12。你再用 llama.cpp(一個在本地跑 AI 模型的工具)載入一個 34B Q4 模型測試,發現它能載入的模型確實比原廠 24GB 大,但每秒產生的文字數量和原廠 4090 一模一樣——因為記憶體頻寬完全沒變。更糟的是,高負載跑了 20 分鐘後電腦直接當機。回頭找賣家,對方已經消失。相較之下,你如果買兩張二手 RTX 3090(約 1,600 到 1,800 美元)加上 NVLink(一種讓兩張顯示卡協同工作的連接器),總共 48GB 記憶體、有原廠保固、總花費更低,而且每張卡壞了還可以單獨送修。

T3
半數用戶認AI已能處理一半工作量

Anthropic(開發 Claude 這款對話 AI 的公司)在 2026 年 6 月公佈了一份針對約 9,700 名 Claude 使用者的調查報告。結果顯示大約一半的受訪者認為,AI 已經能夠處理他們工作中 50% 以上的任務內容——其中有 33% 的人估計落在 30% 到 60% 之間,14% 的人認為達到 60% 到 90%,甚至有 4% 的人覺得 Claude 幾乎能完成整份工作。調查也發現,使用率最高的三種工作類型是資料庫查詢(82% 的人用)、部落格或文章寫作(81%),以及行銷內容產出(80%)。值得注意的是,把愈多工作交給 AI 的人,對自己未來的薪資和技能價值反而愈樂觀,這和一般大眾擔心 AI 會取代工作的普遍憂慮不太一樣。

舉資料庫查詢為例——假設你是一位市場分析師,以前要從公司資料庫撈出「過去三個月、北部地區、購買金額超過五千元的客戶名單」,你得先學會 SQL(一種專門用來跟資料庫溝通的程式語言),自己寫查詢指令、執行、然後等結果。現在你用 Claude,只要用白話中文描述「幫我查出過去三個月北部地區消費超過五千元的客戶」,AI 就會自動幫你生成 SQL 指令、執行查詢,並把結果整理成表格。根據調查,82% 的使用者已經在用 AI 做這類工作;對比舊做法,你不必再花時間學 SQL 語法或自己除錯,原本可能要 30 分鐘的查詢工作在 5 分鐘內就能完成。

T3
audio.cpp 整合 14 種音訊模型效能翻倍

audio.cpp 是一個完全用 C++ 程式語言寫成的音訊 AI 引擎,能讓你的電腦直接在本地執行各種語音相關的人工智慧模型。所謂的「語音 AI 模型」包含文字轉語音(TTS,就是把文字唸出來的功能)、語音辨識(聽聲音轉成文字)、以及說話者分離(在多人對話中自動分出誰在說話)等功能。這個專案受到 llama.cpp 的啟發——llama.cpp 讓大型語言模型(LLM,像 ChatGPT 這種會對話的 AI)脫離了需要大量 Python 套件的複雜環境,而 audio.cpp 對音訊模型做了同樣的事情,讓它們只需要 C++ 就能直接執行。它目前支援 14 種不同的音訊模型,在 NVIDIA 顯示卡上(透過 CUDA,一種 GPU 加速技術),文字轉語音的速度可以比 Python 版本快最高 5 倍,長文本生成甚至可達即時播放速度的 50 倍以上。

假設你正在開發一個客服語音機器人,需要把系統回覆的文字轉成語音播給客戶聽。傳統作法需要安裝 Python 和 PyTorch(一個深度學習框架)、TTS 函式庫等一堆套件,每次啟動模型要等 5-10 秒載入,在 GPU 上生成 10 秒語音大約需要 300 毫秒。改用 audio.cpp 後,你只需下載一個編譯好的執行檔,用一行指令啟動 REST API 伺服器(一種讓不同程式可以透過網路互相溝通的方式),任何語言寫的應用程式(Go、Rust、Node.js 等)都可以直接透過網路請求來呼叫語音生成功能。在同樣的 GPU 硬體上,生成同樣一段 10 秒語音只需要約 60 毫秒,速度快了 5 倍。你可以選擇不同的模型——PocketTTS 適合輕量快速、Qwen3-TTS 支援 10 國語言、OmniVoice 甚至支援 646 種語言——按需求切換,完全不需要改寫程式碼。如果你的應用需要同時服務大量使用者,這 5 倍加速意味著你可以用更少的機器硬體,或是讓更多使用者同時享有即時語音服務。