AI Daily Digest

📰 每日 AI 彙整

2026-07-08  ·  共 38 則報導
T1 爆炸重要T2 值得關注T3 一般資訊T4 參考用T5 可略過
T2
T2
AutomationBench 代理評測 Fable 5 居冠

AutomationBench-AA 是由第三方機構 Artificial Analysis 推出的 AI 代理人(Agent,就是能夠自動串接軟體、執行工作任務的 AI 程式)獨立評測榜單,針對 Zapier 的自動化平臺進行測試。這次評測涵蓋 657 項任務與 40 個模擬的企業 SaaS(雲端訂閱軟體,例如 Gmail、Slack、Salesforce 這類)應用情境,同時評估模型能否達成指定目標、又有沒有違反業務規則(例如不該刪的資料絕對不能刪)。結果顯示 Claude Fable 5 以 48.6% 的成績微幅居冠,Opus 4.8 緊追在後(48.5%),Gemini 3.5 Flash(42.6%)與 GPT-5.5(42.1%)落後一截;開源模型(Open weights,指對外公開模型參數、可自行下載使用的 AI)差距明顯,最佳開源模型 GLM-5.2 僅達 27.8%。重要的是,所有模型都仍有違反業務規則的情況,顯示 AI 代理人目前可靠性仍不足。Artificial Analysis 同步推出六個產業專項指數(金融會計、法律、醫療、策略營運、工程、經濟),讓使用者可依自己的行業選出最適合的模型,而非只看單一綜合分數。

假設我想在公司導入 AI 自動化,讓代理人幫我串接 Gmail、Slack、Google Sheets,自動整理每天進來的客戶回覆並記錄到試算表。過去只能靠各廠商自己出題、自己公佈的測試數據,難以比較。現在透過 AutomationBench-AA 的第三方評測,可以發現 Gemini 3.5 Flash 雖然整體完成率偏低(42.6%),但在「每違反一次業務規則能完成多少目標」的效率比,以及單位成本表現上相當突出——換句話說,同樣的費用它能完成更多工作。如果我的場景預算有限、能容忍偶爾出現的規則失誤,選 Gemini 可能比 Claude Fable 5 更划算。對比舊做法:以前只能看廠商自己公佈的 benchmark(基準測試),現在有獨立榜單且按產業細分,更能找到真正適合自己業務場景的 AI 代理人,而不是隻追求排名第一的模型。

T2
MIRA 世界模型實現遊戲即時對戰

General Intuition、Kyutai 與 Epic Games 合作,推出了一款名為 MIRA 的「世界模型」(world model,就是讓 AI 學習並模擬整個環境的運作方式,不靠傳統的物理引擎或手寫規則)示範作品。MIRA 以《火箭聯盟》(Rocket League,一款讓玩家駕駛火箭動力車子踢足球的電競遊戲)為測試舞臺,訓練資料來自 1 萬小時的機器人對戰錄影,AI 從這些影片中學會了遊戲的「物理感」與「視覺呈現」。MIRA 能以每秒 20 幀的速度即時運行,且完全沒有寫任何物理運算或渲染程式——AI 自行從資料中「理解」了球如何彈跳、車子如何移動。最引人注目的是,一個 50 億參數(parameter,可以想成 AI 的「神經元數量」)的模型,就能在單張 NVIDIA B200 顯示卡上完整跑完一場 2 對 2 的多人對戰,被業界視為世界模型技術從純展示品邁向實際互動模擬器的重要里程碑。

假設一家遊戲公司想製作一款新的賽車遊戲。傳統做法是:程式師花幾個月手寫物理引擎(計算車輛碰撞、輪胎摩擦、空氣阻力),再請美術設計每一幀的視覺效果,耗時耗力。用 MIRA 這類世界模型技術,改做法是:餵給 AI 大量的遊戲對戰影片(例如 1 萬小時),AI 自己從影片中學出「當車子撞上牆壁時畫面會怎麼變」、「球從這個角度彈出去會飛到哪裡」。之後,不需要任何物理引擎程式,AI 就能即時生成符合邏輯的遊戲畫面,玩家實際操控時也能正常互動。舊做法需要大量工程師寫物理規則;新做法是 AI 看影片自學,開發成本與週期都大幅縮短,且未來可快速套用到其他遊戲類型。

T2
微軟 Copilot 改用自家模型降成本

微軟(就是開發 Windows 和 Office 的美國科技巨頭)正在把旗下 AI 助理產品 Copilot(整合在 Excel、Outlook 等辦公室軟體裡的 AI 功能)所使用的 AI 模型,從 OpenAI(開發 ChatGPT 的公司)和 Anthropic(開發 Claude 的公司)的商業模型,逐步換成微軟自家研發的 MAI(Microsoft AI)模型。目前每週已有數萬次用戶查詢在 MAI 模型上執行,顯示替換已悄悄進行中。微軟 AI 主管 Mustafa Suleyman 公開表示,目標是「最終消除」向外部 AI 供應商支付的授權費用。對 Copilot 訂閱用戶而言,這可能意味著花一樣的錢,卻只能得到能力較弱的 AI 服務。

假設你是上班族,每天在 Outlook 用 Copilot 自動摘要冗長信件,或在 Excel 用 Copilot 幫你撰寫複雜公式。過去這些請求背後調用的是 OpenAI 的 GPT 系列或 Anthropic 的 Claude——目前業界公認最強的商業 AI 模型。現在微軟正悄悄把引擎換成自家 MAI 模型:介面外觀完全一樣,但背後運算的模型已換人。若你向 Copilot 提出需要複雜推理的問題,得到的答案品質可能下滑,或需要更多來回對話才能完成同樣任務。舊做法是微軟按使用量付授權費給 OpenAI 和 Anthropic,再包進 Copilot 訂閱轉賣給企業用戶;新做法全改用自家模型,微軟省下這筆外部授權成本,但品質風險由用戶承擔。

T2
中國擬限制頂尖 AI 模型出口

中國當局正在考慮限制外國取用中國最強大的 AI 模型(就是像 ChatGPT 那樣的大型語言模型,能對話、寫作、分析資料),包括阿里巴巴的 Qwen、字節跳動的 Doubao,以及 Z.ai 的 GLM-5.2。這些模型過去以「開源」(免費公開給全世界下載使用)著稱,是許多開發者和企業替代昂貴美國 AI 服務的低成本選擇。中國商務部主導了與各大科技公司的討論,探討將高效能 AI 系統列入國家安全管制,無論是閉源(只開放 API 存取)還是開源模型都在考量範圍內。這代表美中兩個超強都已把 AI 視為國家戰略資產,而歐洲長期依賴廉價中國 AI 模型的捷徑,可能比預期更快消失。

假設你是一家歐洲的新創公司,過去選用阿里巴巴的 Qwen 開源模型來開發客戶服務機器人,一個月成本僅是使用 GPT-4o(OpenAI 的旗艦模型)的幾分之一——因為 Qwen 可以直接下載在自己伺服器上跑,不必按用量付費給美國大廠。一旦中國實施出口管制,你可能無法繼續更新或下載最新版模型,必須轉向 OpenAI、Anthropic 等更昂貴的美國供應商,或是等到 2027 年之後歐盟自建的 AI 基礎設施(EU InvestAI,歐盟計畫斥資 2,000 億歐元推動的 AI 投資計畫)才能上線。目前歐洲超過 80% 的數位產品和服務都依賴外部 AI 供應商,原本靠中國開源模型彌補自主能力缺口的策略,如今面臨提前失效的風險。

T2
中國 AI 代理安全部署國家標準

中國國家密碼標準委員會 TC260(專責制定中國網路資安相關標準的官方機構)發布了一份針對 AI 代理(AI agent,就是能自主執行任務、使用工具、保存記憶的 AI 系統,例如能幫你自動查資料、填表單、操作電腦的智慧助理)部署與使用的安全實踐指引。這份指引要求業者在正式上線前必須完成安全評估,在 AI 代理運作的整個生命週期中全程管控其操作權限,並完整保留稽核日誌(就是紀錄 AI 代理做了哪些動作的操作記錄)。當系統下線時,也必須依規範安全清除所有資料,避免資訊殘存洩漏。除此之外,中國另外頒布了針對「擬人化 AI 互動服務」(就是讓 AI 模仿真人角色、甚至對外聲稱自己是人類的服務類型)的臨時管理措施,將於 7 月 15 日正式生效,目前已有多個主要平臺提前調整甚至暫停特定功能以因應。

假設一間企業在中國開發了一套 AI 業務代理,能自動回覆客戶訊息、查詢訂單並更新系統資料。在過去沒有明確規範的狀況下,這個代理開發完成後就能直接上線。但在 TC260 新規下,業者上線前必須先完成安全評估(評估代理可能被惡意指令操控的風險);上線後要完整記錄代理每一步的操作(例如「12:03 查詢訂單 #12345」「12:04 修改收件地址」);並且只能給代理最低限度的必要系統權限,不能讓它任意存取不相關的資料庫。一旦服務停用,所有代理持有的資料必須依規安全刪除。這代表開發者從一開始就要把「可稽核性」和「最小權限原則」設計進系統架構,否則無法通過合規審查,也就無法在中國市場上線。

T3
T3
亞伯達省政府用 Claude 掃漏洞

加拿大亞伯達省政府自 2025 年起,開始使用 Claude Code(Anthropic 開發的 AI 程式碼助手,可以把它想成一個能讀懂、分析並修改程式碼的 AI 機器人)來強化政府資安防護。省政府技術與創新部的團隊,搭配 Claude 的 Opus 和 Sonnet 兩種模型(這是同一家 AI 公司提供的不同等級模型,就像手機有不同規格版本),在短短 20 小時內掃描了 4 億 6600 萬行程式碼,成功找出並修補多處安全漏洞,還順帶建立了新的資安防護工具。這個案例代表政府機構開始大規模採用生成式 AI(就是 ChatGPT、Claude 這類能生成文字與程式碼的 AI 技術),來應對日益複雜的網路資安威脅,不只是民間企業在用,連公部門也開始以 AI 當作核心防護手段。

亞伯達省政府面臨一個現實難題:政府系統龐大,程式碼量驚人,傳統做法是聘請資安顧問、逐段手動審查程式碼,這不只花費數個月時間,成本極高,而且人力有限,往往只能抽查部分系統、無法做到全面覆蓋。改用 Claude Code 之後,團隊把政府系統的程式碼輸入 AI 進行分析,AI 不是單純搜尋關鍵字,而是真正理解程式碼邏輯與執行流程,20 小時內掃遍 4 億 6600 萬行程式碼(相當於每秒分析約 6,500 行)。AI 找到漏洞後,還能直接給出修補建議,讓工程師加速完成修復,同時也協助團隊開發出新的自動化資安監測工具。比較下來:舊做法耗時數月、覆蓋率低、人力成本高;新做法一天完成全面掃描、補漏速度大幅提升、還衍生出可重複使用的資安工具,整體效益差距極為明顯。

T3
SkyPilot 整合 HF 零出口跨雲 AI 訓練

Hugging Face(全球最大的 AI 模型與資料集分享平臺)與 SkyPilot(一個讓你用同一份設定檔在 AWS、GCP、Azure 等各家雲端跑 AI 的工具)宣佈深度整合。核心功能是「零出口費用」——過去在 A 雲存資料、跑 B 雲的機器,光是把資料搬過去就要額外付一筆「出口費」,有時費用比算力還貴。現在透過 Hugging Face Buckets(HF 自己的雲端儲存空間),不管你在哪家雲端跑訓練或推論,都可以直接讀取模型和資料,不用搬資料、不用付出口費。掛載方式採用「懶加載」(lazy loading,就是你實際用到哪個部分才傳輸那個部分的資料,不是一口氣全部下載),速度快且省頻寬;儲存底層還有自動去重功能,意思是如果你的資料有很多重複區塊,只會儲存一份,大幅節省空間。

假設你想在多家雲端同時微調(fine-tune,就是用自己的資料對現有大型 AI 模型做客製化訓練)Qwen 3.5-4B 這個開源語言模型(Qwen 是阿里巴巴出的中英文 AI 模型系列)。舊做法:先把 4GB 模型檔案和你的訓練資料集分別上傳到 AWS S3 和 GCP Storage 各一份,每次傳資料要付出口費,儲存費也要付兩次。新做法:把模型和資料集放一份在 Hugging Face Buckets,在 sky launch 設定檔裡寫一行 source: hf://Qwen/Qwen3.5-4B,接著執行 sky launch qwen-sft.yaml --infra aws,SkyPilot 自動在 AWS 的 L40S GPU 機器上啟動訓練,模型約 30 秒內掛載完畢(懶加載,不用等全部下載);同一份設定換成 --infra gcp 就跑 GCP;每次儲存訓練檢查點(checkpoint,就是訓練途中的進度存檔)只上傳「有變動的區塊」,測試顯示 Parquet 資料表追加 10,000 筆資料只傳輸約 10 MB,而不是整個 106 MB 重新上傳。完全不用手動管跨雲憑證——一個 HF_TOKEN(Hugging Face 帳號的 API 金鑰)搞定所有雲端。

T3
AI 揪出 Cloudflare 密碼庫七個漏洞

zkSecurity 是一家專門做密碼學安全審計的公司,他們開發了一個叫 zkao 的 AI 審計代理(也就是一個會自動讀程式碼、找問題的 AI 機器人),並把它用來掃描 Cloudflare(全球知名的網路基礎設施公司)開源的密碼學函式庫 CIRCL(一套讓應用程式可以做加密、簽章等安全操作的程式工具集)。結果 AI 真的找到了七個真實存在的安全漏洞,這些漏洞全部都已經過人工驗證確認可利用,並依照負責任披露流程通報 Cloudflare。掃描使用了兩款 AI 模型:Claude Opus 4.6(Anthropic 出品)以及 GPT-5.3(OpenAI 出品),配合專家事先寫好的「技能提示」來強化找漏洞的能力。這次實驗展示了 AI 已經可以在正式的密碼學程式碼裡找到人類可能忽略的細微錯誤,為 AI 輔助資安審計開了一個重要先例。

七個漏洞中有一個特別值得舉例說明——BLS 聚合簽章(一種讓多人同時在同一份文件上聯合簽名的加密技術)缺少訊息去重複檢查。舊做法下,審計員必須手動逐行閱讀幾千行密碼學程式碼,找到這種邏輯缺陷可能要好幾天甚至幾週。AI 掃描則是這樣:zkao 搭配 Claude Opus 4.6 讀入 CIRCL 的 BLS 簽章程式碼,依照預先設定的「聚合簽章安全檢查清單」提示,直接指出「聚合時沒有先對訊息去重,攻擊者可以重複送入同一則訊息造成簽章驗證混淆」——這個問題若被惡意利用,理論上一個人就能偽造出看似合法的多人聯合簽章。AI 幾分鐘內標記出問題,人類再花幾小時驗證與撰寫報告,整體效率比純人工審計快了數十倍。

T3
Kokoro 本地 CPU 可跑高品質語音合成

Kokoro 是一個可以完全在個人電腦上運行的文字轉語音(TTS,就是讓電腦把文字念出來的技術)工具。它的 AI 模型只有 8,200 萬個參數(參數是 AI 模型學習到的知識量,數字越大通常需要越強的硬體),屬於非常輕量的設計,卻能產生逼真自然的語音。最大特點是不需要昂貴的 GPU(顯示卡,通常是跑 AI 必備的高效能硬體),只用一般電腦的 CPU(中央處理器,電腦的主要運算核心)就能完成語音合成。它支援英文、普通話、印度語等多種語言,並提供約 50 種不同聲音選擇。所有運算都在本機進行、不需要把資料傳送到雲端伺服器,能有效保護個人隱私。

假設我要為一個文章朗讀 App 加入語音功能,但不想依賴 Google 或 Amazon 的雲端 TTS API(因為有費用、有隱私疑慮,或需要穩定網路)。改用 Kokoro,只要執行一行指令:podman run -p 8880:8880 ghcr.io/remsky/kokoro-fastapi-cpu,下載約 5 GB 的容器映像後,即可在 localhost:8880/web 開啟網頁介面,直接輸入文字、選聲音、輸出音訊檔。實測結果顯示,2013 年出廠的老電腦 Intel Core i7-4770K 合成一段短文字只需約 4.7 秒,新款 AMD Ryzen 7 只需 1.5 秒,Apple M2 Pro 則約 4.5 秒。對比過去「要嘛付費用雲端 API、要嘛買 GPU 才能跑本地高品質 TTS」的兩難,Kokoro 讓任何一臺現代桌機或筆電都能離線合成出自然語音,不產生費用、不洩漏使用者資料。

T3
AI 代理讀寫 Word 文件效率倍增工具

docx-cli 是一個命令列工具(就是在黑色視窗打指令來操作的程式),專門讓 AI 代理人(agent,就是能自動執行任務的 AI 程式,例如 Claude Code、Codex)更有效率地讀取和編輯 Word 文件(.docx 格式)。這個工具的核心優勢是:AI 不需要自己去解析 Word 內部複雜的 XML 格式(一種程式碼格式,Word 文件底層就是用這個儲存內容),而是透過簡單指令直接操作,大幅減少 AI 需要處理的資料量。根據開發者做的受控對比測試,使用 docx-cli 讓 AI 完成文件任務的耗用 token(就是 AI 每次「看」或「生成」文字的計費單位,用愈多愈貴)減少了約 2.2 至 2.6 倍,速度也快了 1.7 至 2 倍。更關鍵的是,傳統方式讓 AI 直接改 Word 文件,大約每跑 36 次就有 5 次產生 Word 根本打不開的損壞檔案;而 docx-cli 生成的 36 份文件全數都能正常開啟。

假設我要讓 AI 代理人幫我填寫並批註一份 NDA(保密協議)合約的 Word 文件。用傳統方式,AI 必須直接讀取並修改文件的底層 XML 程式碼,就像叫人直接改網頁原始碼而不是使用 Word 介面來編輯——不但消耗大量 token,而且常常搞壞文件格式讓 Word 無法開啟。用 docx-cli,AI 只需執行簡單指令:先用 `docx read` 讀取合約內容,再用 `docx replace` 填入甲方乙方名稱、日期、適用州別等欄位,接著用 `docx track-changes` 開啟追蹤修訂,最後用 `docx comments add` 在有疑義的條款旁留下批註——人再於 Word 中點「接受」或「拒絕」審閱即可,格式和排版完全保留原樣。實測結果:使用便宜的 AI 模型(Haiku)時,docx-cli 能完成 6 個文件任務中的 4.3 個,傳統方式只完成 0.7 個(差距約 6 倍);換成更強的模型(Sonnet),docx-cli 達到 6/6 全數完成,傳統方式卻只有 4/6。

T3
終止 AI 推理重複迴圈

當 AI(人工智慧)在解題推理時,有時會卡在一個無限的重複迴圈裡——就像在同一個句子打轉,一直說「等等,讓我重新想想…等等,讓我重新想想…」直到把它的「記憶空間」(能處理的字數上限)全部耗光。Liquid AI 這篇文章提出了一個叫做「最終標記偏好優化」(FTPO,Final Token Preference Optimization)的新訓練方法——簡單說,就是在 AI 訓練過程中,精準找出它開始打轉的那個關鍵字,然後教它在那個節點選擇其他更有意義的詞彙繼續推理。這個方法基於一種叫 DPO(直接偏好優化,一種讓 AI 學會「哪個答案更好」的訓練技術)的演算法改進而來,並加入特殊的正則化機制避免破壞模型其他能力。實驗結果顯示,在一個叫 Qwen3.5-4B 的 AI 模型上,重複迴圈率從 22.9% 大幅降至 1%,整體回答品質也同步提升,且訓練成本相當低,程式碼已完整開源。

假設你使用一個小型推理 AI 模型(例如只有幾十億參數的輕量模型)解數學題:「請證明質數有無限多個。」AI 開始推理後陷入重複迴圈:「等等,讓我再想一下。等等,讓我再想一下。等等,讓我再想一下……」把幾千字的空間全部耗盡,最終沒給出任何答案。這就是所謂的「末日迴圈」(doom loop)。使用 FTPO 方法對同一模型進行後訓練(post-training,就是在已訓練好的模型上再做針對性微調)後,AI 在偵測到自己快要打轉的那個瞬間,會自動轉向改用不同詞句繼續推理,最終給出完整的數學證明。相比舊做法(靠調整生成溫度或設定重複懲罰等外掛手段),FTPO 直接從模型內部解決問題,且只需一張 GPU 花 1-2 小時完成訓練,成本極低。

T3
Ilya 推薦 30 篇 ML 論文入門網站

有人把 Ilya Sutskever(OpenAI 共同創辦人,帶領訓練出 ChatGPT 的核心科學家)當年推薦給 John Carmack(《毀滅戰士》遊戲引擎的傳奇程式設計師)的 30 篇機器學習論文,重新整理成一個對初學者友善的網站(30papers.com)。這份清單被業界視為理解現代 AI 技術的「最短路徑」之一,涵蓋深度學習(一種讓電腦從大量資料中自動學習規律的技術)的核心基礎論文。原本學術論文讀起來門檻極高、充滿數學符號,這個網站把它們整理成更容易入手的格式,讓有心學習 AI 基礎的人不必從零開始摸索該讀哪些資料。這份資源在 Hacker News 上獲得 147 點讚,顯示開發者社群普遍認為它很有參考價值。

假設你是有程式基礎但從未正式學過 AI 的後端工程師,想搞清楚 Transformer(一種讓 AI 能理解並生成文字的核心架構,ChatGPT 就建立在上面)到底是怎麼運作的。以往你得自己 Google,搜出一堆不知道從何讀起的論文,不知道哪篇重要、順序為何、跳過哪些沒關係。現在可以直接上 30papers.com,這份清單已由頂尖研究者幫你篩好「非讀不可」的 30 篇,並以初學者友善的方式呈現重點摘要,讓你有一條清晰的學習路徑。對比舊做法(自己東翻西找、花好幾週才拼湊出學習順序),這份清單能讓你省去挑選的迷茫,直接進入閱讀與理解本身。

T3
AI 自動化自身的三明治策略

這篇文章來自一個名為 Beagle SCM 的軟體版本管理工具的開發團隊,他們分享了一套與 AI 共存的工程哲學,稱為「三明治策略」。核心想法是:AI(像是 Claude 這類大型語言模型(LLM),就是 ChatGPT、Claude 這種會對話的 AI)雖然聰明,但本質上容易出錯且結果不穩定,不能完全信任它自己管理自己。所以他們的做法是把 AI 的能力「夾」在兩層可靠的確定性工具中間——上層是明確的流程規則,下層是用 C 語言寫的穩定核心程式,中間才讓 AI 處理模糊、彈性的工作。當 AI 在執行過程中反覆遇到相同的模式,系統就會自動把那個任務提煉成確定性工具,最終「把 AI 自動化掉」,讓簡單可靠的程式接手。這個思路可以推廣到任何需要把 AI 整合進正式流程的工程場景。

假設我在開發一個程式專案,需要 AI 幫我自動檢查每次提交(commit,就是把程式碼存入版本記錄)的品質——例如確保沒有把 `build/` 這類編譯產出的資料夾誤提交進去。如果直接讓 AI 自由判斷,它可能這次發現,下次又放過,結果不穩定。用三明治策略的做法是:先讓 AI 在幾次執行中學習「什麼叫做不該提交的檔案」,當 AI 的判斷規律固定下來後,就把這個邏輯寫成一段確定性的檢查腳本(script),之後這個任務就完全交給腳本執行,不再呼叫 AI,速度更快、結果更可靠、成本也更低。對比舊做法:要嘛全靠人工 review(耗時),要嘛全靠 AI(結果不穩定),三明治策略讓兩者各司其職,AI 負責「發現規律」,確定性工具負責「穩定執行」。

T3
Skill-Omni 多模態 AI Agent 技能範式

Skill-Omni 是由 openJiuwen 社群發布的業界首個多模態 Skill(技能知識庫)範式,專為 AI 代理(就是能自動執行任務的 AI 程式,例如幫你自動操作電腦、填表單的那種)設計。傳統的 Skill 是純文字說明書,但許多任務需要視覺資訊才能完整理解,例如「把照片色調調整到主體更突出」這種描述,光靠文字很難讓 AI 知道到底要調多少、調成什麼樣子。Skill-Omni 解決了這個問題:它能把網頁教學和影片教程自動轉換成包含圖片的多模態技能庫,讓 AI 代理可以「看圖學技能」,而不是靠文字猜測。系統採用「按需讀取」機制,只有在 AI 真正需要時才把圖片注入,不會一次塞太多造成 AI 記憶體(也就是「上下文視窗」,AI 每次能同時處理的資訊量)過載。

假設我想讓 AI 代理自動幫我用修圖軟體(如 Photoshop)處理一批照片,讓主體更突出。舊做法是寫一段純文字說明:「選色相╱飽和度工具,把飽和度調高 20」——但 AI 根本不知道調 20 還是 50 才對,也不知道「主體突出」實際長什麼樣子。用 Skill-Omni 的做法是:先把一篇有前後對比圖的修圖教學網頁餵進系統,系統會自動濾掉廣告圖、只保留操作步驟截圖和效果對比圖,整理成一份「有圖可依」的技能知識庫。之後 AI 執行任務時,能直接參考這些圖片進行操作,就像給助理看著範例照片而非讀文字說明。相較於舊做法,AI 能看出色調差異在哪、調整幅度對不對,準確度大幅提升,不再需要反覆試錯。

T3
螞蟻靈波開源具身視覺基礎模型

螞蟻集團(就是支付寶背後的那家公司)旗下 AI 研究團隊「靈波」,發布並開源了兩個針對機器人設計的視覺基礎模型(所謂基礎模型,就是預先在大量資料上訓練好的 AI,可以作為其他任務的起點),分別叫做 LingBot-Vision 與 LingBot-Depth 2.0。這兩個模型專注於讓機器人更精準地「看懂」真實世界的立體空間,尤其是一些連人眼都容易混淆的難搞場景,例如透明玻璃杯、光線昏暗的角落、或者很小很遠的物體。核心突破是一種叫「遮罩邊界建模」(masked boundary modeling,讓 AI 刻意去學習圖像中最難辨別的邊緣區域,而不是隨機遮住畫面)的訓練方式,使得只有 3 億參數(參數愈多代表模型規模愈大)的輕量模型,就能跑出和 70 億參數大模型相當的深度估計精準度,參數量整整少了 23 倍。模型權重已同步上架 HuggingFace 和 ModelScope,程式碼也在 GitHub 公開(robbyant/lingbot-vision),技術報告可在學術論文平臺 arXiv 查閱(arXiv:2607.05247)。

假設你在開發一臺倉儲機器人,要讓它從傳送帶上抓取透明塑膠瓶。傳統深度估計模型(讓 AI 判斷每個像素離鏡頭多遠的技術)遇到透明或反光材質時往往失準,因為這類材質的邊緣在影像中幾乎「消失」,AI 難以判斷瓶身輪廓在哪裡。用 LingBot-Vision 作為視覺骨幹、再搭配 LingBot-Depth 2.0,機器人就能更準確地估算出透明瓶的輪廓與距離,進而計算正確的抓取位置。對比舊做法,過去可能需要加裝額外的結構光感測器,或換用參數量極大的模型才能達到類似效果;現在這個輕量模型在 NYU-Depth v2(深度估計領域常用的標準評測資料集)上就已超越同類大模型,且在 12 個深度估計基準測試中全面領先,部署到邊緣裝置(算力有限的嵌入式硬體,例如機器人的機載電腦)上的成本大幅降低。

T3
AI 代理長期記憶三篇新研究

這篇報導介紹了三篇專門解決「AI 助理記憶問題」的最新研究論文。所謂 AI 代理(agent,就是能自主持續執行任務的 AI 程式,例如自動幫你管理行事曆或回覆信件的 AI)在長時間運作時,常常遇到記憶混亂的問題——把過時的舊資訊和最新資訊同時拿來用,導致回答互相矛盾或不準確。第一篇論文 A-TMA 專門解決「鬼記憶(ghost memory)」問題,也就是 AI 同時撈到已失效的舊記憶和最新記憶,造成資訊衝突;在 LTP 測試基準上,搭配 Graphiti(一套 AI 記憶管理框架)使用後,衝突處理準確度提升了 0.240 的幅度。第二篇 ReContext 是一種不需額外重新訓練模型的推論強化方法,它會在 AI 產生答案之前,把文件中的關鍵證據段落再重新「播放」給模型看一遍,讓 AI 更能充分利用超長文件(128K tokens,即約 10 萬個中文字的篇幅)裡分散的資訊。第三篇 BlockSearch 則是一套針對百萬字符超長文件的即時查詢技術,讓 RAG(Retrieval-Augmented Generation,讓 AI 先查資料庫再回答、減少憑空捏造的技術)能擴展到更龐大的文件量。這三篇論文共同指向一個趨勢:AI 的記憶與推理問題,愈來愈可以在「推論階段(AI 實際運作產生答案的當下)」解決,而不必重新訓練整個模型。

假設我在開發一個「長期客服 AI 助理」,它要記住每個用戶過去所有的對話紀錄。今天某位用戶剛更新了收貨地址,但資料庫裡還保有三個月前的舊地址。沒有 A-TMA 的舊做法:AI 同時撈到新舊兩筆地址,可能隨機採用其中一個,甚至在同一段回應裡說出兩個地址互相矛盾,用戶必須一再重申「我說的是新地址」。加入 A-TMA 之後:AI 能識別出哪一筆是「鬼記憶(已過時、應棄用)」,優先採用最新資料,衝突準確率明顯提升,不再讓用戶重複更正。另一個場景是法律文件分析:我要讓 AI 分析一份 8 萬字的技術授權合約,用 ReContext 的做法,AI 在回答「第 12 條的終止條款如何啟動」之前,會自動把第 12 條相關段落再重新讀一遍,而不是隻靠一次性的語意搜尋撈幾個片段;測試顯示在 8 個 128K 長文件資料集上,AI 找到正確答案的成功率都有所提升,比傳統推論方式更能掌握散落在文件各處的證據。

T3
微軟優化 GPT-5.5 推理效率

推理效率(AI 每次回答時所消耗的時間與運算資源)正逐漸成為 AI 產業的核心競爭焦點,業界已有觀察者直接指出這是「戰略瓶頸」。Microsoft 在 GitHub Copilot(一款整合在程式開發工具中、幫助工程師寫程式的 AI 助手)上線 GPT-5.5(OpenAI 最新一代的對話式 AI 模型)之後,主動針對「提示詞(prompt)設計」進行層級優化——也就是調整傳送給 AI 的問題格式與指令寫法,而非更換底層模型。目標是同時壓低迴應延遲(讓 AI 回答更快)、並減少 token 消耗(token 是 AI 處理文字的最小計費單位,用量越少成本越低)。這個案例說明一件重要的事:即使模型本身沒有升級,光靠改善「與 AI 溝通的方式」,就能對效能與成本產生實質影響。

假設你是每天使用 GitHub Copilot 的工程師,請 AI 幫你補全一段 Python 函式。在優化前,Copilot 每次請求都將完整的對話歷史、大量背景說明與格式指令一起打包送給 GPT-5.5,導致每次回應慢了幾秒、且 API 費用偏高。Microsoft 工程師在 GPT-5.5 正式上線後,重新設計提示詞結構:精簡系統指令、移除冗餘的格式說明、只傳遞當下真正需要的上下文。結果是同樣的程式補全任務,token 消耗下降,回應速度加快,使用者感受到更流暢的體驗,Microsoft 的推理服務成本也同步降低。這就是「提示詞層級優化」的具體效果:不換模型、只改問法,成效立竿見影。

T3
OpenAI 實時迷你模型升級推理工具

OpenAI(也就是開發 ChatGPT 的那家公司)推出了 GPT-Realtime-2.1-mini,這是他們「實時 API(讓開發者直接呼叫 AI、進行即時語音或文字對話的開發者服務)」系列中小型版本的最新升級。這次更新最重要的是:迷你版本現在也能「推理(AI 在回答前先一步步思考、把推導過程列出來,而不是直接衝口而出)」,並支援「工具呼叫(讓 AI 在對話中去查詢資料庫、執行計算或呼叫外部系統)」。更棒的是,這些新功能的價格與上一版完全相同,不需要額外付費。OpenAI 還宣稱透過快取(把常用的回應暫時存起來、下次直接取用)的改善,p95 延遲(意思是:把所有請求的回應時間排序,最慢的那 5% 用了多久)降低超過 25%,讓即時對話應用更加流暢。

假設你是一位開發者,正在用 OpenAI 的 Realtime API 打造一個「即時語音客服機器人」。以前用迷你版本時,機器人只能照著事先設定的劇本回答,因為不支援工具呼叫,所以沒辦法即時查詢客戶訂單狀態;而且遇到需要多步驟判斷的退換貨規則時,常常答非所問。升級到 GPT-Realtime-2.1-mini 之後,你可以設定一個「查訂單」工具,讓 AI 在對話中直接拉出訂單資料;同時開啟推理模式,讓它在遇到複雜規則時先想清楚再開口。加上延遲降低,使用者等待回應的時間更短,整體體驗從「勉強夠用的自動語音」升級為「接近真人客服的感覺」,費用卻完全不增加。

T3
LlamaIndex 多模態 PDF 檢索新流程

LlamaIndex(一個幫 AI 系統讀懂文件的開源框架)與 LanceDB(一個專為 AI 設計的向量資料庫,就是把文字、圖片等內容轉換成數字後儲存,讓 AI 能快速找到相關內容)合作,提出了一套處理「混亂 PDF」的多模態檢索流程(multimodal retrieval pipeline,意思是同時能理解文字、圖表、圖片等不同形式內容的查詢系統)。這套流程的設計理念是把一份 PDF 文件拆成三個層次:整頁內容、文字段落、以及從頁面中抽取出來的圖片或圖表,三者以相互連結的方式儲存在資料庫裡,而不是全部混在一起。這讓 AI 在回答問題時,能更精準地同時搜尋文字段落「和」視覺圖表。在一份 ESG 報告(企業環境、社會與治理的永續報告,格式通常非常複雜,夾雜大量圖表與條列資料)的標準測試中,這套流程達到了 82% 的頁面命中率、74% 的答案正確率,展現了比傳統做法更好的表現。這個方向呼應了 LlamaIndex 創辦人 Jerry Liu 提倡的「文件情境層」概念,也就是在 AI 代理(agent,能自主執行任務的 AI 程式)和原始文件之間,專門建立一個能理解文件結構的中間層。

假設你要讓 AI 分析一份 60 頁的上市公司 ESG 年報,裡面有文字說明、數字表格、長條圖和折線圖混在一起。傳統 RAG(讓 AI 回答前先查文件庫的技術)做法是把整份 PDF 切成一段一段的文字,AI 靠「語意相似度」來找答案——但這樣一來,圖表裡的數字根本沒有被轉換成文字,AI 就看不到;而且各段文字失去了「它在哪一頁、旁邊有什麼圖」的脈絡,跨頁追蹤數字時容易搞混。用這套新流程,同一份 PDF 會被分成三張互相連結的「資料表」:第一張記錄每一頁的整體摘要(包含頁碼、章節位置),第二張存放切好的文字段落,第三張存放從頁面抽取出來的圖表圖片(並附上說明文字)。當你問「2024 年溫室氣體排放量比前一年減少了多少?」,AI 同時搜尋文字表格和圖表,透過連結關係找到那張折線圖、確認頁碼、再比對文字說明,最終給出有出處的精準答案——而不是「找不到相關資訊」或把不同年份的數字混在一起回答。

T3
Carmack 論 AI 推理記憶體優化

John Carmack(約翰·卡馬克,《毀滅戰士》遊戲引擎之父,現在轉型專注於研發 AGI 通用人工智慧)在社群媒體發了一串技術討論串,主張目前 AI 推理(Inference,就是讓模型實際回答問題、生成文字的過程)所使用的記憶體系統可以比現在便宜得多。他的核心論點是:大型語言模型(LLM,就是 ChatGPT、Claude 這類會對話的 AI)在回答問題時,讀取模型內部參數的順序是固定且可以事先預測的,這種特性稱為「確定性存取模式(Deterministic Access Pattern)」,與一般電腦程式需要隨機讀取記憶體的情況非常不同。目前 AI 晶片大量仰賴昂貴的 HBM(高頻寬記憶體,High Bandwidth Memory,一種極快但造價驚人的特殊記憶體,是 Nvidia GPU 最貴的核心零件之一);但 Carmack 認為,既然讀取順序可以預測,就可以設計更便宜的記憶體方案,讓系統預先把資料排好,不需要負擔 HBM 那麼高的速度和成本,這個觀點引發了業界廣泛的技術討論。

假設你要建立一個 24 小時線上服務的 AI 客服機器人,需要不斷讓大型語言模型回答用戶問題。現在的做法是購買 Nvidia H100 或 H200 GPU 伺服器,每張卡要價超過新臺幣 90 萬元,其中大部分成本來自內建的 HBM 高頻寬記憶體,因為一般記憶體速度太慢、跟不上 GPU 的運算節奏。Carmack 的論點指出:大型語言模型(以 Transformer 架構為主)每次推理時,讀取各層參數的順序幾乎完全固定——從第一層讀到最後一層,再下一個詞元(Token)同樣重複。這代表可以設計一套「預排讀取時序的記憶體控制系統」,用成本低很多的 DRAM(普通動態隨機存取記憶體)甚至 Flash 快閃記憶體搭配智慧預取(Prefetch,提前把下一步需要的資料準備好)替代部分 HBM。結果可以是:伺服器硬體成本大幅下降,讓更多公司有能力自行部署大型模型,而不是全靠昂貴的雲端 GPU。對比現在的做法——無論模型讀什麼順序都用最貴的 HBM 硬扛——Carmack 的方向是:利用 AI 推理特有的「可預測性」來設計更省錢的硬體架構。

T3
Claude Cowork 擴展至手機與網頁

Anthropic(開發知名 AI 對話助手 Claude 的公司)旗下的 Claude Cowork 工具,正式從原本僅限電腦桌面版,擴展到可在手機和瀏覽器網頁上使用。Cowork 是一種「AI agent」(就是可以自動執行多步驟工作任務的 AI 助理),用戶交代好任務後,AI 會在背景持續執行,不需要人一直盯著螢幕等待。這次更新最大的意義是「跨裝置連續工作」:可以在電腦啟動任務,用手機查看進度通知,即使電腦已關機,任務照樣繼續跑;等方便的時候再打開網頁版取得完成結果。根據 Anthropic 分析超過 60 萬個組織的使用資料,最常見的用途是業務流程操作(33.4%,例如整理報告、填表、協調試算表)和內容寫作(16.4%,簡報草稿、社群貼文),軟體開發反而只佔 8.7%——顯示 AI agent 已從工程師專用工具走向一般職場員工的日常。

假設我是行銷人員,需要整理上個月的社群媒體數據並產出 PowerPoint 月報。以前得自己從各平臺下載數據、整理進 Excel、再手動製圖貼入簡報,整個流程可能花 2~3 小時。用 Claude Cowork 新版本,我可以在辦公室電腦上交代任務(「把這份 CSV 整理成月報簡報」),然後關電腦去開會;中途用手機收到進度通知,確認 AI 還在跑;下午回座位打開瀏覽器,直接下載初稿。全程 AI 在背景持續工作,我不必守著螢幕。這和傳統 ChatGPT 對話窗口的最大差別在於:ChatGPT 只能即時互動,關掉視窗任務就停了;Cowork 的 agent 則像是「丟給助理去辦」,讓人可以先去做別的事。

T3
Savi AI 即時防詐騙應用上線

Savi Security 是一家由兩兄弟 Patrick 與 Ryan Coughlin 創辦的新創公司,他們推出了一款 iPhone 和 Android 手機應用程式,專門用來偵測並阻擋 AI(人工智慧)生成的詐騙。隨著生成式 AI(就是能夠自動產生文字、圖片、聲音的人工智慧技術)越來越普及,詐騙集團開始利用 AI 合成逼真的聲音、訊息甚至影像來行騙,例如偽裝成家人被綁架、要求支付贖金。Savi 的應用程式可以掃描用戶收到的簡訊、語音信箱和來電,也能分析可疑的照片與電子郵件,並且提供一個特別的功能:用戶在接到可疑電話時,可以讓應用程式裡的 AI 代理人(就是一個自動執行任務的 AI 助手)即時加入通話,幫忙實時判斷對方是不是詐騙。Savi 的技術核心是先透過旗下免費網站 Scamwise 蒐集超過 10 萬份真實詐騙案例,再用這些資料訓練自家的 AI 詐騙辨識模型,目前主要使用 Google 的 Gemini(Google 推出的大型語言模型)作為底層技術,並建立了一套 AI 閘道來整合多種專用模型。這次他們完成了 700 萬美元的種子輪融資(即公司創立初期的第一筆外部投資),由 Acrew Capital 領投,定價為每月 8 美元或每年 63 美元,一個帳號可供全家人無人數限制共用。

假設你的媽媽突然接到一通電話,對方用你的聲音(由 AI 合成)哭喊說「我被綁架了,快打錢來!」過去媽媽可能難以判斷真假、驚慌失措。現在她可以打開 Savi 應用程式,在通話中點選「讓 AI 加入監控」,Savi 的 AI 代理人會即時分析這通電話的語音特徵、對話邏輯,並在幾秒內告知「這通電話極可能是 AI 合成詐騙,請勿轉帳」——而不是等掛掉電話後再慢慢回報。相比過去只能事後報警、錢已匯出的被動局面,Savi 的即時介入讓用戶在仍在通話中就能獲得警示,大幅降低上當的機率。

T3
美軍自駕車首度實戰烏克蘭

美國新創公司 Forterra 研發了一款名為 Lancer 的自動駕駛 ATV(就是一種能在崎嶇地形行駛的四輪越野車),已在烏克蘭戰場部署超過 100 輛。這些車輛搭載 AI(人工智慧)導航系統、Starlink(馬斯克的衛星網路)天線及客製化感測器,能在無人駕駛的狀況下自主通過複雜地形。自 2025 年 10 月上線以來,已完成超過 1,100 次任務、行駛 2,500 英里、運送超過 35 萬公斤物資,並執行 52 次傷患撤離。目前烏克蘭部隊仍以遠端遙控為主,車輛雖能自主導航地形,但尚無法辨識突發敵軍威脅並自主應對。Forterra 正將自動駕駛演算法與生成式 AI(像 ChatGPT 這類能理解情境並做決策的 AI)整合,讓車輛未來能更獨立判斷戰場狀況。

烏克蘭前線的士兵面臨全程被無人機監視的困境,任何車輛移動都可能遭到攻擊。在這種情況下,一名受傷士兵需要從前線後送——傳統做法是派真人駕駛救護車前往,等同把另一條命押上去。改用 Lancer 自動駕駛車輛後,士兵在後方透過遠端操控介面指定目的地,車輛自行規劃路線、穿越彈坑地形抵達傷患位置、完成後送。若車輛途中被擊毀,損失的只是機器而非人命。Forterra 公開的數字顯示,這類傷患撤離任務已執行 52 次,和人工駕駛相比最直接的差異就是:車壞了可以換,人死了不行。

T3
Vercel CEO:AI 模型與 Agent 應分離

Vercel(一家幫助開發者快速把網站和應用程式上線的雲端平臺)執行長 Guillermo Rauch 接受科技媒體 TechCrunch 採訪,分享他對 AI 代理(Agent,就是能自動執行任務、不需要人一直盯著的 AI 程式)產業走向的看法。他指出,AI 開發已從去年的「做原型、試新鮮」階段,明顯轉向「真正部署到正式環境、認真計算成本和效能」的成熟期。Rauch 主張,企業在使用 AI 時應該把「底層模型」(就是 OpenAI、Anthropic、Google 這些 AI 公司提供的 AI 大腦)和「代理應用程式」(在這個大腦上執行特定任務的程式邏輯)拆開來管理,不要把兩者死死綁在一起。這樣做的好處是:哪家 AI 廠商最便宜、效果最好,就換哪家,企業不會被單一平臺綁架。Vercel 因此推出了 Eve 框架(一個讓你用白話文設定 AI 代理行為的工具)和 Vercel 沙盒(Sandbox,一種讓 AI 只能存取特定資料、不能亂摸其他東西的隔離機制),支撐這套「模型可替換」的架構。

假設你是一間軟體公司的工程師,想讓 AI 代理自動幫你們寫程式、提交程式碼。舊做法可能是直接用某家 AI 平臺的一整套解決方案(例如全部押在 OpenAI 的 API 上),但一旦 OpenAI 漲價或推出競爭者更好的替代品,你想換掉就非常麻煩,因為你的程式碼全都依賴那家平臺的特定格式和介面。Rauch 倡導的新做法是:用 Eve 框架定義代理的行為邏輯(例如「遇到 bug 就先跑測試,測試失敗再查文件」),這套邏輯寫好之後,底層可以自由換接 OpenAI、Anthropic Claude 或 Google Gemini 任何一家的模型——哪家這個月最划算就用哪家。Vercel 沙盒則確保 AI 代理在幫你寫程式時,不會不小心讀到公司其他敏感的機密程式碼或內部資料。Vercel 目前每天有 600 萬次部署,其中約一半是由 AI 編碼代理自動觸發,每日 AI 流量超過 1 兆個 token(token 是 AI 處理文字的基本單位,大約等於半個英文單字)。

T3
Cohere 開源阿拉伯語語音辨識模型

Cohere(一家加拿大 AI 公司)發布了一款名為「Transcribe Arabic」的語音辨識模型(就是可以把人說的話自動轉成文字的 AI 系統),專門針對阿拉伯語設計,並以開源(Open Source,程式碼公開、任何人都可以免費使用和修改)方式釋出,放在 Hugging Face(AI 模型的共享平臺,類似 GitHub 但專門放 AI 模型)上,採用 Apache 2.0 授權(一種非常寬鬆的授權,商業用途也可免費使用)。這個模型有 20 億個參數(參數數量代表模型的「學習容量」,數字越大通常理解能力越強)。根據 Cohere 的基準測試,Transcribe Arabic 在辨識阿拉伯語方言(埃及、敘利亞、海灣地區等口音各異的地區腔調)、中英夾雜語音(code-switching,說話時夾雜另一種語言,例如阿拉伯語夾英文),以及純阿語英語雙語內容等困難場景上,表現均優於 Whisper(OpenAI 開發的知名語音辨識系統)和 OmniASR 等競爭模型。對於需要處理阿拉伯語語音的開發者或企業,這是一個可以直接部署的現成工具,且完全免費。

假設你要建立一個中東地區的客服語音轉文字系統,客戶打電話時往往混用埃及方言加英文,例如說「ana aiz to know el delivery status」(阿拉伯語方言夾英文,意思是「我想知道配送狀態」)。用舊有的 Whisper 處理這類語音,往往辨識錯誤或大量漏字,後續 AI 根本無法正確分析客戶意圖。換成 Transcribe Arabic,同樣的錄音輸入後,能更完整準確地輸出文字,讓後端 AI 正確判讀客戶需求,大幅提升中東市場客服的回應品質——而且這個模型可以免費下載在自己的伺服器上跑,不需要付費 API 呼叫費用。

T3
中國 AI 模型佔 OpenRouter 三成流量

中國的 AI 語言模型(就是像 ChatGPT 這類能對話、寫程式、回答問題的 AI 服務)在近幾個月快速搶佔美國市場。根據 OpenRouter(一個讓開發者可以統一存取多家 AI 模型的平臺,用一個帳號就能切換 OpenAI、Anthropic、DeepSeek 等各家模型)的數據,中國模型自今年 2 月以來,每週都佔該平臺流量的三成以上,高峰時甚至達到 46%,而去年同期只有 11%。這波成長的最大推力是「價格」——中國開源模型(原始碼公開、任何人都能下載自行部署的模型)的使用費用,比 OpenAI 和 Anthropic 的同類產品便宜 60% 到 90%。美國新創公司越來越傾向將產品切換到 DeepSeek(深度求索)、Z.ai 等中國模型。分析師估計這些模型在整體能力上仍落後美國頂尖模型約六到九個月,但對許多商業應用來說,這個差距在可接受範圍內,省下的龐大成本更是吸引力所在。

假設我是一家美國新創公司,正在開發客服自動化產品,每天要讓 AI 處理大量用戶訊息,計費單位叫 token(token 就是 AI 讀取和生成文字時計算費用的最小單位,大約 4 個英文字母算一個 token)。原本用 Anthropic 的 Claude 模型,每月費用相當可觀。切換到 DeepSeek 之後,相同工作量的費用可降低 60%-90%。實際案例:自動化工具新創公司 Lindy 已完整從 Anthropic Claude 切換到 DeepSeek,其 CEO 公開表示這個決定每年可為公司省下數百萬美元。代價是什麼?DeepSeek 在複雜推理或資安相關任務上的表現略遜,但針對客服問答、文件摘要、內容生成等日常商業工作,差距並不明顯——對大多數新創公司而言,「夠用 + 省大錢」的組合比「最強但貴」更實際。

T3
Replit Agent 持續學習新方法

大多數市面上的 AI 代理(就是能幫你執行任務、寫程式、查資料的 AI 程式)背後都跑在封閉的大型語言模型(像是 GPT-4、Claude 這類商業 AI,你無法直接修改它們的內部運算參數)上。因為改不了模型本身,開發者只能從「外部」讓 AI 越用越好,也就是改進代理的執行環境、工具串接方式,以及給 AI 的提示內容——這種做法就叫做「不碰模型權重的持續學習」。Replit(一個讓使用者用自然語言就能建立 App 的線上開發平臺)為了讓他們的 AI 代理持續進步,設計了兩套工具:一個叫 ViBench,專門評估 AI 是否能從文字描述成功建出可運作的應用程式;另一個叫 Telescope,會自動把 AI 在實際使用中產生的失敗記錄(就是出錯的 log 日誌)分類整理成一群群有共同原因的問題,讓工程師知道該優先修哪裡。

假設我是 Replit 的工程師,使用者每天都在用 AI 代理做「幫我建一個記事本 App」「幫我做一個簡單的預算追蹤網站」這類任務。AI 有時會失敗,但錯誤五花八門,人工看很花時間。以前的做法:工程師每週手動翻閱幾百條錯誤日誌,猜測主要問題在哪,憑直覺決定要改哪段程式。用了 Telescope 之後:系統自動把這幾百條錯誤分群,例如發現「有 30% 的失敗是因為 AI 沒正確處理使用者上傳的圖片格式」「有 20% 是因為 AI 生成的程式碼用了已棄用的套件」。工程師一眼就能看出最大宗的問題,針對性地改善提示詞或工具設定,再用 ViBench 測試修正後 AI 完成任務的成功率有沒有提升。整個流程從「憑感覺找問題」變成「資料驅動、有優先順序地改進」,不需要動到 AI 模型本身一行程式碼。

T3
企業開源 AI 的真實策略

外界常以為企業一定都在用 GPT-4、Claude 這類大型商業 AI,但美國企業 AI 新創 Decagon 的實際做法說明瞭另一條路:他們高達 90% 的工作量跑在開源模型(就是程式碼和模型權重都公開、任何人都能免費下載自己架的 AI 模型)上。關鍵在於「微調」(Fine-tuning,就是用大量針對特定任務的資料重新訓練模型,讓它只專注把一件事做好),微調後的小模型反應速度快、成本低,而且在固定任務上往往比通用大模型更準確。這並不意味所有企業都該馬上換掉商業模型——目前大多數企業 AI 仍在早期摸索,偏好彈性強的前沿商業模型(如 ChatGPT、Claude)。合理的趨勢是:先用商業模型試出哪些工作流有用,等流程穩定後,再把那些任務遷移到更便宜、更專門的開源小模型上。

假設我是一家電商公司,想導入 AI 自動回覆客服問題(查訂單、處理退換貨等)。初期我直接串接 GPT-4 API(OpenAI 提供的付費商業介面),優點是能應付各種奇怪問題,但每次回應要花 3~5 秒、每月費用高,且回覆風格不夠統一。等客服流程穩定後,我改用 LLaMA 3(Meta 釋出的開源模型),把公司兩年的客服紀錄拿去做微調,讓模型只學「這家公司的客服怎麼回答」。結果:回應時間縮短到不到 1 秒,月費降低約七成,回覆風格也完全符合品牌調性。代價是:這個微調模型只會回固定範圍的客服問題,碰到訓練資料以外的新情況容易出錯,仍需保留人工審查機制。這正是 Decagon 文章點出的核心邏輯——開源不是萬靈丹,而是「任務確定後的最佳化選項」。

T3
Monarch 在 AMD GPU 容錯分散訓練

PyTorch Monarch 是 Meta(Facebook 母公司)開發的分散式訓練框架(就是讓大型 AI 模型的訓練工作分散到幾百甚至幾千張 GPU 上同時進行的系統)。訓練像 GPT 這類有數十億、甚至數千億參數的大型語言模型(就是 ChatGPT 這類會對話的 AI)時,需要大量 GPU 持續協作好幾天、好幾週。在這麼大的規模下,某一臺伺服器或某一張 GPU 中途故障幾乎是常態,而以往只要有一個節點(單臺伺服器)壞掉,整個訓練就得喊停、從頭再來。Monarch 的核心功能是「彈性容錯」——偵測到某臺機器故障時,系統自動把它排除並繼續訓練,不需要人工介入、不需要全部重跑。這次更新讓 Monarch 正式支援 AMD 的 ROCm 平臺(AMD 的 GPU 通用運算環境,功能類似 NVIDIA 的 CUDA),讓本來只能依賴 NVIDIA GPU 的大規模訓練場景,多了一個穩定可靠的 AMD 替代選擇。

假設你的公司在一個有 500 臺伺服器的 AMD GPU 叢集上訓練一個千億參數的語言模型,預計跑五天。訓練進行到第三天,其中三臺伺服器的 GPU 過熱當機。舊做法:整個訓練作業強制中斷 → 工程師介入排查哪些機器壞了 → 手動把故障機器踢出去 → 重新啟動訓練,光停機與重啟就可能浪費半天到一整天。用了 Monarch 的容錯機制後,系統自動偵測三臺伺服器離線,將剩餘 497 臺重新編組,訓練作業繼續執行,中間幾乎不停頓。整個過程不需要人工處理,也不需要從第一天重跑。現在這套機制在 AMD ROCm 上也能運作,代表選用 AMD 硬體(通常比 NVIDIA 便宜或更容易取得)的訓練場景,終於也能享有同等級的自動容錯保障。

T3
PACE 大幅降低 AI 代理能力評測成本

測試 AI 模型的「代理能力」(就是讓 AI 自己上網查資料、操作程式、完成跨多步驟任務,例如幫你訂機票或自動修程式碼,這類被稱為「代理型 AI(Agentic AI)」的情境)通常費用極高,因為要跑大量複雜的真實場景測試。PACE(Proxy for Agentic Capability Evaluation,代理能力評估代理框架)是一個新研究框架,核心概念是:只用一小組「簡單版」的非代理型測試題,就能準確預測 AI 在複雜代理任務上的分數。具體做法是先從現有題庫中挑選少量「最有代表性的題目」,建立統計預測模型(迴歸模型,即用數學公式找出題目分數和最終評測分數的對應關係),再用這個模型估算 AI 在完整代理基準測試上的表現。實測結果顯示,PACE 能把評測成本壓低超過 99%,同時平均預測誤差控制在 4% 以內,讓開發者在開發過程中可以快速篩選模型,不必每次都花大錢跑完整測試。

假設我是一家新創公司的 AI 工程師,正在替「自動化客服代理」挑選底層 AI 模型,手頭有五個候選(GPT-4o、Claude Sonnet、Llama 3.1 等)。完整跑一輪代理型基準測試(例如 SWE-bench,讓 AI 實際修 GitHub 上的程式碼 bug;或 GAIA,讓 AI 完成需要搜尋+計算+整合的多步驟題目)可能要花數千美元和好幾天。改用 PACE 的做法:只從較簡單的非代理題庫中抽取少量「指標題目」,讓五個模型作答(成本極低),再用 PACE 的預測模型推算各模型在完整代理測試上的估計得分,快速排出優劣順序。最後只對排名第一的模型做完整驗證,省去了對其他四個模型的冗餘測試費用,整體評測成本縮減 99% 以上,同時預測誤差不超過 4 個百分點。

T3
2026 年中 CLI 程式碼 Agent 評測

這篇文章回顧了 2026 年年中,幾款主流「CLI 編程 Agent(就是在終端機命令列介面中,幫工程師自動讀懂程式碼、制定修改計畫、跨檔案編輯、執行測試、從錯誤中自我恢復的 AI 工具)」的發展現況與比較。目前最受矚目的幾款工具分別是 Claude Code(由 Anthropic 開發)、Codex CLI(由 OpenAI 開發)、Omp,以及 OpenCode,它們都能處理真實大型軟體專案(repository,就是一個包含所有原始碼的完整軟體資料夾),並產出可直接投入正式上線環境的程式修改。其中 Claude Code、Codex CLI 與 Omp 三款在輸出品質上已非常接近,幾乎難以分出高下;相較之下 OpenCode 雖然整體品質略低,但它最努力地支援各種不同的大型語言模型(LLM,就是 ChatGPT、Claude 這類能對話的 AI 大腦),讓使用者不被特定 AI 供應商綁死。各款工具的差異主要在於「任務描述清晰度」、「維持程式碼庫整潔的能力」、「權限管理機制」,以及「是否在對的時機提供對的工具」這四個面向。

假設你是一位工程師,需要修復一個橫跨多個模組的後端 API 錯誤——舊做法是手動逐一打開相關檔案、比對邏輯、改完一個再測另一個,往往要花半天排查。使用 Claude Code 這類 CLI 編程 Agent,你只要在終端機輸入問題描述,Agent 會自動讀取整個專案結構,找出與這個錯誤相關的所有檔案,列出一份修改計畫讓你確認,接著自動編輯程式碼、執行測試確認沒有破壞其他功能,最終遞交一份完整可合併的修改。若是使用 OpenCode,優勢在於:即使你的公司內部用的是非主流或自行架設的 AI 模型,它也會嘗試完成任務,而 Claude Code 等工具對特定模型的相容性則相對有限。

T3
AI 程式代理提升開發者合併量 24%

微軟(Microsoft)進行了一項研究,調查工程師使用「命令列 AI 程式代理」(就是在終端機裡輸入指令、由 AI 自動幫你寫程式、修改程式碼的工具,例如 GitHub Copilot CLI 這類產品)之後,對實際工作產出的影響。研究結果顯示,使用這類工具的工程師,合併的「pull request(程式碼審核請求,簡稱 PR,也就是工程師寫好一段功能後送交給同事檢查並合入主程式庫的流程)」數量,比預期高出了約 24%。研究也發現,這類工具的普及並非來自公司強制推廣,而是靠同事之間口耳相傳、互相帶動,說明「怎麼推廣工具」這件事,跟「工具本身好不好用」一樣重要。

假設一個十人工程師團隊,過去每週平均合入 50 個 PR。在其中幾位工程師開始使用命令列 AI 程式代理(例如讓 AI 自動生成程式碼草稿、自動補全測試、或直接在終端機裡對話式修 bug)之後,不需要公司主動推行,這批人的使用習慣自然透過內部討論、Slack 分享擴散給其他同事。三個月後,整體團隊的 PR 合入量成長至每週約 62 個,相當於憑空多出一到兩位工程師的產出。對比沒有採用這類工具的同期對照組,差距就是那 24%。這代表評估 AI 工具導入成效時,不能只看工具功能強不強,還要觀察內部推廣策略——讓早期採用者自然帶動同儕,往往比強制培訓更有效。

T3
Anthropic 推出 Claude Code 企業閘道

Anthropic(開發 Claude AI 的公司)推出了一款「企業閘道」(Enterprise Gateway),讓大公司在使用 Claude Code(Anthropic 的 AI 程式碼輔助工具,可幫助工程師自動生成與修改程式碼)時,能透過 Amazon Bedrock 或 Google Cloud 這兩個主流雲端平臺進行統一管理和部署。這個閘道是一個「無狀態容器」(stateless container,就是一套可以安裝在公司自己伺服器上、不需保存連線狀態的獨立軟體),讓企業的 IT 部門能集中控制誰可以使用、用了多少、花了多少錢。它整合了身份驗證(確認使用者身分,支援 Google Workspace、Microsoft Entra ID、Okta 等主流系統)、政策執行(集中設定使用規則,工程師登入時自動套用)、使用量遙測(每次請求都記錄並傳送到公司自己的監控系統)、跨雲路由(可在 Claude API、Amazon Bedrock、Google Cloud 之間調度流量,並支援故障切換)以及費用上限管控(可設定組織、群組或個人每日、每週、每月的消費限額)等五大核心功能。簡而言之,這讓企業能像管理其他 IT 系統一樣,有條有理地在公司內部推行 Claude Code,而不再是讓每位工程師各自散亂地使用個人金鑰。

假設一家擁有 200 位工程師的科技公司想全面導入 Claude Code 提升開發效率。過去,IT 部門必須為每位工程師個別申請 API 金鑰(讓程式存取 Claude 服務的「通行密碼」),手動寄發設定檔,遇到員工離職還要逐一撤銷權限,且完全看不出哪個團隊到底花了多少費用,安全與財務管控幾乎是靠人力硬撐。有了這套企業閘道後,IT 部門只需部署一個中央容器並接上公司既有的 Microsoft Entra 帳號系統,工程師用公司帳號登入後便自動取得短效憑證,無需保管任何長期密碼。管理員在後臺設定「行銷團隊每月上限 1,000 美元」,系統自動執行;所有使用記錄透過 OTLP(一種標準化的監控資料傳輸協定)送進公司的可觀測性平臺,財務部門即時可查費用明細。相比過去碎片化、手動維護的方式,導入時間從數週縮短為數天,且安全性與成本透明度大幅提升。

T3
升級 AI 模型不一定更划算

許多人直覺認為,新版 AI 模型一定比舊版更好、更省錢,但微軟開發者部落格的實測結果打破了這個迷思。他們比較了 Claude Sonnet 5(新版)與 Claude Sonnet 4.6(舊版)在實際開發任務上的表現,發現雖然 Sonnet 5 每個 token(AI 處理文字的最小計量單位,大約 0.75 個英文字算一個 token)的定價便宜了 33%,但在某些任務上卻消耗了多出 10 到 12 倍的 token,結果同樣的工作跑下來反而貴了將近 4 倍。更嚴重的是「穩定性」問題:Sonnet 5 在同一個任務上的 token 用量極不穩定,有時只用 1 萬 6 千個,有時卻暴增到 660 萬個,這種不可預測性讓開發者完全無法估算 AI 的使用成本。研究也發現,新版模型在「是否忠實遵循指令」這件事上雖然有進步,但在某些品質指標(例如產出的程式碼是否符合該語言的最佳慣例)上,舊版反而表現得更好。

假設我是一名工程師,要用 AI 幫我把舊版程式碼自動升級成新版本(例如把某套框架從 v2 升到 v3)。用 Claude Sonnet 5,任務完成率很高,達到 100%(舊版 Sonnet 4.6 只有 60%),聽起來很棒——但代價是每次執行要花 $2.01 美元,而舊版只要 $0.55,貴了快 4 倍。如果一天跑 100 次,一個月下來費用差距超過 4,000 美元。更麻煩的是,Sonnet 5 的費用非常不穩定,你根本不知道下一次會花多少,預算規劃幾乎不可能。反觀舊版 Sonnet 4.6,token 用量很集中穩定,雖然完成率低,但成本可預測。研究的結論是:升級前一定要用自己的實際任務測試,不能單憑「新版定價更低」就貿然切換。

T3
機器人崛起:AI 補不了的硬體差距

這篇文章是一場深度訪談,邀請 SemiAnalysis(一間專門研究半導體和新興科技的頂尖技術分析機構)的機器人專家,討論為什麼「實體機器人」而非「AI 軟體」才是這波科技浪潮中最顛覆性的通用技術。文章的核心論點是:機器人能讓「資本」和「人工勞動」徹底脫鉤——過去企業想擴大生產就必須僱更多人,但機器人讓你只要有足夠資金買機器就能幾乎無限擴產,這在人類歷史上前所未見。中國廠商 Unitree 推出的 R1 機器人售價僅 4,900 美元(約新臺幣 16 萬元),比美國同類產品便宜 15 倍以上;關鍵在於「執行器」(actuator,就是讓機器人手臂和腿部能出力動作的電機模組),這個零件佔機器人整體成本的 50~70%,中國掌握了從稀土採礦到成品製造的完整產業鏈,美國目前幾乎完全缺乏。文章也直接反駁「靠更聰明的 AI 大腦來彌補硬體差距」的想法——當對手的機器人便宜 15 倍,光靠軟體優勢根本填不回來,這是一個硬體供應鏈問題,不是 AI 演算法問題。

假設我想在倉庫建一條自動分揀線,傳統做法是僱工人,每班 20 人,加上薪水、勞健保和管理成本,一年開支十分可觀。現在我考慮用機器人取代,Unitree R1 一臺約 4,900 美元,可執行把箱子從 A 點搬到 B 點的任務;美國廠商的同等規格機器人,要價可能超過 7 萬美元。有人說:「美國有 OpenAI、Google,AI 比較聰明,機器人『大腦』更強,可以補回來」——但文章中 SemiAnalysis 專家直接回應:當對方硬體便宜 15 倍,你的軟體要聰明到什麼程度才夠?答案是不可能達到的程度。真正的瓶頸在於執行器的製造需要稀土材料加工、精密機械加工等完整上下游,中國全都有、美國全都缺,而且短期內靠政策也無法快速補足。換句話說,選 Unitree 省下的差價,可以再買 14 臺備用機器人,這種成本差距已超出軟體能彌補的範疇。

T3
每百萬token定價具誤導性

一篇技術分析文章,指出 AI 界常見的「每百萬 token(token 是 AI 模型讀寫文字的基本計費單位,類似簡訊的「字數」計費)定價」是一個會讓人做出錯誤決策的指標。文章核心論點是:不同 AI 公司使用各自的「分詞器(tokenizer,把文字切成 token 的工具)」,同一段文字在不同模型裡切出來的 token 數目不一樣,所以光看單價毫無意義。更大的問題是,有些模型在背後做大量「思考推理(chain of thought,讓 AI 自己先想一遍再回答)」,這些隱藏運算也按相同費率收費,導致「便宜模型」實際完成一項任務的總花費反而更高。作者整理了 8 個主流模型的每百萬 token 定價,對比完成同樣基準測試任務的實際花費,兩者排名大相逕庭。結論是:選模型時,應以「完成你實際任務的總成本」作為依據,而非 token 單價,否則很可能花更多錢卻得到更差的效果。

假設我要為公司的客服系統選一個 AI 模型,每天要回答大量客戶問題。我先看定價頁:Claude Opus 每百萬 token 15 美元,GPT-5.5 每百萬 token 20 美元,直覺選 Claude Opus。但依照文章的方法,我改成測量「回答 100 個真實客服問題各花多少錢」:結果 GPT-5.5 完成同樣 100 題的總費用只有 Claude Opus 的一半,因為 GPT-5.5 產生的 token 更少、分詞效率更高。舊做法:只看每百萬 token 單價,選了「看起來便宜」的模型。新做法:用一批真實任務跑一輪,比較完成任務的實際總費用。這樣才能找到真正對你的使用情境最划算的模型。

T3
AI 提升設計品質,不縮短時程

設計工作室 Charming Robot 花了一年時間,把 AI 工具真正整合進產品設計流程,最後得出一個反直覺的結論:AI 並不會讓工作完成得更快,五天的衝刺週期(一種固定時間段落、集中衝刺交付成果的工作方式)一天都沒縮短。但同樣的五天,現在能交出過去做不到的完整度——所有使用者狀態、所有裝置版面一次齊備,而不是分批分階段慢慢補。他們的做法是:先寫好「體驗簡報」(把「為什麼做、預設值、有哪些狀態」寫清楚),然後讓 Claude(Anthropic 公司開發的 AI 助理)根據簡報直接生成可互動的原型(prototype,就是可以點按、模擬真實操作感的半成品介面),再由原型自動產出文件(使用者故事、流程圖、驗收條件),確保文件永遠和原型同步、不會過期。最核心的轉變是:過去以靜態文件為中心,現在改以「活的原型」為唯一可信依據,工程師拿到的永遠是最新版設計,不再靠過期說明書猜意圖。

某訂閱制媒體產品要重新設計整個訂閱流程,需要同時處理五種使用者狀態(未登入、已登入但未付費、三種不同等級的付費訂戶),並覆蓋桌機、平板、手機三種介面——合計至少十五套畫面。過去做法是分階段:先交桌機版,客戶確認後再補手機版,文件在這過程中經常對不上原型。新流程中,設計師先把五種狀態和使用情境寫進簡報,交給 Claude 生成互動原型後,系統自動把原型裡的每個設計決定轉成規格文件——每次原型一改,文件跟著重新產出。結果:同樣五天結束,交付的是完整的產品全景,工程師拿到的文件和原型 100% 一致,不需要再開會對焦「這個設計的意思是什麼」。相較於舊做法,不是速度快了,而是本來要分三輪才能交齊的東西,一輪就交完了。

T4
T4
動態推測解碼讓 LLM 高負載提速

LM Systems(負責開發 vLLM 推論引擎(就是讓 AI 模型快速回覆用戶的底層加速軟體)的研究團隊)提出了一種改良版「推測解碼(Speculative Decoding)」技術。推測解碼是什麼?簡單說,AI 在生成文字時會先用一個小模型「猜」接下來的幾個字,再由大模型一次驗證這些猜測——這樣比大模型一個字一個字慢慢生成快很多。這次的改良點在於:當伺服器處於高負載(同時有很多人在用)時,系統會自動跳過對部分草稿字元的驗證,用靈活的方式平衡速度與輸出品質,而不是像傳統方法那樣死守固定的驗證預算。依據公佈的測試數字,DeepSeek-V4-Pro 模型在單一請求(batch=1)情境下,在 NVIDIA B300 GPU(英偉達最新一代高階加速卡)上達到每秒 383.7 個 token 的輸出速度——對重視回應速度的應用來說是明顯進步。

假設一家公司用 vLLM 部署 AI 客服,白天尖峰時段同時有 500 人在問問題。傳統固定預算的推測解碼會強制驗證所有草稿字元,高負載時等待時間拉長、回覆變慢。換用這個動態方法後,系統偵測到負載升高,自動減少驗證步驟,讓每一個回覆的延遲縮短——用戶感受到的就是:即使在尖峰時段,AI 客服依舊幾乎即時回覆,不再出現卡頓。相比舊做法,同樣的硬體能服務更多並發用戶,或把省下的算力用在其他任務。