AI Daily Digest

📰 每日 AI 彙整

2026-06-28  ·  共 37 則報導
T1 爆炸重要T2 值得關注T3 一般資訊T4 參考用T5 可略過
T2
T2
DeepSeek 74 億首融 V4 定價顛覆行業

DeepSeek(一家由中國量化對沖基金幻方量化孵化、目前全球最受矚目的 AI 新創公司之一)在 2026 年 6 月完成了創立三年來的首次對外融資,募得約 74 億美元(摺合新臺幣逾 2,400 億元),估值約 600 億美元,創下中國 AI 公司的融資規模歷史紀錄。這次融資結構非常特殊:創辦人梁文鋒個人就出資逾 30 億美元,騰訊、寧德時代等商業大咖雖然跟進,卻完全沒有投票權,且資金被鎖定長達五年無法提前退出;唯一擁有直接股權與投票權的是中國國家 AI 基金,但其出資額還不到整體融資規模的 2%——相當於用象徵性的小額出資換取政治背書,而決策權仍牢牢掌握在創辦人手中。與此同時,DeepSeek 最新發布的開源模型(即公開讓任何人免費下載使用的 AI 程式)V4-Pro,在數學推理和程式設計的標準能力測試中,表現超越所有同類開源競品;其 API(開發者串接 AI 服務的計費介面)定價每處理一百萬個字元(token)僅收 3.48 美元,僅為 OpenAI 同類服務的 12%、Anthropic 的 14%,對整個 AI 行業的收費模式造成系統性衝擊,迫使產業重新評估商業模型的合理性。

假設你是一名應用程式開發者,目前用 OpenAI 的 GPT API 幫用戶提供智慧客服回應,每月 API 費用約新臺幣 9 萬元。現在你可以把日常對話切換到 DeepSeek V4-Flash(V4 系列中定位輕量快速的版本),同樣的請求量費用可降至約新臺幣 1 萬元,節省近 90%;遇到需要複雜推理或精密計算的問題(例如幫用戶分析合約條款或生成程式碼),再呼叫 V4-Pro 版本處理——這種「雙層 AI 呼叫架構」讓你在不明顯犧牲品質的前提下,把每月 AI 費用從 9 萬大幅壓低至 1 至 2 萬元。與舊做法相比,省下的預算可用來擴充服務規模或降低終端售價,對成本敏感的中小型開發者而言,DeepSeek V4 系列正在把「使用頂尖 AI」的門檻直接打穿。

T2
Lindy 棄 Claude 轉投 DeepSeek 省九成費

AI 自動化平臺 Lindy(一家 25 人的小型新創公司,讓用戶把 AI 當成「數位員工」來幫自己自動完成各種日常工作任務)宣佈,已將公司 100% 的 AI 流量從 Anthropic 的 Claude(就是開發出 Claude 這款 AI 助理的美國公司旗下模型)全面切換到中國公司 DeepSeek 的 v4 Flash 版本。觸發這個決定的核心原因非常直接:Lindy 每個月花在 AI 推理(就是讓 AI 模型實際執行任務時所需支付的運算費用,類似用計程車按里程收費)的錢,已經超過了整個公司全體員工的薪資總和,執行長 Flo Crivello 形容這是「不可持續、關乎企業生死的決定」。切換之後,AI 運算成本下降了約 90%,公司累計節省「數百萬美元」,而且在許多常用功能上,DeepSeek 的表現反而比 Claude 更好。這個案例揭示一個結構性趨勢:當企業大量依賴 AI agent(能自動執行任務的 AI 程式)時,模型費用可能在某個臨界點突然超越人事成本,逼迫企業緊急換供應商。

假設你是一家使用 Lindy 平臺自動處理客服信件、安排會議、整理合約的中小企業主。Lindy 背後的 AI 每天要替你執行成千上萬個任務,每次執行都需付「推理費用」。當任務量大到一定規模,這筆費用竟比養一整組員工還貴。Lindy 為此花了 6 到 9 個月做「離線回放評估」(offline replay evaluation,就是把過去用戶的上萬個真實請求,重新丟給新模型跑一遍並比對結果,而不是隨便測幾個問題就拍板),評估了 GLM5.1、Kimi K2.5/K2.6、DeepSeek v4 Flash 等多個模型。最終選定 DeepSeek v4 Flash 後,先讓公司內部員工小範圍試用,確認留存率正常後才逐步開放給全體用戶。遷移最大的技術代價是 prompt 重寫(就是重新調整對 AI 下指令的措辭,因為 Claude 和 DeepSeek 理解指令的風格差異顯著)。最終結果:同樣的任務量,費用降了 90%,效果不但沒退步,部分場景反而更好;Claude 仍保留供用戶主動選擇,或用於需要高精度推理的特定任務。

T2
Graphify 程式庫轉知識圖譜

Graphify 是一套開源的 AI 編程助手插件,只需執行一個指令 `graphify .`,就能自動掃描整個程式碼庫,把所有程式碼、資料庫結構(schema)、文件甚至圖片整理成「知識圖譜」(Knowledge Graph,就是把資訊用節點和連線串起來的結構化地圖,類似把一本書的重要概念畫成有關聯的心智圖)。這個工具目前支援超過 20 個主流 AI 編程平臺,包括 Claude Code、Cursor、GitHub Copilot CLI 等。它最大的亮點是效率:每次查詢消耗的 token(token 是 AI 處理文字的計費單位,花費越少代表越省錢也越快)比直接讀取原始程式碼少用 71.5 倍,而且建好的知識圖譜可以跨對話持久保存,不用每次重新掃描。這個專案在短短三個月內累積超過 72,600 顆 GitHub 星星(開發者表示讚賞的方式),爆紅速度罕見,背後更獲得矽谷知名創業加速器 Y Combinator S26 梯次支持。

假設你是剛加入某公司的後端工程師,要接手一個有一萬行程式碼的舊系統。以往做法有兩種:一是自己慢慢翻閱所有檔案,費時費力;二是把大量程式碼一次丟給 AI 助手閱讀,費用高昂且對話視窗(AI 一次能看的內容上限)很快就塞滿。用 Graphify 的話,先執行 `graphify install --platform claude-code` 安裝插件,再對著你的程式碼目錄執行 `graphify .`,幾分鐘內就會自動產出三份文件:一個可在瀏覽器互動瀏覽的圖形化地圖 `graph.html`、一份重點摘要報告 `GRAPH_REPORT.md`、以及機器可讀的 `graph.json`。之後你問 Claude Code「這個系統的訂單付款流程怎麼走?」,AI 不必重讀所有原始檔,只需查詢已建好的知識圖譜,速度大幅提升、費用省下 71 倍以上。下次開新對話,知識圖譜依然保存,不用重來——這正是舊做法最痛的地方。

T2
DeepSeek 開源 LLM 推論加速框架 DSpark

DSpark 是由中國 AI 新創公司 DeepSeek 發表的一項推論加速技術,核心方法叫做「投機解碼」(Speculative Decoding,一種讓 AI 回答速度顯著提升的技巧)。一般 LLM(就是 ChatGPT 這類大型語言模型,每次對話都要一個字一個字慢慢輸出)在生成文字時,每輸出一個 token(token 是 AI 處理語言的最小單位,大約等於半個到一個中文字)都需要讓整個大模型跑一次計算,速度受到很大限制。投機解碼的原理是加入一個小型「草稿模型」(Draft Model)先快速預測接下來可能出現的好幾個 token,再讓大模型一次批次驗證——猜對的直接採用,猜錯的才從那個位置重新生成,讓大模型每次計算可以「一次頂多次用」,大幅提升生成效率。DeepSeek 同步開源了整個 DeepSpec 框架,包含資料準備、草稿模型訓練、效果評估的完整流程,並收錄 DSpark、DFlash、Eagle3 三種投機解碼演算法,任何開發者都可以用自己的模型訓練對應的草稿模型來加速推論。

假設我在公司伺服器上部署了 DeepSeek-R1 模型,提供內部員工查詢使用,但用戶反映每次等待回答很久、同時多人使用時更慢。使用 DeepSpec + DSpark 的完整流程:第一步,用框架提供的腳本下載問答資料、讓 R1 預先生成對應的回答(建立訓練資料快取);第二步,用這批資料訓練一個小型草稿模型;第三步,部署時讓草稿模型先一口氣猜出 4~8 個 token,再讓 R1 一次批次確認——一次「確認動作」等於過去好幾次的效果。對比原本每個 token 都要等 R1 完整計算一遍,整體吞吐量(同時間可以處理的字數)顯著提升,相同硬體能服務更多並發用戶,或讓每次回應的等待時間明顯縮短。DeepSpec 把三種演算法都整合進同一套框架,開發者不需要從頭實作,只需跟著流程跑腳本,即可在自己的模型上套用投機解碼加速。

T2
VLX 端側流式多模態模型發布

杭州 AI 新創公司 Om AI 發布了 VLX 系列——全球首個專為「端側」(直接在手機、機器人等裝置上本地運行,不需連接雲端伺服器)設計的流式多模態模型。多模態(能同時處理影像、影片、文字等不同類型資訊的 AI)過去通常需要強大的雲端算力才能跑,但 VLX 從設計之初就針對算力有限的本地裝置最佳化,而非事後縮小。VLX 包含三款接力模型:VLX-Flow 負責即時感知影片串流(單路延遲僅 0.06 秒)、VLX-Seek(3B 參數)負責精確定位畫面中的物體、VLX-Go(0.6B 參數)負責規劃機器人下一步行動——三者共享同一基礎架構,能在同一支影片串流上依序完成「感知→定位→行動」的完整端到端任務,無需上傳雲端。這也正好切中 CVPR 2026 最熱兩大研究方向:Streaming(AI 即時感知連續影片)與 Grounding(AI 在畫面中精確找到目標位置),Om AI 團隊核心來自 CMU、清華、浙大及微軟、阿里等機構,其前作 VLM-R1 上線 12 小時即獲 2000+ GitHub Star。

我想讓一臺倉庫機器人持續跟隨工人並搬運貨物。舊做法需把攝影機畫面上傳雲端 AI 分析、再傳回指令,往返延遲至少 0.3~1 秒,工人一轉身機器人就跟丟,且在無 Wi-Fi 的倉庫死角完全失靈。換成 VLX 系列後,機器人本機同時運行三層:VLX-Flow 每 0.06 秒讀取一次影片快照判斷現場狀況;VLX-Seek 用 Region Token(把目標位置直接編碼成一個特殊標記,不需 AI 慢慢輸出文字座標)精確框出工人;VLX-Go 僅用 0.6B 參數(大約是一般模型的十分之一體積)就能算出下一步移動航點。全程在裝置本機完成,不需網路,整體回應延遲從 1 秒縮到約 0.06 秒,在隱私敏感或無網路的場合同樣可用。

T2
開源模型挑戰閉源霸主

開源(程式碼公開、可免費下載使用)的 AI 語言模型(Large Language Model,就是 ChatGPT 這類會對話的 AI)正在快速追上頂尖付費閉源模型。最受矚目的是中國清華大學開發的 GLM-5.2,NVIDIA 為它釋出了專為 Blackwell(新一代高階 AI 繪圖卡系列)優化的 NVFP4 量化版(一種壓縮技術,讓模型跑起來更省記憶體卻幾乎不損失準確度),同時主流部署框架 vLLM(一套廣泛用於生產環境的 AI 推理工具)也正式加入對它的支援。評測平臺 Arena 的人類偏好投票顯示,GLM-5.2 Max 在前端程式碼撰寫任務上已超過 Anthropic(做 Claude 的公司)旗艦推理模型 Claude Opus 4.8 Thinking,這個結果引發開發者圈大量討論。與此同時,Cohere 公司的 Apache 2.0(可免費商業使用的授權)開源程式碼模型,只需 20 GB 記憶體即可在本機執行,並宣稱保留超過 99% 的原始性能。更大的背景是:GPT-5.6 的存取限制引發開發者不滿,進一步推動了開源替代方案的聲勢,多位業界人士直言「限制頂尖閉源模型存取,只會讓開源生態更強」。

假設你是一個獨立開發者,想在自己的 Mac Studio 電腦上本機運行一套醫療諮詢 AI Agent(代理人,就是能自動規劃並執行多個步驟任務的 AI,例如查資料、填表、生成報告一條龍),但雲端 API 費用太貴,也擔心患者資料傳到外部伺服器有隱私疑慮。現在你可以直接下載 GLM-5.2,部署在本機 Mac Studio 上——有實際使用者回報,這套組合跑醫療代理任務的體感品質,與訂閱 Claude Code(Anthropic 提供的雲端程式碼 AI 服務)相當。差異在於:舊做法需要按 token(AI 處理文字的計量單位,大約 1000 個 token 等於 750 個英文單字)付費、資料離開你的機器;新做法一次部署、資料留在本地、執行成本幾乎為零,適合需要長時間高頻呼叫或有資料合規要求的場景。

T2
Claude Opus 4.8 電腦操作奪冠

OSWorld 2.0 是一個評測 AI「電腦操作能力」的基準測試(就是測試 AI 能不能真正用滑鼠、鍵盤完成電腦任務,例如開檔案、填表單、在網頁上點選按鈕等等),是目前這類測試中最受矚目的標準之一。最新一輪的測試結果顯示,Anthropic 的 Claude Opus 4.8 以 20.6% 的任務完成率拿下第一名,領先 OpenAI 的 GPT-5.5(約 13%)將近 8 個百分點。OSWorld 2.0 比前一版本難度更高,測試環境更接近真實電腦的複雜程度,因此所有模型得分都相對偏低,但 20% 已是目前最高水位。值得一提的是,GPT-5.5 雖然成功率較低,卻使用更少的 token(可以理解為 AI 處理訊息時的「計算量單位」,token 越少代表費用越低),在「省成本」這個面向上有一定優勢。

假設你想開發一個 AI 助理,讓它幫用戶完成「開啟電腦上的試算表 → 找到指定欄位 → 加總數字 → 切換到電子郵件應用程式 → 把結果貼到草稿裡」這種跨應用程式的多步驟任務。這正是 OSWorld 2.0 在測試的核心場景。根據本次結果,若選用 Claude Opus 4.8,大約每 5 個這類任務中會有 1 個完整成功;若選用 GPT-5.5,大約每 8 個才有 1 個成功。對開發「AI 幫你操作電腦」產品的工程師來說,Claude Opus 4.8 目前在成功率上明顯更可靠;但若任務量大、API 費用是主要考量,GPT-5.5 的 token 效率或許值得納入評估。

T2
亞洲AI新創挑戰Anthropic出口禁令

美國川普政府在 2026 年 6 月中旬,以安全為由禁止 Anthropic(一家美國知名 AI 公司,旗下有廣受企業使用的 Claude 系列聊天 AI)將旗下最強的兩款模型 Mythos 和 Fable 5(都是 AI 模型,也就是讓電腦能理解語言、解決複雜任務的核心引擎)出口給美國以外的用戶。這個禁令一出,許多亞洲企業和開發者突然無法繼續使用這兩款模型。填補空缺的速度比外界預期快得多:日本的 Sakana AI 推出了名為 Fugu 的新模型,聲稱能力與被禁的 Fable 5 和 Mythos Preview 相當,特別適合「多智能體系統」(agentic system,讓多個 AI 模型互相協作、自動完成複雜任務的架構);中國的 360 公司則推出兩款專攻資安的模型,分別用於自動偵測軟體漏洞和自動化網路防禦。這波發展讓業界開始擔心:美國 AI 實驗室是否會因為自家政府的出口管制,永久失去亞洲這個龐大市場。

假設你是一家日本軟體公司的技術主管,過去半年你們的開發團隊一直用 Anthropic 的 Mythos 模型來跑「多步驟自動化代理」(就是讓 AI 自動規劃、呼叫各種工具、一步步完成任務,不需要人工一直介入),用來自動審查程式碼和生成測試報告。出口禁令一實施,你們馬上無法繼續存取這個 API(API 就是讓你的程式直接呼叫 AI 服務的介面)。切換到 Sakana AI 的 Fugu 之後,Fugu 同樣支援多模型協作架構,且伺服器在日本境內、不受美國法規約束,你們的工作流程幾乎不需要大改就能繼續跑。相比之下,如果沒有 Fugu 這類替代方案,你們要嘛得等美國政策鬆綁(遙遙無期),要嘛得花大量時間重寫整套流程改用能力較弱的舊模型,開發進度至少延誤數週。

T2
川普政府解禁 Mythos 5 AI 模型

Mythos 5 是 Anthropic(開發出 Claude 這款對話 AI 的美國公司)推出的一款專為網路安全設計的 AI 模型(可以把它想成一個專門協助偵測駭客攻擊、防禦資安威脅的智慧工具)。2026 年 6 月 12 日,因為有資安研究人員公開聲稱能輕易突破它的安全防護機制,美國政府下令禁止使用這個模型。禁令實施兩週後,川普政府商務部長 Howard Lutnick 在 6 月 26 日正式通知 Anthropic 執行長 Tom Brown:「適當的保障措施已就位,允許特定信任合作夥伴存取 Claude Mythos 5 模型。」此次解禁的範圍涵蓋超過 100 家獲授權的美國政府機構與企業,這些機構的非美籍員工,以及 Anthropic 自家原本被禁止存取的非美籍員工,全部都在解禁名單之內。值得注意的是,同期發布的 Fable 5(防護機制更嚴密的升級版本)此次並未納入解禁範圍。

假設一家負責維運美國電力網路的關鍵基礎設施公司,旗下有來自多國的網路安全工程師。過去兩週,這些工程師即便持有公司內部授權,也完全無法使用 Mythos 5 來分析惡意程式碼或評估潛在的駭客入侵路徑,只能退而求其次改用功能較弱的工具或大量人工分析,效率大打折扣。隨著此次解禁,只要該公司列於授權名單之內,旗下所有工程師——不論國籍——現在都可以正式調用 Mythos 5,讓 AI 快速掃描異常流量模式、提出防禦建議,把原本可能需要數天的資安分析壓縮到數小時之內。這次政策轉向的意義在於:政府不再採取全面封鎖,而是改以「白名單授權」的方式,讓特定受信任機構重新取回這個強大工具的使用權。

T3
T3
LLM 補貼退場與 Token 成本策略

目前 OpenAI、Anthropic 等 AI 公司是用遠低於成本的價格在提供 AI 服務——OpenAI 每賺 1 美元就花掉 1.35 美元,Anthropic 每 100 美元的訂閱背後估計有超過 1,000 美元的基礎設施成本在支撐。這種補貼(就是廠商自掏腰包幫用戶貼錢)讓大家享受多年低價,但退場訊號已出現:GitHub 的 Copilot(一個幫工程師自動寫程式的 AI 工具)已在 2026 年改為依照實際用量計費,而非固定月費。研究預估,補貼完全退場後 LLM API(讓開發者用程式呼叫 AI 的介面)費率可能上漲 30–50%。與此同時,一個反向趨勢正在成熟:一年前還算頂尖的模型(如 Llama 3.1),現在已可在普通筆電的 NPU(筆電內建的 AI 加速晶片,功耗比獨立顯示卡低)上免費跑,讓自架模型的損益平衡點大幅提前。整體而言,這篇分析提醒開發者與企業:補貼時代養成的「token 隨便用」習慣,需要盡快用工程方法補救,否則帳單正常化時將首當其衝。

假設你的新創公司用 Claude API 做客服機器人,每天收到 5 萬則對話,每次對話都夾帶一段固定的 2,000 字「系統說明」(告訴 AI 它的角色、公司規則、回答格式)。在沒有任何最佳化的情況下,這段說明每天被重複傳給 AI 5 萬次,每次都按全價計費,一個月光輸入成本就可能超過 10,000 美元。開啟 Prompt Caching(快取機制,讓 AI 記住已讀過的固定內容、下次命中快取只收 10% 費率)之後,相同的使用量輸入成本降到約 1,000 美元,省掉 90%,且程式碼端完全不需改動業務邏輯。若日後補貼退場讓 API 費率漲 40%,沒開快取的版本月帳單衝破 14,000 美元,而已開快取的版本僅漲到 1,400 美元——差距在定價動盪時會被放大十倍以上。

T3
中國AI晶片實測遠遜H100

七家中國晶片商宣稱自家產品達到 NVIDIA H100(目前業界最頂級的 AI 訓練晶片)等級,但多家獨立機構的實測數據給出了截然不同的答案。其中表現最好的華為 Ascend 910C,FP16 算力(AI 計算時最常用的數字精度格式,可簡單理解為「算力密度」的量測指標)約為 800 TFLOPS(每秒可做 800 兆次浮點運算),僅及 H100 的 2,000 TFLOPS 的 40%;中國所有量產晶片的算力中位數更只有約 96 TFLOPS,與 H100 相差整整 8 倍。供應鏈也有重大隱患:HBM(高頻寬記憶體,讓 AI 晶片能快速讀取大量模型參數的特殊記憶體,目前全球供應由韓美廠商把持)仍是最大瓶頸,部分晶片被迫使用頻寬只有 HBM 四分之一的替代方案。製造良率同樣拖累成本,SMIC(中芯國際,中國最先進的晶圓代工廠)的 7nm 良率僅 30~40%,遠低於臺積電的 80~90%,直接讓每片晶片的實際成本幾乎翻倍。不過在 DeepSeek R1(中國領先的大型語言模型,即 AI 聊天系統)推理(讓模型回答問題的使用情境)場景中,部分國產晶片已通過中國信通院官方認證,確實具備可部署的實用性。

假設一家中國企業想用 DeepSeek R1 671B(一個擁有 6710 億參數的大型 AI 對話模型)架設客服機器人,但因美國出口管制無法購得 NVIDIA H100。他們可評估寒武紀的 Siyuan 590 晶片:先安裝 PyTorch(主流 AI 開發框架,就是大多數工程師寫 AI 程式用的工具)並搭配寒武紀的 torch_mlu 後端(讓 PyTorch 能認得寒武紀晶片的橋接套件),再跑 QiMeng-Xpiler 掃描工具,分析現有的 CUDA 程式碼(原本為 NVIDIA 晶片寫的 AI 程式)有多少比例可自動轉換——約 95% 的常見算子(AI 運算的基本單元)可自動轉換,但若有自訂的特殊運算,每個模型可能還需額外 1~2 個月人工移植。最終取得的算力約與五年前的 NVIDIA A100 相當:用來做推理(讓 AI 回答問題)足夠勝任,但若要從頭訓練新模型,速度仍會比 H100 慢 2.5~8 倍。與直接用 H100 相比,這條路功能上可行、採購管道合規,但工程準備期更長、算力天花板更低,適合「合規優先、效能其次」的部署情境。

T3
AI 寒冬歷史與 LLM 泡沫警示

一篇歷史對照分析,把 1980 年代「Lisp 機器」(當年為了跑 AI 程式而專門打造的電腦,代表廠商有 Symbolics、LMI,曾被美日政府砸下鉅額資金)泡沫破裂的故事,對比今日大型語言模型(LLM,就是 ChatGPT、Claude 這類能對話的 AI)熱潮的種種相似之處。1980 年代初,Lisp 機器被視為 AI 的未來,但不到十年,通用電腦靠大量生產壓低成本,把這些專用機器全打垮,AI 產業隨後進入長達十年以上的「AI 寒冬」(資金撤退、研究停滯的冰封期)。文章指出今日 LLM 的投資規模遠超當年,甚至接近某些小國的整年 GDP,兩個時代都犯了「過度外推」(把有限成功無限放大成對未來的全面承諾)的毛病,也都低估了把技術真正導入企業時面對的組織複雜度。作者最後自我反諷:這篇質疑 AI 的文章,標題竟然是請 ChatGPT 建議的。

假設你是某家公司的 IT 主管,2025 年花了大筆預算把客服系統全面換成某家 LLM 廠商的雲端服務。本文的警示是:若這家廠商因泡沫破裂倒閉或縮減服務,你的系統就可能瞬間停擺——就像 1980 年代買了 Symbolics Lisp 機器的大學或研究所,廠商一倒閉連維修零件都找不到。文章建議的做法是:同時接入多家廠商的 API(多廠商策略),並保留傳統人工客服備援,避免把核心業務的命脈全交給單一 AI 供應商。對比「全力押注一家前沿廠商」的舊做法,這種多元對沖策略初期成本略高,但能大幅降低廠商消失或服務中斷時的業務風險。

T3
PlayGen:單張圖片即時生成可玩遊戲

PlayGen 是中山大學團隊於 2024 年 12 月發表並開源的 AI 框架,能夠只靠一張圖片加上玩家操作指令,讓 AI 即時模擬出可互動的遊戲畫面,完全在本機電腦上運行,不需要連接雲端伺服器。它內部使用三個技術模組協同運作:VAE(一種把圖片先壓縮成簡短數字代碼、推論完再還原成畫面的技術,讓運算量大幅降低)、LDM 搭配 DiT(在壓縮空間中運作的擴散模型,也就是類似 AI 繪圖背後那套技術,用來預測玩家動作後應該出現的下一幀畫面)、以及類 RNN 記憶模組(RNN 是一種能記住前面狀態的神經網路結構,這裡用來確保遊戲不會「忘記」之前發生的事)。在普通消費級顯示卡 NVIDIA RTX 2060 上,可達到每秒 20 幀的流暢度,連續運行超過 1000 個畫面後玩法準確度仍僅下降不到 0.2%。近期因 Reddit 社群 r/LocalLLaMA 的討論串重新爆紅,引發廣泛關注。

假設我想在完全不安裝原始遊戲、也不擁有程式碼和素材版權的情況下,體驗《超級瑪利歐兄弟》的操作感。使用 PlayGen,我只需提供一張遊戲截圖,然後透過指令列輸入操作序列(例如「向右移動三步、跳躍」),AI 就會根據這張圖片和指令即時渲染下一幀——馬利歐真的往右跑、躍過水管,畫面連貫地更新下去。舊做法必須擁有遊戲引擎授權、完整素材和程式碼才能重現遊戲邏輯;PlayGen 讓 AI 直接從畫面「學會」遊戲規則並加以模擬,繞過了傳統流程。不過目前只驗證了《超級瑪利歐兄弟》和《DOOM》兩款遊戲,若想讓它學會其他遊戲,仍需自行收集大量操作錄影資料並重新訓練模型,門檻還很高,距離商業化尚有一段路。

T3
中國繞過晶片禁令手法與 NVIDIA 反制

美國政府自 2022 年起對中國實施 AI 晶片出口禁令,禁止銷售用於訓練和運行 AI 的 NVIDIA 高階 GPU(圖形處理器,現已廣泛用於 AI 運算)。2026 年 5 月,美國司法部揭露多起繞過禁令的走私案件,涉及逾 7,000 枚 NVIDIA H100/H200 晶片、金額逾 1.6 億美元。走私手法分三類:一是偽造品牌標籤混入正常貨物出口;二是透過印尼、馬來西亞等第三國雲端服務商「租用算力」,讓晶片不必實體出境就能被中國企業使用;三是透過多層空殼公司隱藏真實買家身分,聊天記錄甚至出現「不要提任何與中國有關的事」等字樣。為反制這些漏洞,NVIDIA 開發了「GPU 位置驗證」技術,利用晶片內建的機密運算(一種讓晶片內部計算結果無法被外部偽造的安全機制)測量通訊延遲,估算晶片實際所在的地理位置,使晶片本身成為合規執法的工具,此舉已引發中國網路監管機構質詢是否存在「後門」。

假設我是一家中國 AI 新創公司,無法採購被禁止的 NVIDIA Blackwell GB200(目前最新一代 AI 訓練晶片),但想使用其算力。舊做法是聯絡印尼一家電信業者,以「租用雲端算力」名義遠端使用裝有 GB200 的伺服器——因為禁令只管「實體出口」,晶片沒有跨境就不算違規。ByteDance 就透過馬來西亞業者租用了 36,000 枚 Blackwell GPU,這正是典型的雲端漏洞利用。但現在情況改變了:商務部 2026 年 6 月明確表示,只要「最終受益人」是中資企業,即使算力在境外也屬禁令範圍;而 NVIDIA 一旦部署位置驗證技術,晶片會自動回報所在地,若與申報地不符就觸發警報,相當於晶片內建了地理防護鎖。這意味著合法佈局海外算力的跨國企業,也必須重新審視股權結構和合約,否則可能在不知情下承擔法律責任。

T3
BrowserBC 人類操作蒸餾 Agent 技能

BrowserBC 是一套開源工具,由 Einsia AI 旗下的 Navers Lab 開發,目的是讓 AI 助理(Agent,就是能自動完成任務的 AI 程式)學會在瀏覽器上操作網頁——不是靠死記硬背,而是靠「看懂人在做什麼」。傳統上,要讓 AI 自動操作網頁,必須寫很精細的腳本,指定「在座標第幾行第幾列點一下」,頁面稍有變動就失效。BrowserBC 採用三個步驟:先「錄製」一個人真實操作網頁的過程,再「轉寫」成用自然語言描述的「技能卡」(記錄要做什麼、怎麼判斷完成、要注意什麼陷阱),最後讓任何 AI 模型拿著這張技能卡去執行同類任務。最關鍵的突破是:技能卡儲存的是「做事的邏輯與意圖」,而非精確的座標和選取器(HTML 網頁裡用來定位按鈕的位址代碼),所以即使網頁改版、按鈕移位,AI 仍能靈活應對,不會像舊方法一樣一碰變化就壞掉。在兩個公開評測基準(評量 AI 完成網頁任務的標準測試)上,BrowserBC 讓成功率分別提升了 20.9 個百分點和 35.5 個百分點,操作步驟次數也平均減少了 27.3%。

假設你要讓 AI 自動幫公司員工在各種旅遊訂房網站上訂民宿。舊做法:工程師要針對每個網站手寫腳本,一旦網站改版,腳本報廢、需重寫,維護成本極高。用 BrowserBC 的新做法:由一位員工親自在電腦上完整操作一遍訂房流程——輸入入住退房日期與人數、套用評分和價格篩選、瀏覽全部結果、挑選最佳房源——BrowserBC 在背後自動記錄每個步驟的「意圖」,生成一張技能卡,內容大致是「輸入基本資訊 → 套用篩選條件 → 瀏覽全部結果 → 選出最佳選項 → 確認訂單」。之後,任何 AI 模型(包括比較便宜的小型模型)拿到這張技能卡,就能在網站上穩定完成類似訂房任務,就算網站改了介面也不容易失敗。相比沒有技能卡指引的 AI,後者常常在頁面上不斷重複操作(死循環),或胡亂猜測得出錯誤訂單,而有了技能卡的 AI 則可以一路走完流程、成功下單。

T3
AI Agent 賦能一人公司實況

這篇報導採訪了多位靠 AI 獨自撐起整間公司的創業者,紀錄「一人公司(OPC,One Person Company,顧名思義就是隻有一個人的公司)」在 AI 時代的真實現況。所謂「AI Agent(AI 代理人,一種能自動接受指令、自己規劃並執行任務的 AI 機器人,不需要人一步一步指揮)」,讓以前要整個團隊才能完成的設計、開發、研究等工作,現在一個人就能包辦。這些創業者描述的新型工作模式是「一個人加一群 Agent」——人負責做判斷和決策,AI 代為執行各種具體工作。不過文章也坦誠地點出限制:面對企業客戶時仍需大量維護溝通時間、複雜專案還是需要請領域專家介入,一人公司並非萬能。

兩位遊戲獨立開發者周杰和宣醬,打算在 15 天內做出一款 3D 動作遊戲《機械漫遊》的試玩版,去參加遊戲競賽。過去製作一個 3D 遊戲角色需要外包給美術設計師,花費 5,000 到 8,000 元人民幣(相當於臺幣約 2 至 3.5 萬元);現在透過 AI 3D 生成工具(如 Tripo),同樣的 3D 角色只需 10 到 50 元人民幣,成本足足降低約 100 倍。他們如期在 15 天內完成試玩版並參賽,最終獲得 Tripo Game Jam 第一名。以傳統做法,光是美術外包費用就可能把小型獨立遊戲團隊的預算耗盡,根本不可能在這麼短的時間內完工。

T3
微軟AI職場報告:員工準備好組織沒有

微軟每年發布《工作趨勢指數》(Work Trend Index)報告,2026 年版調查了全球 10 個市場、共 20,000 名 AI(人工智慧,就是 ChatGPT 這類能理解語言、輔助工作的技術)使用者,研究員工與公司在 AI 應用上的現況落差。報告最核心的發現是:當 AI 效益不彰時,公司組織本身要承擔約三分之二的責任,個人員工的因素只佔三分之一——換句話說,員工大多已準備好用 AI,是公司的制度和文化還沒跟上。調查顯示,58% 的受訪者表示 AI 幫他們完成了一年前根本做不到的事,中國地區更高達 72%;但只有 26% 的員工認為主管對 AI 的理解程度與自己相當。報告把這個現象稱為「轉型悖論」——個人已改變,但組織的評估和激勵制度還停在舊模式,反而拖累了 AI 真正能帶來的效益。

假設一家公司引入 AI 寫作工具,讓員工用它起草報告、整理會議記錄。員工很快學會並大量使用,效率明顯提升,每天省下兩個小時。但公司的績效考核標準仍然只看「最終產出數量」,沒有衡量「用 AI 省下的時間是否投入了更高價值的工作」,獎金制度也沒有配合調整。結果員工不知道這省下的兩小時該做什麼才算「表現好」,甚至擔心被認為偷懶,AI 的效益就這樣白白流失。這正是報告點出的問題所在。微軟建議的解法是:主管要自己帶頭公開示範使用 AI、重新設計績效指標,把 AI 的應用能力納入組織正式評估,讓員工有方向感,才能真正解鎖 AI 的生產力潛力。

T3
Agent Arena Token效率評測出爐

Agent Arena(一個讓不同 AI 模型互相較量、公開評比效能的平臺)發布了一份「Token 效率基準測試」結果。Token(AI 處理語言的最小單位,中文大約 1~2 字為一個 Token;用越少 Token 完成越多任務,代表越省錢也越有效率)是呼叫 AI 服務的計費單位,所以效率高低直接影響使用成本。這份測試把「回答品質」和「Token 用量」放在同一張圖上比較,讓人一眼看出哪些模型在「花相同資源下表現更好」。根據結果,Fable 模型品質領先基準線 +14.1%,Anthropic 的 Opus 4.8 Thinking(Claude 系列的推理型 AI)領先 +9.2%,OpenAI 的三款 GPT-5.5 系列模型全部位於效率前緣上方,中國的 GLM-5.2 也接近基準線並領先 +5.1%。這種「品質 vs 成本」的評測方式,比單純看分數高低更貼近實際開發需求,因為企業在選模型時最在意的是「花同樣的錢能做到多少事」。

假設我是一家新創公司的工程師,每月要花幾千美元呼叫 AI API(讓程式透過網路使用 AI 服務的介面)來自動分類和回覆客服信件。過去看評測只能知道「哪個模型得分最高」,但高分模型往往需要消耗大量 Token 才能回答得好,費用驚人。現在有了這份 Token 效率對照圖,我可以直接比較:Fable 在同等 Token 花費下,品質比業界平均好 14.1%;換算成費用,若原本每月要花 5,000 美元才能讓某模型達到目標品質,改用 Fable 可能只需花 4,400 美元就能達到同樣效果,每月省下約 600 美元。這份評測讓「選模型」從憑主觀印象,變成有數字依據的工程決策。

T3
Cohere 用 AI 代理自動維護 vLLM 分支

Cohere(一家專門提供企業 AI 服務的公司)公開分享了一套用 AI 程式碼代理(就是能自己讀懂錯誤、自己寫程式修復問題的 AI 助手)來維護長期自訂分支的方法。他們的應用場景是 vLLM(一個廣泛被企業用來在自家伺服器上快速執行 AI 語言模型的熱門開源工具),Cohere 因為有客製需求,長期維護一份自己改過的 vLLM 版本(稱為「fork/分支」,就像從同一本食譜複印了一份,但自己又加了私房改動)。問題在於 vLLM 本身持續更新,Cohere 的分支必須定期把原版更新合併進來(這個動作叫 rebase),過程中衝突與錯誤層出不窮,傳統做法需要工程師手動排查、修復,曠日費時。現在他們讓 AI 代理全程接手這個循環:自動合併更新→跑測試→診斷錯誤→修復程式碼,一直重複直到所有測試通過為止,原本要好幾週的工作縮短至幾天,而且修復成果也回饋給 vLLM 開源社群,讓所有人受益。

假設你是一間公司的 AI 基礎設施工程師,你們用 vLLM 來跑自己部署的語言模型,但因為有特殊效能優化,你維護了一份客製化的 vLLM fork。每當 vLLM 發布新版本,你就要手動走一遍流程:先合併原版新程式碼(rebase)→ 跑測試,發現有 30 個測試失敗 → 逐一閱讀錯誤訊息,判斷是 API 介面改了、還是邏輯衝突 → 手動改你的客製程式碼 → 再跑測試確認有沒有修乾淨……這樣來回可能要花掉整整兩週。現在換成 AI 代理接手整個控制迴圈:代理自動合併、自動執行測試、自動讀懂失敗原因並產生修復程式碼、再自動重跑測試驗證,不需要工程師守在旁邊盯著。工程師只需要在最後審核 AI 的修改是否合理,整個流程從兩週壓縮到幾天,同時還能把值得共享的修復直接提交回 vLLM 主線。

T3
多家公司更新 AI 代理框架

本週多家公司同步更新了各自的 AI 代理(Agent,就是能自主執行任務的 AI 程式)框架設計。Monday.com 重建了旗下 AI 助理「Sidekick」,起因是單一代理必須同時管理超過 200 個工具,造成「上下文汙染」(Context Pollution,意思是 AI 的「工作記憶」裡塞了太多不相關的資訊,導致判斷力下降、回答品質變差)並使 API 費用大幅攀升。OpenHands 平臺則新增了支援「長程工作流程」(Long-horizon Workflow,指需要跨越很多步驟、耗時較長才能完成的複雜任務)的基礎功能。Vercel AI SDK 的 Harness API(一種統一管理不同 AI 代理的介面)宣佈同時支援 OpenCode 與 LangChain Deep Agents 兩套框架。Hermes Agent 則推出子代理委派功能(讓主 AI 把任務分派給更專精的子 AI),以及 Mixture of Agents 2.0(混合多個 AI 模型協同運作),宣稱結合 Claude Opus 與 GPT 模型後在基準測試中有顯著提升。

假設你是 Monday.com 的用戶,希望 Sidekick AI 幫你「重新規劃第三季行銷專案的時程,並通知所有相關成員」。在舊架構下,這個 AI 要同時啟用 200 多個工具(包含行事曆、郵件、Slack、報表、CRM 等),等於讓 AI 同時記住 200 種操作說明,結果它常常在工具之間搞混、回應速度變慢,每次呼叫的費用也居高不下。重建後的 Sidekick 改採「多個小代理分工」的架構——一個子代理只管行事曆,一個只管通知——每個子代理的「工具清單」縮短到個位數,AI 的工作記憶不再過載,回答速度更快、費用也隨之下降,用戶拿到的結果也更準確。

T3
AI 推論成本控制實戰分享

Baseten(一家 AI 推論服務商,專門幫開發者把 AI 模型部署到雲端並快速回應用戶請求)與 Coinbase(全球最大加密貨幣交易所之一)各自公開分享瞭如何大幅降低 AI 運算費用的實際做法。Baseten 的「推測解碼(speculative decoding,一種讓小模型搶先預測輸出、再由大模型驗證的加速技巧)」技術,透過即時訓練小草稿模型,讓接受率中位數提升 20%,有時甚至超過一倍以上。Coinbase 執行長 Brian Armstrong 公開了他們的生產環境(production,指真實上線、有真實用戶使用的系統)優化手冊:預設使用更便宜的模型、依問題複雜度路由到不同等級的 AI、重複利用暖快取(warm cache,保留已計算好的結果避免重複花費算力)、並精簡每次傳給 AI 的上下文資訊量。LangChain(一套常見的 AI 應用開發框架)也強調提示詞快取(prompt caching,讓系統記住重複的提問片段、不必每次重新計算)是讓 AI Agent(自動執行任務的 AI 程式)在商業上可持續運作的關鍵。

以 Coinbase 為例:他們在使用 AI 輔助客服和內部工具時,Token(AI 處理文字的計費單位,越多越貴)用量持續增加,但每月帳單卻降低了將近一半。關鍵做法之一是把「快取命中率(cache hit rate,指系統成功使用已存結果、免於重算的比例)」從 5% 提升到 60%——也就是說,以前每 100 次 AI 請求有 95 次都要重新計算、重新收費,現在只剩 40 次需要。搭配「依問題難度選便宜或昂貴的模型」和「每次只傳必要的對話記錄給 AI 而非完整歷史」等策略,讓他們在業務量持續成長的同時,AI 費用不增反減,達到近乎省下一半開銷的效果。

T3
代理強化學習環境擴展挑戰解析

AI 研究者 Cameron Wolfe 分析了訓練「代理型 AI」(Agentic AI,就是能自己思考、規劃並執行多步驟任務的 AI)時遇到的基礎設施瓶頸。訓練這類 AI 需要用強化學習(RL,一種讓 AI 透過反覆嘗試與獎懲回饋來自我改進的技術),同時在大量「模擬環境」中讓 AI 練習,數量可能多達幾百甚至幾千個。問題在於如果直接用 Docker(一種把程式打包隔離執行的容器技術)在本地電腦上啟動這些環境,Docker 的調度系統很快就會成為瓶頸,無法有效管理這麼多並行任務。要突破這個限制,需要引入 Kubernetes(一種可以跨多臺機器自動分配、管理大量容器的平臺),才能讓訓練規模真正擴展開來。此外,Wolfe 也特別推薦 Prime Intellect 開源的「env hub」,作為目前最實用、可直接採用的環境管理框架。

假設我要訓練一個能自主寫程式、除錯、提交程式碼的 AI 代理。強化學習的訓練方式需要同時讓幾百個 AI 副本在各自的程式碼沙盒(sandbox,隔離的練習空間)裡嘗試解題,每個副本得到對或錯的回饋後,整個模型才能從中學習並改進。若用一般 Docker 在單臺機器啟動這幾百個沙盒,很快就會遇到資源調度卡死的問題,訓練速度極慢。改成 Kubernetes 後,幾百個沙盒可以分散到多臺機器上自動管理、平行執行,整體訓練效率大幅提升。Prime Intellect 的 env hub 已把這套架構包成開源工具——研究者或工程師可以直接拿來搭建自己的 Agentic RL 訓練環境,省去從零設計基礎設施的功夫。

T3
靜態基準測試衡量記憶非智慧

這篇討論集中在學界對 AI 評測方式的批評。所謂「靜態基準測試」(benchmark,就是給 AI 模型做一套固定題目來打分的方式,類似考試),越來越被研究者質疑:這些測試測的是 AI「記住了訓練資料裡的答案」,而不是真正的「推理能力」或「智慧」。Keras(一個廣泛使用的深度學習框架)的創始人 François Chollet 指出,除非測試題目是動態生成或帶有對抗性設計(每次出不一樣的題、甚至刻意設計成模型沒見過的形式),否則高分只代表「記得多」,不代表「想得好」。研究者 Neel Nanda 也提出「模型鑑識」(model forensics,就像刑事鑑識一樣,解剖 AI 行為來找出它為何出錯)的方向。此外,也有研究者呼籲評測應該納入「實際影響力」、「品質感受」和「安全性」等面向,而不只看文字生成的標準數字分數。這些批評與改革方案即將在 ICML(國際機器學習頂級學術會議,是 AI 研究界最重要的會議之一)上正式發表。

假設我要評估一個 AI 模型的數學解題能力。若用靜態基準測試(如 MATH benchmark,裡面有固定的題庫),模型在訓練時可能已經「看過」這些題目或類似題,測試時直接「背出答案」,得到高分。但換一套全新的、訓練資料裡沒有的數學題,同一個模型的分數就會大幅下降。對比之下,動態評測(如 ARC 挑戰賽,每次出真正新穎的推理題)就能更準確分辨:這個 AI 只是在「背書」,還是真的「會解題」。現實中許多排行榜上的「頂尖模型」,在動態測試下表現往往遠不如靜態測試分數所顯示的那麼強——這正是研究者呼籲改革評測文化的原因,讓分數真正反映 AI 的能力上限,而非記憶上限。

T3
Google 多 Token 預測加速裝置端推理

Google Research 提出了一種新方法,讓已經正式發布、不能再修改的「凍結模型」(frozen model,指廠商已定型、不再重新訓練的 AI 模型)也能使用「多 Token 預測」(Multi-Token Prediction,MTP,讓 AI 每次同時預測多個字詞,而非一次只猜一個字,藉此加快輸出速度)技術。這項技術主要針對「裝置端推理」(on-device inference,指直接在手機、平板等本機裝置上執行 AI,而非每次都傳送到遠端雲端伺服器處理),可以顯著減少等待時間、降低網路依賴。過去要達到類似的加速效果,業界通常需要額外訓練一個輕量版「草稿模型」(draft model,先快速猜幾個候選字、再讓大模型驗證是否正確),但這個新方法完全不需要,直接把加速模組附加在原始模型上即可,大幅降低部署的複雜度與成本。

假設一家臺灣手機廠商要在新旗艦機上內建 AI 語音助理,使用的是 Google 某款已正式上線的語言模型。舊做法:必須另外取得或訓練一個小型草稿模型(需要技術授權、額外算力、模型管理成本),在裝置上同時維護兩個模型,空間與效率都是負擔。新做法:直接套用 Google 這個方法,把多 Token 預測模組「嫁接」到原有凍結模型,無需更動模型本身的任何參數。結果:裝置上只需一個模型,加速效果相近,部署難度大幅下降——對想在手機 AI 競爭中加速落地的廠商來說,這是實際可用的工程捷徑。

T3
fal 開源 3DREAL 3D 渲染秒變寫實影片

fal(一家讓開發者能快速部署 AI 模型的雲端平臺)開源了一個叫做 3DREAL 的工具。它建立在 LTX-2.3 之上——LTX-2.3 是 Lightricks 公司推出的開源影片生成 AI,能產出最高 4K、長達 20 秒的影片,並採用對商業用途友善的 Apache 2.0 授權。3DREAL 使用了一種叫 IC-LoRA(In-Context LoRA,一種用少量參考資料讓 AI「學會」特定風格或場景的輕量微調技術)訓練而成,核心功能是把 3D 軟體(例如 Blender)或遊戲引擎輸出的低多邊形灰色草稿動畫,自動轉換成電影等級的真實感影片。在轉換過程中,原始動畫的構圖、鏡頭運動方向與場景空間佈局都會完整保留,只有「外觀」從電腦生成的粗糙質感變成照片級寫實畫面。模型權重已上傳至 Hugging Face,也可以直接透過 fal 的線上 API 端點使用,無需自行架設環境。

假設我是一位獨立遊戲開發者,需要製作一段「城市摩托車追逐」的宣傳預告片。傳統做法是先建立完整的高精度 3D 場景與角色模型,再設定燈光、材質貼圖,最後排隊等 GPU 渲染,整個流程動輒數天甚至一週。現在改用 3DREAL:我只需在 Blender 裡快速擺出一段低多邊形灰色「積木動畫」——建築是灰色方塊、摩托車是灰色幾何體、鏡頭推軌已設定好——大概半天可完成。接著把這段粗糙動畫上傳到 fal API,在 prompt 裡加入觸發詞「3DREAL」並描述「賽博龐克夜晚城市、霓虹燈反射濕柏油路面」,3DREAL 就會輸出一段構圖完全一致、但視覺上充滿電影質感的寫實影片——鏡頭角度、摩托車移動路徑、建築位置與原始積木動畫完全吻合,省去了繁瑣的手動渲染工序,費用只按生成的像素量計算(約每 megapixel 0.0024 美元)。

T3
Gemini 推出低延遲語音串流更新

Google 的 AI 助理 Gemini(一款類似 ChatGPT 的對話式 AI 產品)近期推出了多項功能更新。最主要的更新是「低延遲 TTS 串流」——TTS 就是「文字轉語音(Text-to-Speech)」,也就是讓 AI 把文字內容直接唸出來;「低延遲」則代表等待時間縮短,聲音能更即時地播放,不需要等 AI 生成完整段落才開始播放,類似串流音樂一邊下載一邊播的概念。另一項更新是「Thinking Levels(思考層級)」功能正式推廣到網頁版、iOS 及 Android 手機平臺——這個功能讓使用者可以自行決定 AI 在回答前要「想多深」,可選擇快速但較精簡的回應,或是較慢但推理更縝密的深度思考模式。這些更新屬於 Google 持續推出的「Gemini Drops」系列產品改版計畫的一部分。

假設你是一位需要快速審聽語音稿的內容創作者,想把一篇五百字的文章透過 Gemini 轉成語音來校對。以前 TTS 串流有明顯的延遲感,系統要先把整段文字都生成完才開始播放,等待時間令人不耐。更新後的低延遲模式讓音訊幾乎一提交就立刻開始播放,邊生成邊輸出,聽起來更像真實的語音通話而非等待讀檔。另一個場景是你在手機上用 Gemini App 解一道複雜的邏輯推理題——以前只能接受系統預設的回應品質;現在可以手動選擇「深度思考」層級,讓 AI 多花幾秒仔細推導,大幅降低出現粗心錯誤的機率,對需要正確答案的場景(如數學、法律分析)特別有用。

T3
AssemblyAI 語音模型跨輪次記憶

AssemblyAI(一家專門做語音辨識 API(讓開發者把語音轉文字功能接進自己產品的服務)的公司)發布了 Universal-3.5 Pro Realtime 模型,新增「跨段上下文延續」功能,也就是讓 AI 在即時語音辨識時記住前面說過的內容。傳統的即時語音辨識(把麥克風輸入即時轉換成文字的技術)每段音訊都是獨立處理,完全不知道前面說了什麼,因此遇到短句、念出來的 Email、或名字等情況特別容易出錯。新模型有兩種記憶方式:一是開發者透過程式參數主動傳入「AI 助理剛問了什麼問題」,讓模型知道當下的對話脈絡;二是模型本身會自動保留一小段對話記憶,就算開發者不傳任何資訊,也不會每次都「從頭開始」,這功能預設開啟。根據針對 20,000 個語音 AI 音訊檔的測試,啟用此功能後可降低 10.2% 的字詞辨識錯誤率,且已包含在現有定價(每小時 $0.45 美元)中,不需額外付費。

假設我在開發一個語音 AI 客服系統,機器人問使用者:「請問您的 Email 是?」,使用者口頭回答「user at assembly a i dot com」。傳統即時語音辨識不知道前面問了什麼,只會把這段話照字面轉成文字「user at assembly a i dot com」,而不是正確的 user@assemblyai.com。使用 Universal-3.5 Pro Realtime 後,開發者把「請問您的 Email 是?」作為上下文資訊傳進模型,模型就能推斷這是一個 Email 地址,自動正確辨識成 user@assemblyai.com。實際有生產環境的團隊在結合這項功能後,將每段話的辨識錯誤率從 26% 大幅降到 9%,效果相當明顯。

T3
Mistral OCR 4 基準測試遭質疑

Mistral 是一家法國 AI 公司,他們發布了一個叫做 OCR 4 的文件解析模型(OCR 是讓電腦自動辨識掃描文件或圖片裡文字的技術)。Vik Paruchuri 是另一個文件解析工具 Chandra 2 的開發者,他公開質疑 Mistral 在官方 benchmark(基準測試,就是業界用來比較不同 AI 模型表現優劣的標準化評分方式)報告中,刻意呈現對自己有利的數據。Paruchuri 指出,Mistral 的比較圖表中把 Chandra 2 的分數列得遠低於其公開程式碼庫(即 GitHub 上任何人都能跑的測試)所得出的實際成績。此外,Mistral 還完全略去了另一個表現出色的競品工具 Infinity Parser(它達到 87.6% 的準確率),讓自家產品在比較上看起來更突出。

假設你是一位需要選文件解析工具的開發者,正在評估要用哪個 AI OCR 服務來處理大量 PDF 合約。你看到 Mistral 官方發布的比較表,裡面顯示 Mistral OCR 4 大幅領先 Chandra 2,於是準備採購。但如果你去 Chandra 2 的 GitHub 頁面自己跑測試,或查看第三方評測,會發現 Mistral 引用的 Chandra 2 分數根本與公開結果不符——真實分數比表中顯示的高出許多。更重要的是,你完全不會從 Mistral 的報告裡知道有 Infinity Parser 這個選項(準確率 87.6%),因為 Mistral 根本沒把它列進去。這類「挑選性基準測試(cherry-picking benchmark,刻意選對自己有利的數據或對手的舊版本做比較)」是 AI 產品行銷的常見手法,提醒開發者在看廠商自行發布的比較報告時,最好同時查原始論文或開源社群的獨立測試結果來交叉驗證。

T3
LlamaParse 成為 n8n 認證節點

LlamaParse 是由 LlamaIndex(一個幫助開發者把 PDF、Word、報表等各種格式檔案連接到 AI 的開發框架)推出的文件解析工具,能把複雜文件轉換成 AI 可以理解的結構化文字資料。n8n 則是一個開源的自動化工作流程平臺(概念類似 Zapier 或 Make,可以把各種軟體工具串接起來,讓資料自動在不同服務間流動,且能自架在自己的伺服器上、資料不必上傳到第三方)。這次更新讓 LlamaParse 成為 n8n 的「官方認證社群節點」,表示它通過了 n8n 官方的品質審核,可以在 n8n 的視覺化工作流程介面中直接拖拉使用,不需要自己手寫 API 串接程式碼。支援的操作涵蓋解析(把文件轉成可讀文字)、擷取(抽出指定欄位)、分類(判斷文件類型)、切分(把長文件分段)、搜尋,也能作為 AI 代理人(AI agent,就是能自主規劃並執行多步驟任務的 AI)所呼叫的工具。

假設你的公司每天收到大量 PDF 合約,需要從中抓出合約日期、金額、甲乙方名稱,並自動存入資料庫或觸發後續審核流程。過去要做到這件事,工程師必須自己寫程式呼叫 LlamaParse API、處理回傳格式、再手動串接 n8n——步驟繁瑣,非工程師完全插不上手。現在只需在 n8n 介面的節點庫搜尋「LlamaParse」,把節點拖進流程圖、選擇「擷取」模式並設定要抓的欄位,儲存後 n8n 就會在每次收到 PDF 時自動解析、輸出結構化資料,再接到下一個節點自動寄通知信或寫入 Google Sheets。對比舊做法,省去了維護 API 串接程式碼的工作,業務人員自己也能完成整條自動化流程的設定。

T3
阿里 Qwen 影像生成代理框架

阿里巴巴發表了 Qwen-Image-Agent,一個專門解決 AI 圖像生成「上下文鴻溝」問題的 Agent(代理,就是能自主規劃並依序執行多個步驟的 AI 程式)框架。所謂「上下文鴻溝」,是指使用者輸入的提示詞(prompt,即你告訴 AI 要畫什麼的那段文字)往往資訊不夠完整,而文字轉圖像模型需要更豐富的背景才能生成準確的圖。這個框架整合五大能力:規劃、推理、搜尋、記憶與回饋,讓 AI 在生成圖像前先主動補齊缺少的資訊、自動橋接這道鴻溝。研究團隊同步推出評測基準 IA-Bench(Image Agent Bench),在 WISE-Verified 與 Mind-Bench 等知識密集型測試中超越現有多個強基線模型。

假設你想生成一張「2024 年巴黎奧運開幕式主視覺海報風格的圖像」,一般文字轉圖像工具(如 Stable Diffusion、Midjourney)可能因為沒有足夠背景知識,畫出不符合事實或風格錯誤的畫面。Qwen-Image-Agent 會先分析這個提示詞缺少哪些上下文——例如奧運配色、標誌性地標、視覺元素——然後透過搜尋功能查詢相關資料,再結合記憶(累積的知識庫)和多步推理,自動組合出更完整的生成指令,最後交給底層圖像模型生成結果。舊做法是使用者自己把提示詞寫得無比詳細(通常很費心力且難以做到),新做法是 AI 代理幫你自動補齊所有缺漏,普通使用者只需輸入簡短需求即可。

T3
百餘 Agent 協作讓 Gemma 4 推理提速 5 倍

Hugging Face(全球最大 AI 模型分享平臺,類似 AI 界的 GitHub)的共同創辦人 Thomas Wolf 分享了一項實驗:讓超過 100 個 AI agent(就是能自主規劃、執行任務的 AI 程式)互相協作,共同對 Gemma 4(Google 釋出的開源大型語言模型(就是和 ChatGPT 同類型、能讀懂人類文字的 AI 程式),規模數百億參數)進行推理加速優化(讓 AI 「想」事情時跑得更快)。最終成果是推理速度提升了整整 5 倍。這個案例最引人注目之處在於:不是由人類工程師手動調校,而是靠一群 AI 自己協商、分工、測試、改進,達到大幅提速的效果。

假設你要在自己的伺服器上跑 Gemma 4 為客戶即時回覆問題,原本每秒只能回應 2 個請求,用戶常常要等好幾秒才看到答案。傳統做法是請資深工程師花數週時間人工分析模型結構、調整運算排程、測試各種量化方式(把模型數值壓縮以加快計算)。而這個多 agent 協作方案則是:啟動 100+ 個 AI agent,每個 agent 負責探索不同的優化策略(有的測 kernel 融合、有的試 batch 排程、有的調記憶體佈局),各 agent 跑完後回報結果,再由協調 agent 彙整並決定下一步探索方向——整個流程自動循環。最終讓同一臺伺服器每秒能處理 10 個請求,等待時間從數秒縮到不到 1 秒,且全程不需工程師手動介入。相比傳統人工調校,這套方式大幅縮短了優化所需時間。

T3
創辦人用 Claude 打贏癌症之戰

一位 35 歲的科技新創創辦人 Connor Christou 在確診罕見侵襲性癌症(非霍奇金淋巴瘤)後,把自己所有的醫療資料——血液檢驗報告、全身掃描數據、智慧手環紀錄、每日症狀日誌——全部輸入 Claude(Anthropic 開發的 AI 對話助理,就是類似 ChatGPT 的那種工具)。這個案例說明瞭一件事:AI 不是用來取代醫生的,而是幫助病患「問出更好的問題」,讓自己在複雜的醫療決策中不再茫然。他在六個月化療後達成完全緩解(也就是檢查不到任何活躍腫瘤),其中一個關鍵轉折點,就是 Claude 幫他識別出一個連多位醫生都一時忽略的罕見現象,讓他避免了不必要的放射治療。這個故事展示了 AI 在個人醫療決策輔助方面的真實潛力,也點出了一般人如何利用 AI 來消化艱澀的醫療資訊。

Christou 最後一次 PET 掃描(一種用來偵測癌細胞活動的全身影像檢查)結果模糊——影像上仍有亮點,醫療團隊傾向安排放射治療。他不確定是否要接受這個建議,於是把三次 PET 掃描報告加上一份 MRI 影像資料,全部丟給 Claude,請它分析「這些亮點到底是什麼?」。Claude 比對資料後,指出一個罕見但有據可查的現象:年齡 40 歲以下且從此類淋巴瘤康復的患者,化療後胸腺(位於胸腔的免疫器官)有可能重新活化、出現暫時性增大,在影像上看起來就像腫瘤殘留。Claude 評估他屬於這種「胸腺反彈」的機率約 90%,而非活躍疾病復發。Christou 帶著這份分析去請教三位額外的醫學專家,全部確認這個判斷正確。最終他沒有接受放射治療,直接進入觀察期,確認完全康復。如果他沒有用 AI 輔助查詢,很可能就直接接受了本來不必要的放射線照射。

T3
半數Claude用戶說AI能做一半工作

Anthropic(就是開發 Claude 這款 AI 助手的美國公司)針對近 9,700 名 Claude 用戶進行了一份調查,結果相當驚人:大約一半的受訪者表示,AI 現在已經能夠處理他們至少一半的日常工作任務。換句話說,這些人每天的工作,有一大半已經可以交給 AI 來做或協助完成。更有趣的是,往後 12 個月的展望:有 26% 的受訪者預期,屆時 AI 能替他們分擔高達 60% 到 90% 的工作量。調查也揭露了不同族群的心態差異——剛進職場的年輕工作者對 AI 取代工作感到最憂慮;但另一方面,平常最頻繁使用 AI 工具的重度用戶,反而對自己的職涯發展最樂觀,他們認為越懂得善用 AI,自己就越有競爭優勢。

假設你是一位每天需要寫報告、整理會議記錄、回覆大量電子郵件的行政人員。以前這三件事加起來可能要花你六個小時。根據這份調查中的重度 Claude 用戶實際做法:他們會把會議錄音丟進 Claude,讓 AI 自動整理成結構化的會議記錄;再把一堆散亂的資料貼給 Claude,要它彙整成一份報告草稿,自己再稍作修改;最後連例行性的客戶回信也讓 AI 起草初稿,確認語氣後直接發送。實際效果:原本六小時的工作可能壓縮到兩到三小時,空出來的時間可以去做更需要人際判斷或創意的事。與沒有使用 AI 的同事相比,這些人的產出量幾乎翻倍,而且整體工作滿意度反而提高——這也解釋了為什麼重度使用者對 AI 帶來的未來更感到期待,而非恐懼。

T3
iLLaDA 擴散語言模型媲美 Qwen2.5

ByteDance(抖音母公司)和中國人民大學研究團隊共同發布了 iLLaDA,一個擁有 80 億參數(參數量是衡量 AI 模型規模的指標,越大通常理解能力越強)的語言模型,但它產生文字的方式和 ChatGPT、Claude 截然不同。主流 AI(稱為「自迴歸模型」)像打字一樣從左到右一個字一個字生成,前面寫了就不能改。iLLaDA 採用的是「擴散」方式——先把所有要填的位置全部空著(像一張佈滿空格的填字遊戲),然後透過多輪迭代同時把所有格子由模糊變清晰,最終輸出完整文字,這個概念來自 Midjourney 等圖像生成 AI 的技術原理。iLLaDA 在 12 兆個 token(token 是 AI 處理文字的基本單位,大約是半個英文單詞或一個中文字)的資料上訓練,基礎版本在多項測試中平均 63.9 分,勝過 Qwen2.5 7B(阿里巴巴的主流開源模型)的 63.3 分,在推理測試 BBH 上更以 71.3 對 63.9 明顯領先。不過,進行指令微調(即讓模型學會按照用戶指示做事)後,iLLaDA 的分數只有 67.1,而 Qwen2.5 同版達到 77.1,差距主要出在數學解題和寫程式兩個領域;研究團隊坦承目前缺乏強化學習對齊訓練,且模型在複雜任務上容易陷入推理循環。

假設我想請 AI 幫我寫一段 100 字的電商產品介紹。傳統自迴歸 AI(如 ChatGPT)會從第一個字開始依序寫到最後,像打字機一樣:打出去的字就固定了,後面的字只能根據前面已寫的內容繼續,無法回頭修改第一句。iLLaDA 的做法則像用鉛筆打草稿再反覆修整:先把 100 個位置全部填入模糊的初步猜測,第二輪再同時調整所有位置,幾輪之後才輸出最終版本——理論上能讓後半段的詞句去「影響」前半段。在這類基礎生成任務上,iLLaDA 目前的品質已可接近 Qwen2.5。但如果改成「請幫我解這道數學應用題並寫出程式」,iLLaDA 的表現就明顯落後,還需要額外的強化訓練才能趕上主流水準。

T4
T4
Revise 推出寫作歷程回放功能

現在的 AI(人工智慧,就是像 ChatGPT 那樣能寫文章的程式)寫作能力已強到幾乎無法用肉眼分辨「這段文字是人寫的還是 AI 生成的」。各種 AI 偵測工具(專門判斷文字是否由 AI 產生的程式)準確率也越來越不可靠,導致師長、編輯、僱主等人愈來愈難信任所看到的文章。面對這個信任危機,線上寫作編輯工具 Revise 推出了「完整歷程回放」新功能,能把使用者從第一個字到最後一個字的打字過程,錄成像影片一樣的動態回放,讓任何人都能親眼見證文章是由真人一字一字打出來的。這個功能可以用連結分享給其他人觀看,用具體的打字行為做為「人工創作」的證明,不再只靠文字宣稱「我發誓是我寫的」。

假設你是一名大學生,繳交了一篇報告,教授懷疑是 AI 代寫。用舊方法,你除了口頭說「真的是我寫的」,幾乎無法提供其他證據,因為連 AI 偵測工具都可能誤判。現在如果你平時在 Revise 上寫作,它會自動記錄每一次的輸入、刪改、段落搬移的完整順序。繳交時,你附上一條回放連結,教授點開就能看到你在鍵盤上逐字完成整篇文章的過程——包括你改了第二段三次、在結論段上停頓很久再繼續打——這種動態紀錄遠比靜態文字更難偽造,實質上提供了可驗證的人工創作證明,解決了口說無憑的困境。

T4
AI 論文速覽 視覺理解與代理訓練

這篇彙整整理了四篇跨領域的 AI 最新研究論文,主題涵蓋多模態(就是能同時理解文字、圖片、影片等不同類型資訊的 AI 技術)以及代理訓練(讓 AI 能夠自己計畫、執行一連串動作來完成任務的技術)。其中 Confidence-Aware Tool Orchestration 專注於讓 AI 在分析影片時,能根據自己對每個分析工具有多少把握,來決定要用哪個工具,讓影片理解更穩定可靠。ViQ 這篇論文則研究如何讓 AI 把文字和視覺(圖片、影像)的理解方式「對齊」,讓模型能更精準地依據文字描述找到對應的視覺內容。最受關注的 JERP 論文提出一種方法,讓 AI 代理在執行任務留下的「操作紀錄」(稱為軌跡)中學習,同時產出人類看得懂的規則說明(可解釋規則池),讓工程師能理解 AI 為何做某個決策。

假設你在訓練一個 AI 代理幫你自動測試網頁,它每次操作都會留下紀錄(例如:點了哪個按鈕、填了什麼表單、遇到什麼錯誤)。用傳統方法,這些紀錄只是拿來讓模型的參數(也就是 AI 的「大腦設定」)更新一次,下次遇到類似情境未必會變得更聰明,也無從得知 AI 為什麼做那個選擇。JERP 的方法在更新參數的同時,也會從這些紀錄中萃取出人類可讀的規則,例如「當登入失敗超過三次,先清空 Cookie 再重試」。工程師可以審閱這些規則是否合理,甚至手動修改錯誤的規則——這是舊方法做不到的,因為舊方法的「學習」全埋在難以解讀的數字參數裡。

T4
Claude Fable 5 疑回歸係介面誤判

近日 AI 社群(使用和討論 AI 工具的網路圈)一度盛傳,Anthropic(Claude 這款 AI 的開發公司)旗下的 Claude Fable 5 模型(Anthropic 一款先前下架或限量的 AI 語言模型)似乎悄悄重新上線。起因是有用戶在社群媒體上貼出疑似出現 Fable 5 的截圖,引發廣泛轉傳與討論。然而,Anthropic 官方工程師隨即在推文中澄清:他們對 Fable 5 的實際流量(也就是真正被送到這個模型去處理的使用者請求數量)是「零」,Fable 5 及相關的 Mythos 模型完全沒有對任何人提供服務。最後確認的原因是介面顯示錯誤(UI bug,也就是畫面上的標籤顯示出了問題)或是有人刻意製作假截圖,並非模型真的重新開放。

想像你是一名開發者,在 Twitter 上看到有人說「Claude Fable 5 回來了!」並附上截圖,立刻興奮地開啟 API(應用程式介面,讓你的程式能呼叫 AI 功能的通道)想搶先試用。但根據 Anthropic 官方說法,後端根本沒有為 Fable 5 分配任何流量,你的請求會被分配到其他模型或直接失敗,根本不是真正的 Fable 5。這個事件提醒開發者:AI 社群中的「模型目擊報告」往往在官方確認之前無法輕信,截圖可能因介面 bug 或惡意偽造而失真,應以 Anthropic 官方公告或 API 文件為準,而非依賴社群傳言。