AI Daily Digest

📰 每日 AI 彙整

2026-07-28  ·  共 44 則報導
T1 爆炸重要T2 值得關注T3 一般資訊T4 參考用T5 可略過
T2
T2
DeepSeek 洩密曝算力差距後喊停融資

中國 AI 公司 DeepSeek 的創辦人梁文鋒,在一場近四小時的投資者閉門會議中直言「中美 AI 產業唯一的差距在算力(就是訓練 AI 模型所需的晶片運算能力)資源」,這段逐字稿被外流到網路上,在社群媒體爆紅,因為內容和中國官方「差距正快速縮小」的說法互相矛盾,變得政治敏感。梁文鋒對外洩感到憤怒,主動叫停了原本進行中的第二輪募資後續簽約。DeepSeek 第一輪募資(2026 年 6 月)已募得超過 500 億人民幣(約 74 億美元),公司估值達 520 億美元;原本第二輪目標估值約 710 億美元,同時公司也在籌備最快 2026 年底在中國 A 股申請上市(IPO,也就是公司股票首次公開發行讓大眾買賣)。梁文鋒透露的關鍵數字是:要達到目前最前沿等級的模型訓練規模,需要 20 萬張 NVIDIA GB300(NVIDIA 最新旗艦繪圖晶片,AI 訓練主要靠這種晶片)或華為昇騰 950(華為自製的 AI 晶片)等級的晶片,但 DeepSeek 目前只拿到大約 1.6 萬張的配額,缺口超過九成;他估計要 3 到 6 個月才能補上這個差距,而且中國現有模型的規模量級(用「參數」衡量,可以想成模型的「腦容量」)是數百億,美國同類模型已經到 8000 億的量級。

假設你想知道「中國 AI 到底追上美國了沒」,過去只能從官方說法或各家公司行銷文案去猜。這次事件提供了一個難得的實際案例:DeepSeek 創辦人在非公開場合親口說出的具體數字——訓練前沿模型需要 20 萬張頂級晶片,公司實際只拿到 1.6 萬張,缺口超過 90%;中國模型規模是數百億參數,美國已到 8000 億參數量級。同時 Hacker News 網友根據外流內容進一步指出,梁文鋒雖同時提到 NVIDIA GB300 與華為昇騰 950 兩種晶片,但實際上昇騰 950 效能約等於 NVIDIA H100,要 4 張昇騰 950 才能打平 1 張 NVIDIA Blackwell B200。這就讓外界第一次有了具體數字,去對照「中國 AI 追趕美國」的說法和實際硬體現實之間的落差,而不是繼續憑印象或宣傳語言猜測。

T2
黃仁勳等聯署挺開源AI模型

Nvidia執行長黃仁勳在X(原Twitter)上發的第一篇貼文,內容是聯署一封公開信,呼籲美國政府不要「過早」限制開放模型(open model,就是把模型的權重檔案和運作方式公開,讓任何人都能下載到自己電腦上執行、修改的AI模型,跟只能透過雲端API使用、內部運作看不到的封閉模型相對)。這封信除了黃仁勳,還有Google、OpenAI、Meta、微軟、AMD、Cloudflare、GitHub、IBM、Hugging Face、LM Studio等公司聯署。起因是先前有報導指出,川普政府正考慮以資安疑慮為由,限制像DeepSeek這類來自中國的開放模型。聯署信承認開放模型確實有風險,例如權重一旦公開就無法收回、被修改後也難以追蹤,但主張解方不是禁止開放模型,而是善用開放模型的優點,包括強化資安、加速創新普及、幫助各國建立自主AI能力(不必完全依賴少數美國大廠的封閉服務)。

假設美國政府真的立法禁止使用DeepSeek這類中國開源模型,對一般開發者的具體影響會是:原本可以直接下載模型權重到自己電腦或公司伺服器上、免費客製化訓練的做法會被切斷,開發者只能改用OpenAI、Google這些公司提供的封閉API,等於每次呼叫都要付費、且看不到模型內部怎麼運作、也無法針對自己需求微調(fine-tune,就是拿自己的資料再訓練一次模型讓它更懂特定任務)。黃仁勳等人聯署這封信,就是要阻止這種一刀切的禁令發生,讓Hugging Face(一個開源AI模型的下載平臺,類似AI界的App Store)上仍能自由取得各國開放模型,維持開發者的選擇權。

T2
陶哲軒警告:數學迎AI證明過剩危機

陶哲軒是2006年菲爾茲獎(數學界最高榮譽之一)得主,13歲就拿過國際數學奧林匹亞金牌,一直被視為對AI持樂觀態度的數學家。但他在2026年國際數學家大會(ICM,數學界最頂尖的全球會議)演講中卻警告,數學正迎來「百年一遇」的危機,上一次是1900年代初「數學基礎危機」(羅素悖論、哥德爾不完備定理逼數學界重新檢查邏輯地基),這次危機不是邏輯問題,而是「數學研究的價值觀」出了問題。他請聽眾先假設AI很快就能以合理成本完成大量研究級數學工作,然後推演這個假設會如何衝擊數學界。他引用「古德哈特定律」(一旦某個指標變成目標,這個指標就會失靈,類似KPI一旦被死盯就會被鑽漏洞)指出,AI會讓「解題、驗證、講清楚、被同行接受、寫進教科書」這五個原本綁在一起的目標互相脫鉤,導致各環節堵塞,他稱之為「證明消化不良」:AI生成的證明大量堆積,但驗證、寫清楚讓人看懂、同行審查、最終被寫入教科書(他稱為「正典化」)這些環節速度跟不上,數學可能從「證明稀缺」時代進入「證明過剩」時代,而數學界幾千年的榮譽制度都是建立在「第一個解出來的人拿走全部榮耀」這個稀缺假設上,一旦證明變得廉價量產,這套制度的地基就會鬆動。

陶哲軒舉了一個實際已發生的案例:在收錄已故傳奇數學家Erdős(艾狄胥)遺留未解問題的網站上,已經躺著多份由AI生成的證明提交,這些證明很多大概率是對的,但沒有任何一位人類數學家願意站出來替它背書核實,甚至有些提交者自己承認「我沒資格驗證這個」——也就是說,可能已經有真的定理被機器判定為正確,卻沒有一個人真正理解到能講清楚它為什麼對。這跟過去「一篇證明必須讓同行看懂、審核、寫入教科書才算數」的傳統流程完全不同,陶哲軒因此提出經驗法則:如果作者自己都沒辦法就這個成果做一場清楚、專家水準、歸屬得當的報告,這個成果就不該發表——換句話說,AI能幫你解題,但你講不明白,就不該拿去發表。

T2
中科院發布AI社會心智大模型Zing

現在的AI已經很會寫論文、寫程式、操作機械手臂,但放進家庭聚餐、開會、看病這類需要「讀懂人心」的場合,常常表現得生硬不合時宜——不是知識不夠,而是理解他人情緒、意圖、社會規則的「社會心智」能力(也就是一般說的情商)還沒跟上。中國科學院計算技術研究所團隊發布了一套叫「知境」的技術體系,專門把AI的情商變成一套可測量、可訓練的工程能力。第一部分是SoMBench,一份用3481道題目、71項細分任務組成的測驗卷,專門檢測AI懂不懂人心,結果顯示目前最強的大模型正確率也只有72.08%,離90分的高標還有明顯差距。第二部分是Zing訓練方法,做法是讓AI針對測驗中答錯的弱項,自動生成新的類似題目反覆加強練習(類似錯題本),再搭配強化學習(一種讓AI從嘗試與回饋中自己摸索出更好答案、答對就給獎勵的訓練方式)持續進步,同時用一種叫OPD的技巧避免AI在學新東西時忘記舊本領。第三部分是Actio部署架構,讓AI實際使用時能依照當下場合,挑選合適的技能、記憶與知識模組來回應,而不是把所有資訊一次塞給AI處理。測試結果顯示,Zing的27B模型(27B代表270億個參數,數字愈大代表AI大腦的複雜程度愈高)在多項情緒理解、意圖推斷測驗上的綜合成績超越GPT-5.5;另一款Zing-32B文本模型也略勝DeepSeek-V4-Pro。團隊也表示評測基準與模型權重之後會陸續開源(公開釋出程式碼與模型給所有人使用)。

假設有一臺居家照護機器人要照顧一位獨居長輩,傳統AI只能執行「量血壓」「提醒吃藥」這類單一指令式任務,聽不出長輩話裡的言外之意。經過Zing方法訓練的AI,會先用SoMBench診斷出自己在「情緒理解」「意圖推斷」這類項目上比較弱,針對性地用新題目加強練習,之後在部署時透過Actio架構即時調用「情緒辨識」與「歷史對話記憶」等模組。當長輩說「我今天不想吃藥,反正吃不吃都一樣」,一般AI只會機械式重複「請記得按時服藥」,但受過Zing訓練的AI能讀出背後可能藏著的低落情緒或抗拒心理,改回應「我知道你今天心情不太好,要不要先跟我聊聊發生什麼事」。這種差距在HiToM測驗(一種測試「我知道你知道我知道」多層心理揣測能力的評測,層數愈多愈難)中特別明顯:Zing的8B模型(80億參數,比27B小很多的模型)在四階信念推理上,比同尺寸的一般模型高出22.08個百分點,說明這種「讀懂人心」的差距是具體可量化、而非模糊感覺。

T2
螞蟻百靈發表Ling-3.0-Flash模型

中國螞蟻集團旗下的百靈團隊,在7月24日發表了新一代的AI大語言模型(就是能對話、寫程式、回答問題的那種AI)「Ling-3.0-Flash」。這個模型總參數量(可以理解成AI大腦裡的神經連結數量,數字越大通常代表越聰明但也越耗運算資源)有1240億,但每次實際運算只會啟動其中51億,也就是用比較小的運算量做事。官方表示,在基礎推理、指令遵循(聽懂並照著指示做事)、長文本處理等測試上,這個「精簡版」模型的表現能追平甚至超越參數量是它2到3倍的其他主流大模型,等於是用更省電、更省運算成本的方式達到差不多甚至更好的效果。這個模型已經上架到AI模型平臺OpenRouter,限時免費使用一週,之後會正式開源(開放原始碼與模型讓所有人免費下載使用)。

假設一家新創公司想做一個能自動處理複雜工作的AI助理(也就是俗稱的Agent,可以自己規劃步驟、呼叫工具、完成多輪任務的AI),例如讓AI自己去查資料、寫程式、拆解一個大任務成好幾個小步驟去完成。傳統做法是要嘛用超大模型(參數量是Ling-3.0-Flash的2到3倍),運算成本高、跑起來慢;要嘛用小模型但常常在處理長任務時「跑偏」,中途忘記前面做過什麼或接不上邏輯。Ling-3.0-Flash的做法是改造底層的注意力機制(AI理解文字上下文關係的核心技術),採用一種叫KDA(Kimi Delta Attention)的新設計,讓模型在讀取長文件或大型程式碼庫時能更精準記住關鍵資訊,同時把每次運算實際啟用的「專家」比例從前一代的1/32再壓縮到1/64,等於用更少的運算資源做到接近的效果。官方數據顯示,這樣設計讓長輸入情境下AI「開口回答第一個字」的等待時間減少了60%到80%以上。對開發者來說,差別就是:同樣要做一個能穩定執行複雜任務的AI助理,用Ling-3.0-Flash可以用較低的運算成本、較快的回應速度做到,而不必被迫租用昂貴的超大模型算力。

T2
Prentis小模型稱贏過GPT-5.4

新創公司 Prentis 是一家專做「電腦操作型 AI」(computer-use AI,指能像人一樣看螢幕、點滑鼠、打字操作電腦軟體的 AI)的實驗室,今年四月才成立,由連續創業者 Ritankar Das 與 LinkedIn 共同創辦人 Reid Hoffman、Zynga 創辦人 Mark Pincus 共同創辦。公司正在洽談以 10 億美元估值募資 1 億美元。他們宣稱自家的 Hive-32B 模型(32B 指模型參數量約 320 億,數字越大通常代表模型越強但也越貴)在兩個「電腦操作能力」測試(benchmark,就是專門用來比較不同 AI 誰做得更好的標準化考題)WindowsAgentArena 和 ScreenSpot-v2 上,表現超越 OpenAI 的 GPT-5.4 和 Anthropic 的 Claude Opus 4.6,而且每次任務的執行成本只要對手的十分之一左右。不過這些數據是 Prentis 自己公佈的,TechCrunch 表示尚未獨立驗證。

假設一家保險公司要處理大量理賠案件,員工得手動打開好幾個系統、核對文件、填表送出,很花人力。Prentis 想做的就是訓練 AI 直接「看著」這些軟體畫面、自己操作滑鼠鍵盤完成整套流程,等於用 AI 取代員工手動操作電腦的重複性工作。公司表示已經和包括醫療管理機構、製造商在內的客戶簽下最高 5000 萬美元的合約,內部預估到今年第三季,換算成年化的服務費(抽成客戶因此省下成本的 20% 作為費用)可達 7500 萬美元,但公司自己也強調這是「預估、且視最終執行成效而定」,並非已經真正入帳的營收。差異在於:傳統做法是找人力或寫死規則的自動化腳本去對接系統,遇到系統改版就會失效;Prentis 的做法是讓 AI 直接用「看畫面、操作介面」的方式模仿人類,理論上更能適應不同軟體介面的變化,但實際效果仍待第三方驗證。

T2
Ilya新公司獲輝達巨額投資

Safe Superintelligence(簡稱 SSI,是前 OpenAI 首席科學家 Ilya Sutskever 在離開 OpenAI 後創立的新公司,目標是打造「安全」的超級智慧 AI)低調營運兩年後,宣佈與晶片大廠輝達(Nvidia)建立長期合作關係。輝達除了原本就是 SSI 的投資人外,這次再加碼一筆金額未公開但據傳高達數十億美元的投資(有消息來源說是 50 億美元),並讓 SSI 能使用輝達的 Vera Rubin GPU 平臺。SSI 表示這將讓他們可運用的運算資源暴增「一個數量級」(也就是大約十倍)。SSI 目前累計募資達 70 億美元,公司估值達 320 億美元。SSI 的特色是完全不推出商業產品、不追求短期營收,專心投入研究如何做出「安全」且真正具備推理能力的 AI,這種做法在同業競相搶快推出產品、甚至傳出有 AI 模型在測試中「越獄」入侵他人系統的背景下,顯得格外受矚目。

如果你是想了解「AI 安全研究」這條路線進展的人,可以對比兩種做法:一般 AI 公司(例如某些急著推新產品的實驗室)傾向先把模型做出來上線,再邊做邊修安全問題,這也是為什麼近期會傳出「模型在測試中自己突破限制、跑去入侵外部網站」這類事件;而 Sutskever 的 SSI 選擇反過來做——兩年內完全不發布任何產品、不對外展示任何成果,只悶頭做「怎麼確保 AI 行為可控」這件事的基礎研究,直到研究成果被輝達認可、願意砸重金加碼投資並提供最新晶片,才首次公開近況。對關心 AI 風險的人來說,這代表「先求安全再求快」這條路線目前拿到了業界最大晶片商的資源背書,是一個可以持續追蹤的指標性案例。

T2
微軟推資安AI 難題仍靠OpenAI

微軟發表了一個叫 MAI-Cyber-1-Flash 的小型資安模型(專門用來檢查程式碼裡有沒有安全漏洞的 AI),把它裝進自家的 MDASH 多代理系統(多個 AI 分工合作處理任務的架構)裡。這套組合在 CyberGym 這個測試(用來評比 AI 抓程式碼真實安全漏洞能力的基準測試)拿到 96% 的高分,比對手 Mythos 高出 12 分,也贏過 Gemini 和 GPT。微軟表示因為九成的任務都能由這個較便宜的小模型處理,只有真正困難的案子才會轉交給 OpenAI 的 GPT-5.4 處理,整體成本可以省下一半。這也顯示微軟正從單純依賴 OpenAI,逐漸轉型成同時自研模型、又能調度多家 AI 的「模型協調者」角色。

假設一家公司想掃描自己龐大的程式碼庫,找出可能被駭客利用的安全漏洞。過去若全部交給 GPT 這類頂級大模型逐一分析,速度慢、費用高。用微軟這套新架構後,系統會先讓便宜的 MAI-Cyber-1-Flash 處理九成常見案例,只有真的判斷不出來的困難案例才丟給更貴的 GPT-5.4 深入推理。結果是:資安檢測維持接近頂級模型的準確度(96%),但整體運算成本降低約 50%。微軟同時還推出叫 Perception 的即時資安代理系統,號稱每天分析超過 100 兆筆資安訊號、服務 160 萬名客戶,用來即時監控並阻擋威脅,而不只是事後分析程式碼。

T2
德里高院判OpenAI版權案初步勝訴

印度德里高等法院駁回了印度大型新聞通訊社ANI對OpenAI提出的「暫時禁制令」(preliminary injunction,就是官司還沒判定最終結果前,先強制對方停止某行為的臨時命令)申請。ANI控告OpenAI用它的新聞內容訓練ChatGPT(AI訓練用的資料庫)並侵犯版權,但法官認為ANI提出的證據反而幫了OpenAI:ANI拿去當證據的文章,發表時間是在GPT-4和GPT-4o訓練資料截止之後,等於證明那些文章根本不可能被拿去訓練模型。法官初步判斷ChatGPT答案裡出現的相似內容,其實來自RAG(Retrieval Augmented Generation,讓AI回答前先即時上網查資料,而不是背答案),而不是模型記住了原文。法官也首次明確把「用受版權保護的資料做AI訓練」歸類為印度法律中的「私人使用(含研究)」例外,只要訓練資料來源合法、且訓練後的複本沒有公開釋出。這是一個「初步裁決」,正式的訴訟本案仍在審理中,最終結果可能翻盤。

假設你是一家新聞媒體,想告一家AI公司「你們拿我的新聞去訓練AI,還讓ChatGPT把我的文章內容講出來,這是侵權」。過去這類官司在各國結果不一(美國、德國、英國都有不同判法),這次印度的案例提供一個具體攻防範例:ANI原本想證明ChatGPT會「一字不漏複製」自己的文章,於是故意用「請你完整複製這篇文章」這種誘導式提問去測試ChatGPT,結果ChatGPT依然沒有輸出逐字複製的內容,只給出主題和標題,法官因此認定沒有直接侵權證據;同時ANI又拿訓練截止日期之後才發表的文章當「證據」,反而幫OpenAI證明「這些文章根本不在訓練資料裡」。對比其他仍在打官司的媒體或創作者,這案例說明:想告贏AI公司「訓練侵權」,必須拿出模型訓練期間內、且能被逐字重現的具體文本證據,光靠「主題相似」或「AI講得出這則新聞」是不夠的。

T2
Claude分享對話遭搜尋引擎索引

7月26日有使用者發現,只要在Google或Bing搜尋「site:claude.ai/share」這類指令,就能找到大量原本被用戶「分享」出去的Claude(Anthropic出的AI聊天機器人)對話紀錄,內容包括履歷、公司內部程式碼討論、甚至API金鑰(一種用來讓程式互相溝通的密碼)和加密貨幣錢包資訊。這不是駭客入侵、也不是Anthropic系統被攻破,而是使用者自己按下「分享」鍵產生的公開網頁,被搜尋引擎的自動爬蟲程式正常收錄進搜尋結果而已。問題出在這些分享頁面似乎沒有加上「noindex」標籤(一種告訴搜尋引擎「請不要收錄這頁」的網頁設定),導致只要有人把分享連結貼到Reddit、X、GitHub等公開網站上,搜尋引擎就能順著連結找到並收錄它。Google當天稍晚已下架許多結果,但其他搜尋引擎仍有部分殘留。這與2025年ChatGPT分享連結也曾被Google索引的事件如出一轍,顯示這是AI業界共通的隱私設計漏洞,而非單一公司的問題。

假設一位工程師在Claude裡貼上公司內部程式碼請AI幫忙除錯,過程中不小心把資料庫密碼或API金鑰也貼了進去,然後按下「分享」鍵把這段對話發給同事參考。這個分享連結本質上是一個公開網頁,任何拿到連結的人都能看,這是Claude設計上就允許的。但問題是,如果這位工程師後來把連結貼到公司內部Slack或某個公開論壇求助,只要該論壇頁面本身是公開可爬取的,Google的爬蟲程式就可能順著這條連結找到並收錄這個Claude對話頁,之後任何人只要在Google搜尋「site:claude.ai/share 資料庫密碼」之類的關鍵字,就有機會直接看到這段含有機密資訊的對話內容,而工程師本人可能完全不知道自己的對話已經能被陌生人透過搜尋找到。對策是使用者要主動到Claude設定裡的「Settings→Privacy→Shared Chats→Manage」檢查並刪除所有含敏感資訊的分享連結,而不能假設隨機產生的連結網址天生就是隱密安全的。

T3
T3
開源工具讓AI寫的網頁設計更好看

現在很多AI工具(像Claude Code、Cursor這種能幫你寫程式的AI助手)在設計網頁介面時,因為訓練資料都來自差不多的網站範本,做出來的畫面常常長得一模一樣:用同一種字型、同樣的紫藍色漸層背景、疊很多層卡片、彩色底配灰字,業界戲稱這種千篇一律的成果叫「AI slop」(AI生成的低品質、同質化內容)。有位前Google開發者關係主管、也是知名網頁工具jQuery UI的創始人Paul Bakaus,做了一個叫Impeccable的開源工具,專門用來「教」AI助手怎麼做出有設計感、不撞臉的介面。它是一個skill(可以想成給AI助手的一份操作說明書加上一組指令),內建23個指令,例如輸入init可以先幫專案建立一份設計規範文件,audit和polish可以幫你檢查並修飾現有設計,live則能一邊改一邊在瀏覽器即時看效果。裡面還有60條完全不靠AI判斷、寫死的規則,可以直接放進開發流程自動抓出不良設計,另外還有177多套人工審核過的參考設計範例庫,讓AI在生成介面時有更多好品味可以模仿而不是每次都套用同一種模板。這個工具目前在GitHub上已經有超過5萬顆星(代表很多人關注和使用的指標),並且同時支援Claude Code、Cursor、GitHub Copilot、Gemini CLI等多種常見的AI程式工具,安裝也很簡單。

具體場景:一個新創團隊要用Claude Code這類AI程式助手快速做出一個產品官網,如果直接叫AI「幫我設計一個首頁」,十次有八次會得到同樣的配方:Inter字型、紫藍漸層背景、一堆疊起來的白色卡片,看起來就跟其他用AI做的網站沒兩樣,因為所有大型模型幾乎都是在同一批SaaS網站範本上訓練出來的,沒有特別引導就會生成這種安全但無聊的成品。裝上Impeccable之後,先在專案裡執行「/impeccable init」,工具會生成一份PRODUCT.md和DESIGN.md,把這個產品的定位、風格偏好記錄下來,當作AI往後設計時的參考依據;接著利用Impeccable內建的60條確定性偵測規則(例如檢查對比度不足、卡片疊太多層等常見毛病)與177套人工審核過的設計範例庫,可在開發流程中自動攔截樣板化設計,避免落入AI slop的窠臼。改完後再跑「/impeccable live」,可以在瀏覽器裡即時看到調整後的畫面。跟過去直接叫AI設計、拿到差不多成品再自己手動微調相比,Impeccable把怎樣算好設計的規則和範例明確寫進流程裡,讓AI在動手畫介面之前就先有方向,省下反覆試錯的時間。

T3
腦波資料能否解物理AI瓶頸

這篇報導在講「物理 AI」(physical AI,就是控制機器人做實際動作的人工智慧,例如人形機器人、機械手臂)目前最大瓶頸不是模型技術本身,而是訓練資料不夠。影片可以錄下手部怎麼動,卻沒辦法記錄操作者當下腦中在想什麼、覺得困難還是輕鬆完成,這種「意圖」資訊傳統影片資料完全缺失。新創公司 Encord 找上德國腦科學公司 Zander Labs 合作,讓機器人操作員戴上量測腦波的頭戴裝置(EEG,就是透過貼在頭皮的感測器讀取大腦電位活動,可以偵測操作者當下是否困惑、驚訝或高度專注,不需要操作者主動說話或按按鈕),把「操作者覺得困難的那一刻」標記進訓練資料,讓 AI 模型學會判斷什麼時候該多花運算資源仔細思考。另一家公司 BrainCo 則走不同路線,在 WAIC 2026(世界人工智慧大會)上展示能在 200 毫秒內把腦波訊號直接轉成機器人動作指令的技術,鎖定軍事與醫療應用市場,兩者是各自獨立的技術路線,並非同一套系統。Encord 估計,有標記困難度資訊的高品質訓練資料,價值是普通影片資料的 100 倍,但製作成本也貴了約 20 倍,公司已募得 6000 萬美元投入這塊資料基礎建設市場,不過這項腦波標注技術目前仍是小規模試驗階段,還沒證實能大規模提升機器人實際表現。

Encord 在加州 San Leandro 的倉庫裡,讓試驗操作員 Andrew Ceja 戴著頭戴裝置,裝置上的攝影機記錄他「看到的畫面」,同時腦波感測器(EEG)量測他在操作過程中的心理狀態(例如錯誤感、意圖、驚訝)。把這兩種資料合併起來,就能在訓練資料裡標記出「操作者覺得特別需要專注或出錯機率高的時刻」,讓機器人模型知道:不是每個動作都同等重要,遇到需要更高專注度的環節,模型應該多分配一點運算資源、放慢速度、精算力道,而不是像看一般教學影片那樣把每一步都用同等級的運算隨便帶過。對比傳統做法——只靠影片訓練機器人模仿人類動作——舊方法完全沒辦法得知人類操作者在哪個瞬間其實是全神貫注、如履薄冰,於是模型很可能在真正該小心的地方反而處理得太隨便,導致操作失敗(例如夾壞物品或弄倒堆疊物)。

T3
電商平臺推AI後臺代理人Athena

加拿大電商建站平臺 Shoplazza(服務全球超過 65 萬商家)推出一個叫 Athena 的 AI 後臺代理人(agent,就是能自己執行任務的 AI 助理,不只是聊天)。以前商家要管理商品、訂單、折扣、物流、數據分析,得在好幾個不同的後臺頁面之間切換操作;Athena 讓商家直接用自然語言講出想做的事,AI 會準備好操作內容、先給預覽,等商家確認後才真正執行,避免 AI 自作主張改錯東西。這個設計背後的架構是「協調器模式」(orchestrator pattern):Athena 本身不儲存商家的商品、訂單等核心資料,這些資料仍然只存在 Shoplazza 原本的系統裡,Athena 只負責調度、串接各個子系統完成任務,這樣可以避免多套系統的資料互相打架、對不上。Athena 上線後在新創產品發布平臺 Product Hunt 上架首兩天拿下當日第 2 名、累積 267 票,並提供 7 天免費試用。

假設一個賣快時尚服飾的跨境電商商家,手上有一批新品的 Excel 表格和商品圖片,想快速上架。傳統做法是逐一登入後臺商品頁,手動填類別、材質、顏色、標題、描述、定價,一件件慢慢建檔。用 Athena 的話,商家直接把 Excel 檔或圖片丟給它,AI 會自動辨識出商品的類別、材質、顏色等屬性,並生成草稿版的標題、描述和建議定價,商家只需要檢查、確認後就能一次上架,不用再一頁一頁手動輸入。同樣地,商家想知道「上週哪個商品轉換率最低」,不用自己跑去報表頁選時間區間、設篩選條件,直接用一句話問 Athena,它會直接生成圖表和數據解讀。差異在於:傳統方式要熟悉每個後臺模組操作,Athena 把跨模組的瑣碎操作簡化成一句話加一次確認。

T3
德國院士:AI 突破靠小型智能體協作

德國國家工程科學院院士、同時也是中國工程院外籍院士的赫爾佐格(Werner Herzog,AI 領域資深專家,1985 年創立德國第一個 AI 研發中心),最近接受央視專訪時提出一個看法:他認為 AI(人工智慧)領域下一次重大突破,不會來自一個更大、更強的單一大型模型,而是來自很多個小型、專門化的「智能體」(agent,也就是能自己執行任務的 AI 程式)彼此協作、分工完成任務。他解釋,這種做法的好處是彈性大,可以隨時依需求增加或移除某個智能體,就像人類團隊合作一樣,比單靠一個巨大系統包辦所有事情更靈活、更好落地。他也提到 AI 的終極目標之一是降低一般人取得知識的門檻,而現在的大型語言模型(LLM,就是 ChatGPT 這類會對話的 AI)只是初步做到這件事,離真正完全落地還需要更多研究和實踐。

以「開發一套軟體」這個任務為例:傳統做法是丟給一個超大型的單一 AI 模型,要求它從頭到尾自己搞定需求分析、寫程式、測試、除錯,結果往往因為任務太複雜、單一模型顧此失彼而出錯。多智能體做法(如 Andrew Ng 所舉例子)則是把整個軟體開發流程拆成子任務,分別交給扮演「軟體工程師」「產品經理」「設計師」「QA 測試」等不同角色的智能體各自負責一塊,彼此再把結果交接、整合。差別在於:單一大模型是一人包辦、容易顧此失彼;多智能體是分工合作、每個 agent 只需專精自己那一小塊,出錯時也比較容易定位是哪個環節的問題,這也是目前 LangGraph、AutoGen、CrewAI 等主流 agent 框架採用的架構方向。

T3
NVIDIA推即時手術模擬AI

NVIDIA發表了一個叫Cosmos-H-Dreams的新系統,它是一種「世界模型」(world model,就是一種能學會預測「如果做某個動作、畫面接下來會變成怎樣」的AI,不用工程師手動把每個物體和物理規則都寫死)。這次的重點是把它用在手術機器人上:AI看著一段開刀畫面和機器手臂接下來要做的動作,就能即時生成「如果照這樣操作,畫面會變成什麼樣子」的模擬影像,而且是每秒約160張畫面的即時速度,用一張NVIDIA RTX PRO 6000顯示卡就能跑。之前的舊版本Cosmos-H-Surgical-Simulator只能做到每秒約10張畫面,速度太慢沒辦法讓人即時操作互動,這次靠一種叫「蒸餾」(distillation,指把一個很聰明但很慢的大模型的能力,濃縮教給一個小而快的模型)的技術大幅加速。這套系統還可以接上VR頭盔(Meta Quest)或瀏覽器,讓人用手把或鍵盤即時操控虛擬手術機器人並看到生成的畫面。

假設一家醫療機器人公司想訓練一個「自動打結縫合」的手術機器人策略(policy,指AI控制機器手臂該怎麼動的決策邏輯),傳統做法是必須不斷在真的機器人上實際操作測試,既耗時又可能損壞昂貴設備,而且很難刻意製造「失敗案例」(比如縫線打結失敗、針掉了)來讓AI學習怎麼應對意外。用Cosmos-H-Dreams的做法是:先給它一張手術現場的初始畫面,再輸入一連串機器手臂的動作指令,它就能即時生成「照著這樣做會發生什麼」的逼真手術影片,工程師可以在虛擬環境裡反覆測試上千種操作組合、包括故意讓它失敗的情境,評估階段不用每次都實際操作機器人,速度也快到可以讓人即時用VR手把操控互動練習,這跟過去只能錄影分析、事後評分的舊流程差很多。

T3
FeyNoBg 開源去背模型發表

有一家叫 Feyn 的公司在 Hacker News 上發布了 FeyNoBg,這是一個自動「去背」(就是把照片裡的人或物體從背景中切割出來,常用來做去背貼圖、換底圖)的 AI 模型,同時也開源了訓練這個模型用的 Python 工具庫,名叫 NoBg。去背聽起來簡單,其實對 AI 來說很難處理毛髮、車輪輻條、動態模糊等細節邊緣,很容易切壞。這次發布的重點不只是模型本身效果好,還把訓練、預處理、評測這些原本分散在不同專案、彼此不相容的流程,整合成一套統一的工具庫,方便其他開發者拿去訓練自己的去背模型。

假設你要做一個「上傳寵物照片自動生成去背貼圖」的功能:過去的做法是找一個現成的去背模型(例如 BiRefNet),但如果效果不好、想微調(就是拿自己的資料再訓練一下模型),常常會發現每個模型的程式碼、資料前處理、評測方式都不一樣,要花大把時間去對接。用 FeyNoBg 附帶的 NoBg 工具庫,開發者可以直接用同一套 Python 介面載入 BiRefNet 這類模型、餵自己的照片資料集去訓練或微調,不用重寫前處理程式碼。官方測試顯示,FeyNoBg 在八個公開評測基準中,有四個拿下目前最佳成績,其餘也都和第一名差距在 2% 以內,比起單獨訓練「找輪廓」或「描邊補光」其中一項能力就犧牲另一項的舊做法,效果更平衡。

T3
用AI重寫Bun專案進度存疑

Bun 是一套很受歡迎的 JavaScript 執行環境(可以想成是讓網頁程式碼在電腦上直接跑起來的引擎),被 AI 公司 Anthropic(也就是 Claude 這個 AI 助理背後的公司)收購。Bun 的創辦人 Jarred Sumner 在 7 月初宣稱,使用 Anthropic 的 AI 工具 Claude Code(一種可以自動寫程式、改程式碼的 AI 助手)在短時間內以一定成本完成重寫並合併進主分支,但這項宣稱引發外界質疑。這篇文章的作者對這個說法抱持懷疑,實際去查了 Bun 的原始碼庫和 GitHub 上的資料,發現事情沒有官方說的那麼順利、那麼快、那麼便宜。

作者實際去 clone(下載複製)Bun 的原始碼庫查證:距離重寫「完成」已經過了 6 週,Bun 卻連一個新的正式發布版本(release tag)都還沒出,這是該專案史上少見的超長空窗期(上一次類似的空窗是 2022 年的 6 週)。作者又去查代表 Claude Code 自動送出的機器人帳號 robobun 的未合併 PR(pull request,也就是等待被審核合併進主程式的程式碼修改)數量:7 月 9 日時是 1277 個,到 7 月 27 日暴增到 2475 個;而每個 PR 光是跑自動化測試(CI/CD)就要花 40 分鐘到 1.5 小時,照這個速度要把現有的全部合併完,得讓測試機器不間斷跑 86 天。作者也指出,官方公佈的 16.5 萬美元只算了 API 呼叫費用,沒算進龐大的自動化測試機器成本,而 Anthropic 員工是否直接參與程式碼撰寫及其人力成本,目前仍缺乏明確資訊;若照重寫後仍持續燒錢的速度(估計每天約 1 萬美元)推算,整體花費恐怕已逼近 80 萬美元,遠高於原本宣傳的數字。這說明:AI 自動重寫大型專案聽起來很吸引人,但實際驗收進度、真實成本與官方宣傳之間,可能存在明顯落差,用來當作「AI 已能取代人類工程師」的證據時要格外謹慎。

T3
Cisco推出AI代理協作框架

現在很多企業已經用多個AI代理(agent,也就是能自主完成任務的AI程式)分別處理不同工作,例如一個負責看診分流、一個負責排班、一個負責保險核對、一個負責藥局出貨。但這些AI代理彼此之間目前只能交換資料,沒辦法真正『一起思考』協調決策,還是得靠人類居中拍板。Cisco旗下的Outshift團隊發表一套稱為『Internet of Cognition(認知網路)』的架構構想,主張要幫這些AI代理裝上共享意圖、共享背景資訊、共享推理過程的『連結層』,讓它們能像團隊一樣自己協調解決單一AI代理訓練時沒學過的新問題。他們也開源釋出了幾個技術元件:讓代理彼此找到並驗證身分的AGNTCY(已捐給Linux基金會)、讓代理在行動前先協調好目標的Mycelium、以及持續檢查AI代理的行為是否仍符合原始任務授權的安全機制CASA。要注意的是,這篇文章是Cisco贊助的置入內容,並非MIT Technology Review編輯部撰寫的獨立報導,內容偏向宣傳其產品理念,但涉及的多代理協調問題與解法在技術上仍有參考價值。

假設一間醫院要打造一個看診協調系統,裡面有四個AI代理各司其職:一個負責初步問診評估症狀、一個負責掛號排程、一個負責核對保險給付、一個負責處理藥局配藥。過去做法是這四個AI各自運作、資料互通但無法協調,遇到需要跨部門判斷的情況(例如病人保險只給付部分藥物、要不要調整看診順序)就得停下來等人類主管拍板,效率卡住。Outshift測試了他們的協調協定Mycelium:讓每個AI代理行動前,先公開宣告自己的目標、主動說出還缺哪些資訊、彼此有衝突時先協商解決,而不是直接各做各的。根據Cisco內部針對14種情境的測試,沒有這套協調機制時,AI代理群體只有約三分之一(約33%)的情況能自行達成共識決策;加上Mycelium協調協定後,達成決策的比例提升到93%。也就是說,同樣的多代理系統,多了一層『先講清楚目標、有問題就講、衝突先談』的協調規則,就能大幅減少需要人類介入拍板的次數。

T3
英特爾談企業代理AI佈署法

這篇是英特爾(Intel)發布的贊助內容(文末註明「由英特爾製作,非MIT Technology Review編輯部撰寫」),主題是「代理式AI」(agentic AI,指會自己規劃步驟、呼叫工具、執行任務的AI系統,不只是回答問題的聊天機器人)要在企業裡大規模運作時,該怎麼規劃電腦資源。英特爾說他們做了數千次代理式AI工作負載實驗,歸納出五個重點:這是整套系統的問題而不只是AI模型推論的問題、現有測試工具大多量不到系統整體表現、規劃容量要看「每顆虛擬處理器(vCPU)能撐幾個代理」而非代理總數、要監控任務延遲而非平均處理器使用率、預設用「多開幾臺機器」而非「把單一機器規格加大」來擴充。他們提出六個衡量指標:任務成功率、每個任務的成本、每個任務花的時間、任務吞吐量(單位時間能處理的任務數)、代理密度(每顆vCPU能跑幾個代理)、延遲。這些是英特爾自家實驗得出的建議,性質上偏向廠商推廣其硬體與方法論的內容,而非獨立第三方研究。

假設一家企業要建置一群自動處理IT工單的AI代理,過去做法可能是隻看伺服器的平均處理器使用率來決定要不要加機器。但英特爾的實驗發現,AI代理的運作模式是「忽快忽慢」:常常在等AI模型回覆,然後突然一陣密集運算,所以就算平均使用率看起來還好,其實已經開始塞車、使用者要等更久了。他們建議改用「代理密度」規劃容量,例如:8顆vCPU的機器上跑10個代理,跟16顆vCPU機器跑20個代理,只要密度相同(都是每顆vCPU約1.25個代理),兩臺機器的表現會差不多,這樣不同機型、不同世代的處理器都能用同一套標準比較。同時改看「P95延遲」(把所有任務依花費時間排序,取最慢的後5%所花的時間)當預警訊號,比等到平均任務時長變差才發現問題更早。得出結論後,擴充容量時優先選「多開幾臺機器」而非「把單一機器規格加大」,因為代理彼此工作獨立、單一代理運算負擔不重,多開機器通常更省錢、更容易維持原本設定的代理密度目標,也比較不會因為單臺機器出問題而全部停擺。

T3
OpenAI研究:AI讓員工跨界做別人的工作

OpenAI(就是做ChatGPT的公司)的經濟研究團隊分析了超過80萬則美國ChatGPT使用者傳的訊息,發現有16.8%的工作相關訊息、以及43.5%屬於特定職業的訊息,內容其實是在做「別的職業」該做的事,這個現象他們稱為「任務跨界」(task crossover)。舉例來說,小商家老闆可以自己用AI草擬文案、審合約、做基本財務分析;業務員可以直接用AI分析客戶數據,不用再找分析師;行銷人員能自己排查網站問題,不用等工程師。研究顯示某些職業特別容易「借用」別的職業的工作,例如客服人員77%、設計師75%、人資69%、法務56%、行銷53%的職業相關訊息其實是在做別的職業的任務。研究也發現公司規模有影響:在2到5人的小團隊裡,員工做「份外工作」的比例(18.9%)比100人以上的大公司(16.3%)更高,推測是小公司裡沒有專門的人手,遇到問題的人就自己動手用AI解決,AI因此成了資源不足時的萬用工具。

假設一家只有3個人的新創公司要投放一波行銷廣告,過去流程通常是:業務或創辦人先發想文案草稿,再交給行銷專員潤飾定稿,行銷專員如果要看數據成效,還得再麻煩懂數據的人跑報表,一來一往至少要跨好幾個人手。根據這份研究,現在同一個人可能直接用ChatGPT把文案、成效數據分析、甚至簡單的網站錯誤排查都一次做完——這項「創建行銷素材」的任務在多個不同職業的ChatGPT對話紀錄中都曾出現。差異在於:過去需要「交接」給對應職能的同事才能完成的環節,現在變成一個人靠AI就能從頭做到尾,尤其在人手不足的小公司裡更明顯。

T3
開源倡議只剩Anthropic未簽

輝達(NVIDIA,AI晶片公司)執行長黃仁勳日前發表公開信,呼籲各大AI公司支持「開放權重模型」(open-weight model,就是把訓練好的AI模型參數公開讓大家下載使用,跟只能透過付費API呼叫的「閉源模型」相對),短短幾天內已有超過70家公司與機構連署,OpenAI也被列入簽署名單,微軟執行長納德拉據報導也已表態支持,圖靈獎得主楊立昆等人物亦在社群上表達支持,唯獨開發Claude的AI公司Anthropic至今沒有簽署。Anthropic一名資深研究員(曾參與Google DeepMind的AlphaGo、AlphaZero等知名AI專案)在社群媒體上以諷刺語氣表示,期待黃仁勳也將CUDA(讓顯示卡能跑AI運算的軟體工具)和微軟Windows開源,引發社群討論;AI研究者吳恩達則公開為黃仁勳辯護。也有分析指出,開放權重模型越普及,代表越多公司會自行下載模型並部署在自己的伺服器上執行,這會直接推高「推理運算」(就是AI模型實際被使用、產生回答時所需要的運算)的晶片需求,而OpenAI、Anthropic等公司正在開發自製晶片或改用Google TPU,試圖降低對輝達的依賴。

假設你是一家想部署自己AI服務的新創公司,過去只能付費呼叫封閉API服務商提供的API,無法直接下載模型權重放在自有伺服器上部署和客製化。如果黃仁勳這波開源倡議真的推動更多公司釋出開放權重模型,你就可以直接下載模型檔案,放到自己買的伺服器上執行、依需求客製化,不用每次呼叫都付費給API供應商。但要跑起這些模型,你得自備推理用的晶片,而目前市面上這類晶片主要由輝達供應,但OpenAI、Anthropic等公司正在開發自製晶片或改用Google TPU,試圖降低對輝達的依賴——文中分析指出,開放權重模型越多人用、部署越分散,推高的是通用推理晶片需求,反而有助於鞏固輝達的市佔,這也是Anthropic遲遲不簽署背後的部分原因之一。

T3
騰訊WorkBuddy上線AI出海專家

中國信通院和騰訊在2026世界人工智能大會上聯合推出「AI航海家+」,是一批裝在騰訊的多智能體(multi-agent,就是可以同時派出好幾個AI小幫手、各自負責不同任務再協同合作的系統)平臺WorkBuddy裡的AI顧問。首批22位智能體專家覆蓋巴西、阿聯酋、埃及、新加坡、印度尼西亞、馬來西亞、泰國七個國家,分別懂當地的稅務、法務、市場營銷、人力等領域規則。這批智能體背後使用的是信通院多年積累的國別專業語料,經過清洗、結構化和校驗,能直接給出「該怎麼辦」的具體判斷,而不只是把外文條文翻成中文。目前這個「全球發展專區」已經同步上線WorkBuddy的國內版和國際版(workbuddy.ai),計劃出海的中國企業和海外本地企業都能使用。

一家深圳消費電子公司想去巴西建廠,過去需要自己招募懂當地稅法的團隊,或花費數萬乃至數十萬元進行盡職調查諮詢,或諮詢當地會計師、稅務顧問才能梳理清楚信息。用AI航海家+的話,可以直接在WorkBuddy裡問巴西財稅金融專家「計劃在巴西建廠,哪個城市綜合成本最低」,它會拉出各州市的稅收優惠政策,逐項比較企業所得稅、ICMS、IPI等稅種,再結合產業政策和物流條件篩出建議城市,幾分鐘內就給出了一份結構化分析,而不是像過去那樣得等待傳統方式的漫長週期才能獲得判斷。

T3
Google AI搜尋已成主流

市場情報公司 Similarweb 的最新報告指出,Google 的「AI Overviews」(就是在搜尋結果最上方,由 AI 直接生成一段摘要答案,取代你自己點連結去看)出現的比例,一年內從 15% 暴增到 43%,代表越來越多人搜尋時看到的不再是一排藍色連結,而是 AI 直接寫好的答案。同時「AI Mode」(Google 更像聊天機器人的對話式搜尋功能)的造訪次數,也從 2025 年 6 月的 1.26 億次成長到 2026 年 5 月的 2.79 億次。這代表使用者的搜尋習慣正在改變:從打幾個關鍵字,變成打一整句像在跟人聊天的問題。這個趨勢對經營網站、寫文章維生的出版商(尤其是新聞媒體)很不利,因為使用者看完 AI 給的答案後,往往不會再點進原始網站,導致這些網站流失原本靠「被搜尋、被點擊」帶來的流量。

以前一個新聞網站經營者想知道「使用者怎麼從 Google 找到我的文章」,做法很單純:使用者搜尋關鍵字 → 看到我的文章連結 → 點進來 → 網站有流量、有廣告收益。現在的情況變成:使用者搜尋同樣的問題 → Google 的 AI Overviews 直接把答案(可能引用了我的文章內容)寫在搜尋結果最上面 → 使用者看完摘要就滿足了,未必再點進原網站 → 流量下降,即使自己的內容其實被引用了。報告也提到一個對照:ChatGPT 在 2026 年 5 月做了一次更新後,美國桌面版查詢中,答案帶「可點擊連結」並讓使用者真的點進網站的比例,從 3 月的 25% 提高到 5 月底近 60%,顯示不同 AI 產品在「引用來源是否給流量」這件事上做法差很多,這也是網站經營者評估要不要對抗(例如用 Cloudflare 工具擋掉 AI 爬蟲、要求 AI 公司付費才能抓取內容)時的重要參考數據。

T3
新創Enigma籌7100萬做機器人操控介面

一家名為 Enigma 的機器人新創公司剛從隱身模式(stealth,指公司先低調做研發、不對外公開,準備好才亮相)中現身,宣佈拿到 7100 萬美元的種子輪(seed round,公司最早期的募資階段)投資,由 Index Ventures 和 Ribbit Capital 領投。這家公司做的不是一般的機器人硬體,而是研究「人類要怎麼跟機器人溝通最自然」這件事,目標是讓操控機器人像轉車上音量旋鈕一樣直覺,而不是像現在要花很多時間一步步教機器人該做什麼。他們的兩位創辦人 Jonathan Jacobi 和 Gal Niv 都不是機器人專業背景出身,而是資安圈出身(曾服役於以色列情報單位 8200 部隊),他們認為正因為不是業內人士,反而能用更開放的角度重新思考「人機互動的終極體驗該長什麼樣」,而不是像業內人士一樣先卡在「機械手臂靈不靈活」這種技術細節上。

Enigma 目前正在做一個公開的大型實驗:全世界任何人都可以連線到他們位於以色列和加州的機庫,透過網路操控超過 100 臺他們自製的機械手臂,讓這些手臂畫畫、用劍互相打鬥、或做簡單的化學實驗(拿取並混合裝著液體的燒瓶)。這個實驗的目的不是展示機器人多厲害,而是蒐集資料回答一個問題:人類到底想用打字、講話、錄影示範,還是用手指點選拖拉的方式跟機器人溝通?傳統做法是工程師先設計好一套操控介面(例如打字下指令),使用者被迫遷就這套介面;Enigma 反過來讓大量真人先自由嘗試各種互動方式,再從蒐集到的真實使用資料中,找出哪種介面人類用起來最直覺,之後才拿這個結論去設計正式的操控介面與訓練背後的 AI 模型。目前該公司已在醫療、物流、娛樂等領域與企業展開合作,但尚未公開具體應用案例。

T3
Baseten推出GLM-5.2最快API

Baseten(一家提供AI模型雲端運算服務的公司,簡單說就是幫別人把AI模型架起來、讓開發者能透過網路呼叫使用)幫GLM-5.2(一個大型語言模型,就是像ChatGPT一樣會對話生成文字的AI)推出了新版API(應用程式介面,簡單理解成「讓程式跟AI溝通的窗口」)。新版API的尖峰速度可以達到每秒280個token(token可以理解成AI處理文字的最小單位,大致對應幾個字或半個字),平均速度約每秒100個token,比剛上線那天的版本快了兩倍以上。他們同時還做了一個「Fast版本」,專門針對寫程式和AI代理(agent,就是能自己執行多步驟任務的AI程式)的場景去降低延遲(也就是從送出請求到拿到回應之間等待的時間)。Baseten表示接下來還會改進他們的推測性解碼(speculative decoding,一種讓AI一次預測多個字、用完再驗證對錯以加快生成速度的技術)演算法,讓GLM-5.2的效能再進一步提升。

假設你在開發一個需要即時對答的程式設計輔助工具(coding assistant),使用者輸入問題後你呼叫GLM-5.2的API來生成程式碼建議。用舊版launch-day API的話,因為速度較慢,使用者可能要多等好幾秒才看到程式碼跑出來,體驗會覺得卡頓;如果改用Baseten新推出的Fast版本API,因為專門針對coding和agent場景做了延遲優化,同樣的程式碼建議請求可以更快跑完,回應速度可能更順暢,對需要即時互動的coding agent類應用來說,等待感會明顯降低。

T3
LLM讓形式化證明變實用

一位工程師寫了一篇技術部落格,講他用 LLM(就是像 ChatGPT 這種能理解並生成程式碼的 AI)來幫忙寫「形式化證明」。所謂形式化證明,是用像 Lean、Coq 這種特殊程式語言,把程式邏輯上該滿足的規則寫成數學式子,讓電腦自動檢查程式有沒有邏輯漏洞,而不是靠人腦肉眼檢查或寫在註解裡容易被忽略。過去這種寫證明的工作極度耗時,作者引用知名的 seL4 作業系統核心驗證專案為例,工程師花在寫證明上的時間是設計加寫程式時間的 10 倍,證明程式碼的行數甚至是一般程式碼的 20 倍以上,所以這類語言一直很小眾。作者實際測試發現,現在的 LLM 已經可以在大約 20 分鐘內、只用不到 20 美元月費額度的一小部分,自動完成過去需要耗費大量人力的複雜證明工作,而且他確認這些證明是真的通過型別檢查、沒有偷懶留白(沒有 sorry 佔位符)。他認為這代表形式化證明這種過去被認為太貴、太小眾的技術,明年很可能會變成業界標準配備。

作者實際做的案例是:自己動手用 Lean 語言寫一個 Zstandard(一種取代 gzip 的檔案壓縮格式)解壓縮程式。程式裡有一段程式碼要從一個位元組陣列裡取第一個元素,但如果這個陣列剛好是空的,一般語言(像 C)在這裡會直接當機或出現無法預期的錯誤(未定義行為),過去工程師只能小心翼翼手動檢查或寫在註解提醒別人「這裡陣列不能是空的」,但註解沒有強制力,團隊變大後很容易被忽略而出包。Lean 的做法是要求你「數學上證明」這個陣列不可能是空的,才準許你去讀取它,這樣型別系統本身就杜絕了這類錯誤。接著作者又進一步挑戰更難的:證明一整個「機率編碼表格建構演算法」(entropy table 建構函式)符合四項嚴謹的數學性質,包括表格大小正確、每個符號分配到的狀態數量符合它出現的機率等。這種等級的證明在人工寫的年代要耗費大量心力,是前面提到 seL4 專案「十倍工作量」的來源,但作者讓 LLM 自動完成了,只是中途需要微調程式寫法(避免用太多命令式、走捷徑的寫法)讓 LLM 比較好處理,最後他人工確認證明真的通過檢查。對比舊做法:以前要嘛沒人做這種嚴謹證明(風險留給執行期出包),要嘛得靠專家耗費大量工時手工證明,現在 LLM 讓一般工程師也能低成本、快速拿到同等級的數學保證。

T3
AI代理提示快取的脆弱性

這篇文章講的是「提示快取」(prompt caching,簡單說就是AI在對話時,把前面已經處理過的內容暫存起來,下次不用重新計算,藉此省錢省時間)在AI代理(agent,就是能自己連續執行多步驟任務的AI程式,例如寫程式用的AI助理)身上是怎麼運作、又為什麼很容易失效。文章解釋,AI代理每次對話幾乎都要把系統設定、工具說明、對話紀錄整包重送給模型,如果每次都重新計算會很貴很慢,所以業者用快取技術把「算過的部分」存起來重複利用。但作者強調這個機制很脆弱:只要換一個工具定義、換一個模型、或者背後伺服器把請求轉送到不同機器上,原本應該很便宜的「接著問一句」就會變成整包內容都要重新算一次的昂貴請求。文章也提到快取通常有時效(例如Anthropic預設5分鐘沒動作就失效),以及工具清單一改動、對話分支跳轉、系統提示裡塞了時間戳記等情況,都可能讓快取整個失效,導致帳單暴增。

假設你在用一套AI寫程式代理(coding agent)持續開發一個專案,對話歷史已經累積到10萬個token(token是AI處理文字的最小單位,可以想成是字詞碎片)。如果快取正常運作,下次你只是回一句「continue」,系統只需要用便宜的「快取讀取價」處理那10萬token的歷史,再用正常價格處理你新打的那幾個字,成本很低。但文章舉了一個實際情境:如果你去倒杯咖啡,離開超過Anthropic預設的5分鐘快取時效,回來後只打一句「嗨」,系統會發現快取已經過期,於是必須把整整10萬token的歷史用「未快取的正常價格」整包重新算一次,這一句簡單的招呼話反而變成一筆意外的大額扣款。同樣地,如果你的代理程式中途新增了一個工具(例如原本只有讀檔、寫檔、執行指令,中途又加了一個「部署」工具),只要這個新工具的說明被插進系統提示的前段,後面所有對話紀錄的快取都會作廢,即使你只是想省一點工具說明的token,反而讓數萬個對話token要重新計費。

T3
NVIDIA影片生成模型大幅提速

NVIDIA 研究團隊發表 SANA-Video 2.0,這是一款能在單一顯示卡上生成高畫質長影片的 AI 模型。它主打的技術是把「線性注意力」(一種讓 AI 處理長序列資料時運算量不會爆炸性增加的省力算法)和少量「softmax 注意力」(傳統做法,品質好但運算量隨內容長度呈平方成長、非常耗資源)以三比一的比例混搭在一起,用省力算法打底、再定期用傳統做法補強細節,讓生成品質接近傳統做法,但速度快非常多。研究團隊還設計了一個叫「區塊注意力殘差」的機制,把前面算好的區塊摘要傳遞給後面的層數重複利用,藉此在不增加多少運算量的情況下提升生成細節的豐富度。整體而言,這是一篇技術論文與展示網頁,展現如何讓 AI 影片生成從又貴又慢,變得可以在一張顯卡上實際跑起來。

假設你想用 AI 生成一段 720p、5 秒長的影片,用傳統的高品質影片生成模型(例如論文提到的對照組 Wan 2.2-A14B)在一張 NVIDIA H100 顯卡上跑,需要耗費相當長的時間且運算成本高;改用 SANA-Video 2.0(5B 規模模型),論文數據顯示它在同一張 H100 顯卡上,經過完整最佳化後只要約 13 秒就能生成同樣 720p、5 秒的影片,比對照組快了 120 倍,而在畫質評分(VBench,一種專門評估 AI 生成影片好壞的標準測試)上仍拿到 84.30 分,和更大型的傳統模型打平。差異在於:以前想要單卡跑出這種長度和畫質的影片幾乎不可行,現在同一張卡在十幾秒內就能完成,讓個人開發者或小團隊也有機會直接在自己的設備上做影片生成實驗,不必依賴大型雲端算力叢集。

T3
新模型Celeris-1推理提速15倍

有家叫Celeris的公司發表了一款新的語言模型(LLM,就是像ChatGPT那樣能對話、寫文章的AI),名叫Celeris-1。它主打的賣點不是「比別人聰明」,而是「回答速度比別人快很多」:官方數據顯示,Celeris-1回答一半問題所需的時間(p50延遲,代表一半的回應在這個時間內完成)只要157毫秒,比OpenAI的GPT-5-mini快約15倍、比GPT-5快約17倍。之所以能這麼快,是因為它用了一種叫「擴散(diffusion)」的生成技術,跟目前主流AI模型「一個字接一個字往下猜」的做法(自迴歸生成)不同,可以更平行、更快地把整段回答生成出來。在智慧程度的測驗(MMLU-Pro,一種考AI綜合知識與推理能力的標準化測驗)上,Celeris-1拿到76分,跟GPT-5-mini的78分、GPT-5的81分接近但沒有超過。另外在每秒能吐出多少字(tokens per second,字詞生成速度)的測試中,Celeris-1達到每秒1,280個token,遠高於Google Gemini 3.5 Flash-Light的144個。不過原文下方也有人留言質疑,76分對81分其實差距不小,官方形容自己「接近GPT-5等級的智慧」可能有點誇大。

假設你在做一個客服機器人,需要即時回覆大量用戶詢問,如果用GPT-5,每個問題可能要等上以秒計的時間才能生成完整回答,尖峰時段容易塞車、用戶會感覺卡頓。換成Celeris-1,因為p50延遲只要157毫秒(不到0.2秒),同樣的問題幾乎是秒回等級,而且每秒能吐出1,280個字,代表長篇回答也能很快跑完。差別在於:如果應用場景是量大、要即時、但答案不用非常精準到頂尖水準(例如客服對答、即時字幕翻譯),用Celeris-1可以用差不多的智慧水準換來大幅降低的等待時間與伺服器成本;但如果任務需要GPT-5那種頂尖推理能力(例如複雜程式除錯、法律文件分析),Celeris-1實測的76分仍略遜一籌,不見得夠用。

T3
OpenRouter推出分類器功能

OpenRouter Classifiers(分類器,目前是測試版)是一項新功能,讓開發者可以在工作區中為每一筆AI推理請求加上標籤,例如標註任務類型、所屬部門、代理複雜度等,方便後續統計與管理。開發者可自行設定分類維度、撰寫分類提示詞、選擇用哪個模型來執行分類判斷,官方文件中有更多使用說明。

使用Classifiers後,開發者可依照任務類型、所屬部門、代理複雜度等維度為每筆推理請求貼上標籤,方便後續在工作區中篩選、統計與管理用量。官方文件提供更多設定方式與使用說明。

T3
法律AI公司推真實案例基準

Legora 是一家做法律用 AI 助理的公司,他們推出一個叫 BAR(Benchmark for Agentic Reasoning,用來測試 AI 代理推理能力的評測)的新評測標準。跟很多 AI 基準測試(benchmark,就是用一套固定題目來打分數、比較不同 AI 模型誰厲害的方法)不一樣的地方是,BAR 不用簡化過、人工設計的模擬題目,而是直接拿真實律師事務所處理過的案件(超過5000件、涵蓋28個法律業務領域)來出題,並且在 Legora 自己實際提供給客戶用的系統環境裡測試,而不是另外搭建一個測試用的簡化環境。每個題目都由真人律師事先寫好評分標準(叫做 rubric,就是一份「答案要包含哪些重點才算對」的檢查清單),並依重要性給不同權重,模擬真正律師事務所合夥人審稿時「漏掉關鍵條款比漏掉小細節嚴重得多」的評分邏輯。他們也因此比較了 Anthropic(Claude 系列)、OpenAI、SpaceXAI 等公司的多個模型,在不同任務長度和難度下的表現、速度與成本差異。

假設一間律師事務所想確認到底該用哪個 AI 模型來處理起草、審閱合約這類工作,如果只看一般公開的 AI 能力排行榜(例如比誰數學、寫程式厲害),沒辦法反映實際處理法律文件的能力,因為題目通常是簡化過的假設情境,而且題目公開後,AI 公司可能拿去當訓練資料,讓下次模型「背過題目」而考高分。用 Legora BAR 的做法是:直接給 AI 一個「請把對方寄來的保密協議(NDA)草稿,對照我方保密協議範本做逐條修改標記,並針對合約期限、機密資訊定義、禁止挖角條款這三點特別留意,最後附一份簡短說明哪些地方需要我方決策」這種真實會發生的任務,讓 AI 在案件資料夾(裡面放著範本、過去案例、相關文件)裡實際操作,再由律師事先寫好的檢查清單來打分。這樣測出來的結果,才真正反映這個 AI 到未來實際上工時,能不能做出律師能用、能信任的成品,而不是只考出一個漂亮但不實用的分數。

T3
NVIDIA ModelExpress加速模型部署

NVIDIA 發表一套叫 ModelExpress(簡稱 MX)的工具,用來解決一個很實際的麻煩:現在的 AI 模型(尤其是大型語言模型,就是像 ChatGPT 背後那種會對話的 AI)檔案動輒幾百 GB 甚至上兆位元組,每次要在伺服器上啟動一個新的服務節點,都得把這些龐大的權重檔案(weights,也就是模型訓練完後存下來的「記憶」數據)從硬碟或雲端存儲搬到 GPU(顯示卡,AI 運算的主力晶片)裡,這個搬運過程非常花時間,等於每次擴充機器都要重新等一次。MX 的做法是優先找「已經在跑同一個模型的其他伺服器」,直接用 GPU 對 GPU 的高速網路(P2P RDMA,一種繞過中間層、直接兩臺機器顯卡對顯卡傳資料的技術)把權重複製過去,比起每次都從遠端儲存空間慢慢下載快很多。除了權重本身,MX 也能同步搬運「已經編譯好的運算加速快取」,讓新伺服器不用重新花好幾分鐘做暖機(JIT 編譯,就是程式在執行當下才即時把程式碼轉成機器能跑更快的版本),以及在強化學習訓練(RL post-training,一種讓模型透過不斷嘗試、根據回饋調整的訓練方式)過程中,即時把訓練端更新的權重同步給負責產生資料的推論端。

NVIDIA 團隊實測用一個叫 DeepSeek-V4 Pro 的大模型,跑在 8 張 B200 GPU 的伺服器上:原本要啟動一個新的服務副本(replica),需要從儲存空間把模型權重和相關快取全部下載進 GPU,總共花費 8 分鐘。改用 ModelExpress 後,因為系統會自動找到已經在服務同一模型的另一臺伺服器,直接用 GPU 對 GPU 的方式把權重和編譯快取複製過去,整個搬運只花不到 10 秒,把總啟動時間壓縮到 1 分 44 秒,等於快了將近 5 倍。對於需要頻繁自動擴容(autoscaling)、或是要不斷因應流量尖峰增開伺服器的 AI 服務商來說,這代表新機器上線變快、使用者等待時間變短,也省下大量重複下載造成的網路頻寬浪費。

T3
Amazon資助Lean證明AI安全

Amazon宣佈長期資助「Lean專注研究組織」(Lean FRO),這是該組織史上收到的最大一筆捐款。Lean是一種程式語言,專門用來寫「數學證明」,可以嚴謹證明一段程式或規則在任何輸入下都不會出錯,這和傳統軟體測試(只能測試你想得到的情境,測不到的就漏掉)是完全不同的做法。Amazon認為,隨著AI代理人(agent,就是能自己做決策、動手操作的AI程式,例如能自動核准理賠、操作重要系統的AI)的權力越來越大,光靠測試已經不夠,需要數學等級的證明才能讓人真正信任這些AI不會亂來。Amazon刻意把Lean的開發放在公司外部、由社群共同治理,理由是這樣客戶、稽核人員、監管機關才能自行檢視這套驗證工具本身有沒有問題,而不是隻能相信Amazon的一面之詞。

具體例子是Amazon Bedrock AgentCore裡的「Policy」功能:它用Lean做數學驗證,來證明一套規範AI代理人行為界限的「政策語言」(policy language,也就是規定AI能做什麼、不能做什麼的規則)本身是正確無誤的,等於是幫AI代理人的行為邊界上了一道有數學保證的鎖,Amazon表示目前還沒看到其他公司提供這種等級的保證。另一個例子是有科學家用LLM(就是ChatGPT這類會對話的AI)搭配Lean,證明瞭Amazon Aurora資料庫最關鍵的「分段修復協定」(segment repair protocol,用來保護資料完整性的核心機制)是正確的,而且只花了原本人工證明所需時間的一小部分。差異在於:傳統做法只能靠工程師寫測試案例逐一檢查,難保沒漏掉的邊角情況;用Lean做數學證明則能一次性、確定性地涵蓋所有可能輸入,這對操作金錢、理賠、關鍵基礎設施的AI代理人來說是更高等級的安全保障。

T3
Oracle推中階市場私有AI資料庫

Oracle推出新產品「Base Database Cloud@Customer」,讓中型企業和分公司也能用上原本只有大企業才負擔得起的「私有AI」服務。所謂私有AI,是指企業把AI模型直接架設在自己公司內部的機器上運算,資料不用傳到外部雲端,比較符合注重隱私、法規要求的產業需求。這款產品是一臺實體機器(代號X11平臺),可以放在客戶自己的機房裡(叫做on-premises,就是不用透過遠端雲端資料中心),但同時享有雲端等級的自動化管理服務(Oracle自家雲端OCI提供的自動化維運功能),並支援執行LLM(就是ChatGPT這種能對話、生成文字的AI模型)的本地推論運算,也就是讓AI模型直接在自己防火牆內的機器上回答問題,不必把公司資料送出去給外部AI服務處理。這個產品定位是填補現有旗艦產品Exadata Cloud@Customer(給大型企業用、規模更大更貴)和一般中小企業需求之間的落差。目前唯一還沒做到的是完全離線、不連外網的「氣隙(air-gapped)」控制系統,官方說這部分還在規劃中,尚未推出。

假設一家中型製造公司的分公司想用AI幫忙分析內部生產數據、回答員工查詢公司規章,但公司規定客戶資料和內部文件不能傳到外部雲端伺服器。過去若要達到這種「資料不出門又要雲端管理方便」的需求,通常只能選擇Oracle旗艦產品Exadata Cloud@Customer,但那套系統規模大、成本高,適合大型企業,中型分公司很難負擔。現在用Oracle Base Database Cloud@Customer的X11機器,公司可以把這臺機器裝在自己機房,執行Oracle AI Database 26ai,讓LLM模型直接在機房內的機器上運算、回答內部查詢,同時Oracle還是能透過雲端後臺幫忙自動化維護、更新這臺機器,公司不用自己養一整組IT維運團隊。差別在於:以前中型企業要嘛忍受資料外送雲端的風險,要嘛得砸大錢買旗艦級系統;現在有中間選項,用較低成本的機器就能兼顧資料留在本地和雲端自動化管理兩個好處。

T3
Neo4j虛擬圖譜公開預覽

Neo4j(一家專做「圖資料庫」的公司,圖資料庫是把資料存成「人、事、物之間的關係網」而不是傳統表格)推出新功能「Virtual Graph(虛擬圖譜)」,現在開放給所有 Aura(Neo4j 的雲端服務)用戶公開試用。這個功能可以直接連到企業已經在用的 Snowflake、Databricks、Google BigQuery(三個常見的資料倉儲/大數據平臺,公司通常把海量原始資料堆在這裡)上,不用把資料複製搬家,就能把裡面的表格資料「看成」一張知識圖譜來查詢,官方稱為「zero-copy(零複製)」。它會用 AI 幫忙自動抓表格資料、建議該把哪些欄位當成節點(人、公司這類實體)、哪些當成節點之間的關係,使用者可以檢查調整後再用圖形查詢語言 Cypher 查詢;查詢背後會被確定性地(同一問題每次都轉換成同樣結果,不是 AI 隨機生成)翻譯成 SQL 丟回原本的資料倉儲執行。官方建議它適合用在 GraphRAG(一種讓 AI 先查知識圖譜、再回答問題的技術,能減少 AI 亂編答案)、大批資料整理、和分析師探索資料等「容許等幾秒鐘」的場景,若是需要毫秒級即時反應的用途(例如即時防詐騙評分)則仍建議用原生 Neo4j 資料庫。目前公開預覽期間免費,公司預告 9 月 1 日起開始比照 AuraDB Pro 的價格收費。

假設一家銀行想查「哪些帳戶背後的實際受益人是同一個人」,這種問題要跨好幾層帳戶、股權、身分資料才能串起來回答。過去的做法是先寫 ETL 資料管線,把 Snowflake 裡的帳戶表、股權表整批複製搬到獨立的 Neo4j 圖資料庫,再手動建模、維護兩邊資料同步,一旦來源資料更新,圖資料庫就會跟著過時(也就是所謂的「資料飄移」)。用 Neo4j Virtual Graph,銀行只要在 Aura 主控臺裡設定好 Snowflake 的連線,AI 會自動掃描帳戶表、股權表等,提出一份「哪些欄位是節點、哪些是關係」的圖模型草案,分析師檢查調整後就能立刻用 Cypher 查詢語句問「哪些帳戶共享同一個受益人」,系統即時把這句 Cypher 轉成 SQL 丟回 Snowflake 算出結果,資料全程沒有離開 Snowflake、也沒有複製第二份。差別在於:舊做法要花時間搭建搬資料的管線、且資料會過時;新做法幾分鐘內就能對「原地不動」的資料跑圖形查詢,且結果永遠是最新的。

T3
向量搜尋上億筆時RAM太貴怎麼辦

這篇文章討論的是「向量資料庫」(一種讓 AI 能用語意找相似內容的資料庫,例如問一句話就能找到意思相近的文件,常用在 RAG,也就是讓 AI 回答前先查資料庫、避免憑空捏造)在資料量衝到一億筆到十億筆規模時遇到的成本問題。目前最主流的搜尋演算法叫 HNSW(一種把資料放進記憶體、靠圖形結構快速找相鄰資料點的方法),速度很快,但代價是要把整份索引塞進昂貴的 RAM(電腦的高速記憶體,比硬碟貴很多但存取快很多)。文章比較了兩種改用硬碟儲存的替代演算法 SPANN 和 DiskANN,它們把大部分資料改放到便宜的 SSD 或雲端物件儲存,只把少量索引資訊留在 RAM,藉此大幅降低費用,但查詢速度會變慢、且延遲比較不穩定。文章用實際數字換算:一億筆向量若全放 RAM 一個月要花約六千美元,改用硬碟只要一百多到三百美元,成本差距可以到數十倍。

假設一家公司要做客服 AI 或企業內部搜尋,向量資料庫存了一億筆文件片段的語意向量。用傳統作法(HNSW 全放 RAM),每個月光是資料庫記憶體費用就要六千美元左右,而且資料量若成長到十億筆,費用會線性暴增到六萬美元。改用 DiskANN 或 SPANN 這類硬碟導向索引後,同樣一億筆資料每月硬碟費用降到約一百二十到三百美元,代價是查詢延遲從毫秒級可能拉長到幾十甚至幾百毫秒(要看資料是否剛好被快取住)。文章指出,如果這個查詢結果後面還要送給 AI 語言模型做進一步處理(例如 RAG 場景),多這一百毫秒通常不影響整體使用體驗;但如果是需要即時反應的 AI 代理人(agent)記憶系統、一次任務內要連續查很多次,這種延遲差異就會被放大,這時就該考慮繼續用比較貴但快的 RAM 方案。

T3
專家解讀:AI採用瓶頸在情境工程

這篇文章是 Stack Overflow 資料科學總監接受訪談,討論為什麼現在AI工具用起來還是卡卡的。他發現真正的瓶頸不是AI「不夠聰明」,而是「情境工程」(context engineering,意思是要把AI需要知道的背景資料,例如信件往來紀錄、Slack對話、公司內部流程,事先整理好餵給AI,它才能給出真正貼切的答案)沒做好。舉例來說,AI可以幫你回一封信,但它不知道寄信人是誰、你們之前聊過什麼,所以你得先手動把相關的郵件、對話全部複製貼上給AI,設定好權限,最後還要自己檢查修改內容才敢送出,一來一往下來,設定的功夫往往比自己寫信還累,這就是為什麼很多人用了一兩次就放棄的原因。文章也提到企業內部的專屬流程和機密資料,一般的大型語言模型(LLM,就是ChatGPT這類會對話的AI)根本沒被訓練過,因為公司不會把機密資料拿去給AI公司訓練,所以AI在處理公司內部業務時特別容易「猜錯」或抓錯重點,也就是被無關資訊「分心」,浪費時間和運算成本(token,可以想成AI每讀一個字要付的錢)。作者建議想真正用好AI,第一步是像教小孩一樣,先停下來「觀察與思考」:回覆這封信我會參考哪些資訊、會刻意忽略哪些資訊,把這些想清楚並寫下來,才能一步步把AI該看什麼、不該看什麼設定對。

具體案例是回覆一封同事寄來的信。假設同事Joe寄信來問「專案XYZ最新進度如何」,人類會很自然地判斷:進度資料可能在Slack、Jira(專案管理工具)或某場會議紀錄裡,然後挑出最相關的來源回覆。但直接把這封信丟給一般AI,AI沒有這些背景,它只看得到這封信本身,可能會抓錯重點,或需要你先把Slack對話、Jira紀錄、過去信件全部手動複製貼上進去才能生成一個堪用的草稿,寫完後你還要再花一兩輪修改才敢按送出。對比之下,如果公司事先做好「情境工程」——把哪些工具、哪些資料夾、哪些頻道跟哪種問題對應好,並讓真正懂流程的員工先確認過AI的理解是否正確——AI下次遇到類似問題時就能直接抓到對的資料來源,不用每次都重新人工兜資料,這就是情境工程要解決的核心問題:讓AI不再因為「資訊分心」或「資訊不足」而答非所問。

T4
T4
漫畫作者控告AI迷因產生器侵權

一位在菲律賓的數位創作者Elmer Saflor,網路暱稱「Superelmer」,畫了一幅在2017年爆紅的迷因漫畫「Running Away Balloon」(一個人跑走並放開氣球的漫畫)。他最近提告一家叫Memes Apps的公司,指控對方旗下的AI迷因產生器(一種輸入文字或需求、AI就自動生成迷因圖片的工具,服務叫Memes.ai和Memes AI Studio)把他的漫畫當成付費廣告產生器的範本,讓使用者可以直接套用他的作品去生成商業廣告,卻沒有取得他的授權,這已經違反著作權法。Saflor提告前並沒有先跟對方聯絡協商,也還沒看過自己的漫畫真的被用在生成出來的廣告裡,但他表示提告是為了透過訴訟程序的證據開示(強制對方提供資料的法律程序)弄清楚事實,同時凸顯一個更大的問題:AI平臺使用創作者作品時到底該負什麼授權責任、著作權法在「網路迷因變成商業產品」這件事上該怎麼適用。網路法律專家Eric Goldman指出,2024年「SuccessKid」迷因的官司已經有判例:迷因用在非商業場合大致算合理使用,但用在廣告裡就不算,這對Saflor的案子是有利的先例。

假設你經營一個迷因廣告生成平臺,使用者輸入品牌名稱和訴求,AI就自動套用網路上熱門的迷因圖片模板(例如某個知名的表情包或漫畫格式)產生出一張看起來很像原迷因、只是替換了文字和商標的廣告圖。Saflor這個案子點出的風險是:如果你的AI工具背後的訓練或模板資料庫,直接把某個有明確作者、受著作權保護的漫畫(不是單純的路人照片截圖迷因,而是像Saflor這種原創連環漫畫)拿來當「廣告生成範本」使用,即使使用者自己沒特別選擇要用這張圖、平臺是自動套用,作者本人一樣可以告你的公司,而且法院先前在SuccessKid案已經傾向認定「迷因用在廣告」不算合理使用。對比舊做法:過去很多迷因產生器只是把梗圖庫當成「大家都在用、法律風險低」的公共素材,這起訴訟提醒平臺方,若梗圖有明確著作權人,商業化使用仍需要另外取得授權,否則可能面臨侵權訴訟。

T4
Claude Opus 5 一度大量錯誤已修復

Claude(Anthropic 出的 AI 聊天機器人,類似 ChatGPT)旗下最新模型 Opus 5,在 2026 年 7 月 27 日發生短暫的服務異常,使用者呼叫時出現大量錯誤訊息(也就是系統回應失敗、無法正常得到答案)。受影響的不只是網頁版 claude.ai,還包括開發者用的 API(讓其他軟體呼叫 Claude 的介面)、Claude Code(寫程式用的 AI 工具)以及 Claude Cowork(協作功能)。官方在事發後掛出事件公告並持續調查,約半小時後(從 UTC 11:27 到 11:47)錯誤率就恢復到正常水準,官方將此事件標記為已解決,但沒有公佈詳細的根本原因。

如果你當天正在用 Claude Code 寫程式,或透過 API 串接 Opus 5 做客服機器人,在 UTC 11:27 到 11:47 這段時間內呼叫可能會收到錯誤回應而不是正常答案;對比平常穩定運作的狀況,這段時間你可能需要重試請求或切換到其他模型版本;事件解決後恢復正常呼叫即可;至於官方是否要求使用者進行任何補救設定,目前尚無法確認。

T4
超維動力攜手北大醫療做具身智能

深圳一家做「具身智能」(就是讓機器人擁有能感知、理解並操作真實世界的AI能力,不只是嘴巴聊天而已)的公司「超維動力」,和北大醫療旗下的醫療管理公司達成合作,要一起把機器人技術帶進醫院場景。因為醫院對安全要求極高,機器人不能貿然直接上場操作病患或器械,所以雙方規劃了三步走的路線:先在電腦裡建一個高度逼真的「虛擬醫院」讓機器人反覆練習犯錯,再用真人醫護戴頭戴式攝影裝置示範操作、把動作轉成AI可學習的訓練資料,最後才在貼近真實的病房、手術室環境裡做驗證測試,通過後才考慮小範圍試點應用到真正醫院。目前雙方鎖定的優先驗證任務是試管分揀、藥品配送、病床轉運這類相對低風險的醫院日常作業。

假設一家醫院想讓機器人幫忙做「藥品配送」這種瑣碎但重複的工作,傳統做法是直接買一臺配送機器人放進醫院試跑,但醫院動線複雜、人流密集,出錯風險高、也難以大量收集真實操作數據來改善機器人表現。超維動力的做法是:先用他們的「KAI World Model」世界模型引擎把醫院的病房、手術室等場景搬進虛擬世界,讓機器人在虛擬醫院裡先跑幾千次「送藥」流程、隨便犯錯也沒關係;同時用「KAI Halo」頭戴式採集裝置,讓真實醫護人員戴著它做示範動作(例如怎麼拿藥、怎麼放進推車),系統再把這些動作轉換成機器人能學習的訓練資料,等於用真人經驗當機器人的「教材」。等機器人在虛擬環境裡練到動作穩定、不出錯,才會被放進貼近真實的病房環境做進一步測試,確認安全可靠後才會考慮真正在醫院試點運作。相比直接把機器人丟進醫院現場「邊做邊學」,這套流程等於先在低風險的虛擬環境裡把犯錯成本降到零,等能力練扎實了才進場,降低真實醫療場景中的安全風險。

T4
飛書深諾推出出海AI行銷Agent 2.0

中國企業「飛書深諾」推出了一套叫 Marvy 2.0 的 AI 行銷系統,專門幫中國品牌到海外賣東西時處理行銷工作。它用的是「多智能體(multi-agent,就是讓好幾個各司其職的 AI 小助手一起合作,而不是隻有一個 AI 單打獨鬥)」架構,裡面有五個專門的 Agent(可以理解成分工不同的 AI 員工),分別負責市場調查、選投放平臺與預算、做廣告創意、實際上架投廣告、以及事後分析成效,上面還有一個「Supervisor Agent」負責統籌分派任務、協調各 Agent 的意見分歧。它強調自己不是把同一個問題丟給好幾個大模型各自回答再拼湊(官方稱這種做法為「偽多智能體」),而是真的共用資料、互相驗證、可以追溯每個判斷用了什麼資料、走了什麼推理過程。系統還有一套「Trace→Eval→Agent」機制,會記錄每次任務執行的完整過程、評估執行品質好壞,再把評估結果回饋給下一次任務,讓系統越用越準。

某中國消費電子品牌要開拓奈及利亞(Nigeria)市場,過去這種任務要靠一個全鏈路投放團隊(市場調查、策略、創意、投放、數據分析各有專人)花一個月才能做完。改用 Marvy 2.0 之後,系統自己分析當地消費者、競爭狀況和過去投放數據,再製定媒體與創意策略、完成廣告投放,並依實際成效持續調整判斷,結果整個專案的優化效率提升了 74%,人工花費的時間減少了 89%。差異在於:傳統做法要靠不同團隊人工把調查結果、策略、素材、投放、成效逐環節手動傳遞銜接,容易卡在團隊之間的溝通與等待;Marvy 2.0 把這整條流程接進同一套系統,讓各環節的資料自動流通、即時反饋,大幅縮短了從調查到成效複盤的週期。

T4
Threads私訊可跟Meta AI聊天

Meta(就是Facebook、Instagram、WhatsApp的母公司)宣佈在Threads(類似X/推特的社群平臺)的私訊功能裡加入Meta AI聊天機器人(一種能跟你對話、回答問題的AI助理),讓使用者可以私下跟這個AI對話,不用像之前只能在公開貼文裡跟它互動。這其實是Meta AI在Facebook、Instagram、WhatsApp私訊裡都已經有的功能,現在延伸到Threads。Meta這樣做的用意,是希望使用者留在自家App裡問問題、找資訊,而不是跳出去用OpenAI的ChatGPT或Google的Gemini這些競爭對手的AI服務。這項更新從週一開始在全球陸續上線。

假設你在Threads上看到一則貼文、一張圖片或一段影片,想多瞭解背後的資訊,以前你可能要截圖、複製連結,另外打開ChatGPT或Gemini的App貼上去問。現在有了這個新功能,你可以直接把那則Threads貼文、圖片、連結或影片分享給私訊裡的Meta AI,直接在對話框裡追問細節、深入討論,不用離開Threads這個App。對Meta來說,差別在於:以前使用者問完問題可能就順勢切換去用別家AI App,現在整個問答流程都留在Threads裡完成,使用者黏著度更高。

T4
Aiven併購Flow AI強化代理架構

開放資料平臺公司 Aiven(提供 Kafka、PostgreSQL 等代管開源資料庫服務)宣佈收購 Flow AI,一家專門打造「AI 代理」(agent,就是能自己規劃步驟、呼叫工具去完成任務的 AI)生產環境基礎設施的公司。Flow AI 的技術包含代理執行環境(runtime,讓代理實際運作的底層系統)、資料層工具,以及評估工具(evaluation,用來檢驗 AI 代理回答品質好不好的機制)。收購後,Aiven 希望讓企業可以把 AI 代理直接架在自家最新、受控管的正式營運資料旁邊執行,而不必另外搬資料或忍受資料過時的問題。Aiven 強調所有服務仍會維持在真正的開源軟體上,不會做成專屬(proprietary)分支鎖住客戶。

假設一家 SaaS 公司想做一個能直接讀公司內部即時交易資料庫、回答客服問題的 AI 代理,過去做法是先把資料從正式資料庫匯出、清洗、放進另一個給 AI 用的系統,資料常常有延遲、且要自己拼湊代理的執行環境和品質評估工具,開發時間拉得很長。收購後 Aiven 的目標是讓這家公司可以直接在 Aiven 代管的 Kafka、PostgreSQL、ClickHouse 等資料庫旁邊,用 Flow AI 帶來的代理 runtime 和評估工具建置代理,資料是即時、受治理的正式資料,不需要額外搬遷資料層,等於把「建置可靠代理」的基礎設施跟「管理正式資料」的基礎設施合而為一。

T5
T5
Meta推獨立賣家App Seller

Meta(就是 Facebook 的母公司)推出一款全新的獨立應用程式,名叫 Seller(賣家),目前還是早期實驗性質。它的定位是專門給在 Facebook Marketplace(臉書的二手交易市集)上賣東西的人用,就像過去有專門剪片軟體服務內容創作者一樣,Seller 就是要服務「賣家」這個族群。這個 App 完全免費,除了手機版之外,也會有網頁版可以用。裡面內建了一些 AI(人工智慧)功能,目的是讓刊登商品、賣東西的過程變得更輕鬆、更少麻煩。使用者可以直接用自己的 Facebook 帳號登入 Seller,而且商品刊登資訊會自動跟 Marketplace 同步,不用兩邊分別上架。

假設你平常會在 Facebook Marketplace 上賣東西。過去在 Marketplace 的介面中管理商品刊登,流程上可能比較零散。有了 Seller 這個獨立 App 之後,你可以直接用 Facebook 帳號登入,App 內的 AI 功能會協助簡化刊登流程(例如可能減少部分手動輸入的步驟),你上架的商品資訊會自動同步回 Marketplace,不需要再到另一個地方重複刊登一次。對比舊做法,差別在於現在有一個專門、更聚焦於賣家需求的獨立工具,而不是擠在 Marketplace 這個大平臺的介面裡處理所有事情。