AI Daily Digest

📰 每日 AI 彙整

2026-07-04  ·  共 35 則報導
T1 爆炸重要T2 值得關注T3 一般資訊T4 參考用T5 可略過
T2
T2
Caveman省65%輸出Token

這是一套給 Claude Code(Anthropic 出的 AI 寫程式工具)用的外掛小工具,叫做「Caveman」,核心想法很簡單:教 AI「講原始人話」。平常 AI 回答問題時,常常會加一堆客套話,像是「我很樂意幫你」「這是一個很好的問題」,這些話對使用者沒實質幫助,卻要花錢(因為 AI 服務是照輸出的字數,也就是「token」,計費的)。Caveman 這套工具會強迫 AI 把這些廢話全部砍掉,只留下重點,講話像原始人一樣:「完成」、「先工具、先結果」。官方測試顯示平均能省下 65% 的輸出字數,最高甚至能省到 87%。這個工具在 GitHub(一個給工程師公開分享程式碼的網站)上短時間內衝到 8 萬多顆星星(代表受歡迎程度的指標),顯示很多工程師覺得好用又想省錢。

假設一位工程師要請 Claude Code 解釋「React 元件為什麼會重複渲染(re-render,就是畫面重複刷新,可能造成卡頓)」這個問題。用平常模式,AI 可能會輸出 1,180 個 token 的落落長解釋,裡面夾雜很多客套鋪陳。裝上 Caveman 之後,同一個問題只輸出 159 個 token,省下 87%,但關鍵技術重點與程式碼區塊都保留完整、沒有被砍掉。工具還提供四種壓縮強度可以選(輕度省 30%、預設省 65%、極致省 75-80%,甚至有一個「文言文模式」),而且不影響 AI 背後真正的「思考過程」(thinking token,即 AI 內部推理用的字數),只是把「講給人看的最終答案」精簡化。對於每天大量呼叫 Claude API(等於是按用量付費的服務)的公司來說,輸出字數減少 65%,就直接等於帳單省下對應比例的錢,而且安裝只要一行指令,同時相容 Claude Code、Cursor、Codex 等 30 多種常見的 AI 工具,導入幾乎沒有阻力。

T2
Meta坦言AI代理進展慢

Meta(臉書的母公司)執行長祖克柏在 7 月 2 日的內部全員大會上,公開向員工承認公司在 AI Agent(AI 代理人,也就是能自己完成一連串任務、不只是聊天回答問題的 AI 系統)的開發進度,比他原本預期的慢很多。Meta 在 2026 年初裁員約 8,000 人,同時把 7,000 名員工轉調到 AI 相關部門,還特別成立了一個叫「Agent Transformation(代理人轉型)」的專責小組,目的就是加速把公司產品都改造成能自主執行任務的 AI Agent。但祖克柏坦言,這波組織重整並不順利,過去四個月 AI Agent 的進展「並未如預期般加速」,效益也還沒真正展現出來。Meta 2026 年預計要在 AI 基礎設施上砸下約 1,450 億美元(約新臺幣 4.6 兆元),是全球數一數二的投入規模,但目前看不到對應的回報,祖克柏估計要再等 3 到 6 個月才可能看到成果。

假設一家公司想把原本「客服人員照著 SOP 回答問題」的流程,改造成「AI Agent 自己判斷問題、查資料、下決定、甚至自動處理退款」這種更進階的自動化。Meta 內部就是在做類似的事,他們把原本寫網頁功能、做推薦演算法的一般工程師,整批轉調去開發這種 AI Agent,結果發現:這些工程師過去熟悉的開發流程、測試方法、評估標準,幾乎都要重寫一套,不是把 ChatGPT 這類 AI 接上 API 呼叫幾行程式碼就能搞定的事。內部工程師形容新部門「問題叢生」、氣氛低迷,顯示即使是砸下千億美元、找來大量人力的 Meta,要把「AI 聊天回答問題」升級成「AI 自主完成複雜任務」,工程難度和組織磨合成本都遠超外界想像。這對其他也想導入 AI Agent 的企業是一個警訊:如果 Meta 都要花 6 到 12 個月才看得到成效,一般公司若倉促上馬類似專案,很可能會遇到同樣的落差。

T2
Mistral發布證明AI模型

法國 AI 公司 Mistral 發表了一個叫做 Leanstral 1.5 的新模型,這不是一般聊天用的 AI,而是專門用來做「數學證明」和「程式碼驗證」的 AI。所謂形式驗證(formal verification),就是用嚴謹的數學方法證明一段程式或一個數學敘述「保證正確」,而不是像一般測試那樣只能抽樣檢查、無法保證涵蓋所有情況。這個模型使用一種叫 Lean 4 的程式語言來寫證明,Lean 4 可以像編譯程式一樣,自動檢查一個證明的每一步邏輯是否成立,只要編譯通過,就代表這個證明是絕對正確的。Leanstral 1.5 雖然號稱有 1190 億個參數(可以想成模型的「腦容量」),但運作時每次只會用到其中 60 億個,這種設計讓它跑起來速度快、成本低,卻仍然維持很強的解題能力。這個模型是開源的(採用 Apache-2.0 授權,代表任何人都可以免費下載、修改、拿去商用),可以透過 Hugging Face 下載權重,或直接呼叫 Mistral 提供的 API 使用。

假設一位工程師想證明「自己寫的自平衡二元搜尋樹(AVL tree,一種常見的資料結構)在最壞情況下搜尋速度仍然是 O(log n)」,也就是想從數學上「保證」這個常用資料結構的效能上限,而不是隻靠測試幾組資料去猜。過去這種證明必須由懂形式方法的專家花大量時間手工在 Lean 裡一步步寫出來,門檻很高、很少人做得到。用 Leanstral 1.5,工程師只要把定理敘述丟給模型,它會自動嘗試寫證明、把結果丟給 Lean 編譯器檢查,編譯器如果報錯,模型就根據錯誤訊息自己修正再試一次,反覆執行直到編譯通過為止;官方就實際跑出了這個 AVL 樹的完整證明(過程中用掉約 270 萬個 token、經過 22 次上下文壓縮)。除了證明數學定理,Mistral 也讓這個模型去掃描 57 個真實的開源程式碼庫找漏洞,結果找出 11 個可疑問題,其中 5 個是先前從未被回報過的真實漏洞。在成本上,官方公佈解一題 Putnam 數學競賽等級的題目平均只要約 4 美元,相較之下用另一個對手模型 Seed-Prover 1.5 的高規格設定要價超過 300 美元,成本差了快 75 倍;在 miniF2F 這個常見證明測試集上已經拿到 100% 全對的成績(代表這個測試集已經被「打滿分、用盡」了),在難度更高的 PutnamBench 上也解出了 672 題中的 587 題。

T2
AI找漏洞數量暴增3.5倍

Anthropic(開發 Claude 這款 AI 對話模型的公司)發布了新版模型「Claude Mythos Preview」,這個模型有個特別能力:能自動閱讀程式碼、找出軟體裡的安全漏洞(CVE,全稱是「通用漏洞揭露」,簡單說就是駭客可能拿來攻擊系統的軟體弱點)。根據數據分析機構 Epoch AI 的觀察,2026 年 6 月,全球公開揭露的「高風險」與「重大」等級漏洞數量暴增,比過去單月紀錄多出 3.5 倍以上。研究者認為,這波暴增和 Anthropic 內部一個叫「Project Glasswing」的計畫有直接關係——這個計畫就是用 AI 模型去大規模掃描各大公司的軟體,把找到的漏洞回報給廠商修補後才公開。也就是說,不是漏洞突然變多了,而是 AI 讓「找漏洞」這件事效率大幅提升,過去要靠人工資安研究員一個個手動抓的漏洞,現在 AI 能批量挖出來。

假設微軟、Google、Apple、AWS 這些大公司過去要靠自己聘用的資安團隊,一行一行審查程式碼、或用傳統掃描工具找漏洞,這種方式速度慢、也容易漏掉藏得深的問題。Project Glasswing 讓 Claude Mythos Preview 直接去掃描這些公司的軟體程式碼,短時間內就挖出超過 1 萬個「高風險」或「重大」等級的漏洞,並且照規矩:先私下通知廠商修好,才對外公開細節(這是資安圈的標準做法,避免漏洞被公開後還沒修就被駭客利用)。對比舊做法,光是 2026 年 6 月單月,全球被公開揭露的高風險/重大漏洞就約有 1,500 個,是過去單月紀錄的 3.5 倍以上——等於 AI 在幾週內做完過去可能要好幾個月、甚至好幾年人力才能做完的漏洞挖掘工作。

T2
中國團隊推出AI虛擬細胞模型

一家中國新創公司「百曜科技」發表了一個名為 CellOS 的 AI 模型,目標是打造一個「虛擬細胞」——也就是讓電腦模擬出一顆真實細胞在不同條件下(例如被某種藥物處理、或是某個基因被關掉)會如何反應。這個模型用了 Yann LeCun(他是 Meta 的首席 AI 科學家,也是深度學習的奠基者之一)四年前提出的 JEPA 架構(全名「聯合嵌入預測架構」,簡單講就是讓 AI 不是死記硬背輸入的東西,而是學著去「預測」接下來會發生什麼變化,比較接近人腦理解世界的方式,因此又被稱為「世界模型」)。CellOS 用了 12B(120 億)參數,吃進將近 3.9 億筆「單細胞轉錄組」資料(轉錄組可以想成是一份清單,記錄一顆細胞裡有哪些基因正在被「啟動」,這份清單能反映細胞現在是健康還是生病、屬於哪種細胞、或是對藥物有什麼反應),涵蓋人體 40 多種組織、260 多種細胞類型,是目前公開資料中規模最大的單細胞基礎模型。研究團隊過去也在 Arc Institute(一個專門舉辦「虛擬細胞」競賽的美國研究機構)的挑戰賽中拿過全球第一、第二的成績。

假設一間藥廠想知道「如果我開發的新藥去抑制某個基因,會不會意外傷害正常細胞」,傳統做法是先在實驗室培養細胞、真的加藥、再花好幾天等結果,一次只能測有限的組合,成本高、速度慢——這也是為什麼新藥研發平均要花十年、十億美元,但成功率不到一成。有了 CellOS 這種虛擬細胞模型,研究人員可以直接在電腦裡輸入「這顆細胞+這個基因被關掉/這個藥物」的條件,模型會預測出細胞的基因表現會如何變化,等於是先在電腦裡篩選一輪、把最有可能有效或有風險的組合挑出來,再拿去實驗室驗證,大幅減少要真的動手做的實驗數量。在一項叫 Pearson_edist 的評測指標上(這是用來衡量模型預測的細胞反應跟真實實驗結果有多接近的分數,數值越高代表預測越準),CellOS 拿到 0.619 分,是目前唯一超過 0.6 的模型,比之前最好的開源模型 TranscriptFormer(0.373 分)高出 66%。

T2
Fable5迴歸差評跑分崩盤

Fable 5是一個AI模型(可以想成是一個會跟你對話、幫你寫程式碼的人工智慧助理),最近重新上線後短短24小時內被大量用戶狠狠吐槽。最大的問題是它的表現突然大幅退步:原本擅長的「抓程式錯誤(debugging,就是幫你找出程式碼哪裡寫錯了)」能力,測試分數從86.2分暴跌到25.9分,排名從第9名摔到第41名;「重構程式碼(refactoring,就是把寫得亂的程式碼整理得更好用)」的分數也幾乎腰斬。除了變笨,它還會莫名其妙拒絕回答一些完全無害的問題,甚至系統後臺被發現給某些用戶貼上「太笨不需要用Fable」這種帶貶義的標籤,然後偷偷把他們的請求轉給另一個較舊的模型(Opus 4.8)處理,用戶卻完全不知情,等於花了Fable的錢卻用到別的東西。

有測評機構BridgeMind實際跑分測試,發現在12個程式除錯任務中,Fable 5只完整跑完3個,其餘9個全部被系統自動降級、偷偷換成Opus 4.8來處理,用戶完全沒被告知。更誇張的是賬單:同一次編程測試總共花了321.53美元,但仔細拆開一看,真正用Fable 5處理的部分只花了78.38美元,剩下242.24美元(佔了四分之三的工作量)其實是Opus 4.8做的——也就是說用戶是照Fable 5的價格付錢,實際卻拿到另一個模型打折服務的品質。另外還有生物醫藥工程師想請AI解釋"human"(人類)這個單字,結果被系統直接攔截拒答;也有分析師只是問"raspberry"這個單字裡有幾個字母r,同樣被拒絕回答,而且同一個問題問不同人,AI的反應還不一樣,像是抽獎一樣沒有固定標準。這些具體案例讓開發者直呼這根本是「純純詐騙」。

T2
AI一晚發現4種新超導體

超導體是一種在特定低溫下電阻會完全消失的材料,找到它、尤其是找到能在更高溫度下也超導的材料,是能源和電子領域一個百年難題,因為過去只能靠科學家一個一個試、非常耗時耗力。現在阿里達摩院聯閤中國人民大學、中國科學院大學等機構,做出了一個叫「元素蝦(ElementsClaw)」的 AI 智能體(可以理解成一個專門做科研任務的自動化 AI 系統,會自己查資料、做預測、設計驗證方案)。這個系統的核心是一個叫 Elements 的模型,用了「幾何深度圖神經網路」(一種專門理解分子和晶體這類三維空間結構的深度學習模型,深度學習就是讓 AI 透過大量資料自己學出規律的技術)技術,並且用 1.25 億個分子和晶體的結構資料預訓練過(預訓練就是讓 AI 先在海量資料上打基礎,再針對具體任務微調)。這套系統只用了 28 個 GPU 小時(GPU 是電腦裡專門做大量平行運算的晶片,這裡指總共只花費了相當於一顆 GPU 跑 28 小時的算力),就把 240 萬種已知穩定晶體材料全部掃描了一遍。

假設科學家要找新的超導材料,傳統做法是從幾百萬種候選材料裡,憑經驗挑一批、拿到實驗室裡逐個合成測試,往往測十個才中三個左右(自然界裡約 3% 的材料具備超導性質),而且人類摸索這條路已經走了 100 多年,累計才發現 2000 多種超導體。這次「元素蝦」用 28 個 GPU 小時掃描 240 萬種晶體材料後,先預測出 6.8 萬種「疑似超導體」的候選名單,再經過科學家驗證,最終確認了 4 種此前人類完全不知道的新超導體,命中率達到 40%,比自然界隨機命中率高了一個數量級(約 13 倍)。這 4 種材料裡包括資料庫裡本來就存在、但從沒人做實驗驗證過的 Hf₂₁Re₂₅(臨界溫度 2.5K,K 是開爾文,一種溫度單位,數值越低代表要冷卻到越接近絕對零度才會超導);此前被算錯了結構資料的 Zr₄VRe₇(臨界溫度 3.5K);由 AI 自己生成全新結構、之前世界上根本不存在記錄的 HfZrRe₄(臨界溫度 5.9K);以及臨界溫度最高、達到 6.5K 的 Zr₃ScRe₈。也就是說,過去人類要靠上百年反覆試錯才能碰運氣找到的東西,現在 AI 一次批量掃描幾十小時就能圈出高命中率的候選清單,大幅縮短了「大海撈針」式科研的時間。

T2
AI真正走進生物實驗室

輝達(Nvidia)執行長黃仁勳今年稍早提出「物理 AI(Physical AI,指能理解並操控真實物理世界的人工智慧,例如機器人、自駕車)的 ChatGPT 時刻」,主要是講機器人和自動駕駛。這次登場的是中國公司「湧生智能」(華大智造旗下子公司,由該公司首席 AI 官帶隊),跟上海人工智慧實驗室合作,把類似的物理 AI 概念做進了「濕實驗室」(wet lab,就是真的擺著試管、培養皿、機械手臂做生物實驗的實體實驗室,跟純電腦模擬的「乾實驗室」相對)。他們做出兩個東西:一是「ProtoPilot」,一個多智能體(multi-agent,就是好幾個分工合作的 AI 助手)系統,你只要用白話文說「幫我做 8 個某基因的突變體」,它就會自動生成實驗方案、轉成程式碼、再指揮實驗室裡的自動化設備真的動手做出來;二是「BioLab Bench」,一套專門用來考核這類 AI 能力的評測標準,特別之處是它不只是紙上測驗,而是拿真實的自動化實驗設備來驗證 AI 出的方案能不能真正跑通。

假設一位生物學家想要「構建 8 個 GLuc(一種發光蛋白)突變體」來做後續實驗,傳統做法是研究員自己設計實驗方案、寫操作步驟、再一步步操作移液機、PCR 儀、定序等設備,過程繁瑣且容易出錯。用 ProtoPilot,研究員只要打一句自然語言指令,系統裡的「統籌」智能體會先規劃整體流程,「方案專家」智能體生成具體實驗步驟,「程式碼」智能體再把步驟轉成設備能直接執行的程式碼,最後真的在實體自動化設備上跑。實測結果顯示:在 96 孔盤接菌培養、24 個菌落 PCR 擴增全部成功之後,系統進一步構建了 15 個定點突變體且全數通過測序驗證,接著做 DNA 組裝,96 個克隆中有 93 個初篩呈陽性(陽性率 96.9%)。過程中系統第一輪失敗後還能自己分析原因、調整方案再重做一次並成功——這是自我修正的能力。在標準化測驗(ProtocolQA)上,ProtoPilot 開放式問答得分 52.38%,超過 OpenAI 旗艦模型 GPT-5.6 Sol 的 43.5%;把方案轉成可執行程式碼的成功率達 96.6%,遠高於對照系統 LabScript-AI 的 64.6% 和 GPT-5.5 的 17.7%。差異就是:舊做法要靠人工設計、操作、還要盯著每一步;新做法讓 AI 從「聽懂需求」到「指揮機器動手做出來」全程自動跑完,而且做錯了還會自己改。

T2
Vercel高層談Agent新型軟體

Vercel(一家專門幫工程師架設網站、以「一鍵部署」聞名的雲端服務公司)的技術長特助 Andrew Qu 接受 Latent Space(一個專門訪談 AI 技術人物的媒體)訪問,談他們公司從做「網站」轉型做「agent」(可以自己判斷、自己執行任務的 AI 程式,不只是回答問題的聊天機器人)的心路歷程。他認為 agent 是一種全新型態的軟體,跟傳統網站程式很不一樣:傳統網站的行為是固定、可預測的(按下這個按鈕一定發生那件事),但 agent 的輸出和互動方式更「動態」,也就是同樣的輸入不見得每次都做一樣的事,因為它要自己「推理」該怎麼做。Vercel 為此打造了一套叫 eve 的 agent 開發框架,把「切換不同 AI 模型」「失敗自動重試」「長時間任務可以中斷後續接著做」這些重複出現的麻煩事,包裝成現成的工具給開發者用。他也提到 skills(技能,就是給 AI 一份簡短說明文件,教它某個最新做法或糾正它學過的過時知識)為什麼重要:AI 模型訓練的資料常常過時,需要額外補充最新資訊才不會給錯建議。

Vercel 內部自己就在用 agent 處理重複性工作,例如:法務合約先做第一輪「redlining」(也就是先幫忙標出合約裡需要修改、有疑慮的條款,人再做最後把關,而不是律師從頭逐字看);行銷團隊每季做業績檢討(retrospective)時,用 agent 先彙整數據、抓出該聯繫的潛在客戶名單;工程師想查公司內部資料庫時,直接跟 agent 說想查什麼,由它自動寫出查詢語法,不用自己寫程式碼。另一個具體例子是 skills 的用途:Vercel 幾年前已經停用了「Vercel Postgres」這個資料庫服務,改用新的市集(marketplace)機制,但因為 AI 模型是用舊資料訓練的,常常還是會建議開發者用已經停用的 Vercel Postgres。解法是寫一份簡短的 skill 文件告訴 agent「Vercel Postgres 已停用,該用新方案」,agent 讀到這份文件後就會自動改用正確、最新的做法回答,不需要重新訓練整個模型。此外 Vercel 現在偵測到來訪的是 AI agent(而非人類瀏覽器)時,會直接回傳精簡的 Markdown 格式網頁內容,而不是給人類看的複雜 HTML 版面,讓 AI 更容易讀懂並正確操作網站。

T2
微軟整合Copilot推代理

微軟傳出計畫在今年8月把「消費者版Copilot」和「企業版Copilot」(Copilot 是微軟做的 AI 助理,類似 ChatGPT,整合在 Windows、Office 等產品裡)合併成同一個 App。這代表以後不管你是一般用戶還是公司員工,打開的會是同一套 Copilot,功能統一管理。同時,一些很少人用的功能(例如 Copilot Podcasts,一個把內容轉成 Podcast 的功能)將被砍掉。微軟還會推出新的 AI 代理(agent,就是能自己執行一連串任務、不需要你每一步都下指令的 AI)叫做「AutoPilot」,可以在背景幫你處理事情,但這是要額外付費才能用的加值服務。這波動作被外媒形容為微軟跟進 Anthropic、OpenAI,一起搶進「AI 超級 App」的競賽——也就是想把搜尋、聊天、辦公、代理任務全部整合進單一 AI 入口,讓使用者不用再切換多個工具。

假設你是一間中小企業的員工,公司用 Microsoft 365,你原本要用「企業版 Copilot」寫報告、查資料;下班後想用手機上的「消費者版 Copilot」規劃週末行程,卻發現介面、功能、甚至登入方式都不一樣,很難搞混誰能用什麼。8月合併後,你只需要一個 App,公司帳號登入就能無縫在工作模式和個人模式間切換。如果你願意多付一筆訂閱費,就能啟用 AutoPilot:例如你交代它「每天早上幫我整理收件匣裡的重要郵件、草擬回覆」,AutoPilot 會在背景默默完成,你早上打開手機時就已經有整理好的摘要和草稿等你確認——不像現在的 Copilot 需要你主動打開對話、一句句下指令才會動作。

T2
基準測試低估AI實力

英國「AI 安全研究院」(AISI,政府成立、專門評估 AI 風險與能力的研究單位)做了一份研究,檢查了七種常見的 AI 評測基準(benchmark,就是用來幫 AI 模型打分數、比較誰厲害的標準化考題)。他們發現,這些測試普遍「低估」了 AI agent(可以自己規劃步驟、呼叫工具、連續執行任務的 AI,不只是單純回答問題)的真實能力。原因是測試時通常會限制 AI 能用的運算資源(token budget,可以想成是給 AI「思考」的字數額度或時間額度),額度設得太低,AI 還沒發揮完全實力測試就結束了。研究團隊發現,只要把這個額度放寬,AI 的表現會明顯提升,代表過去我們看到的各家模型分數,可能都比它們實際能做到的還要差。

以「軟體工程任務」(例如叫 AI 幫忙修 bug、寫程式)這項測試為例,AISI 把 AI 可以使用的 token 額度(也就是允許 AI 多想、多嘗試幾次的量)提高到原本的十倍,結果任務成功率大約提升了 25 個百分點。而且愈新、愈強的模型,從中受益愈多——代表新模型其實有更多「潛力」是舊有測試方法量不出來的。AISI 估算,如果照這種放寬額度的方式重新衡量,AI 前沿技術(最頂尖模型)的實際進步速度,比過去用標準測試方法看到的還要快上約 60%。這對開發者和企業的意義是:如果只看官方 benchmark 分數來評估某個模型「夠不夠用」,可能會低估它真正能達成的效果,尤其是在需要 AI 多花點時間反覆嘗試的複雜任務上。

T2
Meta新模型追平GPT-5.5

Meta(臉書的母公司)內部有一個專門做「超級智慧」研究的團隊,負責人 Alexandr Wang 最近公開表示,他們正在訓練中的新一代 AI 模型,代號叫「Watermelon(西瓜)」,在幾項業界公認的 benchmark(就是用來測試 AI 模型能力強弱的標準化考題,例如數學、程式、推理等測驗)上,成績已經追上了 OpenAI 目前最強模型 GPT-5.5。這代表 Meta 在頂尖 AI 模型的競賽中,可能重新拉近了跟 OpenAI 的差距。不過這個模型目前還在訓練階段,尚未正式對外發布,Meta 也還沒公佈何時會推出。值得注意的是,Watermelon 用的運算資源(可以想成是訓練 AI 要燒的電腦算力與電費)比 Meta 前一個模型 Muse Spark 多了十倍以上,顯示 Meta 這次是砸重本要衝頂尖水準。

假設你是一間公司的技術主管,過去半年一直在用 GPT-5.5 來處理客服自動回覆或程式碼生成,因為它是市場上公認最強的模型。如果 Meta 的 Watermelon 真的如傳言般追平 GPT-5.5,等到它正式發布後,你就多了一個效能相當、但可能開源或授權條件更寬鬆(Meta 過去的 Llama 系列多半走開源路線)的選擇,屆時可以重新比較兩家的價格、速度與授權方式,決定要不要把部分工作負載轉移過去,不用再被單一供應商綁住。目前差別在於:GPT-5.5 已經是可以直接使用的正式產品,Watermelon 還在實驗室訓練中,說得出「跑分追上了」,但還拿不出「可以下載或呼叫 API 使用」的實際產品。

T2
Laguna XS 2.1新模型發布

Poolside 這家 AI 公司發表了新模型「Laguna XS 2.1」,參數量 330 億(模型內部「知識容量」的一種粗略衡量,數字越大通常代表能記住、理解的東西越多,但不是唯一指標)。這個模型採用 MoE(Mixture-of-Experts,混合專家架構,簡單說就是模型內部分成很多個「小專家」,每次回答問題只挑其中幾個專家出來運算,而不是整個模型全部啟動,好處是速度快、省資源但效果不打折)。它主打「agentic coding」(讓 AI 像一個能自己動手做事的工程師一樣,自動寫程式、除錯、規劃步驟,而不是隻回答一句話)跟「long-horizon tasks」(需要很多步驟才能完成的長任務,例如整個專案的開發流程)。在 SWE-bench Multilingual(一個專門測試 AI 修 bug、寫程式能力的多語言基準測試,分數越高代表越會寫程式解 bug)上拿到 63.1% 的成績,比之前進步了 5.4 個百分點。它還提供三種「量化」版本(quantized,把模型壓縮瘦身,讓一般電腦或較弱的伺服器也能跑得動,犧牲一點點準確度換取更省資源)。授權採用 OpenMDW-1.1,屬於開放模型授權,意味著開發者可以自由下載、使用、甚至修改這個模型。

假設一間新創公司想做一個「自動修 GitHub bug」的工具,過去可能要付費呼叫 GPT-4 這類雲端大模型的 API,每次呼叫都要花錢,而且模型是封閉的,無法客製化或部署在自己公司內部伺服器(例如金融、醫療產業因法規要求資料不能出公司)。現在他們可以直接到 Hugging Face(一個公開下載 AI 模型的平臺)下載 Laguna XS 2.1,選擇量化版本部署在自己公司的伺服器上,不用付 API 費用,也符合資料不外流的規定。實測在 SWE-bench Multilingual 這個修 bug 測試上,它能正確解決 63.1% 的問題,比舊版本多修好 5.4% 的 bug,代表同樣丟一批程式問題給它,它能比舊版本多解決約每 100 題中的 5、6 題。

T2
AI代理人自動執行勒索攻擊

資安公司 Sysdig 表示,他們發現了史上第一起「從頭到尾由 AI agent(也就是能自己規劃步驟、自主連續執行多項任務的 AI 程式,不需要人一步一步下指令)獨立完成」的勒索軟體攻擊。這個 AI agent 利用了一套叫 Langflow(一個讓開發者用拖拉方式快速搭建 AI 工作流程的開源工具)裡的 RCE 漏洞(Remote Code Execution,遠端程式碼執行漏洞,簡單說就是駭客可以透過網路,在完全不接觸受害者電腦的情況下,遠端偷偷執行任意指令)。過去駭客攻擊通常需要人親自操作每個步驟,但這次攻擊裡,AI agent 自己完成了「找漏洞、偷帳密、把資料庫加密、發出勒索訊息」這一整套流程,等於是勒索軟體攻擊第一次不需要人在旁邊操盤。這代表 AI agent 的自主能力已經強到可以被拿來當「全自動駭客」使用,對資安防禦是一個警訊。

假設一家公司內部用 Langflow 建了一個對外開放的 AI 工作流程服務,但沒有把某個已知的 RCE 漏洞修補好。過去,攻擊者要闖進這臺伺服器、找到資料庫、偷到帳號密碼、把資料庫檔案加密、再手動寫勒索信要贖金,中間每一步都需要駭客本人盯著、判斷、下指令,過程可能拖上好幾小時甚至好幾天,也比較容易在某個環節被資安系統攔截或被人發現異常行為而中斷。但這次 Sysdig 觀察到的攻擊,是駭客先設定好一個 AI agent 的目標(例如「進入這臺主機、拿到資料、加密、勒索」),接著 AI agent 自己判斷要先掃描找出 Langflow 的 RCE 漏洞、自己決定用這個漏洞入侵、自己找出資料庫位置並偷取登入憑證、自己執行加密指令、最後自己產生並留下勒索訊息——整個過程一氣呵成、幾乎不需要人再介入。差別在於:傳統攻擊速度受限於「人」的操作速度與精神,AI agent 可以 24 小時不間斷、同時對大量目標重複這套流程,讓攻擊規模和速度大幅提升,也讓防禦方更難即時反應。

T3
T3
GLM5.2上AMD省逾2倍成本

這篇文章講的是,一家叫 Wafer 的公司,把一個大型語言模型(LLM,就是像 ChatGPT 那樣會理解和產生文字的 AI 模型)叫做 GLM-5.2,拿到 AMD 推出的一款叫 MI355X 的 AI 晶片上運行,結果跑起來的速度和成本表現都相當不錯。目前大多數 AI 模型訓練和運行都仰賴 Nvidia 的晶片(像文中提到的 Blackwell 系列),因為 Nvidia 的軟體生態(CUDA,一套讓工程師方便寫程式操控晶片的工具)發展得早又完整,大家用習慣了很難換掉。但這篇文章證明,只要肯花工夫調校軟體,AMD 的晶片也能達到接近 Nvidia 的效能,而且硬體採購成本大幅較低,等於是用比較便宜的設備做出差不多的成果。文章也提到量化(quantization,一種把模型內部數字用比較精簡的方式儲存、藉此讓運算變快變省資源的技術)等具體技巧,顯示這不是空談,而是有實際測試數據支撐。

假設一家新創公司要幫自己的 AI 客服機器人選購伺服器,如果用 Nvidia 最新的 Blackwell 晶片組成的伺服器(B300),雖然每臺伺服器每秒能吐出約 3192 個文字單位(tok/s,衡量 AI 回覆速度的單位),但採購成本高。改用 AMD 的 MI355X 晶片,經過 Wafer 團隊調校量化方式與推理框架(sglang,一套讓 AI 模型運行更有效率的軟體)之後,每臺伺服器每秒能吐出 2626 個文字單位,大約是 Nvidia 方案的 80% 效能,但硬體成本卻只要 Nvidia 的 37% 左右,換算下來等於用不到一半的錢達到八成效能。對於預算有限但又需要大量 AI 運算的公司來說,這是一個具體可行、划算的替代方案,不必被綁死在單一晶片供應商身上。

T3
超節點光互連衝破算力瓶頸

WAIC(世界人工智慧大會,中國一年一度規模最大的AI產業盛會)將於2026年7月17日到20日在上海舉行,這次大會有一個重要主題,是討論AI晶片(也就是用來訓練與運行AI模型的專用硬體,像是GPU、NPU這類晶片)的運算能力已經快要碰到物理上的天花板,單顆晶片再怎麼進步,進步幅度都會越來越有限。業界因此想出用「超節點」的做法來突破:把成千上萬顆晶片緊密串接在一起,讓它們運作起來像是同一臺超級電腦,藉此解決晶片與晶片之間、機櫃與機櫃之間傳輸資料速度太慢、拖累整體效率的問題。另外還有「光互連」技術(原本晶片之間傳輸資料是靠電訊號跑銅線,現在改用雷射光跑光纖,速度更快、發熱更少、也更省電),用來取代傳統電子傳輸方式,突破頻寬瓶頸。這些技術合起來的目標,是讓訓練與運行超大型AI模型(例如參數量高達兆級的模型)不再被硬體拖慢,同時把整體成本壓下來,達到「造得出、也用得起」的目標。

以AI公司無問芯穹推出的「Token超級工廠」為例:過去要訓練與運行大型AI模型時,晶片之間傳輸資料的延遲會拖慢整體效率,導致每處理一個Token(可以想成AI閱讀或生成文字時使用的最小單位,一個中文字大約要用掉1到2個Token)的成本居高不下。透過「跨集群異構PD分離技術」(把運算任務拆分到不同的晶片叢集,依照每種晶片的特性分派最適合的工作,減少資源浪費),無問芯穹把AI推理(也就是AI模型實際回答問題、生成內容的運算過程,跟訓練模型不同)的成本壓到原本的十分之一,單Token成本從130萬(原幣值單位)降到35萬。同樣地,上海的Shanghai Cube機櫃利用液冷技術,在同一個機櫃裡塞進128張晶片同時運行DeepSeek 671B(一個規模龐大的AI模型),功率密度達到傳統氣冷機櫃的3到5倍,而且耗電效率指標PUE(數字越接近1代表越省電)壓到1.05以下,比傳統氣冷機櫃省電四成以上。對比舊做法:以前想要跑更大的模型,只能不斷堆疊更多晶片,耗電量也跟著線性往上增加;現在透過超節點、光互連、液冷散熱等系統層面的整體改造,同樣規模的模型能用更少的電、更低的成本、更快的速度運行起來。

T3
微調模型逐字資料還原法

這是一篇機器學習研究論文,提出一種叫「CDD」(Contrastive Decoding Diffing,對比解碼差異法)的技術,用來檢查一個 AI 模型在「微調(fine-tuning,就是拿一個已經訓練好的模型,再用少量新資料繼續訓練,讓它學會特定領域知識或行為)」過程中,是否偷偷「背」下了微調用的原始文字,之後有辦法一字不差地把它吐出來。做法是比較「微調後模型」和「微調前的原始模型(base model)」兩者在每個字被選中的機率分數(logits,也就是模型對下一個字打的分數表)之間的差異,把這個差異放大,就能讓模型把藏在微調資料裡的原句「逼」出來。這個方法的特別之處在於只需要拿得到模型輸出的機率分數就好(灰盒存取),不需要像之前的方法(Activation Difference Lens,活化差異透鏡)那樣要拿到模型完整的內部權重、還要一層一層去試哪層有效,門檻低很多。換句話說,這是一種幫外部稽核者、資安研究員檢查「這個 AI 是不是把不該記的東西背起來了」的工具。

假設一間公司把自家內部的客戶資料或機密文件拿去微調一個開源大模型,想確認這個微調後的模型會不會不小心把這些機密文件的原句背出來洩漏給使用者。用傳統的稽核方法(例如 Activation Difference Lens),研究者得先拿到這個模型完整的權重檔案,還要準備測試用的探測語料,一層一層地嘗試模型的哪一層神經網路藏著這些記憶,過程繁瑣且門檻高。改用 CDD 的話,只要能同時拿到「微調前」和「微調後」兩個版本模型對同一段輸入所給出的下一字機率分數,把兩者相減、放大差異,再用這個放大後的訊號去引導生成,模型就會被誘導著把當初微調資料裡的原句一字不差地講出來。結果差異是:舊方法需要完整權重和大量嘗試才能抓到洩漏線索,CDD 只要拿得到輸出機率,就能直接把疑似洩漏的原文逐字還原出來,大幅降低稽核者的技術門檻。

T3
AI讓網站為訪客即時客製

Adobe 的首席科學家 Carlos Sanchez 在 AI Engineer World's Fair(一個給工程師參加的AI技術大會)上,展示了一種叫做「agentic site(自主網站,意思是網站本身會像個小助理,自動判斷你要什麼,再動態組出一個網頁給你看)」的新概念。傳統網站的「個人化」通常只是套用預先設計好的幾種版型,例如電商網站根據你買過的東西推薦類似商品,選項其實是固定死的,工程師事先寫好幾套規則就是全部了。Adobe這次展示的做法不一樣:系統會即時分析訪客在網站上的瀏覽行為和搜尋關鍵字,判斷這個人現在是「隨便逛逛」、「認真研究」還是「準備要買」,再用LLM(大型語言模型,就是像ChatGPT背後那種能理解和生成文字的AI技術)從公司既有的內容庫裡挑選、重組出一個量身打造的網頁——不是憑空編造內容,而是從真實資料裡組裝。整個過程只要一到兩秒,成本大約是每頁一到兩美分。Sanchez強調這不是空想的未來技術,而是現在就做得到的事,只是企業還在摸索要怎麼實際應用、什麼樣的商業場景才划算。

舉例來說,一個原本賣咖啡機的網站,如果偵測到某個訪客最近在瀏覽露營用品、搜尋「戶外煮咖啡」,系統會即時把整個頁面的文案、產品排序、推薦內容都換一批——原本首頁可能主打「居家義式咖啡機」,現在自動變成「露營用手沖咖啡組合」,連文案語氣都換成戶外情境。用舊做法,這種個人化頂多是工程師事先寫好「如果標籤等於露營,就顯示A模組」這類固定規則,能變化的組合有限,而且每一種情境都要有人事先想到並寫死程式。用新做法,訪客甚至可以直接打字輸入「歐洲AI研討會」,系統就能當場用AI從公司資料庫抓取相關內容、即時生成一整頁介紹,完全不需要工程師事先預想並準備好這個頁面版型。差異在於:舊方法是「選單式」個人化(從有限的幾個現成選項中挑一個貼近的),新方法是「生成式」個人化(每個人看到的頁面都是當下現場組出來的,理論上可以有無限種組合)。

T3
AI瀏覽器大戰白熱化

以前大家用瀏覽器(就是 Chrome、Safari 這種上網用的軟體)主要是為了搜尋資料,但現在各家公司開始把「AI 助理」直接內建進瀏覽器裡,讓瀏覽器不只能顯示網頁,還能主動幫你「做事」。這篇報導整理了 2026 年最熱門的幾款替代瀏覽器,重點是不少新款都主打 AI 代理(agent,就是能自己執行多步驟任務的 AI 助手)功能,例如自動幫你讀信、排行程、填表單,甚至寫程式。文章直接點出,瀏覽器大戰的重點已經從「誰的搜尋結果比較準」變成「誰的 AI 能代替你在瀏覽器裡動手做事」。

假設你每天早上要做的事是:打開信箱看有沒有重要郵件、把會議邀請加進行事曆、再查一下今天要買的東西。用傳統瀏覽器(例如 Chrome),你得自己一個個分頁切換,手動點開信件、手動加行事曆、手動搜尋購物網站,整個流程可能花 10-15 分鐘。文章提到的 Perplexity Comet 這款瀏覽器,可以直接叫它「幫我總結今天的郵件重點、把裡面提到的會議加進行事曆」,AI 會自己讀信、判斷重點、自動建立行事曆邀請,你只要最後確認一下就好。另一款 OpenAI Atlas 更進一步有「代理模式」,可以讓 AI 直接在瀏覽器裡幫你完成像填寫線上表單、比價購物這類多步驟操作,而不是隻回答問題。差別在於:舊做法是你自己動手做每一步,新做法是你講出目標,AI 在瀏覽器裡自己跑完整個流程。

T3
AI抓漏洞害資安報告暴增

現在有越來越多公司開始用 AI(人工智慧)模型自動去找軟體裡的資安漏洞(就是程式裡可能被駭客利用的弱點),而不是隻靠人類工程師手動檢查。研究機構 Epoch AI 發現,2026 年 6 月全球有 21 個組織通報了大約 1,500 個「高風險」或「重大」等級的 CVE(就是資安界統一編號、公開紀錄的漏洞),這個數字是過去單月最高紀錄的 3.5 倍以上。研究人員認為,這波暴增的時間點剛好對上多個「AI 抓漏洞計畫」(用 AI 自動掃描程式碼找漏洞的專案)陸續上線,兩者高度相關。也就是說,AI 開始真的能像資深資安研究員一樣,大量、快速地挖出以前沒被發現的漏洞。

假設某公司的資安團隊過去只能靠 5 個工程師手動翻程式碼找漏洞,一個月大概抓出 10~20 個問題。現在他們導入 AI 抓漏洞工具後,AI 可以 24 小時不間斷地掃描整個程式碼庫,一次比對幾百萬行程式,抓出人類可能要花好幾週才找得到、甚至根本不會注意到的漏洞組合。這正是 2026 年 6 月實際發生的狀況:21 個組織合計通報了約 1,500 個高風險漏洞,比過去任何一個月都多出 3.5 倍以上。差別在於,傳統做法漏洞通報量穩定成長,但這次是「跳一大階」,說明不是工程師突然變勤奮,而是 AI 工具讓掃描漏洞的效率整個升級,過去藏在程式裡沒人發現的問題,現在被大量挖出來攤在陽光下。

T3
金融微調模型勝GPT

知名對沖基金 Bridgewater(橋水基金,全球最大對沖基金之一)和 Thinking Machines Lab(前 OpenAI 技術長 Mira Murati 創辦的新創公司)合作,把一個開源模型 Qwen3-235B(阿里巴巴開發的大型語言模型,參數量 2350 億)針對金融任務做了 fine-tuning(微調,就是拿特定領域資料再訓練一次,讓模型更擅長某個專業領域)。他們宣稱這個微調後的模型在金融測試上準確率達到 84.7%,表現贏過 Gemini(Google 的 AI 模型)、Claude(Anthropic 的 AI 模型)和 GPT(OpenAI 的 AI 模型),而且運算成本只要對手的十四分之一左右。不過要注意,這些數字是兩家公司自己測出來、自己公佈的,沒有經過外部第三方驗證,所以可信度還有待觀察。

假設一家投資機構想用 AI 來分析財報、判斷企業信用風險或做投資決策,直接用通用型的 GPT 或 Claude 去問專業金融問題,常常因為這些模型沒有針對金融領域的特殊術語、計算邏輯和真實市場情境做過訓練,導致答錯或給出不夠精確的答案(文章標題點出關鍵原因:這些金融測試的正確答案從未被公開過,等於模型是在考「沒讀過的考古題」)。Bridgewater 和 Thinking Machines Lab 的做法是:拿一個開源模型 Qwen3-235B,用金融領域的專屬資料重新訓練後,號稱在同樣的金融測試中答對率提升到 84.7%,且運算成本大幅降低。差異在於:通用模型是「什麼都懂一點但金融不夠深」,微調後的專用模型則是「犧牲部分通用能力,換取金融領域的精準度與更低成本」。不過由於這是廠商自行公佈的內部測試結果,尚未有獨立第三方複驗,實際效果仍需觀察。

T3
SGLang用AI寫優化技能包

SGLang 是一個讓大型語言模型(LLM,就是像 ChatGPT 背後那種會生成文字的 AI 模型)跑得更快的推理引擎(負責在伺服器上實際執行模型、產生回答的軟體)。SGLang 的開發團隊分享了他們怎麼用 AI 代理(agent,也就是能自己執行多個步驟、不只是回答一句話的 AI 助手)來幫忙做「效能優化」這種瑣碎又重複的工程工作。他們的做法是把過去工程師憑經驗做的事,寫成一份份叫做「SKILL.md」的說明書(每份都要交代:什麼情況該用這招、怎麼開始檢查環境、怎麼驗證結果、怎麼判斷好壞、最後怎麼整理成果),讓 AI 代理照著做,而不是每次都要工程師從頭教一遍。同時他們也訂了「基準測試契約」(benchmark contracts,就是規定測試時必須用完全相同的模型、硬體、設定,才能公平比較新舊版本快慢),以及「審查迴圈」(review loop,讓一個 AI 負責寫程式改進、另一個 AI 或人負責檢查有沒有問題,來回幾輪直到通過)。核心精神是:AI 代理的價值不是取代工程師,而是把工程師的經驗變成可以重複執行、可以驗證、可以審查的標準流程。

SGLang 團隊想讓 Qwen3-Next 這個模型在 H100 顯卡(TP=4,代表模型被切成 4 份分散在 4 張顯卡上平行運算)上跑得更快。過去若靠工程師手動抓效能瓶頸,可能要花好幾天讀效能剖析報告、猜測哪裡卡住。這次他們讓 AI 代理照著寫好的「llm-torch-profiler-analysis」技能書,自動產生三張表:一張列出每個運算核心(kernel,就是 GPU 上實際跑的一小段運算程式)各佔多少時間;一張找出哪些運算本來可以「重疊」一起做卻沒有重疊;一張比對是否有更快的「融合」寫法可用。AI 代理照表發現:模型裡「跨顯卡加總結果」(allreduce)這個步驟沒有跟主要運算融合在一起,白白浪費時間。工程師確認方向後,讓代理去實作融合方案,並用固定的基準測試契約(同樣的硬體、同樣的資料量)反覆驗證,同時用 MMLU、GSM8K(兩種標準考題,用來確認優化後模型答題準確度沒有變差)檢查沒有把模型改壞。最終結果:這套推理系統的處理速度從每秒 5.49 個請求提升到 9.41 個,等於快了 71.4%。這個改進已經被正式合併進 SGLang 專案(PR #22664)。對比舊做法,這代表原本要工程師手動一個一個核心去研究、耗時數天的優化工作,現在可以交給照著標準流程走的 AI 代理先跑一輪、產出可驗證的證據,工程師只需要把關審查最後結果。

T3
蘋果擴散模型效能優化法

這則新聞在講蘋果研究團隊改良「擴散語言模型」(diffusion LLM,簡稱 dLLM,是一種跟 ChatGPT 常見的「一個字一個字接龍」生成方式不同的 AI 文字模型,它是先粗略生成一整段文字,再像修圖一樣反覆修正細節,這種「先猜再修」的做法本來是拿來生成圖片的技術,現在也被用來生成文字)。這類模型每一輪修正時,只會保留信心最高的一些字(token,就是 AI 處理文字時切出來的最小單位),其餘信心不夠的字會直接丟棄重猜。問題是這些被丟掉的字其實藏有有用的上下文資訊(context,也就是前後文脈絡),丟了等於白白浪費,導致生成品質打折扣。蘋果團隊發表的「Residual Context Diffusion」(殘留上下文擴散)就是一個新模組,專門把這些原本要丟掉的字所帶的資訊萃取出來,變成一種「殘留訊號」,在下一輪修正時重新餵回模型,讓模型不會平白損失資訊。實驗結果顯示,加了這個模組後,各種前沿 dLLM 的準確度都全面提升,而且額外運算成本很小。

假設一個 dLLM 要一次生成 100 字的文章草稿,模型會先粗略產生 100 個字的初步猜測,然後每一輪只挑出信心最高的 20 個字定案,其餘 80 個字被丟掉重新猜測。傳統做法是這 80 個字的資訊直接消失,下一輪只能從頭再猜,等於每次都在浪費運算和資訊。加上 Residual Context Diffusion 之後,這 80 個被丟棄字背後的「潛在理解痕跡」(不是文字本身,而是模型內部對這些字的判斷線索)會被轉換成殘留訊號,注入下一輪的生成過程,讓模型猜下一批字時能參考「雖然沒被採用、但仍有參考價值」的線索。研究團隊在多個 benchmark(標準測試集,用來衡量 AI 模型能力的公開題庫)上測試,加了這個模組的 dLLM 準確率都比沒加的版本高,額外運算量卻很少,幾乎不影響生成速度,等於是用很低的成本換來明顯的品質提升。

T3
CursorBench 3.1 評測出爐

CursorBench 是 AI 程式碼編輯工具 Cursor 官方做的一套「考題」,專門用來測試 AI 代理(agent,就是能自己動手做事、不只是聊天回答的 AI)在真實工作情境下的表現。這些考題不是隨便出的,而是直接取材自真實使用者用 Cursor 時遇到的實際任務,特色是「模糊」(題目沒講清楚要怎麼做,AI 要自己判斷)而且要動到「多個檔案」(不是改一行程式碼就好,而是要理解整個專案的架構)。最新版本 3.1 涵蓋四大類任務:讀懂整個程式碼庫、找出程式裡的錯誤(bug)、規劃怎麼實作新功能,以及審查別人寫的程式碼品質。這次總共有 36 個不同的 AI 模型參加評測,分數從 45% 到 72.9% 不等。

假設一間公司想知道「該用哪個 AI 模型來幫工程師自動修 bug」,過去只能憑感覺或看廠商自己吹噓的數字。有了 CursorBench 3.1,就能直接查表比較:表現最好的模型(測試中稱為 Fable 5 Max)拿到 72.9% 的準確率,但平均每處理一個任務要花 18.02 美元;而另一個叫 Composer 2.5 的模型準確率是 63.2%,但每個任務只要 0.55 美元,便宜超過 30 倍。公司可以據此決定:如果是攸關產品上線的關鍵 bug,寧可多花錢用高分模型;如果是大量重複性的小任務,改用便宜模型划算得多。這種「準確度 vs. 成本」的具體對照表,是過去單看模型行銷文案時完全看不到的資訊。

T3
Claude企業版加強成本控管

Anthropic(開發 Claude 這款 AI 聊天機器人的公司)針對企業版 Claude 推出一批新的管理功能,目標是讓公司裡的 IT 和財務主管更清楚知道「公司裡的人到底怎麼用 AI、花了多少錢」。過去企業導入 AI 工具常見的痛點是:用量像個黑盒子,主管看不到誰在用、用在哪、花了多少,等到帳單來了才嚇一跳。這次更新讓管理員可以依部門、依員工個別查看使用狀況,還能設定「花費上限」跟預警通知,甚至替不同角色預先指定該用哪個模型(例如例行小任務就別自動用最貴的模型),避免成本失控。

假設一家公司有 200 名工程師都在用 Claude Code(AI 寫程式助手)。以前 IT 主管只知道「這個月帳單多少錢」,卻搞不清楚是哪個團隊、哪些人用得特別兇,也無法在超支前介入。用了這次的新功能後,主管可以打開後臺儀錶板,直接看到每個團隊每天用了幾次、寫了幾支程式、用掉多少額度,系統還會估算「這些用量幫公司省下多少工時、每次提交程式碼平均成本多少」。當某個團隊的花費衝到公司設定上限的 75%,系統會自動發通知提醒主管;到 90% 再發一次更緊急的警告,讓主管有機會在帳單爆掉前,先調整團隊的模型權限或用量規則。同時財務部門也能把這些用量數據串進公司原本就在用的 Datadog、CloudZero 這類雲端成本監控工具,跟其他雲端支出放在同一張儀錶板裡看,不用再另外對帳。這跟以前「等帳單來才知道超支」的做法比,等於是把成本管理從「事後補救」變成「事前預警」。

T3
拉馬努金挑戰測試AI證明

這是一個給 AI(人工智慧)出的數學測驗,叫做「拉馬努金挑戰」(Ramanujan Challenge),名字來自印度傳奇數學家拉馬努金,他生前最厲害的本事就是能「憑直覺」寫出很多神奇的數學公式(例如算圓周率的特殊算法),卻常常說不出這些公式為什麼成立。這個挑戰就是要看現在的 AI 能不能做到拉馬努金做不到的事:不只是「猜出」一個公式長什麼樣子,還要能寫出「證明」,也就是一步一步嚴謹地說明這個公式為什麼一定是對的。發起人是研究者 Ido Kaminer,題目一共有十題,全部跟數學常數(像圓周率、自然對數的底 e 這類特殊數字)的公式有關,活動時間從公佈日到一個月後截止。這類挑戰通常被視為衡量 AI「推理能力」(不是背答案,而是真的會不會邏輯思考)進展到什麼程度的指標之一,跟先前 AI 在數學奧林匹克競賽拿金牌的新聞屬於同一類話題。

假設有一條公式聲稱「某個無窮連分數(一種數字一直往下疊的算式)算出來剛好等於圓周率」。過去做法是:數學家或電腦程式先用「暴力硬算」的方式,把這條公式一直算下去,看數值是不是真的越來越接近圓周率,如果數值吻合就先相信這個公式「大概是對的」,但沒人能保證它在所有情況下都成立。這次挑戰要求 AI 不能只交出「我算過,數值對得上」這種答案,而是要交出三種形式之一:正式的數學證明(用嚴謹的邏輯推導)、用電腦代數系統(一種專門幫忙做符號運算的軟體,像 Mathematica)跑出來的推導過程、或是一份人類看得懂的證明外加可以重現的程式碼,讓別人能重新跑一次驗證。這跟以往「AI 算出答案就算過關」的測驗不同,這次的重點是「AI 能不能把過程講清楚、讓別人能檢查每一步」,這對判斷 AI 是否真的具備嚴謹推理能力(而不是碰巧猜對)是更嚴格的考驗。

T3
AI缺電迷思:閒置產能未釋放

最近常聽到「AI 太耗電、電網快撐不住」的說法,但這篇分析指出,問題其實不完全是「電不夠」,而是「電被浪費、沒被善用」。美國電網(就是輸配電到每個家庭、公司、資料中心的電力系統)平均使用率只有約 30%,代表七成時間是閒置的。同樣地,訓練/運算 AI 的 GPU(一種專門跑 AI 運算的晶片)使用率也常常只有 10-40%,資料中心(放滿伺服器、專門跑 AI 運算的大型機房)也有三到五成的時間是閒置的。也就是說,不是完全沒有電力和運算資源,而是這些資源分散、沒被即時測量和調度,導致明明還有空間,卻被誤以為「不夠用」。解法方向是靠軟體做即時監控和協調,把這些「隱藏產能」找出來、用起來,而不是一味蓋新電廠或擴充新機房。

新創公司 GridCARE 用 AI 去分析美國一家大型電力公司 National Grid 的即時電網狀態,結果找出原本沒人發現的 650 MW(百萬瓦,大約可供數十萬戶家庭用電)閒置容量,可以直接分給附近想蓋資料中心的 AI 公司用,不用等新電廠蓋好。另一家公司 Phaidra 則是幫一座 1 GW(十億瓦,等級是超大型資料中心)規模的機房調整冷卻系統,把冷卻水溫從 25°C 提高到 35°C(因為原本設定太保守),結果釋放出 67 MW 的額外運算容量可以拿來跑更多 AI 工作,估計一年多賺 38 億美元。對比舊做法:以前業界遇到「電不夠、機房滿載」通常直接花好幾年時間蓋新電廠或新機房;現在用 AI 做即時監控和調度,幾週到幾個月內就能從既有設施「榨出」原本浪費掉的產能。

T3
企業濫用AI恐釀安全漏洞

現在很多公司開始用「agentic AI(就是能自己規劃步驟、自動執行任務的 AI,不只是回答問題而已)」來幫忙寫程式、加快軟體開發速度,一週甚至更短時間就能推出一次新版本。但問題是,公司內部負責檢查程式安全性的流程(像是 pentesting,也就是「滲透測試」,找專人假扮駭客攻擊自己系統看有沒有漏洞)根本跟不上這麼快的更新速度。Economist Enterprise 和資安公司 Aikido Security 做的研究發現,很多企業已經因此發生資安事故,而且問題往往是等到出事才被發現,因為根本沒時間在上線前徹底檢查清楚。

假設一家公司用 AI agent 幫忙寫一個新的客戶登入功能,AI 一週內就寫好、測完基本功能、直接上線,開發團隊覺得效率很高。但傳統做法是:工程師寫完後,資安團隊要花好幾天做滲透測試,檢查密碼加密方式、有沒有 SQL injection(一種常見的資料庫攻擊手法)漏洞等等,確認沒問題才上線。現在因為 AI 加速了開發,很多公司省略或縮短了這段檢查時間,結果就是登入功能上線後才被駭客發現漏洞、資料外洩,而不是上線前就先被抓出來。研究顯示這種「開發速度大幅超前資安檢查速度」的落差,正在讓越來越多企業付出實際代價。

T3
Safari推出MCP代理伺服器

蘋果推出了新版「Safari Technology Preview 247」,這是 Safari 瀏覽器的實驗版本,讓工程師可以提前試用還沒正式上線的新功能。這次更新最大的亮點,是加入了一個叫做 MCP(Model Context Protocol,一種讓 AI 助理能跟外部工具、程式互相溝通的標準協定,可以想成是「AI 跟軟體之間的翻譯機」)的伺服器功能。有了這個功能,AI agent(就是能自己執行多個步驟去完成任務的 AI 程式,例如自動幫你操作網頁、測試功能)就可以直接連上 Safari 瀏覽器視窗,看到使用者實際會看到的畫面內容。這對開發網頁的工程師來說,代表以後測試網站、抓網頁上的錯誤(debug)可以交給 AI 自動完成,不用自己一直手動點來點去檢查。除此之外,這次更新也修了一些網頁技術相關的小毛病。

假設一位網頁工程師正在開發一個新的購物網站,想確認「結帳按鈕在手機畫面上會不會被其他元素擋住」。傳統做法是工程師自己打開 Safari,手動調整視窗大小、一格一格檢查畫面,或是寫一套自動化測試腳本,事先寫死要檢查哪些畫面元素、要點哪些按鈕,一旦網頁改版腳本就要跟著重寫。有了 Safari 的 MCP 伺服器,工程師可以讓 AI agent 直接連進這個 Safari 視窗,AI 會「看到」跟使用者一樣的實際畫面(而不是隻讀網頁的程式碼),然後自己判斷結帳按鈕的位置有沒有問題,甚至直接回報「按鈕在 iPhone 尺寸下被廣告區塊蓋住了」。差異在於:以前工程師得自己盯著畫面找問題,或維護容易過時的測試腳本;現在可以讓 AI 用「看畫面」的方式直接幫忙抓錯,省下大量手動檢查的時間。

T3
打造AI實習生Junior

Junior 是軟體監控公司 Sentry 開發的一個 AI 助手,運作在 Slack(一款企業聊天軟體)裡,定位就像一個新來的實習生:你交代任務、它去執行、做完之後你審核成果、方向不對就出言糾正它,而不是完全放手不管。它的核心用途是把公司裡分散在不同工具(像是程式碼庫、GitHub 上的問題追蹤系統、自動化測試工具)的工作串在一起,讓員工在 Slack 聊天視窗裡下一句指令,就能跨系統完成任務,不必自己來回切換好幾個工具。舉例來說,如果工程師想知道某個功能的權限控管是怎麼實作的,Junior 不會憑印象亂猜答案,而是直接搜尋公司的程式碼庫、追蹤程式邏輯,再根據看到的原始碼回答。開發團隊花了四個月、寫了大約十萬行 TypeScript(一種常見的網頁程式語言)打造這套系統,並把整個專案完全開源(原始碼公開,任何人都能下載修改),放在 GitHub 上供其他公司參考或直接改造成自己的版本。

Sentry 的工程師在 Slack 裡直接跟 Junior 說「幫我把這串討論整理成一個 GitHub Issue(GitHub 是存放程式碼與追蹤問題的平臺)」,Junior 讀完整段對話後,自動生成一份包含「缺口分析」(找出目前做法哪裡不足)與「事後檢討」的完整 Issue,內容比工程師自己手動寫的還要詳細完整。另一個案例是前端網頁改版之後,Junior 會用自動化工具實際點擊網站上的功能、截圖、錄影,把畫面上出現的小瑕疵(例如按鈕位置跑掉、文字被截斷)整理成報告,貼回同一個 Slack 討論串裡。對比舊做法:以前工程師得自己手動測試網頁、自己寫 Issue 摘要、自己整理測試紀錄,現在這些瑣碎但耗時的工作交給 Junior 處理,而且它是照著真實程式碼與實際畫面操作得出結果,不是憑空編造答案。

T4
T4
小模型嵌入塌縮新解法

這是一篇研究小型語言模型內部運作機制的技術文章。先解釋背景:語言模型在處理文字時,每個字詞(token)會被轉換成一串數字組成的向量,叫做 embedding(可以想成是這個字詞在電腦裡的「座標」),模型就是靠比較這些座標的相似程度來理解語言。研究者發現一個問題,叫做「embedding condensation(嵌入塌縮)」:在比較小的語言模型裡,資料經過一層一層的 Transformer(就是目前主流 AI 模型的核心架構)運算後,這些原本應該分散、各自代表不同意思的座標,會漸漸擠在一小塊區域裡,變得彼此很相似,等於是模型「詞彙的區分能力」在退化。而且這個現象在模型剛初始化(也就是還沒開始訓練)時就已經出現,用知識蒸餾(一種讓小模型模仿大模型行為的訓練技巧)也解決不了。研究者提出一種新的訓練用損失函數(loss function,是訓練時用來告訴模型「現在做得好不好、該怎麼調整」的計算方式),叫做 dispersion loss(分散損失),刻意在訓練過程中把這些座標「推開」,讓它們均勻分佈在一個球面上,藉此對抗塌縮現象。

假設你要訓練一個手機能跑的小型 AI 模型(例如只有十億參數,遠比 GPT 這類大模型小),傳統做法是直接訓練或用知識蒸餾去模仿大模型,但研究發現這類小模型的字詞座標會不知不覺擠在一起,導致模型分不清楚語意相近但不同的詞(例如「銀行」和「河岸」的英文 bank 在小模型裡可能糊在一起變得難以區分)。用這篇提出的 dispersion loss,在訓練過程中加入一個額外的規則,強制把所有字詞的座標往外推、盡量均勻分散在球面上,同時限制向量不能無限膨脹。作者自己在文章中坦承,目前實驗規模還小,效果改善「較為溫和」,需要更多統計檢驗才能確定是否有效,建議大家在正式投入大量訓練資源前,先用小規模實驗驗證。這則討論在 Hacker News 上只有 20 個讚、4 則留言,屬於較小眾的研究分享,還不是成熟可用的技術,但對關心「如何用更少參數做出效果更好的小模型」的研究者是個值得追蹤的方向。

T4
AI術語一次搞懂

這篇文章是 TechCrunch 整理的一份 AI 詞彙懶人包,把最近常聽到、卻常常讓人一頭霧水的 AI 術語,用白話文一次解釋清楚。因為 AI 發展太快,媒體、公司、工程師常常直接丟出一堆專有名詞,例如「LLM」「訓練」「推論」等,一般人聽了根本不知道在講什麼。這篇文章就是專門寫給非工程背景的讀者,把這些詞拆解成生活化的說法,讓沒碰過 AI 的人也能看懂新聞在講什麼。它不是介紹某項新技術或新產品,而比較像一本隨時可以查的「AI 字典」,適合收藏起來,之後看到不懂的詞就回來查。

假設你看到一則新聞寫「這個新 LLM(大型語言模型,也就是像 ChatGPT、Claude 這種可以跟你聊天、回答問題的 AI)在某次測試中發生了嚴重的 hallucination(幻覺,意思是 AI 一本正經地說出錯誤或編造的資訊,例如編出一篇根本不存在的論文引用)」,你可能完全看不懂重點在哪。查了這份懶人包之後你會知道:LLM 就是那種「你打字問它、它打字回你」的 AI 程式;而「幻覺」是它的已知弱點,代表它有時候會把錯的東西講得很有自信,特別是在問健康、法律這類需要精確答案的問題時風險更高。文章還解釋了「訓練」(training,餵資料讓 AI 學會回答問題的過程)、「推論」(inference,訓練完成後,AI 實際被拿來用、回答你問題的階段)、「微調」(fine-tuning,在已經訓練好的模型上,再用少量特定領域資料加強某項專長,例如讓一個通用 AI 更擅長回答醫療問題)、「token」(AI 處理文字時切出來的最小單位,中英文切法不同,這也是為什麼 AI 服務常按 token 數量收費)、「權重」(weights,模型內部決定「哪個資訊比較重要」的數字參數)、以及「思維鏈」(chain of thought,讓 AI 把一個大問題拆成一步一步的小步驟去想,適合用在數學或寫程式這類需要邏輯推理的任務,能明顯提高答對機率)。有了這些解釋,之後不管是看科技新聞、還是同事聊到「要不要幫這個模型做 fine-tuning」,都能聽懂在講什麼、甚至能接話。

T4
AWS推出免程式AI客服設計工具

AWS(亞馬遜的雲端服務部門)在每週例行更新中,替旗下客服系統 Amazon Connect 推出一個叫「Agentic CX Designer」的新工具。這是一個「無代碼」(不用寫程式,用滑鼠拖拉就能設計流程)的畫布工具,讓企業裡負責客服業務的人(不一定是工程師)也能自己設計並上線「AI 驅動的自助客服體驗」,例如讓客戶打電話或用 App 詢問時,由 AI 代理人(agent,就是能自己判斷該做什麼、多步驟完成任務的 AI 程式)來應對。這個工具同時支援語音和文字/App介面的設計,也把「代理型 AI」(會自己規劃步驟的 AI)和「確定性 AI」(照固定規則走、結果可預期的傳統程式邏輯)整合在同一套流程管理裡,並提供即時模擬測試功能,還有一個叫「Live Sync」的技術,可以在客人講話或打字的同時,即時連動更新網頁或 App 畫面上顯示的內容。同一份更新裡,AWS 也附帶推出了 EC2 AMI Watermarks(替雲端伺服器的映像檔加上防偽浮水印,方便追蹤來源、防止未經授權的映像被冒用)和 MySQL 資料庫治理模式的改革(讓 Oracle 以外的公司也能參與 MySQL 專案的決策,AWS 也拿到一席)。

假設一家電信公司想做一個「客戶打電話查帳單、改方案」的自助客服系統,過去做法是工程團隊要花好幾個月,先寫程式串接客服系統、設計對話流程、反覆測試上線,業務部門只能提需求、無法自己動手。用 Agentic CX Designer 之後,客服部門的產品經理可以自己在畫布上拖拉節點,設計「客戶說『我要改方案』→ AI 先確認身分 → 查詢目前方案 → 提供建議選項 → 客戶確認 → 系統執行變更」這一整套流程,中間可以隨時用內建模擬功能假裝客戶說話測試效果,不用等工程排期。AWS 官方說法是「從設計到測試模擬、再到正式上線可用的體驗,能從『數月』縮短到『數週』」——差異就在於過去要工程師手動串接的部分,現在變成用畫布拖拉+即時模擬就能完成。

T4
別再演AI信心大戲

這是一篇針對「AI 產業浮誇宣傳」的評論文章。作者 Elena Verna 指出,現在很多人、很多公司都在對外宣稱「AI 徹底改變了我們的工作」,但實際上根本沒講清楚 AI 到底做了什麼、幫了什麼忙。她把這種現象稱為「AI 信心劇場」(意思是大家在表演對 AI 很有信心、成果很棒,但背地裡其實搞不清楚狀況、也拿不出真正證據)。她認為這種假象短期看起來風光,長期卻會讓大家對 AI 工具失去信任,也讓真正該被重視的改進機會被忽略掉。文章同時點出職場文化的變化:以前員工比誰工作更努力,現在卻比誰「用了多少個 AI 代理(agent,就是能自己執行一連串任務的 AI 程式,例如自動幫你查資料、寫信、下單)」,導致員工為了保住工作,被迫誇大自己用 AI 做出的成果。

假設一家公司要招聘一位「AI 應用專家」,過去面試官只要問幾個專業術語就能大致判斷候選人程度,但現在任何人只要花點時間,就能把 ChatGPT、Claude 這類工具的術語背得滾瓜爛熟,光靠嘴巴回答已經無法分辨誰是真的懂、誰只是在複誦流行語。作者建議的做法是:不要只靠口試,而是直接出一個真實案例題,例如「請用 AI 工具幫我把這份客服信件的常見問題整理成一份可查詢的知識庫,並展示你怎麼確認整理結果是正確的」,讓候選人實際操作並拿出結果,而不是空口承諾「AI 幫我省了 80% 時間」這種無法驗證的說法。對比舊做法(只憑履歷和口頭陳述判斷),新做法能真正看到這個人是否具備可驗證、可重複的實作能力。

T4
AI讓資安人員變開發者

這篇文章討論的是資安(負責保護公司系統、抓漏洞、防止駭客入侵的專業人員)這個職業,因為 AI 的出現正在起根本變化。過去資安人員的工作比較像「守門員」:跑掃描工具找出漏洞,寫一份報告丟給工程團隊,再由工程團隊自己想辦法修。作者認為現在因為有像 Claude Code 這樣的「終端機原生編碼代理」(意思是可以直接在你的電腦終端機裡讀程式碼、寫程式碼、跑測試的 AI 助手,不用你手動一行一行改),資安人員已經可以自己動手改程式碼、跑測試、直接提交完整的修復方案(Pull Request,也就是「我改好了,請審核並合併」的程式碼提交請求),不用再等工程團隊排隊處理。文章也提到,公司內部已經開始用 Claude 這類 AI 定期(例如每季)自動跑「使用者權限稽核」(檢查誰有權限存取什麼系統或資料)和「依賴套件監測」(檢查程式用到的外部程式庫有沒有已知漏洞),過去這些工作要花好幾週協調人力,現在幾乎不用花什麼人力成本。因此作者認為,未來評估資安人員表現的指標,也該從「抓到幾個漏洞」,改成「工程師願不願意採用你做的防護工具」「自動化防護出錯導致變更失敗的次數」這類更貼近產品成效的指標。

假設一家公司的資安人員發現公司內部系統有個常見漏洞(例如某個網頁表單沒有做好輸入檢查,可能被駭客用來注入惡意程式碼)。傳統做法是:資安人員寫一份報告,列出問題在哪個檔案、建議怎麼修,丟給工程團隊的待辦清單,工程團隊可能要等兩三週才排到時間處理,中間漏洞持續存在。用文章提到的新做法,資安人員可以直接打開 Claude Code,讓它讀取整個程式碼倉庫,找到問題所在的程式碼,自己生成修補的程式碼、在本地跑測試確認沒有把系統改壞,然後直接提交一份完整、可以直接審核合併的 Pull Request 給工程團隊——工程團隊只要看過、按下合併就好,中間的漏洞曝險時間從幾週縮短到幾小時甚至更短。另外像每季一次的使用者權限稽核,過去要資安人員手動去每個系統拉清單、比對誰不該有權限、寄信提醒各部門主管確認,現在可以設定 Claude 自動跑這整套流程,資安人員只要最後過目結果就好。