Anthropic研究員Alpöge與Claude Fable 5(Anthropic最新一代AI模型)合作,找到了「Jacobian猜想」的反例,終結了這個困擾數學界87年的難題。這個猜想是1939年提出的,簡單說就是:如果一個多項式(一種數學公式)在每個點都「局部看起來可逆」,那它是不是整體上也一定可逆(也就是可以從結果反推回原本的輸入)。過去87年很多數學家嘗試證明這個猜想,但提交的證明後來都被發現有錯,Alpöge甚至形容這是「瘋子的墓地」。這次他和Claude Fable 5只花了一個下午,就找到一個具體的反例(也就是一個違反這個猜想的實際例子),證明猜想是錯的。反例找到後,經過Alpöge本人三次不同方式驗算、Hacker News社群多人自行代入計算、以及另一個AI助手Grok的獨立確認,三方結果一致,讓原本「這只是行銷噱頭」的質疑逐漸消散,但正式的學術同儕審查(也就是其他數學家審核確認無誤)仍未完成。
具體做法是這樣的:Alpöge請Claude Fable 5幫忙在特定的幾何構造空間裡尋找Jacobian猜想的反例,Fable在幾小時內就產出了一個從三維複數空間映射到自身的七次多項式(一種數學算式),這個算式的Jacobian行列式(衡量映射是否局部可逆的數學指標)恆等於-2,符合猜想的前提條件,但把三個不同的輸入點(0,0,-1/4)、(1,-3/2,13/2)、(-1,3/2,13/2)全部映射到同一個輸出(-1/4,0,0),直接違反了猜想所說的「整體可逆」。任何人都可以用免費工具驗證:打開Wolfram Alpha或用Python的sympy套件,把這三組數字代入公式算一次,就能親眼看到三個不同輸入真的都得出同一個答案,行列式也確實是-2。值得注意的是,2015年時研究者估計如果反例存在,多項式次數至少要200次以上才找得到,但這次Fable找到的答案只用了七次,代表過去人類幾十年苦尋不著的答案,其實藏在一個小得多的搜尋範圍裡,只是沒人想到要往那個方向找。
Google在今天一口氣發布了三個新的AI模型(AI就是能理解語言、生成文字或圖片的電腦程式),包括接替Gemini 3.5 Flash的Gemini 3.6 Flash、更省錢的Gemini 3.5 Flash Lite,以及第一個專攻網路資安的Gemini 3.5 Flash Cyber。不過原本說好6月要上線的Gemini 3.5 Pro(比Flash系列更強的版本)仍在測試中還沒發布,Google也已經開始訓練下一代的Gemini 4。3.6 Flash的重點是「又快又便宜」:在寫程式能力的DeepSWE測試(一種評估AI寫程式好壞的標準考題)中,分數從37%提升到49%,在電腦操作能力的OSWorld測試(測試AI能不能像人一樣操作電腦介面完成任務)中從78.4%提升到83%,而且處理同樣任務省下約17%的token(token是AI處理文字時計費和計算的基本單位,可以想成AI「讀字」和「吐字」時按量計費的計量單位)。
假設你是開發者,之前用Gemini 3.5 Flash串接一個自動填表、點按鈕的自動化代理(agentic workflow,就是讓AI自己規劃步驟、操作軟體完成任務的系統),但發現它常常要繞很多步驟才能完成、而且輸出的程式碼品質不穩定。換成Gemini 3.6 Flash後,官方數據顯示同樣任務會用更少步驟、更少token完成,寫程式測試分數也從37%跳到49%;同時輸入token價格維持每百萬字1.5美元不變、但輸出token價格從每百萬字9美元降到7.5美元,等於同樣工作量下帳單直接變便宜。如果你的應用場景是資安相關(例如自動偵測程式碼漏洞或分析攻擊行為),還可以改用新推出的Gemini 3.5 Flash Cyber,這是Google第一款專門針對資安任務調校的模型。
美國聯邦法院正式批准 Anthropic(做出 Claude 這款 AI 聊天機器人的公司)與一群作家、出版商之間的15億美元和解案,這是美國史上金額最大的版權賠償案。事情起因是 Anthropic 訓練 Claude 這類大型語言模型(LLM,就是 ChatGPT、Claude 這種能跟你對話、寫文章的 AI)時,被指控使用了透過盜版網站(LibGen、PiLiMi,類似非法下載電子書的網站)取得的書籍。法院最終區分出一個重要原則:如果 AI 公司是合法買書、合法取得授權後拿去訓練模型,這屬於「合理使用」(Fair Use,美國版權法允許在特定條件下不必另外付費使用受版權保護作品的規定)而受到保護;但如果是從盜版網站下載書籍存起來,即使不是每本書都真的拿去訓練,也算侵犯版權。和解涵蓋約48萬多件作品,每件約可獲賠3000美元,Anthropic 必須銷毀所有從那些盜版網站下載的檔案。不過這只是地方法院層級的判決,沒有更高層法院的判例效力,Google、Meta、OpenAI 等公司也都面臨類似的版權官司,這場「AI 訓練資料到底能不能用盜版內容」的法律戰其實才剛開始,遠遠沒有結束。
假設你是一間打算訓練自己專屬 AI 模型(fine-tuning,意思是拿一個現成的 AI 模型、用自己的資料再加以調整訓練,讓它更懂特定領域)的新創公司,過去你可能會想「反正網路上到處都是電子書資源,抓下來訓練應該沒差」。這起判決給的具體教訓是:如果你的訓練資料是從 LibGen、PiLiMi 這類已知的盜版電子書網站下載來的,就算你最後沒有把每一本書都真的餵給模型訓練,光是「下載並存放」這個動作本身就已經構成侵權,屆時可能要面對每件作品約3000美元的天價賠償(Anthropic 這次總共要賠15億美元)。正確做法應該是:建立一份訓練資料的「來源清單」,記錄每一筆資料是透過購買、簽署授權協議、或是合法取得的公開資料集拿到的(也就是所謂的資料溯源機制),這樣未來如果被告,才有證據證明資料來源合法、受合理使用保護,而不是像 Anthropic 一樣事後被迫花大錢和解、還得銷毀整批盜版資料庫。
小米在2026年7月16日發表了一個叫Xiaomi-Robotics-1的機器人「基礎模型」(foundation model,意思是先用大量資料訓練出一個通用的AI底座,之後只要用少量新資料微調,就能學會不同的具體任務,不用每次都從零訓練)。這個模型最特別的地方是用一個叫UMI的手持裝置,讓人類直接手持拍攝、蒐集了10萬小時、橫跨1700多種場景的操作影像,完全不需要真的機器人在旁邊配合錄製,大幅降低了資料蒐集的成本和門檻。之後才拿7200小時真實機器人操作資料做進一步對齊訓練。模型參數從2B增加到10B時(約20億到100億),任務成功率從61%提升到79%;面對全新任務,只要準備不到10小時的示範資料微調,就能達到75%成功率,效率遠勝競爭對手Physical Intelligence的π₀.₅模型(同樣條件下只有40%)。不過在名為RoboDojo、模擬更接近真實居家環境的高難度測試中,即使是最佳成績也只有13.93%,顯示這類模型離真正能可靠處理家事、還很有一段距離,Hacker News社群也就「這種消費級人形機器人到底有沒有存在必要」展開了激烈辯論。模型權重和程式碼已經開源在GitHub與Hugging Face上,任何人都可以下載使用。
假設一間新創公司想做一臺能幫忙摺衣服的家用機器人,過去做法是得先買機器人手臂、實際操作蒐集幾千小時的機器人示範資料才能訓練出堪用的模型,成本高、耗時久。有了Xiaomi-Robotics-1這個開源基礎模型後,工程師可以直接下載官方釋出的2.6B(26億參數)版本,先用不到10小時的示範資料(例如工程師自己手持裝置示範摺自家品牌的幾件衣服)進行微調,根據論文數據就有機會達到75%左右的任務成功率,比從零訓練省下大量機器人操作時間與資料蒐集成本。差別在於:舊做法必須先擁有機器人本體才能開始蒐集訓練資料,Xiaomi-Robotics-1則是預訓練階段完全不需要機器人本體(用手持裝置UMI取代),等於把最貴、最花時間的那一步大幅簡化,讓小團隊也有機會做客製化機器人任務原型。
MCP(Model Context Protocol,一套讓 AI 模型可以安全連接外部資料庫、檔案、API 等工具的共同標準,可以想成是「AI 與各種軟體工具溝通的共同語言」)將於 2026 年 7 月 28 日發布史上最大規模的規格修訂。這次修訂拿掉了協定內建的「session(工作階段,指伺服器記住你是誰、對話進行到哪的機制)」管理,改用 server/discover 方法讓 AI 工具隨需查詢伺服器能提供什麼功能,不再需要先「握手」自我介紹。這代表任何一個請求都可以隨機丟給任何一臺伺服器處理,不必像以前那樣綁定固定的服務員,因此可以直接搭配最普通、最便宜的 round-robin(輪流分配)負載平衡器,不需要額外建置能記住連線狀態的特殊基礎設施。同時也強化了 OAuth(一種常見的帳號授權登入機制)驗證、加入了類似網頁快取的 ttlMs/cacheScope 欄位,並讓工具描述格式支援更完整的 JSON Schema 規格。SDK(軟體開發工具包)維護者有 10 週的時間可以驗證相容性,Roots、Sampling、Logging 三項舊功能則被標記即將淘汰。
假設一個中小型新創想做一個「AI 客服 agent」,讓它能透過 MCP 連上公司內部訂單資料庫查詢訂單狀態。用舊版 MCP,工程團隊得先讓伺服器記住每個對話的 session(例如透過 Mcp-Session-Id),代表得額外架設支援 sticky session(同一使用者的請求要一直導向同一臺機器)的負載平衡器,或是自建一個共用的 session 儲存系統,才能讓服務撐得住流量、還能水平擴充機器——這對只有幾個工程師的小團隊是不小的額外工程負擔。換成新版無狀態 MCP 後,伺服器每次收到請求都能獨立處理、不用記住誰是誰,團隊只要用最普通的 HTTP 服務加上任何雲端平臺內建的輪流分配負載平衡器就能上線。不過,遷移時除了把「握手初始化」的邏輯換成呼叫 server/discover,還需要一併更新負載均衡的路由設定(改用 header-based routing),並非只替換一個步驟就能完成;官方提供的 10 週驗證窗口主要是給 SDK 維護者與客戶端實作者確認相容性,並非開發者完成程式碼遷移的期限。
OpenAI 正式推出「Ads Manager」(廣告管理後臺),讓企業可以在 ChatGPT(就是那個大家用來聊天問問題的 AI 助理)的對話裡投放廣告。官方說法是,使用者來 ChatGPT 不只是找資訊,也常常是在比較選項、猶豫要買什麼、做決定,這種「正在考慮要不要買」的時刻,對廣告主來說很有價值,所以 OpenAI 想把這類廣告機會開放出來。廣告主註冊後會進入 Ads Manager 後臺,可以自己建立帳號、設定廣告活動,並使用官方提供的教學資源上手。OpenAI 強調會「謹慎」推進這件事,並訂出幾個原則:廣告會被清楚標示、廣告內容會和 ChatGPT 原本自己生成的回答明顯區分開來,使用者也能自行控制自己的資料要不要被用來投放廣告。零售商 Best Buy 的媒體副總裁在官方文案中提到,他們已經提早試用,認為消費者愈來愈習慣在 ChatGPT 這類平臺上做研究、比較商品,因此在這些時刻出現對品牌很重要,早期成效也讓他們感到鼓勵。
假設一個使用者在 ChatGPT 裡問「幫我比較一下現在該買哪款筆電」,未來在這類「比較選項、準備做決定」的對話情境中,像 Best Buy 這樣有付費投放廣告的零售商,就可能在對話旁邊或附近出現一則清楚標示為「廣告」的內容,例如推薦某款正在促銷的筆電連結,但這則廣告會和 ChatGPT 本身給出的建議文字明確區分、不會混在一起,使用者也可以在設定裡選擇是否讓自己的對話內容被用來決定要投放什麼廣告給自己。
AI新創公司Poolside發布新模型「Laguna S 2.1」,專門用來處理需要長時間、多步驟的寫程式任務。這個模型用的是MoE(混合專家模型,一種讓AI內部分成很多小專家、每次只喚醒其中一小部分來運算的架構,好處是能省下大量運算資源)架構,總共有1180億個參數,但每次實際運作只會啟動80億個,體積比同等級競爭對手小很多。在多項benchmark(就是用來統一衡量不同AI模型能力高低的標準化測試題庫)中,例如專門測試AI能不能在終端機裡完成複雜長任務的Terminal-Bench,這個小模型的分數逼近參數量是它好幾倍的大模型。團隊強調這次進步的重點不是把模型做得更聰明,而是讓它「做事的方式」變好:更願意反覆驗證自己的成果、不會半途宣告成功、遇到卡關會持續嘗試不同方法而不輕易放棄。模型權重公開在Hugging Face(一個AI模型與資料集的公開分享平臺)上,開發者也能透過API或在自己電腦上跑。
Poolside團隊實際測試時,只給模型一句指令:「用JavaScript從零打造一個簡易瀏覽器引擎,能把HTML/CSS網頁片段畫在畫布上,效果要跟真的瀏覽器一樣」。模型在完全沒有人類插手的情況下,花了50分鐘、跑了181個步驟,從一個空資料夾開始,自己寫出HTML解析器、CSS選擇器解析、版面配置引擎、畫布繪圖器等完整流程。因為這個模型本身沒有「看圖」的視覺能力,沒辦法直接檢查自己畫出來的網頁對不對,它就想辦法找了一個無頭瀏覽器(headless Chromium,一種在背景執行、不顯示畫面的瀏覽器程式)把自己畫的結果和真瀏覽器渲染的畫面逐像素比對,藉此驗證自己做得對不對。對照傳統做法:一般AI模型遇到「沒辦法直接看結果對不對」的任務,常常會做到一半就交差了事或宣稱完成,但這個模型會主動找替代方法驗證到底,這正是Poolside這次強調的「持續性與自我驗證能力」的具體展現。
阿里巴巴的Qwen團隊推出了新一代圖像生成模型Qwen-Image-3.0,圖像生成模型(就是輸入一段文字描述,AI幫你畫出一張圖的AI工具)。這次的重點不是畫得多漂亮,而是畫得多「真實可用」:它可以接受長達4500個token(token是AI處理文字的基本單位,大約幾個字算一個token)的長指令,一次就畫出結構複雜的版面,例如把9張各自獨立的資訊圖表排成3x3的九宮格、每格都有自己的文字說明和插圖。它還能把字畫到只有10個像素那麼小卻依然看得清楚,甚至能正確畫出帶有上標下標、分數、求和符號的LaTeX數學公式(LaTeX是學術界常用來排版數學公式和論文的軟體語法)。目前這個模型只開放邀請制的API存取(也就是還沒有對一般大眾公開),未來會整合進Qwen Chat等阿里自家的應用程式,而且和第一代Qwen-Image不同,這次很可能不會釋出開放授權的模型權重(權重就是AI模型訓練完後的核心參數檔案,開放權重代表任何人都能下載來用或修改)。
假設你要做一份圖文並茂的教學考卷,裡面同時要放中文說明、一條物理公式、一張手繪風格的插圖,過去用AI畫圖工具通常一次只能處理簡單的單一畫面,長文字排版容易變成模糊亂碼、公式符號更是常常畫錯或畫不出來,只能東拼西湊好幾張圖再手動排版。Qwen-Image-3.0的示範案例顯示,它可以直接把一整份包含公式、圖表、文字說明的考卷或學術論文頁面,在一次生成中完成排版,包括正確畫出帶有分數、求和符號的多行數學算式。不過原文也提醒,這類輸出仍然是「一張圖片」而非可編輯的文字檔或LaTeX原始碼,所以像正式論文排版這種需要之後修改內容的場景,實用性仍有限,比較適合當作視覺草稿或版面示意圖。
這篇研究部落格文章指出,AI模型能不能「舉一反三」(學術上叫compositional generalization,意思是把學過的簡單技能組合起來解決從沒看過的複雜問題),關鍵不完全在於餵給模型多少訓練資料,而是在於「harness」(就是包在AI模型外面、負責把複雜任務拆解成小塊再餵給模型的程式框架,例如Claude Code、Codex這類工具)設計得好不好。作者提出一種叫RLM(Recursive Language Model,遞迴語言模型)的框架,讓AI處理任務時把龐大複雜的上下文內容拆給多個「子任務」分頭處理,自己只保留精簡的分解步驟,不必把所有細節都塞進腦子裡記住。實驗發現,只用短任務訓練這套RLM框架,測試時卻能應付長度多達8到32倍的長任務,效果比直接訓練原始Transformer模型(也就是ChatGPT、Claude背後那種基礎AI架構)好上約10倍,而且訓練一個領域學到的能力,還能轉用到完全不同的領域。這代表未來提升AI能力不能只靠砸更多訓練資料,把任務拆解的框架設計好,甚至能讓現有模型不必重新訓練就解決原本做不到的難題。
研究團隊用一個叫Qwen3-30B-A3B的語言模型做實驗,任務是「在6.4萬字的對話紀錄裡找出第2次出現某個關鍵句」(MRCRv2測試),並把測試難度拉高到200萬字(8個關鍵句版本)。傳統做法是把整份對話全部塞進模型的上下文視窗一次讀完,只用6.4萬字短版本訓練,測試200萬字長版本時表現大幅下降,因為模型從沒見過這麼長的輸入,即使用YaRN技術(一種延長模型可讀取字數上限的方法)硬撐也一樣。改用RLM框架後,模型會把200萬字的長對話自動拆成一塊塊,分派給多個子任務各自去搜尋,自己只需要記住「我把任務拆成幾塊、要哪幾塊回報結果」這種精簡步驟。結果只用短版本訓練的RLM,在長版本測試上的表現逼近甚至超過直接動用更強大的GPT-5.5模型處理長任務的成績,遠遠贏過沒用這套拆解框架、單純硬讀全文的原始Transformer。
這篇部落格文章由英國帝國理工學院數學教授(也是 Lean 這套工具的維護者)撰寫,記錄過去兩個月裡 AI 在數學研究上一連串驚人進展。Lean 是一種「形式化證明」程式語言,數學家可以把證明寫成 Lean 程式碼,電腦會逐行檢查邏輯是否完全正確、沒有漏洞,比人工審稿更可靠。過去這種形式化工作極度耗時,但現在多家公司的 AI 模型(例如 OpenAI 的 Sol、Anthropic 的 Claude Fable,以及 Yann LeCun 新創公司 Logical Intelligence 的系統)已經能自動把人類語言寫的數學論證「翻譯」成 Lean 程式碼並驗證。ChatGPT 先是推翻了 Erdős 提出的「單位距離猜想」,接著 OpenAI 的 Sol 模型找到反例,推翻了一個關於有限階群概形的 60 年未解問題(Grothendieck 問題),最後 Claude Fable 更找到反例解決了開放上百年的「雅可比猜想」(Jacobian Conjecture)。所有這些證明都經過 Lean 逐行編譯驗證,確保沒有邏輯錯誤。
作者提到他的博士生 Andrew Yang 原本要用 Lean 完整證明一個對「費馬最後定理」證明至關重要的「模性提升定理」(modularity lifting theorem),在獲得 Sol 和 Fable 的使用權後,利用 AI 工具大幅縮短了形式化工作的週期。另一個例子是雅可比猜想:Levent Alpöge 用 Claude Fable 找到反例後,Paul Lezeau 手動把這個反例形式化成 Lean 程式碼,直接提交給 Google DeepMind 維護的「Formal Conjectures」猜想資料庫,因為該資料庫已事先將雅可比猜想的正式敘述寫好,所以驗證 AI 找到的反例是否成立變成幾分鐘內就能編譯確認的事,大幅簡化了傳統的驗證流程。
Google 去年把搜尋功能大改版,加入了「AI 模式」(用 AI 直接生成一段對話式的回答,取代傳統那種列出一堆網站連結讓你自己點進去看的搜尋結果)。結果是,使用者花在 Google 上的時間變多了,因為不用再點進其他網站找答案,Google 自己就把答案講完了。但這對其他網站來說是壞消息:Google 導流給這些網站的流量正在持續減少,因為使用者根本不需要再點連結。這種轉變被認為正在威脅「開放網路」(也就是所有網站彼此靠著搜尋引擎導流、互相連結、共同組成的網路生態),顯示 AI 技術正在快速顛覆整個科技產業的運作方式。
以前你在 Google 搜尋「番茄炒蛋怎麼做」,Google 會列出十個食譜網站連結,你點進某個美食部落格,那個部落格靠廣告或流量賺錢。現在打開 AI 模式搜尋同樣的問題,Google 直接在搜尋頁面生成一份完整的做法步驟,你看完就滿足了,根本不會點進任何食譜網站。差別在於:以前的做法讓內容創作者(食譜部落格、新聞網站等)能靠 Google 導流獲得瀏覽量與收入,現在 Google 自己生成答案、把使用者留在自己的頁面上,內容原創網站的流量與收入因此大幅減少,長期下來可能讓越來越少人願意持續產出原創內容。
Anthropic(開發 Claude 這個 AI 助理的公司)宣佈在旗下「AI for Science」(用 AI 加速科學研究的補助計畫)之下,開了一個專門針對罕見遺傳疾病的申請通道。全球約有 4 億人患有超過 7000 種罕見疾病,但因為病患分散在小群體裡,醫生很難建立病歷資料庫、找出治療標的、設計臨床試驗,Anthropic 認為 AI 能幫忙整理零散的醫學文獻、從有限的資料中快速找線索。通過申請的研究者或早期生技公司,六個月內可以拿到最多 5 萬美元的 Claude API 使用額度(也就是免費用 AI 跑研究,不用自己付雲端運算費)。申請分成兩個方向:一個給做基礎科學研究的學者,另一個給正在加速罕見病藥物開發的新創生技公司,申請截止日是 2026 年 8 月 2 日。
舉例來說,一家做罕見病藥物開發的新創公司,過去要把「確認基因診斷」推進到「病人能實際拿到藥」平均要花一到兩年,其中很多時間耗在依序(不是同時)跑安全性試驗,以及手動整理數千頁的化學與法規文件(新藥申請的規範書)。拿到這次補助後,該公司可以用Claude協助起草和交叉核對這些法規文件(例如IND新藥臨床試驗申請的各個章節),把原本要花好幾個月的文件整理工作壓縮到幾天內完成,交給人類專家審核;同時也能用AI分析一個治療標的能不能用小分子藥物、抗體、基因療法等不同方式攻克,加快篩選治療策略的速度。例如,Every Cure 這家機構已經在用 Claude 從數百萬個候選藥物中找「老藥新用」的機會。
美國有一個政府機構叫 CAISI(AI 標準與創新中心,隸屬於國家標準暨技術研究院 NIST,負責訂出 AI 模型該怎麼測試、怎麼評估資安風險的官方規則),它的主管 Chris Fall 在 2026 年 7 月 20 日確認辭職,上任才大約三個月,沒有說明原因。這已經不是第一次:前一任主管 Collin Burns 今年 4 月上任不到一週就離職,據報是因為他曾在 Anthropic(一家知名 AI 公司)工作過而在政府內部被排擠;再更早,白宮的「AI 沙皇」David Sacks 也已在 3 月離任。目前先由 NIST 局長暫代,商務部預計數週內公佈新人選。另外,白宮 7 月推出一個叫「Gold Eagle」的網路安全計畫,卻沒有讓 CAISI 參與,外界認為這代表這個標準機構正逐漸被邊緣化、失去實權。
假設你是一家 AI 新創的合規負責人,原本打算依賴 NIST 的 AI 風險管理框架(AI RMF,一套教企業怎麼測試和管理 AI 風險的官方指引)來規劃公司的合規流程。但現在 CAISI 主管職位半年內換了三次人、又被排除在白宮新的資安計畫之外,代表這套美國官方標準短期內可能停滯不前、不會更新,你如果繼續等 NIST 出新文件,可能會卡關。實際的做法應該改成:優先參考國際通用的 ISO/IEC 42001(AI 管理系統國際標準)或歐盟 AI 法案等國際框架來做合規基礎,同時盯緊白宮後續發布的行政命令,而不是死等一個目前群龍無首的聯邦標準機構表態。
Hugging Face 與 Pollen Robotics 團隊發布了一個叫 Grabette 的開源硬體系統,目的是解決訓練機器人(機械手臂)最缺的東西:大量真實世界的「操作示範資料」。以前要收集這種資料,通常得真的用一臺機器人手臂,讓人遠端操控它做動作(這叫teleoperation,成本高、耗時、還需要專門的實驗室設備)。Grabette的做法是:不需要機器人,只要一個手持的夾爪裝置,裝上一般相機和一個有深度感應的相機(RGBD攝影機,能同時拍到畫面和物體距離),人直接用手拿著它做動作(例如抓取、搬移物品),裝置會用SLAM技術(一種讓機器從影像自動算出自己移動軌跡的演算法,常用在機器人和AR眼鏡上)記錄下手部在空間中的完整3D移動路徑和夾爪開合狀態。錄好的資料會自動轉換成LeRobot格式(Hugging Face推出的機器人資料集標準格式),上傳到Hugging Face Hub(一個公開分享AI模型與資料集的平臺)後,任何人都能拿去訓練自己的機器人操作模型,不需要先擁有一臺機器人。團隊也一併推出了它的機器人版雙胞胎「Gripette」,一個成本約120歐元的機動夾爪,可以裝在真實或模擬的機械手臂上,執行從人手示範中學到的動作。
假設一個機器人研究者想教機械手臂學會「把杯子從桌上拿起來放進櫃子」這個任務。傳統做法:需要一臺真的機械手臂、一套遠端操控介面,讓操作員花好幾個小時反覆操控手臂做這個動作、錄下每一次的感測器數據,過程繁瑣且非常依賴實驗室設備,很難讓不同地方的人一起貢獻資料。用Grabette的做法:研究者花約490歐元的零件(樹莓派、一般相機、深度相機、磁編碼器)自己組裝一個手持夾爪,直接用手拿著它做「拿杯子放進櫃子」的動作,按一下按鈕開始錄、再按一下停止,資料就存在樹莓派裡。接著打開瀏覽器裡的Grabette控制檯,選擇要用的錄製片段,一鍵送去雲端處理:系統自動用SLAM演算法算出手部移動軌跡、檢查軌跡有沒有跳動或追蹤失敗,然後把資料轉成LeRobot標準格式的資料集上傳。研究者接著就能直接拿這批資料,用官方提供的範例(Diffusion Policy這種能在一般消費級顯卡上訓練的視覺動作模型)訓練一個政策模型,再裝上Gripette夾爪、接上一支叫OpenArm的7軸機械手臂實際測試成果。差異在於:整套流程不需要先擁有機器人,任何人在家組裝一個手持裝置、錄幾段影片,就能為全球共用的機器人訓練資料庫貢獻資料。
有開發者發布了一個叫 Slater 的開源圖資料庫(graph database,一種把資料存成「節點+關係」而不是傳統表格的資料庫,適合處理「誰跟誰有關聯」這種問題)。它最大的賣點是可以用幾百 MB 的記憶體,服務一個有上億個節點、數十億條關係的超大圖(例如維基資料 Wikidata 的 9000 萬節點圖),因為它不像多數同類資料庫(如 Neo4j、Memgraph)要把整張圖整個塞進記憶體,而是像資料庫一樣從硬碟按需讀取。它同時內建了「磁碟原生向量搜尋」(vector search,就是把文字/圖片轉成一串數字後,找出語意最相近的其他資料),並且相容標準 Bolt 協定,任何現有的 neo4j 驅動程式都能直接接上不用改程式。這對做 RAG(讓 AI 回答問題前先去資料庫查資料,避免憑空捏造答案)的開發者有實際幫助,因為知識圖譜和向量搜尋可以放在同一顆引擎裡,不用另外管理兩套系統。
假設你要幫公司建一個內部問答 AI,用 RAG 讓它能回答「A 部門的某個專案,牽涉到哪些供應商、又跟哪個法規條款有關」這種需要跨好幾層關聯的問題。傳統做法是把文件切成小段、用向量相似度去撈最像的段落餵給 AI,但答案往往分散在不同文件裡,撈到的片段各自獨立、缺乏「誰跟誰有關」的脈絡,AI 容易答錯或答不出來。改用 Slater,你可以先將業務中不同實體之間的關聯建成圖,AI 查詢時能沿著圖上的路徑逐步探索,同時圖旁邊就內建向量索引可以做語意搜尋,兩種查詢用同一套系統、同一個資料庫連線就能做完,而且就算公司資料膨脹到上億筆關聯記錄,伺服器也只需要幾百 MB 記憶體就能撐住,不必為了塞下整張圖而不斷加大伺服器規格。
Twitter創辦人Jack Dorsey旗下公司Block推出一款叫Buzz的開源工作平臺,目標是把團隊聊天(像Slack)、AI代理人(AI agent,就是能自己執行任務、寫程式、審查程式碼的AI助手)、以及程式碼託管(像GitHub)三個原本分散在不同軟體的功能,全部整合進同一套系統。Buzz的核心技術是Nostr(一種去中心化通訊協定),每一則訊息、每一次程式碼提交、每一個工作流程步驟都會被加密簽名並記錄下來,讓人類員工和AI代理人使用同一套身分系統,各自擁有自己的金鑰和頻道權限。這代表AI代理人不再只是聊天室裡的機器人,而是可以像真正的團隊成員一樣搜尋過去對話、開啟程式碼庫、提交修改、審查程式碼、執行工作流程。不過目前Buzz的中繼伺服器(relay,負責驗證和分發所有訊息的核心伺服器)仍是集中式架構,並非真正點對點的去中心化,這點與Dorsey宣稱的「去中心化、自主可控」有落差;此外行動裝置版本、推播通知等功能都還在開發中,官方文件也坦承產品尚未完成。
假設一個開發團隊要修一個功能分支:過去的做法是在Slack上討論需求、在GitHub開分支寫程式碼、CI(持續整合,自動跑測試的系統)跑測試結果又跳到另一個通知頻道,AI代理人幫忙寫的程式碼審查意見還要另外串接工具才能同步進聊天室,整個過程資訊分散在三、四個不同系統裡,事後要追溯「這個決策是誰在什麼討論下做的」很麻煩。用Buzz的話,一個功能分支會自動變成一個專屬頻道,這個頻道裡同時放著討論串、程式碼的修改記錄(patch)、CI測試結果、審查留言、以及最終合併的決定,全部用同一套簽名記錄保存並可搜尋;AI代理人(目前支援Goose、Codex、Claude Code等工具)可以直接在這個頻道裡讀取上下文、送出程式碼修改、跑工作流程,不需要額外串接其他系統去同步資訊。差別在於:舊做法要靠人工在多個工具間手動對照拼湊脈絡,Buzz把整個開發歷程收斂成一條可完整追溯的紀錄。
有團隊在Hacker News上發表一個叫CodeAlmanac的開源免費工具,專門解決一個常見問題:開發者跟Claude Code、Codex這類寫程式的AI助理(coding agent,就是能幫你寫程式、改程式碼的AI)聊了很多,過程中討論出很多重要決定,但這些對話內容通常沒人整理,時間一久就被遺忘,新加入的人或未來的AI也不知道當初為什麼要這樣設計。CodeAlmanac會在你的程式碼專案裡自動維護一個叫almanac的資料夾,裡面放著一頁頁互相連結的說明文件,記錄程式碼背後的決策和原因,這些內容會存進SQLite(一種輕量資料庫)方便查詢。它還會自動在專案設定檔(如CLAUDE.md)裡加上指示,讓以後的AI助理開始工作前,先查這個知識庫再動手。每隔五小時,它會啟動一個agent自動讀取你最近跟AI的對話紀錄,更新相關文件內容,開發者選擇用時間間隔而非每次提交程式碼時觸發,是因為觀察到大家提交程式碼很頻繁,若每次都觸發會讓花費的AI運算成本(token cost)太高。
假設一個三人小團隊,各自用自己的Coding Agent(AI寫程式助理)開發同一個專案。過去的做法是:某人想了很久做了一個技術決定,改動了程式碼,之後要打電話跟另外兩位隊友解釋「為什麼程式碼長這樣」,這些口頭說明沒有留下紀錄,新人或未來的自己很快就會忘記原因。裝上CodeAlmanac之後,每五小時系統會自動掃描這三人各自跟AI助理的對話紀錄,抽取出「做了什麼決定、為什麼這樣做」,寫成一頁頁Markdown文件放進repo裡的almanac資料夾,並讓每個人的AI助理下次開工前自動先查閱這些文件。結果是:以前必須靠人工口頭解釋、容易遺漏和過時的知識,現在變成自動更新、AI自己會讀的活文件,團隊不用再靠記憶或臨時打電話對齊彼此的決策脈絡。
OpenAI(開發ChatGPT的公司)宣佈推出「ChatGPT for Small Businesses」計畫,專門幫助小型企業主學習使用AI(人工智慧)來處理日常工作。這個計畫包含線上教學webinar(就是網路直播講座)、實體AI訓練營、教學指南,以及與Dropbox、Shopify、Intuit、Slack、Atlassian、Wix等合作夥伴整合的外掛與技能。核心賣點是ChatGPT Work,這是一款可以連結企業檔案、應用程式並記住使用者工作習慣的agent(就是能自主完成多步驟任務的AI助理),背後採用OpenAI最新的GPT-5.6模型。OpenAI表示去年類似的實體訓練營中,有78%參與者當天就做出能用的AI工作流程,42%的人每週省下超過五小時。
假設你是一家只有三五個人的設計工作室老闆,平常要兼行銷、記帳、跟客戶溝通,忙到分身乏術。用ChatGPT Work,你可以錄一段語音備忘(例如邊開車邊講想法),它會自動整理成一則簡潔的Slack訊息,一次發送到不同頻道,不用自己打字轉述。你也可以建立一個會即時更新的頁面(OpenAI稱為Site),持續追蹤市場提及、競爭對手動態或產品趨勢;或是把顧客評論丟給它,讓它自動做出一份訓練簡報,整理出做得好的地方和待改進之處。跟過去相比,這些原本需要外包、或老闆自己熬夜處理的雜事,現在可以直接交給AI在背景完成。
上海儀電主導的「愛賽思OpenAI4S」科研AI社群,在2026世界人工智能大會(WAIC,就是每年在上海舉辦的大型AI產業展會)上正式升級改名為「智愛賽思」,同時推出專門給科學家用的「科研專屬Token Plan」(Token可以理解成使用AI服務要花的點數額度)。這個方案分成學術體驗包、科研標準包、實驗攻堅包三種等級,讓不同需求的研究者依用量付費訂閱,用途涵蓋讀論文、校對文字、分析數據,到多模態(同時處理文字、圖片、數據等不同形式資料)分析和高難度實驗攻堅。平臺背後整合了上海人工智能實驗室、上海創智學院等多個機構的合作資源,並集成了專用AI模型,例如Yi-Science-Evolving(儀電自研)、Intern-Discovery、SciMaster,這些模型比通用型AI更懂科研的專業語境和推理邏輯。整體定位是幫科學家把算力、模型、工具、資料、實驗資源整合在一個平臺裡,減少在不同系統間切換的麻煩。
假設一名材料科學研究生要寫論文,過去得自己分頭上好幾個網站查文獻、再用另一套軟體做數據分析、又要找別的工具跑實驗設計,來回切換平臺很浪費時間。用智愛賽思的話,他可以訂閱「學術體驗包」,在同一個平臺裡先用內建的百萬級文獻庫做文獻調研,再用平臺整合的AI4S專屬模型(例如SciMaster)幫忙設計實驗步驟、分析實驗數據,最後由AI協助整理論文草稿。差別在於:以前要在文獻資料庫、分析軟體、寫作工具之間手動搬運資料,現在同一個帳號、同一個Token額度就能串起整個科研流程,省去跨平臺重複匯入匯出資料的麻煩。
阿里健康旗下的醫學AI平臺「氫離子」(一個給醫生用、能讀懂病歷和醫學文獻並用AI對話回答臨床問題的系統)宣佈和三個全球最權威的醫學期刊出版方談成內容合作,分別是NEJM(新英格蘭醫學雜誌,醫學界公認最頂尖的期刊之一)、JAMA(美國醫學會雜誌)以及先前已簽約的BMJ(英國醫學雜誌)集團。這代表氫離子成為中國第一個同時拿到這三大頂級醫學期刊全文內容授權的AI平臺。過去中國醫生想查一篇頂刊論文,常常只能看到摘要,要看全文得付費登入,而且要分別跑好幾個期刊網站分開查,查一個免疫治療的細節可能得花上半天。現在這三家出版集團的內容都已經接進氫離子,醫生可以直接在平臺上讀到全文,或直接用自然語言提問,AI會根據這些文獻給出有實證依據的回答,並附上可以回溯到原文段落的引用來源,還支援中英對照閱讀。
假設一位腫瘤科醫生要幫病人判斷某種免疫治療方案在特定亞群病人身上的療效證據,過去做法是先在PubMed搜尋,通常只能看到論文摘要,要看全文得個別登入NEJM、JAMA、BMJ等期刊網站付費或機構訂閱,一篇篇比對,整個流程可能耗費半天。現在透過氫離子平臺,醫生可以透過AI對話提問「某免疫治療方案對某亞組病人的療效證據」,AI會在已授權的NEJM、JAMA、BMJ全文資料庫裡搜尋並整理出有實證依據的回答,同時附上可回溯到原始論文段落的引用,還能中英對照查看原文,省去逐一登入多個期刊網站分別檢索付費全文的時間與門檻。
阿里旗下的AI編程工具Qoder(一種能幫你自動寫程式碼的AI助手,類似會寫程式的聊天機器人)推出新的安全功能「Qoder Security」,等於給每個用戶配一位專屬的資安工程師。背景是現在全球超過四成的新程式碼是靠AI輔助寫出來的,但AI寫出來的程式碼出現漏洞(就是程式裡的安全破綻,可能被駭客利用)的機率比人工寫的還高,而企業的資安審查能力卻沒跟上,所以這個功能把安全檢查直接內建到AI寫程式的過程裡,而不是等寫完才另外檢查。它會在AI生成程式碼的同時就同步做安全檢查,一發現問題就自動修復,下一輪再重新驗證一次,形成「發現、修復、再驗證」的完整循環。
假設一位工程師用Qoder寫一段處理使用者登入的程式碼,過程中不小心讓AI生成了容易被SQL注入(一種常見的資料庫攻擊手法,駭客可以透過輸入特殊指令偷取或竄改資料庫內容)的程式碼。傳統做法是靠事後的靜態掃描工具(只會比對已知的危險寫法規則,容易漏掉沒看過的變種),寫完程式碼後才跑一次掃描,發現問題再手動回頭修。Qoder Security則是三層防護:第一層在打字生成程式碼的當下就即時攔截已知的高危寫法(例如呼叫危險函式),零延遲自動修掉;第二層在一個任務做完後,用能理解程式碼語意的AI模型去抓SQL注入、敏感資料外洩這類需要理解上下文才抓得到的風險;第三層在你要提交程式碼前,主動問你要不要做跨檔案、跨函式的完整資料流掃描,把單一檔案看不出來的隱藏漏洞揪出來。根據官方測試數據,比起傳統掃描方案,漏洞檢出率提升約60%,誤報率降低約80%,且從發現漏洞到修復平均只要幾小時,而不是像過去可能拖上好幾天甚至更久。
2025年初,DeepSeek公司把自家的大型推理模型R1拿來解題,讓它產生約80萬份完整的解題過程紀錄,裡麵包含它一步步思考、寫錯又自己更正、甚至自言自語「等等,讓我再想想」的完整推理軌跡(也就是AI解題時腦中那串思路的文字紀錄)。研究團隊把答案錯誤或寫得亂的紀錄濾掉,剩下的拿去對幾個現成的小型開源模型(像是Qwen和Llama系列、參數量從15億到700億不等,參數量越大代表模型「腦容量」越大、通常也越聰明)做監督式微調(就是拿標準答案範例直接教模型模仿、是最基礎的AI訓練方式,不涉及複雜的獎勵機制)。沒想到效果好得驚人:原本平凡的小模型被微調後,開始能解出對它們來說原本很難的數學競賽題目,其中一個70億參數的模型甚至自己學會了驗算、學會在推理中途換個方向重新思考,而這些行為並沒有被特別設計來訓練。這打破了業界原本的預期——先前普遍認為,直接叫小模型逐字模仿大模型的解題過程效果有限,因為小模型實際使用時走的思路本來就和大模型不一樣,單純模仿不會真的學到東西,但這次的結果證明simplest的模仿方式反而效果驚人。
假設我想要一個能跑在自己筆電、成本低的AI模型幫忙解數學題或寫程式邏輯,但市面上便宜的小模型通常推理能力很弱、常常算錯。照這篇文章介紹的做法,我可以先用一個很強但很貴的大型推理模型(如DeepSeek R1)針對大量題目生成完整解題過程(不是隻給答案,而是把它「怎麼想」的過程都記下來),篩選掉推理走偏、答案錯誤的紀錄後,把這些「解題過程範例」拿去對一個小模型(例如70億參數的Llama)做最基本的監督式微調。結果這個原本普通的小模型,在沒有額外複雜訓練技巧的情況下,就能解出原本超出它能力的競賽數學題,甚至自己學會邊算邊檢查對不對。相較於過去業界主流做法(用強化學習、讓模型自己在推理路徑上反覆試錯訓練,成本高、流程複雜),這個方法只需要把老師的解題過程整理好餵給學生模型,成本低很多,卻得到接近的效果。
最近 AI 研究圈流傳一個新想法:讓 AI 變聰明的關鍵,可能不是把底層模型(Transformer,一種 AI 常用的神經網路架構)做得更大,而是外面包著模型的那套「執行框架」(harness,就是安排 AI 一步步做事的流程和工具)。研究者 Alex Zhang 提出一種叫 RLM(推理語言模型,一種訓練方式)的做法:用設計良好的框架,把表面上看起來不同的任務,轉換成模型內部處理起來很類似的步驟,讓模型從中學到可以套用到其他任務的通用能力。多位業界人士(包括 LangChain 創辦人 @hwchase17)跟進討論,認為 AI 真正變聰明的關鍵,可能正從「模型本身」轉移到「怎麼安排 AI 做事的流程設計」上。同時,LangSmith Sandboxes、Agno Environments 等新工具上線,讓開發者可以在模擬環境裡訓練和測試會長時間運作、自己除錯的 AI 代理人(agent,能自主完成多步驟任務的 AI 程式)。另外還有研究提出,讓 AI 代理人在試做任務時,把「觀察到的環境變化」也拿來當學習素材(不只看最後有沒有得到獎勵),這樣能讓 AI 學得更有效率、更會用工具、也更能應付新狀況。
假設你要訓練一個 AI 代理人去處理「長時間追蹤並修復程式 bug」這種任務,傳統做法是直接餵給它大量真實的長任務資料,又貴又難蒐集。用 RLM 的思路,你可以只準備大量「短版本」的簡化任務(例如幾步就能解決的小問題),但用同一套框架把這些短任務的步驟拆解方式,設計得跟長任務的拆解邏輯相似,讓模型學到的是「怎麼拆解問題」這個可重複使用的能力,而不是死記某個特定長任務的解法。訓練完後,直接把它丟到真正的長任務(可能長 8 到 32 倍)上,它也能上手,不需要重新收集昂貴的長任務訓練資料。這跟過去「模型越大越聰明」的思路不同,差別在於:省下大量長任務資料蒐集成本,靠的是「怎麼安排任務」的巧思,而不是砸更多算力堆模型參數。
YC(知名新創加速器 Y Combinator)與 Together AI(一家提供 GPU(就是專門用來訓練與跑 AI 模型的高效能運算晶片)雲端運算服務的公司)宣佈合作,推出第一個專屬給 YC 新創公司使用的 GPU 叢集(把很多臺 GPU 伺服器串連起來、統一調度使用的運算資源池)。目的是讓新創公司更容易取得訓練、微調(fine-tune,就是拿一個已經訓練好的模型,用少量自己的資料再調整一下,讓它更適合特定用途)與部署 AI 模型所需的運算資源,降低過去要簽 24 個月長約才能用到 GPU 的門檻。Together AI 目前已服務超過 8000 個客戶,包含 Cursor、Cognition、ElevenLabs 等知名 AI 公司。這則消息反映了「取得運算資源」已成為 AI 新創最大的瓶頸之一,也是這次合作想解決的核心問題。
假設你是一個剛從 YC 加速器畢業的早期新創團隊,想訓練自己的客製化語言模型,但過去要租用 GPU 雲端服務,供應商常要求簽 24 個月的長期合約,對現金流緊張的新創來說風險很高、也難以隨用量彈性調整。有了這次 YC 與 Together AI 的專屬叢集合作後,YC 系新創可以用更彈性、門檻更低的方式申請使用這批 GPU 資源,不必被綁死在長約裡,就能開始訓練、微調並上線自己的 AI 模型,把原本卡在「等錢、等約、等機器」的時間省下來,提早驗證產品。
Unsloth(一套讓開發者能用更少電腦資源訓練與執行 LLM〈就是 ChatGPT 這類會對話的大型語言模型〉的開源工具)宣佈和 AMD(美國一家設計晶片與顯示卡的公司)合作,現在可以在 AMD 的顯示卡上訓練與執行超過 500 個模型。過去這類工具大多隻支援 NVIDIA(另一家顯示卡公司)的硬體,這次等於讓使用 AMD 顯示卡(包括 Radeon、Instinct、Ryzen 系列,以及資料中心用的顯示卡)的人也能做同樣的事,且支援 Windows、WSL、Linux 系統。Unsloth 表示透過自家客製化的 Triton 核心(一種讓程式在顯示卡上跑得更快的底層程式技巧)與數學演算法,速度最高可提升 2 倍、記憶體佔用減少 70%,而且準確度不會下降。他們也提供最佳化的 ROCm(AMD 的顯示卡運算軟體平臺)版本,支援 GGUF 與 Safetensors 這兩種常見的模型檔案格式進行推論(就是讓模型實際回答問題的過程)。
假設有個學生只有一張 AMD Radeon 顯示卡(而非市面上訓練 AI 最常見的 NVIDIA 顯示卡),過去想微調(fine-tune,就是拿一個現成模型、用少量自己的資料再訓練一次讓它更懂特定任務)Qwen 或 Gemma 這類開源模型,往往因為工具生態系幾乎都綁定 NVIDIA 而做不到,或效能極差。現在用 Unsloth 的 AMD 支援版本,這位學生可以直接在自己的 Radeon 顯示卡上訓練 Qwen、Gemma,官方甚至表示只要 3GB 顯示記憶體就能訓練,且速度比一般作法快到 2 倍、記憶體省下 70%。差異在於:以前 AMD 顯卡用戶等於被排除在主流 LLM 訓練工具之外,現在可以用同一顯示卡完成原本以為只有 NVIDIA 卡才能做的訓練工作。
Cursor(一家做 AI 輔助寫程式工具的公司)團隊做了一個實驗:讓一組 AI agent(可以自己規劃步驟、呼叫工具去完成任務的 AI,不只是單純聊天回答)只看 SQLite(一套很多軟體都在用的資料庫程式)長達835頁的官方使用手冊,從零把整個資料庫程式重寫一遍,但改用 Rust(一種以安全、效能著稱的程式語言)來寫。結果這個重建版本通過了100%的隱藏測試(Cursor 團隊自己準備、AI 事先沒看過的驗收測試),代表它幾乎完整還原了原版功能。團隊也發現一個有趣現象:如果換用不同的 AI 模型組合去分工執行這個任務,最終花費的運算成本可以相差到15倍之多,說明「用哪個模型做哪一步」對成本影響非常大。
假設一間公司想把內部一套老舊的 C 語言資料庫工具換成更安全的 Rust 版本,但原始碼因年代久遠、文件不齊全,工程師得花好幾個月手動閱讀、逆向工程再重寫,還容易漏掉邊角案例。Cursor 這次的做法是:不看原始碼,只給 AI agent 團隊讀835頁的官方手冊(規格文件),讓多個 agent 分工設計、寫程式、寫測試、互相檢查,最後產出的 Rust 版本能100%通過官方等級的隱藏測試集。對比傳統做法(工程師逐行讀原始碼再手刻),這代表:只要有完整規格文件,AI agent 團隊有機會在沒看過原始程式碼的情況下,直接從文件重建出功能對等的軟體,且品質由自動化測試驗證,而不是全靠人工審查。同時,成本會因為選用的模型組合不同而差到15倍,所以實務上要重建大型軟體時,還得同步做模型組合的成本評估。
研究機構 BloombergNEF(一家專門分析能源市場趨勢的顧問公司)發布最新報告指出,因為 AI(人工智慧)運算需求暴增,美國資料中心(就是存放伺服器、跑 AI 運算的大型機房)到 2035 年的用電量會是現在的 4 倍,佔全美發電量的五分之一。報告預測未來十年資料中心容量將大幅增加,其中將近一半專門用來訓練和執行 AI 模型,而且大部分還是集中在美國,到 2033 年美國將佔全球 AI 晶片用電量的 64%。這次的用電量預估比 BloombergNEF 去年 12 月的預測高出 83%,其他機構如 EPRI(電力研究機構)、S&P 也都大幅上修預測,反映資料中心建設速度遠超原本想像。
以美國東岸的電網管理機構 PJM Interconnection(涵蓋維吉尼亞到伊利諾州的電網系統)為例,報告預測未來資料中心將吃掉這個電網 34% 的電力,德州電網 ERCOT 則要撥出 22% 的發電容量給資料中心。PJM 因為連接申請量太大,過去曾暫停接受新發電來源的併網申請長達四年,即使今年 4 月重新開放,供需失衡仍讓當地電價一年內飆漲 76%,甚至有電力公司 American Electric Power 揚言要退出 PJM 電網。但即便如此,資料中心仍搶著要接進 PJM,在最近一次的容量拍賣中,資料中心就佔了申請電力的 38%。這說明 AI 產業的爆發式成長,實際上正在對真實世界的電網基礎建設造成壓力,不是隻有晶片和演算法的競賽而已。
音樂串流平臺 Deezer(一家和 Spotify、Apple Music 類似的線上聽歌服務)公佈最新統計,今年 6 月平臺上每天新上傳的歌曲裡,超過一半、平均約 9 萬首都是用 AI 生成的。這個比例是持續攀升的:2025 年初只佔一成,到 2026 年 4 月已經衝到 44%,短短幾個月又衝破 50%。串流業界對 AI 歌曲該怎麼處理還沒有共識,有的平臺(像 Bandcamp)直接禁止上架,有的(像 Tidal)不讓 AI 歌曲抽分潤,蘋果音樂則是讓上傳者自願標註是否為 AI 製作。Deezer 自己則開發了偵測技術,能認出用 Suno、Udio(兩家因版權訴訟而知名的 AI 音樂生成新創公司)等工具做出來的歌曲,並打算開始下架半年內沒人聽過、或涉及灌水播放次數詐騙的 AI 歌曲。
Deezer 的具體做法是:先用自家開發的偵測技術,掃描平臺上每天新上傳的歌曲,辨識出哪些是用 Suno、Udio 這類 AI 工具生成的,並在後臺幫這些歌曲貼上標籤。接著鎖定兩種歌曲下架:一是半年內完全沒人聽過的 AI 歌曲,二是被抓到用機器人灌播放次數、藉此從平臺分潤機制詐取版稅的 AI 歌曲。今年稍早 Deezer 還把這套偵測工具開放給其他平臺使用,上個月更推出另一個工具,可以直接掃描 Apple Music 和 Spotify 的播放清單,抓出裡面混雜的 AI 生成歌曲。
新創公司Gritt從隱身模式(stealth,指公司先悶頭研發、暫不公開細節的階段)中正式亮相,並宣佈已募得3200萬美元資金。這家公司由兩位卡內基美隆大學畢業的機器人專家創立,他們用AI模型(可以理解成讓機器有判斷力的軟體大腦)加上機器視覺(讓機器像人一樣用攝影機看懂周遭環境)去控制現成的工業機器手臂和搬運車,讓機器人能在戶外工地這種凌亂、不固定的環境裡工作——這在過去是傳統工業機器人做不到的,因為它們通常只能在固定、規律的工廠產線上運作。公司創辦人認為,是最新一代AI模型的進步,才讓機器人第一次能應付這種不可預測的戶外工地環境。
目前太陽能發電廠的建設面臨缺工問題,安裝大片玻璃太陽能板需要人力搬運、定位、鎖固,既耗時又容易造成工人受傷(板子重達100磅要舉過頭頂安裝)。Gritt的做法是:不自己造機器人硬體,而是租用市面上現成的機器手臂(例如川崎重工的產品)和搬運車,再用自家AI模型控制這些設備,讓機器人自動把太陽能板從卸貨處搬到金屬支架上,並以低於一毫米的誤差精準定位,讓工人接手鎖緊即可。實際效果是:原本8人的工班一天能安裝800片太陽能板,換成搭配Gritt系統後,同樣的工班一天可以裝到3000到4000片,等於產能提升約4到5倍。目前Gritt已有2套系統在現場運作,並簽下合約要在未來18個月內協助安裝2.8吉瓦(GW,衡量發電量的單位)的太陽能板,客戶包含美國前十大電力工程公司中的三家,計畫半年內把系統擴增到48套。
巴基斯坦法官人力嚴重不足,每十萬人不到兩位法官(歐盟是22位、英格蘭和威爾斯是30位),到2024年底累積了226萬件未結案。蘇黎世聯邦理工學院、倫敦帝國學院和新經濟學院的研究團隊,找來1,559位巴基斯坦法官(約佔全國初審法官一半)做大型隨機實驗,測試一套叫JudgeGPT的AI助理(用OpenAI的GPT-4打造,並用RAG技術,也就是讓AI回答前先去查資料庫、找到129,235份文件包括過去判決和法律條文,再引用生成答案)。結果發現光給AI工具沒用,一定要搭配實地訓練(三週內六堂、每堂90分鐘的課)才有效:受訓法官用量是隻上通識講座那組的四倍,所在地區案件量因此多結了6.3%,換算下來一年多結約1,848件案子。研究者估計,比起多聘法官達到同樣產量,這套做法平均每花一元可省下38.5美元,判決品質也沒有下降,反而在配對比較中被評為較優的比例從42%升到59%,也沒有發現AI讓性別或宗教偏見增加。
以前巴基斯坦法官人力吃緊,一個法院可能同時堆著上千件案子,法官要自己一件件查法條、翻過去的判例,寫判決書,速度很慢。研究團隊讓部分法官用JudgeGPT,法官在系統裡打一個問題(例如某項法律爭點該怎麼判),AI會從12萬多份判決和943部法律裡挑出最相關的10段內容,生成一個附引用來源的答案,法官再自己判斷要不要採用、怎麼寫進判決書。但研究發現,光給工具沒受訓的法官,40週下來平均只登入約20次、下不到50個提示;而受過6堂訓練課、學會「AI適合做什麼、不適合做什麼、怎麼查核輸出」的法官,同期登入近60次、下超過200個提示,且更常拿AI來做編輯、摘要文字這類AI比較不會出錯的工作,而不是直接問AI法律問題(避免AI亂編答案的風險)。最終效果是:受訓組的地區一年多結1,848件案子,判決品質沒退步反而略升,比起多僱用法官來處理相同案量,每投入1美元大約省下38.5美元。對比是:沒有訓練,AI工具幾乎等於白買;有訓練,才能真正把積壓案件的速度提上去。
Anthropic(開發 Claude 這款 AI 助理的公司)在 Claude Cowork(Claude 桌面應用程式裡的工作區功能,讓 AI 幫忙處理各種任務)裡新增了一個功能:使用者可以邊做事邊錄下自己的電腦畫面,同時用語音講解自己在做什麼,Claude 就會把這段錄影轉換成一個「可重複使用的技能」並存起來。之後遇到同樣的任務,就能直接叫出這個存好的技能自動執行,不用每次都重新手動教一遍。這個「錄製技能」的選項放在 Cowork 介面的「+」選單裡,目前只開放給 Pro、Max、Team 這幾種付費方案的使用者。文中提到 OpenAI(ChatGPT 背後的公司)的程式開發工具 Codex 也有類似的錄製並重播工作流程的功能。
假設某位使用者每週都要重複做同一件雜事,例如打開某個網站、下載一份報表、貼到 Excel 裡整理格式,過去只能每次都自己動手做完整套步驟,或者花時間寫程式自動化。有了這個功能之後,他只需要照常做一次這件事,同時開啟螢幕錄影並口頭講解「我現在點進報表頁面、下載檔案、貼到表格第二欄」,Claude Cowork 事後就會把這段錄影連同語音說明整理成一個技能存檔。下次要做同樣的事,直接呼叫這個存好的技能,Claude 就會依照當初錄的步驟自動執行,使用者不需要重新操作一遍,也不需要自己寫程式碼去描述流程。
微軟和法國AI新創Mistral宣佈擴大合作,簽下一筆數十億美元的大單,要在歐洲建置AI基礎設施。Mistral會新增數千顆Nvidia最新一代Vera Rubin GPU(GPU是專門用來跑AI運算的晶片),微軟則會用這些運算資源來支撐自家雲端和AI服務。同時,Mistral的Medium 3.5和OCR 4模型(OCR是「光學字元辨識」,也就是讓AI讀懂圖片或掃描文件裡文字的技術)現在已經上架微軟的Foundry平臺(微軟提供給企業客戶挑選、部署各種AI模型的服務),Medium 3.5也進駐微軟的Copilot Studio(讓企業自行打造AI助理的工具)。企業可以透過Azure Local,選擇在雲端、在自己的機房環境,或完全離線的方式執行Mistral的模型,這個做法主要是鎖定金融、醫療、製造這類對資料保密要求很高的產業。微軟總裁Brad Smith表示,歐洲應該能在不放棄資料掌控權的前提下用上強大的AI。
假設一家歐洲的醫院想導入AI來輔助病歷文件的辨識與整理,但受限於醫療法規,病患資料完全不能傳到公司自己管控範圍以外的伺服器上。過去若要用微軟雲端的AI服務,資料勢必得上傳到微軟的雲端,這在醫療業常常過不了合規審查。透過這次合作後,醫院可以選擇用Azure Local把Mistral的OCR 4模型部署在自己機房、甚至完全離線運作,資料完全不出院內網路,同時仍能透過本機部署的AI模型進行辨識,讀取掃描病歷、提取關鍵資訊。差別在於:以前「用強大AI」跟「資料不外流」兩者難兼顧,現在企業可以兩者都要。
企業支出管理公司 Ramp 打造了一個內部的 LLM(大型語言模型,就是 ChatGPT 這類會理解和生成文字的 AI)閘道系統,需要在多家 AI 供應商、多種模型之間自動選擇,兼顧成本和速度。這套系統叫 Ramp Router,核心用了兩個統計技巧:一是用 EWMA(指數加權移動平均,一種讓最近資料權重較高的平均算法)持續追蹤每個模型「真的」故障的機率,並排除是用戶自己輸入錯誤造成的假故障;二是用 Thompson sampling(一種一邊觀察結果、一邊更新機率預測、然後根據預測做決策的演算法,常用在要不斷嘗試找出最佳選項的情境)去學習每個模型的回應延遲分佈。系統會把「這次請求失敗的機率」加上「回應太慢趕不上期限的機率」,兩者結合模型的價格,即時算出當下最划算又可能準時的模型和服務層級來使用。Ramp 表示這套機制讓串流版本的產品 Ramp Inspect 節省了 30% 的成本,且沒有犧牲效能。
舉例來說,Ramp 有一個「用 AI 重新排序內容」的功能,設定了 6 秒的回應期限。當它偵測到原本要用的模型正被供應商限速(也就是回應會變慢或失敗機率變高)時,Router 會即時算出改用一個更便宜的替代模型比較划算,就自動把這次請求切換過去,而不需要工程師手動介入判斷。傳統做法通常是寫死規則(例如固定用某個模型,或故障後才手動切換),這樣要嘛平常多花冤枉錢用較貴的模型保險,要嘛故障當下沒能即時反應造成請求逾時或失敗。Ramp 這套方法讓系統在每一次請求發生的當下,就用機率計算自動挑出成本與可靠度的最佳平衡點。
中國AI公司Z.AI(原名智譜,做GLM系列大型語言模型,也就是類似ChatGPT的AI)蓋好了一座發電容量達1吉瓦(等於同時供應約75萬戶家庭用電的規模)的資料中心,而且裡面用的晶片全部是中國自產、沒有用美國NVIDIA的晶片。這座設施已經開始部分運轉,目的是提供更多運算資源來訓練Z.AI旗下更先進的GLM模型。這件事之所以重要,是因為它代表中國想擺脫對NVIDIA晶片依賴的一次重要測試:如果國產晶片撐得起這種規模的AI模型訓練,就代表中國半導體業真的追上來了。目前中國本土晶片商如華為、寒武紀,都在跟NVIDIA的效能差距上努力追趕。
在美國出口管制下,中國AI公司取得NVIDIA晶片受到限制。現在Z.AI改用純國產晶片,蓋出一座1吉瓦規模(相當於約75萬戶家庭同時用電量)的資料中心,等於自己掌握了訓練用的運算硬體來源,不用再看國外晶片供應臉色。對比之下,同業Moonshot(另一家中國AI新創,做Kimi K3模型)就因為運算資源吃緊,上週日直接暫停新用戶訂閱、優先保留資源給既有付費會員,顯示算力短缺已經是中國AI公司普遍要面對的現實問題,而Z.AI這步等於是提前用國產硬體解決了這個瓶頸。
這則新聞在講 AI(人工智慧)如何影響新藥開發這件事。藥廠在把一個候選藥物拿去做人體臨床試驗之前,通常要先經過「臨床前開發」(preclinical development,也就是先在實驗室和動物身上測試藥物的安全性和效果,確認有希望才會進入人體試驗)階段,這個階段過去往往又貴又慢。根據報導,導入 AI 之後,這個臨床前階段的成本和時間最多可以縮減 70%,也因此帶動藥廠對進階分析軟體和 AI 模型的需求增加。報導預估,這樣的效率提升可能在未來三到五年內,讓新藥開發專案的數量成長超過 10%。不過報導也提醒一個重要保留:到目前為止,還沒有任何一款完全由 AI 主導開發流程的藥物真正拿到美國 FDA(食品藥物管理局,負責審核藥物是否能上市的美國政府機關)的核準上市,這讓外界對 AI 究竟能不能真正幫到病人的治療,還存有疑慮。
以一間藥廠在做臨床前開發為例:過去要驗證一個候選藥物是否值得往下推進到人體試驗,得靠大量實驗室實驗和動物實驗,一步步排除不安全或無效的候選分子,整個流程耗時又燒錢。報導指出,導入 AI 模型輔助這個臨床前階段後,同樣的驗證流程可以把成本和時間壓縮最多 70%,等於藥廠可以用更少資源、更快速度篩掉沒有希望的候選藥物、留下有機會的繼續往下走,這也是為什麼藥廠對相關 AI 軟體和模型的需求持續增加、預期未來幾年新藥開發專案數量會明顯成長超過一成。但要注意的是,這些效率提升目前都還停留在「開發流程變快變便宜」這個階段,還沒有一款靠 AI 主導開發出來的藥物真正走完全程、拿到 FDA 核准上市,所以 AI 對病人實際治療結果的幫助,目前仍是未知數,不能直接畫等號。
Anthropic(做 Claude 這款 AI 的公司)內部一直在測試一個叫 Conway 的專案,它是一個「一直開著、不用你盯著就能自己做事」的 AI 代理人(agent,就是能自己執行任務的 AI 程式),今年春天首次曝光,可以操作 Claude Code(寫程式用的 AI 工具)、自己開瀏覽器、發通知,甚至能被外部事件「叫醒」去做事。Anthropic 最近在 Conway 介面上貼出通知,宣佈這個內測專案將在 7 月 24 日(週五)下午 5 點(美國太平洋時間)結束,並提醒測試者要在那之前把自己的資料匯出,方法是直接跟 Conway 說「export my data」。外界猜測有兩種可能:一是 Anthropic 決定不走「雲端容器代理人」這條路,把資源都押在已經在推的 Cowork(讓 Claude 在使用者自己電腦上當個人助理的產品)上,Conway 就此收攤;二是內測只是告一段落,準備擴大到 Max 訂閱用戶做更大規模的預覽,屆時 Conway 可能會變成大家都能用的雲端容器,讓使用者安裝外掛、交辦各種工作,還會搭配一個叫 UI tabs 的功能,讓使用者自訂並分享專屬的操作面板。
如果你是 Anthropic Max 方案的付費用戶,目前只能用 Claude 做「你問一句、它答一句」的互動;假如 Conway 真的走上「擴大預覽」這條路,未來你可能可以設定一個 webhook(當某個外部事件發生時自動觸發程式的機制,例如你的網站被下單、或某個檔案更新了),讓 Conway 在背景自動被叫醒去執行任務,比如「一有新的客服信件進來,就自動幫我整理重點並回覆」,不需要你手動開啟對話視窗盯著它做。這跟現在的 Claude 對話視窗必須你主動輸入才會動作、無法自己在背景待命處理事情,是完全不同的使用方式。
Google Cloud(Google 的雲端服務部門)宣佈投入7.5億美元,成立新基金來支持旗下12萬個合作夥伴開發「代理式AI」(agentic AI,就是能自己規劃步驟、呼叫工具去完成任務的AI,不只是單純回答問題)。這筆錢會用來補助合作夥伴做AI價值評估、打造原型、建置與部署AI代理,並派出Google自家的「前線部署工程師」(forward-deployed engineers,直接進駐客戶專案協助解決技術難題的工程師)。目前Google Cloud生態系已有超過33萬名受訓的技術專家,且在前20大SaaS(軟體服務)公司中有95%使用Gemini模型,前100大中則有超過80%使用。這次投資反映出雲端巨頭之間的競爭焦點,已從單純比拚模型能力,轉移到比拚誰能幫企業真正把AI落地應用的生態系與服務能力。
假設一家大型零售商想用AI自動處理供應鏈訂單異常,但公司內部沒有足夠的AI工程師能力,過去只能自己摸索或花高價請顧問從零打造。有了這筆基金,像埃森哲(Accenture)、勤業眾信(Deloitte)這樣的顧問夥伴,可以拿到Google提供的資金、Gemini模型的早期存取權、以及駐點工程師支援,直接在Google的「Gemini Enterprise Agent Platform」上用現成的框架快速組裝出客製化AI代理。舉例來說,勤業眾信已經累積超過1000個預建代理範本,可以針對零售商的情境微調後就上線,而不是從頭寫程式。差異在於:舊做法企業得自己承擔開發風險與時間成本,新做法是由Google出資、顧問出人力、平臺出工具三方協作,讓AI代理上線的時間從數月級縮短到可快速部署的規模。
這篇文章講的是「平臺工程」(就是幫工程師快速準備好開發、測試用的伺服器環境的團隊和工具)現在面臨新挑戰:以前是人類工程師申請環境,一天頂多幾次、可以等幾小時;現在換成AI寫程式代理(coding agent,能自己讀需求、寫程式碼、跑測試的AI)在申請環境,一個人一天可能同時開好幾個AI工作階段,每個階段都要求「幾秒內給我一個環境來驗證我剛寫的程式碼對不對」,而且用完馬上丟棄。文章引用數據說,GitHub上光是Copilot這個AI寫程式工具,五個月內就開了超過一百萬個PR(pull request,程式碼提交請求),顯示這種需求量不是空談。傳統做法要嘛是「每次申請都複製一整套系統」(太貴太慢,因為要複製四十幾個服務加資料庫),要嘛是「大家共用同一套測試環境排隊用」(會塞車,而且一個人的錯誤程式碼會搞壞別人的測試)。文章提出第三種架構:平常只維護一份「穩定版」系統,每次有人要驗證新程式碼時,只把「改動到的那幾個服務」臨時啟動、其餘部分都導流到共用的穩定版,這樣速度能壓到幾秒鐘、成本也接近零,同時還能保持每個請求互不幹擾。
假設一間公司的AI寫程式代理一天要處理幾百次「改一小段程式碼、跑測試看有沒有壞掉」的請求,每次改動的可能只是四十個服務裡的一兩個。用「整套複製」的舊做法,每次要花十幾分鐘複製一整套四十幾個服務加資料庫的系統,一小時電腦資源費要好幾塊美金,而且AI代理等不了十幾分鐘就會等到逾時;用「大家排隊共用一套」的做法,AI代理暴增的請求量會讓排隊時間長到失控,還可能被別人壞掉的程式碼汙染測試結果。文章介紹的做法(以Signadot這家公司的產品為例)則是:系統本身平常就有一份「持續從主分支部署的穩定版」在跑,AI代理申請驗證時,系統只額外啟動被改到的那一兩個服務,其餘流量照樣走穩定版,幾秒內就能開始測試、跑完立刻丟棄,公司不用為閒置的整套複製環境付錢,AI代理也能在自己的「寫程式碼→測試→看結果→修正」迴圈裡連續跑上百次而不被基礎設施卡住。
Oracle在自家的企業軟體系統(Oracle Fusion Applications,一套幫公司管財務、人資、供應鏈、客戶服務的雲端系統)裡,推出一個新的AI代理(AI agent,就是能自己執行任務、不只是聊天回答問題的AI程式)建構工具,讓客戶和合作夥伴可以直接在系統裡打造「Fusion Agentic Applications」(會自動執行企業工作的AI應用程式)。這些AI代理不是獨立運作的外掛小工具,而是直接內建在企業系統裡,能存取公司既有的財務資料、審批流程,並自動套用公司原本就有的權限管理和稽核紀錄(也就是誰在什麼時候改了什麼都會被記錄下來)。工具支援從完全不用寫程式(用自然語言描述需求)到專業工程師寫程式碼(可搭配VS Code、命令列工具,以及Codex、Claude Code等AI寫程式助手)等不同技術程度的使用者。Oracle也同步開了一個公開的GitHub程式碼庫,提供範本和參考架構,讓開發者更快上手打造這類企業AI應用。
假設一家公司想用AI自動處理「應收帳款催收」(提醒客戶付款、判斷哪些客戶需要優先追討)這件事。過去做法是找外部AI廠商打造一個獨立的自動化工具,再花額外工程時間把它接上公司的財務系統、設定好誰能看什麼資料、確保操作有紀錄可查——這個「接軌」過程往往比做AI本身還花時間,也是很多企業AI專案卡在半路的主因。用Oracle這個新工具,公司可以直接在Fusion Applications裡(AI代理已經看得到催收相關的帳務資料和工作流程)用自然語言描述「找出逾期30天以上且信用評分低的客戶,自動發送提醒並生成催收優先清單」,系統會自動套用公司原有的權限規則(例如只有財務部門能核准減免)與審批流程,且每一步操作都留下稽核紀錄,不需要另外寫串接程式或另外設計權限系統。
科技顧問公司Xebia推出一套叫Axis的平臺,用AI代理(AI agent,就是能自己執行多步驟任務、不用每步都靠人下指令的AI程式)來幫企業把雜亂的資料整理成AI可以直接使用的狀態。很多企業想導入AI,但資料分散在CRM(客戶關係管理系統)、Excel表格、Email、老舊系統裡,格式亂七八糟,這就是所謂的資料就緒度(data readiness,意思是資料乾不乾淨、能不能直接餵給AI用)問題。Xebia Axis號稱能把原本人工要做的資料盤點、遷移、上雲流程自動化,官方宣稱遷移速度最多可以快到3倍。這套平臺不綁定特定雲端或特定AI模型,可以搭配AWS、Google Cloud、Azure等雲端,以及Claude、OpenAI、Gemini、Mistral等多家LLM(大型語言模型,就是ChatGPT、Claude這類會理解和生成文字的AI)。
假設一家全球銀行原本有多套各自獨立、彼此不相通的詐騙偵測系統和信用評估系統,資料格式不一、散落各處,工程團隊光是搞清楚哪些資料在哪裡就要花很久。用傳統做法,人工盤點加上手動搬遷資料到新系統,往往要拖12到18個月,而且遷移過程中還要人工反覆核對資料有沒有搬對(parity check,就是確認新舊系統資料一致)。改用Xebia Axis後,平臺裡的Readiness模組會先自動掃描整個資料版圖,2到4週內就生出一份資料就緒度評分和遷移藍圖,接著Migration模組自動做資料和程式碼轉換、並自動做一致性檢查,Operations模組甚至能自己抓出問題根因、寫好修正的程式碼提交(以人工審核過的pull request形式),不用工程師從零手動改。官方案例提到,某全球航空公司用這套流程把原本12到18個月的遷移案子壓縮到只要幾個月;某全球銀行則透過類似做法把基礎設施成本降低30%到50%。差別在於:傳統做法幾乎全靠人力盤點加上緩慢的手動遷移,Xebia Axis則是讓AI代理自動跑掉大部分苦工,人只需要審核關鍵決策和最終修正。
美國波士頓公司BrainCo在2026世界人工智慧大會(WAIC,在上海舉辦的AI產業盛會)上,展示了一套讓人用「意念」操控機器人的系統。使用者戴上一頂輕便的腦電圖(EEG,一種貼在頭皮上偵測大腦電訊號的裝置)頭盔,AI演算法會把腦訊號解讀成使用者想做的動作,再轉換成機器人能執行的指令,整個過程不到200毫秒(也就是幾乎感覺不到延遲)。現場示範中,機器手臂靠著操作者「想」抓杯子、「想」拿蘋果,就完成了需要精細動作的任務。BrainCo同時也發表了一套「具身智能(Embodied AI,指讓AI控制的實體機器人在真實世界中行動)數據採集方案」,目的是解決訓練機器人做複雜動作(像摺衣服、組裝零件)時,高品質真實資料嚴重不足的產業痛點。
假設一家機器人公司想訓練機器手臂學會「抓取易碎物品」這種需要細膩力道控制的任務,傳統做法通常是靠人類操作員用搖桿或手把示範動作,再把動作資料餵給AI模型學習,但這種方式只記錄了「手做了什麼」,沒記錄「大腦當下在想什麼」,資料裡缺少意圖層面的資訊。BrainCo的方案是讓示範者戴上EEG頭盔和高精度手套,同時採集手部動作、機器人執行結果,以及操作者當下的腦波訊號,等於同時記下「大腦想要做什麼」和「手實際怎麼做」。這樣訓練出來的AI模型,理論上能更準確地把「意圖」拆解成一步步可執行的動作,而不只是模仿手部軌跡。這解決了機器人訓練資料,長期以來「量不夠、且資料裡看不到人類真正意圖」的老問題。
紐西蘭奧克蘭大學的研究者針對軟體工程師做了一項為期六個月的研究,觀察大家在使用AI寫程式助手(就是像Copilot、Claude Code這種能幫忙自動生成程式碼的工具)之後,感受上有什麼變化。結果發現一個矛盾現象:有84%的工程師持續覺得自己「產出變多、做事變快」,這個比例六個月來幾乎沒變,算是好消息。但另一方面,覺得自己「工作體驗變差」的人卻從14%一路增加到27%,而且一旦感覺變差,幾乎沒有人能再回到原本的好心情。研究用一套叫DevEx(開發者體驗)的框架來拆解「體驗」,分成三塊來看:回饋速度(多快知道自己寫得對不對)、腦力負擔(要花多少心力去想)、心流狀態(能不能專心投入、不被打斷)。結果發現回饋速度變快了(AI幾秒內就能給答案),但心流狀態大幅惡化(因為每次AI給答案,人都要停下來判斷『這段對不對、要不要改』,反而一直被打斷專注力),腦力負擔也小幅上升。研究者認為,這代表AI把『做出成果』和『做這件事本身帶來的成就感、投入感』給拆開了:工作量表面上看起來很漂亮,但底下工程師的心理疲乏正在累積,長期下來可能變成職業倦怠或離職潮。
假設一位資深工程師過去要花三天才能寫完一個複雜功能,現在用AI助手三小時就能生出堪用的程式碼初稿,看起來效率暴增十倍。但研究裡有工程師形容真實感受是:以前寫程式時能連續專注一兩個小時進入『心流』狀態解決一個難題,現在變成AI每隔幾秒就丟出一段建議,工程師得不斷停下來讀、判斷『這段對不對、要不要接受、要不要修改』,然後再繼續下指令——這種反覆切換注意力,讓人感覺自己一直在被打斷,即使整體工作速度變快了,卻再也感受不到過去那種深度投入、解決難題後的成就感。差別在於:舊做法是『慢但有掌控感和成就感』,新做法是『快但變成監督AI、不斷評估對錯的瑣碎工作』,產出量表增加了,但工程師自己形容像是把喜歡的部分交給機器,自己只剩下把關和背責任。
這篇文章的作者做了一個叫 Pizzo 的音樂編曲網頁應用,裡面內建了一個 AI 代理(agent,就是能主動幫你操作軟體、不只是聊天回話的 AI)。作者提出一個設計理念:AI 代理不該被放在「聊天框」裡、擋在使用者和應用程式中間,而應該和使用者一起、同時操作同一份文件(例如同一首歌、同一份試算表),就像兩隻手同時在捏同一團黏土。作者認為程式設計用的 AI 代理(例如能自動改程式碼、跑測試的工具)之所以做得比其他領域的 AI 產品好,是因為開發者給了它一整套「工作室」:檔案庫、可以執行程式的環境、讀寫工具;但音樂、試算表、繪圖這些非程式領域的 AI 產品,大多只是在既有軟體前面加一個問答框,沒有給 AI 對等的操作環境。作者也介紹了自己在做的 Project Think,是一套「無伺服器」(serverless,意思是不用整天開著一臺專屬伺服器等使用者上線,用多少算多少、閒置時自動休眠)的代理執行框架,目的是讓「每個人都能有自己的 AI 代理」這件事在成本上可行,而不是隻有開發者才用得起。
具體情境:我在用 Pizzo 編一首歌,手上正抓著速度滑桿調整節奏,同時我開口跟 AI 代理說「把和絃改得更有夢幻感、調到 D 調」,代理不會生成一個新的音樂 App 或丟一段程式碼給我下載,而是直接對我正在編輯的同一份歌曲檔案下指令,呼叫像 transpose(2)(把整首歌移調兩個半音)這種寫死、可測試的固定函式來改和絃,改完後我還能用手繼續調整其他地方。傳統做法則是:AI 生成一段全新結果丟回聊天視窗,我得自己複製貼上、或整個對話紀錄變成唯一的真相來源,一旦要修改就得整段重新生成,狀態散落在對話紀錄裡難以追蹤。差別在於:Pizzo 讓「歌曲本身」保持唯一狀態來源,AI 只是眾多操作介面之一(滑鈕、鍵盤、AI 代理都能改同一份資料),而不是把對話紀錄當成資料庫。
這篇文章的作者是一位資深工程主管,他探討當AI寫程式碼(也就是用AI自動產生軟體原始碼,取代部分人工敲鍵盤的工作)讓「寫程式」這件事變得非常便宜之後,傳統的工程團隊管理規則有哪些還適用、哪些已經過時。他指出像「衝刺速度(velocity,一種衡量團隊工作量的指標)」「PR(pull request,工程師提交程式碼修改的申請)數量」這類舊有績效指標,過去之所以堪用,是因為寫程式碼本身很稀缺、很花時間,現在AI把寫程式碼變便宜了,這些指標反而會被用來灌水,變成誤導管理者的假象。他把「正確性檢查」拆成兩種:一種是機器可驗證的(像型別檢查、單元測試、程式碼規範),這類AI已經能做得比人類審查員又快又好;另一種是「語意正確性」,也就是這段程式碼是否真的符合公司業務需求、法規要求,這種判斷仍要靠人類,因為負責審查的AI和寫程式的AI共用同樣的訓練資料和盲點,容易犯一樣的錯誤卻互相看不出來。他最後總結,隨著AI把「產出」變得便宜,未來組織裡真正稀缺、有價值的不再是「誰生產得多」,而是「誰願意為結果簽字負責」,管理職的角色也將從指揮產出轉為審核與承擔責任。
假設一個工程團隊要求AI幫忙寫一個新的付款功能程式碼。照文章的建議做法,團隊會先把這段程式碼丟給自動化流程做「機器可檢查」的驗證,例如跑型別檢查、單元測試、程式碼規範檢查,如果測試沒過,AI會自己讀錯誤訊息、修改程式碼、再跑一次測試,這個過程比人類工程師手動除錯快很多,因為機器判斷「對不對」的標準(像測試案例、型別規則)早就被寫成程式可以讀懂的規格。但這段付款程式碼是否真的符合公司的退款政策、有沒有踩到金融法規的紅線,這種問題AI自己判斷不出來,因為負責審查的AI跟寫程式的AI用的是同一套訓練知識,容易犯一樣的盲點而互相看不出破綻,所以這一步仍需要一位資深工程師親自看過、簽字確認才能上線。對比舊做法:過去團隊靠人工逐行審查全部程式碼、耗時又容易漏看瑣碎錯誤;新做法是把瑣碎、有明確對錯標準的檢查交給AI自動跑,把人力集中在少數真正需要判斷「這樣做到底對不對」的關鍵決策上,省下的是重複的機械審查時間,省不下的是要有人為結果負責這件事。
這篇文章講的是最近 AI 開發圈瘋傳的一個新詞「圖形工程」(graph engineering),還有它怎麼在短短幾天內取代了另一個才火紅六週的詞「迴圈工程」(loop engineering,指讓 AI 代理人〔agent,就是能自己規劃、執行、檢查工作的 AI 程式〕不斷『做事、檢查、再做』繞圈子直到任務完成的做法)。當任務變複雜、需要好幾個步驟平行進行、或需要不同工具互相搭配時,光靠一個迴圈不夠,開發者得規劃整個『圖』——由節點(一個動作或決策)、邊(下一步要做什麼)、狀態(保留下來要傳給下一步的資訊)組成的架構,這就是圖形工程。文章也踢爆了一個在網路上瘋傳的說法:說微軟、史丹佛、Anthropic 三家公司都改用圖形工程取代 RAG(Retrieval-Augmented Generation,讓 AI 回答前先查資料庫再作答、避免亂編答案的技術),還聲稱準確率提升 18%、成本降低 85%。作者查證後發現這個數字其實只來自一篇針對『工業工程圖』這種很窄應用場景的論文,並不是普遍現象,微軟、史丹佛、Anthropic 三者實際做的事情也完全不同,卻被硬湊在一起說成同一件事。文章提醒讀者,多數 AI 代理人任務其實不需要搞複雜的圖形架構,一個模型加一個工具迴圈加一個好的停止條件就夠用了,只有當任務真的需要平行處理、獨立驗證、或人工核准時才值得加上圖形框架。
假設你在做一個自動幫使用者訂機票的 AI 代理人,簡單版做法是寫一個迴圈:找航班→訂位→檢查是否訂成功→沒成功就重試,直到完成。但如果任務變成『比價三家網站、其中兩家要平行查、查完由另一個 AI 覆核比價結果有沒有算錯、最後金額超過某門檻要真人核准才能付款』,這就不是單一迴圈能處理的了,需要把『查價 A』『查價 B』『覆核』『真人核准』畫成一張圖,決定每個節點做什麼、什麼條件下走到哪個下一步、以及查到的價格資訊(狀態)要怎麼傳到下一步。文章舉 Anthropic 的 Claude Code 為例:它讓 Claude 自己寫一段 JavaScript 程式碼去協調多個平行執行的子代理人,因為流程已經寫死在程式碼裡,AI 就不用每一步都重新想『接下來要幹嘛』,省下大量重複思考所耗費的資源(token,AI 處理文字的計費單位)。這跟網路上瘋傳『圖形工程讓準確率提升 18%、成本降低 85%』的說法不一樣,那個數字其實只適用於工業工程圖辨識這個很窄的場景,不能直接套用到所有 AI 代理人任務上。
TRMNL據稱是一家做電子紙(e-ink,就是像電子書閱讀器那種省電、不會反光的小螢幕)顯示裝置的公司,他們推出一個新功能叫Agent(AI代理,也就是能自己動手做事的AI助手),使用者只要用一句話描述需求,例如「幫我做一個顯示全世界人口數的外掛」,AI就會自動寫程式碼、生成能在裝置上顯示的外掛(plugin,一種可以另外安裝、擴充功能用的小程式)。這個功能目前是公開測試版(beta),使用者需要自備OpenRouter(一個能用一個帳號呼叫多家AI模型的服務平臺)或Anthropic的API金鑰(API Key,用來付費呼叫AI模型的授權碼)才能使用,官方也提供進階的MCP(一種讓AI工具直接連接、操作外部服務的協定)伺服器選項給想在本機開發的使用者用。這則新聞在Hacker News(一個以科技從業者為主的討論網站)上屬於一則產品功能公告,而非重大技術突破。
假設你有一臺TRMNL的電子紙顯示器,想要一個能顯示meh.com(一個賣特價商品的網站)每日特價商品的小工具,但你完全不會寫程式。過去你得自己學怎麼呼叫meh.com的資料、自己排版畫面。現在你只要在TRMNL的外掛編輯畫面打一句話「幫我做一個顯示meh.com每日特價的外掛」,AI代理會自動理解需求、寫出畫面標記語言(markup)、串接meh.com的資料介面,如果需要金鑰它還會主動提醒你去申請。官方案例顯示,加上後續要求把商品圖片也顯示出來,整個外掛做完只花了兩三分鐘、成本約2.2美元。這跟過去「找工程師或自己學程式」的做法差異在於:使用者完全不用寫一行程式碼,只靠對話描述需求就能得到一個能用的產品外掛。
有一群工程師在做一個叫 Pareto 的開源專案,目的是幫機器人研發團隊管理訓練資料。機器人團隊會上傳「LeRobot」格式的資料集(就是機器人示範動作的紀錄檔),裡面同時包含好幾個攝影機畫面、機器手臂的關節角度、施力數值、時間戳記等各種同步資訊,不只是單純一支影片。作者發現,這個系統要解決的問題其實跟YouTube很像:都要處理大檔案上傳、背景轉檔、產生縮圖預覽、建立搜尋索引、以及讓使用者不用下載整個檔案就能線上瀏覽(也就是「串流」)。文章詳細說明他們如何用可續傳上傳、Temporal(一套幫忙管理長時間背景工作、失敗自動重試的工具)分散處理任務、把檔案原始資料、資料庫metadata(描述資料的資料,例如檔名、時間、標籤)、搜尋索引(LanceDB,一種存放AI向量、方便語意搜尋的資料庫)分開存放,以及只傳輸使用者實際要看的那段畫面而非整包檔案。
假設一個機器人研發團隊想找出所有「機器手臂夾取橘色方塊」的示範資料,用來訓練下一版動作模型。傳統做法可能要工程師手動翻找上千支影片檔案,一支支看內容標記。用Pareto的話,使用者直接在網頁輸入文字「orange block」搜尋,系統會把這句話轉成向量(一種讓電腦理解語意相似度的數字表示),去LanceDB資料庫比對出符合的機器人示範片段,使用者可以直接在網頁上同時看多支攝影機畫面、拖動時間軸比對機器手臂當下的關節角度和施力數據,決定這段示範夠不夠格放進訓練集。整個過程不需要下載整份資料集,跟YouTube使用者輸入關鍵字就能找到影片、邊看邊拖進度條的體驗一樣,流程大幅簡化。
蘋果的「Private Cloud Compute」(簡稱 PCC,是蘋果設計的一套雲端運算系統,同時號稱能保護使用者隱私)最近公佈了最新一份 SOC 3 稽核報告。SOC 3 是由美國會計師公會(AICPA,一個專門制定會計與稽核準則的組織)主導的一種獨立稽核報告,簡單說就是找外部審計單位來檢查一家公司「說到有沒有做到」,這次審查的重點是 PCC 系統在安全性、數據處理完整性、機密性等方面的控管機制是否真的有效運作。蘋果每季都會發布一次這種報告,這次涵蓋到 2026 年 4 月底為止的檢查期間。不過報告裡特別聲明,這次審查完全不涉及蘋果 AI 服務本身「答得準不準、效果好不好」,稽核師只針對背後雲端基礎設施的資安控管把關,不對 AI 表現發表任何意見。
假設你是一位資安研究員或企業IT主管,想確認蘋果PCC雲端基礎設施是否確實經過第三方稽核,而不是隻憑蘋果自己的宣傳。這時可以直接到蘋果官方認證頁面下載這份 SOC 3 報告 PDF,查閱獨立審計機構在 2026 年 4 月底前的檢查期間所給出的審計結論。有了這份報告,第三方稽核的白紙黑字讓「蘋果雲端AI基礎設施是否真的安全」這件事有了可查證的依據,只是這份保證仍僅限於資安控管本身,不代表AI回答的品質或正確性也被驗證過。
有一位開發者在 Hacker News 上發表了自己做的新工具,叫做 DocCharm。它是用來解決一個很多公司都有的煩惱:產品功能一直在改版,但客服說明文件(help center,就是網站上教你怎麼用產品的那些說明頁面)常常沒跟著更新,時間久了說明文件跟實際產品對不上。DocCharm 的做法是自動盯著公司在 GitHub(工程師存放程式碼、記錄每次修改的平臺)上提交的程式碼變更(PR,也就是「這次改了什麼」的紀錄),然後用 AI 判斷這次改動是不是該連帶更新說明文件,並且自動生成建議的修改內容,或者在完全沒有對應文章時直接生成新的草稿。所有 AI 生成的內容都不會直接發布,會先進入一個審核清單,一定要有人看過(也可以順手編輯)才會正式上線,避免 AI 亂寫的內容直接曝光給客戶看。目前已支援自動匯入 Zendesk 和 Mintlify 這兩家常見的說明文件平臺的既有內容,也能套用公司自己的品牌風格。作者表示自己已經在本業公司內部使用一段時間,省下不少時間,也開始有同一投資方旗下的其他公司在使用,但目前推廣方式主要靠自己一對一接觸客戶,還沒有大規模銷售。
假設一間 SaaS 公司的工程師這週把「匯出報表」功能從只能匯出 CSV 改成同時支援 CSV 和 Excel 兩種格式,過去的做法是工程師改完程式碼就結案,沒人記得去客服說明文件那頁補一句「現在也能匯出 Excel 了」,於是使用者照著舊的說明文件操作,找不到 Excel 選項就以為產品沒這功能,跑去客服抱怨。裝上 DocCharm 之後,這次程式碼改動一提交到 GitHub,DocCharm 就會自動偵測到「匯出報表」相關的程式碼有變化,用 AI 對照現有的說明文章草擬一段新增內容(例如在原本的匯出教學文章裡加一段「如何匯出 Excel 檔」),放進審核清單讓客服或產品負責人看一眼、確認沒寫錯就按下發布,整個過程不需要工程師額外花時間手動去改文件,也不會漏掉更新。
在2026世界人工智慧大會上,由上海儀電智算牽頭,聯合GPU晶片、伺服器整機、大模型、軟體等23家上下游廠商(包括階躍星辰、稀宇科技、寒武紀、浪潮集團、中興通訊等),成立了一個叫「智算系統架構聯盟」的產業組織。這個聯盟的目的是讓做AI運算基礎設施(也就是訓練和跑AI模型要用到的伺服器機房設備)的廠商,有一套大家都遵守的共同規格,不用各做各的、互相不相容。聯盟同時發布了第一份成果,叫《超節點系統架構規範》,「超節點」可以理解成把很多臺伺服器機櫃透過高速線路連接起來、當成一臺巨型電腦來用的架構。規範分成硬體和軟體兩部分:硬體規定了節點尺寸統一、採用冷板式液冷整機櫃,電力/散熱液/網路線要能像插頭一樣快速插拔更換(即電/液/網三總線盲插);軟體規定了叢集管理、資料儲存讀取、安全驗證等要遵守的做法。簡單說,這是中國大陸產業界想替AI運算機房「訂規格」,讓不同廠商的晶片、整機、軟體能互相搭配使用。
假設某家AI雲端服務商要蓋一座新的AI訓練機房,過去的做法是:機櫃尺寸、散熱方式、電力介面都由自己選的整機廠商決定,等哪天想換一家GPU晶片供應商、或加購其他廠牌的伺服器機櫃,常常會發現尺寸不合、線路介面不相容,得整批重做。有了這份《超節點系統架構規範》之後,只要是聯盟裡23家廠商生產、遵照規範做的機櫃、GPU晶片、液冷系統、叢集管理軟體,理論上可以互相插拔搭配(規範裡講的「電、液、網三總線盲插」),機房營運商就能像組裝樂高一樣,向不同廠商採購符合規範的零件湊成一套完整機房,不必被單一供應商綁死,也能加快後續擴充、維修的速度。目前這仍是剛發布的1.0版規範和剛成立的聯盟,實際能否被廣泛採用還要看後續各廠商配合實作的狀況。
上海市教委和市經濟信息化委指導,由上海儀電牽頭,聯合上海電信、上海移動、上海聯通協同共建的「上海市教育算力專區」,在2026世界人工智慧大會上正式開啟試運行。這是一個專門給全市中小學和大學使用的普惠性雲端運算資源池(算力,就是跑AI模型需要的電腦運算能力,通常要花錢租用伺服器才能用)。平臺把上海儀電自己的伺服器和三大電信商的運算資源整合起來,統一分配給學校使用,讓學校不用自己花錢建置設備、也不用自己去外面找雲端服務商。平臺上已經預先裝好了DeepSeek、GLM、MiniMax等十幾個中國主流的大型語言模型(LLM,就是ChatGPT這類會對話、能寫作業、能做研究的AI),學校可以直接拿來用在教學和科研上,不需要自己安裝設定。官方公佈的效能數字包括:首Token時延控制在800毫秒以內,調用成功率達99%以上,服務可用性99.9%。
假設上海某所高中想開一門「AI程式設計」選修課,過去老師想讓學生實際操作大型語言模型做實驗,得自己去找雲端服務商申請帳號、付費購買運算額度,學校經費有限、申請流程也繁瑣,很多學校因此根本不敢開這類課程。現在有了這個教育算力專區,學校只要透過統一入口登入,就能直接呼叫平臺上已經裝好的DeepSeek、GLM等模型,讓學生做AI對話、文字生成之類的實作練習,大幅降低了學校導入AI教學的技術門檻和資源取得難度。
上海儀電在2026世界人工智慧大會(WAIC,一場在上海舉辦的AI產業大展)上,發表了自家「儀電智算雲YiCloud」(一套提供算力、模型、應用場景一條龍服務的雲端平臺)在金融、製造、醫療三個「國家人工智慧應用中試基地」(政府支持的AI技術落地實驗場,讓企業把AI技術從實驗室搬進真實產業測試)的應用成果。這篇內容主要在講一家公司的產品成績單,性質偏向企業公關稿,但裡面附了一些具體數字可以參考。整體上是講AI基礎建設(算力平臺)如何支撐金融風控、工廠自動化、醫療輔助診斷這三個領域的實際落地案例。
在金融領域,儀電智算雲替中國銀聯(負責銀行卡清算的機構)與17家機構共同打造的百億級金融語料庫和50萬條微調(fine-tuning,就是拿特定領域資料再訓練模型讓它更懂該行業)資料提供算力,訓練出的金融垂直模型讓「幻覺率」(AI胡說八道、講錯事實的機率)降低30%,安全合規能力提升25%,處理複雜任務的成功率超過85%;實際應用上協助攔截超過2億元的可疑交易。在製造領域,上海電氣用這套平臺部署了51個工廠用的AI智能體(能自主執行任務的AI程式),把工藝設計週期從「以月計」壓縮到「以週計」,訂單準時交付率做到100%,並用AI監控60萬臺電梯的合規運作、讓風電設備故障停機率降低20%。在醫療領域,復旦大學附屬中山醫院用這套平臺已有51項AI應用進入中試推廣階段,其中包含一個叫「觀心」的心血管疾病輔助診斷智能體。對比沒有這套整合平臺之前,企業要各自建算力、各自訓練模型、各自對接場景,這篇宣稱透過「算力+模型+場景」一體化服務,把落地的流程和時間都大幅縮短了,不過具體省了多少時間、成本並未提供對照數字。
新創公司Infinity宣佈獲得1500萬美元融資(由Touring Capital領投,OpenAI與Anthropic的研究員也以個人身分投資),公司要做的事情是幫「非CUDA」晶片跑AI推理(inference,也就是AI模型訓練好之後,實際拿來回答問題、生成內容的運算過程)時能更有效率。CUDA是NVIDIA(輝達)自家的晶片運算軟體層,目前幾乎是AI晶片界的標準配備,但其他晶片廠(例如新創d-Matrix的Corsair晶片)沒有這套現成工具,跑起AI模型效率就差一截。Infinity打造的是「AI寫AI工具」的自動化系統,包括agentic profiler(用AI自動分析程式哪裡跑得慢的工具)、AI compiler(把程式碼轉換成晶片看得懂的機器指令的編譯器)、晶片模擬器,讓這些工具自動生成、優化適合特定非CUDA晶片的推理程式碼堆疊。公司表示他們用這套自動化流程產生的推理程式碼,在Qwen3這款開源模型的測試中效能超越了vLLM(目前業界常用、主要針對NVIDIA GPU優化的開源推理加速框架)。
假設某家晶片公司(如d-Matrix)做出一款新的AI晶片Corsair,想拿來跑Qwen3這種大型語言模型做推理,但因為不是NVIDIA的GPU、沒有CUDA可用,工程師得自己手動寫底層優化程式碼,耗時又容易寫得不夠快。用Infinity的做法,是讓AI agent自動掃描程式執行狀況找出效能瓶頸(profiling)、自動生成並編譯出針對Corsair這顆晶片量身打造的推理程式碼,全程不需要工程師手動調校底層指令。Infinity宣稱這樣自動生成出來的程式碼堆疊,在Qwen3模型的測試中比目前業界常用、主要為NVIDIA GPU優化的vLLM框架跑得更快。差別在於:傳統做法要靠人力針對每種新晶片手動寫優化程式碼,曠日費時;Infinity的方法是讓AI自己生成、自己優化,理論上能讓任何NVIDIA以外的晶片都快速追上CUDA生態系的效能水準。
Anthropic(開發 Claude 這款 AI 聊天機器人的公司)宣佈把 Claude 的「Team 方案」(給公司團隊用的付費訂閱方案)最低訂購人數從原本的 5 人降到只要 2 人就能訂。這代表小型團隊或小公司也能用團隊方案,不用像以前一樣得湊到 5 個人才划算。這個方案還附帶一些企業會需要的功能,例如團隊共用的專案空間、集中管理的帳單、SSO(單一登入,就是員工用一組帳密就能登入公司所有系統,不用每個工具都重設密碼)、以及「企業搜尋」(可以跨團隊使用的多個工具一次搜尋資料)。整體來說這是一個降低採用門檻的商業調整,讓更多小團隊願意付費使用 Claude 的進階功能。
假設你和另一位同事開了一間 2 人的小工作室,想用 Claude 協作寫程式或整理客戶資料,但過去公司方案規定至少要 5 個帳號才能訂閱 Team 方案,等於你們得多付 3 個用不到的名額,劃不來,只能兩人各自用個人版、資料和專案都不能共用。現在門檻降到 2 人,你們兩人就能直接訂 Team 方案,開始使用共用專案(兩人可以在同一個專案裡累積對話紀錄和上傳的文件)、集中管理的帳單(一張發票搞定,不用各自報帳),還能設定 SSO 統一登入。差異在於:以前小團隊要嘛多付冤枉錢、要嘛只能用陽春的個人版;現在 2 人小團隊就能以合理成本用到完整的團隊協作功能。
Claude Code(Anthropic 出的一款讓 AI 直接在終端機裡幫你寫程式、改程式的工具)新增了一個「螢幕報讀模式」。所謂螢幕報讀軟體(screen reader,例如 VoiceOver、NVDA)是視障或弱視使用者常用的輔助工具,會把螢幕上的文字唸出來或轉成點字,讓看不到畫面的人也能操作電腦。過去 Claude Code 的介面可能對螢幕報讀軟體不夠友善,這次更新後,只要在啟動指令加上一個參數,介面就會切換成一行一行、循序輸出的純文字格式,並且幫每一行標好用途、選單改成數字編號、有通知時還會發出提示音,讓螢幕報讀軟體能順利唸出來、使用者也能用數字選擇選項。
假設有一位視障工程師想用 Claude Code 幫忙寫程式,但原本的終端機介面可能因為動態顯示而讓螢幕報讀軟體難以順暢解讀,導致操作困難。有了這次更新後,他只要在啟動 Claude Code 時多打一個參數(--ax-screen-reader),介面就會變成一行一行、不重疊、有標籤的純文字輸出,螢幕報讀軟體就能照順序完整唸出,遇到需要注意的通知時還會發出提示音提醒。
Google的Gemma團隊在社群發文,介紹開發者現在可以用Gemma 4 31B模型搭配Cerebras和Hugging Face提供的技術,打造反應極快的語音AI系統。這套做法採用「cascaded speech-to-speech」架構(就是把語音轉文字、文字讓AI理解回覆、再把回覆轉回語音,分成好幾個步驟依序處理的語音對話流程),而且整套都是開源的,代表任何開發者都能免費取用、自行架設。目的是解決語音助理常見的「等待感」問題,讓AI語音對話更接近即時、自然的交談體驗。
假設我想做一個語音客服機器人,使用者講話後AI要能快速聽懂並用語音回覆,過去若用一般雲端語音AI服務,常常會有明顯延遲,使用者講完話要等好一陣子才聽到回覆,體驗生硬。改用這套方案的話,開發者可以把Gemma 4 31B(負責理解語意、生成回覆內容)接到Cerebras的高速運算晶片上跑推論,這樣AI「想」回覆內容的時間大幅縮短,再串接語音辨識與語音合成模組組成完整的語音對話管線。超快推理速度來自Gemma 4 31B在Cerebras專用硬體上運行,整套cascaded speech-to-speech棧是開源的,可從Hugging Face取用,推理加速則結合Cerebras的硬體。差別在於:舊做法要嘛延遲明顯、要嘛付費用商用低延遲語音API;新做法用開源模型加專用加速晶片,就能自己架出低延遲的語音助理雛形。
Cognition是一家做AI寫程式代理(agent,就是能自己動手完成任務的AI程式)的公司,旗下產品叫Devin,是一個會自動幫忙寫程式、修bug的AI工程師。這次Cognition收購了一家名叫TierZero的新創團隊,創辦人是Anhang和Yun,他們專門研究軟體上線後的維運自動化,例如系統出包(incident,就是系統當機或出錯的緊急狀況)時要怎麼快速抓到問題、不讓它擴大影響。Cognition打算把TierZero這套處理系統事故的自動化技術整合進Devin裡。目的是讓工程師以後不用花那麼多時間盯著系統救火,可以把時間拿去做真正的開發工作。
假設一家公司的網站在半夜突然回應變慢,過去做法是值班工程師被手機叫醒、登入系統慢慢查log(紀錄檔)、找出是哪個服務出問題,可能花上一兩小時才排除。TierZero的技術被整合進Devin後,Devin這類AI代理可以在事故剛發生、還沒擴大之前就自動偵測到異常、比對過去類似事件的處理方式,甚至直接執行修復或先做初步隔離,讓工程師隔天上班時看到的是「已處理」的報告,而不是半夜被叫醒手動排查。差異在於:以前維運救火要人力盯著、反應慢;併購後Devin能把這塊自動化,工程師省下的時間可以拿去開發新功能。
這篇文章建議,使用AI agent(就是能自己執行多步驟任務、像個助理一樣幫你做事的AI工具)做事時,應該讓AI在每次工作結束後,寫一段簡短的活動日誌,記錄它做了什麼、做了哪些關鍵決定與背後理由、犯了什麼錯誤、還有哪些後續待辦事項。作者說這種日誌用純文字檔(markdown,就是一種簡單的純文字格式,方便電腦與人都能讀)存起來即可,每篇大約只要30秒就能讀完,沒什麼進展的工作時段可以直接跳過不寫。她認為這個習慣能讓原本「看不見」的AI工作過程變得容易檢視、容易改進,也能幫助使用者更有效地把工作交給AI處理,並保留過程中的脈絡,養成更好的AI使用習慣。
作者舉了一個實際案例:她請AI幫忙修復一個WordPress網站的標題問題。AI在診斷過程中,先嘗試了兩個不同的API端點(就是程式對外提供資料存取的介面)都沒成功,後來才去查閱參考文件,最終決定改用「site-hosted端點」而不是「public-api端點」來解決問題。因為有這篇工作日誌,作者事後才能清楚知道AI繞了哪些彎路、做了什麼關鍵選擇。她也發現,靠著日誌回顧一整週的AI工作紀錄,可以直接請AI依此生成週報草稿,省去自己從頭回想並撰寫的時間;長期累積下來,這些日誌還能成為年度考核或職涯成長的具體憑據,而不是像以前那樣,AI做了一堆事卻完全沒有留下任何痕跡可供檢視。
這是Hacker News(一個給工程師分享作品和討論科技的論壇)上的一則「Show HN」分享文,作者展示自己做的一款太空經濟模擬器(SIM,就是模擬現實運作的軟體,這裡模擬的是星際貿易、船隻運補等經濟活動)。整個專案是作者和Claude(一款AI聊天機器人,也能幫忙寫程式)搭檔開發完成的,作者表示如果沒有Claude幫忙,他沒有足夠的時間精力做到現在這個程度。這則新聞的重點不是模擬器本身有多厲害,而是展示一般開發者如何用AI輔助程式設計(AI pair programming,就是讓AI當寫程式的搭檔,你講需求它幫你寫或改程式碼)獨立完成一個原本需要團隊才能做的複雜專案。這篇貼文目前只有18個讚和2則留言,關注度不高,屬於社群裡的小型分享。
作者原本想做一個「數百艘太空船各自有AI大腦、自己決定要不要接運貨合約、要不要進廠維修、什麼時候該回港讓船員休息」的複雜經濟模擬系統,一開始用Elixir/Phoenix這套程式語言和框架寫原型,但發現在Windows遊戲電腦上跑不順(技術上是背後的BEAM排程器效能不佳)。於是他請Claude把整個模擬引擎重寫成Rust語言(一種執行效率更高的程式語言),並用Bevy這套遊戲引擎做畫面呈現。結果是:模擬核心跑得又快又穩,目前能同時模擬近500艘船、每次運算約10到20毫秒,作者的目標是衝到10萬艘船的規模。差異在於:如果沒有Claude幫忙做語言重寫和架構調整,作者自己一個人很難有時間把整套系統從Elixir搬到Rust還維持能動、能擴充的狀態,這正是AI輔助程式設計讓個人開發者能做出過去需要團隊才能完成的專案的具體例子。