Anthropic(開發 Claude 這款 AI 模型的公司)官方研究部落格宣佈,一個尚未對外發布的研究版 Claude,在嘗試挑戰數學史上最著名的未解難題之一「黎曼猜想」(Riemann hypothesis,這是一個從1859年就存在、懸賞百萬美元、至今無人證明或證偽的數論難題,牽涉質數在數線上的分佈規律)時,雖然沒能解出這個終極難題,卻意外在一個相關的子問題上刷新了紀錄:把「黎曼 zeta 函數的零點中,滿足黎曼猜想的比例」這個下界數字,從過去數十年學界累積出的41.6%,一口氣提高到67.2%。這個結果已由Anthropic內部兩位數學家驗證,並經外部數論專家審閱,Claude還自己產出了一份可供電腦形式化驗證(也就是用嚴謹邏輯工具再三確認證明沒有邏輯漏洞)的證明。Anthropic強調,這不代表AI離證明黎曼猜想更近,但它展現了AI模型在數學研究能力上的進步速度,是一個值得留意的指標性案例。
Anthropic員工Jarred Sumner(本身不是數學家) — 他只是簡單提示Claude「認真挑戰一下黎曼猜想」,之後把所有數學上的判斷和方向完全交給模型自己決定,過程中他大多隻傳送「繼續加油」「相信自己」這類鼓勵訊息,沒有給任何專業指導。結果:Claude第一輪嘗試產生並測試了650個想法,全部失敗;在Jarred鼓勵下再試一次,這次Claude花了一天半時間,協調約60個Claude子代理(subagent,也就是同時分工合作的多個AI副本)一起運算,彼此之間合計執行了2400次指令、寫了數百支Python程式,對已知的zeta函數零點做了數千次數值驗證,並互相審查彼此的工作,最終才在原本目標之外意外做出突破。怎麼做:整個過程是在Claude Code環境中進行,橫跨兩次工作階段,總共用掉3100萬個輸出token(AI生成文字的計量單位) Anthropic內部兩位數學家Levent Alpöge與Ralph Furman,以及外部專家Brian Conrey、Dan Goldston — 審查Claude寫出的證明論文,確認其中的數學推導是否正確、是否與既有文獻重複。結果:確認Claude的結果是新的、有效的,並協助整理出一份給專家看的簡潔說明;同時另一位員工Eric Easley與Claude合作,把證明轉換成Lean(一種電腦形式化證明語言)版本,通過了標準驗證工具的檢查 Claude自己(在完成推導後) — 主動要求對自己的成果做把關:派出多個子代理重新審查證明、尋找反例、下載54篇arXiv論文比對確認這個結果不是別人已經發表過的,並且從零開始獨立重新證明一次同樣的結論。結果:確認結果站得住腳後,Claude還主動建議應該找真人數論學家來驗證,最終促成論文與正式驗證流程
加拿大媒體 The Walrus 發表深度報導指出,AI(就是像 ChatGPT 這種能自動讀懂並回答問題的人工智慧系統)正在大量提取人類累積數十年的網路知識,卻沒有人認真問過:內容被 AI 拿走、摘要、重述之後,原始網頁和作者還剩下什麼?報導提到,FiveThirtyEight 的消失是企業意志的展現;維基百科(Wikipedia,全球最大的免費線上百科全書)人類訪客流量年減 8%,因為使用者直接在搜尋結果頁看到 AI 生成的答案摘要,不必點進原始網站;同時 AI 爬蟲(robot,自動爬取網頁內容的程式,通常用來蒐集資料餵給 AI 訓練或即時查詢)卻佔掉維基百科最耗資源流量的 65%。報導認為這不是慢慢的衰退,而是系統性的「數位記憶清洗」——網站為了擋掉 AI 爬蟲而封鎖存取,結果連帶把 Internet Archive(負責長期保存網路歷史頁面的非營利檔案館,俗稱 Wayback Machine)和學術研究工具一起擋在外面,形成兩難。報導也提到 Reddit 上出現企業刻意植入內容、企圖汙染 AI 訓練資料與搜尋答案的現象,讓存檔本身從源頭就帶有偏見。
Disney — 將旗下資料新聞網站 FiveThirtyEight 的網域重新導向到其他頁面,等於讓網站消失。結果:三萬八千五百餘篇存檔文章從網路上蒸發,創辦人 Nate Silver 估計代表超過 20 萬小時的新聞工作被抹去;他主動提出出資購買存檔遭 Disney 拒絕 維基媒體基金會(Wikimedia Foundation,維基百科的營運組織) — 因為人類訪客流量在 2025 年年減 8%(因 AI 直接在搜尋頁顯示答案摘要),而 AI 爬蟲卻佔去維基百科 65% 最耗資源的流量。結果:2025 年 11 月正式要求 AI 公司停止免費抓取維基百科資料,改為透過官方付費 API(Wikimedia Enterprise API)存取 Cloudflare(全球主要的網路基礎設施與資安服務公司) — 推出付費授權的 AI 爬蟲存取模式,讓網站可以要求 AI 公司付費才能抓取內容。結果:把過去『開放免費抓取』的網路慣例轉變成用金錢決定存取權的商業模式,被報導視為開放網路規範終結的訊號 德國法院 — 審理一起關於 Google AI 搜尋摘要產生錯誤資訊(例如給出錯誤的日落時間)的案件。結果:裁定 Google 應為其 AI 生成的錯誤陳述負責,這是首次有法律嘗試要求 AI 中介者對答案準確性負責 法國政府與歐盟委員會 — 法國採用 Qwant 作為政府搜尋引擎、強制公務員使用 Tchap 訊息應用程式;歐盟委員會加入 W Social 獨立社交平臺。結果:開始把資訊基礎設施當作國家主權議題處理,而非單純交給市場上的美國 AI 公司
這則消息來自開源專案 Orca(由 Y Combinator 支持的新創 Lovecast Inc. 打造),是一款開放原始碼的 ADE(Agent Development Environment,意思是「專為 AI 代理工作流設計的開發環境」,就像 VS Code 是為人類工程師設計的 IDE 一樣)。傳統的程式編輯器(像 VS Code、Cursor)是假設一次只有一個人在寫程式;當 AI Agent 的能力已經足夠,真正的瓶頸變成「怎麼同時讓多個 Agent 並行工作而不互相干擾」。Orca 的做法是幫每個 Agent 分配一個獨立的 git worktree(可以想成同一份程式碼的獨立分身副本),讓每個 Agent 在自己的空間裡跑,互不幹擾,等任務做完,使用者再挑出最好的結果合併回主專案。這個專案採 MIT 授權(完全免費、可自由修改使用),發布不到五個月就在 GitHub 上累積了 42,790 顆星星,顯示開發者社群對這類工具的高度興趣。
X 用戶 @nalin(據其貼文,可能是 Orca 使用者) — 用 Orca 把工作跨功能、跨專案拆成多個並行任務,交給不同 Agent 同時處理。結果:認為 Orca 是目前跟 AI Agent 協作最好的方式,用過後就回不去舊的單線程開發方式了 Hacker News 用戶 @jvican — 拿 Orca 和另一款類似工具 Omnigent 比較,兩者都屬於「Agent IDE」這種新品類,使用者丟任務進去、其餘交給系統處理。結果:實際用 Orca 跑了幾個任務後,覺得整體體驗相當不錯 Hacker News 用戶 @vulture916 — 因為 Orca 內建瀏覽器功能,可以直接點選網頁上的 UI 元素、寫評論後送回給 Agent 修改。結果:這位使用者之前自己土法煉鋼做過類似方案,但改用 Orca 後覺得方便很多,因此在多款功能相近的 ADE 中選擇 Orca Hacker News 用戶 @BlueOrigin50 — 使用 Orca 的「Worktree Sleep」功能,在暫時不需要某個 Agent 工作分支時把它睡眠。結果:可以關閉終端機和 Agent 以節省電腦記憶體,需要時再喚醒,所有 Agent 的工作狀態都會完整還原
Google Research 與 Google DeepMind 發表全球首個通過隨機對照試驗評估的即時視訊問診 AI 系統,代號 AMIE(Video)。這套系統建立在 Gemini(Google 的大型語言模型)與 Project Astra(Google 的即時多模態互動技術)之上,採用多個 AI agent(可以想成多個分工合作的 AI 助手)協同運作的架構,能一邊即時對話、一邊做臨床推理,同時透過視訊鏡頭和麥克風即時感知病患的咳嗽聲、走路姿態異常等視覺與聽覺線索,就像真人醫師問診時會觀察病人的樣子。研究團隊採用 OSCE(客觀結構式臨床考試,一種模擬病患情境來測試醫師臨床能力的標準化評估方式,廣泛用於醫學教育與執照認證)框架進行測試。Google 團隊也明確表示,這套系統距離真正進入臨床實際使用還需要更多研究,目前還不能取代醫師看診。
Google Research 與 Google DeepMind 研究團隊 — 招募 30 位基層醫師與 15 位病患演員,設計 100 個臨床情境,讓 AMIE(Video) 與純文字版 AMIE、真實醫師三方進行對照測試,比較病史詢問、診斷、治療管理、體格觀察四項核心能力。結果:AMIE(Video) 的表現與真實基層醫師相當或更優;病患演員在溝通效率、便利性、被理解感三項給予 AMIE 更高評分,但在建立醫病信任關係上仍偏好真實醫師。系統已知限制包括細微解剖判斷不夠精準、難以捕捉快速動作、以及辨識細膩情緒線索的能力仍有差距
中國電商巨頭螞蟻集團旗下的投資部門,領投了機器人新創公司「戴盟機器人」數億元人民幣的融資,這是螞蟻集團第一次把錢投進機器人的「觸覺感知」領域,也就是讓機器人能像人手一樣「摸」出東西的軟硬程度、有沒有滑動。戴盟機器人同時發表了全球首個「物理交互腦」Daimon-TWM,這是一種以觸覺資料為核心訓練出來的AI模型(可以想成是機器人的大腦,但特別擅長靠「觸感」判斷該怎麼動手),用途是讓機器人在抓取、組裝這類需要碰觸物體的任務中做得更穩。這個模型參數規模達到100億等級(參數愈多通常代表模型能學到的細節愈多),並支援每秒100次的高頻觸覺回饋,讓機器人能幾乎即時根據手感調整動作。戴盟也已將首批觸覺數據集放上阿里的魔搭AI模型平臺供下載,並宣稱服務了包含OpenAI、Figure、Meta在內的兩百多家客戶。
戴盟機器人 — 以觸覺感測數據為核心,打造出Daimon-TWM觸覺AI模型,讓機器人在需要碰觸物體的接觸密集型操作中,即使遇到擾動,仍能維持動作準確。。結果:在沒有幹擾的情況下,成功率比對照的其他方案高2倍;在有幹擾的情況下,成功率高達10倍,顯示純靠攝影機影像判斷的機器人模型在真實世界的不穩定狀況下容易失效,而這套加入觸覺的模型明顯更穩定
阿里巴巴的Qwen(通義千問)團隊在Hugging Face(一個AI模型的公開分享平臺)上發表了新一代開源大型語言模型(LLM,就是像ChatGPT那種能對話、寫程式、回答問題的AI)Qwen3.8,總參數量達2.4兆(實際運算時只啟用其中950億參數,是一種叫MoE混合專家的省算力設計)。官方宣稱這是Qwen家族中最強的一代,首次把等同Qwen-Max等級(阿里最頂級的付費模型)的能力開放給大家免費下載使用。Qwen團隊表示這個模型在寫程式、專業工作、研究、以及需要連續執行很多步驟的AI agent(AI代理,就是能自己規劃並執行一連串任務的AI)任務上都有大幅進步,也支援context length(上下文長度,即AI一次能記住、處理的文字量)原生26萬多字,最高可擴展到約101萬token(token是AI處理文字的基本單位,約等於半個字到一個字)。
Qwen官方 — 在多項公開及自製的benchmark(基準測試,用來量化比較不同AI模型能力的標準化考題)上,將Qwen3.8-Max(Qwen3.8的官方雲端版本)與Claude Opus 4.8、Claude Fable 5、GPT-5.6 Sol等業界頂尖模型做對比測試,涵蓋寫程式代理任務(如Terminal Bench、SWE-bench Pro)、通用代理任務(如處理長流程工作的CoWorkBench、JobBench)、以及一般能力測試(如醫療知識HealthBench、法律PLawBench、金融PRBench-Finance)。結果:Qwen3.8-Max在多數項目上追平甚至部分超越GPT-5.6與Opus 4.8等收費模型的成績,例如在PaperBench(模擬完成學術研究論文任務的測試)拿下93.0分、高於其他所有列出的模型;在HealthBench(醫療問答測試)拿60.2分也是最高分,顯示這個開源模型在特定任務上已能與最頂尖的封閉模型競爭 開發者 — 使用Transformers、vLLM、SGLang等常見的AI模型部署工具,把Qwen3.8-2.4T-A95B下載到自己的伺服器上跑起來,或使用Qwen3.8-Max官方雲端API。結果:透過Docker指令或簡單的pip安裝指令,就能在本機或雲端伺服器架起一個相容OpenAI API格式的服務,讓自己的程式呼叫這個模型回答問題、寫程式。怎麼做:安裝與啟動範例:pip install vllm 後執行 vllm serve "Qwen/Qwen3.8-2.4T-A95B",接著用curl呼叫 http://localhost:8000/v1/chat/completions 送出對話請求;官方建議取樣參數為 temperature=1.0, top_p=0.95, top_k=20,並可透過reasoning_effort參數(xhigh/medium/low)調整模型思考的深度與速度成本
OpenAI(做ChatGPT那家公司)官方部落格發表兩份研究報告,分析企業如何使用AI。報告指出,企業使用AI已經從「幫忙想」進化到「幫忙做」:以前員工問AI「怎麼準備簡報」,現在可以直接叫AI agent(一種能自己操作工具、瀏覽資料、完成多步驟任務的AI)去蒐集資料並直接把簡報做出來。報告發現用得最深的前10%企業(稱為frontier firms,領先企業),每個使用者產生的AI輸出量是一般企業的8.3倍,而且這個差距在過去半年內從2.6倍快速拉大到8.3倍。報告也指出,使用AI最積極的不是主管,而是資淺員工,資淺員工採用AI半年後,每週傳的訊息比高階主管多13則。
OpenAI企業客戶整體(以Codex與ChatGPT使用量統計) — 截至今年6月,比較企業客戶使用Codex(AI寫程式agent工具)與ChatGPT產生的輸出量佔比。結果:Codex佔了Codex加ChatGPT總輸出量的64%,顯示企業開始把工作委派給能自動執行任務的AI agent,而不只是問答式的助理 OpenAI自家內部員工 — 每週使用Plugins(把AI技能和公司資料、工具串接起來的擴充套件)的比例。結果:OpenAI內部員工每週使用Plugins的比例高達95%,遠高於一般領先企業的21%與一般企業的9%,顯示大部分企業其實還有很大成長空間 Virgin Atlantic(維珍航空)工程團隊 — 用Codex(AI寫程式agent)重構老舊程式碼。結果:原本要花兩週的工作,縮短到30分鐘完成 Virgin Atlantic(維珍航空)產品團隊 — 用ChatGPT Work(企業版ChatGPT)做競爭對手研究,用來規劃公司未來五年的數位策略。結果:原本要花好幾週的研究工作,縮短到幾小時完成 企業裡各職能部門的員工(法務、業務、招募、行銷等) — 自二月以來使用Codex的每週活躍人數成長幅度比較。結果:法務部門成長108倍、業務41倍、招募41倍、行銷26倍,遠超過工程部門本身的5倍,顯示AI agent正快速擴散到非工程職能
OpenAI(開發 ChatGPT 的公司)官方部落格宣佈,開始在 ChatGPT 裡測試廣告。這次測試對象是美國地區、已登入的成人使用者,且只限「免費版」和「Go」這種低價方案,付費的 Plus、Pro、Business、Enterprise、Education 方案不會看到廣告。OpenAI 說廣告不會影響 ChatGPT 給的回答內容,也不會讓廣告主看到使用者的對話紀錄,只會給廣告主看點擊、觀看次數這種統計數字。目前這項測試已陸續擴大到英國、墨西哥、巴西、日本、南韓、加拿大、澳洲、紐西蘭等地區,OpenAI 表示今年會持續擴大到更多國家。
OpenAI — 在使用者與 ChatGPT 的對話中,依對話主題、過去聊天紀錄、過去和廣告的互動紀錄,挑選相關廣告顯示給使用者,例如使用者在查食譜,就可能看到餐點外送或食材包的廣告。結果:廣告會清楚標示為「贊助」,並和 ChatGPT 自己生成的回答在畫面上明顯分開;若有多個廣告主符合,系統只挑最相關的一個優先顯示 一般使用者 — 若不想看廣告,可以升級到 Plus 或 Pro 付費方案,或在免費方案內選擇「不看廣告」但換取每天可用的免費訊息額度變少。結果:使用者也能隨時關閉廣告、給廣告意見回饋、查看某則廣告為何被推播給自己、一鍵刪除自己的廣告相關資料
中國具身智能(就是能像人一樣在真實世界裡動手做事的AI機器人)公司「自變量機器人」辦了一場公開直播實測,讓機器人在沒有人工介入、沒有固定動作流程的情況下,連續分揀隨機送來的各種包裹整整1小時。結果分揀效率達到每小時1816件,比美國機器人公司Figure AI此前公開的每小時1248件紀錄高出45%以上,準確率也達到98%。更值得注意的是,自變量機器人只用了雙機械臂加標準夾爪的方案(不是像Figure AI那樣的人形機器人加五指靈巧手),硬件成本因此降低了約70%。支撐這套表現的核心是自變量機器人自研的WALL-B「世界統一模型」(一種把視覺、聽覺、語言、觸覺和動作全部打通、放進同一個網絡裡一起處理的AI大腦架構,和過去把這些功能分開處理、容易在傳遞中丟失信息的VLA架構不同)。
自變量機器人(WALL-B模型) — 在直播中面對傳送帶上隨機出現、形態各異的包裹(紙盒、快遞軟袋、圓柱形快件、泡沫封裝的生鮮件等),且包裹擺放姿態也是隨機的,機器人需要實時判斷每件包裹的屬性並即時決定抓取或搬運方式。結果:輕而規整的包裹直接快速抓取搬運;較大較重的箱體改用雙臂協同搬運;夾取條件不好的箱體則從側面推移,兼顧效率與降低包裹受損風險,全程無人工接管、無故障停機,最終1小時內完成1816件分揀,效率超越Figure AI原紀錄45% 自變量機器人(WALL-B模型) — 在「面單整理」環節處理不同類型包裹的標籤面朝向問題,包括小件包裹和容易變形的衣物類軟包。結果:面對小件包裹時藉助慣性快速翻轉以提高效率;面對較重包裹則分步驟緩慢調整避免受力過猛偏移;面對軟包類先用撥動、展開等動作恢復平整後再校準面單位置,顯示出根據物體材質、重量和形變特性做出不同動作規劃的能力 自變量機器人(WALL-B模型) — 直播中遇到兩個包裹疊在一起、彼此遮擋幹擾的突發狀況。結果:機器人判斷直接抓取不適合,臨時調整策略先將兩個包裹分離,再逐個完成分揀
中國具身智能(就是能感知、操作真實世界的機器人AI)新創公司擎羽科技(FEAGINE)發佈了三款仿生柔性機械臂A01、A02、A03,以及第一代跨本體(也就是能在不同機器人身體之間通用)基礎模型Fi0。擎羽的思路和主流「人形機器人」不同:與其造一個像人的通用身體,不如讓機器人身體依任務自由設計,再用同一套AI大腦(Fi0)把「怎麼完成任務」的知識跨越不同身體重複使用。Fi0的關鍵設計是:機器人遇到沒學過的新任務時,人類可以戴上擎羽的Ego頭環示範一次,AI就能把這段示範當成參考資料(論文裡稱為skill context),當場理解該怎麼做,不需要重新訓練模型參數。Fi0還會先在腦內模擬幾種可能的動作方案,預測每種方案可能帶來的後果(比如會不會撞到東西、能不能完成任務),再選出風險最低、最可能成功的方案才真正執行。
擎羽科技 — 發佈FEAGINE A01、A02、A03三款繩驅柔性機械臂,節段數、自由度、長度和負載能力依序遞增(A01單段2自由度、重750克、末端負載200克;A02兩段4自由度、臂長30釐米、末端負載400克、最高時速0.78米/秒;A03三段6+1自由度、臂長50釐米、末端負載600克、最高時速1.17米/秒),三款均支持ROS 1、ROS 2、Python與C++,A02和A03還配套GUI、MuJoCo與SAPIEN仿真環境。結果:擎羽宣稱這是全球首個實現標準化量產交付的繩驅柔性本體產品矩陣,可分別用於移動底盤輕量操作、桌面近人服務、以及需繞過障礙的複雜空間抓取任務 面對訓練時沒學過的新任務的機器人(搭載Fi0模型) — 由人類先戴上Ego頭環做一次示範動作,Fi0透過Skill Encoder把示範轉成一組skill tokens(描述操作對象、任務階段、關鍵接觸點、目標狀態的信息包),當作推理時的參考上下文。結果:機器人不需要重新訓練模型參數,就能直接執行這個新技能,且同一段人類示範可以被A01、A02、A03等不同身體的機器人共同理解並各自轉化成適合自己身體的動作。怎麼做:人類使用Ego頭環完成一次demonstration,Fi0將其編碼為skill context供推理時調用 Fi0模型中的World Dynamics Model與MAWA等預測評估機制 — 針對同一個任務先根據當前機器人身體狀態生成多個候選動作方案,再向前模擬推演每個方案在未來幾個時間步可能造成的物體狀態、接觸關係與任務進度變化。結果:MAWA綜合任務進展、成功概率、物理風險與模型不確定性對各方案評分,選出最適合當前任務與當前身體的動作,例如同一技能在較短的A01上傾向直接路徑,在節段更多的A03上則會利用構型繞開障礙
電子報 TheSequence 訪問了 NVIDIA 的 Chris Alexiuk(負責推廣 NVIDIA 的 AI 技術、協助開發者理解與使用 Nemotron 系列模型的人)。Nemotron 是 NVIDIA 自己開發的開放權重模型系列(開放權重指模型的參數檔案是公開的,任何人都能下載來用或修改)。這次訪談重點放在最新推出的 Nemotron 3 系列,以及 NVIDIA 為什麼即使賣的是 GPU(AI 運算晶片)而不是模型本身,仍然願意花大力氣開放模型權重、訓練資料和技術報告。Alexiuk 也談到目前 AI 產業正從「單次對話的聊天機器人」轉向「長時間自主執行任務的代理(agent,就是能自己規劃步驟、呼叫工具、完成多階段任務的 AI)」,以及如何在多個模型之間做任務分配(model routing,依任務難度或性質,把工作分派給不同大小、不同專長的模型處理,藉此省錢省時間)。
NVIDIA 的 Nemotron 3 系列 — 把模型分成三種尺寸:Nano(總參數約300億,實際運算時只啟用約30億)、Super(總參數約1000億,實際運算時只啟用約120億)、Ultra(總參數約5000億,實際運算時只啟用約500億),這些尺寸分別對應到「一張GPU」「一個伺服器節點」「一整座NVL72機櫃」等不同等級的硬體規模。結果:讓使用者可以依照自己手上的硬體條件(從個人一張顯示卡到企業級機房)選擇對應大小的模型,兼顧效能與成本,NVIDIA 也在模型說明卡上明確標示每個尺寸建議搭配的硬體配置 NVIDIA 的 Nemotron 3 架構團隊 — 在模型架構中混合使用 Mamba-2(一種比傳統 Transformer 注意力機制更省運算資源的序列處理架構)和稀疏混合專家(MoE,模型內部有很多個「專家」子網路,每次只啟動其中一小部分來處理輸入,藉此在不大幅增加運算量的情況下增加模型容量),並只保留少數幾層傳統注意力機制。結果:團隊發現「注意力機制不是萬能,但仍不可或缺」——注意力層對於長文本的記憶與檢索能力仍然關鍵,若要在保留超長上下文能力的同時完全捨棄注意力機制,還需要更大幅度的架構突破 NVIDIA — 在 Super 和 Ultra 兩個尺寸的模型中導入名為 LatentMoE 的技術:先把輸入的文字片段(token)壓縮進一個更精簡的「潛在空間」,再送進混合專家系統做運算。結果:在相同運算成本下,可以讓模型多路由到約4倍數量的專家子網路,這些節省下來的運算資源被拿去換取更高的準確度 NVIDIA — 推出 Nemotron 3.5 Lightning,一個300億參數、實際啟用30億參數的開放模型,特別針對「AI 代理」執行過程中大量、重複的執行層工作(例如呼叫外部工具、把任務轉交給子代理)做最佳化訓練,並針對開發者實際在用的代理框架調校。結果:讓開發者不必浪費昂貴的頂尖大模型去處理繁瑣的執行細節,改用這個又快又便宜的小模型負責跑腿工作,同時整合了推測解碼(一種加速生成文字的技術)並支援從資料中心到個人小型工作站(DGX Spark)的部署
Anthropic(開發Claude系列AI模型的公司)宣佈,將為旗下模型生成的文字加上浮水印(一種附加在文字內容中、可供其他系統辨識的標記,用來標示內容是由AI生成或編輯)。這項改動是為了配合歐盟AI法案的「透明度準則」(要求AI公司必須用其他系統可辨識的方式標示AI生成或AI編輯過的內容),該準則已於2026年8月2日生效。Anthropic表示,8月2日之後發布的所有新模型都會自動內建這項浮水印技術,同時也會把這項功能擴展到舊有模型上。浮水印是嵌在文字本身裡的,所以就算使用者把文字複製貼到別的地方,浮水印通常還是會跟著一起過去,甚至經過一些編輯後也可能還留著。
Anthropic — 針對8月2日之後發布的所有新模型,自動套用浮水印技術來標記AI生成的文字和檔案(檔案部分採用C2PA這套公開的內容驗證標準)。結果:浮水印會套用在模型層級,因此不論使用者是透過Claude平臺API、Claude聊天介面、Claude Code、Claude Cowork還是Claude Tag等哪個產品或介面產生文字,都會被標記,且複製貼上後浮水印通常仍會保留 Anthropic — 把浮水印支援擴展到8月2日之前發布的舊有模型。結果:讓舊模型產生的內容也能被標記為AI生成,但文章指出目前尚不清楚使用者需要編輯多少內容才能移除浮水印,TechCrunch已向Anthropic詢問細節但尚未得到回覆
科技媒體The Decoder引述《The Information》報導指出,Nvidia正在打造新一代開放權重模型(open-weight model,指模型參數公開釋出、任何人都能下載自行部署的AI模型)Nemotron 4,目標是與全球最強的免費可用模型競爭。報導指出,這個系列裡最大的模型參數量(可以理解為模型的「腦容量」,數字越大通常代表模型能處理的知識和推理能力越強)將至少達到一兆,是前一代Nemotron 3 Ultra的兩倍。Nvidia也大幅加碼在雲端訓練模型上的支出,到2031年為止投入將達280億美元,最快今年秋天可能發布。不過即使達到一兆參數,Nvidia仍只是追上中國實驗室目前已經達到的規模,例如Moonshot AI的Kimi K3有2.8兆參數,DeepSeek V4 Pro有1.6兆參數。
Nvidia — 打造開放權重模型Nemotron 4,參數量目標至少一兆,是前代Nemotron 3 Ultra的兩倍,並將雲端訓練投入的支出提高三倍、到2031年累計達280億美元。結果:今年六月推出的Nemotron 3 Ultra,在Artificial Analysis智慧指數(一個用來比較不同AI模型能力強弱的評分榜)上是最強的美國開放模型,但仍落後中國的Kimi K2.6;目前該指數上Nemotron 3 Ultra得38分,Kimi K3則約60分,顯示Nemotron 4即使如期在今秋推出,規模上也只是追平、而非超越中國同業 Nvidia — 同時也是反對監管開放模型連署請願的簽署公司之一,即使川普政府正考慮針對特定中國模型實施禁令。結果:越多公司自行架設(self-host)開放模型,Nvidia的GPU(圖形處理器,也是訓練與運行AI模型最主要用到的硬體晶片)就賣得越多;但Nemotron 4一旦推出,也會讓Nvidia與OpenAI等自己的重要客戶形成直接競爭關係
NVIDIA(輝達)發表了兩項新東西:一個叫Nemotron 3.5 Lightning的300億參數開放式「混合專家」模型(MoE,就是把一個大模型拆成很多小專家模型,每次只叫幾個專家出來做事,比較省運算資源),專門處理大量、專門化的AI代理人(agent,就是能自己執行多步驟任務的AI程式)任務;另一個叫NeMo Switchyard的開源工具庫,會在agent執行任務的過程中,把每一個步驟自動分配給最適合的AI模型去做,而不是整段任務都用同一個模型硬做到底。NVIDIA表示Lightning模型的輸出速度比同級模型快up to 4倍。這樣「哪個步驟找哪個模型做」的設計,目的是在不犧牲品質的前提下大幅省錢省時間。
NVIDIA自家測試團隊 — 用Nemotron 3.5 Lightning模型執行agent(AI代理人)任務,並與Qwen3.6-35B模型比較準確度和速度;同時把Lightning搭配NeMo Switchyard路由工具一起跑,去比較整體任務花費。結果:Lightning完成agent任務的速度比Qwen3.6-35B快約30%,且準確度相當;搭配Switchyard之後,整體任務還能維持接近頂尖水準的完成度,但花費大約只要單獨使用Opus 4.8模型跑完整任務的三分之一
由 MATS Research、ELLIS Institute Tübingen、Max Planck Institute for Intelligent Systems 等機構組成的研究團隊(論文作者包含 Alexander Panfilov 等人)發表研究指出,OpenAI、Anthropic、Google 等公司的前沿 AI 模型在思考時,會產生一段「加密的推理過程」(chain-of-thought,就是模型回答前在腦中一步步推導的草稿,這些公司會把這段內容加密後回傳給開發者,避免被抄襲模仿)。研究團隊發現,把一個強模型產生的加密推理過程,重新餵給同系列的弱模型,再用越獄手法(jailbreak,就是誘導 AI 說出原本被禁止講的內容)誘導弱模型講出來,就能把強模型原本加密、看不到的推理內容還原成明文,而且全程不必直接攻擊強模型本身,也不會觸發它的反抄襲防護機制。更嚴重的是,這些還原出來的推理內容裡藏有真實的機密資訊,例如 API 金鑰、密碼等,代表企業和使用者的機密可能透過這個管道外洩。
研究團隊 — 從 GitHub 和 Hugging Face 上蒐集了 6,708 筆公開的、由 Claude、GPT、Gemini 等模型產生且仍含有加密推理區塊的真實使用紀錄,將解碼流程套用到每一筆加密區塊上。結果:共還原出 315,320 段推理內容;在限定為真實、非測試用途的使用紀錄中,找到 704 筆個人隱私資料,包括 62 組 API 金鑰、33 組密碼、24 組存取權杖、30 個個人電子郵件地址,以及姓名、地址、內部網址等技術識別資訊,其中 64 筆資料只出現在隱藏的推理內容裡、在使用者看得到的畫面上完全找不到 研究團隊 — 把 Opus 4.8 模型推理內容的前 1% token(token 是 AI 處理文字的最小單位)預先塞進 Kimi-K3 模型的推理過程中。結果:即使沒有直接把答案塞給 Kimi-K3,它給出的可見答案用詞也會明顯往 Opus 的答案風格靠攏,證明推理內容確實會影響模型行為,不只是無意義的雜訊 研究團隊 — 故意要求模型針對有害內容進行推理,但同時要求它給出的可見答案保持無害。結果:結果發現雖然畫面上顯示的答案是安全的,但隱藏的推理過程中仍留有具危險性的知識內容,而研究團隊的解碼手法可以把這些內容還原成明文讀出來
xAI(Elon Musk 旗下的 AI 公司,也就是聊天機器人 Grok 的開發商)發表新產品 Grok Bot,這是一種可以幫你「代辦真實工作」的 AI 代理(agent,就是能自己執行多步驟任務、不用你一步步下指令的 AI)。每個 Bot 都有自己專屬的雲端電腦、記憶功能,還能登入你平常用的各種網站和工具(就算那些工具沒有提供 API 或 MCP,也就是沒有官方的程式化接口,Bot 也能像人一樣手動操作介面)。你可以像傳訊息給同事一樣把工作交給 Bot,它會全程自己完成,只有在需要你拍板決定時才會回來找你。目前 Grok Bot 處於早期測試階段,開放給 SuperGrok Heavy、Cursor Ultra、Cursor Teams Premium 的訂閱用戶在桌面版和 iOS 上使用,企業用戶則要排候補名單。
xAI 內部的業務(sales)Bot — 在公司內部代號 SpaceXAI 的團隊裡,這個 Bot 負責把通話紀錄的重點更新進 CRM(客戶關係管理系統)。結果:並自動草擬後續跟進郵件,不需要業務人員自己動手整理和撰寫 xAI 內部的營運(ops)Bot — 處理新進員工的座位安排,以及處理 Gmail 收到的發票。結果:這些原本要人工處理的行政瑣事變成自動完成 xAI 內部的工程(engineering)Bot 與除錯(debugging)Bot — 工程 Bot 在產品介面中重現一個 bug、提交工單,然後把修復工作交接給另一個專門除錯的 Bot。結果:整個從發現問題到交接修復的流程不需要工程師手動串接
OpenAI(開發ChatGPT的AI公司)發表GPT-5.6-Cyber,這是專門用來做「漏洞研究」(找軟體裡的安全漏洞)、「攻擊驗證」(測試漏洞是否真的能被利用)等進階資安任務的AI模型。同時OpenAI擴大了Daybreak計畫,開放Blue和Red兩種存取層級,讓經過審核的資安防禦人員可以用到更強大、限制更少的AI工具。一般版GPT-5.6對敏感資安請求(例如寫繞過系統防護的程式碼)幾乎都會拒絕回答(拒絕率高達98.5%),但GPT-5.6-Cyber在Daybreak Red授權下,對這類進階資安請求的完成率高達95%,等於大幅降低了「AI因為怕被濫用而拒答」的情況,讓真正經過審核的安全研究人員能順利做事。OpenAI強調這是因為駭客未來會愈來愈常用AI發動全自動攻擊,防禦方必須先一步拿到同等強大的AI工具做準備。
OpenAI內部研究人員 — 用GPT-5.6-Cyber調查Chrome瀏覽器使用的JavaScript引擎V8。結果:發現兩個先前未知、可以串連起來破壞記憶體並逃脫V8沙盒(一種限制程式活動範圍的安全機制)的漏洞,通報Google後獲確認並修復,編號為CVE-2026-15903(一個高風險漏洞,因編譯器少做了一次安全檢查,可能讓攻擊者讀寫其他程式的記憶體、甚至在Chrome沙盒內執行任意程式碼) OpenAI與Daybreak合作夥伴 — 用GPT-5.6-Cyber分析一款主流手機作業系統。結果:找到至少5個漏洞,其中包含一條可以從不受信任的App一路提升到本機最高權限的攻擊鏈,目前正配合官方修補中 OpenAI與Daybreak合作夥伴 — 用GPT-5.6-Cyber分析一款主流資料庫軟體。結果:找到3個嚴重漏洞,其中一個可以讓攻擊者遠端執行程式碼 OpenAI與Daybreak合作夥伴 — 用GPT-5.6-Cyber分析一款主流作業系統核心(kernel,作業系統最底層、管控硬體與權限的核心程式)。結果:找到超過400個可能導致權限提升的漏洞 一位受邀早期試用的資安客戶夥伴 — 在專案的Trusted Access(受控管的授權存取環境)下,用GPT-5.6-Cyber處理專家級漏洞研究工作。結果:模型對真實攻擊限制條件推理更準確、能追蹤更複雜的系統狀態,原本舊模型花了好幾週斷斷續續都解不開的問題,這次不到一天就完成,且因為不必要的拒答變少了,研究人員能把更多時間花在驗證發現、轉化成防禦價值上
根據科技媒體 Inside AI 引述《The Information》報導,微軟(Microsoft)預計最快在9月公開發表新一代自研AI晶片Maia 300,目標是降低對Nvidia昂貴GPU(就是專門做AI運算的高階顯示卡)的依賴。Maia 300是2023年11月推出的第一代Maia晶片的後繼版本,當初那顆晶片雖然是為訓練與執行大型語言模型(LLM,就是ChatGPT、Claude這類會對話的AI背後的模型)設計,但量產速度比微軟內部目標和競爭對手都慢,這次新版就是要迎頭趕上。微軟已找臺積電(TSMC)預訂超過30萬顆Maia 300的產能,預計2027年交貨,顯示微軟對自研晶片的長期投入相當大。除了自家的Azure OpenAI、Copilot等服務,微軟也在說服包括Anthropic(Claude模型的開發公司)在內的雲端大客戶採用Maia 300,如果成功,將是Nvidia AI訓練晶片市場少見的大型客戶流失案例,也可能讓Maia 300成為繼Nvidia CUDA、Google TPU之後的第三個晶片生態系。
微軟(Microsoft) — 向臺積電下單超過30萬顆Maia 300晶片產能,並將其整合進Azure雲端AI基礎設施,同時支援PyTorch、TensorFlow等主流AI開發框架。結果:預計2027年開始交貨,目標是同時支援AI模型的訓練與推論(inference,就是AI實際回答問題、生成內容的運算過程),並在效能與成本上和Nvidia GPU競爭 Anthropic(Claude模型開發公司) — 目前是Nvidia的主要客戶,微軟正嘗試說服其將部分AI運算工作負載轉移到Maia 300上。結果:若成真,將是首批從Nvidia平臺大規模轉出的指標性案例之一,但由於Nvidia的CUDA軟體生態系已深植業界,把既有模型移植到新架構需要大量工程投入,轉換過程並不容易
機器人新創公司Dyna Robotics發表了新模型Dyna-2,這是一種「世界-行動模型」(world-action model,簡稱WAM,是一種不只預測動作、還會同時預測未來畫面的AI模型架構)。這個模型用超過一百萬小時的人類影片(例如人手做家事、操作物品的第一人稱影片)來預先訓練,而不是直接用機器人手臂的操作資料訓練。Dyna Robotics證明瞭一件業界一直想確認的事:只要不斷加大人類影片訓練資料量,模型控制「從沒見過的機器人硬體」的能力就會可預期地變好,這叫「人類到機器人的遷移擴展定律」。在對39種機器人任務做零樣本測試(zero-shot,指模型完全沒針對這個任務特別訓練過就直接上場)時,訓練資料從1000小時增加到100萬小時,表現持續變好,尤其在1萬到10萬小時之間進步特別明顯。
Dyna Robotics — 把Dyna-2部署到真實客戶場地,在機器人完全沒見過的新環境中執行零樣本任務(不額外訓練、直接上工)。結果:實際生產環境中的任務成功率達到87%,相較於前一代以「視覺-語言-動作模型」(VLA,目前業界主流的機器人AI架構)打造的Dyna-1只有46%的成功率,等於成功率翻倍以上 Dyna Robotics研究團隊 — 讓Dyna-2在同樣資料集與參數設定下,與Dyna-1做同條件的正面對比測試,並在閃爍迪斯可燈光、全黑環境、甚至研究人員故意在旁邊搗亂(把機器人做好的工作弄亂)等極端情況下測試。結果:Dyna-2的任務成功率是Dyna-1的1.55倍,展現出更強的環境穩健性;此外,模型還意外具備「聽指令做事」的能力,語言指令跟隨成功率從35%一路提升到內部測試的96% Dyna Robotics工程團隊 — 針對生成式世界模型常見的「反應延遲」問題(要花很多運算時間才能預測出下一步該做什麼,導致機器人反應慢半拍),設計了新的「一步式影片生成蒸餾」技術管線。結果:在單張H100 GPU(一種高階AI運算晶片)上,影片生成的延遲從10203毫秒大幅降到110毫秒,等於快了近100倍,讓模型能幾乎即時「想像」出下一步該怎麼做
創投公司a16z發表分析文章指出,能夠自己操作電腦畫面(點擊、輸入、瀏覽網頁,業界稱為computer-using agent,電腦使用代理)的AI,已經從展示階段真正進入企業的日常生產作業。文章指出,這類AI在標準測試(OSWorld-Verified,一種專門測AI能不能像人一樣操作電腦介面完成任務的基準測試)上的完成率,從2025年初的42%大幅提升到2026年6月的85%,甚至超過人類在同樣任務上的72%完成率。不過作者強調,光比較測試分數已經沒有意義,因為85%的完成率代表還有15%會失敗,但企業真正要用在業務流程上,往往需要接近100%成功率才敢放心交給AI做。文章認為,現在真正決定誰能勝出的關鍵,已經不是哪家模型比較聰明,而是誰能把這些代理接得夠穩、夠可靠地嵌進企業實際的工作流程裡。
一家消費品數據平臺公司 — 原本用人工寫死的程式(手工編碼抓取器)去各大零售商的網站入口抓資料,每月要處理1500到2000萬次自動化的網站互動;當零售商網站介面改版、原本的抓取程式失效時,改用AI代理當作備援,讓它自己診斷問題、修好抓取流程。結果:抓取資料的維護團隊規模因此縮減一半,省下的人力被重新分配去做其他工作 一家全球性的系統整合商(幫企業導入IT系統的公司) — 在27個真實的生產環境工作流程中導入AI代理,每天處理1500到2100張IT工單(客戶提出的技術問題請求)。結果:目標是把原本20%到25%的員工,從利潤微薄的委外技術支援合約工作中釋放出來,轉去做其他業務 一家招聘機構 — 把整個招聘流程從頭到尾自動化,包括在面試結束後自動把應徵者的資料填進追蹤系統(ATS,應徵者追蹤系統)。結果:刻意選用比較便宜、非最頂尖的AI模型來做,因為這種模型已經足夠完成任務、表現良好,不需要花錢用最貴的模型 一家大規模營運的公司 — 每月執行數百萬次自動化任務,交給供應商在背後管理運作。結果:操作人員甚至不知道背後用的是哪一款AI模型,因為根本不需要知道——供應商會在底層自行更換模型,就像雲端服務商更換硬體一樣,使用者感覺不到差異
Artificial Analysis(一個專門幫AI模型做能力評測、發布排行榜的機構)發布了新的評測項目「AA-AnalystAgent」,專門測試AI代理人(agent,就是能自己動手操作工具、完成多步驟任務的AI)在真實試算表和文件上做量化分析的能力,例如像真正的分析師一樣讀懂醫療支出報告、貿易統計、水文氣象資料等。結果顯示Anthropic的Claude Opus 5拿下第一名,正確率54%,OpenAI的GPT-5.5以50%排第二,Anthropic的另一款模型Claude Fable 5則以49%排第三。這次評測特別要求模型對同一題目連續答對五次才算真的過關(稱為pass^5或pass-all-5),因為現實中分析師工作最重要的不是偶爾答對,而是每次都能穩定給出正確答案。評測還發現,模型最常見的失敗原因是「一開始就認定錯誤的解讀方向,之後死不悔改」,這種情況佔了所有失敗案例的57%。
Artificial Analysis — 設計了80道題目,涵蓋14個商業與科學領域(如醫療、能源、環境報告等),讓多個AI模型在其開源的Stirrup測試環境中(模型可使用程式執行、網頁抓取、看圖片等工具)各自嘗試解題,每題重複跑五次。結果:Claude Opus 5以54%的pass^5成績奪冠,GPT-5.5第二(50%),Claude Fable 5第三(49%),前三名差距僅相當於80題中的3題;GPT-5.5雖然單次答對率(pass@1)最高達66%,但因為不夠穩定,最終pass^5輸給更穩定的Opus 5 Google DeepMind的Gemini 3.1 Pro Preview — 參與同一項評測。結果:這款模型有81%的題目至少答對一次,但要求連續五次都答對時只剩41%,最終排名第九,顯示「運氣好答對一次」和「真正穩定可靠」是兩回事 Moonshot AI的Kimi K3 — 作為開源模型參與評測。結果:以39%的成績成為開源模型中排名最高者,但仍落後於封閉頂尖模型15個百分點;第二名開源模型DeepSeek V4 Flash僅25%,顯示開源陣營內部差距比開源與頂尖閉源模型的差距還大 Claude Sonnet 4.6 與小米的MiMo-V2.5-Pro — 兩者在評測中拿到相同分數。結果:同樣拿到20%的分數,但每題成本相差懸殊,Claude Sonnet 4.6每題花1.34美元,MiMo-V2.5-Pro只要0.05美元,顯示同樣的分數可能有天壤之別的價格
分析機構Artificial Analysis(一家專門幫各家AI模型打分排名的獨立評測單位)發布最新報告,指出SpaceXAI(馬斯克旗下AI公司,原xAI)推出的新模型Grok 4.6,在該機構的「智能指數」(Intelligence Index,一套綜合多項測驗算出的AI能力總分)拿到61分,追平OpenAI的GPT-5.6 Sol,僅次於Anthropic的Claude Opus 5(63分)和Claude Fable 5(62分),正式擠進所謂「前緣模型」(frontier models,就是當前最頂尖那一小群AI模型)之列。這代表Grok系列在短短一個多月內從落後追到與業界龍頭並駕齊驅。報告也強調Grok 4.6的定價完全沒有調漲,卻換來更強的能力,等於用比對手低六成以上的成本拿到接近頂級的表現,被認為是目前「智能與成本效益」最划算的模型之一。
Artificial Analysis評測團隊 — 在GDPval-AA v2(一套測AI處理知識型工作任務能力的基準)、τ³-Banking(模擬銀行客服情境的測驗)、Terminal-Bench v2.1(測AI操作電腦終端機、下指令完成任務的能力)三項「代理式」(agentic,指AI能自主連續執行多步驟任務而非只回答單一問題)測驗上為Grok 4.6打分。結果:Grok 4.6在GDPval-AA v2的Elo(一種常見的相對實力積分制)拿到1753分,僅次於Claude Opus 5;在τ³-Banking拿50.7%,是前兩名之一;在Terminal-Bench v2.1拿88.4%,與最頂尖模型表現相當。同時它完成任務平均只需約53個對話回合、耗用約0.5B(5億)input tokens(可理解為AI閱讀輸入內容所消耗的『字詞單位』數量),遠比Claude Opus 5平均約103回合、2.0B tokens更省 Artificial Analysis評測團隊 — 比較Grok 4.6與Grok 4.5、Grok 4.3的分數,以及與其他模型的定價。結果:Grok 4.6比一個多月前發布的Grok 4.5進步5分,比更早的Grok 4.3進步23分;定價維持每百萬輸入token 2美元、輸出token 6美元不變(比Claude Opus 5的5/25美元、GPT-5.6 Sol的5/30美元便宜六成以上),平均每個任務只花0.84美元,與Kimi K3相當但智能略高,因此被列入『智能與成本』效益最佳的模型名單中;不過快取(cache,重複資料可用較低成本再次讀取)命中價格從Grok 4.5的每百萬token 0.3美元調漲到0.5美元
LMArena(一個專門用真人投票方式,幫各家 AI 模型打分排名的評測機構)在 X(推特)發文指出,開源模型(就是原始碼和訓練參數都公開、任何人都能下載使用的 AI 模型)和商用付費模型(如 GPT、Claude 這類不公開內部細節的模型)之間的實力差距,已經縮到史上最小。在他們的 Code Arena: WebDev 排行榜(專門測試 AI 寫網頁程式能力的競賽場)裡,兩者差距從2025年底的約150分,壓縮到現在只剩約10分左右,等於開源模型已經快追上商用模型的寫程式能力。LMArena 也預告,即將公開權重(weights,也就是模型訓練完的核心參數檔案,公開後任何人都能下載自己跑)的開源模型 Muse Spark 1.2,以及另一款開源模型 Glimmer,可能會進一步影響這個排行榜的頂尖名次,正式分數即將公佈。
LMArena(AI 模型評測平臺) — 追蹤並比較 Code Arena: WebDev 排行榜上,開源與商用模型在網頁開發任務上的分數差距變化。結果:從2025年底約150分的差距,收斂到現在僅約10分,顯示開源模型的寫程式能力已大幅逼近商用頂尖模型
Claude的Compliance API(合規API,讓企業的資安、法務團隊可以透過程式介面調閱Claude的使用紀錄,用來做內部稽核或法律訴訟時的證據蒐集)已擴大涵蓋範圍。這項功能為Beta測試階段。這次擴充是「附加」性質,代表企業原本從Compliance API抓取的資料格式和方式完全不變,只是多了新的資料來源可以查。
企業的資安與合規團隊 — 過去企業已可透過Compliance API查看員工的Claude聊天紀錄;Cowork與Claude Code的使用階段則未涵蓋在內,形成稽核死角。。結果:現在新增的session端點會把Cowork和Claude Code的每一次使用階段,整合成一份完整的紀錄回傳,內容包含提示詞(prompt)、AI回應、工具呼叫(例如網頁搜尋、MCP外部工具串接)內容,以及使用者ID、信箱、組織ID、時間戳記等metadata(後設資料,也就是描述資料本身的資料),讓合規團隊能在同一套介面看到所有Claude使用紀錄,不用再為每個產品另外架設記錄系統。怎麼做:已啟用Compliance API的企業可直接用現有的Compliance Access Key查詢新的session端點;尚未啟用的企業需要先參考Compliance API文件申請開通。目前這個Beta不涵蓋網頁版的Claude Code、透過Claude Platform存取的Claude Code,以及跑在Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry上的使用階段
Anthropic官方部落格分享了公司內部業務開發(Business Development,簡稱BD,就是負責找客戶、談合作的業務團隊)如何用自家的Claude Cowork(一種可以幫忙自動執行重複性工作流程的AI助理功能)來處理大量的客戶開發工作。文章作者John Albert是Anthropic的業務開發代表,他說以前每天要花約5小時手動回覆客戶信件,現在把這些工作變成AI的『技能(skill,就是預先設定好、可重複執行的AI任務腳本)』和『排程任務(scheduled task,就是設定固定時間自動跑的AI工作)』,讓團隊把時間省下來做更重要的策略性工作。這篇文章比較像是公司內部案例分享,用來展示Claude在實際商業場景中的應用方式,而不是重大技術突破。
John Albert(Anthropic業務開發代表) — 以前每天花5小時手動回覆客戶詢問信件,現在設定一個每小時自動執行的收件匣技能,讓AI掃描業務代表的信箱、找出需要回覆的信件,並根據公司整理好的常見問答知識庫草擬回覆內容。結果:AI草擬的回覆會留給業務代表本人檢查、修改後再送出,大幅減少手動重複回覆的時間,讓團隊能把時間花在真正需要策略思考的客戶溝通上。怎麼做:這個技能由三部分組成:一段簡短的系統提示(system prompt,也就是告訴AI該怎麼做的指令)、公司整理的常見問答知識庫當作參考資料、以及每位業務代表自己的寫作風格檔案(透過另一個『語氣技能』讀取過去寫過的文件、訊息和郵件產生) Anthropic業務團隊 — 建立一個技能監看Gmail和Google日曆,偵測客戶『放鳥(no-show,約好會議卻沒出現)』或後續失聯的情況並主動通知業務代表。結果:業務代表能更快察覺客戶失聯並即時跟進,避免商機因疏於聯繫而流失 Anthropic業務團隊 — 用CRM(客戶關係管理系統)連接器讓AI掃描所有新進的潛在客戶名單,並自動草擬個人化的第一次聯繫訊息,這個技能會在一天中依排程多次執行。結果:確保不會有潛在客戶被晾在一邊等太久才收到聯繫 Anthropic業務團隊 — 建立一個技能,讀取公司內部關於Salesforce(一套常見的客戶關係管理軟體)商機階段的判斷準則,再對照Gmail和Gong(一種會議通話紀錄分析工具)裡實際發生的互動內容,判斷商機是否該推進到下一階段。結果:AI會提出每筆Salesforce更新建議並附上判斷依據,等待人工核准;若業務代表修改或拒絕建議,AI會記錄原因,避免同樣的判斷錯誤再次發生 John Albert(Anthropic業務開發代表) — 針對手上同時經營的上百個客戶帳號,設定一個每晚自動執行的排程任務,讓AI連接Salesforce、Apollo、Common Room等業務工具、Gong通話紀錄與公司資料倉儲,深入研究每個帳號目前的聯繫狀況、使用情形與相關訊號。結果:隔天早上打開Claude Cowork就能看到每個帳號的摘要簡報、評分和建議的下一步行動方案,且這個流程會隨業務代表持續提供回饋而越來越準確 Anthropic業務團隊 — 用一個技能對照Gong通話紀錄和公司的探索式銷售電話(discovery call)教戰手冊,替每通電話打分數卡。結果:分數卡會列出這通電話做得好的三件事、可改進的三個地方、是否通過標準的判定,以及下一次最該練習的一個重點 John Albert(Anthropic業務開發代表) — 有位業務主管(AE)臨時提出想找出他負責客戶群中可能對即將舉辦的『Claude Code for Data Engineering』網路研討會有興趣的帳號,這件事沒有現成的技能可用,作者直接下一個提示(prompt)請Claude處理。結果:Claude檢查了使用數據和CRM歷史紀錄,依照公司理想客戶輪廓(ICP)替每個帳號評分,並列出最適合邀請、且值得聯繫的窗口
美國科技媒體 Ars Technica 報導,數位資安公司 A Security 用公開可取得的 AI 模型(也就是一般人也能使用的 AI 工具),在2026年6月僅用不到20次提問(prompt,就是你打字問 AI 的那句指令)就找到 Zoom 視訊會議軟體的重大安全漏洞。這個漏洞出在螢幕分享時即時標註(annotation,就是開會時可以在畫面上畫重點的功能)所用的通訊協定,只要通話中有人分享螢幕,不論是主持人還是與會者,攻擊者都能在對方毫無察覺、完全不需要互動的情況下,遠端接管其裝置,而且影響 Windows、macOS、Linux、iOS、Android 全部平臺。A Security 共同創辦人 Omer Gull 表示,這種漏洞過去可能要一個五人團隊花六個月反覆試驗才找得到,現在用 AI 幾乎人人都能在很短時間內達到同樣結果,代表資安攻防的門檻正快速降低。
數位防禦公司 A Security — 用公開可取得的 AI 模型去分析 Zoom 螢幕分享時的即時標註功能,這類功能通常程式邏輯複雜、容易被人忽略,因此鎖定它來找漏洞。結果:不到20次提問就找到可讓攻擊者在受害者毫無互動、毫無察覺的情況下遠端接管裝置的安全漏洞,相較過去需要五人團隊花六個月才能做到同等成果,時間與人力成本大幅降低
這篇文章由 ngrok(一家做網路穿透服務的公司)部落格作者 Annie Sexton 撰寫,她整理了一個資訊論(研究「資訊要用多少位元才能表示」的數學理論)上的核心觀念:語言模型(LLM,就是 ChatGPT 這類會對話的 AI)做的事情,跟壓縮檔案(像把照片存成 zip 檔變小)在數學上其實是同一件事。她引用 DeepMind 在 2023 年發表的論文《Language Modeling Is Compression》佐證,該論文顯示一個叫 Chinchilla 70B 的大型語言模型,能把一組叫 ImageNet 的圖片資料壓縮到只剩原本 43.4% 大小,表現贏過專門設計來壓縮圖片的 PNG 格式(PNG 只能壓到 58.5%)。文章的核心公式是:AI 預測下一個字越準,需要用來記錄這個字的資訊量(位元數)就越少,所以「壓得越小」代表「AI 越聰明」;反過來也可以拿模型的壓縮效率,當作評斷這個模型有多聰明的量化指標,不必再單靠主觀的 benchmark(測驗題)打分數。但文章也指出現實限制:LLM 模型檔案動輒好幾 GB(十億位元組),部署與運算成本遠超過壓縮省下來的那點資料量,所以目前還不能直接拿 LLM 當一般人使用的壓縮工具來商業化。
adamgordonbell(Hacker News 用戶) — 他挑戰 Hutter Prize(一項比賽誰能把整套維基百科壓縮到最小容量就能得獎的競賽),嘗試用 LLM 的方式來壓縮維基百科文字內容。結果:他表示如果忽略掉「訓練出這個模型本身也要佔用很大容量」這個前提成本,LLM 在壓縮維基百科上的表現非常出色 PawelHuryn(X/前 Twitter 用戶) — 他向擔心長工作階段的使用者說明:Claude Code 在達到上下文視窗限制前,會自動將舊上下文壓縮成摘要。結果:Claude Code 會在真的塞滿之前,自動把舊的對話內容壓縮成摘要,讓工作可以繼續進行不中斷。怎麼做:可以在 ~/.claude/settings.json 這個設定檔裡加入 CLAUDE_AUTOCOMPACT_PCT_OVERRIDE 這個參數,自行調整要壓縮到多滿的時候才觸發自動摘要 csells(X/前 Twitter 用戶) — 進行了一場很長的 Claude Chat(網頁版對話)。結果:他發現 Claude 內建的壓縮機制到後面會直接放棄並跳出錯誤訊息,導致對話無法繼續,讓他覺得很不方便,於是他改用一款叫 Claude Exporter 的 Chrome 瀏覽器擴充套件,把整段對話另外下載成 Markdown 檔案保存起來
OpenAI(推出ChatGPT的公司)在2026年8月11日以公開預覽形式推出了ChatGPT的Linux桌面應用程式,支援Ubuntu、Debian、Fedora等主流Linux發行版,同時提供x64與ARM64兩種處理器架構的安裝包。這個應用把ChatGPT對話、ChatGPT Work(企業版功能)以及Codex(OpenAI的AI寫程式工具)三項功能整合在同一個介面裡,其中Codex支援直接讀取本機端的程式碼儲存庫,讓工程師可以在Linux電腦上直接用AI輔助寫程式。不過這款軟體是閉源的(原始碼不公開,外界無法檢查它到底傳輸了哪些資料),而且目前仍是不穩定的預覽版,OpenAI不建議用在正式重要的工作環境。這次推出的時間點,比競爭對手Anthropic推出Claude的Linux桌面測試版大約晚了一個月。
Hacker News使用者@taosx — 在官方版本推出前,自行把應用程式的安裝檔(asar,一種桌面程式常用的打包格式)解開後在Linux上使用了一段時間,藉此在同一個視窗介面裡於ChatGPT對話與Codex寫程式功能之間切換。結果:認為功能相當豐富,包含語音模式和瀏覽器功能可用,但自己平常很少啟動使用,覺得自己可能不是這款產品鎖定的主要目標用戶 Hacker News使用者@brettpro — 約一個月前試用當時尚未正式發布的Linux版本,測試它在Linux環境下的表現。結果:發現支援狀況很差:在沒有圖形介面的伺服器(headless環境)下登入功能完全故障,安裝包裡還寫死了固定的程式路徑、且需要root(系統最高權限)才能安裝,OpenAI在GitHub問題回報區也證實這不是他們當時的優先開發項目;後來他改用Incus(一套Linux容器管理工具)搭配自製的輔助腳本來繞過問題
Google DeepMind 官方部落格宣佈推出「SL2T」(sign-language-to-text,手語轉文字)模型,這是一個能把手語動作直接翻譯成文字的 AI(就是讓比手語的人不用打字,AI 直接看懂手語變成文字)。全球有超過200種手語、約7000萬名聾人及重聽人使用,過去語音AI技術進步很快,但手語一直被忽略,因為手語不是「用手打英文」,而是有自己文法和詞彙的獨立語言,AI 還要同時看懂手勢、表情、身體姿勢等全身動作,難度很高。SL2T 用超過10萬小時、涵蓋50多種手語的資料訓練而成,其中約四分之一是美國手語(ASL),目前先透過 Google Pixel 11 手機的 Gboard輸入法與 Live Transcribe(即時字幕)App 推出 ASL 轉英文功能,未來會支援更多手機和手語種類。
Google Pixel 11 使用者(聾人或重聽人) — 用手比美國手語對著手機鏡頭,取代打字,可以用來搜尋網路、寫訊息或文件、對 Gemini(Google的AI助理)下指令。結果:根據 DeepMind 內部測試者反饋,用ASL比手語輸入比打英文字更快、更自然、更順手;在對話情境中(Live Transcribe),也可以直接比手語回覆,不用手動打字往返。怎麼做:手機端先用 MediaPipe Holistic(一種姿態追蹤技術)在裝置上追蹤使用者身體各點的位置,只把這些幾何座標(不是原始影像,保護隱私)傳到伺服器做翻譯,SL2T 再把這串座標直接翻成文字,不經過中間的「手語標記」(gloss)步驟 DeepMind 研究團隊(含 Sam Sepah 等聾人 Google 員工) — 在 FLEURS-ASL(sd-test)這個標準測試集上評估 SL2T 的 ASL 轉英文翻譯品質。結果:SL2T 在零樣本(zero-shot,即完全沒針對該測試集額外訓練)情況下拿到 70 分 BLEURT(一種衡量翻譯品質好壞的分數),明顯高於過去任何已公開的成績,同時也特別優化了左撇子比手語、單手比手語(例如另一手拿著手機時)等實際使用情境
使用者只要在 Gemini 裡開啟各服務的連結功能,就能直接完成訂餐廳、找醫生、聽音樂等日常任務,不用再切換到各個 App。這次開放連接的服務涵蓋生產力、生活娛樂、音樂、居家健康等多個類別;Google 表示,目標是讓使用者在同一個地方規劃、創作並完成待辦清單。
Granola、Otter.ai、Wix 使用者 — 在 Gemini 中連接這些生產力與創作工具。結果:可以直接用 Gemini 摘要會議內容(Granola、Otter.ai 是會議記錄與轉錄工具)、編輯自己的網站(Wix 是建站平臺) 想安排休閒活動的使用者 — 連接 Fever、GetYourGuide、Localiza、OpenTable(英國)、Ticketmaster。結果:可以在 Gemini 裡直接預訂當地體驗活動、租車、訂餐廳,並搜尋活動門票 喜歡聽音樂的使用者 — 連接 iHeartRadio 與 Pandora。結果:可以在 Gemini 裡發掘新電臺、直接播放喜歡的歌單 需要居家與健康服務的使用者 — 連接 Angi、Thumbtack、Zocdoc。結果:可以在 Gemini 裡找到居家維修等專業人員(Angi、Thumbtack 是媒合師傅的平臺),或直接預約看診(Zocdoc 是掛號平臺)
Cactus Compute(一間做小型裝置AI推論的團隊)在GitHub上發布了Needle 2,這是一個只有14MB大小的「基礎模型」(foundation model,指可以直接拿來用、不用再重新訓練的通用AI模型),專門設計給手機、穿戴裝置、智慧家庭裝置和機器人這類記憶體和運算能力有限的小型裝置使用。它的參數量(就是模型裡用來記住知識的數字量,越多通常代表模型越聰明但也越肥大)只有4500萬個,跑起來整個對話只需要大約28MB記憶體,比市面上其他小型模型(例如FunctionGemma 270M、LFM2.5 230M)小上5到70倍。這個模型的專長是「工具呼叫」(tool calling,就是讓AI在對話中自動幫你操作外部程式或抓資料,例如查天氣、轉帳)和從文字中抽取結構化資料(例如把一張發票的文字內容整理成「廠商、金額、到期日」這種固定格式)。開發者可以透過Python套件cactus-needle直接安裝使用,模型權重是自帶壓縮在14MB的執行檔裡,不需要額外下載管理模型檔案。
開發者(範例程式碼作者) — 用needle.tool這個裝飾器把一個Python函式(例如查詢城市天氣的get_weather函式)包裝成AI可以呼叫的工具,函式的說明文字(docstring)會被AI讀來判斷什麼時候該呼叫這個工具。結果:執行agent.run("what's it like in Lagos right now?")後,模型自動判斷要呼叫get_weather工具、餵入正確參數,並把結果(例如「Lagos氣溫27度、晴朗」)整理回傳,不需要人工介入判斷或解析。怎麼做:import needle @needle.tool def get_weather(city: str): "Get the current weather for a city." return {"city": city, "temp_c": 27, "sky": "clear"} agent = needle.Needle(tools=[get_weather]) print(agent.run("what's it like in Lagos right now?")["results"])
Embabel 團隊(由 Spring 框架創辦人打造)在 GitHub 上發布了開源專案 Embabel Agent,這是一套讓 Java/Kotlin 開發者在 JVM(也就是執行 Java 程式的底層環境)上建立「AI 代理」(agent,能自主規劃並執行多步驟任務的 AI 程式)的框架。它的特色是把 LLM(大型語言模型,就是 ChatGPT 這類會對話生成文字的 AI)的提示互動,跟一般程式碼與資料模型混合在一起使用。跟其他代理框架不同的是,Embabel 不是用固定流程圖(有限狀態機)跑死板步驟,而是用一套非 LLM 的 AI 演算法即時「規劃」,每執行完一個步驟就重新評估下一步該怎麼走,類似機器人學裡常講的 OODA 循環(觀察、判斷、決策、行動的迴圈)。目前專案在 Maven Central 已有正式版本,並附有完整文件與 Discord 社群。
Embabel 官方 — 打造了一個線上文件問答服務 hub.embabel.com,本身就是用 Embabel 框架做出來的一個 AI 代理。結果:使用者可以直接用自然語言問框架的用法問題,由這個 Embabel 代理即時回答,等於用自己的產品展示自己的能力
這是 infiniflow 團隊開發的開源專案 RAGFlow,是一套 RAG(Retrieval-Augmented Generation,讓 AI 回答問題前先去查資料庫、避免憑空亂答的技術)引擎,它把 RAG 和 Agent(能自主執行多步驟任務的 AI)能力結合在一起,目的是幫企業把雜亂的資料轉換成可靠、可直接上線的 AI 系統。這個專案曾登上 GitHub Trending(GitHub 上當日最多人關注的專案排行榜)。專案持續在更新支援的功能,例如串接 Feishu、Discord、Telegram、Line 等聊天平臺,支援 DeepSeek v4、Gemini 3 Pro、GPT-5 系列等多種模型,也加入了 AI 代理的「記憶」功能、資料解析工具 MinerU 與 Docling,以及可從 Confluence、S3、Notion、Discord、Google Drive 同步資料的能力。
infiniflow 團隊 — 開發並持續維護 RAGFlow,將文件切塊(chunking,就是把長文件拆成小段方便 AI 檢索)、模型串接、多平臺聊天機器人整合等功能整合進同一套開源系統。結果:開發者可以用 Docker 快速自架服務,或使用官方雲端服務 cloud.ragflow.io,把企業內部文件變成能被 AI 準確查詢、回答問題的系統,取代過去自行拼湊多個工具的做法
Lightricks 在 GitHub 上發布了 LTX-2 的官方 Python 推論與 LoRA 訓練工具包。LTX-2 是一個以 DiT(Diffusion Transformer,一種結合擴散模型與 Transformer 架構的生成技術)為基礎的影音生成模型,特別之處在於它能生成「同步的影片畫面和聲音」,也就是影片裡的人講話時,嘴型、聲音、音效會同步出現,而不是隻生成無聲影片。這個專案目前是 GitHub Trending 每日排行榜第 5 名(Python 語言類別),代表短時間內受到大量開發者關注。使用者可以透過 Hugging Face(一個存放 AI 模型的公開平臺)下載模型權重(約 66GB),並用官方提供的指令列工具直接生成影片。
任何取得程式碼與模型權重的開發者 — 依照官方 Quick Start 教學,先用 git clone 下載程式碼,再用 uv sync 安裝環境,接著從 Hugging Face 下載約 66GB 的模型檔案(包含影像生成、文字理解、影音編碼等多個子模型檔)。結果:執行一行指令並輸入文字描述(prompt),就能生成一段有同步人聲、音效與影像的短片,例如官方範例是生成一位戴棒球帽男子對著鏡頭講話並帶有吸鼻子聲音的影片。怎麼做:git clone https://github.com/Lightricks/LTX-2.git 後執行 uv sync --extra natten 安裝依賴;下載模型後執行 uv run python -m ltx_pipelines.distilled 並帶入 --transformer-path、--text-encoder-path 等模型路徑參數,加上 --prompt "文字描述" 即可生成影片;若 GPU 記憶體不足可加 --quantization fp8-cast --offload {cpu, disk} 參數降低負擔
Kronos 是 GitHub 上一個開源專案(作者 shiyu-coder),推出的是第一個開源的金融K線基礎模型(foundation model,指先在大量資料上預先訓練好、之後可再微調去做各種特定任務的通用AI模型);「K線」就是股票、加密貨幣等市場常見的蠟燭圖走勢資料,記錄開盤、收盤、最高、最低價與成交量。這個模型用了超過45個全球交易所的資料訓練而成,論文已發表在 arXiv,並已被 AAAI 2026(人工智慧領域重要學術會議)接受。它的做法分兩階段:先用一個特製的「分詞器」(tokenizer,就是把資料切成AI看得懂的小單位)把連續的K線數值資料轉成一串串離散的代碼,再用一個大型的Transformer(目前主流AI模型的架構)在這些代碼上做預訓練,讓模型能同時處理多種金融量化分析任務,例如預測未來價格走勢。
Kronos 開發團隊 — 建立了一個線上展示網站,示範用 Kronos 模型預測 BTC/USDT(比特幣兌泰達幣)這個交易對未來24小時的走勢。結果:使用者可以直接在網頁上看到模型產生的價格走勢預測圖,不需要自己架設環境。怎麼做:官方提供 Live Demo 連結(https://shiyu-coder.github.io/Kronos-demo/),也提供 pip install -r requirements.txt 安裝依賴,並可用幾行 Python 程式碼(載入 KronosTokenizer 與 Kronos 模型、建立 KronosPredictor)即可對自己的資料做預測
AllenAI(艾倫人工智慧研究所)在其OlmoEarth Studio平臺(一個用來分析衛星等地球觀測影像的AI工具)發布新功能,讓使用者能計算並匯出「嵌入向量」(embedding,就是把複雜的影像資料轉成一串數字,讓電腦能快速比較兩塊地表像不像)。這些嵌入來自他們開源的OlmoEarth基礎模型(一種先在大量資料上預先訓練、之後可套用到各種任務的AI模型),程式碼和模型權重都公開,任何人都能檢視運作方式。使用者可以在網頁介面或API選擇感興趣的區域、時間範圍、模型大小、解析度和影像來源(如Sentinel-2衛星影像),系統就會產生一份COG格式(一種可被地理資訊軟體讀取的雲端優化影像檔)的結果,可直接用QGIS、GDAL、rasterio(Python的地理影像處理套件)等常見地理工具開啟使用。若需要更精準的效果,Studio也支援監督式微調(SFT,用少量標註資料進一步訓練模型,讓它更貼合特定任務)。
AllenAI研究團隊 — 在加州Merced附近選一個城市地區的像素當查詢點,計算它與周邊每個像素嵌入向量的餘弦相似度(一種衡量兩組數字方向像不像的方法,數值愈接近1代表愈像)。結果:產生的熱力圖能清楚區分出城市建築與道路,農業地塊則明顯不同,完全不需要任何人工標註資料 AllenAI研究團隊 — 在越南Ca Mau紅樹林沿海地區僅標註60個像素(紅樹林、水域、其他各20個),訓練一個簡單的邏輯迴歸分類器(一種基礎的機器學習分類方法),對整個區域每個像素做預測。結果:僅用60個標註像素就產生出一致的土地覆蓋地圖,加權F1分數達0.84(分類準確度指標,愈接近1愈準),且把標註數量從30增加到300,準確度幾乎不變,代表嵌入向量本身已包含大部分有用資訊。怎麼做:用rasterio讀取匯出的192波段嵌入COG檔案,reshape成(像素數,192)的矩陣,搭配scikit-learn的StandardScaler做特徵標準化,再訓練LogisticRegression(max_iter=2000)分類器,最後對全部像素做predict AllenAI研究團隊 — 針對加州Butte郡同一區域,分別計算2023年9月與2024年9月的Sentinel-2月度嵌入,並測量每個像素的餘弦距離(衡量前後變化程度)。結果:2024年7至9月發生的Park Fire野火燒毀範圍立刻在結果中清楚顯現,不需要任何訓練或標籤資料,只需兩份嵌入檔案和幾行Python程式碼 AllenAI研究團隊 — 對荷蘭Flevoland(一塊人工填海造陸的農業區)的嵌入資料做主成分分析(PCA,一種把高維度資料壓縮成少數幾個代表性維度的技術),把結果對應到紅綠藍三色顯示成假色影像。結果:影像高度還原出當地規則的農地格線,不同作物類型、水域與城市區域各自呈現不同色調,模型在完全沒被告知「地塊」或「作物」概念的情況下自行學會了這些地表結構
Liquid AI(一家專注打造能在手機、筆電等裝置本機上運行的小型AI模型的公司)在Hugging Face(AI模型分享平臺)發布了新模型LFM2.5-VL-3B,這是一個VLM(視覺語言模型,就是能同時看懂圖片又能用文字聊天的AI)。它主打能在裝置端(不用連雲端伺服器、直接在手機或筆電上跑)快速執行,強項包括看懂手機或電腦螢幕畫面、抓出圖片中物件的位置(叫grounding,即根據文字描述指出圖片中對應的區域)、同時理解多張圖片,以及呼叫外部工具(function calling,就是AI能自己判斷要呼叫哪個程式功能來完成任務)。官方表示這顆30億參數的模型用了34兆個訓練資料(token,可理解為文字或圖像被切成的小單位)訓練而成,在多項公開評測(benchmark,即用來比較不同AI模型表現好壞的標準測驗)中,同量級模型裡表現名列前茅。
Liquid AI官方 — 在蘋果M5 Max筆電、AMD Ryzen AI Max+ 395處理器、三星Galaxy S26 Ultra手機等裝置上實測LFM2.5-VL-3B的運行速度。結果:在M5 Max上每秒可產生228個token,在Ryzen AI Max+ 395上每秒116個token,記憶體佔用約3GB;即使在Galaxy S26 Ultra手機上也能達到每秒20個token,代表模型可以完全在手機上離線運行,不需要網路連線或雲端伺服器 Liquid AI官方 — 提供開發者用Python的transformers套件載入並執行LFM2.5-VL-3B,讓模型看一張圖片並用兩句話描述內容。結果:官方範例顯示,模型看了一張沙發上兩隻貓咪的照片後,正確輸出「Two cats are sleeping on a pink couch with two remote controls.」(兩隻貓在粉紅色沙發上睡覺,旁邊有兩個遙控器)。怎麼做:安裝 pip install -q torch torchvision accelerate transformers>=5.10.1,接著用 AutoModelForImageTextToText 與 AutoProcessor 從 LiquidAI/LFM2.5-VL-3B 載入模型,將圖片與文字提示打包成訊息後呼叫 model.generate 產生描述文字
IBM Research 在 Hugging Face 官方部落格發表文章,介紹他們開發的 ALTK-Evolve 技術,並和另一套業界方法 ACE(Agentic Context Engineering)做比較。這兩套技術都是讓 AI 代理(agent,就是能自己執行多步驟任務的 AI,例如自動幫你查資料、下單、對帳)從過去做過的任務經驗中「學到教訓」,下次遇到類似狀況就不會再犯同樣的錯,而且不需要重新訓練模型。差別在於 ACE 每次都把整本「教訓手冊」全部塞給模型看,ALTK-Evolve 則只挑出當下任務真正用得到的幾條教訓給模型看,結果準確率差不多甚至更好,但花費的 token(可以理解成 AI 讀寫文字要付的計費單位,越多越貴越慢)大幅減少。IBM Research 表示這代表『教訓不用刪減,但不用每次都全部塞給模型看』是可行的路線。
IBM Research 團隊 — 在 AppWorld 這個模擬九款手機App、要求 AI 代理完成分帳、找歌、對帳等真實多步驟任務的測試基準上,分別讓同一個 ReAct 代理(每一步會自己寫程式碼呼叫工具的 AI 代理)搭配 ACE 或 ALTK-Evolve 的記憶技術,測試強模型 DeepSeek-V3.2 和較弱的 gpt-oss-120b 兩種情況。結果:在強模型 DeepSeek-V3.2 上,ALTK-Evolve 任務完成率 89.3%(ACE 為 80.4%),且只用了 ACE 約4成的 token(26.3萬 vs 63.4萬);在較弱模型 gpt-oss-120b 上兩者準確率打平(56.0% vs 54.8%),但 ALTK-Evolve 只用了 ACE 約七分之一的 token(11.6萬 vs 77.7萬)
DeepSeek 官方 API 文件宣佈,其 API 現在支援「Responses API」這種請求格式(這是 OpenAI 訂出的一種 AI 對話請求/回應規格,讓開發者可以用同一套程式碼串接不同家的 AI 模型),並把 base_url 指向 DeepSeek 自家伺服器。這個更新主要是為了讓 DeepSeek 的模型能被整合進「Codex」(一種 AI 輔助寫程式的工具)使用。文件提到目前可呼叫的模型名稱包含 deepseek-v4-flash 與 deepseek-v4-pro,顯示 DeepSeek 已推出新一代 V4 系列模型。文件也詳細列出哪些 OpenAI 原本的參數(例如串流 stream、推理強度 reasoning effort、工具呼叫 tool_choice 等)DeepSeek 有支援、部分支援或完全不支援,方便開發者評估相容性。
使用 Codex 等工具的開發者 — 想在原本呼叫 OpenAI Responses API 的程式裡改用 DeepSeek 模型。結果:只需把 base_url 換成 https://api.deepseek.com、model 換成 deepseek-v4-flash 或 deepseek-v4-pro,其餘程式碼幾乎不用改,因為 DeepSeek 相容同一套請求格式,且不支援的參數會被靜默忽略而不會噴錯。怎麼做:安裝 openai 這個 Python SDK(pip3 install openai),設定 client = OpenAI(api_key="
根據Known Agents公司發布的「Agentic Web Index」(業界代理網路指標,一個監測超過5000個網站AI機器人流量與資安狀況的儀錶板),網站流量中會出現「冒名」(spoofing)造訪:來訪者宣稱自己來自某個已知AI機器人,但未能通過該機器人支援的驗證方式(例如已驗證的IP位址或Web Bot Auth)。Known Agents表示,驗證失敗代表該次造訪很可能是假冒者所為,但無法確認實際發出請求的軟體或幕後操作者是誰。該儀錶板也會列出最常被冒用的AI機器人身份與近期熱門的目標路徑,顯示冒名流量是網站上可觀察到的一種現象。
Known Agents — 在其Agentic Web Index儀錶板中加入「Spoofing 與 Security」(冒名與資安)監測項目,追蹤哪些知名AI機器人身份最常被冒用、以及被鎖定掃描的網站路徑。結果:讓參與監測的網站經營者能分辨出真正經過驗證的AI機器人流量,跟冒充身份但驗證失敗的可疑流量,並可能有助於及早察覺冒名或異常的造訪模式。
這是一位獨立開發者(部落格網域 chad.cm,本文作者自稱同時經營多個產品與一個非營利組織)分享自己如何用六個AI agent(就是能自己執行任務、不只是聊天回答的AI程式)組成一支「虛擬員工團隊」,取代原本需要僱用更多員工或志工才能做的工作。這六個agent分別負責行政提醒與行事曆管理、監控網站錯誤與效能、寫程式、行銷(看流量和社群數據)、網路搜尋做研究、以及伺服器維運。它們都跑在一臺便宜的雲端主機(DigitalOcean,一種雲端伺服器租用服務)上,透過一個叫Buzz的開源類Slack聊天軟體互相溝通、也跟作者本人溝通。作者也誠實提到,這套系統花的設置時間是自己動手做的十倍,目前投資報酬率其實是負的,但他認為「先把工廠蓋起來」這件事本身有長期價值。
ops-agent(負責監控維運的agent) — 當作者的網站因程式錯誤、延遲過高等問題在Sentry(一套錯誤監控工具)產生警報時,Buzz會自動把警報訊息貼進聊天室並@ops-agent。結果:ops-agent會跨Sentry、Cloudflare(網路服務商)和程式碼分析根本原因、生成報告並嘗試修復問題,不過目前這個流程仍完全由作者本人在旁監督確認,還沒完全自動化。怎麼做:作者附上實際的Buzz workflow設定範例:trigger設為webhook,收到Sentry建立事件時,傳送格式化訊息並標註「@ops-agent please triage」,附上issue id、標題與連結,要求ops-agent用Sentry的MCP(一種讓AI存取外部工具資料的協定)查詳情 dev-agent(負責寫程式的agent) — 作者在外面用手機看到自己網站有問題或想到新點子時,直接在Buzz上丟給agent處理。結果:不需要打開電腦寫程式就能把簡單的開發任務外包出去完成,作者也提到下一步想串接Linear(專案管理工具)的工單,做到「工單進去、PR(程式改動請求)出來」全自動 ea-agent(作者的行政助理agent) — 每天查看Linear工單、行事曆和前一天的對話紀錄。結果:整理出作者當天該優先處理的工作,形成「晨間工作簡報」 gtm-agent(行銷agent) — 每天檢視社群內容行事曆。結果:提醒作者內容排程上有哪些空缺、並能建議可發布的內容 研究與提醒任務 — 作者只要用手機App說「ea-agent,明天提醒我這件事,回應前持續提醒」,或「research-agent,去幫我深入研究某個主題」。結果:不用自己動手查資料或設提醒,agent會主動追蹤並回報 vps-agent(伺服器維運agent) — 每天檢視前一天所有Buzz對話紀錄,包含私訊。結果:整理出一份晨間報告,列出已完成、進行中、需要作者關注的事項;作者可以直接回覆「去做第2、3項,第4項明天提醒我,第8、10項建Linear工單」讓agent接續執行
開發者 Derek Anderson 在自己的部落格分享,他改造了 Automatic1111(簡稱 A1111,一款開源的 Stable Diffusion(一種能用文字生成圖片的 AI 模型)操作介面)在蘋果 M 系列晶片上的執行效率。他不想放棄 A1111 現有的介面、模型、外掛生態,也不想像 Draw Things(另一套蘋果原生的繪圖 AI 軟體)那樣整個重寫,而是隻針對其中最耗時的幾個環節,改用蘋果的 Metal(蘋果提供給開發者直接操控顯示晶片運算的底層技術)來加速。他花了大量篇幅描述自己嘗試了很多優化方法,但最後把大部分「看起來應該更快」的東西刪掉了,因為實測後發現沒有效果甚至更慢,只留下真正有效的少數幾項改動。這篇文章對一般人來說可以理解成:同一套繪圖軟體,換個底層引擎接法,讓蘋果電腦跑得更快,而使用者完全不用換軟體或重新設定。
Derek Anderson — 在自己的 M3 Pro 筆電上,用 A1111 執行五步驟的 Stable Diffusion 1.x 圖片生成(DPM++ SDE 取樣器、CFG 約 1.15、解析度 384x640 或 512x512),比較改造前後的生成耗時。結果:生成時間從原本約 8 到 10 秒,降到約 3 到 7 秒;他強調這是觀察到的範圍而非嚴謹對照的科學測試 Derek Anderson — 在 M1 Mac mini 上,用完全相同的模型、取樣器、步數、CFG、解析度等設定,對比官方版 Automatic1111 與他自己改造的 Metal 版本各跑一次生成。結果:官方版耗時 12.8 秒,改造版耗時 8.7 秒,延遲降低約 32%(即生成速度提升約 1.47 倍) Derek Anderson — 嘗試把注意力運算(attention,AI 模型判斷圖片各部位關聯性的核心計算)的部分改寫成蘋果專用的 Metal 版本,並把多個小型 GPU 指令合併成一個大指令一起送出(而不是每算一次就送一次),同時依照電腦當下可用的記憶體大小動態決定要不要用這個新方法。結果:減少了 GPU 與程式之間頻繁溝通造成的延遲,是整體加速中最關鍵的一項改動。怎麼做:程式邏輯大致是:當是推論模式、使用半精度浮點數、且注意力矩陣形狀符合特定大小時,才呼叫 Metal 加速版本,否則照舊走 PyTorch 原本的計算路徑 Derek Anderson — 嘗試把常見的兩個影像正規化運算(GroupNorm 和 SiLU)合併成一個自訂的 Metal 運算核心,一次做完不用分兩次呼叫。結果:減少了中間結果寫出又讀回的浪費,是少數保留下來的優化之一 Derek Anderson — 嘗試把多個運算包裹在一起打包送給 GPU(packed QKV projections),以及嘗試把整個殘差區塊搬進蘋果的 MPSGraph 引擎裡一次執行。結果:這兩項在小範圍測試時看起來有機會更快,但實際跑完整張圖生成後反而變慢(例如 MPSGraph 版本從 9.5556 秒變成 9.6533 秒,慢了約 1%),因此最終都被他捨棄、沒有放進最終版本
部落客 Florian Herrengt 在自己的部落格發文(後登上 Hacker News 熱門討論,370 讚、305 則留言),分析 AI 編碼工具(像 Claude 這種能寫程式的 AI)對軟體工程師職涯的衝擊。他認為以前寫程式的速度有天花板,團隊裡能力不足的工程師頂多拖慢進度,但現在有了 AI agent(能自主執行多步驟任務的 AI 程式),一個人一個下午就能生出兩萬行程式碼,卻沒人真正理解這些程式碼在做什麼。結果是:技術債(為了求快而留下、以後要花更多力氣償還的爛程式碼)累積速度遠超過去,而且一旦出錯,連工程師自己都要反問 AI「這段資料到底哪裡來的」才能回答問題。作者認為這會讓「中產階級工程師」(能把需求轉成程式碼、但缺乏架構判斷力的人)快速貶值,真正值錢的是那些能做出正確判斷、看得懂系統全貌的資深工程師,未來薪資會朝兩極化發展。
作者虛構的一個工程團隊情境(用來說明現象,非真實企業案例) — 團隊成員大量使用 AI agent 自動產生程式碼,一次 PR(Pull Request,即提交給團隊審查的程式碼變更)動輒新增兩萬多行、刪除近四千行,附上 AI 自動寫的變更說明。結果:程式碼量暴增但沒人真正理解架構;出現使用者回報的怪異 bug 時,連原作者都要重新詢問 AI「資料從哪來」,兩人一起盯著 AI 的落落長回答卻無法判斷真假,最終只能靠翻閱一整串 AI 對話紀錄去拼湊當初的設計決策,技術債難以清理
OpenRouter 官方部落格文章提到一個網頁搜尋效能排行榜。當你要打造一個能自己上網查資料的AI代理人(agent,也就是能自主執行任務的AI程式)時,需要決定要用哪個模型來寫查詢、用哪個搜尋引擎(例如Exa、Parallel、Perplexity,或是OpenAI、Anthropic、Google自帶的搜尋功能)、要用哪種搜尋方式,以及給AI幾次搜尋機會(搜尋預算)。OpenRouter用四種測驗(包含高難度事實查找、多步驟研究問題、大範圍資料收集、專家級考題)反覆測試各種模型、引擎、搜尋次數的組合,把品質、花費、速度都列出來,方便開發者依自己的需求挑選最划算的搭配,而不用自己花錢花時間逐一測試。
OpenRouter官方團隊 — 用Perplexity搜尋引擎,分別讓Claude Opus 5、GPT-5.6 Sol、GPT-5.6 Luna三個模型在困難的事實查找測驗(BrowseComp)中,各自嘗試1次、5次、25次搜尋機會。結果:搜尋次數從1次提高到25次,答對率大約翻倍(例如Claude Opus 5從35.8%提高到89.0%),但花費只增加2.5到7倍,是提升品質中最划算的做法;不過在較簡單的任務(如HLE專家考題)上,增加搜尋次數對GPT-5.6 Sol幾乎沒有幫助,卻要多付三倍的錢 OpenRouter官方團隊 — 分析25次搜尋預算下,模型答對和答錯時分別平均用掉幾次搜尋。結果:答錯的情況平均用掉更多次搜尋(例如WideSearch任務答錯時平均用23.4次、答對時只需17.6次),顯示AI在找不到答案時會把搜尋預算都用光仍然失敗,若任務失敗率高,縮減搜尋次數反而能省錢 OpenRouter官方團隊 — 固定搜尋預算為25次,比較同一模型換用不同搜尋引擎(Perplexity、Exa、Parallel)的表現。結果:平均而言,固定模型只更換搜尋引擎,分數約差10分;而前沿模型與成本較低的模型之間的平均差距則更大,約15分。也就是說,以平均數據來看,模型選擇帶來的分數差距比引擎選擇略大,顯示選對模型比選對搜尋引擎更重要。。怎麼做:開發者可在 OpenRouter 設定 engine 參數指定 exa、parallel、perplexity、native 或 auto;其中 auto 會先試各家原生搜尋、失敗才轉用第三方(不是 native)。並可用 max_tool_calls 參數設定 AI 最多可搜尋幾輪、用 max_results 設定每次搜尋回傳幾筆結果。
中國科學院自動化研究所紫東太初大模型團隊發表了一種新的多模態模型(能同時理解圖片和文字的AI)壓縮技術,叫GMC(意思是把大量視覺Token用一種聰明的方式合併、只留下最有用的部分)。背景是這樣的:AI在理解一張圖片時會把圖片切成好幾百甚至上萬個小碎片(叫Token,可以想成AI理解圖片的最小單位),這些碎片越多,AI計算就越慢、越吃顯存(就是顯卡的記憶體空間)。以前業界常用的做法是隻挑分數最高的碎片、丟掉其他的,但這樣容易把文字、數字這類不顯眼但重要的信息弄丟,導致AI看圖看錯、編造不存在的內容(業界叫視覺幻覺)。GMC不是簡單丟棄碎片,而是把要丟掉的碎片裡的有用信息,轉移合併到保留下來的碎片上,做到砍掉大量碎片但信息幾乎不丟失,而且不需要重新訓練模型,裝上就能用。
紫東太初大模型團隊 — 在Qwen2.5-VL-7B這款開源視覺語言模型上應用GMC,把原本1296個視覺Token砍掉80.2%、只留256個。結果:模型仍保留了完整版97.78%的平均能力;若進一步砍掉90.1%只留128個Token,仍能保持99.11%的能力 紫東太初大模型團隊 — 在另一款模型LLaVA-1.5-7B上,分別只保留128個和64個視覺Token做測試。結果:平均性能分別達到完整模型的99.76%和99.82%,證明這個方法能搬到不同架構的模型上用 紫東太初大模型團隊 — 針對長文檔問答場景,處理一份包含15876個原始視覺Token的文件。結果:在保持98.87%問答質量的同時,推理速度加快1.258倍,且減少73.94%的KV Cache(顯卡裡暫存計算結果用的記憶體)佔用
中國量子位(qbitai)報導,新能源大廠遠景科技集團在內蒙古烏蘭察布蓋出了目前全球最大的AI算力「超級單體」(就是把數十萬甚至上百萬張GPU晶片集中放在同一棟建築裡運算的超大型機房),已於8月6日正式投產。這棟建築面積超過12萬平方公尺,相當於20座標準足球場,所在的「星河基地」規劃總用電容量達2GW(十億瓦,大約是一座中型城市的用電量),設計目標是支撐上百萬張AI晶片同時並行運算。文章指出,過去蓋AI機房的多半是電信商、專業機房開發商或科技大廠,這次卻是一家新能源公司出手,關鍵原因是AI機房的瓶頸已經從「有沒有晶片」轉移到「有沒有穩定又划算的電力」——訓練任務動輒跑好幾週,只要供電不穩、電壓波動,整個運算叢集就可能中斷,得花額外時間重新載入進度,成本很高。
遠景科技集團 — 在烏蘭察布當地風力和太陽能資源豐富(全域綠電佔比達67%)的地點,自建風電場並拉專線,把綠電直接送進資料中心,再用「遠景天機」氣象大模型(用AI預測未來風力、日照變化的模型)預測發電量、「遠景天樞」能源大模型負責即時調度用電,加上EnOS物聯網系統把風機、儲能、供電設備和運算設備串在同一套控制系統裡,並採用800V直流供電方案減少電力轉換過程中的耗損,同時依機櫃密度混用風冷、液冷及當地天然冷源來散熱。結果:經遠景測算,同樣面積下的算力輸出可以達到傳統資料中心的10倍;公司規劃到2030年要在全球戈壁荒漠地區蓋出5GW規模的綠色AI算力中心,烏蘭察布這座基地是第一步
Unsloth(一家專注於讓 AI 模型訓練和推論更省資源的公司)推出了 Unsloth Desktop,這是一款開源(原始碼公開、任何人都能檢視和使用)的桌面應用程式,可以在 Mac、Windows、Linux 上本機(不用連網、不用把資料傳到雲端伺服器)執行和訓練 AI 模型。它支援 MLX、GGUF 等模型相關技術,也支援圖片、影片、語音生成,並可用一般 CPU 或多張顯示卡運作。這款軟體的野心不只是做一個「本機聊天介面」,還內建工具呼叫(讓 AI 自動執行外部程式或指令)、沙箱程式碼執行(在隔離安全環境中跑程式碼避免影響電腦本體)、私人網路搜尋、RAG(讓 AI 回答前先查資料庫、避免憑空捏造)、MCP(一種讓 AI 與外部工具或資料源串接的標準協定)等進階功能,並宣稱訓練速度可達 2 倍、且顯示卡記憶體用量減少 70%。
Unsloth 官方 — 推出 Unsloth Desktop,讓使用者在自己的電腦上(而非透過雲端服務)執行與訓練各種 AI 模型,並可將 Claude Code、Codex 等工具連接到本機模型使用。結果:根據官方宣稱,工具呼叫準確度提升 50%,且具備自我修復能力;訓練速度提升至 2 倍,顯示卡記憶體用量減少 70%;多位觀察者認為這使其定位更接近一套完整的本機 AI 作業環境,而非僅是 LM Studio 的競爭產品。怎麼做:軟體已在 unsloth.ai 及 GitHub(github.com/unslothai/unsloth)上架,並提供部落格與使用教學(unsloth.ai/docs/desktop)
LlamaIndex(一家專門做AI文件處理工具的公司)的應用研究團隊發表了ExtractBench,這是一個用來測試「AI從複雜企業文件裡自動擷取資料」能力的評測基準(benchmark,就是一套標準化的考題,用來公平比較不同AI系統誰做得好)。他們用370份企業文件(涵蓋金融、能源、政府、汽車等領域,共4869頁、67種文件類型)去考14套不同系統,包括市面上最先進的VLM(視覺語言模型,就是能同時看懂圖片/掃描文件又能讀文字的AI)、會自己規劃步驟的coding agent,以及專門做文件擷取的API服務。最關鍵的發現是:短文件很容易讓系統的缺陷被隱藏起來,一旦文件超過50頁,市面上商用VLM的召回率(recall,也就是「該抓到的資料有多少比例真的被抓到」)會暴跌到35%以下,原因是AI在處理長表格時會「靜悄悄」漏掉一堆列而不出聲提醒,但同時精確率(抓到的資料裡有多少是對的)卻還能維持很高,等於是「抓得準但漏得多,還完全不會告訴你漏了」。LlamaIndex同時在自家產品LlamaParse裡推出新的擷取等級「Agentic Plus」,宣稱在這個基準上拿下第一名,準確率達95.6%,而且成本只要第二名的三分之一不到。
LlamaIndex應用研究團隊 — 打造ExtractBench基準,找來370份企業文件(4869頁、67種文件類型),對14套系統(含商用VLM、coding agent、專門擷取API)進行測試;評分時完全不靠LLM當評審、具備確定性與可重現性,衡量項目包括資料值準確率、長表格完整度、空間定位(能不能精準指出資料在文件哪個位置,方便日後稽核)與每頁處理成本。結果:發現商用VLM在文件超過50頁時召回率會崩到35%以下(因為悄悄漏抓表格列),而精確率卻維持很高,等於是系統會讓人誤以為它做得很好、實際上漏了大半資料卻不會示警;相對地,LlamaIndex自家新推出的Agentic Plus擷取等級以95.6%準確率排名第一,成本不到第二名的三分之一。怎麼做:可透過部落格文章、GitHub開源倉庫(run-llama/ExtractBench)與HuggingFace資料集下載完整資料並自行跑測試工具(harness)
新創公司 Attestable 宣佈獲得兩千萬美元(約新臺幣6億元)種子輪投資,領投方為 Altimeter Capital 與 TLV Partners。這家公司要解決的問題是「可驗證推論」(verifiable inference,也就是想辦法證明一個 AI 模型真的是用它宣稱的那個模型、用正確的輸入資料、正確呼叫了該呼叫的工具來跑出結果,而不是偷工減料或造假)。他們用的技術叫零知識證明(zero-knowledge proof,簡稱 ZK,一種數學方法,可以在不曝露原始資料內容的情況下,證明某個計算真的有被正確執行過)。Attestable 宣稱把過去被認為不切實際、運算成本過高的 ZK 技術,大幅降低了運算負擔,讓它變得可以實際商用。以太坊創辦人 Vitalik Buterin 也對此發表看法,認為目前這套方法在某些情境下的額外運算成本可能已經壓到只比原本直接跑推論多不到10倍,並將此視為邁向更強隱私保護推論技術的一個過渡墊腳石。
Attestable(由 Yogi Brn 創辦的新創公司) — 打造可驗證推論的基礎設施,目標是讓 AI 代理人(agent,能自主執行多步驟任務的 AI 系統)在執行愈來愈長的操作鏈(例如連續呼叫多個外部工具、做多步驟決策)時,外界能夠驗證這條操作鏈真的是由正確的模型、用正確的輸入、正確地跑出來的。結果:投資人 jaminball 表示團隊已將 ZK 證明的運算負擔,從過去公認不切實際的水準,降低了好幾個數量級(也就是縮小非常多倍);Vitalik Buterin 進一步估計,在部分情境下額外開銷可能已經壓低到不到原本推論成本的10倍以內
一位在 X(原 Twitter)上使用帳號 @nathanrs 的開發者,在 SpaceXAI 舉辦的黑客松活動中,發表了一套讓 LLM(大型語言模型,也就是像 ChatGPT 這類會對話的 AI)推論結果在不同硬體上完全一致的方法。平常同一個提示詞(prompt,也就是你輸入給 AI 的問題或指令)在不同顯卡或處理器上跑,就算設定成溫度為0(代表要求 AI 給出最穩定、不隨機的答案),輸出還是可能不一樣,原因是電腦做浮點數(帶小數點的數字)加法時,運算順序不同會導致結果有微小差異,而不同硬體、不同運算核心排列運算的順序本來就不同。這位開發者的做法是把模型從輸入到輸出全程都用整數運算(因為整數加法不像浮點數那樣會因順序不同而變,具備所謂的「結合律」),避免以往常見的整數量化(把模型參數壓縮成整數以節省空間)在遇到 softmax、normalization、SiLU 這類非線性運算時,又偷偷轉回浮點數計算而破壞一致性的問題。他表示這個方向過去多半是因應沒有浮點運算單元的邊緣裝置(如低階嵌入式晶片)而做,很少有人從「讓結果可重現」這個角度切入。
@nathanrs(開發者,本次研究作者) — 在 SpaceXAI 黑客松期間,將 Qwen3-0.6B 模型改寫成全程整數運算的版本,並在 A100、H100、Apple M5 Max、AMD EPYC、Intel Xeon 共2顆GPU與3顆CPU上,各自產生512個token(token是AI處理文字時切分出的最小單位)的生成結果,並對每一步的輸出做雜湊(hash,一種把資料轉成固定長度指紋碼、方便比對是否完全相同的方法)比對。結果:所有走整數運算的版本在5種不同硬體上都得到完全相同的雜湊值64430dd985f8;相對地,原本用fp16(一種常見的16位元浮點數格式)跑的版本,每臺硬體從第一個token開始就出現不同結果。此外在WikiText2(一個常用的語言模型測試資料集)上量測,整數版本的困惑度(perplexity,數值越低代表模型預測越準)為20.72,甚至比fp16版本的20.95還好;在A100顯卡、batch 1(一次只處理一筆請求)的情境下,配合CUDA圖優化,整數解碼速度達到每秒106個token,是fp16即時運算版本的3.6倍。怎麼做:作者表示做法是簡化了2024年一篇名為I-LLM的論文(該論文把整數推論用在LLaMA模型上)中的方法,讓輸入的token id一路到最終int32格式的logits(模型輸出的原始分數)全程只用整數運算,並在每一步都做鏈式雜湊來驗證各硬體結果是否一致;程式碼已放在GitHub,作者也提到之後會另外寫一篇完整說明文章
Infinity(一家做AI推論優化的公司)與晶片廠商d-Matrix合作,用「代理式」(agentic,就是讓AI自己規劃、執行、除錯任務,而不只是回答問題)的方式,打造了一整套自動化工具,把大型語言模型(LLM)有效率地部署到d-Matrix的Corsair晶片上。Corsair是一種把運算和記憶體(SRAM)緊密整合在晶片上的推論加速晶片,跟Groq、Cerebras是同類型設計,目的是避開一般GPU常見的「記憶體搬移瓶頸」(模型權重要不斷在晶片內外搬動,很耗時)。這項合作中,AI代理自行打造了編譯器、晶片模擬器和除錯工具,完成晶片部署的最佳化工作。這也呼應一個趨勢:AI代理正在往技術堆疊的更底層(像編譯器、記憶體管理這種基礎建設層)發展,支持者認為這種「軟體自動生成、針對不同晶片調整」的能力,長期有機會削弱NVIDIA靠CUDA(NVIDIA的專屬程式開發工具生態)建立的軟體護城河優勢。
Infinity(推論優化公司)與d-Matrix(晶片公司) — 針對開源模型Qwen 3,在d-Matrix的Corsair晶片上進行部署最佳化,打造了Ignition這個優化代理(agent),讓它自動完成四項工作:寫一個能把模型安排進晶片記憶體階層的編譯器、寫一個晶片模擬器來測試、寫一個能抓出記憶體錯誤的靜態檢查工具(並用Rust重寫加速90倍)、以及打造一個能自動除錯的AI代理。結果:跟Infinity原本的實作相比,Qwen 3在單一Corsair卡上的推論速度(每秒輸出的token數,token可以理解為AI處理文字的最小單位)提升了20倍,能處理的上下文長度(一次能讀進去的文字量)也延伸到16倍。原本需要工程師花好幾天人工排查的除錯工作,現在AI代理可以自動完成
AI 論文摘要帳號 dair_ai 在 X(原 Twitter)上發表一篇新論文摘要,指出 AI 模型呼叫外部工具(tool calling,就是讓 AI 在回答時去執行程式、查資料或操作系統的功能)時,用「程式化工具呼叫」(把工具包成有型別的 Python 函式,AI 直接寫程式碼呼叫執行)比傳統「JSON 工具呼叫」(AI 輸出一段固定格式的 JSON 資料,再由外部程式去解析執行)準確度更高。這篇論文在 14 個語言模型上,用 BFCL v4(一個專門測試 AI 呼叫工具能力的標準化測驗)做比較,發現程式化呼叫在 11 個模型中打平或勝過 JSON 呼叫,其中 GPT-5.6 系列準確度提升了 10.6%。研究也發現,在需要同時平行呼叫多個工具、或是對話變長導致資訊混亂(context rot,指模型上下文塞太多雜訊、表現變差)的情況下,程式化呼叫的優勢更明顯,而且模型的程式能力越強,這個優勢會越大。
論文研究團隊 — 在 14 個語言模型上,於 BFCL v4 測試集,比較「程式化工具呼叫」(工具包成 Python 函式,AI 寫程式碼呼叫並在同一輪內執行取得結果)與「原生 JSON 工具呼叫」(AI 輸出結構化 JSON 描述要呼叫哪個工具、參數是什麼)兩種方式的準確度。結果:程式化呼叫在 11/14 個模型中打平或勝過 JSON 呼叫;在平行呼叫多個工具的情境下,13/14 個模型是程式化呼叫勝出;在對話變長、上下文品質變差(context rot)的情境下,JSON 呼叫的準確度平均下降 2.3%,而程式化呼叫維持穩定;GPT-5.6 系列用程式化呼叫比 JSON 基準準確度高出 10.6%
這是一則來自AI電子報作者swyx整理的科技動態,內容提到Browser Use(一套讓AI代理,也就是能自動幫你操作電腦的AI程式,直接操控瀏覽器的工具)和Stagehand v4(另一套同類型工具)的更新,顯示業界正走向更輕量、更貼近瀏覽器原生操作的AI代理設計方式。過去這類工具常需要為每個網頁操作(例如點擊、輸入文字)都定義一個獨立的工具指令(tool call),造成每次跟AI溝通時要傳送大量的規格說明,浪費運算資源。新趨勢是讓AI直接寫一段操作腳本來完成整套動作,而不是一步一步呼叫工具。附帶案例顯示,一個叫Hermes的AI代理系統原本要用12種不同的瀏覽器操作工具,改用Browser Use模式後,靠Browser Use團隊推出的CLI(命令列工具)3.0版,把這12種工具合併成一種,讓AI能一次寫出完整腳本執行。
Hermes(一套AI代理系統) — 原本使用12種不同的瀏覽器操作工具(tool)分別處理點擊、輸入等動作,改用Browser Use模式後,改由Browser Use的CLI 3.0驅動,把這些工具整合成一個,讓AI一次寫出完整操作腳本而不是逐步呼叫工具。結果:根據測試,這樣做讓AI要處理的資料量(token,也就是AI讀取和產生文字的基本單位,用量越大越花錢越慢)減少了48%到66%,而且準確度沒有下降
這則消息來自科技新聞觀察者 swyx 的彙整貼文,內容談的是「本機優先」(local-first,意思是工具主要在自己電腦上跑、不必事事依賴雲端伺服器)的 AI 代理人(agent,就是能自己讀檔案、寫程式、執行指令的 AI 助手)工具鏈又有新進展。第一項是 Pi 這家公司的 SDK(軟體開發套件,讓工程師能把某功能直接嵌進自己的程式),它強調一個寫程式的 AI 代理人其實只需要四個基本操作:讀檔、跑指令(bash)、修改檔案、寫檔案,就能有相當不錯的能力,因為現在的 AI 模型本身已經很懂得怎麼靈活運用這些基本操作。第二項是 Jerry Liu(知名開源專案 LlamaIndex 的創辦人)推出的 LiteParse,這是一個專門在代理人執行流程中做「低延遲文件解析」(也就是快速把 PDF 等文件內容抽取出來給 AI 讀)的工具,號稱靠規則式(heuristic,就是先用固定邏輯判斷而非直接動用大模型)擷取,200 頁文件只要 4 毫秒,遇到規則判斷不了的複雜版面才會退回用 OCR(光學文字辨識)或 VLM(視覺語言模型,能看懂圖片內容的 AI)處理。
Pi(開發 Pi SDK 的團隊) — 設計一套寫程式用的 AI 代理人工具組,只提供四個核心工具:read(讀檔)、bash(執行終端指令)、edit(修改檔案)、write(寫入新檔案)。結果:證明現有 AI 模型光靠這四個基本操作,就能組合出足以應付大部分寫程式任務的能力,不需要堆疊大量客製化工具。怎麼做:Pi SDK 提供程式碼範例,讓開發者可以把這四個工具原語直接加進自己的應用程式中 Jerry Liu(LlamaIndex 創辦人) — 開發 LiteParse,讓 AI 代理人在處理文件時先用規則式方法快速擷取內容,效果不夠好時才升級用 OCR 或 VLM 辨識。結果:號稱處理 200 頁文件只需 4 毫秒(在規則式擷取可行的情況下),大幅降低文件解析對整體代理人回應速度的拖累
SemiAnalysis指出,TileRT/InferenceX這個軟體專案在NVIDIA GPU(顯示卡)上試圖模擬Cerebras、Groq、SambaNova等廠商常見的高互動性特性,特別針對batch size 1、disaggregated serving(拆分式服務)與decode/prefill separation(解碼/預填分離)。
TileRT/InferenceX專案 — 在NVIDIA GPU上實作batch size 1、disaggregated serving、decode/prefill分離等技術。結果:嘗試模擬Cerebras、Groq、SambaNova等專用低延遲推論晶片的高互動性表現,讓一般NVIDIA GPU也能提供接近即時的AI回應體驗
Anthropic(開發AI聊天機器人Claude的公司)宣佈,把Claude Sonnet 5(該公司今年6月推出的一款AI模型,可以理解和生成文字、程式碼等)的「早鳥優惠價」變成永久價格。這款模型原本在6月上市時,以每百萬輸入token(token是AI處理文字時切分的最小單位,大約等於幾個英文字母或半個中文字)2美元、每百萬輸出token 10美元的優惠價推出,優惠期限原訂到8月31日結束。Anthropic官方在社群平臺上宣佈,這個優惠價格之後不會漲,會一直維持下去。這代表用這款模型開發應用程式的開發者,成本不會突然變貴。
Anthropic — 原訂6月上市的Sonnet 5優惠定價(輸入每百萬token 2美元、輸出每百萬token 10美元)只到8月31日。結果:Anthropic宣佈把這個優惠價格改為永久價格,之後不會調漲,讓依賴此模型的開發者和企業可以放心規劃長期成本
TechCrunch 的 Podcast 節目 Equity 訪問了新創公司 Sandbar 的共同創辦人暨執行長 Mina Fahmi,談他們推出的語音記事戒指 Stream。這款戒指屬於近年一波穿戴裝置浪潮之一,這類裝置主打隨時用講話的方式記下靈感和想法,再由 AI 整理成摘要。Sandbar 目前已募得 3600 萬美元資金,其中包含由 Adjacent 和 Kindred Ventures 領投的 2300 萬美元 A 輪。Fahmi 在訪談中談到,過去許多語音硬體裝置未能順利突破市場,而他押注的方向是讓使用者牢牢保有主導權,認為這是把穿戴科技做對的關鍵。
Sandbar 共同創辦人暨執行長 Mina Fahmi — 在 TechCrunch Equity 節目訪談中,說明 Stream 語音戒指的設計理念,並分析先前同類語音穿戴裝置為何未能成功普及。結果:他提出的差異化重點是:讓使用者對裝置錄音、記錄的過程保有明確掌控感,這是他認為 Stream 能突破過去產品困境的關鍵設計原則
Google在2026年的Made by Google發表會上,公佈了Pixel 11系列手機、Pixel Watch 5智慧手錶、以及新推出的追蹤器Pixel Tag,同時也展示了多項搭載在Pixel裝置上的Gemini(Google的AI助理)新功能。其中比較特別的是無障礙功能升級:「Live Transcribe」(即時把語音轉成文字顯示的功能)現在能支援美國手語,透過手機鏡頭把手語翻譯成文字,讓使用者多一種溝通方式。另外Google也推出「Rambler」,一個新的語音輸入功能,特色是能理解使用者說話時不完整、有贅字、沒有講得很有條理的句子,不需要刻意字正腔圓才能被聽懂。此外「Circle to Search」(圈選搜尋功能)現在可以直接在相機介面裡使用,讓使用者不用離開拍照畫面就能辨識物品、搜尋遠方物件、翻譯文字或提問。
Pixel Camera使用者 — 使用擴充後的Live Transcribe功能,把鏡頭對準比手語的人。結果:手語會被即時翻譯成文字顯示,讓不會手語的人也能理解對方在說什麼,多一種溝通方式 Pixel手機使用者 — 用Rambler語音輸入功能講話,不刻意組織句子、有停頓和贅字。結果:系統仍能正確理解使用者想表達的意思,不需要像過去語音輸入那樣講得字正腔圓 Pixel Camera使用者 — 在拍照畫面中直接使用Circle to Search圈選畫面中的物品。結果:不用切換或離開相機,就能辨識物品、搜尋遠方物件、翻譯文字或針對周遭事物提問 Pixel Buds使用者 — 用語音請Gemini協助尋找或讓Pixel Tag發出聲音。結果:透過語音指令就能定位遺失的鑰匙、皮夾、行李等物品,不需手動操作App
由General Catalyst與AMP PBC領投的11億美元(約新臺幣350億元)種子/A輪融資,投給了才成立兩個月的新創公司River AI,參與投資的還有Nvidia、AMD Ventures、Y Combinator、Temasek等大型科技公司與創投。River AI創辦人是Igor Babuschkin,曾在DeepMind和OpenAI任職,也是馬斯克旗下AI公司xAI的共同創辦人。他的目標是把AI從頭打造一套新架構,讓「代理人」(agent,也就是能幫你自動完成任務的AI程式)變成完全屬於使用者個人、可被使用者自行訓練的貼身助理,而不是像現在的AI公司那樣把AI打造成取代人類員工的工具。River AI已推出API(讓其他開發者的程式能呼叫、串接的服務介面),依照使用的公開模型不同、以每百萬個token(token是AI處理文字時切分的最小單位)計費,並支援RL(強化學習,一種讓AI透過嘗試錯誤、獎懲回饋來自我改進的訓練方式)與LoRA(一種只需少量運算資源就能微調模型的技術)微調,讓企業可以直接訓練、擁有屬於自己的開源模型,取代目前常見的「提示工程」(prompt engineering,也就是不斷調整下指令的文字技巧來引導既有AI,但模型本身不屬於你、也無法真正改進)做法。
River AI(企業客戶對象) — 企業想擁有可自行掌控、訓練的AI模型,而不是依賴別人管理的封閉式AI服務。結果:根據River AI官方募資公告,任何企業都能在15到20分鐘內完成一次複雜的強化學習訓練,且不需要自己的基礎設施團隊,成本比使用封閉原始碼的替代方案省下2到4倍
Spotify(全球最大串流音樂平臺)宣佈將推出「AI Persona」(AI人格,指帳號背後的藝人身分是AI生成、不是真人)標籤,用來標示那些用AI生成身分的藝人檔案,並且預設把這些AI人格的音樂排除在編輯精選、演算法推薦、以及個人化推薦之外。Spotify不會只靠藝人自己申報,還會主動審查檔案照片和名稱是否像是照片級擬真的AI生成身分,優先從聽眾人數多的熱門檔案開始審查。這個標籤只是針對「這個帳號代表的是不是真人」做判斷,不是在評斷音樂本身是不是用AI製作的(AI製作的音樂資訊會透過另一個叫AI Credits的功能顯示)。此舉是Spotify因應AI生成內容氾濫(英文叫AI slop,指大量低品質、AI量產灌水的內容)、擔心影響使用體驗與訂閱意願而祭出的政策,也是它去年9月起AI音樂政策的延伸。
Spotify — 從2026年9月中開始,在藝人檔案的橫幅、簡介欄、搜尋結果與歌曲列表上顯示「AI Persona」標籤,並允許藝人在8月11日起透過Spotify for Artists自行申報,同時也會開放使用者檢舉尚未被標示的疑似AI人格檔案。結果:被標示為AI Persona的檔案,其音樂預設不會出現在編輯精選、演算法推薦或個人化推薦中,除非使用者主動追蹤該AI人格帳號;藝人若認為標籤誤判,也可以提出申訴
根據 The Decoder 的文章,一份發表於《Clinical Imaging》期刊的調查顯示,AI(人工智慧)輔助乳癌篩檢工具的實際表現,遠不如放射科醫師原本的期待。調查對象是美國乳房影像學會(Society of Breast Imaging)的215名成員,其中約半數已在使用經FDA(美國食品藥物管理局)核准的AI乳癌篩檢工具,另有11%計畫採用。這份調查由加州大學聖地牙哥健康中心(UC San Diego Health)的主要作者Joud Almogati主持,結果指出只有少數醫師認為AI是決策時的關鍵因素,多數人只把AI當作「第二意見」參考用。
美國乳房影像學會的215名受訪放射科醫師 — 實際使用或評估FDA核准的AI乳癌篩檢工具,比較用AI前後的召回率(recall rate,指病人被要求回診做進一步檢查的比例)、不必要切片檢查數量、以及醫師工作倦怠程度。結果:只有35%的醫師表示召回率有下降,但原本有59%的人期待會下降;只有9%表示不必要的切片檢查變少了,但原本有36%的人期待會變少;只有29%表示倦怠感減輕,但原本有56%的人期待會減輕。成本過高與機構支援不足,是目前推廣AI工具最大的障礙。
AI新聞網站The Decoder報導,根據三個獨立市場數據來源,Google的Gemini(一款對話式AI聊天機器人,類似ChatGPT)正在快速流失使用者,市佔率被OpenAI的ChatGPT與Anthropic的Claude搶走。AI文字辨識平臺Pangram(專門分析文章是不是AI寫的工具,藉此推算各家AI模型的使用比例)發現,Gemini的市佔從12%暴跌到只剩1.9%,Pangram形容這是一次「崩盤」。同時OpenAI維持超過50%的市佔,Anthropic則從4.3%成長到14.9%,主要是在技術與科學寫作領域成長明顯。另外兩個數據來源Similarweb(網站流量分析工具)與OpenRouter(一個讓開發者串接多家AI模型的平臺)也呈現同樣的下滑趨勢,顯示這不是單一數據源的誤差。文章也提到,這現象可能與Google DeepMind近期高層異動(包含執行長Demis Hassabis在內多位資深人士離職)有關。
Pangram(AI文字辨識平臺) — 分析大量使用者提交的文本,推算文本背後是哪家公司的AI模型所生成,藉此估算各AI模型的市佔率。結果:Gemini的市佔率從12%跌到1.9%,OpenAI維持50%以上市佔,Anthropic從4.3%成長到14.9% Similarweb(網站流量分析平臺) — 追蹤Google網站的整體流量佔比變化。結果:Google網站市佔從27%微幅降至26.8%,但相較一年前的9.4%仍是大幅成長
Anthropic(開發AI聊天機器人Claude的公司)宣佈延攬法律新創公司Akiva AI創辦人Robert Mahari,出任公司首位「Claude法律業務負責人」,專責把Claude這套AI模型推廣到律師事務所與法律部門的實際工作中。Mahari擁有法律AI(用AI協助處理法律相關工作)博士學位。今年5月Anthropic已經推出12款法律外掛工具(plugin,讓Claude能串接特定專業軟體的功能模組),並與LexisNexis、Relativity等超過20家法律科技公司建立合作。The Decoder(科技新聞網站)指出,法律市場正吸引愈來愈多科技大廠投入:OpenAI挖角合約管理新創Ironclad創辦人Jason Boehmig,Amazon推出Amazon Quick處理法律任務,Microsoft也在Word中加入法律AI代理人(agent,能自動執行特定任務的AI程式)。過去AI系統在法律工作上不夠可靠,常會捏造引用來源和判例(俗稱幻覺),加上隱私與保密規範也讓導入更困難;但隨著模型能力進步、且能更好地連結法律資料庫與既有的執業軟體,現在已較容易融入律師事務所的日常工作流程。
Robert Mahari — 以Anthropic首位「Head of Claude for Legal」身份,負責把Claude模型部署並擴展到整個法律產業。結果:延續今年5月已推出的12款法律外掛工具,以及與LexisNexis、Relativity等20多家法律科技公司的既有合作 OpenAI — 挖角合約管理新創Ironclad創辦人Jason Boehmig,投入法律AI領域。結果:與Anthropic、Amazon、Microsoft同步加碼佈局法律科技市場 Amazon — 推出Amazon Quick處理法律相關任務。結果:成為大型科技公司搶進法律AI市場的案例之一 Microsoft — 在Word文書軟體中加入法律AI代理人(agent)功能。結果:讓法律工作流程可直接在既有辦公軟體中透過AI協助完成
歐洲AI新創公司Mistral在官方部落格宣佈兩項針對企業客戶的新服務。第一是「區域推論」(regional inference,就是讓AI運算請求固定在指定地區的伺服器處理,不會跨境傳輸),企業可以選擇把請求送到歐盟或美國的伺服器,處理資料一律留在該地區境內,這對銀行、政府機關、保險公司這類需要證明客戶資料沒有離開歐盟的單位很重要,但要多付10%的費用。第二是「優先層」(Priority Tier,尚在公開測試階段),付費客戶的請求在系統忙碌時可以插隊優先處理,並附帶99.5%正常運作時間的保證(等於每月最多容許約3.5小時當機),要多付75%的費用。另外Mistral也開始把其他公司的開源模型(例如中國Z.ai公司的GLM-5.2)搬上自家平臺,用同樣的區域規則提供服務。
銀行、政府機關、保險公司等企業客戶 — 透過api.eu.mistral.ai這個歐盟專用網址,直接把合約文本等敏感資料送進模型做單次查詢(不涉及需要暫存資料的功能)。結果:可以拿到「運算過程留在歐盟境內」的保證,多付10%費用;但若需要用到agent(代理任務)、批次處理或檔案管理功能,這些「需要暫存狀態」的功能在區域端點上不提供,帳號設定、金鑰、帳單等資訊也仍可能在區域外處理 客服聊天機器人、工廠產線控制系統等對延遲敏感的客戶 — 與Mistral業務團隊簽約後,將API參數service_tier設為auto,啟用優先隊列。結果:忙碌時請求會被優先處理,並取得99.5%正常運作時間的SLA保證;超過個別協議的每分鐘請求上限時不會失敗,只是自動退回標準處理速度,API回應會標示該請求實際由哪一層處理,方便客戶核對是否有拿到應有的服務。怎麼做:將service_tier參數設為auto即可啟用優先層,預設值是standard_only(走一般路徑);費用是標準價格的1.75倍(多收75%),若有使用提示詞快取(prompt caching,把重複出現的文字段落存起來、之後用更低費率計費)折扣仍可疊加,最高可折抵90%,且會先計算快取折扣,再加上優先層費用
Cursor(一款用 AI 輔助寫程式的編輯器工具)正準備把內部代號「Origin」的功能,以「Cursor Review」的名稱推出給更多使用者,而不只是先前的封閉合作夥伴測試名單。這個功能會新增兩個分頁:Codebase 用來同步、管理從 GitHub(存放程式碼的線上平臺)拉進來的專案;Review 則是一套自動化的 PR(pull request,也就是「我改好了程式碼、請你審查再合併」的申請)處理流程,會在需要人類判斷時通知開發者,讓人類和 AI 代理人(agent,能自己執行多步驟任務的 AI)可以一起處理一個專案裡堆積的待審查修改。訊號顯示最快這週就可能上線,比 Cursor 今年六月宣佈這個平臺時說的「秋天上線」還要早。Origin 是在 Cursor 自家的 Compile 大會上發表,由 Cursor 在 2025 年底收購的 Graphite 團隊打造,訴求是傳統 GitHub 的審查模式是為「一個人、一次改動、依序合併」的人類步調設計的,而 Cursor 展示過一個專案一秒能塞進 22.6 次程式碼提交,遠超人類審查得動的速度,所以此舉是為了讓大量同時運作的背景 AI 代理人團隊,能更快把它們產出的程式碼改動審查、合併進主專案。
Cursor(開發 AI 程式編輯器的公司) — 把先前只開放少數合作夥伴測試的 Origin 平臺,以「Cursor Review」名稱擴大推出,新增 Codebase 與 Review 兩個分頁功能。結果:開發團隊可以在同一個介面裡管理從 GitHub 拉進來的專案,並讓自動化流程通知人類在需要判斷時介入審查一大批由 AI 代理人產出的 pull request,加快程式碼審查、合併的速度
AI Frontiers 部落格作者 Damon Binder(慈善研究機構 Coefficient Giving 資深研究員)撰文分析:如果未來出現 AGI(通用人工智慧,指能勝任人類幾乎所有腦力工作、且成本划算的 AI),它不只能做辦公室工作,也能操控機器人做體力活,因為操作機械所需的即時控制、空間推理等能力,跟做腦力工作是同一套技能。他用美國政府編製的「投入產出表」(記錄每個產業要向其他產業買什麼原料/設備的統計表,用來推算整體經濟怎麼運作)去試算:如果人類勞動完全被機器人取代,經濟不再受限於「工人數量固定」這件事,機器可以自己造更多機器人,於是整體實體產出可能每年翻倍成長,遠快於現在經濟體平均要好幾十年才翻倍。作者強調這個推算完全沒有假設會有新科技突破,純粹是把現有生產方式套進機器人身上去算,結論已經足夠驚人。
Damon Binder(文章作者) — 採用美國政府2017年涵蓋402個產業的投入產出表,搭配數學家 von Neumann 提出的「經濟最大成長率」計算方法,模擬一個完全由機器人取代人力的自動化經濟體會如何成長。結果:算出這樣的經濟體實體產出大約每年翻倍一次(現在的真實經濟體平均要好幾十年才翻倍一次);就算只拿一半產出去投資擴產、另一半留給民眾消費,也能約20個月翻倍一次;即使考慮建廠工期延遲,仍能在兩年內翻倍 文章中舉例的機器人廠商 Unitree 與 Tesla — Unitree 已經在販售一款兒童身型大小的人形機器人 G1;Tesla 則對外表示目標是把其全尺寸人形機器人 Optimus 的成本壓到約2萬美元。結果:文章用這個價格試算:若一臺機器人造價3萬美元、可以24小時運作取代一名時薪30美元的工人,大約六週就能回本,說明機器人勞動力在經濟上可能非常划算
這篇文章的作者訪問了Abi Olvera(曾任美國國務院外交官,現主筆Positive Sum這個Substack電子報,也是Golden Gate Institute的特別顧問),討論為什麼大家常常預測錯AI對產業的實際影響。核心問題是:很多人把「AI能做到某件事」(技術能力)跟「AI真的改變了整個工作流程的產出」(實際影響)搞混了。現實中的工作往往牽涉社會互動、機構制度、實體操作、和只能靠經驗累積的默會知識(tacit knowledge,就是那種很難用文字寫清楚、只能做久了才會的know-how),這些都是AI一時半刻難以取代的環節,所以只看AI單一任務的能力進步,常常會高估它對整個產業的衝擊速度。文章主張,未來要做出更準確的AI預測,需要更多結合第一線從業者經驗與技術理解的跨領域研究(cross-framework research),去具體檢驗AI是否真的改變了工作流程裡「卡最緊」的那個瓶頸步驟,而不只是加快了某一個任務。
AI先驅Geoffrey Hinton — 2016年在多倫多的一場機器學習研討會上公開表示,深度學習(一種讓電腦透過大量資料自己學會辨識規律的AI技術)五年內就會在放射科影像判讀上超越人類,因此「應該停止訓練放射科醫師」。結果:結果與預測完全相反:放射科不但沒有萎縮,梅約診所(Mayo Clinic,美國知名醫療機構,也是AI採用最積極的醫院之一)自2016年以來放射科人力反而成長了55%,該部門還建立了一支40人的AI團隊、使用超過250個AI模型。原因是AI雖然很擅長從影像中找出可疑病灶,但放射科醫師的工作還包含整合病人病史、跟其他醫師溝通討論、撰寫報告、執行相關醫療程序等,這些AI都無法取代,AI把找病灶這一步做得更快,反而讓其他相關工作量跟著變多,需要更多人手去消化 一項針對分子生物學新手的研究 — 研究比較兩組完全沒有實驗室經驗的新手:一組只能上網查資料,另一組除了上網還能使用前沿AI模型協助,觀察他們花八週時間能否獨立完成一套動手做的濕實驗室(wet-lab,指要實際操作試管、儀器等物理實驗,而非只在電腦上跑程式)工作流程。結果:結果好壞參半:AI確實在流程中某些中間步驟上有幫助,但並沒有顯著提高「從頭到尾完整做完整套實驗流程」的新手人數比例。也就是說,AI能幫上一部分的忙,但要取代動手操作所需的默會知識和排除故障的實務能力,目前還做不到
NVIDIA 研究團隊發表了名為 WorldTrace 的新方法,登上 ICML 2026 workshop 最佳論文。這是為「自迴歸影片世界模型」(一種能一格一格連續生成影片畫面、讓使用者可以在裡面互動走動的 AI,例如生成一個可以邊走邊看的虛擬場景)設計的技術。這類模型有個大問題:生成的影片一旦拉長超過訓練時看過的長度,模型就會像失憶一樣,明明之前生成過的畫面資料還存在記憶體裡(技術上叫 KV 快取,AI 用來暫存之前內容以便回顧的機制),卻讀不出來、想不起來自己去過哪裡。NVIDIA 團隊發現問題根源在於一種叫「位置編碼」的機制(AI 用來標記每個畫面在時間軸上先後順序的方法)超出了原本訓練範圍就會失效,而不是記憶內容本身不見了。WorldTrace 的解法是不用重新訓練模型,只靠調整記憶格子的「位置標籤」讓它們永遠落在模型讀得懂的範圍內,藉此讓模型能持續保持畫面流暢,也能認出並回到先前經過的場景。
NVIDIA 研究團隊 — 用一套叫 LoopMem 的測試方法,讓 AI 影片模型沿著不同路徑(例如走一圈再繞回原點、多次重複造訪同一個地方、大幅度轉動鏡頭環視 360 度)生成畫面,測試它能不能認出自己回到了先前去過的場景,並用 PAC(一種比對畫面是否對得上先前場景的分數)打分。結果:在「去了又回來」的長路徑測試中,WorldTrace-Landmark 方法得分 0.825,遠高於舊做法(只靠捨棄舊記憶的滑動視窗法)的 0.627;標準路徑測試中是 0.864 比 0.723;重複造訪測試中是 0.941 比 0.892。不過在最難的 360 度環視測試中,兩者差距最小(0.577 比 0.559),代表這仍是此方法的弱點所在。另外在畫面流暢度測試中,生成長度拉到訓練時長度的 24 倍時,WorldTrace-Field 方法比舊方法的畫面穩定度分數(TempSSIM)高出 15.5%
微軟 AI 部門(Microsoft AI)發表新版程式碼生成模型 MAI-Code-1.1-Flash,這是專門幫忙自動寫程式、修程式的 AI 模型,已經正式整合進 GitHub Copilot(微軟旗下最知名的 AI 寫程式輔助工具,會在你打字時自動建議程式碼)。相較於今年6月發表的舊版 1.0,新版寫出的程式碼品質更好、處理同樣任務省下25%的 token(token 是 AI 讀寫文字的最小計價單位,越少代表越省錢越快)、而且整體使用成本只要舊版的四分之一。微軟表示這是靠讓模型在數十萬個真實的強化學習(一種讓 AI 透過不斷試錯、依結果好壞調整行為的訓練方式)環境中反覆磨練,針對開發者實際回饋最在意的命令列操作和 .NET(微軟自家的程式開發框架)任務去優化而達成的。
GitHub Copilot CLI(命令列版的 AI 寫程式助手)使用者 — 在命令列環境中請 AI 協助完成程式任務,並以 Terminal-Bench 2.1(專門測試 AI 在命令列環境表現的標準測驗)評分。結果:相較舊版 1.0,成績提升22% 使用 .NET 框架的開發者 — 請 AI 協助完成 .NET 相關的程式任務。結果:表現比舊版提升15% GitHub Copilot 一般使用者 — 日常使用 AI 建議的程式碼。結果:程式碼被保留下來(不被刪掉重寫)的比例提高4%,使用者回頭再用的比例提高9%,同時 AI 回應速度加快25%、耗用的 token 減少25%
NVIDIA(輝達)在自家的Hugging Face平臺發表了新的開源模型「Nemotron 3.5 Lightning」。這是一個MoE(混合專家模型,就是把AI拆成很多個小專家,每次只叫醒其中一小部分來回答問題,這樣速度快又省資源)架構的模型,總參數量30B(30億級規模),但每次實際運作只會用到其中3B(等於只用約十分之一的力氣做事),目的是讓長時間運作的AI代理(agent,就是可以自己連續執行多步驟任務的AI助理)能用更低的延遲、處理更大量的請求。它同時支援長達100萬token(token可理解為AI讀寫文字的最小單位,1M token大約等於好幾本書的份量)的上下文長度,代表它能一次記住非常長的對話或文件內容。NVIDIA也提供了在自家GPU硬體(如DGX Spark、H100、GB200等)上部署這個模型的完整教學與指令,方便開發者直接串接到vLLM、SGLang、TensorRT-LLM、Ollama、llama.cpp等常見AI服務框架上使用。
NVIDIA官方 — 在Hugging Face模型頁面公佈Nemotron 3.5 Lightning在多項標準測試(benchmark)上的表現,包括MMLU Pro(一般知識測驗)、GPQA Diamond(推理能力測驗)、SWE-bench Verified(真實軟體工程任務測驗)等。結果:例如SWE-bench Verified分數為52.80分,GPQA Diamond為75.57分,NVIDIA說明這些數字是用自家統一測試工具(NeMo Gym/Nemo Evaluator SDK)量測,可能與其他廠商自行公佈的數字不同 開發者(想在自己的DGX Spark機器上跑這個模型的人) — 依照NVIDIA提供的指令,用vLLM(一套用來架設AI模型伺服器的開源軟體)啟動Nemotron 3.5 Lightning服務。結果:啟動後即可透過與OpenAI相容的API格式,用curl指令或程式呼叫這個模型進行對話或任務處理。怎麼做:vllm serve --model $MODEL_CKPT --moe-backend marlin --kv-cache-dtype fp8 --enable-prefix-caching --gpu-memory-utilization 0.91 --speculative_config.num_speculative_tokens 3 --mamba-backend flashinfer --mamba-cache-mode align --reasoning-parser nemotron_v3 --speculative_config.model $DSPARK_CKPT --tool-call-parser qwen3_coder --enable-auto-tool-choice 想在個人電腦本機端跑模型的使用者 — 透過Ollama這套簡化本機執行AI模型的工具,一行指令下載並執行Nemotron 3.5 Lightning。結果:不需要自己架設伺服器或寫程式,就能在自己電腦上直接使用這個支援工具呼叫與思考功能的AI模型。怎麼做:ollama run nemotron-3.5-lightning
AI 建站工具公司 Lovable 在官方部落格發文,主張讓使用者自己「選模型」(model picker,就是介面上那個下拉選單,讓你挑要用 GPT 還是 Claude 之類的 AI 模型)這種設計是死路。Lovable 認為不同模型(就是不同家公司做的 AI,例如 GPT、Claude 等)各有擅長的地方,有的擅長抓程式錯誤(debug),有的擅長設計介面,沒有一個模型能全能通吃,而且模型排名會隨新版本推出不斷變動,使用者沒必要在動工前先賭一把選對模型。因此 Lovable 打造了一套「控制層」(control plane,一個在背後即時監控整個開發過程的系統),會在使用者開發 App 的過程中,根據任務難度、進度是否卡關等狀況,動態把不同階段的工作分配給最適合的模型,而不是從頭到尾只用一個模型。這套控制層也會依每個模型的特性調整給它的指令、工具與專案脈絡(context,就是餵給 AI 參考的背景資訊),甚至在自己訓練的模型表現優於外部模型時,直接換上自家模型處理路由、摘要、寫 commit 訊息等固定工作。
Lovable 內部評測團隊 — 針對新一代前沿模型與其前一代模型做完整建站流程的評測比較。結果:新模型完成任務的速度快了15%、所需的來回溝通次數(turns)少了40%、整體評分也高了2到3%,因此團隊決定換用新模型 Lovable 控制層 — 發現某個模型在成功修改程式碼後,仍會重複讀取已經在脈絡中的檔案並重新檢查。結果:團隊改給該模型不同指令,要求它信任既有脈絡與修改結果、跳過多餘的重複檢查動作,藉此提升效率。怎麼做:指令內容為:信任脈絡(trust the context)、信任修改結果(trust the edit result)、跳過多餘的工具呼叫(skip the redundant tool calls) Lovable 控制層 — 在某次模型評比(bake-off)中,比對人類評分、Lovable 自建的 LLM 評審(LLM judge,就是用 AI 來幫忙打分數的評審機制)與外部預期排名是否一致。結果:發現有個評審把一個外表好看但內容空洞的成果排名排得過高,也有個評審對兩個幾乎一樣的成果給出天差地遠的分數,團隊因此重新校正該評審機制、並淘汰有問題的那個
部落客Daniel Miessler(網站danielmiessler.com)與他的AI助理Kai Magnus共同撰文分析,起因是Anthropic(Claude的開發公司)在2026年8月11日宣佈,之後Claude產生的所有內容都會加上標記:圖片等檔案用C2PA(一種業界通用的檔案來源簽章標準,記錄這張圖是不是AI做的)技術加簽章,純文字則加上作者所稱「肉眼看不出來」的浮水印,而且複製貼上到別處後這個標記依然存在。問題是Anthropic完全沒公開這個文字浮水印的原理與偵測方法,作者於是根據公開的學術做法自行推理拆解。作者說明,浮水印不必藏在看得到的字元裡,也可以藏在AI每次選字時的「傾向」——也就是給模型一把只有持有者知道的密鑰,讓它在每個字的選擇上都稍微偏好密鑰指定的某些字,一般人看不出差異,但持有密鑰的人可以用統計方法驗出這種偏好確實存在,而且這個訊號會隨著文字被複製貼上而保留,隨著文字被改寫而變弱。作者也指出這種浮水印能證明的事很有限:偵測到標記只代表這段文字某個階段被Claude處理過,不代表整段話是Claude寫的(例如你自己寫好、只請Claude潤飾文法,結果也會被標記);而沒偵測到標記也不代表就是人寫的,因為短文、被大幅修改過的文字、或較舊型號的輸出都可能驗不出來。
Daniel Miessler — 用一支腳本讀取Claude輸出文字裡每一個字元的code point(字元在電腦裡對應的數字編碼),檢查裡面是不是藏了零寬字元(zero-width character,一種肉眼看不到但電腦讀得到的隱藏符號)或不尋常的間距。結果:檢查結果發現全部都是一般常見的可列印ASCII字元(電腦最基本的英數字元編碼),沒有任何零寬字元或異常間距,證實Anthropic的文字浮水印不是藏在這種表層的編碼或格式裡,而是藏在更深層、AI選字用詞的傾向上 Daniel Miessler — 提出兩種可以清除文字浮水印的方法:一是把文字整段重新輸出成乾淨、純ASCII、間距統一的格式並驗證沒有殘留其他東西;二是把文字內容本身重寫改寫,換掉夠多的用詞。結果:第一種方法能清掉藏在編碼或排版裡的標記,但無法動到藏在選字傾向裡的標記;第二種方法透過大幅換詞可以把統計訊號洗掉到偵測器找不到,但如果是拿另一個AI來重寫,只是把Claude的浮水印換成那個AI自己的浮水印,並沒有真的清除掉,真正有效的辦法是由人親自重新思考並改寫文字內容
Raindrop(一家做AI代理(agent,也就是能自己執行多步驟任務的AI程式)監控與除錯工具的公司)發布了Signals 2.0,核心是一個叫rd-signal-2的模型管線(pipeline,指一連串自動化處理流程)。它的用途是幫忙判斷AI代理的某個行為「好」還是「不好」,例如AI是不是在瞎編答案、工具呼叫是不是失敗了卻沒被發現。官方表示rd-signal-2的準確度接近GPT-5.6,但成本卻便宜1600倍(相較GPT-5.6 Sol xhigh版本)。他們同時推出Signal Builder,讓客戶可以自己訓練、架設專屬的分類器,並支援「零資料保留」(Zero Data Retention,代表處理完資料不會被公司留存,適合醫療等高隱私要求產業)。
Raindrop官方(以自家系統為例) — 要判斷一段AI代理的執行紀錄(trace)裡,是否發生「工具呼叫重複失敗但AI最後還是回覆好像成功了」這種錯誤,這種錯誤往往不是單一步驟造成,而是好幾個步驟之間的關聯。結果:rd-signal-2會先用寫好的程式碼去比對各次工具呼叫的輸入內容、確認是否真的失敗,如果條件不成立就直接判定不符合、不需要呼叫AI模型;只有在條件成立、需要語意判斷時,才交給專門訓練過的小型分類模型去判斷,藉此大幅降低成本 Raindrop內部團隊 — 為了測試「怎麼定義行為好壞」有多困難,他們把同一個一句話的行為描述寫成四種不同版本的分類規則,套用在同樣2000筆正式環境紀錄上做比對。結果:四個版本判定為「符合」的比例從0.9%到4.6%不等,而且有67%被判定符合的紀錄,至少被其中一個版本認為不符合,顯示光是定義好壞標準就充滿分歧
Geopolitechs(一個新聞電子報網站)根據 Jiemian News 的報導指出,AI agent(就是能自己執行多步驟任務的 AI 助理,例如幫你訂機票、寫報告全程自動完成)公司 Manus,原本在2025年12月底被 Meta 以超過20億美元收購,如今宣佈交易破局、重新變回一家獨立公司。Manus 在2026年8月11日發出用戶信,說明是因為要「遵守某些司法管轄區的監管要求」,背景是中國商務部從2026年1月起就在調查這筆收購案是否符合中國法律。由於公司架構要拆分回獨立狀態,部分用戶的帳號資料會受影響,必須自行備份,之後再等公司重新上線後把資料復原回去,等於使用者要經歷一次「資料搬家」的麻煩。
Manus 的重度使用者 — 平時把任務歷史、工作流程都存放在 Manus 帳號裡,遇到這次公司脫離 Meta 收購、重組為獨立公司的變動。結果:必須在期限前(文章提及約8月23日前)自行備份資料,等公司8月25日後恢復獨立運營時再把資料復原,過程中有資料遺失或流程中斷的風險,也可能因此降低對這個服務的信任
OpenAI 官方文件(learn.chatgpt.com)指出,ChatGPT 桌面版與 Codex CLI(一款在終端機裡跑的 AI 寫程式工具)現在新增「匯入」功能,可以把使用者在其他 AI 助理裡設定好的東西直接搬過來用,不用重新打一遍。桌面版可以從 Claude Code(Anthropic 的寫程式 AI 工具)、Claude Cowork、或 Cursor(另一款 AI 程式編輯器)匯入;Codex CLI 則可以從 Claude Code 或 Cursor 匯入。可匯入的內容包括指令設定檔、Skills(預先寫好的技能包)、Plugins(外掛程式)、專案資料夾、最近的對話紀錄、MCP 伺服器設定(讓 AI 連接外部工具/資料的協定)等。匯入過程不會刪除或更動使用者原本在舊工具裡的設定,兩邊可以並存。
ChatGPT 桌面版使用者 — 在 Settings 選單開啟 Import,選擇要從 Claude Code、Claude Cowork 或 Cursor 匯入,並勾選要帶過來的項目(如指令檔、Skills、Plugins、專案)。結果:匯入完成後可直接打開被匯入的專案或對話繼續工作,且可開啟自動同步,讓匯入的內容持續跟原工具保持一致。怎麼做:開啟 ChatGPT 桌面版 → Settings > Import(若沒看到,改到 General 找「Import other agent setup」)→ 選擇來源 AI 工具 → Continue → 勾選要匯入的項目 → Continue Codex CLI 使用者 — 在終端機的 Codex CLI 對話中輸入 /import 指令,選擇要從 Claude Code 或 Cursor 匯入設定、專案檔案與近期對話。結果:最多可匯入過去 30 天內的 50 筆對話,並可檢視、確認匯入的設定後在 Codex 裡繼續原本的工作;但此指令在任務執行中、遠端連線、或連接本機 app-server daemon 時無法使用。怎麼做:在本機啟動 Codex CLI 對話 → 輸入 /import → 選擇 Claude Code 或 Cursor → 挑選要匯入的設定、專案檔、近期對話 → 確認後繼續在 Codex 中工作
法國AI新創公司Mistral宣佈計畫在2030年前,於歐洲打造最多1GW(十億瓦,約可供應數十萬戶家庭用電量的發電規模)的AI運算容量,也就是大量用來訓練與運行AI模型的伺服器機房。Mistral推動這項計畫的理由是要建立「主權運算」(sovereign infrastructure,指歐洲自己掌控的AI基礎設施,不必依賴美國或中國的雲端服務)。目前Mistral已經開始向企業客戶洽談長期合約,希望在算力真正蓋出來之前就先鎖定用戶需求,確保投資有回報。這反映出全球AI公司為了跟上運算需求,正積極自建龐大的資料中心與電力基礎設施。
Mistral AI — 規劃在歐洲興建最多1GW的AI運算容量,目標於2030年前完成。結果:目的是建立不依賴他國的歐洲主權AI基礎設施,同時公司已開始向客戶尋求長期承諾以支持這項擴張計畫
英國科技媒體The Register報導了企業IT顧問Keith Townsend(CTO Advisor)的分析。他指出,常聽到的「95%企業AI專案沒有帶來實質回報」這個統計數字,真正的問題不在AI模型本身、也不在資料,而是出在「代理層」(agent layer,也就是負責決定要用哪個模型、哪個AI代理去處理任務、怎麼在多個模型間分配工作、以及要留下什麼證據紀錄的那一層邏輯)。他提出一套「八層AI基礎架構」模型,主張其中第2C層(也就是「推理/判斷層」)幾乎無法在不同廠商、雲端與地端環境之間搬遷,因為裡面藏著決定AI系統該相信什麼、由誰負責、出錯了要找誰負責的規則,一旦企業把這層外包給供應商,就等於把控制權也一併讓出去了。他還提出「決策授權配置模型」(DAPM),把企業裡的決策授權分成「未明確歸屬」「平臺主導」「治理耦合(自動化到一定門檻就轉交人工審核)」「產品對齊(授權給產品團隊在guardrail範圍內自行決定)」等幾種類型,主張多數企業從沒認真盤點過這些授權到底歸誰,等系統在正式環境中做出離譜判斷(也就是常說的AI幻覺,指AI一本正經講出錯誤或編造的內容)時才發現說不清楚原因、也找不到能修的人。
Keith Townsend — 去年他把一套正式上線的AI系統,從Google Cloud(谷歌雲端平臺)搬到自家機房的NVIDIA DGX Spark(一種地端AI運算設備)上,目的不是真的要離開Google,而是想搞清楚「如果要離開,代價會是什麼」。結果:他發現資料本身一個下午就搬完了,但嵌入向量(embeddings,把文字轉成AI能理解的數字向量)、檢索邏輯、以及判斷語意關聯的規則完全沒辦法直接搬過去,他得整套手動重建;他因此體會到「資料搬得動,但判斷力搬不動」,這正是他後來提出「推理層才是鎖定廠商的關鍵」這套理論的起點
JetBrains(開發 IntelliJ IDEA、PyCharm 等程式編輯器的公司)發現公司內部使用 AI 工具(例如寫程式用的 AI 助手)的花費半年內暴增將近十倍,於是開始想辦法把這些支出看清楚、管起來。他們沒有像有些公司一樣直接規定員工只能用一兩款 AI 工具,而是蓋了一套共用的存取與計費系統,讓工程師還是能自由選用各種 AI 工具,但公司可以統一追蹤和控制花費。這套系統後來擴充成一個叫 Central CLI(CLI 是指令列工具,工程師打指令來操作的軟體)的東西,所有透過它呼叫 AI 工具的請求都會先經過公司自己的 AI 平臺,等於在工程師和各家 AI 服務商(例如 Anthropic、OpenAI)中間加了一個管制站,主管可以看到並設定每個人或每個團隊的花費上限。這反映出一個趨勢:AI 費用管理正變成企業工程團隊必須認真面對的營運問題,不只 JetBrains,Accenture、Uber 等公司也都在想辦法控制員工濫用 AI 導致的成本暴增。
JetBrains 內部工程團隊 — 一開始花了四天人工把各個 AI 供應商和工具的用量、費用資料手動整理進試算表,先搞清楚錢花到哪裡去了。結果:後來把這個流程自動化,改用供應商的 API(讓不同軟體互相溝通、自動抓資料的接口)加上內部儀錶板,隨時能看到目前和預估的花費,不用再手動整理 JetBrains — 把一位員工自己寫的內部小工具擴充成正式的 Central CLI,讓所有 AI 工具(不論自家或第三方)的請求統一經過公司的 AI 平臺。結果:一千多名開發者在短短幾週內就採用了 Central CLI,公司也因此能對第三方工具套用既有的 AI 額度制度,並讓主管替個人、團隊設定花費上限,不過目前仍有部分終端機型 AI 代理和員工個人訂閱的花費還沒被涵蓋進來
Cisco 官方部落格宣佈,旗下的 AI Defense(一套專門偵測 AI 威脅的資安服務)現在可以透過 Anthropic 新推出的「推論掛鉤」(inference hooks,就是讓模型在真正開始回答之前,先把使用者輸入送去給第三方資安服務檢查一遍的機制)整合進 Claude 企業版。當員工在 Claude、Claude Code(可以寫程式、操作工具的 AI 助理)或 Claude Cowork 裡輸入提示詞(prompt,就是你打給 AI 的指令)時,這段內容會先被送到 Cisco AI Defense 檢查,判斷裡面有沒有提示詞注入(prompt injection,指藏在文件或網頁裡的惡意指令,企圖騙 AI 執行不該做的事)或越獄(jailbreak,指設法繞過 AI 安全限制的手法),確認安全才放行讓模型真的執行,否則就直接擋下來。Cisco 強調傳統的資料外洩防護(DLP)工具只會盯著「敏感資料有沒有流出去」,並不會去看「AI 本身有沒有被騙、被操控」,而這正是 AI Defense 想補上的缺口,同時它也會檢查 AI 呼叫外部工具(包括透過 MCP,一種讓 AI 連接外部工具/資料庫的標準協定)後傳回的結果內容是否被動過手腳。
企業安全團隊 — 在 Claude 企業版中啟用 Cisco AI Defense 整合,讓每一則員工送給 Claude、Claude Code 或 Claude Cowork 的提示詞,在模型真正執行前先經過檢查。結果:惡意的提示詞注入或越獄嘗試會在模型執行前就被擋下(回傳 deny 判定),安全的提示詞則正常放行(回傳 allow 判定),過程中每個檢查請求都會用一次性簽章驗證真偽,員工的使用體驗完全不受影響。怎麼做:目前此功能透過 Anthropic 的 inference hooks(尚在測試版)運作,只在模型執行前的提示詞階段生效,回應內容的檢查要等 Anthropic 擴大該功能後才能支援;企業可到 Claude 企業版設定中開通,也可先到 Cisco 開發者入口網站的 playground 輸入提示詞試看看即時檢查結果
Google Cloud官方部落格宣佈,旗下的資料庫搬遷服務(Database Migration Service,簡稱DMS,是幫企業把資料庫從一種系統換到另一種系統的工具)現在加入了Gemini(Google自家的AI大腦,跟ChatGPT是同類東西)驅動的程式碼轉換功能。企業把老舊資料庫(例如Oracle或SQL Server)搬到開源的PostgreSQL資料庫時,最卡關的地方是裡面成千上百段用特殊語法寫的「預存程序」(stored procedure,就是資料庫裡預先寫好、可重複執行的一段程式邏輯,處理像是訂單計算、交易驗證這類商業規則),這些程式過去要靠工程師逐行手動改寫,常常要花好幾個月。現在Gemini能自動把這些舊語法轉換成PostgreSQL可讀的PL/pgSQL程式碼,並且會把轉換後的新程式碼和原始程式碼並排顯示,讓工程團隊可以邊看邊審核、修改,確認無誤後才真正部署上線,而不是讓AI黑箱自動上線。
一個要把Oracle資料庫搬到PostgreSQL的企業團隊 — 原本資料庫裡有一段Oracle專用的預存程序,用來計算顧客訂單總額並套用分級折扣,裡面用了Oracle特有的NVL和DECODE函式;過去團隊得手動把NVL改寫成PostgreSQL的COALESCE函式、把DECODE改寫成標準的CASE條件式,還要調整例外處理邏輯(例如WHEN NO_DATA_FOUND THEN這類語法)。結果:改用DMS裡的Gemini後,系統會自動分析這段原始程式碼並直接產生對應的PostgreSQL PL/pgSQL程式碼,同時附上說明文字解釋為什麼NVL要換成COALESCE、DECODE的邏輯如何轉成CASE區塊,團隊只需要審核與微調,不必從零手動翻譯。怎麼做:在DMS的搬遷評估流程中執行分析,系統會自動產生轉換後的PL/pgSQL程式碼、附帶行內解釋,並提供Converted、Warning、Action Required等驗證狀態標記,供人工逐一檢查後再套用到目標的Cloud SQL或AlloyDB測試環境
IBM與Red Hat宣佈擴大Lightwell專案,推出新的商業版工具,協助企業針對「人類寫的」和「AI寫的」軟體都建立可驗證的信任機制。背景是:現在AI寫程式的速度越來越快,企業不只要程式碼跑得動,還要能證明這段程式碼從哪裡來、怎麼做出來的、有沒有被竄改過、是否符合公司的安全規定。Lightwell整合了業界既有的幾個安全標準,包括Sigstore(幫軟體元件簽名認證的工具)、in-toto(記錄軟體從開發到部署每一步流程的框架)、SLSA(一套供應鏈安全等級標準)、以及SBOM(軟體物料清單,列出一個軟體用了哪些元件,方便追查安全漏洞)。新推出的功能包含:幫程式碼「簽名」證明來源、產生「來源證明」(provenance,說明這段程式碼是怎麼建置出來的)、驗證是否符合公司政策、以及生命週期管理。IBM強調,未來會有越來越多AI代理人(agent,能自主執行任務的AI程式)直接參與寫程式、改設定、修bug,企業必須要能追蹤「到底是誰(或哪個AI)在什麼身分下、依照什麼規則做了這個改動」,這是Lightwell想解決的核心問題。
IBM與Red Hat — 擴充開源的Lightwell專案,推出商業版供應鏈安全工具,整合簽名、來源證明、產物驗證與政策執行等功能。結果:企業不用自己拼湊多個分散的開源專案,就能對人類與AI產出的軟體都建立可驗證、可追溯的信任機制
哥倫比亞大學(Columbia)的科學家團隊開發出一套結合AI的系統,用來在顯微鏡樣本裡找出極難發現的精子。有些男性精子數量極低(醫學上稱重度寡精症),但體內其實仍殘留少量精子,只是用肉眼透過顯微鏡檢查時,醫生常常找不到、容易漏看。這套名為「精子追蹤與回收系統(Sperm Tracking and Recovery,簡稱STAR)」的工具,就是用AI影像辨識技術去掃描樣本、揪出這些肉眼難以察覺的精子。研究團隊表示,這項技術有機會幫助到約一成因無精症(azoospermia,也就是精液中完全檢測不到精子的不孕症)而不孕的男性,讓他們仍有機會透過人工生殖技術懷孕。
哥倫比亞大學研究團隊 — 針對精液樣本中肉眼難以在顯微鏡下找到的稀少精子,開發AI系統進行自動掃描辨識。結果:能找出人工鏡檢常常遺漏的個別精子細胞,為無精症患者帶來透過生殖技術懷孕的新希望
開發者 Sahan Serasinghe 在個人部落格分享他打造一個「AI 修漏洞代理」的工程經驗。這個系統用 GitHub Copilot SDK(微軟 GitHub 提供的工具,能讓 AI 代理直接操作程式碼、跑指令、開 Pull Request 也就是提交程式碼修改請求)去自動修補程式庫裡的相依套件安全漏洞。他原本一次只處理一個程式庫,30 個程式庫要花 46 分鐘;改成同時跑 5 個代理(worker pool,工作池,就是限制同時執行數量的排隊機制)後縮短到 12 分鐘,但過程中踩了不少坑:多個代理共用暫存資料夾會互相覆蓋檔案、發生錯誤時代理資源沒清乾淨會外洩、單一伺服器內的併發上限在多臺伺服器(replica)同時跑時會被乘倍放大。他歸納出的關鍵原則是:每個代理要有獨立隔離環境、併發數量要看真正稀缺的資源(記憶體、硬碟、API 額度等)決定而非隨便設,且工作狀態要用資料庫等持久化機制記錄,避免代理當掉時重試造成重複提交 PR。這篇文章對正在打造或維護 AI 代理系統的工程師很有參考價值。
Sahan Serasinghe(作者本人) — 打造一個 AI 代理系統,讓它自動掃描程式庫的相依套件漏洞、做出最小安全修改、驗證後開 PR 給程式庫負責人審核。結果:從循序處理 30 個程式庫(46 分鐘)改成 5 個代理併發處理(12 分鐘),速度提升約3.8倍;但過程中發現需額外處理暫存目錄衝突、資源清理、跨伺服器併發上限、任務重試去重等問題才能安全運作。怎麼做:用 randomUUID() 為每個工作分配獨立暫存目錄(如 /tmp/agent-{repo}-{branch}-{uuid})避免檔案互相覆蓋;用 try/finally 確保代理連線、runtime、暫存區在任務結束或出錯時都會被清理;自訂一個有限併發數的 worker pool(而非用 Promise.all 讓所有工作同時無限制執行)逐一分派工作,任務失敗不影響其他工作
這篇部落格文章的作者(Excamera Labs 的工程師)指出,AI 的agentic coding工具(也就是能自己動手改程式碼、跑程式、看結果、再修改,反覆迭代直到完成任務的AI助理)今年變得非常強大,讓寫軟體的成本大幅下降。他發現,當軟體變便宜、其他非軟體類型的工作(例如硬體電路板設計)相對就變貴了,於是產生一個強烈誘因:想辦法把任何專案都改造成「看起來像軟體專案」的形式,藉此享受AI帶來的效率紅利。他以自己動手做的PCB(印刷電路板,就是電子產品裡那塊佈滿電路的綠色板子)設計為例,展示這個做法。
文章作者本人 — 作者原本用一套叫cuflow的工具,這是一個用Python程式碼(而非傳統CAD繪圖軟體)來畫電路板佈線的系統,過去純手工編寫程式碼來擺放零件、拉線,某次做TermDriver這片電路板花了約一週、寫了600行Python。這次他改用AI agent,直接用口語指令跟AI溝通,例如「把R4、R5往南移1mm,讓D+、D-線從USBC連接器下方繞到對應的電阻墊」「交換R4、R5的位置以消除線路交叉」「把R6、R7逆時針轉90度」,AI就會自動修改Python程式碼、執行產生Gerber格式的電路板圖檔(PCB製造業標準檔案格式)、檢視結果並持續調整。結果:作者表示AI不只會寫程式和排版,還懂USBC接頭的實際接線原理(作者自認這方面他懂得還不如AI多),產出的程式碼品質也不差,跟他自己寫的風格差不多。整個PCB佈線過程因此變得像在跟AI對話一樣輕鬆,大幅縮短了原本要花一週手工調整的時間。怎麼做:作者實際下給AI的指令範例:Move R4, R5 so they are 1mm south of the USBC, and route D+,D- underneath the connector to their respective resistor pads. Exchange locations of R4, R5. This will fixed the wire crossing. Rotate R6, R7 90 degrees counterclockwise. Place R7 so that its bottom pad is level with the USBC connector. Place R6 1.1mm right of R7.
Modular公司(開發AI推論框架MAX與Mojo程式語言的公司)官方部落格宣佈,Mojo語言正式邁入1.0版本。Mojo是一種專為高效能運算設計的程式語言(語法接近Python,但執行速度可媲美C/C++,特別適合寫給CPU、GPU等硬體跑的AI程式),從2023年首次發布至今持續演進。1.0代表語言核心語法終於穩定下來,之後的改動主要是新增功能,不會再像過去那樣頻繁大改,讓開發者可以放心用它蓋長期專案。Modular表示Mojo已經是他們自家商用產品MAX與Modular Cloud的底層基礎,天天在正式環境使用。
Mojo開源社群 — 自Modular開放Mojo標準函式庫原始碼以來,社群貢獻者提交程式碼修改。結果:近200位貢獻者送出超過1,100個PR(pull request,即程式碼修改提案),改動超過20萬行程式碼,另有上千人回報問題協助改善語言設計 Mojo語言團隊 — 在26.5版整合並簡化過去多種寫法並存的語法(例如變數宣告統一用var關鍵字、closure閉包寫法統一、指標型別統一成單一Pointer型別),並新增Python風格的lambda(一種簡短寫法的匿名函式)語法。結果:語言用詞與寫法更一致,降低學習與維護成本;同時LSP(編輯器裡即時顯示程式碼提示、抓錯的服務)更穩定,VS Code等編輯器使用體驗改善;並新增可偵測記憶體參照失效(例如List.append後舊的參照失效卻仍被使用)的安全檢查 MAX(Modular的AI推論框架)團隊 — 為26.5版MAX新增對GLM-5.2、Nemotron-H兩種模型(皆屬於Mamba-2混合架構模型)的支援,並讓Kimi 2.5模型能透過新的Module V3路徑載入使用;同時把安裝方式拆分成max["serve"]、max["benchmark"]、max["all"]等選項。結果:開發者可以只安裝自己需要的部分套件,不必整包下載;原本的modular套件將於26.6版停用改由新方式取代。怎麼做:uv pip install --upgrade mojo uv pip install max[all]
一位獨立部落格作者發表分析文章,說明如何單純靠對Claude、GPT等前沿AI模型(就是ChatGPT、Claude這類會對話的大型語言模型)提出精心設計的問題,反推出這些模型背後隱藏的訓練資訊,例如訓練資料收集到什麼時間點(稱為knowledge cutoff,知識截止日)。作者解釋,大型模型的訓練通常分三階段:先用大量網路資料做「預訓練」(pre-training,讓模型學會基本的文字接龍能力)、再用品質較高的專業資料加強能力、最後把它調教成會對話、會用工具的「助理」人格。作者發現,只要問模型「歷史上某天發生什麼事」的選擇題,統計錯誤率隨時間變化的曲線,就能推估模型的預訓練資料大概收集到哪一天為止;另外也可以直接問模型「今天幾號」,或問模型「你是誰」,從回答模式反推訓練細節。文章也指出一個有趣現象:Anthropic的Sonnet 5有時會誤認自己是GPT-4,作者推測可能是訓練資料裡混入了大量使用者與舊版ChatGPT的對話紀錄所致。
這位部落格作者 — 蒐集維基百科上「每日發生的歷史事件」做成8選1選擇題題庫,拿去測試多個Claude與GPT系列模型,並統計各模型答對率隨日期增加而下滑的曲線。結果:從錯誤率開始明顯上升的時間點,推估出Anthropic的Opus 4.7之後的模型可能來自同一個訓練批次、預訓練資料截止於2025年12月底左右;OpenAI的GPT-5.6系列則來自另一批約2026年2月底完成的訓練資料,顯示不同版本模型並非用同一份底層訓練資料 這位部落格作者 — 另外直接詢問模型「今天是幾號」以及「你是誰」,觀察不同模型世代回答的變化規律。結果:發現同一預訓練資料的模型家族(例如Opus 4.7、Sonnet 5、Fable/Opus 5)在自報日期上有明顯的世代分界線,且進一步測試發現Claude系列模型在被要求「假裝自己是某個OpenAI模型」時,模仿準確度達68%,但OpenAI模型反過來模仿Claude的準確度只有8%,作者推測這與訓練資料中混入大量ChatGPT對話紀錄有關
OpenAI官方部落格由公司財務團隊撰文,分享過去兩年把整個財務部門重新用AI(人工智慧)打造的五個心得。他們的長期目標是「零延遲結帳」(財報結算即時完成,不用等好幾天)和「持續更新的預測」(不用每次都手動重做預測模型)。文章強調重點不是買更多AI工具或用更多token(AI處理文字的計費單位),而是重新設計整個工作流程,圍繞著「決策」本身、給員工可以嘗試新做法的空間、把權責分清楚、並實際量測AI到底做出了多少有用的成果。他們也提到自建的客製化GPT(一種可以針對特定資料訓練回答風格的AI聊天工具)已經在投資人關係、採購、稅務等部門派上用場。
OpenAI投資人關係團隊 — 打造了一個叫IR-GPT的客製化GPT,讓它只根據公司核准過的資料庫內容來回答投資人盡職調查(due diligence,就是投資人深入查核公司狀況)時提出的問題。結果:原本一個分析師要花好幾小時、有時甚至熬夜才能查資料、寫草稿、核對一致性的工作,現在幾秒鐘就能生出一份完整的初稿,但最終還是由人來審閱、加入判斷並確認跨投資人的回答一致 一位原本完全不會寫程式的廣告部門同事 — 使用Codex(OpenAI的AI寫程式工具)自己動手做了一個工具,把每月的廣告預測拆解成每週、每日的細部計畫,並自動考慮平日假日差異。結果:這個工具能自動比對預測數字、確保每個數字都對得上核准過的模型,行銷主管可以快速看出哪裡有變化、該往哪裡加碼投資
這篇文章來自產品分析平臺PostHog的部落格,作者Cleo Lant(PostHog產品行銷經理)主張,AI agent(能自己執行多步驟任務的AI助理)並不會讓使用者介面(UI,就是螢幕上讓人點選操作的畫面)消失,而是讓產品變成「人機混合」型態:一部分操作交給agent透過API或MCP(一種讓AI連上軟體、直接呼叫功能的協定)在背後完成,另一部分則仍需要人類用畫面來核准、檢查、還原錯誤。作者指出,未來產品最有價值的畫面,會是讓人核准agent的動作、檢視agent到底改了什麼、必要時一鍵撤銷、以及一次看清多個agent在做什麼的介面,而不是傳統的操作按鈕。文章也提到agent不會像人一樣留下滑鼠亂點、放棄填表單這類使用痕跡,所以產品團隊需要另外建立追蹤機制才能知道agent到底在幹嘛、卡在哪裡。
PostHog(分析工具公司) — 讓使用者只要在終端機執行一行指令,就能自動設定帳號、掃描程式碼決定要安裝哪些追蹤功能,過程逐步顯示在終端機。結果:設定完成後,有些人繼續透過MCP(不用畫面)操作,也有人回到網頁介面看數據、點選瀏覽。怎麼做:npx -y @posthog/wizard@latest PostHog內部團隊 — 用公司自己的Slack機器人,把一句話的需求描述自動轉成一份PR(Pull Request,即提交給工程師審核的程式碼修改提案)。結果:作者表示99%信任AI能做對,但仍會在GitHub的介面上檢查程式碼差異(diff)才決定是否合併 AgentMail(電子郵件服務) — 讓AI agent依照線上文件,自行申請電子信箱帳號並產生存取金鑰,不需要人類手動開控制檯設定。結果:但驗證仍需要人類介面協助:系統會寄一組六位數驗證碼給實際的人,在人類轉交驗證碼之前,agent只能用申請當下的信箱地址寄信 Vercel(網站部署平臺) — 提供MCP伺服器,讓agent可以查詢部署狀態、抓取執行紀錄、觸發新的部署。結果:agent做的部署變更會同步出現在人類看的Vercel後臺畫面,附帶一樣的紀錄與復原(rollback)功能 PostHog — 提供自家MCP伺服器,讓agent用使用者的帳號權限建立功能旗標(feature flag,用來控制新功能是否對使用者開放)或啟動A/B測試。結果:所有變更都會記在專案的活動紀錄裡,並標註是哪個agent用戶端呼叫的,方便之後篩選出哪些改動是agent做的、哪些是人做的 PostHog團隊 — 開發了一個叫MCP Analytics的工具,把每一次agent呼叫工具的紀錄都轉成一筆事件,連agent當下想做什麼都記下來。結果:上個月追蹤到近1000萬次工具呼叫、來自31種不同的agent用戶端;靠這些紀錄發現使用者實際用agent做的事,包括某項數據變動就自動發簡訊通知、上線一個A/B測試(含功能旗標與50/50分流設定)、排查正式環境的錯誤(如過期的登入連結、遺失的登入憑證) Intercom(客服軟體公司) — 其Fin Operator功能會依需求調整AI客服機器人Fin的設定。結果:每次調整都變成一份提案(官方形容像是一份Pull Request),列出結構化的修改內容與原因,使用者要先審核、編輯、核准後才會真正生效 Anthropic — 沒有把Claude Code(他們的AI程式設計工具)只留在終端機介面,而是額外推出桌面應用程式、網頁版、IDE擴充套件,以及一款叫Cowork的產品,全都包著同一套底層AI模型。結果:喜歡精簡指令列操作的人可以繼續用終端機,喜歡更完整畫面操作的人可以改用Cowork,滿足不同使用習慣
這是阿里巴巴 Qwen 團隊在 GitHub 上發布的開源專案 Qwen-MM-Plugins(多模態外掛套件),目的是讓 AI agent(能自主執行任務的 AI 助手,例如 Claude Code、Codex 等程式設計工具)也能直接讀懂圖片、影片、音訊、文件等內容,而不只是處理文字。使用者只要跑一行安裝指令,就能把這些能力(稱為 Skill,技能模組)加進自己常用的 AI 工具裡,並依需要外接 MCP 伺服器(一種讓 AI 呼叫外部工具的標準介面)。套件涵蓋讀圖讀影片、OCR 文字辨識、網頁搜尋、長影片記憶、影音生成剪輯、3D 建模(Blender、FreeCAD)、教育影片製作等多種能力,各自獨立安裝、互不影響。此專案採 Apache-2.0 開源授權,任何人都能免費使用與修改。
Qwen-MM-Plugins 使用者 — 安裝好對應能力後,在對話中直接用 @ 附加檔案並用白話下指令,例如附上一份 PDF 說「總結第三頁並擷取表格」、附上會議錄影說「轉成逐字稿並標出說話者與時間戳記」、附上一張照片說「辨識拍攝地點並上網驗證」、附上兩小時的講座影片說「列出各段重點與時間戳記」。結果:AI 會自動選擇對應的 MCP 工具處理這些非文字內容,不需要使用者手動指定用哪個模型或工具,等於把原本只會讀文字的 AI 助手升級成能看圖、看影片、聽聲音的全能助手。怎麼做:@report.pdf Summarize page 3 and extract its table. / @meeting.mp4 Transcribe this with speaker labels and timestamps. / @place.jpg Identify where this photo was taken and verify it on the web. / @lecture-2h.mp4 List the main points with timestamps.
這篇發表在arXiv的機器學習論文(研究團隊未具名,隸屬論文作者群)測試了一個關於Transformer(目前主流大型語言模型,如ChatGPT背後所用的神經網路架構)的基本假設:模型裡的前饋網路層(FFN,是Transformer區塊中負責記憶知識的一種子層,佔了模型裡三分之二的非嵌入參數量)到底是不是必要的。研究團隊做了一系列「攻控實驗」,把FFN整層拿掉、只保留注意力機制(attention,讓模型判斷輸入中哪些字詞該互相參考的機制),做出所謂「純注意力Transformer」(Simple Attention Networks,簡稱SAN),並用參數量、訓練運算量(FLOPs)、層數三種方式分別對齊,訓練規模從600萬到8700萬參數、最多餵入1050億個token(token是文字被切分後的最小處理單位,大約等於半個到一個英文單字)。結果發現,如果只是單純把FFN拿掉,模型表現會明顯變差;但如果把省下來的參數預算拿去加深注意力層的層數,兩種架構的表現差距就幾乎消失,只剩下0.27%的損失差異。進一步分析顯示,純注意力模型在「答案就在輸入內容裡」的題目表現較好,但在「答案要靠模型自己記住的知識」這類題目上較弱,顯示FFN層原本負責的部分知識記憶功能,被轉移到了注意力輸出投影層上,並且需要一種叫QK-normalization(一種讓訓練更穩定的技巧)才能讓48層的純注意力模型順利訓練。
論文研究團隊 — 在參數量、訓練運算量、層數三種條件下分別對齊,訓練『拿掉FFN層、只用注意力機制』的Transformer模型(SAN),並與標準Transformer(保留FFN層)做對照比較。結果:若只是單純拿掉FFN層而不調整其他設計,標準Transformer在相同層數下領先0.47 nats(衡量模型預測準確度的單位,數字越小代表模型效果越好)、在相同運算量下領先0.26 nats;但若把省下的參數預算拿去加深注意力層,兩者在相同參數量下的差距只剩0.006 nats(僅0.27%的差異),且在600萬到8700萬參數規模下這個微小差距都很穩定重現。怎麼做:研究團隊在fineweb-edu資料集(一個高知識密度的網頁文字資料集)上,用一組事先設定好、未經調整的預測(pre-registered test)驗證這個解釋:預測差距應落在0.02到0.05 nats之間,實際訓練配對模型測得的差距是0.040 nats,與預測相符
研究機構Gartner發布預測指出,企業花在「AI優化版IaaS」(IaaS是Infrastructure as a Service的縮寫,意思是雲端業者提供現成的伺服器、運算資源讓企業租用,不用自己買機器;「AI優化版」代表這些伺服器特別針對AI運算做過調校)的支出,2026年將成長96%,總金額達到420億美元。Gartner特別指出一個轉折點:以往企業花錢主要是拿去「訓練」AI模型(就是餵資料讓AI學習),但現在「推論」(inference,也就是AI模型訓練完之後、實際被使用者呼叫來回答問題、生成內容的階段)所需要的運算量,已經超過訓練,成為雲端支出的最大來源。Gartner認為,這是因為「Agentic AI」(能自主規劃、執行多步驟任務的AI,而不只是單次回答問題)和更多AI產品正式上線,讓企業需要持續不斷地跑AI運算,而不是像以前訓練完就沒事了。
Gartner — 分析並預測2026年全球AI優化版IaaS雲端支出的成長趨勢。結果:預估支出將成長96%達420億美元,且推論所需運算量首度超越訓練,成為最大支出項目
OpenAI 官方宣佈為 ChatGPT Business(企業版方案,讓公司員工共用管理的 ChatGPT 帳號)推出新的 Premium(進階)席位選項。以往企業版只有一種標準席位,每五小時有使用量上限;現在企業可以額外購買 Premium 席位,用量提升為標準席位的 5 倍,而且完全取消五小時用量限制,適合工作量特別大的員工。企業可以在同一個工作區內混合搭配標準席位和 Premium 席位,依照每個人的實際需求分配,管理者也能在同一介面統一管理用量、帳單與支出上限。
企業老闆/經營者 — 用 ChatGPT 把銷售報表、顧客回饋、庫存資料整合起來,做成營運計畫。結果:原文提到這類分析工作用量大,容易撞到標準席位的五小時用量上限,Premium 席位可讓工作不中斷 行銷人員 — 用 ChatGPT 根據顧客洞察資料,一次規劃整個行銷活動。結果:用量需求較大時可使用 Premium 席位,避免中途被限制打斷 開發者 — 使用 Codex(OpenAI 的程式協作工具)在較大型的程式碼庫上進行建置、測試與功能改進。結果:Premium 席位提供 5 倍用量並取消五小時限制,讓大型專案工作更順暢
WorkOS官方部落格指出,企業裡大量透過MCP(Model Context Protocol,一種讓AI代理人/agent連接檔案、資料庫、內部工具的通訊協定)串接的伺服器,正變成傳統資安工具偵測不到的新型「影子IT」(shadow IT,指員工私自使用未經公司審核的軟體或服務)。文章解釋,過去的雲端存取安全工具是靠監看網路流量邊界來抓違規軟體,但很多MCP伺服器是以本機子程序(stdio,一種同一臺電腦內部程式互相溝通的管道,不會經過網路)方式運作,根本不會被這類工具看到。文章引用Gravitee《2026年AI代理人安全報告》指出,企業內運行的AI代理人數量已超過三百萬個,四個月內成長近一倍,但受到主動監控的比例只有五成二左右。文章強調,風險本質也變了:以前是擔心資料外洩,現在是擔心AI代理人直接對系統做出刪除、轉帳、寫入等實際操作,而且往往完全沒有審核紀錄。
Gravitee(資安報告發布機構) — 發布《2026年AI代理人安全報告》,統計企業內運行的AI代理人數量與監控狀況。結果:發現企業內AI代理人數量已超過三百萬個(比全球沃爾瑪員工數還多),四個月內成長近一倍,但平均監控覆蓋率僅52%,只有14.4%的組織表示所有代理人上線前都經過完整安全審查,88%的組織表示過去一年曾發生或懷疑發生過與AI代理人相關的資安或隱私事件 資安研究人員(2026年5月揭露) — 對外揭露Anthropic官方MCP SDK(軟體開發套件)中一個系統性的設計缺陷,這個缺陷與本機stdio傳輸的處理方式有關。結果:這個缺陷影響下載次數超過1.5億次的生態系,估計有約20萬個暴露的實例;Anthropic證實此行為屬於設計如此,拒絕修改協定,並表示輸入內容的安全過濾應由開發者自行負責,因此這不是一個等待修補的臭蟲(bug),而是MCP本身的運作方式 Akto資安研究員(透過Cloud Security Alliance發表) — 分析並提出「風險本質已改變」的論點:以前的影子AI風險是資料外洩,現在的風險是AI代理人會直接對資料採取行動。結果:同份調查發現79%的組織仍然看不清自己環境中實際運行的AI代理人與MCP連接系統,47%的企業AI使用是透過個人帳號進行、完全脫離公司的單一登入(SSO)與身分治理機制之外,等於AI代理人可以動用員工既有的所有存取權限,卻沒有任何稽核紀錄在監看
Meta(臉書母公司)執行長馬克·祖克柏(Mark Zuckerberg)發表一篇約6500字的長文,說明他對AI(人工智慧)未來發展的新構想。他提出要釋出更多開放權重模型(open-weight model,就是把AI模型的核心參數公開讓大家免費下載、修改、自行架設使用,不像封閉模型只能透過官方付費接口使用),並且成立一支10億美元的基金,投資在Meta興建資料中心(就是存放大量伺服器、用來訓練和運算AI的機房)所在的當地社區。祖克柏認為,Meta把強大AI盡量開放給所有人使用的做法,反而是讓人類避免走向災難性後果的最安全路徑。這篇文章也讓「先進AI是否太危險、不該用開源方式公開」這個業界長期爭論再度成為焦點。
Meta(祖克柏本人) — 發表長文闡述AI政策方向,主張持續釋出開放權重模型,並承諾成立10億美元基金回饋資料中心所在社區。結果:為「AI開放 vs 封閉」的產業辯論提出Meta的官方立場:開放釋出比嚴格封閉更能降低AI帶來的危險
Google(谷歌,全球最大搜尋引擎公司)正在測試一款新版首頁,把原本經典的搜尋按鈕換成「AI Mode」(AI 模式)按鈕。這個新介面讓使用者可以直接詢問檔案內容、使用「Brainstorm」(腦力激盪,一種幫忙發想點子的功能),而且不用登入帳號就能用。如果有登入帳號,還可以額外用來生成圖片。「Ask about files」(詢問檔案)功能讓使用者可以先附上一個檔案,再針對檔案內容提問。
未登入的一般使用者 — 造訪Google新版首頁,點擊AI Mode按鈕,並使用Ask about files功能附加檔案後提問。結果:不需要登入帳號,就能直接針對上傳的檔案內容得到AI回答 未登入的一般使用者 — 在新版首頁使用Brainstorm功能探索想法。結果:不用登入即可透過AI協助發想點子 已登入帳號的使用者 — 在新版首頁使用AI功能。結果:除了上述功能外,還能額外生成圖片
部落格作者 Sean Goedecke 在其個人網站發文主張,本地模型(就是直接跑在你自己筆電、手機上的 AI,不用連網路伺服器)永遠不會贏過資料中心裡的大型模型。他認為現在最強的 AI 模型都太大,只能在整排 GPU(顯示卡,AI 運算用的晶片)組成的叢集裡跑,一般消費者的電腦裝不下。就算小模型愈來愈聰明,使用者也還是會選當下能力範圍內最強的那個模型,而最強的永遠是資料中心版本。他也算了一筆帳:在家自己建一套跑本地模型的設備,成本反而比訂閱雲端 AI 服務貴,因為資料中心可以把很多人的運算「打包」(batching,把多人的請求合併一起算,效率更高)一起處理,比一臺家用顯示卡單獨跑划算約 30 倍。
Thinking Machines 與 OpenAI — 在語音對話等需要即時反應(低延遲)的應用中,採用一種叫「Interaction Models」的設計:先用一個小而快的本地模型負責即時對話,遇到困難問題再轉交給雲端的大模型處理。結果:作者認為這種『小模型接話、大模型思考』的混合模式,可能會是未來五年多數人使用 AI 的主要方式,但背後大部分實際運算仍發生在資料中心,而非本地
部落客 Dan Luu(知名工程效能分析作者,網站 danluu.com)發表長文,質疑網路上流傳「動態語言(像 Python、Clojure 這種不用先宣告變數型別的語言)比靜態語言(像 Rust、Go、C++ 這種要先宣告型別的語言)更省 AI token(就是 AI 讀寫程式碼要花的運算單位,越少越省錢越快)」的說法。他發現這個說法源自小規模、過度簡單的測試題,並不能代表真實情況。於是他自己找 AI 程式設計代理人(coding agent,就是能自己動手寫程式、跑測試、除錯的 AI 工具)做了兩個較大型的真實任務,比較不同程式語言的表現。結果發現動態語言不見得比較好,反而是「語言愈流行、愈多人使用」跟「AI 表現愈好、愈便宜」比較有關係,跟語言是動態還是靜態關係不大。
Dan Luu — 讓 AI 代理人(用 GPT-5.6 等模型)分別用十幾種不同程式語言,從頭實作一個 zstd(一種資料壓縮格式)的解壓縮程式,且完全不給範例測試,只給官方技術規格文件。結果:在中等運算力(medium effort)下,動態語言看起來確實比較省成本又正確;但拉高運算力到最高等級(ultra effort)後,結果變得很混雜,反而有幾個靜態語言表現最好,證明簡單測試得到的結論不能套用到複雜任務上 Dan Luu — 再讓同一批 AI 代理人改用另一個完全不同性質的任務:實作文件格式轉換工具 Pandoc 的一部分功能,並用另外保留、AI 看不到的測試題(holdout tests)來打分數,避免 AI 投機取巧硬套答案。結果:同樣沒看到動態或靜態語言哪一邊明顯勝出,反而是冷門語言普遍表現較差,而語言的『流行程度』和『測試分數高、花費低』有較弱到中等的正相關 Dan Luu — 額外比較了兩種讓 AI 持續工作的方式:一種是用最高運算力(ultra)一次跑到底,另一種是用中等運算力但反覆循環執行、每次清空記憶重來(也就是所謂的 Ralph loop 手法)。結果:整體而言,一次用最高運算力效果比反覆用中等運算力循環更好(不管是花費或時間),而且讓 AI 保留先前的上下文記憶接著做,比每次清空重來(Ralph loop)效果更好
Lenny's Podcast Network 的 How I AI 節目本集訪談了兩位使用 Claude(Anthropic 出的 AI 助理)打造工作流程的實際案例。第一個案例是 Claire 用 Vercel 推出的 Eve(一個能串接 Slack、GitHub 等平臺部署 AI agent 的工具,agent 就是能自主執行多步驟任務的 AI)在一次 Codex(AI 寫程式工具)作業階段裡打造了一個叫「Merge Mommy」的機器人,用來自動審查工程師提交的程式碼修改(PR,全名 Pull Request,就是工程師想合併進主程式的一批修改)。第二個案例是行銷顧問 Grace Clarke 把自己整個服務型事業的日常作業(收信、報價、客戶溝通)都搬進 Claude 裡處理,並用「skill 檔案」(教 AI 記住固定做事方法的說明文件)取代反覆手動下指令。這兩個案例都在說明:新一代 AI agent 平臺已經把重點從「搭建複雜技術架構」轉移到「把工作說清楚、寫成清楚的操作說明」。
Claire(Vercel Eve 使用者) — 用 Vercel Eve 打造名為 Merge Mommy 的機器人,在 GitHub 的 PR 通過自動檢查後,依「變更規模、影響範圍、能否輕易回復、資料與安全性影響、維運影響、測試與 CI 是否完成」六個面向替每個 PR 打風險分數,24 分以下判定為低風險、64 分以上才需要人工審查。結果:低風險 PR 由機器人自動核可,機器人不會直接合併程式碼,而是在 GitHub 上標記灰色勾勾,並發 Slack 訊息附上風險分數、提示人可以直接核准合併;對照案例中提到 Intercom 用類似機制後,AI 審查通過的 PR 合併速度是人工審查的 5 倍,且事後需要回退修正的比例更低。怎麼做:起始 prompt 只有兩三句話:打造一個 GitHub 機器人,等檢查通過後把每個 PR 評為低、中、高風險,並自動核准低風險的 PR;後續全靠反覆調整精煉,而非一開始就寫出完整規格書 Grace Clarke(AI 教育者、前行銷顧問) — 用三個 Claude skill 檔案(管線操作、提案產生器、語氣指南)取代原本每週 20 小時的行政雜務,並把 Gmail 收信流程整個搬進 Claude 裡處理,讓每次與客戶互動的脈絡都能被 AI 記住、累積成下次回覆的參考。結果:客戶溝通的語氣、偏好、歷史紀錄不再被鎖在 Gmail 收件匣裡用完即丟,而是持續累積成 AI 越用越懂她的素材;她也會把 Claude Code(適合主動去摸索解決方案)產出的工作交接內容存成 Markdown 檔案,帶到 Cowork(另一個較視覺化的協作介面)繼續處理,不必重新從頭說明
Martech.zone部落格刊出一位產品經理(PM,負責規劃產品功能與流程的角色)分享的第一手經歷:他不是工程師出身,卻靠AI程式碼生成工具(會自動幫你寫程式的AI)當「工程團隊」,獨自打造了一個名為Simsima的全球旅遊eSIM(一種不用實體卡、用軟體就能開通的手機門號)交易平臺。原本估計需要3到5位工程師、耗時6個月以上才能完成的專案,他一個人花幾週就做出來,同時身兼產品經理、設計師、測試與架構師,程式碼大部分由AI生成。他認為自己身為PM反而更擅長用AI開發,因為寫清楚的需求規格書(明確描述要做什麼、完成標準是什麼)正是PM的看家本領,而這正是AI輔助開發最關鍵的能力。
這位PM作者本人 — 用Next.js(網站框架)、React Native/Expo(跨平臺App框架)、Node.js搭配PostgreSQL資料庫等技術棧,靠AI工具獨自打造網頁版與手機App版的eSIM交易平臺Simsima,並自建含即時利潤追蹤、歐盟增值稅規則、定價管理的後臺系統。結果:原本團隊需2週的後臺系統開發,他一人靠AI只花一個週末完成;整體產品從原估6個月以上的團隊開發時程,壓縮到一人幾週內上線 Simsima團隊 — 設計了名為Smart Link的一鍵安裝功能,讓使用者收到確認信後點一下連結就能自動安裝eSIM,取代傳統掃描QR code或手動輸入40碼啟用碼的麻煩流程。結果:相較於只提供QR code安裝的做法,eSIM開通率提升22% Simsima團隊 — 上線時同步推出25種語言版本,針對200多個國家目的地頁面分別做在地化內容與hreflang標籤(告訴搜尋引擎哪個網頁對應哪個語言/地區的技術設定),而非機器翻譯充數,並額外發布llms-full.txt檔案(一份專門寫給AI模型讀取、幫助AI準確理解自家產品的說明文件)。結果:上線90天內,首批付費客戶來自西班牙、香港、義大利、日本、美國、德國、荷蘭、英國等8個國家、4大洲,多數並非該公司主動行銷觸及;並獲得首筆由Perplexity(一個AI搜尋引擎)導流促成的購買,顯示AI搜尋正成為新的旅遊消費導流管道
科技媒體diginomica報導了交友App公司Grindr執行長George Arison的訪談內容。Grindr近一年大力推動「AI原生化」(讓公司從傳統App公司轉型成幾乎所有開發流程都靠AI輔助的公司),結果是工程師寫程式的角色,逐漸變成監督、審核AI自動生成程式碼(AI synthetics,指AI自己產出的程式碼成果)的角色。Arison表示,從2025年7月到2026年4月,團隊人數差不多,但工程產出量大約增加了2.5倍,換算下來相當於省下約200名工程師、每年6千萬美元的成本。他也提到,現在真正卡關的不再是工程師人力,而是產品經理(Product Manager,負責決定要做什麼功能、優先順序的人)人力不足,因為AI已經讓「寫程式」不再是瓶頸。
Grindr執行長George Arison與財務長John North — 透過導入AI編碼工具(公司內部主要使用Cursor與Claude Code,近期也大量採用一款叫Devin的AI工程工具),讓工程師從自己動手寫程式,轉為負責架構設計、指揮AI、審核AI寫出來的程式碼,同時幾乎重寫了整個Grindr的程式碼庫。結果:工程產出量在9個月內成長約2.5倍(原始比較數字是3.5倍,但公司保守調低估計為2.5倍),且App的當機與臭蟲(bug,程式錯誤)明顯減少、速度變快,過去「Grindr很容易當機」的負面刻板印象已經改善,目前程式碼庫改造工程完成約四分之三
這是AI競技場評測平臺Arena(會讓不同AI模型互相比拼、幫使用者評分排名的第三方機構)在X(原Twitter)上發布的貼文。內容指出,韓國AI公司Upstage推出的新模型Solar Pro 4,是第一個同時登上Arena旗下三個排行榜(Agent Arena、Code Arena網頁開發項、Text Arena)的韓國實驗室,象徵韓國AI技術首次在這幾項國際評測中被正式收錄。在專門評測AI代理人(Agent,也就是能自己規劃、操作工具完成任務的AI)表現的Agent Arena榜單上,Solar Pro 4排名第44名,與MiniMax M2.7、Nemotron 3 Ultra等模型相近。Agent Arena用一種叫「因果追蹤」的方法,衡量模型在真實世界、需要多步驟才能完成的代理任務(例如寫程式、做簡報、上網研究、蓋應用程式、分析文件)中,相對於平均水準模型的淨改善程度。Solar Pro 4的整體淨改善分數是負12.10%,代表整體表現略低於平均模型,其中「確認成功率」為負7.3%、「讚美對抱怨比」為負23.4%、「可操控性」為負13.6%、「錯誤修復能力」(Bash Recovery,指AI在終端機指令出錯後能否自行修正)為負16.5%,只有「工具幻覺」(指AI是否會捏造不存在的工具)這項是正0.3%,表現略優於平均。
Upstage AI — 推出新模型Solar Pro 4,並將其提交至Arena平臺的Agent Arena、Code Arena(WebDev項目)與Text Arena三個排行榜接受評測。結果:成為第一個同時登上這三個榜單的韓國AI實驗室,其中Agent Arena排名第44,整體淨改善分數為負12.10%,與MiniMax M2.7、Nemotron 3 Ultra等模型表現相近
OpenRouter(一個能讓開發者用同一套API呼叫多家AI模型的平臺)宣佈,xAI公司(伊隆馬斯克旗下的AI公司)推出的圖像生成模型Grok Imagine Image 2.0已經上架OpenRouter,開發者可以直接透過API使用。這個模型設計上是給實際工作用的圖像產出,官方說它能規劃文字排版、版面配置,以及需要多個部分組合的複雜視覺內容,在攝影風格、平面設計、插畫等不同類型上都維持一定的還原度。官方特別強調「實際工作是反覆修改的」,所以Image 2.0加入了可以精準修改圖片中特定部分、其餘保持不變的編輯工具,而不是每次都重新整張生成。
OpenRouter平臺上的開發者 — 呼叫Grok Imagine Image 2.0的API生成圖片,並可在單次請求中提供最多3張參考照片。結果:每張圖片費用為0.04美元起,且能針對已生成的圖片做局部修改,不必整張重新生成
Ars Technica(一家科技新聞網站)報導,書商懷疑有AI公司正在大量收購稀有舊書,目的是拿來訓練AI模型(就是餵給AI大量文字資料、讓它學會產生流暢內容的過程),但掃描完後這些書可能被銷毀。原因是把書拆開、裁下書頁再逐頁掃描,是目前最快最便宜的掃描方式,比起保留書本完整、小心翼翼掃描要省時省錢很多。報導指出,Google早在2009年就申請了一種不必拆書就能掃描的專利技術,但這種方法掃描速度較慢、也可能因為書頁彎曲導致文字失真、或漏掃頁面,所以急著訓練AI的公司大多不願意採用。書商和愛書人擔心,實際被銷毀的珍本書數量可能比目前媒體報導的還要多,有些絕版書恐怕會因此永遠消失。
Internet Archive(一個致力於保存老舊書籍與網路資料的非營利組織) — 長期協助圖書館保存老化的書籍收藏,堅持用花時間、謹慎減少翻動書本的方式來掃描舊書。結果:相較於AI公司為求快速便宜而拆書掃描、可能導致書本永久損毀,Internet Archive的做法能保留書籍原貌,凸顯這是需要人工細心處理的工作,不是隨便就能自動化加速的流程
開發者 Hugo He 在 GitHub 上發布開源專案「PPT Master」,這是一套能把文件或主題自動變成真正可編輯 PowerPoint 簡報的工具。它會用 AI(人工智慧,能理解文字內容並自動生成內容的技術)分析來源資料,例如 PDF、Word 文件或網頁,抓出重點、把敘事邏輯安排好,再產出原生的 pptx 檔案(也就是一打開就能在 PowerPoint 裡直接編修的檔案,不是圖片或死板的文字方塊拼貼)。特色包括原生形狀與版面(slide master,也就是投影片母片,控制整份簡報統一風格的模板)、依資料自動生成圖表和表格、可以用簡報備忘稿生成語音旁白,以及支援使用者自己的 pptx 範本套用風格。專案目前在 GitHub Trending(GitHub 上熱門專案排行榜)日榜排名第三,程式語言為 Python,並有 Kimi、PackyCode 等多家 AI API 服務商贊助。
Hugo He(PPT Master 開發者) — 設計 PPT Master,讓使用者提供文件或主題後,系統會先理解材料內容並規劃簡報的論述架構,再進行版面設計,而不是單純把文字塞進固定模板。結果:產出的簡報是可在 PowerPoint 裡繼續編輯的原生檔案,包含真正的形狀、資料圖表與表格,而非平面文字方塊或死板模板套用
Macro(一間位於紐約與多倫多的新創公司)在 GitHub 上開源並推廣一款用 Rust 打造的團隊協作軟體,把 Email、聊天訊息、文件、任務、通話、CRM(客戶關係管理系統,就是記錄客戶聯絡資料和互動紀錄的軟體)全部整合進同一個介面。這個產品的重點賣點之一,是團隊內建「共享 AI 記憶」的 agent(AI 代理人,指能自主執行多步驟任務、而不只是單純聊天回答的 AI):所有信件、文件、任務、通話紀錄都會被串成一張互相連結的關係網,讓 AI agent 可以直接讀取整個團隊的資訊來協助處理客服、寫信、整理任務等工作,而不用像過去那樣把公司資料散落在 Slack、Notion、HubSpot 等好幾套各自獨立的工具裡。Macro 團隊表示這套系統已經被他們自己約 15 人的團隊內部使用了兩年。
Macro 團隊自己(約15人的公司) — 把公司內部原本使用的 Slack、Linear、Notion、HubSpot、Superhuman 等多套獨立工具,換成統一在 Macro 這一套系統裡運作,讓 email、聊天、文件、任務、CRM 資料能互相 @ 連結並被 AI agent 讀取。結果:他們上一個創業擴張到大約20人時,過去分散的工具讓資訊變得『不可計算』、難以整合追蹤;改用 Macro 後所有資料存在同一個雙向關聯的資料庫裡,AI agent 能跨郵件、任務、通話等資料來源直接協助處理工作 一位使用者(客服或業務人員情境) — 收到一封客戶的客服信件時,直接在信件介面按下『task』按鈕,把這封信轉成一則指派給工程師的任務單。結果:不需要手動複製信件內容或截圖轉貼到其他任務管理工具,信件與任務會自動保持連結。怎麼做:在郵件介面點擊「task」按鈕即可建立關聯任務
ZuodaoTech 團隊在 GitHub 上開源了一款叫 Enjoy 的英語學習應用,標語是「AI 是當今世界上最好的外語老師,Enjoy 做 AI 最好的助教」。這款工具結合網頁版(enjoy.bot)、瀏覽器插件(支援 YouTube 和 Netflix)以及即將推出的桌面版,讓使用者可以一邊看影片、看電子書,一邊用 AI 輔助練習英語聽說讀寫。它也搭配了一套叫「一千小時」的訓練教材,用系統化的方式引導使用者練習發音、口說和精讀(就是精讀一篇文章、逐字逐句弄懂的學習法)。這個專案在 GitHub Trending(GitHub 上熱門專案排行榜)單日排名第 16。
ZuodaoTech 團隊 — 開發 Enjoy 應用與搭配的瀏覽器插件,讓使用者能在觀看 YouTube、Netflix 影片時,用 AI 輔助理解與練習英語聽力口說,並提供電子書、單字卡(flashcard)、課程等學習功能。結果:使用者可透過網頁版直接在 enjoy.bot 使用,或在 Chrome 線上應用程式商店安裝瀏覽器插件;專案頁面的相關閱讀則列出『一千小時』與《人人都能用英語》。
開發者 Oleksandr Chekhovskyi 發表了 hax,這是一款用 C 語言寫成、只有單一原生執行檔的「終端原生」AI 編碼代理程式(coding agent,就是能在終端機裡幫你寫程式、跑指令、讀檔案的 AI 助手)。它的賣點是極輕量:啟動瞬間完成、只佔用幾 MB 記憶體,這樣本機跑的 LLM(本地大型語言模型,不用連網、資料留在自己電腦)就能用到更多剩餘的記憶體。它同時支援多種 AI 供應商,包括 OpenAI、Anthropic(也就是 Claude)、Codex、OpenRouter,以及本機執行的 llama.cpp,使用者可以自由切換要用哪個模型。作者強調 hax 刻意不做 MCP 市集、外掛系統、IDE 面板這些「大而全」的功能,走的是純粹、可稽核(能清楚看到送給模型什麼、模型回了什麼)、遵守 Unix 工具傳統的極簡路線,目標族群是常駐終端機、愛用本地模型、需要稽核工具行為,或資源有限的開發者。
習慣在終端機工作、且常跑本地模型的開發者 — 在自己電腦上用 llama-server 啟動本地模型,再用 hax --provider llama.cpp 連接,讓 hax 自動偵測模型與執行環境的能力,不需要額外寫供應商設定檔。結果:可以用極少記憶體、瞬間啟動的方式在終端機直接跟本地 AI 模型互動、下指令、串接子程序,而不必忍受一般 AI 編碼工具佔用大量資源、接管整個終端機畫面的問題。怎麼做:llama-server -m [model].gguf 然後 hax --provider llama.cpp;也可用 hax -p "list TODOs" 執行單一提示、hax -c 繼續上次工作階段、hax --resume 挑選過去的工作階段
MIT Technology Review 旗下業配內容部門 Insights,與 Google Cloud 合作發布一份調查報告。這份報告訪問了 300 位資料與技術主管,發現大部分公司的舊式資料系統(legacy data system,指用了很多年、架構老舊的資料庫或後臺系統)跟不上 AI 代理(agentic AI,就是能自己做決定、自己採取行動的 AI,不只是回答問題而已)即時存取、跨部門調資料的需求,導致 AI 做出的決策不夠準確、也難以擴大規模。報告把受訪企業分成「資料領先者」與「資料落後者」兩群,領先者因為把資料基礎打好,AI 代理的表現明顯優於落後者。
報告中歸類為『資料領先者』(data leaders)的企業 — 確保 AI 代理能存取超過 70% 的公司資料(相較之下,全體受訪企業平均只開放 45%,被歸類為『資料落後者』的企業甚至只有 30% 以下)。結果:100% 的資料領先者表示信任自家 AI 代理做出的決策準確又相關,反觀全體受訪企業平均只有約一半的人有這種信心;在『資料系統限制了 AI 代理擴大規模』與『資料系統拖慢代理決策速度』這兩項困擾上,資料落後者分別有 66% 與 68% 的企業中招,資料領先者則只剩 8%
微軟AI Frontiers(微軟旗下的AI研究團隊)的一名實習研究者(帳號@xidulu,與資深研究員John Langford合作)分享了一個新專案:在AI模型「解碼」(也就是逐字生成回答文字)的過程中,把「前一步的隱藏狀態」(模型內部運算時暫存的中間資訊,可以想成AI思考到一半留下的筆記)跟原本要輸入的文字一起餵給模型,結果不用額外訓練就能讓模型表現變好,等於是免費撿到的效能提升。另外,知名AI科普帳號@dair_ai整理了另一篇論文的重點:把AI之前執行任務時走過的完整推理過程,濃縮成簡短的「自然語言技能」(用白話文寫出來的操作要訣),之後遇到類似的多步驟任務(agentic tasks,也就是需要AI自己規劃、連續執行好幾個步驟才能完成的任務)時直接套用,可以補回55%到超過100%「不用推理模式」跟「有開推理模式」之間的表現落差,而且輸出的文字量還少了2.7到6倍,代表更省成本、回應也更快。這兩則消息都顯示業界正在想辦法讓AI在「推理能力」和「運算成本」之間找到更好的平衡點。
微軟AI Frontiers實習研究者@xidulu(與John Langford合作) — 在AI解碼(逐字生成文字)階段,把前一步留下的隱藏狀態跟當前要輸入的文字一起餵進模型。結果:不需要重新訓練模型,就讓生成表現獲得『免費』的提升。怎麼做:在decoding時,將previous hidden state與token embedding一起作為輸入餵給模型 AI科普帳號@dair_ai總結的一篇論文研究團隊 — 把AI過去執行任務時累積的完整思考過程,濃縮成簡短的自然語言『技能』,讓AI之後遇到類似的多步驟任務時直接套用。結果:能補回55%到100%以上『不開推理模式』跟『開推理模式』之間的表現差距,且輸出文字量減少2.7到6倍,更省又更快
Qdrant(一家開源向量資料庫公司,向量資料庫是一種專門用來儲存和快速搜尋AI生成的「語意向量」的資料庫,常用在RAG,也就是讓AI回答前先查資料庫、避免憑空捏造)在其官方推特發布了1.19版更新。同時,Together AI(一家提供AI模型雲端運算服務的公司)與IBM、NVIDIA合作,宣佈在IBM Cloud上提供企業級推論基礎設施(推論就是讓已訓練好的AI模型實際跑起來回答問題的過程)。這兩則都屬於基礎設施類的例行更新,不是重大突破,但對正在建置AI應用的工程師有實際幫助。整體來說,這反映AI產業目前也在持續打磨底層工具,讓建置RAG、企業AI服務更順手。
Qdrant官方 — 針對關鍵字索引(keyword index,一種只支援精確比對的資料索引方式)新增前綴比對功能,讓使用者可以查詢「開頭是某段文字」的資料,例如所有以https://qdrant開頭的網址。結果:過去若要做前綴查詢,只能整批掃描所有資料、或改用文字索引(會拆詞、但失去精確比對能力),現在只要在索引設定加上"prefix": true,就能直接從索引快速查出結果,同時保留精確比對。怎麼做:在索引設定中加入 "prefix": true 即可啟用前綴比對 Together AI、IBM、NVIDIA — 三方合作,在IBM Cloud上推出企業級的AI推論基礎設施服務。結果:讓企業客戶能在IBM Cloud上直接取得三方整合的AI模型運算能力,不需自行拼湊基礎設施
Automattic(WordPress.com的母公司)旗下的AI人脈管理App「Mesh」正式推出Android版本。Mesh是一款私人的關係管理工具(personal CRM,CRM意思是幫你記錄和管理人際往來的軟體),能幫使用者整理生活與工作上的人脈、記筆記、並在該聯絡的時候提醒你。這次Android版針對平臺特性做了客製化,例如分割畫面、彈出視窗、摺疊機與平板的鍵盤快捷鍵、桌面小工具等。Mesh內建一個叫Nexus AI的功能目前在早期測試階段,可以讓使用者用問問題的方式(例如「我在某公司認識誰」「誰住在某城市」「誰懂某個領域」)在自己龐大的人脈網路裡快速找答案,省去自己一個個回想的麻煩。
Mesh共同創辦人Zachary Hamed — 觀察到有些使用者的人脈網路橫跨多個社群與工作平臺,累積了一萬到五萬筆聯絡人,光靠自己記憶和整理根本不可能兼顧到每個人。結果:公司因此打造Nexus AI,讓AI幫忙在龐大人脈庫中做問答式搜尋(例如查詢認識誰、誰在哪裡、誰擅長什麼),減輕使用者手動整理的負擔 Mesh共同創辦人Matthew Achariam — 分析目前約70%的Mesh使用者是把它用在商業用途上,尤其是管理大型團隊的主管或人脈圈緊密的專業人士。結果:公司因此在設計新功能時,會確保同一套功能同時適用於商業用戶與一般消費者,而不是隻服務單一族群
TechCrunch報導,AI程式碼測試新創公司Blacksmith完成由Peak XV Partners領投的4500萬美元B輪融資,估值來到5.5億美元,較不到一年前A輪的6000萬美元暴漲近10倍。Blacksmith原本是幫企業跑CI(持續整合,就是在程式碼上線前自動反覆建置與測試的流程)工作負載的雲端服務,後來又推出AI程式碼代理(agent,就是能自己執行任務的AI程式)Codesmith,可以自動修復測試失敗的程式碼問題。執行長Jayaprakash表示,隨著Cursor、OpenAI的Codex、Anthropic的Claude Code等AI寫程式工具讓寫程式碼變得更快,驗證AI生成程式碼品質的環節反而成了新瓶頸,這正是Blacksmith要解決的問題。
Blacksmith co-founder兼執行長Aditya Jayaprakash — 公司從2024年成立至今,主打幫企業在程式碼上線前建置、測試、驗證軟體,並用Codesmith這個AI代理自動修復測試失敗的程式碼。結果:客戶數從不到一年前的700多家成長到超過5000家,包含Mercury、Supabase、Clerk、Ashby、Expensify等,年度營收從一千萬美元成長到「數千萬美元」等級,部分最大客戶年花費已超過100萬美元
自動化工具公司Zapier在官方部落格發文,介紹「企業工作流程自動化」(enterprise workflow automation,就是用軟體把公司裡多個部門、多套系統之間原本要人工手動搬資料、互相提醒的重複性工作串接起來,自動執行)。文章指出,現在這類自動化工具開始加入AI(人工智慧,就是能理解語言、自動判斷該怎麼處理資料的軟體),讓原本只會照固定規則做事的流程,變成能自己整理、摘要、產生新內容的「智慧邏輯」。Zapier本身可以串接超過9000個常見商業軟體(例如CRM客戶管理系統、Slack、Facebook廣告後臺等),讓不會寫程式的一般員工也能自己搭建自動化流程,同時IT部門仍可從中央控管誰能做什麼。文章用四個真實企業案例(業務、行銷、客服、IT部門各一個),說明導入後省下多少時間和人力成本。
Vendavo(一家500人規模的訂價軟體公司) — 原本業務團隊要手動把Google廣告帶來的名單,一筆筆從表單複製貼上到CRM系統裡,導致熱門客戶名單常常放好幾小時才有人處理。結果:改用Zapier自動化流程後,名單一進來就自動存進CRM並立即通知業務跟進,把回覆客戶的時間從原本要好幾小時縮短到只要幾分鐘,等於加快了90% Synthesia(一家AI影片製作軟體公司) — 公司提供的免費工具吸引大量網路流量,但大部分只是隨便看看不會買單的人,導致行銷團隊很難判斷Facebook廣告到底該往哪些真正有效的名單去優化。結果:透過Zapier把CRM裡真實的成交、預約demo等資料,即時傳回Facebook的Conversions API(廣告轉換追蹤介面),讓廣告系統改成針對真正有付費意願的人去優化,結果廣告測試優化速度加快了約4倍,團隊每週省下約10小時工作,總共靠43組自動化流程完成,完全沒有動用工程師 Mercari(一家電商二手交易平臺) — 平臺每月大約收到12萬件客服申訴,客服團隊光靠人力根本應付不來。結果:公司自己在Zapier上搭建AI客服系統,約97%的申訴能自動給出第一則回覆,其中每月約4萬7千件能完全由AI從頭到尾處理完畢、不需要真人客服碰到;系統若判斷自己不確定答案,會自動把案件轉回人工處理,避免給客戶錯誤的金錢相關答案。這套系統每月幫團隊省下超過3000小時的人力工時,客戶滿意度(CSAT,5分制)也提升了整整1分 Palo Alto Networks(一家員工超過1萬6千人的資安公司) — 公司有數百名員工要對客戶展示產品,過去每次要開新帳號、重設授權、核准存取權限,都得靠人工在Slack頻道裡一則則手動處理,每個人問法還都不一樣。一位solutions architect(解決方案架構師)打造了能讀懂員工用一般白話文提出的請求、自動跨系統開帳號、分配授權、並把核准結果送回Slack頻道的AI驅動Zapier自動化流程。結果:這套系統服務超過3000名內部使用者,等於省下一整個全職員工的工作量(約合每年15萬美元人力成本),而且回覆內容個人化之後,後續追問的問題減少了20%
9to5mac報導,蘋果在iOS 27 beta 5的程式碼中,發現一項名為Apple Reference Image的新功能,目的是驗證一張照片是否真的是用iPhone相機拍攝的。這個功能的背景是,生成式AI(能自動生成圖片、文字等內容的AI技術)讓製作以假亂真的合成照片變得非常容易,過去要專業修圖師花好幾天才能做到的效果,現在只要打幾個字的提示詞(prompt,也就是給AI的指令)幾秒鐘就能完成,因此業界開始想辦法標示照片是否為AI生成或是否經過竄改,例如Google的SynthID技術會在AI生成的圖片裡加上肉眼看不到的浮水印,OpenAI也採用了同樣技術,Meta則是在Facebook、Instagram、Threads上為AI生成內容加上標籤。蘋果這次的做法不太一樣,是利用iPhone相機硬體本身獨有的感測器資料,證明某張照片確實來自這支特定的iPhone,而不是判斷內容是否由AI生成。
一般iPhone使用者 — 在設定裡開啟相機的Reference Mode(參考模式)後,用該模式拍攝照片。結果:照片會帶有可用來驗證來源的感測器資訊,使用者之後可選擇把照片送到蘋果的Private Cloud Compute(一種蘋果強調隱私保護的雲端運算服務,蘋果本身看不到原始照片內容)進行驗證,驗證後照片會取得一組專屬ID;若之後該相機感測器被判定可能遭竄改或偽造,蘋果可以撤銷先前對該感測器核發的驗證資格;分享照片時,接收方的蘋果裝置也能在本機端檢查照片是否仍屬驗證狀態,而不需要告訴蘋果使用者看了哪些照片
這篇文章的作者是產品管理顧問Marty Cagan(SVPG部落格),他引用科技產業分析師Benedict Evans一篇談「多數人不是工具建造者」的文章與podcast,重新詮釋AI時代產品經理(PM,負責決定要做什麼產品、為什麼做的角色)該扮演的角色。Evans指出,雖然AI讓寫程式、做工具變得容易(例如「vibe-coding」,就是用自然語言口述需求讓AI直接生成程式,不用自己寫程式碼),但大多數一般人和公司並不是天生的工具建造者,即使有了AI工具,也不太會、也不太願意自己動手打造解決方案。Cagan認為這正好說明瞭為什麼產品經理這個角色依然重要:真正稀缺的不是寫程式的技術,而是「看出該解決什麼問題」「找到有效解法」「確保解法對公司整體也行得通」這三種判斷力。他強調AI改變的是做工具的門檻,而不是找出正確問題、設計正確解法這個核心難題本身。
Benedict Evans — 在其付費文章與公開podcast中,比較一般使用者與擅長打造工具者的思維與技能差異,說明為何多數人即使拿到AI工具也不會自己動手做出好用的解決方案。結果:他提出結論:AI讓任何人都能寫程式做工具,但寫程式碼從來不是最難的部分,真正難的是知道該打造什麼、該怎麼設計,這種判斷力仍然是稀缺技能,這也是為什麼軟體公司和顧問這個角色依然存在的原因
Artificial Analysis(一家專門幫開發者評測、比較各家 AI 模型效能與價格的獨立機構,類似「AI 模型的第三方測評網站」)在 X(原 Twitter)上發文表示,他們正在打造一系列新的 AI benchmarking(基準測試,就是用一套標準題目或任務去衡量不同 AI 模型表現好壞的方法)產品,目的是幫助開發者評估各種 AI 模型。他們目前在尋找一小群使用者,希望在正式上線前先讓這些人測試並提供回饋。有興趣的人可以透過貼文附的表單申請搶先體驗資格。這則貼文本身沒有透露新產品的具體功能或測試內容,只是一則招募通知。
Artificial Analysis 團隊 — 開發新一代 AI 基準測試產品,並公開招募一小群使用者參與上線前測試。結果:目前尚未公佈產品細節或功能,僅開放申請搶先體驗名額。怎麼做:透過貼文附上的 Google 表單連結(forms.gle/hpK1xPdevVuyg6)申請 early access