阿里雲宣佈自家研發的「真武M890」AI晶片組成的超節點(就是把很多顆晶片用超高速線路連在一起、當成一臺超大電腦用的架構),已經成功用來運行Qwen3.8——阿里最新旗艦大型語言模型(LLM,就是ChatGPT這類會對話的AI背後的核心模型),參數規模(可以理解成模型的「腦容量」,數字越大代表模型越複雜)高達2.4兆。官方說法是這是中國國內第一個能成功運行超過2兆參數大模型的超節點系統,目前已經上線阿里雲百煉平臺,對外提供推理服務(推理就是模型已經訓練好、拿來實際回答問題或處理任務的過程,跟訓練階段不同)。這代表阿里在晶片、雲端平臺和自家模型之間做了整套技術串接,不是單純硬體升級。
要讓一個2.4兆參數的模型「跑得動」,得把參數拆開放到幾十張、甚至上百張GPU(顯示卡,AI運算的核心硬體)上,這些卡之間要用高速線路互相溝通,一般的AI伺服器叢集因為卡與卡之間傳輸速度(頻寬)不夠,撐不住這種高吞吐量、低延遲、大量同時請求的需求。阿里的做法是用64張真武M890晶片,透過名為ICN Switch 1.0的互聯晶片串起來,做到每秒800GB的傳輸速度,總顯存(暫存模型參數用的記憶體)達到9TB,這樣一套系統就能撐住2.4兆參數、採用MoE(混合專家架構,一種讓模型只啟動部分「專家」子網路來省算力的設計)的Qwen3.8模型運算需求。實測結果顯示,在需要多步驟決策的Agentic推理(也就是AI要像代理人一樣連續做判斷、呼叫工具的場景)中,這套系統比一般做法最多快1.5倍,同時也降低了推理成本。對比舊做法:以前想跑這麼大的模型,得靠外購的大量GPU拼湊叢集,頻寬常常成為瓶頸拖慢速度;阿里這次等於是自家晶片、互聯技術、雲平臺、模型四層一起優化,換來實際可用的效能提升與成本下降。
具身智能(就是讓機器人有「看得懂、動得了」的 AI 大腦,能理解環境並做出動作)領域出現一個反常識的結果:中國公司優艾智合做的 FabriVLA 模型,參數量只有 1B(10 億,比一般大模型小很多,參數量大致代表模型「腦容量」大小),卻在全球知名的具身智能操作評測榜單 Evo-SOTA 上拿下第一名,打敗了包含 π0 在內的多個國際知名大模型。這個榜單用的測驗叫 Meta-World MT50,包含 50 種不同的機器人操作任務,像是抓取、放置、開門、插拔零件等,專門用來考驗機器人能不能同時應付多種不同任務,而不是隻會做一件事。這次奪冠特別的地方在於,它不是靠堆更多參數贏的,而是靠重新設計神經網路架構(也就是模型內部運作的方式):一個是「門控自注意力機制」,讓模型在做一連串動作時,前後動作可以互相參考、更連貫;另一個是「深淺層視覺特徵融合」,讓模型同時看懂物體整體是什麼、又能抓到精細的位置和角度,處理插拔、組裝這類需要精準對位的工作時成功率更高。研究團隊做了消融實驗(拿掉某個設計看效果掉多少,用來證明這個設計真的有用):拿掉深淺層特徵融合,成功率從 90.0% 掉到 82.9%,證明成績提升確實來自架構設計,不是靠參數堆出來的。這件事反映一個趨勢:具身智能正從「比誰參數大」轉向「比誰架構設計得聰明」,而且模型越小,代表可以塞進機器人本體運算、不用依賴雲端算力,更適合真正部署到工廠裡。
假設一家工廠想在產線上導入機器人手臂,負責抓取、放置、插拔電子元件這類需要「換了工件也不能罷工」的多樣化操作。傳統做法是用一個超大參數的通用機器人大模型(例如 π0 這類),靠龐大參數硬記各種動作組合,但模型太大、推理速度慢,而且必須依賴雲端伺服器運算,一旦網路不穩或延遲高,機械臂動作就會卡頓,這在講求即時反應的產線上是不能接受的。改用 FabriVLA 這種 1B 參數的輕量模型後,因為體積小可以直接部署在機器人邊緣端(也就是機器人自己身上的晶片,不用連雲端),反應更即時;同時因為架構設計(門控自注意力+深淺層視覺融合)讓它在 Meta-World MT50 這個涵蓋 50 種任務的測驗裡拿到 90% 的平均成功率,超越參數量大得多的競爭對手,證明工廠不需要為了追求「更聰明」而犧牲「能不能天天穩定上工」——這也是優艾智合接著推出的工業機器人「隙鋒」首發就拿下 4000 臺意向訂單的原因:客戶看重的是能不能真的在產線上穩定幹活,而不是參數表上的數字。
中國具身智能(就是讓AI控制機器人身體在真實世界裡動手做事)公司它石智航,在2026年世界人工智能大會(WAIC)上發佈了新一代機器人大腦模型AWE 3.5。它把過去公認最難自動化的汽車線束裝配車間(工人培訓一個月、在職常常撐不到三個月就離職的高難度崗位)搬進展館,用多臺機器人協同完成流水線裝配。這個模型是具身智能領域第一個把預訓練和後訓練完整打通的「原生」模型,意思是它從一開始訓練時就同時學視覺、語言、動作三種信息,而不是像常見的VLA(Vision-Language-Action,視覺語言動作模型,一種讓AI看懂畫面、理解指令再做動作的架構)那樣先學理論、後訓動作、兩者之間有斷層。AWE 3.5還能像世界模型(world model,一種能在「腦海」裡模擬真實物理世界會怎麼變化的AI,比如東西放手會往下掉)一樣,讓人戴上採集手套就能和它生成的虛擬場景互動,捏積木、拖手機盒都會有符合物理規律的反應,而這些反應完全是模型自己從真實數據裡學出來的,沒有寫死任何物理公式。
假設一家汽車廠要教機器人做「打包書包時拉拉鍊」這類毫米級精度、處處會卡住的精細操作。傳統做法是把機器人放到真實產線上一遍遍試錯,失敗一次記錄一次,既費機器又費時間還磨損設備。用AWE 3.5的做法是:先讓模型在自己內部的「虛擬仿真世界」裡反覆想象、試驗不同力度下拉拉鍊會發生什麼後果,找出最優策略後再交給負責實際動作的部分去執行,這比在真機上反覆硬試快了不止一個數量級。該公司首席科學家丁文超透露,因為預訓練已經足夠紮實,現在教機器人做一個全新任務,只需要「小時級別」的數據採集就能基本跑通。
Cursor(一款很多工程師用來寫程式的 AI 編輯器)推出新功能「Cursor Router」,它是一個智慧路由系統(意思是:使用者送出一個寫程式的請求後,系統會自動判斷這個任務難不難,再決定要用哪個 AI 模型來處理,而不是每次都固定用同一個)。官方表示,這樣做能讓成本降低 60%,而且品質跟全部都用最頂級的 Opus 4.8 模型處理相比沒有下降。使用者可以選擇 Auto 模式,並指定想偏重「智慧程度」「平衡」還是「省錢」,系統就會照這個偏好去挑模型。目前這功能已經對 Cursor 的 Teams 和 Enterprise(企業版)方案用戶開放,團隊管理者還能設定允許或封鎖特定模型、設定預設值等。
假設一家軟體公司裡的工程師,平常寫程式時有些任務很簡單(例如改個變數名稱、修個小拼字錯誤),有些任務很複雜(例如重新設計一整套系統架構)。過去如果團隊統一設定「所有請求都用最強、最貴的 Opus 4.8 模型」,那不管任務多簡單都會被收取最貴的費用。用了 Cursor Router 之後,系統會自動判斷:改個變數名稱這種小任務,就分派給便宜、跑得快的模型處理;遇到系統架構設計這種需要深度推理的任務,才會呼叫昂貴的頂級模型。根據 Cursor 官方說法,這樣整體算下來成本可以省 60%,而且工程師收到的程式碼品質跟過去每次都用最貴模型相比並沒有變差。對比舊做法,團隊不用再手動去猜「這個任務該用哪個模型」,也不用在「省錢」跟「品質」之間做二選一的取捨。
南韓AI公司Upstage發布了一個名為Solar Open2 250B的開源大型語言模型(開源代表任何人都能免費下載、檢視內部程式碼,甚至自行修改使用,不像ChatGPT那樣是封閉黑盒子)。模型名稱中的250B代表參數規模約2500億(參數可以想成模型裡用來記憶與判斷的「旋鈕」數量,數字越大代表模型理論上越聰明,但也越耗運算資源)。
假設一家公司想做一個能幫忙處理大量文件、又要能自動完成多步驟任務的AI助理,理論上可以採用Solar Open2 250B這類開源模型,將模型下載到自有伺服器運行,資料不出公司,同時可根據需求自行調整模型行為。不過,具體部署方式與實際效能表現仍需以官方公佈的資訊為準。
美國新創公司 Arcee 宣佈與美國能源部(DOE,負責能源與科學研究的政府機關)合作,共同打造一個名叫 Genesis-Science-1 的開放權重模型(open-weight model,就是把訓練好的模型參數公開釋出,任何人都能下載使用、修改)。這個模型鎖定的不是一般聊天問答,而是專門用來處理高難度的科學運算工作流程,例如協助研究人員跑實驗、做分析。官方強調這是「有治理機制的研究工具」(governed research harness),也就是模型執行任務時會保留可重現、可驗證的紀錄,方便科學界檢查結果是否可信。有多篇貼文形容這是「兆參數等級」(trillion-parameter-class,代表模型規模非常龐大)的計畫。目前 Arcee 已開放貢獻入口,讓研究實驗室、大學、企業與非營利組織都能參與協助打造這個模型。
假設某間大學實驗室想用 AI 幫忙分析氣候模擬的大量數據,並且需要結果經得起同行審查(也就是別人要能重現一樣的計算過程)。用一般的聊天型 AI(例如 ChatGPT)分析,AI 可能給出看似合理但無法追溯計算步驟的答案,審查時很難驗證正確性。Genesis-Science-1 設計成「治理研究工具」,執行分析時會保留完整、可重現的紀錄,實驗室之後可以把這份紀錄附在論文裡,讓其他研究者照著同樣步驟重跑一次、核對結果是否一致。而且因為是開放權重,實驗室不需要付費呼叫外部 API,可以直接下載模型部署在自己的伺服器上處理敏感研究數據,這是與能源部合作、政府背書的科學專用模型和一般商用聊天模型的最大差異。
社群上出現一波「AI 解開數學難題」的爆量宣稱,起因是一位研究者聲稱藉助 GPT-5.6 Pro(一款 AI 模型)找到 Dinitz-Garg-Goemans 猜想(一個懸而未決約 30 年的圖論題目)的反例(也就是舉出一個具體例子推翻這個猜想)。這則貼文爆紅後,其他人開始模仿同樣的做法,用「讓 AI 不斷嘗試、不要停」的提示技巧去挑戰各種數學問題,甚至變成一種網路迷因。緊接著,與 Cognition(開發 AI 寫程式工具 Devin 的公司)有關的帳號也跟著宣稱解出更多猜想或找到反例,但很快就有人(例如 willdepue)出來質疑這些成果的歸屬是否清楚、有沒有經過嚴謹驗證。整體來看,重點不是「數學被 AI 解決了」,而是前沿 AI 模型搭配大量嘗試、搜尋與自我檢查的流程,正在快速產出大量「看起來很有道理」的研究成果,但這些成果的真假仍需要該領域的專家一一把關確認,目前並非全部都已獲得證實。
一名研究者想挑戰 Dinitz-Garg-Goemans 猜想(圖論領域一個約 30 年沒被解開的公開問題),過去這類問題通常要靠數學家自己手算或寫程式驗證多年。這次他改用 GPT-5.6 Pro,用「持續追問、不要停下來」的提示方式讓 AI 反覆嘗試不同的圖論結構,最終產出一個聲稱能推翻該猜想的具體反例(即找到一個滿足前提但結論不成立的例子)。這則貼文公開後,其他開發者跟風用同樣手法去挑戰別的數學猜想,並得到「疑似解出」的結果。差別在於:過去人類單獨驗證一個反例可能要花數週甚至數年反覆演算,現在 AI 能在短時間內生出大量候選答案,但也因此讓真假難辨的宣稱暴增,社群裡已經有人(willdepue)公開質疑這些「成果」到底是誰做的、有沒有真的被驗證過。
微軟研究團隊發布了一個叫 Fara1.5-27B 的 AI 模型,這是一種「瀏覽器代理」(browser agent,意思是能自己操作網頁瀏覽器完成任務的 AI,例如自動點擊、輸入文字、捲動頁面、造訪網址、執行搜尋)。它最特別的地方是「純視覺」(vision-only):只靠看螢幕截圖來判斷下一步該做什麼動作,完全不讀取網頁背後的程式碼結構(DOM,也就是網頁的原始資料骨架)、不用無障礙輔助工具的資訊、也不做 OCR(光學文字辨識,把圖片裡的文字轉成可讀文字)。這個模型是拿阿里巴巴的 Qwen3.5-27B 模型當基礎,再用微軟自家生成並驗證過的操作紀錄資料(叫 FaraGen1.5)進行微調(fine-tuning,就是拿一個已經訓練好的模型,再用特定資料加強訓練,讓它更擅長某項任務)而成,另外還有較小的 4B 和 9B 版本可用。微軟自己也坦承這個模型有明顯限制:只靠截圖判斷容易被網頁內容植入的惡意指令欺騙(prompt injection,指有心人士在網頁裡藏文字誘導 AI 做壞事)、多步驟操作時錯誤會越滾越大、同樣任務每次執行結果可能不太一樣、還可能「幻覺」出根本不存在的畫面狀態。
假設你想做一個自動化助理,能幫你打開瀏覽器、登入某個網站、搜尋商品、填表單下單,過去要做到這種「電腦操作型 AI」通常需要額外解析網頁的程式碼結構(DOM)或用 OCR 辨識畫面文字,工程上相對複雜、也容易因為網站改版而失效。用 Fara1.5-27B,你只需要把每一步的螢幕截圖丟給模型,它就會直接輸出「點擊座標 (120, 340)」「輸入文字 abc」「捲動頁面」這類具體動作指令,不用額外處理網頁原始碼。差別在於:傳統做法要維護一套解析網頁結構的程式,且容易因網站改版而故障;Fara1.5-27B 純看畫面操作,理論上更貼近人類使用瀏覽器的方式,但微軟自己也提醒,這種做法目前還會遇到多步驟操作誤差累積、同一任務執行結果不穩定等問題,還不到能完全放心讓它自主下單付款的程度。有社群討論注意到,微軟這次選擇微調中國阿里巴巴開發的 Qwen3.5,而非用自家的小模型從頭訓練,並質疑為何捨棄 DOM、無障礙工具、OCR 等更豐富的資訊來源;有人推測是因為輸入資料長度(token budget,也就是 AI 一次能處理的文字量上限)有限,連網址都因為太長被裁切,顯示這個設計可能是為了控制輸入資料量而妥協。
Google 旗下的 AI 助理 Gemini(一款會對話、能回答問題、生成圖片的 AI 應用,類似 ChatGPT)在 2026 年第二季財報會議上宣佈,月活躍使用者(每個月至少用過一次的人數)已經超過 9.5 億,比去年同期成長了三倍。今年二月時 Gemini 才剛突破 7.5 億月活躍用戶,短短幾個月又大幅成長。相比之下,OpenAI 的 ChatGPT 已在今年六月率先突破 10 億月活躍用戶。分析公司 Sensor Tower 的「State of AI」報告指出,2026 上半年 ChatGPT 在 AI 助理市場的佔有率首次跌破五成,而 Gemini 的市佔率則上升到 27.7%,顯示兩大 AI 助理的用戶差距正在縮小。
以 Google 自己公佈的數字為例:Gemini App 光是在 iOS(蘋果手機系統)上,過去 12 個月就被下載超過 1.37 億次,帶動因素包括新推出的 Nano Banana 圖片生成模型、以及像「Daily Brief」(每日重點摘要)、「Gemini Spark」(個人化代理人功能,目前已在美國及國際上線)這類新功能。Google 執行長 Sundar Pichai 在財報會議上特別提到,使用者很喜歡這些新的「代理式」功能(agentic features,也就是 AI 不只是回答問題,還能主動幫你整理資訊、完成任務)。同時 Google 的搜尋引擎也導入了 AI 問答模式(AI Mode),本季使用人數突破 10 億,且透過硬體工程優化,公司表示已經降低了 AI 模式的運算成本,即使不斷推出更多新模型與功能,成本也沒有跟著失控增加。這說明 Google 一方面靠 Gemini 搶攻獨立 AI 助理市場,一方面把 AI 能力嵌入既有的搜尋引擎,形成雙線並進的策略。
阿里巴巴旗下高德地圖的研究團隊發表並開源了一個叫「ABot-World-0」的「世界模型」(World Model,就是一種能模擬環境變化的 AI,你給它一個動作,它就生成下一個畫面,常用在遊戲和機器人訓練上)。和過去只能「播放」固定影片的世界模型不同,這個模型可以讓使用者用鍵盤 WASD 移動、IJKL 轉鏡頭,即時在生成的畫面裡自由走動探索,而且理論上可以無限玩下去,不會像以前那樣走一走場景就卡死或需要重新設定。最大亮點是它體積小(只有 0.5B 參數,是同類模型中相對輕巧的),在一張消費級顯卡 RTX 5090(是遊戲玩家會購買的高階顯卡,並非企業用的伺服器級硬體)上就能跑到每秒 16 張畫面、720P 解析度,第一個畫面出現只要 1.2 秒。研究團隊之後還會公開 500 小時的標註訓練資料,讓其他開發者可以拿去微調出自己的場景。不過模型和程式碼已經開源,任何人都能下載使用。
假設一家做掃地機器人或倉儲機器人的新創公司,想訓練機器人在各種室內環境裡走動、避開障礙物,傳統做法要嘛花錢買 AAA 遊戲的授權來當模擬環境,要嘛自己用 Unreal Engine 建 3D 場景,成本和時間都很高。有了 ABot-World-0,工程師可以直接下載開源模型,用一張 RTX 5090 顯卡,透過文字或圖片生成一個可互動的虛擬空間,讓使用者(人)用鍵盤 WASD 控制移動、IJKL 旋轉鏡頭,即時探索場景並觀察畫面變化。不過,目前模型運行時的互動是由人類操作,並非機器人自動產生訓練數據。官方說法指出,訓練資料的收集是由「WorldExplorer」系統中的 AI Agent 在虛擬環境中自主導航採集,之後官方會釋出 500 小時標註資料集,社群可望以此為基礎微調模型,進一步拓展到新場景領域。
有個叫 OverpAId 的網站打出「解僱你的 CEO,聘請 AI」的口號,作者自己承認這是諷刺作品,背後其實只是一個網域名稱和一臺小電腦,不是真的產品。但網站引用的數字卻很真實:S&P 500 大企業 CEO 平均年薪高達 1890 萬美元,是一般員工薪水的 290 倍,而 AI(就是能自動分析文件、寫報告的電腦程式)已經造成超過 50 萬名科技業員工被裁員,高階主管卻一個都沒被裁。這件事在 Hacker News(一個工程師常逛的討論網站)和 Bluesky(類似推特的社群平臺)上引發熱烈討論,有人覺得諷刺變成了認真的論證,也有人反駁說 CEO 要處理的人脈、政治敏感度和臨場信任,是 AI 目前完全學不來的。整起事件其實在問一個更大的問題:公司省成本裁員時,為什麼刀總是砍向基層員工,卻從不砍向高薪主管。
假設你是公司的部門主管,每週要花好幾個小時整理週報、彙整各單位進度、寫給老闆看的決策建議。討論裡提到一個可以馬上試的做法:讓 AI(例如 ChatGPT 這類聊天機器人)先讀過會議紀錄和數據,自動產出一份週報摘要或幾個決策選項清單,你再拿這份 AI 草稿跟自己原本手寫的版本對照,看哪裡 AI 抓得準、哪裡漏了人情世故或政治考量沒抓到。做幾次之後你會很清楚知道:哪些純粹整理資訊、寫報告的工作可以交給 AI 先做草稿省時間,哪些牽涉到說服人、安撫情緒、判斷誰跟誰有心結的場合,還是得自己上場,而不是像過去那樣,所有報告從頭到尾都得自己一字一句生出來。
Voicebox 是一套開源(原始碼公開、任何人可免費取用修改)的 AI 語音工具,在 GitHub(工程師常用的程式碼公開分享平臺)上已累積約 4.6 萬顆星,代表很多開發者關注並肯定它。它主打把兩個要付費訂閱的雲端服務——ElevenLabs(一款生成擬真人聲的語音合成服務)和 WisprFlow(一款語音輸入轉文字的服務)——搬到使用者自己的電腦上執行,聲音資料完全不用上傳到任何伺服器。最新版本補上了語音輸入功能:按住快捷鍵說話,放開後文字就自動貼到你正在打字的欄位。它同時支援 7 種不同的語音合成引擎可以切換,其中一款可以生成長達 700 秒以上、聽起來連貫自然的語音。
假設我是一名工程師,想讓我平常用的 AI 助理(例如 Claude Code、Cursor 這類會寫程式的 AI 工具)不只用文字回答我,還能「開口說話」,而且用的是我自己聲音克隆出來的音色。過去若要做到語音克隆加語音輸出,通常得付費訂閱 ElevenLabs(月費約 22 美元起),語音輸入再另外訂閱 WisprFlow,且錄音都會上傳到對方的雲端伺服器處理,對重視資料隱私的公司來說是個顧慮。用 Voicebox 的做法是:先錄幾秒鐘自己的聲音當樣本完成聲音克隆,接著在支援 MCP(一種讓不同 AI 工具互相溝通的協定)的 agent 裡呼叫內建的 voicebox.speak 功能,AI 就會用我克隆出的聲音回答我,而且整個過程(錄音、克隆、生成語音)全部在自己電腦上跑,不用月費、聲音資料也不會離開這臺機器,跟舊做法比起來省下訂閱費、也不用擔心隱私外流問題。
Kastra 是一款新工具,專門幫使用 Claude Code、Cursor、Codex 這類「AI 編程代理」(也就是能自己看懂需求、直接幫你寫程式碼甚至執行指令的 AI 助理)的開發者,加上一層即時的安全把關機制。開發團隊會做這個工具,是因為自己有一次差點被 AI 代理誤執行一條會刪掉正式資料庫(production database)測試資料的指令,雖然當下攔了下來,但也發現整套系統裡根本沒有任何機制能事先決定「這個 AI 代理到底被允許做什麼」。因為大型語言模型(LLM,就是 ChatGPT、Claude 這類會自動生成文字或程式碼的 AI)本質上是機率性的,就算你在提示詞(prompt,也就是你給 AI 的指令文字)裡千交代萬交代不要做危險的事,AI 還是有可能不小心做出超出預期的動作,靠寫提示詞來防範並不可靠。Kastra 的做法是在 AI 代理發出「工具呼叫」(也就是實際要執行的動作,例如跑一段程式、改資料庫)之後、真正執行之前,先攔截下來,對照事先寫好的規則判斷是要「允許」「暫停等人確認」還是「拒絕」,整個判斷通常在一毫秒(千分之一秒)內完成,幾乎不會拖慢工作流程。
假設你是一位工程師,日常用 Cursor 或 Claude Code 讓 AI 代理幫你寫程式、跑測試、甚至直接連線操作資料庫。過去的做法是靠在提示詞裡寫「請不要動正式環境的資料庫」,但這只是「拜託」AI,AI 完全可能因為理解偏差而執行了一條刪除正式客戶資料的指令,就像 Kastra 團隊自己遇到的 DELETE FROM customers 事故一樣,等你發現時資料可能已經被刪了。裝上 Kastra 之後,你可以先在本機執行 `kastra-edge scan` 這個指令,它會掃描你電腦上這臺 AI 代理過去的操作紀錄,列出所有「高風險動作」,例如寫死的密碼或金鑰被寫進追蹤中的檔案、動過正式資料庫、用 force push 覆蓋掉遠端程式碼、或是執行來路不明的 curl 指令直接跑腳本。掃描完之後,你可以把每一個發現的風險,一鍵轉成一條「執行期政策」(runtime policy),例如「禁止對名稱含 production 的資料庫執行 DELETE」。之後只要 AI 代理再想做同樣的事,Kastra 會在指令真正執行前攔截下來,依政策判斷擋下或需要你手動按一下確認(約一秒完成),而不是像過去那樣事後才發現資料已經被刪掉、程式碼已經被覆蓋。
Hugging Face 的 Diffusers(一套讓開發者呼叫圖片生成 AI 模型的常用工具庫)現在直接支援 Nunchaku 這套 4 位元量化(quantization,把模型參數從高精度數字壓縮成更省空間的低精度數字,藉此省記憶體、加快運算)技術,不再需要另外安裝獨立的推論引擎。這套技術叫 SVDQuant,特別之處是連運算時的中間數值(activations)也一起壓成 4 位元,不只省記憶體、還能讓生成圖片的速度變快,而一般的量化方法通常只省記憶體、不會加速。新推出的「Nunchaku Lite」讓這功能能套用到任何 Diffusers 模型架構上,不必等官方特地為某個模型寫專用加速程式碼,代價是速度提升幅度不如原版 Nunchaku 引擎那麼極致。官方也釋出了配套工具 diffuse-compressor,讓開發者可以自己把新的模型架構量化後發布成標準 Diffusers 格式的模型倉庫。
假設你要在自己的顯示卡上跑一個文字生成圖片的擴散模型(diffusion model),例如 ERNIE-Image-Turbo,過去若想用 4 位元量化省顯示記憶體,得額外裝一套獨立的 Nunchaku 推論引擎,操作較複雜。現在只要照常執行「pip install -U diffusers transformers accelerate kernels bitsandbytes」安裝好函式庫,接著用平常呼叫 Diffusers 模型的方式 from_pretrained() 載入一個已經量化好的模型倉庫(例如 lite-infer/ERNIE-Image-Turbo-nunchaku-lite-nvfp4_r32-bnb4-text-encoder),就能直接生成圖片,完全不用寫額外程式碼、也不用在本機編譯 CUDA 程式。根據官方測試,在 RTX 5090 顯卡上生成一張 1024x1024 圖片,量化後只要約 1.7 秒、顯存峰值約 12GB,相較未量化的 BF16 版本要用到約 24GB 顯存,等於用一半的顯存做出相近品質的圖,這對顯卡記憶體有限的個人開發者或小工作室來說,是省成本、能跑更大模型的實際差別。
有一個叫 Screenpipe 的新工具,在 Hacker News 上以「Launch HN」的形式發布,是新創加速器 YC 這一屆(S26)的團隊做的。它的做法是在你的電腦上24小時本地錄下螢幕畫面和聲音(強調只存在本機、不上傳),再把這些畫面聲音整理成一份可以被 AI 代理(agent,就是能自己執行多步驟任務的 AI 程式)搜尋、查詢的「記憶」。目的是讓 AI 助理知道你平常到底在電腦上做了什麼事,例如切換了哪些軟體視窗、點了什麼、打了什麼字、講了什麼話,這樣之後你要 AI 幫你整理、回顧或自動化重複性工作時,AI 才有足夠的上下文(context,就是背景資訊)可以參考,不用你每次都重新解釋一遍。技術上它不是笨笨地錄影加全畫面文字辨識(OCR),而是偵測「有意義的變化」才擷取,例如切換應用程式、點擊、打字停頓、捲動這些事件發生時,才拍一張畫面並搭配作業系統本身的無障礙功能資料(accessibility tree,就是螢幕上按鈕文字等結構化資訊),這樣比較省資源、也比較不會存一堆重複垃圾資料。所有資料存在本機的 SQLite 資料庫和影片檔裡,並開放一個 API 讓 Claude、ChatGPT 等各種 AI 助理或代理程式透過 MCP(一種讓 AI 連接外部工具資料的標準協定)來讀取查詢。
假設你今天早上8點到下午4點在電腦上處理了好幾件事:回覆信件、開會、寫程式、瀏覽網頁查資料,但事後你想不起來到底做了哪些、還有哪些沒做完。用傳統做法你得自己回想或翻聊天紀錄、瀏覽紀錄一一拼湊。裝了 Screenpipe 之後,你只要跟 AI 助理說「幫我列出我今天8點到4點做的工作,哪些完成了、哪些還沒」,Screenpipe 會把這段時間內它記錄到的視窗切換、輸入內容、看過的網頁畫面等資料交給 AI,AI 就能直接生成一份具體的工作清單和進度總結,而不需要你自己動手回憶或整理。另一個例子是它可以設定「每小時自動把我做的事情整理成 Obsidian(一種筆記軟體)裡的專案、人物、任務、會議記錄」,等於自動幫你維護一份不斷更新的工作日誌,省去手動記錄的麻煩。
美國一個叫「小科技協會」(Little Tech Association,代表新創公司和創業圈的倡議團體)聯合多位新創創辦人,發公開信給川普政府,要求不要禁止美國業者使用中國的開源權重AI模型(open weight,指模型的參數檔案是公開釋出的,任何人都能下載到自己的電腦上執行、修改,不像有些AI只能透過官方網站或API使用)。信中提到的這類中國開源模型,例如被點名的幾家業者,讓資源較少的小型新創也能用得起先進AI技術。他們的理由是,如果政府基於國安考量全面封鎖,反而會傷害美國自己的新創生態圈和市場競爭力。這封信呼應該協會一貫立場:主張維持開放系統、開放標準,讓市場保持自由競爭,而非用行政禁令保護特定業者。
假設一家資金有限的美國AI新創,想開發一個中文客服機器人,若只能用OpenAI、Anthropic等美國公司的付費API,通常需按使用量計費,中小新創燒錢燒不起;但中國的開放權重模型(open-weight)可以直接下載到自己的伺服器上免費執行、還能依需求微調(fine-tune,就是拿自己的資料再訓練一次,讓模型更懂特定任務),大幅降低開發成本。這次聯署就是擔心,如果川普政府真的立法禁止美國企業使用這些中國開源模型,這條低成本開發路徑會被切斷,受傷最重的不是Google、Meta這種財力雄厚的大公司(他們有自己的模型),而是根本無力負擔昂貴API費用的中小新創。
兩位創辦人 Marcos 和 Harrison 展示了 Palmier Pro,一款開源的 macOS 影片剪輯軟體,特色是內建 AI 生成功能,還附一個本機 MCP(Model Context Protocol,一種讓 AI 助理能直接呼叫軟體功能、操作實際工具的標準介面)伺服器,可以讓 Claude、Codex 這類 AI 助理直接連進去操作剪輯軟體。他們原本是自己做 AI 宣傳影片時嫌麻煩才做這個工具:以前流程是先用 AI 平臺生成影片、下載、匯入剪輯軟體、剪輯、發現要改又要重來一輪,很卡;有了 Palmier Pro 之後,AI 生成和剪輯可以在同一個軟體裡完成。軟體用 Swift 開發,部分模型在本機端執行(包括語音轉文字、用 SigLIP2 做影片畫面搜尋、beat_this 做節拍偵測、Silero VAD 做靜音偵測),但 AI 生成(影片/圖片/音訊)功能需要登入並連到後端伺服器處理。目前僅支援 macOS 26 以上版本,不支援 Linux 或 Windows。
假設你手上有一堆 podcast 錄影素材,想套用某一集已經剪好的風格(例如固定的轉場、字幕排版、節奏),套用到其他集數上。傳統做法是人工一段一段對照著剪,非常花時間。用 Palmier Pro 的話,可以透過本機 MCP 伺服器讓 Claude 或 Codex 直接操作剪輯軟體的時間軸(管理影音軌、片段、關鍵影格),下指令『用同樣的 podcast 風格,套到我這批新素材上』,AI 就能自動完成分軌、剪接、套用轉場等技術性工作,人只需要最後檢查一下創意呈現是否OK。作者也提到,AI 目前不太擅長真正有創意的剪輯判斷,但只要有明確規則可循(例如照逐字稿剪、照節拍剪),它做粗剪就已經很夠用了,能省下大量重複性的技術操作時間。
這篇文章整理了全球資料中心(就是放伺服器的大型機房,網路服務、雲端運算都靠它運作)和AI用電量的最新數據,來源是國際能源署(IEA)等機構的統計。根據估算,資料中心去年用掉全球約1.5%的電力,其中AI專用的資料中心又只佔資料中心用電的三分之一,換算下來AI大約用掉全球電力的0.5%。用電問題並非平均分散,而是集中在少數地區:美國有5%的電力用在資料中心,愛爾蘭甚至超過20%,美國維吉尼亞州更超過四分之一。另外文章也統計了每次問AI一個問題大概耗多少電:像Gemini的一般文字問答約0.24瓦時(Wh,電力單位,大概是微波爐運轉不到一秒的耗電量),ChatGPT的一般問答約0.3至0.34瓦時,但如果是需要AI agent(能自主執行多步驟任務的AI助理)代為推理、處理很長內容的複雜請求,耗電量可能飆到40至50瓦時,差距非常大。
假設你想知道「每天用AI聊天到底耗多少電、劃不划算」,這篇文章給出具體數字可以直接換算:以歐盟居民平均每天用電量約17,000瓦時來看,如果你每天問AI簡單問題(每次約0.3瓦時),等於一天問超過5萬次都還不到你日常用電的零頭;但如果常用AI agent做長篇推理任務(每次約50瓦時),一天問340次左右就相當於用掉你一整天的電力額度。這說明簡單問答對個人碳足跡影響極小,但頻繁使用需要深度推理、長文本處理的AI agent功能,耗電量會明顯放大,是文章提醒讀者若在意環保可以留意的差別,而不是所有AI使用都一視同仁地耗能。
OpenAI(做ChatGPT的那家公司)發表一篇文章,整理全球多家新聞媒體如何用它的AI技術幫助記者和公司營運。多家新聞媒體利用AI協助記者查證新聞、將大量文件整理成可搜尋資料、讓讀者以對話方式查詢,以及協助業務部門尋找客戶。OpenAI強調這些工具旨在減少重複性工作,使記者能將更多時間投入原創報導與查證,而非取代編輯判斷。本質上這是OpenAI對外展示其技術在新聞產業的採用成果,屬於產業應用案例整理,而非新技術發表。
以西雅圖時報(The Seattle Times)為例:他們的廣告業務團隊過去要花好幾個小時,人工篩選、研究潛在廣告客戶的資料,再一一評估這些客戶值不值得接觸。他們改用ChatGPT Enterprise(企業版ChatGPT)打造一個對話式的客製化GPT(自訂用途的AI助理)當作「開發潛在客戶」的工具:業務只要用自然對話下指令,這個AI就能自動產生一份符合條件的潛在客戶名單、依照時報自訂的標準幫每個客戶打分數、寫出研究報告、檢查這個客戶是不是已經在公司的客戶管理系統裡出現過,還能先擬好給客戶電話會議要問的問題。結果是原本要花好幾個小時的潛在客戶篩選作業,現在幾分鐘就能完成,而且已經實際帶來新的業績成交。
日本IT服務大廠NTT DATA Group(旗下約有9000名員工使用Codex)在全公司導入了OpenAI的Codex(一種能自己動手寫程式、執行、測試、修改的AI助手,不只是聊天回答問題),並搭配ChatGPT Enterprise(企業版的ChatGPT)一起用。過去公司靠增加人力來成長,現在他們想改用AI創造更多價值。內部調查顯示超過96%員工對ChatGPT Enterprise感到滿意,超過95%的人說生產力提升了。公司也不是隻給工程師用,連不寫程式的行政、業務等員工都被鼓勵在日常工作中使用Codex,等於把「AI能獨立執行任務」這件事從工程部門推廣到全公司。
NTT DATA有一項關鍵系統的事故分析工作,過去需要5位資深工程師花3天才能完成。導入Codex之後,同樣的分析工作AI在30分鐘內就做完了,等於時間縮短了99.3%。除了工程場景,公司也讓不會寫程式的員工用Codex處理雜務:例如把信用卡帳單裡的交通費資料,自動抓出來填進出差報帳表格裡,Codex能同時讀懂多個檔案的格式規則,還能幫忙核對填寫是否正確;另外原本要靠工程師搭建BI(商業智慧)儀錶板才能做出的分析報告,現在一般員工也能直接叫Codex分析原始數據、產出報告,不用再依賴專門的工具和技能。為了讓這麼多不同背景的員工都能安全使用,公司內部成立了OpenAI Center of Excellence(卓越中心,負責推廣、教育訓練與安全規範),訂出哪些資料能用、Codex能連到哪些系統、要用什麼樣的安全沙盒模式等規則,才敢把使用範圍從一小群進階用戶擴大到約9000人。
北京市政府正式發布了一份名為《北京市關於加快智能體引領發展的若干措施》的官方政策文件,由市發展改革委聯合市委網信辦、中關村管委會、市經信局四個部門共同制定。智能體(Agent,就是能自己感知環境、記住資訊、做決策並動手執行任務的AI系統,比一般只會聊天回答問題的AI更進一步,能像個小助理一樣主動完成一連串工作)被官方認定為AI競爭的新賽道,政策目的是把北京打造成智能體技術和產業的全球高地。文件內容涵蓋九大方向,包括持續強化基礎模型(就是像GPT、文心一言這類大型語言模型)的能力、攻關智能體的底層共通技術(例如讓不同AI框架能互相搭配運作的工具鏈)、推動智能體與智能終端(例如結合AI的手機、機器人硬體)融合、鼓勵Token經濟(Token是AI處理文字時的最小計算單位,這裡意指圍繞AI運算資源產生的新商業模式)發展,以及建立智能體的分級分類安全監管機制。這份文件也提出要透過算力補貼、資金支持、資料共享、人才培訓等具體資源保障來落地這些方向。
以文件中提到的「Token經濟」和「OPC(一人公司)」為例:假設有個獨立開發者想靠一個人加上多個AI智能體就開一家公司運作(政策裡稱為OPC模式),過去他得自己張羅算力、自己摸索用哪套AI框架、遇到安全問題也沒地方諮詢。這份政策提出要建設公共服務平臺,並引育專業化運營團隊、發展專業服務、推動建設OPC社區,讓這類一人公司能獲得專業支持;政策還提出探索發放算力券、Token券等支持方式,並發展Token即服務(TaaS)、智能體即服務(AaaS)等新商業模式,為開發者提供更多降低運算成本和靈活獲取能力的途徑。此外,政府也計畫建置「智能體安全服務平臺」,透過搭建靶場、開發安全大模型等方式,向整個行業開放安全檢測、攻防對抗等共性服務,實現「以模治模」,降低開發者因不懂資安而出包的風險。
你可能看過機器人在展會上倒水、疊衣服的影片,動作總是慢吞吞的,這不是因為技術做不到更快,而是團隊故意調慢速度——一旦調快,出錯率就會飆升。這背後反映的是機器人的「大腦」(也就是控制機器人判斷和行動的AI模型)還沒有真正成熟到能應付各種真實場景。科大訊飛(一家中國的語音AI公司)在WAIC 2026(世界人工智能大會)開幕前,成立了一家新公司「爻方智能」,專門研發機器人大腦,並聯閤中國科學技術大學、聆動通用機器人發佈了一份技術報告,取名iFLYTEK-Embodied-Omni。團隊認為,現在業界主流用來控制機器人的VLA(Vision-Language-Action,一種直接把看到的畫面和聽到的指令轉成動作的AI模型)有個根本缺陷:它只會對當下反應,不會預判做完動作之後世界會變怎樣,就像看到紅燈會踩剎車、卻不知道雨天路滑會打滑。而後來興起、被英偉達大力推廣的「世界模型」(World Model,先在腦中模擬畫面再推算動作的AI)雖然能預判畫面,卻常常出現「預測的畫面很完美、但機器人身體實際做不到」的落差,因為它沒有教AI認識自己身體的極限,也就是缺少「本體認知」。爻方的解法是把「預判畫面」和「認識自己身體能不能做到」兩件事同時練,讓AI不只會想象未來,還知道自己這具身體做不做得到,就像好的羽毛球選手既能預判球的落點,也清楚自己跳不跳得到。
假設要訓練一個機器人手臂去抓取桌上不同形狀的物品。用傳統VLA做法,AI只學會「看到某個畫面就做某個動作」,一旦換了沒見過的物品或環境,動作常常變形出錯,因為它從沒學過物理規律和自身能力的極限。用主流世界模型的兩段式做法(先生成一段「機器人應該怎麼動」的預測影片,再讓機械臂照著影片反推動作),常常出現影片裡的畫面完全合理、但機械臂實際伸手時夠太遠或夠不到的情況,因為模型不知道這具身體手臂的實際長度和關節能轉到什麼角度。爻方的做法是額外訓練一項「逆運動學」任務(給AI看最終要到達的終點位置,逼它自己算出每個關節該怎麼轉、能不能轉到),相當於讓AI在預判畫面的同時也在練習「認識自己身體的極限」。團隊公佈的測試結果顯示,在LIBERO-Plus這個專門考驗換環境、換物體後還能不能做對動作的基準測試中,平均成功率達到89.6%,超過當時最強的VLA和世界模型方法;在雙臂協同抓取任務中,正常環境和刻意加了干擾的隨機環境分別拿下93.68%和93.16%的成功率,幾乎不受干擾影響。
科大訊飛在7月19日發佈了一個叫「星火Token Factory」的新系統,它不是一個新的AI模型,而是企業用來管理和調度「已經在用的多個AI模型」的中間層工具。背景是這樣的:現在很多企業同時在用好幾種大模型(比如處理客服、寫代碼、生成文案),但不管任務簡單還是複雜都用同一個模型處理,導致成本浪費,而且模型一多,管理、監控、安全都變得很亂。這個系統會自動判斷每個任務的難度(簡單任務用便宜的模型、複雜任務用能力強的模型),號稱能把決策時間控制在100毫秒以內。它還針對華為昇騰芯片做了推理加速優化,官方宣稱在同樣硬件下比開源的vLLM-Ascend框架推理效率提升約5倍,首個字生成的等待時間縮短30%到40%。此外還包含審計日誌、敏感信息保護、成本統計等企業管理功能。
假設一家公司同時用了多種大模型,過去工程師需要自行編寫規則來區分簡單任務(如文本分類)和複雜任務(如長文檔分析),並手動管理每個模型的調用成本與數據訪問權限。使用星火Token Factory後,企業只需將所有模型接入這一平臺,平臺會自動分析請求複雜度(例如根據提示詞長短、對話輪數等),將任務路由到合適的模型,同時提供審計日誌、敏感信息防護等安全治理功能,幫助企業實現統一管理與成本歸因,無需從零開發調度和安全邏輯。
這則新聞講的是一種叫 SkewAdam 的「優化器」(optimizer,就是訓練 AI 模型時負責一步步微調參數、讓模型愈訓練愈準的演算法)。現在訓練大模型最常用的優化器叫 AdamW,它有個大缺點:為了記住每個參數過去更新的方向和幅度,會額外保存兩組數字(術語叫一階和二階動量),這些「優化器狀態」佔用的顯卡記憶體,往往比模型本身還大很多。這在 MoE(Mixture of Experts,混合專家模型,就是把模型拆成很多個小型「專家」子網路、每次只啟動其中幾個來運算,藉此用較少運算量做出大模型效果)架構上特別嚴重,因為專家數量一多,AdamW 要記的狀態就爆炸性增加。SkewAdam 的做法是「分層」處理:不是所有參數都用同樣detail的方式記錄狀態,而是依照參數的重要性/使用頻率分配不同精細度,藉此把優化器狀態記憶體砍掉 97%,且經測試準確度不但沒有變差,反而更好。
具體例子:一個 67 億參數(6.7B)的 MoE 語言模型,用 bfloat16 格式儲存權重本身只需要 12.6GB 顯卡記憶體,但如果用傳統 AdamW 優化器訓練,光是優化器狀態就要吃掉 50.6GB,總共需要遠超過 40GB 的顯卡記憶體才訓練得動,一般人手上的 40GB 顯卡(例如 A100 40GB)根本放不下。換成 SkewAdam 之後,同一個 6.7B MoE 模型可以直接塞進單張 40GB 顯卡完整訓練。而且在 8200 萬個訓練詞元(token,就是模型讀文字時切出來的最小單位)的測試中,用 SkewAdam 訓練出來的模型驗證困惑度(perplexity,數字愈低代表模型愈準)是 108.4,比 AdamW 的 126.8、Muon 的 120.2、Lion 的 393.7 都好,就算把 AdamW、Adafactor 調到最佳參數(分別是 118.5、139.7)也贏不了。也就是說,同樣一張消費級/入門級顯卡,以前塞不下的模型現在塞得下,而且訓練出來的模型品質反而更好,不是省記憶體換來品質打折。
這篇文章討論一件事:輝達(NVIDIA)的優勢不只是賣「跑得快的晶片」,而是把晶片、伺服器、晶片與晶片之間的網路連接技術、讓工程師操控晶片寫程式的開發工具(compiler編譯器、framework框架)、雲端服務、到自家開發的前沿AI模型與給數十億人使用的應用程式,全部串成一條完整生產線,讓客戶用起來幾乎沒有阻礙,這種「從頭到尾都自己掌握」的做法被稱為全端(full stack)。作者認為,在所有大公司裡,只有Google最接近擁有這種從晶片到應用程式的完整能力,能自己做晶片、自己蓋伺服器、自己做雲端服務、也有自己的前沿AI模型與大量使用者的應用程式。但作者強調Google並不是輝達「唯一」的對手,也不是能直接取代輝達的選項,因為另一家晶片公司AMD、以及亞馬遜的雲端服務AWS也各自握有一部分全端佈局的能力,只是沒有Google那麼完整,所以用「唯一」這個詞形容Google太武斷。
假設一家新創公司要訓練並上線一個AI服務。若選擇輝達的方案,可以買輝達的晶片,搭配輝達自己開發的伺服器、網路連接技術與軟體開發工具,一路串到雲端上線都不太需要另外拼湊,出問題也在同一套生態系統裡能找到支援,這就是文章說的「全端」(full stack,指從晶片到應用程式全部自己掌握)。文章認為,在所有大公司裡,只有Google擁有類似的完整組合:自己的晶片、伺服器、網路連接技術、軟體開發工具、雲端服務、甚至自己的前沿AI模型與服務給大量使用者用,所以最像輝達的對手。但如果新創公司改選AMD的晶片,通常還是得自己去找雲端服務商湊伺服器、找其他公司的軟體工具鏈,等於自己要當整合者,這就是作者說AMD、AWS雖然也做晶片或雲端,但『不是全端』、不能直接說是輝達『唯一』對手的原因。
Anthropic 幫「Claude Managed Agents(代管代理,就是 Anthropic 幫你代管、負責跑起來的 AI 助理程式,你不用自己管伺服器)」這個功能加了幾項新設定。第一,可以針對每個代理個別調整「思考力道(effort,可理解成 AI 花多少心力慢慢想)」,調低就能讓 AI 回答更快、也更省錢。第二,以前要先建立一個對話工作階段(session)、再另外呼叫一次 API 才能餵資料進去,現在建立時就能一次塞進最多 50 筆使用者訊息和「結果定義」事件,省掉一次來回。第三,一個工作階段裡最多可以掛載 500 個「技能(skill,就是預先寫好、教 AI 怎麼做特定任務的說明書)」。第四,新增了 webhook(一種讓外部系統即時收到通知的機制)可以串接執行環境和記憶儲存空間。第五,子代理(sub-agent,代理底下再分派出去做事的小代理)執行時的事件現在可以即時串流出來看。
假設你在幫公司做一個客服 AI 系統,裡面同時有負責不同任務的代理,各自對應不同難度。新功能允許針對每個代理獨立設定 effort,你可以根據任務需求調整思考力道,平衡回應速度與成本。另外,過去要先建好一個工作階段,才能再發一次 API 呼叫塞入使用者對話紀錄,現在能在建立當下就一次塞進最多 50 則訊息,串接系統時少寫一段程式碼、少一次網路來回延遲。
AI 寫程式工具 Bolt.new(一個用自然語言描述需求、AI 自動幫你生成網頁或應用程式碼的平臺)推出「技能共享」功能。所謂技能(skill)是團隊成員預先寫好的規則或範本,例如「設計規範」「品牌文案語氣」「SEO(搜尋引擎優化,讓網頁在 Google 排名靠前)結構」。以前每個技能要手動叫出來用,現在只要打一句需求,系統會自動判斷該套用哪些技能,並把多個技能疊加在一起同時生效,不用逐一手動指定。同一則消息也提到另一位開發者 Fred Schott 預告了「可組合代理」(composable agents,用程式碼定義而非設定檔定義的 AI 代理)的新方向,但目前只是預告,細節尚未公佈。
假設你在 Bolt.new 裡打一句「幫我們的 Skills 上線做一個候補名單頁面」,系統會自動套用團隊裡已建立的相關技能,例如設計技能確保頁面符合公司視覺規範、品牌語氣技能負責寫文案、SEO 技能負責調整頁面結構等;實際套用的技能數量不固定,取決於 prompt 內容與哪些技能相關。你不用手動一個個叫出這些技能,AI 會依提示內容自動比對並疊加,出來的成品直接是「符合品牌、能轉換、能被搜尋到」的完整頁面。技能新增方式也很彈性,可以上傳 .md/.mdx/.zip 檔、直接從 GitHub repo 匯入,或在設定裡手寫;技能又分「工作區層級」(全team通用)和「專案層級」(單一專案專用、可個別開關)兩種範圍。
LangChain(一家做 AI 應用開發框架的公司)推出了一個叫「Eval Engineering Skill(評估工程技能)」的新功能。所謂 eval(評估),是指用一套測試題目和標準答案來檢驗 AI 代理(agent,能自主執行多步驟任務的 AI 程式)做得好不好,就像幫 AI 出考卷打分數。這個新功能能自動幫寫程式的 AI 代理,利用專案原始碼(repo context)和代理過去執行任務留下的紀錄(agent traces),自動生成測試任務和評分標準,省去工程師手動設計考題的功夫。這代表「幫 AI 出考卷」這件事本身正在變成一個獨立的產品功能,而不只是開發過程中的附屬步驟。
假設一家公司養了一個寫程式的 AI 代理,想確認它改 bug、寫測試的能力有沒有變差或變好,但不知道該出什麼題目來考它。用這個新技能,工程師只要提供這個代理的程式碼倉庫,以及過去執行任務時留下的操作紀錄(agent traces),系統就能自動整理出一批具體的測試任務和對應的評分標準,直接接到 Harbor(LangChain 的評估執行平臺,一套用來跑這些考卷的系統)上執行。原文提到的討論串裡,也有人比較另一個工具 coder-eval.com,指出它多了 A/B 對照實驗功能,能更容易比較不同版本 AI 技能的優劣;還有開發者表示打算把這套方法用在自己的開源專案 openbench 上。差異在於:以前要靠人工一題一題手寫測試案例,現在可以直接從既有的程式碼和使用紀錄自動生成,省下大量時間。
Prime Intellect(一家做AI基礎設施的公司)發布了一個包含超過36萬個任務的資料庫,專門用來訓練「代理型AI」(agent,就是能自己動手操作電腦、寫程式、上網搜尋的AI,而不只是聊天回答問題)。這些任務涵蓋寫程式解bug(SWE)、操作終端機、網路搜尋三大類,總共分成23個任務集,全部整合在同一個API(應用程式介面,讓開發者用一段程式碼就能存取這些任務)之下。他們把其中約13.5萬個任務的執行環境(用來跑測試的虛擬電腦映像檔)放在自己的伺服器上,宣稱是同類型中規模最大的公開資料庫,而且解決了以往常見的Docker Hub(存放這類映像檔的公共平臺)流量限制問題,可以同時跑上千個任務。他們也強調做了嚴格的資料清洗:對每個任務跑「有正確解答就該通過測試、沒解答就該測試失敗」的驗證,反覆跑十次來抓出結果不穩定的假任務,並把清洗後的資料集和產生腳本都公開在Hugging Face(一個AI模型與資料集的公開分享平臺)上,方便別人檢查和複製。
假設一家AI新創公司想訓練一個能自動修bug的程式設計代理AI,用強化學習(RL,就是讓AI透過「做對有獎勵、做錯沒獎勵」不斷試錯來進步的訓練方式)的做法。過去要做這件事,得自己去各處蒐集程式庫的bug修復紀錄、自己架設測試環境、自己確認每個任務的「正確答案」是否真的能讓測試通過、還要防止AI在訓練過程中偷看到測試答案作弊。現在改用Prime Intellect的API,工程師只需呼叫同一組介面,就能拿到36萬個已經驗證過「有解答會通過測試、沒解答會測試失敗」的乾淨任務,環境映像檔直接從Prime Intellect自家伺服器抓取(不受Docker Hub流量限制),且系統會在評分前刻意隱藏測試答案和評分腳本,防止AI作弊。結果是:原本可能要花數週自建的訓練資料與環境,現在一個API呼叫就能取得,且資料品質經過反覆驗證,訓練出來的代理AI更不容易因為資料髒汙或作弊漏洞而學到錯誤行為。
AlphaXiv這家做論文工具的公司推出新產品叫OpenResearch,目標是讓AI代理(agent,就是能自己動手做多步驟任務的AI程式)幫忙重現學術論文裡的實驗結果。使用者只要輸入一個指令,指定論文連結或標題,再指定要用自己的哪臺電腦或雲端運算資源跑,AI就會自動照著論文描述動手做實驗。每次跑實驗都會用「隔離工作區」(worktree,簡單說就是每次實驗都在獨立的乾淨環境跑,不會互相干擾或汙染彼此的程式碼與結果),並串接W&B(Weights and Biases,一套研究人員常用來記錄與比對實驗數據的工具)來自動記錄過程。系統還會畫出一張「分支實驗圖」,把不同嘗試路線之間的關係和演進過程視覺化呈現,方便使用者比較哪條路線比較有效。原文作者提到這反映了一個趨勢:認真做AI代理的人,正在從隨意下指令(ad hoc prompting)進化成明確定義任務、評測標準與資料流程的正規化做法。
假設一位研究生想確認某篇剛發表的AI論文結果是否可重現,過去得自己讀論文、手動架設環境、抓資料、寫程式碼、跑訓練、記錄每次調參的結果,過程繁瑣且容易漏記細節,導致復現失敗時很難回溯是哪一步出錯。用OpenResearch的話,使用者需自行準備論文對應的程式碼與資料,並放在自己的運算環境中;接著下一行指令,例如「/reproduce-paper <論文連結> on <自己的運算資源>」,代理就會在獨立的工作區裡跑實驗、把每次結果自動記錄到W&B,並產生一張分支圖,顯示不同實驗路線之間的關聯與進展。研究生不需手動維護實驗記錄表,出錯時可參考分支圖來比較各分支的表現差異;且資料與程式碼全程留在自己的電腦或運算環境裡,不會外流給第三方。
NVIDIA(一家專門做繪圖晶片和AI晶片的公司)發表了兩款新的AI模型。第一款叫Cosmos 3 Super,是用來生成圖片和影片的AI模型(給它文字描述,它就畫出圖或做出影片),這次的重點是速度變快、只要4個步驟就能生成,比舊版快了最多25倍,而且品質沒有明顯下降。在Artificial Analysis(一個專門幫AI模型打分數、排名的獨立評測網站)上,這款模型在「圖轉影片(無聲音)」項目排名第一、「文字轉圖片」項目排名第二,是開放權重模型(open-weight,意思是模型的參數是公開的,任何人都能下載來用,不像有些AI只能透過付費API使用)中數一數二的成績。第二款叫Cosmos 3 Edge,設計給邊緣裝置(edge device,就是手機、機器人、監視器這類不連雲端伺服器、直接在本地端運算的小型裝置)使用,能理解影片中物體的物理特性(例如東西會怎麼移動、碰撞),用在需要即時反應的場合。兩款模型都已經上架到Hugging Face(一個開源AI模型的下載平臺)供大家下載使用。
假設你是一家做機器人的新創公司,想讓機器人的AI能「看懂」眼前發生的事並預測物體接下來會怎麼移動(例如一顆球滾過來、手臂會不會撞到桌角),但機器人晶片運算能力有限、不能跑龐大的雲端模型,也不能等雲端回傳結果,否則反應太慢。過去做法要嘛自己訓練一個小模型(成本高、耗時久),要嘛硬跑一個大模型犧牲即時性。有了Cosmos 3 Edge,你可以直接下載這個NVIDIA已經訓練好、專門針對邊緣裝置優化、又具備物理理解能力的模型,部署到機器人上,不用自己從零訓練,機器人就能即時判斷物體的物理行為並做出反應。同樣地,如果你是做AI生成影片的服務,過去生成一段影片可能要跑數十步運算、等好幾秒甚至更久,改用Cosmos 3 Super後只要4步就能生成、速度最多快25倍,使用者體驗大幅改善,而且模型排名還是業界前段班,不用在速度和品質之間硬選一邊。
Google執行長Sundar Pichai在公司財報後發文,公佈旗下AI(人工智慧)產品的最新使用數據。他說Google的模型API(讓開發者把AI功能接進自己軟體的介面)每分鐘要處理220億個token(token是AI處理文字時的最小單位,大致可想成幾個字母或半個中文字),這個量比上一季的160億又成長不少,主要靠的是速度快、成本低的Flash系列模型撐起流量。聊天機器人Gemini App的月活躍使用者(一個月內至少用過一次的人數)達到9.5億人,等於全球每十幾人就有一人在用。他也提到面向企業的Gemini Enterprise已被財星100大企業(美國規模最大的100家上市公司)中九成採用,顯示大型公司對AI工具的接受度已相當高。
假設你是企業IT主管,正在評估要不要把公司的客服系統或內部工具串接Google的Gemini模型API。過去你可能只能參考Google官方宣傳詞判斷這項服務是否成熟穩定,這次Pichai直接公佈具體流量數字:每分鐘220億token的處理量,代表這套系統已在支撐全球龐大規模的即時請求,而且季增幅度不小,顯示基礎設施撐得住持續擴張的用量;加上九成財星100大企業已在用Gemini Enterprise,等於已有大量同等規模公司做過壓力測試。這些數字可以作為你評估「這家供應商的服務可靠嗎、規模夠大嗎」的具體依據,而不是隻能憑感覺猜測。
有團隊發布了一個叫 Nanbeige4.2-3B 的新 AI 模型,它只有 30 億個參數(參數可以想成模型腦袋裡的「旋鈕」數量,數字越大通常代表模型越強、但也越貴越慢),卻能在多項測試中打贏參數量是它 4 倍大的模型,例如 Qwen3.5-9B(90 億參數)和 Gemma4-12B(120 億參數)。這個模型主打「代理」(agentic,也就是能自己規劃步驟、呼叫工具去完成任務的 AI,而不只是聊天回答問題)能力,在程式修錯(SWE-bench)、終端機操作(Terminal Bench 2.0)、研究所等級題目(GPQA-Diamond)等多個指標測試上都表現亮眼。它用的是「循環 Transformer」(Looped Transformer)架構,簡單說就是同一組神經網路層被重複拿來用好幾次,而不是每一層都要有自己獨立的參數,這樣可以用比較少的參數量做出接近大模型的效果。不過網路上的討論者也提醒,這些成績目前是模型發布方自己公佈的,還需要外部獨立測試驗證才能完全信任。
假設一家新創公司想做一個能自動幫忙修 GitHub 程式碼錯誤、或操作終端機執行任務的 AI 助理,過去可能得租用像 Qwen3.5-9B 或 Gemma4-12B 這種較大模型的雲端運算資源,成本較高、回應也較慢。如果 Nanbeige4.2-3B 公佈的測試結果屬實,開發者可以改用這個只有 3B 參數的小模型,部署在更便宜的硬體上(甚至可能是單張消費級顯示卡),卻能達到接近大模型的程式除錯與工具操作能力,等於用更低的成本做到差不多的事。差別在於:以前「要更強就得用更大模型、花更多錢」,現在如果循環架構的效率驗證屬實,就有機會「用小模型的價格、得到大模型的表現」。
Cognition公司的AI程式設計代理(agent,一種能自主執行任務、寫程式、跑指令的AI)「Devin」推出新功能叫Devin Outposts,讓使用者可以把Devin的執行環境架設在自己指定的機器或雲端服務上,例如自己的Mac mini、私有網路內的虛擬機、Kubernetes叢集等。Devin原本的推理與規劃仍在Cognition雲端進行,但實際下指令、改檔案、存取程式碼庫的動作可以搬到使用者自己掌控的機器執行。這次更新是與Cloudflare、Daytona、E2B、Modal、Namespace、NVIDIA Brev等多家「沙箱」(sandbox,指隔離出來、安全執行程式碼用的獨立環境)供應商合作,各自提供部署範本與教學。共同的重點是讓AI代理的執行環境更有彈性,可以在邊緣網路、GPU叢集、企業內部網路等不同場景間自由搬遷。
假設一家公司想用Devin除錯訓練AI模型時遇到的問題,但訓練用的GPU伺服器是公司自建、放在私有網路裡,不能讓外部雲端服務直接連進去。透過Devin Outposts搭配Modal的部署範本,可以把Devin的執行環境架到跟訓練、部署模型同一批GPU基礎設施上,讓Devin直接在這些硬體上重現錯誤、抓效能瓶頸、驗證修好了沒,跑完還能將GPU資源縮回零,不用額外付閒置費用。另外用Namespace範本還能讓Devin拿到一臺M5晶片的Mac,配合電腦操作能力自動建置、執行、測試Apple平臺的App——這些部署選項是官方在本次更新中提供的擴展方案。
SkyPilot(一套幫你把運算工作自動派到不同雲端或機構叢集上執行的開源工具,你不用自己一臺臺伺服器手動設定)最近在AI圈的討論熱度上升。多位業界人士都提到,越來越多團隊需要同時使用好幾個不同的雲端服務商,或跨多個機構的運算叢集(就是學校、公司或研究機構各自擁有的一批伺服器主機),而SkyPilot能把這些原本各自獨立、設定方式都不一樣的運算資源統一管理起來,讓使用者不用為每個雲端或叢集分別寫設定檔。雲端服務商Nebius宣佈成為第一個與SkyPilot團隊共同開發整合的雲端合作夥伴。這反映一個趨勢:當AI團隊的運算工作分散在越來越多不同來源、不同規格的硬體上時,這種能把複雜度包起來、讓使用者用同一套方式操作的「基礎設施抽象層」工具,價值也跟著提高。
假設一個研究團隊要訓練AI模型,手上同時有學校的GPU叢集、公司自購的機房、加上向雲端商租的機器,這三種資源的登入方式、排程系統、計費規則全都不一樣。過去做法是研究人員得分別學會三套操作介面,訓練工作要手動搬到哪臺機器上跑、跑完要不要換一個更便宜的雲端,都得自己盯著算。用SkyPilot的做法是,寫一份設定檔描述「我需要多少GPU、跑多久、預算上限」,SkyPilot就自動幫你找出當下最划算或最空的資源、把工作送過去執行,不管背後是學校叢集還是某家雲端商。差別在於:以前換一個運算來源就要重寫一次流程,現在只要換底層設定,操作介面不變。
OpenAI宣佈把「ChatGPT Health」(一個讓ChatGPT回答健康相關問題、並可串接個人健康資料的功能)開放給所有美國18歲以上的使用者,不分免費版或付費版都能用。使用者可以連結Apple Health、MyFitnessPal等App的健康資料,也能匯入Epic、Oracle Health等醫院系統裡的病歷,讓AI在一般聊天視窗(不只是專屬的健康版面)就能根據你的健康資料回答飲食、過敏等問題。OpenAI表示這項功能是在一名佛州牧師控告公司「建議他不要就醫、險些致命」的隔天宣佈的,公司強調服務條款仍寫明「不作為疾病診斷或治療用途」。OpenAI也提到旗下最新模型GPT 5.6-Luna在HealthBench(公司自行開發、用來評測AI回答健康問題準確度的公開測試集)上的表現優於前一代GPT 5.5,但多項研究也指出AI在醫療建議上仍不夠可靠。
假設你平常有在記錄運動量和飲食熱量。以前如果想問ChatGPT健康相關問題,只能在專屬的健康中心(health hub)中提問;現在開放這項功能後,你可以把Apple Health和MyFitnessPal等服務的帳號連進ChatGPT,讓AI在回答時能參考這些實際記錄的數據,提供更個人化的回應。官方表示,使用者可以在一般聊天視窗中直接使用這些連接的資訊,而不必特地切換到專屬健康頁面。不過具體的運作細節與效果,仍有待更多實際使用情況驗證。
美國新創公司Etched剛完成一輪3億美元的募資,公司估值來到103億美元,比去年12月的50億美元估值翻了一倍,只花了七個月。這輪投資由知名創投Sequoia領投,還有a16z、SK海力士、Jane Street等知名機構參與,甚至PayPal創辦人Peter Thiel、前特斯拉AI總監Andrej Karpathy等大咖也是投資人。Etched做的不是一般晶片,而是專門加速AI推論(inference,也就是AI模型讀懂你的問題、生成答案的運算過程)的客製化硬體,號稱完全不需要用到Nvidia的GPU(圖形處理器,目前AI運算最常用的晶片)。這家公司由三位從哈佛輟學創業的年輕人在2022年創立,一路上被很多人質疑不看好,如今用實際訂單和大廠測試結果證明自己。
假設一家AI公司要幫自己的聊天機器人做推論(也就是使用者送出問題、AI生成回答的那個運算階段),推論其實分兩個步驟:先讀懂問題和上下文(叫prefill,運算量大很吃計算力),再一個字一個字生成答案(叫decode,運算量小但很吃記憶體頻寬)。傳統做法是全部丟給Nvidia的GPU處理,成本高、速度也有限。Etched則設計了兩種新硬體來對應這兩階段:一顆是用「低電壓」運作的prefill專用晶片,電壓低發熱少,就能塞進更多電晶體、跑得更快;另一種叫「叢集規模記憶體」(cluster-scale memory)的新技術,讓很多顆晶片可以共用一個超快速、低延遲的記憶體池,專門對付decode階段最耗記憶體的問題。公司說這套系統不是隻能跑特定模型,像DeepSeek、Qwen這種把任務拆給多個小模型處理的「混合專家」架構(MoE),或是不用Transformer的Mamba模型都能跑。差別在於:同樣的推論任務,用傳統GPU可能又貴又慢,用Etched的專用系統理論上速度更快、成本更低,這也是為什麼投資人願意用兩倍估值搶著投錢。
Anthropic(開發Claude這款AI對話工具的公司)推出一個新功能,叫做「Anthropic經濟指數連接器」(connector,就是讓Claude能連上特定資料庫、回答時直接引用裡面數據的外掛)。這個經濟指數本來就有,記錄的是AI在各行各業、各地區實際被拿來做什麼工作。以前這些數據要自己上網站查,現在只要在Claude對話裡直接用白話問問題,Claude就會去查這個資料庫、給出有數據根據的回答,而不是憑印象亂猜。這個功能在claude.ai裡開啟連接器選單就能啟用,任何一款Claude模型都能用,不用額外安裝東西。
假設你是一名記者,想寫一篇報導「AI對教師這個職業的實際影響」。以往若要了解這類資訊,可能需要自行查閱經濟指數的公開數據;現在你只要在Claude對話框打「教師都用Claude做哪些類型的任務」,Claude會直接連到經濟指數資料庫抓出答案,並且可以進一步問「How has that changed over the past year?」來追問變化趨勢,甚至能請Claude把背後的原始數據攤開給你看。差別在於:以前需要自己找數據、分析整理;現在直接用一句自然語言提問就能拿到有憑有據的結果。
WebMCP是一個讓網頁自己「登記」一批功能給AI瀏覽器代理(就是能幫你自動操作網頁的AI,例如自動幫你訂位、填表單)直接呼叫的新技術規格,這樣AI就不用再用猜的方式去點畫面上的按鈕,或用截圖辨識畫面內容,出錯機率會低很多。這份規格由Google和微軟主導,Chrome瀏覽器從149版到156版都在跑公開試驗,任何網站都能申請加入測試。但目前的問題是:幾乎沒有任何網站真的部署了這個功能,也還沒有任何主流的AI代理(像Claude、ChatGPT Agent、Perplexity、Gemini)會去呼叫這些登記好的功能,供給和需求兩邊都還沒接上。規格本身也還在變動中,7月21日這次更新把程式呼叫的位置從navigator.modelContext改成document.modelContext,等於早期就跟進的開發者現在得回頭改程式碼,才能跟上新版本。Chrome內建的Gemini將會是第一個真正使用這項功能的主流AI代理,但確切上線時間還沒公佈。
假設你經營一個線上購物網站,想讓AI代理能自動幫使用者搜尋商品、查詢庫存、甚至完成結帳。用傳統做法,AI只能用「螢幕截圖再點座標」或「解析網頁原始碼猜按鈕功能」這兩種方式操作,網站一改版(例如按鈕位置換了)AI就會失效,而且速度慢、容易出錯。改用WebMCP之後,開發者可以直接在網頁的JavaScript程式裡登記一個叫做search-products的工具,明確定義它接受什麼參數(例如搜尋關鍵字、要回傳幾筆結果)、會回傳什麼格式的資料,瀏覽器會把這個工具攤開給AI代理呼叫,AI呼叫時就像呼叫一個函式一樣直接拿到結構化的搜尋結果,不用再自己解析網頁畫面。目前像Expedia、Booking.com、Shopify、Etsy、Target等大公司已經加入Chrome的試驗名單,但截至目前為止,除了展示用途和專門檢測WebMCP的網站以外,真正在正式環境部署這套工具的網站數量趨近於零,而且還沒有一款主流AI代理會去呼叫這些工具,等於工具做好了但暫時沒人用。
有位開發者分享,這幾個月幾乎都用 Cloudflare 的「Durable Objects(簡稱 DO,一種雲端運算資源,可以想成一個永遠不會忘記狀態、能持續存活的小型獨立程式單元)」來蓋產品,尤其適合拿來做 AI agent(能自己執行多步驟任務的 AI 程式,例如自動幫你訂票、寫程式、處理客服)。DO 把三件事包在一起:一個隨需啟動的輕量運算環境(叫 V8 isolate,可以想成一個很小很快就能開機的虛擬機器)、一個附掛的 SQLite 資料庫(存資料用,不需要另外架資料庫伺服器)、以及自動把請求導到對應那個運算單元的路由系統。開發者不用再想「一堆服務去查同一個資料庫」,而是把系統拆成很多個各自獨立、由事件觸發的「物件」,例如一個聊天室、一個工作區、一個使用者各自是一個物件。作者說 DO 的最大好處是便宜(他整套多代理系統的基礎設施一個月大概只要10美元,換成 AWS 可能貴上10到50倍)、原生支援 WebSocket(能讓伺服器主動即時推訊息給使用者的技術,聊天室、通知常用到)、而且因為程式碼量少,AI 寫程式代理在裡面探索、除錯的效率也比較高(也就是「token 效率」高,token 是 AI 處理文字時計費和計算的最小單位)。缺點包括:單執行緒模型雖然簡化了併發問題,但如果代理生成的程式碼不小心在等 LLM(就是 ChatGPT 這種會對話的 AI)回覆時卡住,會連帶讓其他所有連線的讀取請求卡住長達幾十秒;官方主要只支援 TypeScript 語言;資料庫欄位升級(migration)管理起來也比較麻煩;而且企業如果需要「自己選雲端供應商、資料留在自家機房」(BYO-Cloud)的話,用 Cloudflare 幾乎不可能達成。
假設你要做一個類似 Slack 的多人即時聊天產品,同時還想讓 AI agent 24 小時待在每個頻道裡幫忙整理訊息、回答問題。傳統做法是架一臺應用伺服器 + 一個共用資料庫,所有頻道、所有使用者的請求都打到同一組資料庫,遇到高併發要另外處理鎖定(locking)和查詢效能,而且要幫每個 AI agent 保活、管理連線資源,在 AWS 上這樣一個中等規模的多代理系統,作者估計要花到基礎設施費用的10到50倍。改用 Durable Objects 的做法是:每個聊天頻道建一個 ChannelDO、每個工作區建一個 WorkspaceDO,使用者連進來時系統自動把請求路由到「這個頻道專屬」的那個運算單元,該單元自己管理自己的 WebSocket 連線清單,收到新訊息就直接廣播給所有連在這個頻道上的人,不需要額外的訊息佇列或多層轉發架構。因為每個 DO 是獨立、單執行緒運作,開發者不用擔心兩個請求同時搶著寫同一筆資料出錯的問題。作者實測這樣一套系統一個月大約只要10美元,而且因為程式碼很精簡,讓 AI coding agent(自動寫程式的 AI)在裡面工作時看得懂、改得快,不會像大型程式碼庫那樣讓 AI 迷路變慢。
Redis 創辦人 antirez 撰文指出,AI 編程代理(coding agent,就是能自動幫你讀程式碼、寫程式、改程式的 AI 工具)普及後,軟體開發和發布的方式也可能跟著改變。過去開源軟體通常分成「穩定版」和「開發中版」兩條分支,開發者要等到功能夠成熟、錯誤夠少才會正式發布給使用者用。但現在因為愈來愈多技術使用者本身也擁有 AI 編程工具,連軟體的「使用者」都能自己動手用 AI 修改、調整程式碼來符合自己的需求,不必等開發者把東西打磨到完美才能用。作者認為這代表開源專案可以不用只維護「主線」和「不穩定分支」兩種版本,而可以同時公開多條實驗性分支,讓不同使用者依自己的技術能力和需求去測試、修改、甚至用 AI 自行補完功能。
作者以自己維護的兩個專案舉例:第一個是 Redis(一套很多網站背後用來儲存資料、加速存取的資料庫軟體),他正在寫一個能大幅節省記憶體用量的功能(針對「sorted sets」這種資料結構),這個改動一旦正式合併會影響所有 Redis 使用者,有人可能因此每年省下大筆雲端主機費用;但因為功能還在測試、設計可能改動、甚至最後不一定會被正式採用,與其等它完全成熟才公開,不如提早釋出一個「95% 完成」的分支,讓真正需要省記憶體的進階使用者提前拿去測試、自行調整。第二個例子是他做的本地 AI 推論專案 DwarfStar:他發現只要專案裡已經有兩、三個範例示範某個功能怎麼實作(例如支援某種 GPU 或某個 AI 模型),AI 編程代理就能照著這些範例自動推算出怎麼幫其他類似的 GPU 或模型做出同樣功能,不需要工程師每個組合都自己手刻。他舉例說最近一個新模型(GPT 5.6 Sol)靠著看現有程式碼當範本,只花約兩小時就自動寫出了一套原本需要他自己耗費大量心力研讀模型文件才能完成的實作。這說明開源專案的程式碼本身,現在不只是給人看的成品,也要寫得讓 AI 看得懂、學得會,才能發揮最大效益,跟傳統「先開發完善再統一發布」的做法明顯不同。
這篇文章是客服AI公司Sierra寫的開發日誌,記錄他們花了約十幾週打造一套「MCP閘道」的過程。MCP(Model Context Protocol,一種讓AI代理能安全存取公司內部系統與資料的標準協定,例如讀取Slack訊息、查資料庫、開GitHub工單)讓公司內部的AI代理不再各自為政、各自接資料源,而是統一從一個閘道存取所有內部系統,並統一管理身分驗證與存取紀錄。文章詳細描述了團隊如何從第一週只有一個「whoami」測試工具,逐步擴充到45個服務、公司內89%員工每週使用,過程中遇到的難題包括:如何防止AI代理不小心把A客戶的機密資料透露給B客戶、如何讓AI代理誠實回報工具是否真的成功執行(而不是「作弊」偽裝成功)、以及如何在不同AI代理工具(Pinecone內部代理、ChatGPT、Claude等)之間維持一致的相容性。這是一篇偏工程實務的深度案例分享,對正在建置企業內部AI代理系統的技術團隊很有參考價值。
舉例來說,Sierra團隊發現如果直接做一個「get_customer_journeys」工具讓AI代理能讀取某客戶的完整使用紀錄,風險是AI代理可能不小心把這份資料用在另一個客戶身上(例如客服人員問AI「幫我看看客戶A的操作流程」,AI卻把資料誤用到處理客戶B的請求時)。他們的解法不是直接開放原始資料存取,而是改做一個「get_customer_journey_summary」工具:AI代理只能拿到一份「摘要」,而且在產生摘要前,閘道會先用另一個獨立的AI模型檢查這個查詢請求本身是否安全、是否想套出敏感細節,確認無害後才回傳摘要給發問的AI代理,AI代理本身完全不會碰到原始的敏感資料。這跟一般企業直接把資料庫全部接給AI代理使用的做法不同,多了一層「先審查問題本身、再給摘要而非原始資料」的安全防線。
有一份研究報告在討論一個大家都好奇的問題:既然這麼多公司都在用AI(人工智慧),為什麼失業率沒有明顯上升?研究團隊分析後發現,關鍵原因是大部分公司其實根本沒怎麼認真用AI,只是嘴上說說。這些「低強度使用」的公司,跟完全沒用AI的公司相比,在人力僱用上幾乎沒有差別。真正把AI用深、用透的少數公司,反而在兩年內把員工人數成長了一成左右。換句話說,AI目前還沒有大規模取代人力,是因為真正大量投入AI的企業還是少數,多數企業只是象徵性導入。
研究把公司依「每位員工每月花在AI上的錢」分組:花費最少的後三分之二公司(低強度使用者)在導入AI後,僱用人數完全沒有變化,跟沒用AI的對照組一樣。而花費最多的高強度使用者,平均每位員工每月大約投入30美元在AI工具上,這些公司兩年內員工人數反而成長了10%。這說明真正的差異不在「有沒有用AI」,而在「用得夠不夠深」——淺嘗輒止的公司僱用不變,重押AI的公司甚至還加速擴編,跟外界擔心「AI一導入就裁員」的直覺完全相反。
Dropbox內部有一套叫Riviera的系統,專門負責把各種檔案(PowerPoint、PDF、影片等)轉換成別的程式看得懂的格式,例如把PowerPoint轉成一張張圖片預覽、把影片轉成可以直接串流播放的版本。這套系統原本只是公司內部用來產生檔案預覽的小工具,十年下來擴展成支援三百多種檔案格式、每秒能處理數十萬次轉檔工作的大型平臺。近年Dropbox推出AI助理產品Dash(能回答關於你檔案內容的問題),才發現要讓AI(就是能理解文件內容並回答問題的模型)讀懂文件之前,得先把文件裡的文字擷取出來、掃描件要辨識文字、各種格式要統一整理,而這些「前置整理工作」正好就是Riviera一直在做的事,Dash直接沿用不用重造輪子。現在Dropbox決定把Riviera的部分功能,透過公開API(讓外部程式呼叫的介面)和MCP(一種讓AI工具能存取外部資料與功能的標準協定)開放給外部開發者使用。
假設你在做一個文件管理系統或AI客服,需要讓使用者上傳合約、簡報、掃描件,並讓AI能回答「這份合約的付款條件是什麼」這類問題。傳統做法是自己寫程式,針對PowerPoint、PDF、Word、掃描圖片各自寫一套文字擷取邏輯,遇到新格式就要再加一套,維護起來很累贅、容易出錯。用Dropbox開放的Riviera API後,你只要把檔案丟給這個API,不管是哪種格式,它都能吐出擷取好的文字、預覽圖或摘要資訊,直接餵給AI模型當作回答問題的參考資料,不用自己維護一堆格式轉換程式碼,開發時間可以從原本要花數月縮短到幾週。
這篇文章討論一個新的資料架構構想,主角是「AI代理」(agent,就是能自己執行任務、查資料、做決策的AI程式)。作者觀察到,現在大家都想把公司的資料倉儲(存放大量商業資料、供分析查詢的系統)改造得更適合AI代理使用,但他覺得方向反了。他提出一個相反做法:不要讓所有AI代理都擠著去用同一個中央資料系統,而是讓每個AI代理自己帶一個小型資料庫(用DuckDB,一款可以嵌入程式裡運作的輕量資料庫),需要資料時直接跟其他代理互相交換,不用每次都排隊查詢中央系統。因為AI代理跟人不一樣,它們可能同時有幾十個在跑、彼此還會互相觸發產生更多任務,如果全部擠在同一套資料系統上查詢,很容易塞車、也容易讓錯誤資料一路傳下去而沒人發現。為了避免代理之間對「同一筆資料」有不同認知而搞混,他設計了「不可變資料切片」(一份資料一旦產生就不會再被修改,要更新就產生新的一份,而不是覆蓋舊的)以及三層「語意合約」(用機器可以自動檢查的規則,明確定義一個數字或欄位的計算方式,並自動判斷新舊定義是「相同」「只是新增」還是「會破壞相容性」),確保代理之間交換資料時不會因為定義不一致而算錯。
假設有兩個AI代理都要用到「營收」這個數字:代理A用的定義是「營收=訂單數量乘以單價」,代理B後來把定義偷偷改成「營收=訂單數量乘以單價再打九折(扣掉折扣)」。如果用傳統做法,兩個代理各自算出一個「營收」,沒有人會發現這兩個數字其實含義不同,下游做決策的AI可能直接把兩份數字加在一起,得出一個看似合理、實際上是錯的總營收。這篇文章介紹的架構會怎麼處理:系統把每個「營收」定義本身也做成一個可以被雜湊(一種把內容轉成一串固定長度代碼、內容不同代碼就不同的技術)比對的合約,一旦B的定義偷改了關鍵計算方式,系統會自動比對出這是「破壞性變更」(BREAKING),並在代理B要把資料交給代理A之前就擋下來、回報「這個資料集雖然有可用版本,但每個版本都改動了你需要依賴的定義」,而不是讓兩筆語意不同的「營收」被誤當成同一件事拿去加總。差別在於:傳統做法要等人工事後發現數字兜不起來才會抓到問題,這個做法讓AI代理在交換資料的當下就自動被擋下來,不會把錯誤傳到下游。
AI 伺服器裡的 GPU(繪圖處理器,AI 運算的核心晶片)運作時會產生大量熱,資料中心得花很多電力來降溫,這筆冷卻用電已經變成 AI 公司的一大成本負擔。一家新創公司 Accelsius 開發了一種叫「兩相冷卻」(two-phase cooling,意思是冷卻液會在管路中蒸發又凝結、反覆變換氣態與液態,比單純的液態冷卻散熱效率更高)的技術,原理類似冰箱或冷氣機裡的循環方式。由於水溫愈高,愈不需要額外耗電去把水降溫,這項技術能讓資料中心使用更高溫的循環水,等於用更少電力就能維持伺服器不過熱,對於因為 AI 熱潮而電費暴增的資料中心業者是一大誘因。
Accelsius 拿一臺 Dell PowerEdge XE9680L 伺服器(現有 AI 伺服器機型)改裝實測,把原本的單相冷卻液換成 NeuCool 兩相冷卻液後,直接接觸晶片的冷板(cold plate,貼在 GPU 上直接導熱的金屬板)溫度下降了攝氏 19 度,整個系統層級的溫度也下降了 9 到 14 度。傳統做法下機房水溫必須壓在攝氏 45 度以下才夠冷卻伺服器,用了這個技術後可以把水溫上限拉高到 54 度、甚至在加倍水流量時到 59 度,代表資料中心可以少開一些耗電的冰水機組。不過目前這技術還沒普及:需要搭配客製化冷板和專用的冷卻分配設備,且目前最大的設備只能支援 250kW 機櫃的規模,加上戴爾、HPE 這些伺服器大廠都還沒正式官方支援,所以短期內還不會是資料中心的標準配備,比較像是提前佈局降低未來 AI 電費壓力的解法。
這是一個叫 scrapemychats 的開源(原始碼公開、任何人可免費使用修改)小工具,專門解決一個實際痛點:ChatGPT 的企業版(Business)和團隊版(Team)帳號沒有「匯出資料」按鈕,一旦公司取消訂閱或關閉工作區,員工就永遠拿不回自己的對話紀錄了,個人版帳號才有一鍵匯出功能。這個工具會在你自己的電腦上開一個真正的 Chrome 瀏覽器視窗,用你目前登入 ChatGPT 的帳號狀態,把每一段對話的文字和附加檔案都抓下來存到本機,過程中資料不會傳到任何第三方伺服器,只會跟 ChatGPT 官方網站本身互動。抓完之後它還會自動做出一個離線的搜尋介面(一個網頁檔案,不用連網、不用安裝伺服器),左邊分類、中間列出對話、右邊顯示完整內容含表格圖片,可以整包存進隨身碟長期保存。工具不需要寫程式基礎,官方文件甚至教你怎麼請 AI 助理(像 ChatGPT 或 Claude Code)一步步帶你完成安裝和執行。
假設你在一家公司用 ChatGPT Business 帳號工作了兩年,累積了六百多則對話,公司現在決定不續約、下週就要關閉整個工作區。用舊方法你完全束手無策,因為 Business 帳號介面裡根本沒有匯出按鈕,離職或換公司後這些紀錄就永久遺失。改用 scrapemychats,你只要先跑一次三則對話的小測試(python export_chats.py --limit 3),確認能正常登入抓取後,再跑完整匯出指令,工具會自動放慢速度(每則對話間隔約10到20秒,避免被 ChatGPT 判定為異常流量而封鎖)並在背景跑幾個小時,過程中斷電或電腦睡眠也沒關係,重新執行同一指令會自動接續、不會重複抓取。跑完後執行 build_viewer.py 產生一個 viewer.html 網頁檔,雙擊打開就能像用搜尋引擎一樣,對六百則對話全文搜尋關鍵字,並瀏覽附件圖片與表格等內容,整個過程不需要公司IT或OpenAI官方協助。
OpenAI宣佈在美國喬治亞州埃芬漢郡(Effingham County)興建一座名為「Camellia計畫」的大型資料中心(就是專門放伺服器、訓練與運算AI模型用的大型機房),將向當地電力公司採購3.2GW(十億瓦,是很龐大的電力規模)的電力,分階段在2028到2032年間供應。OpenAI承諾這個計畫不會讓當地居民電費上漲、興建與用電成本全部由OpenAI自行負擔,且用水採取循環冷卻系統以降低耗水量。OpenAI也承諾提供8000萬美元的社區回饋金,用於當地學校、公共安全、醫療、職業訓練等用途,並另外提供最多7100萬美元的Codex(OpenAI推出的AI寫程式代理工具,內建在ChatGPT裡)使用額度給喬治亞州的大學生、社區學院生與技職生,每人可獲得價值100美元的額度用來練習用AI寫程式、做專案。
喬治亞州合格的大學、社區學院或技職學校學生,可透過自己的ChatGPT帳號領取100美元的Codex額度,用於延伸使用Codex、獲得agentic AI實作經驗、建立專案,以及培養工程、醫療、教育、製造業、創業或技術工種等職涯所需的實務技能。這筆額度等於OpenAI以建資料中心換取的社區回饋,直接轉化成當地學生可實際使用的AI工具資源。
OpenAI(推出ChatGPT的那家公司)這週開始讓所有API(應用程式介面,就是讓工程師寫程式直接呼叫AI模型、而不是打開網頁聊天視窗的管道)帳戶都能設定「硬性支出上限」。以前帳戶通常只能設定花費警示,超過額度頂多收到通知,程式還是會繼續呼叫、繼續扣錢;現在可以直接設一個金額上限,一旦用量花到這個數字,系統會直接停止回應新的請求,避免意外爆量繼續燒錢。這個功能背後反映一個趨勢:越來越多團隊在做高流量的AI寫程式工具或AI代理人(agent,就是能自己連續做很多步驟、呼叫多次AI模型來完成任務的自動化程式)應用,這些應用很容易因為程式迴圈或設計失誤而不斷重複呼叫API、瞬間燒光預算。OpenAI員工在多篇貼文中暗示,未來「模型路由」(model routing,就是自動依任務難易度分配便宜或昂貴的模型處理,藉此省錢)將不再是錦上添花的優化選項,而會變成大量使用API的團隊必備的基本功。
舉例來說,一間新創公司若開發了一個AI客服代理人,讓它自動回覆信件、查資料,這個代理人會頻繁呼叫API。過去沒有硬性上限時,程式萬一出現邏輯錯誤(例如重複發送請求),公司可能無法即時阻止開銷;如今能在OpenAI後臺設定每月API花費上限(例如500美元),一旦達到該金額,系統就會擋下後續所有請求,讓公司最多隻損失設定額度內的費用。
美國新創公司 Lunar Outpost 宣佈,他們下一臺月球探測車將採用 Nvidia 的 Jetson 晶片(一種體積小、省電,專門讓機器人就地處理感測器資料的晶片,不是拿來訓練大模型的那種)來控制車上的光達(一種用雷射掃描環境、建立立體地圖的感測器)系統。如果成功,這將是第一顆送上月球表面運作的 GPU(繪圖處理器,也是現在 AI 運算的主力硬體)。Nvidia 也另外和公司 Firefly Aerospace 合作,讓 Jetson 平臺裝在繞月衛星上處理影像。這些都屬於「physical AI(實體 AI,指讓 AI 直接控制機器人、無人載具等實體裝置做出反應的技術)」的應用,讓探測車能就地判斷環境、不必事事回傳地球等指令再行動。
Lunar Outpost 的探測車要在月球坑洞等難以從軌道觀測的地形裡移動,如果只靠地面遙控,訊號來回月球要花好幾秒,遇到障礙物反應不及。改用 Jetson 這類晶片後,車上就能直接跑「physical AI」判斷模型,感測器(光達)掃到障礙物或坑洞,晶片當場就近處理、決定轉向或煞車,不用等地球那邊的工程師下指令。他們正在拿 Jetson 跟原本專為太空飛行設計、抗輻射能力更成熟的飛行電腦做比較測試,評估在月球晝夜溫差劇烈、輻射強的環境下 Jetson 撐不撐得住,這是把消費級 AI 運算晶片第一次搬進地球軌道以外極端環境的實測案例。
最近有些AI新創公司營收成長速度驚人,看起來很風光,但這篇分析指出背後藏著隱憂。這些公司的做法多半是把大型AI模型的「推論」(inference,就是讓AI模型實際跑起來、回答問題或產生內容的運算過程)服務轉手賣給客戶,賺的是很低、甚至是負的毛利(也就是賣出去的價錢可能比自己付的成本還低)。問題在於,這些公司提供的產品或服務,並沒有在原本的AI智慧上面加值,等於只是把別人的運算能力包裝一下轉賣。儘管創投(VC,也就是投資新創公司換取股權的投資機構)對這種高速成長還是很興奮,願意砸錢,但這篇分析認為這種靠低價轉售撐起來的營收成長,商業模式本身並不永續。
具體來說,文中指出這些公司以極低甚至負的利潤率轉售推理服務,用虧損換取營收成長,但並未在AI能力上增加任何價值。這種商業模式一旦市場或資金環境收緊,將難以為繼。
特斯拉(Tesla)宣佈將在德國格林海德(Grünheide)超級工廠讓部分員工背上攝影機工作,記錄他們如何抓握工具、操作零件、完成組裝步驟,把這些動作資料拿去訓練人形機器人Optimus,這種做法叫「模仿學習」(讓AI直接觀察人類示範動作、學著複製出一樣的操作方式,而不是靠工程師寫死每個動作)。特斯拉在美國工廠已有專門的「資料收集操作員」在做類似的動作示範工作,這次是把這套方法搬到德國。目前工會尚未被諮詢此計畫,德國勞動法規定監控員工行為表現的技術系統可能需要經過工會共同決定程序,特斯拉對此未回應媒體詢問。特斯拉另在德國羅伊特林根(Reutlingen)建置感測器、齒輪箱、致動器等零組件的研發與量產基地,顯示格林海德負責提供訓練資料、羅伊特林根負責未來量產機器人本體的分工雛形,但Optimus距離真正量產仍不明朗,目前僅在美國費利蒙的先導產線小量製造。
假設特斯拉要讓Optimus學會「把一顆螺絲鎖進特定角度的孔位」這種精細動作,傳統做法是工程師手動寫程式設定機械手臂的座標與力道參數,遇到零件角度稍有不同就容易出錯,得重新調校。現在的做法改成:讓工廠裡真的每天鎖這顆螺絲的員工背著攝影機工作,AI從大量錄下的真實鎖螺絲影片中,學習員工手腕轉動的角度、施力的節奏、抓取螺絲起子的姿勢,之後Optimus遇到類似情境就能模仿出接近人類熟練工的操作方式,而不需要工程師針對每個零件手動編寫全新的動作程式。差別在於:傳統方法是「人設計規則給機器follow」,這種方法是「機器直接從人的示範中自己歸納規則」,理論上更能適應現場零件擺放角度、光線等微小變化。
這篇文章主要在講資料工程(處理公司內部資料流程的技術)裡一個常被忽略的環節:補回歷史資料(backfilling,就是把系統上線前就存在、但還沒被收進資料庫的舊資料,事後補進去)。作者任職的投資研究公司Opto主張,補歷史資料不該另外寫一次性的臨時程式,而應該和平常處理新資料用同一套流程,只用一個設定開關切換「只處理新資料」「全部重跑」或「重跑單一筆資料」三種模式,這樣比較不容易出錯、也比較好維護。文章後半段提到一個和AI有關的實際做法:他們使用MotherDuck MCP伺服器(MCP是一種讓AI程式能直接讀寫外部資料庫或工具的連接協定)分析資料表,只要打字用白話問AI「幫我分析這張表」,AI就能自動抓出資料裡有多少缺漏值、重複值、時間邏輯是否有異常,並生成一份評分報告,省下工程師人工檢查的時間。
文章舉的實例是:他們有一張存放美國證券交易委員會(SEC)投資顧問公司登記資料的表,總共180萬筆、橫跨26年歷史。過去要檢查這張表有沒有資料品質問題(例如同一家公司的資料出現時間上的空隙、有沒有重複列、空值比例多高),得靠工程師手動寫查詢語句一項項核對,很花時間。現在他們直接對MotherDuck MCP伺服器打一句白話指令:「用MCP伺服器看一下我資料庫裡的form_adv_firm_ownership這張表,幫我分析」,AI就自動抓出關鍵發現,例如「48%的欄位是空值」「有8137筆記錄出現時間空隙,其中82%是因為當事人真的換過名字或角色、18%像是SEC申報本身漏報」,還附上一張A到B-的品質評分表,整個過程只花幾分鐘,而不是工程師手動跑一輪分析的時間。
這篇教學介紹一個開源專案,教你用 AI 幫忙盯著資料庫的「資料表結構」(schema,就是表格裡有哪些欄位、欄位叫什麼名字)有沒有被偷偷改掉。在企業的資料系統裡,只要有人改了一個欄位名稱或刪掉一張表,後面所有依賴這份資料的分析、報表都可能壞掉,這種狀況叫「schema drift(結構飄移)」,是資料工程師最頭痛的問題之一。這個專案結合 Iceberg(一種存放大量資料表的開源格式)、Lakekeeper(負責管理這些資料表目錄的服務)和 Anthropic 的 AI 模型(就是 Claude 背後那家公司的 AI),一旦資料表結構有變動,系統會在幾秒內自動用 AI 分析這次改動的影響有多嚴重,並把結果和建議傳到 Slack 群組通知團隊,不需要人工去翻查整個資料庫。
假設資料工程團隊維護一個銷售資料表 sales.orders,某天有人下了一個 DROP TABLE 指令把這張表刪掉,或是把 customers 表裡的 email 欄位改名成 contact_email。傳統做法是等到下游的報表跑出錯誤、或分析師發現數字不對勁,才回頭追查是哪個改動造成的,往往已經延誤好幾小時。用這個 AI Schema Analyzer,Lakekeeper 偵測到這個 DDL(資料庫結構變更指令)的當下就會把事件送進 Kafka 訊息佇列,一個 FastAPI 服務立刻抓到這個事件丟給 Anthropic 的 AI 模型判斷:這次改動嚴重程度是「info(僅供參考)」、「low(低風險)」還是「critical(危急)」,例如改欄位名稱會被判定為中高風險、刪除整張表會被判定為危急,AI 會在幾秒內把判斷結果和建議動作直接發到 Slack,工程師手機一響就知道要處理,不用等到系統掛掉才知道。
北京趨境科技是一家專門幫企業做「AI 推理」(就是讓已經訓練好的大模型實際回答問題、生成內容的運算過程,跟訓練模型不同,推理是模型上線後每天被使用的階段)的公司,團隊源自清華大學,也是開源專案 KTransformers 和 Mooncake(都是用來加速大模型推理效率的技術工具)的原始開發團隊。這次趨境科技與杭州蕭山區簽約,把「華東區域總部」設在錢江世紀城,計畫五年內建成「萬卡級」(用上萬張 AI 運算晶片組成的叢集)的 AI Token 工廠,Token 是大模型處理文字的最小單位,可以把「AI Token 工廠」理解成專門大量生產 AI 回答內容的處理中心。公司表示自 2026 年初以來,靠著模型調校、KV Cache(一種讓 AI 不用每次都重新計算、可以記住先前運算結果來加速回答的技術)管理優化等工程手段,單臺設備的生產效率提升了 3 倍以上,總產能成長超過 30 倍。這則新聞本質上偏向企業投資設點的公告,技術含量有限,但揭露了部分推理優化的實際成效數字。
假設一家企業想幫自己的客服系統接入一個千億參數規模的大模型,直接硬體堆疊(買更多晶片)成本很高、效率也未必好。趨境科技的做法是不單純擴充硬體規模,而是針對「模型怎麼被調用」「先前算過的資料怎麼被重複利用(KV Cache 管理)」「儲存與網路怎麼協同」等環節做工程優化,號稱藉此讓同一批硬體設備的 AI 內容產出量在數月內提升 30 倍以上,其中服務某個「兆級參數」大模型的專案,做到平均每天穩定產出兆量級的 Token。對比傳統做法「效能不夠就加買硬體」,這種靠軟體與工程優化榨出效能的路線,理論上能讓企業用同樣預算撐起更大量的 AI 服務需求,但實際效果仍需以趨境科技自家披露的數字為準,缺乏第三方驗證。
上海人工智慧實驗室主辦了一個叫「KernelSwift算子創新大賽」的技術競賽,算子(就是AI模型運算時最底層的計算單元,例如矩陣乘法、注意力機制這類重複執行的小運算)優化的意思是想辦法讓這些底層計算跑得更快、更省資源。國產晶片公司太初(杭州)集成電路有限公司(品牌名「太初元碁」)作為合作夥伴,推出了一個專門賽道,主題是AI4S(AI for Science,也就是用AI幫忙做科學研究,例如生物、化學這類領域的計算)跟新型模型架構的算子優化。比賽圍繞一個叫OneGenomeRice的水稻基因組AI模型,要求選手優化兩個特定算子並整合進太初自家的Teco-vLLM推理框架(vLLM是一種讓AI模型回答問題更快的推理加速工具)。整體獎金池達18萬人民幣,報名到8月21日截止。
假設你是一位懂GPU底層優化的工程師,想練手並拿獎金:這次比賽要求你針對水稻基因組AI模型OneGenomeRice,優化reshape_and_cache_flash和flash_attn_varlen_func這兩個算子的執行效能,並讓它們能接入太初自家的Teco-vLLM推理框架在國產AI加速卡上跑。跟一般刷題型競賽不同,這是要在真實的國產硬體生態(河南空港智算中心)上做工程落地,完成賽題的隊伍除了現金獎勵(單隊最高3萬元),還能拿到價值1000元、透過太初元碁TecoAPI平臺發放的Token額度,可以直接拿去呼叫AI模型做其他實驗,相當於用比賽成果換取後續研究的運算資源。