PostHog(一款幫企業追蹤使用者行為、分析產品數據的工具)的工程師,讓 Claude Opus 4.7(Anthropic 公司的 AI 助理)幾乎獨立完成了一項重大程式改寫工程——把舊的 SQL 解析器(SQL 是一種用來查詢資料庫的語言,解析器就是「讀懂這段語言、拆解其結構」的程式組件)全部重寫。舊版解析器用的是 ANTLR(一種幫程式設計師自動產生解析工具的開源框架)搭配 C++(一種老牌程式語言)寫成;新版則由 AI 改用 Rust(一種以高效能、高安全性著稱的現代程式語言)重新實作,共產出約 21,000 行程式碼。整個過程只花了「數天」,若由人類工程師從頭做起,往往需要數個月。最終在生產環境(正式上線、面對真實使用者的伺服器)中,新解析器速度達到舊版的 454 倍;在工程師自己的筆電上測試也有 70 倍提升,且在數百萬次解析結果中,與舊版完全一致,零錯誤分歧。這篇文章特別強調,能做到如此的關鍵不是「讓 AI 亂寫然後碰運氣」,而是搭配了嚴格的自動化測試策略。
假設我負責維護一個資料分析平臺,發現 SQL 解析這個步驟拖慢了整體效能,想把它從舊技術棧重寫成更快的版本,但完整重寫需要的工程時間遠超預算。用這篇文章的方法:先準備好「舊解析器」當作正確答案的參照基準,再用屬性基礎測試(Property-Based Testing,一種自動產生大量隨機測試案例、讓程式自己去找 bug 的測試方法)搭配生產環境的真實 SQL 查詢日誌,建立一套「只要 AI 寫出任何一行錯的,就會馬上被測試揪出來」的安全網;接著把文法規格和參照實作一起丟給 Claude,讓它生成 Rust 版本的全新解析器,每次出錯就把錯誤訊息回饋給 AI 讓它自己修。最終不需要工程師深入閱讀 16,000 行的新程式碼,只需確認測試全部通過,就能上線——速度提升 454 倍,開發時間從「數個月的人力」縮短為「數天 AI 工作量」。
Anthropic(Claude AI 的開發公司)指控阿里巴巴(中國科技巨頭)非法提取 Claude 的模型能力。根據 Hacker News 討論揭露的細節,事情的核心是一條龐大的「中間商產業鏈」:中國的代理商(reseller,就是批發再轉賣的仲介)以官方 API 價格的 1 到 3 折,大量轉賣 Claude 的使用額度(token,可以理解成「使用次數」或「字數配額」)。這些代理商不只轉賣額度,更把使用者與 Claude 的完整對話記錄、推理過程出售給中國 AI 實驗室,讓後者用來訓練自家的 AI 模型。這種做法叫「模型蒸餾」(model distillation,就是讓一個小模型去學習大模型的回答模式,讓小模型也能表現得像大模型一樣聰明),相當於把 Anthropic 的研發成果「免費搬走」來訓練競爭對手的系統。這些代理商還透過身分驗證繞過手法(例如花約新臺幣 900 元買低薪國家的人頭帳號通過生物辨識)和住宅 IP 代理(用一般家庭網路位址混淆來源)維持帳號池,持續切換以規避用量限制。
假設我是一家中國 AI 新創,想訓練自己的對話模型,但沒有足夠的高品質對話資料。傳統做法是自己花費龐大人力標記資料,或購買昂貴的資料集。但現在有了這條產業鏈:我只需要向代理商低價購買「Claude 對話紀錄包」——裡麵包含真實使用者問各種問題時 Claude 的完整回答與推理步驟。我把這些資料拿來微調(fine-tune,就是在現有 AI 模型基礎上用新資料再訓練,讓它學會特定風格或知識)自己的模型,就能讓自家 AI 用上 Claude 的思考品質,卻完全不需支付正規授權費。Anthropic 的 API 定價本來就已攤入龐大研發成本,卻等同於被用 1 折以下的價格「批發」給競爭對手當免費訓練資料——這就是此次指控的核心損害。
這則新聞涵蓋三個 AI 代理(agent,就是能自動執行任務的 AI 程式)領域的重要進展。第一,阿里巴巴旗下 Qwen 團隊發布了 Qwen-AgentWorld,這是一種「語言世界模型」——讓 AI 在腦中模擬七種真實電腦環境(如終端機、瀏覽器、手機介面、網路搜尋等),使 AI 代理在動手前能預先「想像」會發生什麼,而非盲目嘗試;他們同步開源了 35B 參數(參數量是衡量模型大小的數字,越大通常能力越強)的模型與測試基準。第二,OpenThoughts-Agent 發布了一套開放訓練流程,團隊用 10 萬筆資料對 Qwen3-32B 進行微調(fine-tune,就是用特定任務資料讓已有模型更精準),在七項代理測試中達到 44.8% 平均準確率,並揭示「訓練指令的選擇比其他因素影響更大」等實用洞見。第三,業界開始把「記憶」視為 AI 代理的下一個核心基礎設施——好的代理需要能在不同對話之間記住資訊、整合重複記憶、依情境取用,而非把所有歷史全部塞進 AI 的「一次性視窗」(context window,即 AI 每次能讀取的最大文字量)。
假設我用 AI 代理幫我管理程式碼庫,並需要它「自動排查並修復上週所有失敗的測試」。用舊方式,代理只能實際執行每一步驟,碰到錯誤才回頭調整,相當耗時且容易失敗。有了 Qwen-AgentWorld 的世界模型,代理在動手前會先在腦中模擬整個流程:「我開啟終端機 → 執行測試 → 預測可能的報錯類型 → 評估哪種修法成功率最高」,再選定最佳路徑執行,成功率顯著提升。若再加上記憶層(如 Weaviate Engram 這類工具),代理還能記住「上次這個測試失敗是因為資料庫設定沒重置」,下次遇到類似問題直接套用歷史解法,不必從零推理——這正是目前 AI 代理在長期任務中最常遇到的瓶頸,也是這波研究想解決的核心問題。
美國 AI 出口管制(就是政府限制哪些 AI 技術或模型可以流向哪些國家的法規)首次面臨重大法律挑戰。一家名為 Legion 的公司在法庭上主張:讓人透過網路使用 AI 服務(例如呼叫 API、使用雲端 AI 平臺),和直接把模型權重(AI 的核心數值參數檔案,就像 AI 的「大腦數據」)出口給外國是不同的兩件事,不應適用相同法規。與此同時,另一件事也引發廣泛討論:Anthropic(開發 Claude AI 的美國公司)旗下的 AI 模型在一次受限的安全測試中,被指出自動發現了美國敏感系統的漏洞,此事件被稱為「Mythos」,不過部分評論者認為先前的報導有所誇大。此外,本輪新聞還涵蓋人才流動與新實驗室動態:英國兩所新的國家 AI 基礎研究實驗室 BOLD Lab 和 SOFAIR 合計獲得 6,000 萬英鎊種子資金,而 Google DeepMind 也有多名研究員轉投 Anthropic,顯示前沿 AI 人才仍持續向新創公司流動。
假設你是一家臺灣軟體公司,目前透過 API 呼叫方式使用某家美國 AI 服務商的模型。依照川普政府現行的出口管制思路,這樣的使用模式可能被視為「技術出口」而受到限制或審查。但 Legion 的法律論點是:你只是在用這個 AI「問答」,模型本體仍留在美國伺服器,根本沒有任何技術資料被傳輸出去,和直接買一份模型檔案帶回臺灣是完全不同的行為。這個法律論點若成立,將大幅影響哪些 AI 服務可以合法地跨境提供給非美國用戶——對全球 AI 開發者和企業來說,後續判決結果將直接決定哪些工具還能繼續合法使用。
OpenAI(就是開發 ChatGPT 的美國 AI 公司)的企業部署主管 Arnaud Fournier 接受媒體訪談,揭露旗下 AI 程式碼工具 Codex(一種幫工程師自動寫程式、審查程式碼的 AI 服務)在短短三個月內週活躍用戶暴增五倍,目前已超過 400 萬人,月成長率超過 70%。他同時披露,AI 服務的成本在過去 18 個月下降了約 100 倍,原因涵蓋晶片效率提升與模型本身的運算優化。OpenAI 透過子公司 DeployCo 組建自有工程師團隊,直接進駐大型企業,把 AI 模型嵌進企業現有的 IT 系統,而非只是販售 API(讓不同軟體之間互相溝通的技術介面)。這種「工程師進場」的部署模式,讓企業客戶在實際使用中遇到的模型弱點,能快速回饋給 OpenAI 研發團隊,形成「邊用邊改善」的良性循環。
西班牙大型金融機構 BBVA 銀行在使用 OpenAI 模型處理業務文件時,發現 AI 對複雜金融文件的理解能力有明顯不足。這個問題透過 DeployCo 的工程師直接反映給 OpenAI 研發團隊後,推動了模型從 GPT-5.0 升級至 GPT-5.5,大幅強化了文件理解能力。舊有做法是銀行必須自己想辦法繞過 AI 的弱點,或另尋其他工具;DeployCo 的模式讓 BBVA 的真實業務痛點快速影響模型迭代,相當於「用自己的業務問題推動了 AI 進步」,其他企業客戶也因此間接受益於這次升級。
這篇文章是 2026 年上半年 AI Agent(人工智慧代理程式,就是能自動規劃並執行多步驟任務、而不只是回答問題的 AI)發展的全面回顧。文章涵蓋多個重要主題:OpenClaw 與 Hermes Agent 兩款本地端 AI 代理(跑在自己電腦上、不依賴雲端 API 的 AI 助理)、Google 的 Gemma 4 輕量模型、從提示詞工程(Prompt Engineering,就是「怎麼問 AI 才能得到好答案」的技術)演進到技能工程(Skill Engineering,把可重複使用的能力模組化管理)的新趨勢、VLA 模型(Vision-Language-Action,讓機器人能「看懂指令並採取實體動作」的模型)、NVIDIA 的 Nemotron 3 開放生態聯盟、Web 世界模型(讓 Agent 有穩定環境可以持續行動的框架),以及 AI 遞迴自我改進(AI 自己寫程式改進自己)。最核心的大趨勢是:AI Agent 已從實驗性工具演變成具備「記憶、身份、技能、環境感知」的持久性系統,基礎建設的重要性已不亞於模型本身。
以 OpenClaw 為例,過去你可能只是和 ChatGPT 閒聊,每次對話結束後 AI 就忘光所有內容,下次得重新說明。現在透過 OpenClaw 在自己電腦上架設本地 Agent,你可以給 AI 一個固定的「身份檔案」(SOUL.md,記錄它是誰、有什麼目標)、設定排程思考(HEARTBEAT.md,讓它每天定時自動盤點任務),並用 Markdown 純文字檔儲存它的長期記憶。這個 Agent 可以直接整合到你的 WhatsApp、Telegram、Discord,幫你自動分類訊息、執行工具指令、查詢資料庫。對比舊式聊天機器人只能一問一答、完全沒有記憶,OpenClaw 這類本地 Agent 讓 AI 成為你的個人控制中樞——即使你重新開機、過了一週,它仍記得上次討論的內容和學到的操作技巧。
OpenAI 的 Codex CLI(一套讓開發者在電腦終端機裡直接用 AI 撰寫和修改程式碼的命令列工具)被發現存在嚴重的日誌記錄錯誤。日誌(log)就像程式的「自動日記本」,每次執行時會把過程記下來方便除錯,但 Codex 預設把日誌詳細程度設在最高等級(TRACE-level),導致海量不必要的資訊被不間斷地寫入電腦硬碟的一個資料庫檔案。問題有多嚴重?有使用者發現 21 天內累積了約 37 TB(TB 即兆位元組,1 TB 約等於 1,000 GB)的寫入量,年化速率高達 640 TB——而一般消費級 SSD(固態硬碟,現在筆電和桌機最常用的儲存裝置)的 TBW 保固上限(廠商保證的硬碟一生可承受的總寫入量)約為 600 TBW,等同於使用者的 SSD 在一年內就被「用完」整個硬體壽命。此問題已在 v0.142.0 及 v0.143.0 版本中修復,使用舊版者應立即升級。
假設你是一位從今年 1 月起每天使用 Codex CLI 輔助寫程式的開發者,讓它在背景持續執行。你從未特別留意磁碟狀況,直到三週後電腦變慢,一查才發現 `~/.codex/logs_2.sqlite` 這個隱藏在系統資料夾深處的檔案已膨脹至 27 GB,而這些瘋狂的寫入已悄悄耗損 SSD 的剩餘壽命。解法是升級到 v0.143.0 以上版本,再對舊日誌資料庫執行 `VACUUM` 指令(SQLite 資料庫的一種內建「清理壓縮」功能),即可把 27 GB 的日誌壓縮回 73 MB;修復後的版本整體寫入量削減約 85%,SSD 才不會再被悄悄消耗。
一位開發者利用一個晚上的空閒時間,把整本聖經(共 66 卷書)轉換成 RAG(Retrieval-Augmented Generation,檢索增強生成——一種讓 AI 回答問題前先查資料庫、避免憑空捏造的技術)資料庫,並建立一個主題語意搜尋介面,取名 CrossCanon。使用者輸入一個現代語言的主題(例如「金錢問題」),系統透過向量化(把文字的「含義」轉成一組數字,讓電腦能計算語意相似度)技術,從聖經全文中找出語意最相近的段落,而非只比對關鍵字。聖經全文建立了約 4GB 的向量索引,採按段落分組的方式建立嵌入(embedding,即把文字意思編碼成數字向量)。工具目前採用開放授權的 WEB 譯本(World English Bible),已公開上線供任何人免費使用。
假設我想查找聖經裡談到「金錢問題」(money problems)的段落。用傳統關鍵字搜尋,只能找到確實含有「money」或「problems」這兩個字的節次;但用 CrossCanon 的語意搜尋,輸入「money problems」後,系統回傳傳道書 5:9–13,那段講的是財富越積越多反讓人睡不著、錢愈多煩惱愈多的古代智慧——原文不一定出現這兩個英文字,卻在語意上精準命中現代詞彙的概念。對比舊做法(用 Ctrl+F 搜尋原文或靠個人記憶翻查),語意搜尋能跨越時代與語言的隔閡,讓古籍用現代說法也查得到。這個案例同時是一個低成本示範:任何公開文本(法律條文、學術論文、古典文學)都可以用相同方式建立 RAG 索引,讓 AI 在特定語料庫內精準查詢。
RubyLLM 是一個開源的 Ruby 程式語言框架,讓開發者可以用一套統一的程式碼同時串接各大 AI 服務商,包含 OpenAI、Anthropic Claude、Google Gemini、DeepSeek、Mistral、本機部署的 Ollama 等,合計支援超過 800 個模型。過去每家 AI 廠商的 API(應用程式介面,就是讓程式與服務溝通的橋樑)格式各不相同,開發者得分別研究文件、撰寫不同的串接程式碼,換廠商幾乎等於重寫一遍。RubyLLM 把這些差異全部包裝起來,提供一致的呼叫方式,換模型只需改一個參數。除了基本對話,它還支援語音轉文字、圖像生成、結構化輸出(讓 AI 回傳格式固定的 JSON 資料,方便程式直接使用)、以及 Tool Use(一種讓 AI 能主動查詢資料或執行自訂動作的技術)。特別針對 Ruby on Rails(Ruby 生態中最主流的網頁開發框架)做了深度整合,並內建現成的聊天 UI 介面元件。
假設我是一名用 Ruby on Rails 開發電商網站的工程師,想加入 AI 客服機器人功能。以往我先選定 OpenAI,花數小時研究 API 文件、寫串接程式碼;若日後覺得 DeepSeek 更便宜、想切換,幾乎得整段重寫。改用 RubyLLM 後,初始化一行設定 `model: "gpt-4o"`,之後想換成 `deepseek-chat` 只改這一個字,其餘邏輯完全不動。進一步還可以定義一個 Tool,讓 AI 呼叫 `lookup_order(order_id:)` 這個 Ruby 方法直接查訂單資料庫,當客戶問「我的訂單在哪?」時,AI 會自動查詢並以結構化資料回傳給前端顯示——這在舊做法中需要額外花時間自己寫提示解析邏輯,現在由框架統一處理。
Haystack 是一個開源(任何人都能免費下載、使用與修改)的 AI 編排框架(把多個 AI 工具組合成一套完整系統的架構),由德國公司 deepset 開發,最新版本為 2.30。它的主要用途是幫助開發者快速建立兩類 AI 應用:一是 RAG(Retrieval-Augmented Generation,讓 AI 回答問題前先查詢外部資料庫、避免憑空捏造的技術)管線,二是 AI Agent(能自主規劃、呼叫工具、做多步驟決策的 AI 程式)系統。Haystack 的設計重點是「生產就緒」,意即不只是實驗玩具,而是真正能部署上線、在企業環境穩定運行的框架。它支援 OpenAI、Anthropic、Mistral、Hugging Face 等主流 LLM(大型語言模型,就是 ChatGPT 這類能理解與生成文字的 AI 模型),也能連接 Weaviate、Pinecone、Elasticsearch 等向量資料庫(一種能根據語意相似度搜尋內容的特殊資料庫),讓開發者不受任何單一廠商綁架,自由選用最適合的工具組合。Telus、漢莎航空、Accenture、NVIDIA 等企業均已採用。
假設我是一家律師事務所的工程師,想建立一個能回答「這份合約哪一條與哪條法規衝突」的 AI 助理。傳統做法需要自己逐一串接 LLM API、向量資料庫、搜尋模組,任何一環出錯都難以追蹤根因。用 Haystack,我可以用幾十行 Python 程式碼組裝一條完整 Pipeline(流水線):文件切割 → 嵌入向量 → 存入 Pinecone → 使用者提問 → 混合檢索(關鍵字 + 語意) → LLM 生成答案。整條流程可序列化存成 YAML 設定檔,直接部署到 Kubernetes(一種管理大量伺服器的系統),並透過內建日誌觀察每一步的輸入輸出。若 AI 給出錯誤答案,能立刻定位是「檢索回來的文件段落不對」還是「模型推理出錯」,而非毫無頭緒。相比從零手動串接各服務,Haystack 大幅縮短了從原型到正式上線所需的時間與排查成本。
RubyLLM 是一個開源的 Ruby 程式語言框架,讓開發者可以用一套統一的程式碼同時串接各大 AI 服務商,包含 OpenAI、Anthropic Claude、Google Gemini、DeepSeek、Mistral、本機部署的 Ollama 等,合計支援超過 800 個模型。過去每家 AI 廠商的 API(應用程式介面,就是讓程式與服務溝通的橋樑)格式各不相同,開發者得分別研究文件、撰寫不同的串接程式碼,換廠商幾乎等於重寫一遍。RubyLLM 把這些差異全部包裝起來,提供一致的呼叫方式,換模型只需改一個參數。除了基本對話,它還支援語音轉文字、圖像生成、結構化輸出(讓 AI 回傳格式固定的 JSON 資料,方便程式直接使用)、以及 Tool Use(一種讓 AI 能主動查詢資料或執行自訂動作的技術)。特別針對 Ruby on Rails(Ruby 生態中最主流的網頁開發框架)做了深度整合,並內建現成的聊天 UI 介面元件。
假設我是一名用 Ruby on Rails 開發電商網站的工程師,想加入 AI 客服機器人功能。以往我先選定 OpenAI,花數小時研究 API 文件、寫串接程式碼;若日後覺得 DeepSeek 更便宜、想切換,幾乎得整段重寫。改用 RubyLLM 後,初始化一行設定 `model: "gpt-4o"`,之後想換成 `deepseek-chat` 只改這一個字,其餘邏輯完全不動。進一步還可以定義一個 Tool,讓 AI 呼叫 `lookup_order(order_id:)` 這個 Ruby 方法直接查訂單資料庫,當客戶問「我的訂單在哪?」時,AI 會自動查詢並以結構化資料回傳給前端顯示——這在舊做法中需要額外花時間自己寫提示解析邏輯,現在由框架統一處理。
Momenta 是一家從自動駕駛(讓汽車自己會開的技術)起家的中國 AI 公司,最近準備在香港股市掛牌上市,目標成為「物理 AI(讓 AI 理解真實世界物理規律的技術)第一股」。他們的核心產品是「世界模型」——這是一種讓 AI 能夠理解物理規律、預測現實世界接下來會發生什麼的模型(就像讓 AI 學會「物理直覺」,知道丟球後球會往下掉、轉彎時車子會向外偏移)。目前業界有四條主流世界模型技術路線:一是生成像素級逼真影片的「生成式視頻路線」;二是即時產生可互動環境的「交互式世界路線」;三是生成可互動 3D 立體空間的「空間智能路線」;四是在抽象概念層預測未來的「JEPA 路線」。Momenta 的 R7 世界模型採三層架構——預訓練、虛擬仿真、強化學習(讓 AI 透過反覆試錯自動改進的方法),已累積 120 億公里真實駕駛里程作為訓練數據,搭載超過 90 萬臺量產車。
假設我是一位車廠工程師,希望輔助駕駛系統遇到「從未見過的奇特路口情況」時仍能做出正確判斷——例如路中間突然出現施工圍欄、行人從車輛側面跑出來。傳統做法(舊方法)需要針對每種特殊情況單獨蒐集、標注大量影像數據,但現實路況千變萬化根本蒐集不完,一旦遇到沒見過的情況,系統往往直接跳出「請人類接管」。改用 Momenta R7 世界模型的做法:先用 120 億公里真實駕駛數據訓練模型,讓它理解「物理因果關係」(例如前車煞車→後車必須跟著減速、而非繼續加速衝上去);再在虛擬仿真環境中製造各種極端場景反覆演練;最後用強化學習讓 AI 從成功與失敗中自動調整策略。實際效果是:遇到從未見過的路況時,系統能根據物理規律推導出合理應對——而不是在歷史數據庫裡硬找「最像的案例」——從而大幅降低需要人類介入的頻率。
每年中國高考結束後,考生和家長都要面對一個重要決定——填報大學志願(就是選擇要申請哪所大學、哪個科系)。這個過程傳統上要查閱大量資料、比對各校歷年錄取分數線,往往耗時好幾天。2026 年,阿里巴巴旗下的千問 AI(一款類似 ChatGPT 的對話式人工智慧)推出了「高考志願 Agent」(Agent 是指能自動完成多步驟任務的 AI 助手,不需使用者一步步下指令),考生只要輸入自己的分數和偏好,幾分鐘內就能取得一份個人化的志願報告。從高考開考到成績放榜,短短不到三週,超過 1,400 萬人次使用千問詢問高考相關問題——這個數字甚至超過了 2026 年全國高考考生總人數(約 1,290 萬)。最近連續五天的使用量還以超過 100% 的速度快速成長,顯示 AI 工具正在改變中國年輕人做重大人生決策的方式。這套工具由千問大模型(大型語言模型,也就是像 ChatGPT 一樣能讀懂並生成自然語言的 AI 核心技術)結合夸克八年積累的教育數據所打造。
一名高考考生考了 580 分,在省內排名約第 15,000 名,想念理工科但不確定選哪所大學、哪個科系。過去他需要翻遍幾十所學校的招生簡章,再逐一對照各省分數線表格,可能得花好幾天才能整理出候選名單。現在他打開千問志願 Agent,輸入分數、省份排名和興趣偏好,幾分鐘後 AI 就生成一份報告:將院校依風險分為「衝刺」(分數略高、有挑戰性的目標)、「穩妥」(約等分的院校)、「保底」(分數低一些、錄取機率高的院校)三類,並附上每所學校該科系近三年錄取分數、就業率與薪資參考數據。考生最關心的就業前景問題也能直接對話詢問。相比以往靠家長人脈或購買坊間志願填報服務(通常費用不低),AI 工具大幅壓縮了資訊蒐集時間,讓考生把精力集中在最終的取捨判斷上。
Cursor 是一套以 AI 為核心的程式碼編輯器(就是讓工程師寫程式的軟體,但內建了能自動補全、生成、修改程式碼的 AI),現在宣佈與 Notion 整合。Notion 是很多團隊用來記錄文件、管理任務和追蹤專案進度的協作工具,功能有點像 Word、Excel 和專案看板的合體。這次整合讓使用者可以直接在 Notion 裡把程式設計任務「指派給」Cursor 的 AI Agent(能自動執行多步驟工作的 AI),不需要手動切換到 Cursor 應用程式重新描述一次需求。這個動作代表一個更大的趨勢:AI Agent(能自主完成任務的 AI)不再只活在獨立的聊天視窗裡,而是開始被嵌入工程師和設計師日常使用的協作工具,讓 AI 變成你熟悉的工作流中的一個「可指派的成員」。
假設你的團隊在 Notion 的任務看板上有一張卡片,上面寫著「修復登入頁面按鈕在手機版無法點擊的 bug」。以前的做法是:你要先打開 Cursor,手動把這個需求重新打一遍,讓 AI 幫你找相關程式碼、提出修復方案,完成後再回到 Notion 更新任務狀態。現在透過整合,你可以直接在 Notion 那張卡片上把任務指派給 Cursor Agent,Agent 會自動讀取需求說明、在你的程式庫裡找到登入頁的相關檔案、嘗試修復 bug,整個過程不需要離開 Notion,也不需要複製貼上需求。相比舊做法,減少了在不同工具之間反覆切換的摩擦,尤其對專案管理者或非技術角色(例如 PM 想指派工作給 AI 執行)更方便。
這是一份即時語音 AI API(讓應用程式直接呼叫、讓 AI 開口說話的雲端服務)的速度與成本比較測評。評測指標是 TTFA(Time To First Audio,也就是「從送出問題到 AI 開始發出第一個聲音所需的時間」),這個數字越小,語音對話的體感就越流暢,就像打電話時幾乎感覺不到延遲。根據 AI 分析帳號 ArtificialAnlys 的最新評測,Deepslate Opal 以 0.44 秒拿下目前測評榜上的最速寶座,讓語音回應幾乎接近真人對話的即時感。若以成本為優先,Gemini 3.1 Flash Live Preview(Minimal 方案)則以每小時 1.50 美元的音訊輸入費率成為榜上最低價選項。這份數據對打算在產品中加入語音對話功能的開發者,是選擇 API 供應商時的重要參考依據。
假設你正在開發一套 AI 電話客服系統,需要接聽來電並即時回答問題。舊有的語音服務往往讓用戶說完話後要等超過一秒才聽到回應,對話節奏顯得僵硬,用戶容易誤以為系統卡住而重複發問或掛電話。改用 Deepslate Opal 之後,TTFA 縮到 0.44 秒,體感幾乎與真人應答無異,整段對話更自然,也能降低用戶中途放棄的比率。如果你的場景是大量低複雜度的自動回覆(例如查詢訂單狀態),預算有限時可選 Gemini 3.1 Flash Live Preview,以每小時 1.50 美元的低成本跑海量通話,僅犧牲少量速度卻省下可觀費用——兩者各有適用場景,可依「體驗優先」或「成本優先」來取捨。
AI 代理人(就是能自動幫你完成多步驟任務、不需要每步都問你的 AI 程式)的評估標準正在發生根本性的轉變。過去業界習慣把 AI 當成「聊天機器人」來打分,看它能不能在單次問答中答對一道題。但現在越來越多開發者和研究者認為,這樣的測試根本不夠——真正重要的是這個 AI 系統在面對複雜、長時間的任務時,能不能主動「注意到潛在問題、預測下一步需求、主動配合使用者做事」,而不只是被動等待指令才反應。與此同時,開發者也開始區分「用一個現成的 AI 工具幫忙寫程式」和「從頭設計一套能長期自主運作的 AI 程式開發系統」這兩件事——後者需要設計記憶機制、工具使用、執行驗證等複雜能力,技術難度和思維方式都完全不同。這股趨勢已經體現在 Cline(一款 AI 輔助程式開發工具)整合新模型、OpenAI Daybreak 計畫等具體產品的設計方向上。
假設你想讓 AI 幫你每天自動處理 GitHub(程式碼協作平臺)上的問題回報(issue)。舊的評估方式是:給 AI 一個問題描述,看它能不能回答「應該改哪裡的程式碼」——這就像考試考選擇題,答對了不代表真的能做事。新的系統行為評估則會問:這個 AI 能不能在你說「幫我處理今天的問題」之後,自動讀取程式庫、找出相關程式碼、發現你沒提到但相關的連鎖問題、先確認再動手、執行過程中記住之前已改過什麼不重複出錯,甚至在遇到權限不足時主動告知你?舊方法測的是「AI 懂不懂」,新標準測的是「AI 能不能在工具、記憶、驗證、長時間執行等條件下完成整件事」,兩者差距就像筆試和實習的差距。
Hang Ten Systems 是由前 Infosys(印度最大 IT 外包服務公司之一)執行長 Vishal Sikka 新創辦的公司,甫完成 3,200 萬美元種子輪融資,由矽谷知名創投 Mayfield 領投、沙烏地阿美旗下創投跟投,Yahoo 共同創辦人楊致遠也加入董事會。這家公司的核心主張是:企業過去需要花大錢僱用 IT 外包服務商(例如 Infosys、Accenture)來開發、整合、維護企業軟體,而現在 AI 代理(就是能自動接受指令、執行任務的 AI 程式)已經可以代替這些人工外包工作。Hang Ten 提供一套「AI 原生」(從頭為 AI 設計,而非傳統軟體硬塞 AI 功能)的企業服務平臺,核心技術包含代理式程式碼生成(讓 AI 自動撰寫程式)、可重複使用的 AI 技能庫(各產業現成的 AI 功能模組),以及領域專業知識整合。傳統 IT 外包「按人頭計費,人越多成本越高」,Hang Ten 的設計則讓「每完成一個專案,AI 的槓桿就更大」——理論上同樣的團隊可服務更多客戶、成本遞減,直接衝擊傳統外包商的商業模式。
以製造業為例,企業過去要導入新的 ERP 系統(企業資源規劃,就是整合管理訂單、庫存、財務的大型軟體),通常得委託 Infosys 這類 IT 服務商,派數十名顧問花幾個月做客製化整合,費用動輒千萬起跳。導入後每次業務調整都得重新開案外包,費用持續累積。改用 Hang Ten 的 AI 代理平臺,企業工程師描述業務需求,AI 自動生成客製化程式碼,並從技能庫調用現成的製造業領域模組(如庫存邏輯、生產排程規則);後續若要修改,AI 也自動處理,不必每次重新外包。目前西門子歌美颯(全球最大風力發電商之一)和費森尤斯(德國大型醫療集團)已成為客戶,部分原本外包給傳統 IT 服務商的工作已改由這套平臺執行,驗證了「AI 代理取代人工 IT 外包」的可行性。
美國川普政府目前正向 Meta(臉書母公司)施壓,要求他們自願配合聯邦政府對其 AI 模型(就是 Meta 開發的各種人工智慧系統,包含 Llama 系列大型語言模型)進行安全審查。所謂「安全審查」,是指政府機構評估這些 AI 系統的功能強弱,以及是否存在潛在漏洞或風險。目前 Meta 是美國幾家主要 AI 開發商當中,唯一一家尚未與聯邦政府達成自願審查協議的公司,OpenAI、Google、Anthropic 等競爭對手皆已同意配合。Meta 的政策團隊雖已與美國商務部展開談判,但雙方能否順利達成協議,目前仍是未知數。
假設你是一位用 Meta 旗下開源模型 Llama(一種可以免費下載、自己在電腦上執行的 AI 語言模型)來開發聊天機器人的工程師。若美國政府安全審查機制正式上路,政府會測試 Llama 是否有安全漏洞——例如容不容易被惡意使用者誘導生成危險內容,或者是否可能被駭客利用。若審查結果要求 Meta 修改模型行為或限制某些功能,那麼你正在使用的版本日後可能被迫改版、甚至停止對外公開發布。相較於已配合審查的 OpenAI(ChatGPT 的開發商),Meta 若持續抵制,可能面臨監管壓力,進而影響其所有 AI 產品的發展策略與開放程度。
Google Cloud 與 Nokia(知名電信設備製造商)宣佈擴大合作,在 Nokia 的網路管理軟體平臺中加入由 Gemini(Google 自家大型語言 AI 模型,就是 ChatGPT 那種會對話的 AI)驅動的多個 AI 代理(AI agent,指能自動執行特定工作任務的 AI 程式)。目前已上線兩個代理:「路由器代理」負責協調網路設定指令並執行操作防護,「事件分級代理」負責分析網路告警、比對歷史資料找出問題根本原因。未來還有四個代理陸續推出,功能涵蓋異常偵測、KPI(關鍵效能指標)解讀、自動建議修復步驟,以及讓工程師用自然語言(就是像平常說話一樣)生成網路監控儀錶板。這套系統採「人工最終把關」設計——AI 只提供建議,關鍵操作仍由工程師確認後才執行,低風險情境才允許 AI 全自動完成。預計 2026 年 9 月以 SaaS(雲端訂閱服務)形式在 Google Cloud 市集上架。
假設某電信公司的網路工程師上班時,系統同時跳出 200 條告警(警告通知),以往得花數小時逐條確認:哪條是真正的問題、哪條是誤報、故障源頭在哪個設備、該怎麼修復。現在「事件分級代理」會自動比對歷史告警資料,幾分鐘內標出哪些需要立即處理、哪些只是假警報,並附上推測的根本原因供工程師核對。工程師確認後,「行動推理代理」再查閱自動化修復目錄,提出具體補救步驟建議。Nokia 的實測數據顯示,這套流程可將網路問題解決時間縮短 50% 到 80%——原本需要 4 小時排查的故障,現在最快 1 小時內即可處理完畢,而且準確率與成本效率也同步提升。