Cognee 是一個開源的 AI 記憶管理平臺,專門解決 AI Agent(AI 助手程式)最常見的痛點:每次對話結束後,AI 就完全忘記之前講過的事。傳統解法是用 RAG(Retrieval-Augmented Generation,讓 AI 回答前先去查資料庫撈相關文字片段,避免憑空捏造),但這種方式在需要「跨多份文件串連事實」的複雜問題上表現很差——因為答案散落在不同文件,光靠字詞相似度找不到關聯。Cognee 改用知識圖譜(Knowledge Graph,把資訊存成「人物 A → 任職於 → 公司 B」這種節點加連線的結構,而非一大段文字),讓 AI 能沿著關係連線一步步追蹤,解答需要多次跳躍的複雜問題。整套系統支援本機免費自建(只需 pip install,底層用 SQLite + LanceDB + Kuzu 等免費工具,不需額外伺服器),也能升級到企業級資料庫(PostgreSQL、Neo4j),目前已有 70 家以上企業實際使用,並成為 Claude Code 的官方記憶插件。
情境:我在開發企業內部知識助理,讓員工可以問「A 部門去年 Q3 提案的負責人,他現在還在公司嗎?他最近負責哪個新專案?」這種需要跨多份文件、串連人員異動記錄與專案分配表的問題。舊做法(傳統 RAG):把所有文件切成小段,問問題時用語意相似度撈最像的幾段,但「A 部門 Q3 提案負責人」和「他現在的新專案」分散在兩份不同文件,語意相似度無法自動串聯,AI 往往回答「找不到相關資訊」或亂猜一個。換用 Cognee 的流程:安裝後把所有文件(PDF、DOCX、會議記錄等)餵進去;cognee.cognify() 會自動呼叫 AI 從文字中抽取人名、職位、專案、部門等實體,建成一張關係圖。查詢時用 GRAPH_COMPLETION 模式,系統先找到「A 部門 Q3 提案」節點,沿連線找到「負責人王小明」,再往下查到「王小明目前職位:在職、最新專案:B 系統重構」,最終整合成完整回答。具體差異:Cognee 官方測試在需要多跳推理的題組中,正確率從競品的約 54% 提升至調優後的 85%(需注意此為自家測試,競品使用預設值而 Cognee 用調優參數,結果應審慎評估)。最大代價是攝入成本:cognify 每份文件需多次呼叫 AI API,費用比傳統 RAG 高出約 3–5 倍,適合有明確多跳推理需求的場景優先試用。
Garry Tan 是 Y Combinator(全球最知名的新創加速器,曾孵化 Airbnb、Dropbox、Stripe 等公司)的執行長。他在 2026 年 3 月把自己使用 Claude Code(Anthropic 推出的 AI 程式設計助理工具)的整套工作配置整理成一個叫做 gstack 的開源專案並免費公開,短短幾個月就在 GitHub(全球最大的程式碼共享平臺)上累積了 11 萬 3 千顆星星(這是評估開源專案受歡迎程度的主要指標),首週就突破 3 萬 3 千星,速度驚人。gstack 包含 23 個斜線指令(就是在對話框輸入「/」開頭的快捷指令),把 Claude Code 變成一個模擬完整工程團隊的系統,裡面有 CEO、設計師、工程主管、QA(品質保證)負責人、資安長等七個虛擬角色各司其職,每個角色都有對應的工作流程。整套工具以 Markdown(一種極輕量的純文字排版格式)撰寫,採用 MIT 授權完全免費,只需一行指令就能在 30 秒內完成安裝,還能自動偵測並整合 Cursor、Codex CLI 等 10 種主流 AI 開發工具。
我要為自家 Web 服務推出新功能,需要確保瀏覽器端操作沒問題,同時也要通過基本資安審查。以往的做法是:分別找人或自己另外架設 Playwright(一套瀏覽器自動化測試框架)測試環境、逐一對照 OWASP Top 10(網路應用資安組織整理的十大常見漏洞清單)手動審查,再加上部署後要另外設定監控,三件事分屬三套工具,切換成本很高。用 gstack 之後,整個流程都在 Claude Code 裡完成:輸入 `/qa`,它就自動啟動 Chromium(Google Chrome 底層使用的瀏覽器引擎)跑完整的真實瀏覽器測試,並自動產出可重複執行的迴歸測試腳本;輸入 `/cso`,Claude Code 就按照 OWASP Top 10 加上 STRIDE(微軟提出的系統化威脅分析方法)清單掃一遍,附帶 17 條誤報排除規則,省去手動過濾假警報的功夫;輸入 `/canary`,部署後有自動監控迴圈持續確認服務是否健康。整個從「想到要測」到「看完報告」的流程,不需要切換到其他工具、不需要自己搭建測試基礎設施,一個人就能跑完以前需要整個團隊分工的流程。
這篇來自 arXiv(學術論文預發布平臺)的研究論文,由研究者 Martin Monperrus 撰寫,主張「程式碼審查」(就是工程師在正式發布新程式碼前,讓同事逐行檢查、找出潛在問題的過程——在業界已沿用超過五十年)已不再需要人類參與。理由是,LLM 驅動的「程式碼代理」(LLM 就是 ChatGPT、Claude 這類能理解並產生文字與程式碼的大型 AI 系統;代理則是讓這類 AI 自主執行複雜任務的程式架構)已跨越能力門檻:傳統程式碼審查的所有目標——找出 bug、確認邏輯正確、維持程式品質——AI 代理都能以更快速度、更低成本完成。論文也指出,試圖維持「人機混合審查」的折衷方案根本行不通,因為 AI 輔助開發的程式碼產出速度已遠超人類能審閱的極限。若此論點成立,將徹底改變全球軟體開發的工作流程。
假設一間公司的 AI 工具每天自動生成 500 個程式修改提案(pull request,就是「我改了某段程式,請大家審核後合併進主版本」的申請),但工程師團隊只有 10 人,每人每天頂多仔細審查 5 個。這樣每天就有 450 個提案積壓、永遠追不完。論文的核心論點是:與其讓人類疲於追趕,不如完全交由 AI 代理負責自動審查——它可以同時檢查語法錯誤、邏輯漏洞、安全性風險,速度比人類快數百倍,成本幾乎為零。舊做法是每個修改都由人類同事逐行閱讀;新做法是 AI 代理全自動審查並標記問題,工程師只需在 AI 判斷為高風險的少數情況下介入確認,讓整體開發速度不再被審查瓶頸卡住。
百度(中國科技巨頭)在 2026 年 6 月下旬開源了一個叫做 Unlimited OCR 的 AI 文字辨識模型(OCR 就是讓電腦「看圖讀字」的技術,例如把拍的發票照片或掃描文件轉成可編輯的文字)。這個模型主打「一次輸入、長文解析」,意思是你把整份 PDF 文件丟進去,它能夠從頭到尾一口氣讀完並輸出結構化文字,不需要分段切割再人工拼接。它是在 DeepSeek-OCR(DeepSeek 公司推出的知名開源 OCR 模型,已被廣泛使用)的基礎上進一步強化,支援單張圖片或多頁 PDF 兩種解析模式,並附有完整的 Python 範例程式。專案在 GitHub 上架不到兩天就累積超過 3,100 顆星(開發者按讚數),Hacker News(全球知名工程師討論社群)也有 376 個討論點,顯示社群高度關注。模型已在 Hugging Face(全球最大 AI 模型分享平臺)與 ModelScope 上公開下載,任何人都可以免費取用。
假設我有一份 80 頁的中英文合約 PDF,需要把每一頁的條款都轉成可搜尋的純文字,方便後續用程式分析。用傳統 OCR 工具,通常要把 PDF 每頁切成小塊分批辨識,辨識完還要自己拼回來、修正格式錯位,費時且容易漏字。改用 Unlimited OCR,只需十幾行 Python 程式碼:先用 PyMuPDF 把 PDF 的每頁轉成圖片,再呼叫 `model.infer_multi()` 一次送入全部頁面圖片,模型會連續解析整份文件,最後把結果(如 Markdown 格式文字)存到指定資料夾,完全不需要手動拼接。官方 README 已提供這段完整程式,照著複製貼上即可執行,大幅降低文件數位化的工程門檻。
豆包(字節跳動旗下的 AI 助理,也就是中國版 ChatGPT)在 2026 年 6 月推出最新版本 2.1,分為 Pro 和 Turbo 兩款,已在火山方舟(字節跳動的雲端 AI 服務平臺)全面上線。新版本最大亮點是 Agent 能力大幅提升——Agent(AI 自動代理,指 AI 可以自己連續執行多個步驟完成複雜任務,不需要人在旁邊逐步下指令)現在能處理原本需要多人工程師花費數週的高難度專業任務。在主流效能評測上,豆包2.1 程式設計能力已達到與 Claude Opus 4.7(Anthropic 目前最強旗艦模型)及 GPT-5.5 持平甚至超越的水準,部分科學程式碼評測(SciCode)和企業 Agent 任務評測(MCP-Atlas)更直接超過兩者。最特別的是,豆包2.1 定價只有歐美競品的約四分之一,輸入每百萬 Token(AI 計算單位,大約每 750 個英文字算 1000 個 Token)僅 6 元人民幣,對想要高效能但預算有限的開發者相當有吸引力。
豆包2.1 的 Agent 在晶片設計領域展現了突破性能力。用戶讓 Agent 獨立完成一個「16×16 PE Tiny NPU Tile」的硬體電路設計任務——這是一種專門用來跑 AI 運算的小型晶片架構,需要寫 RTL 程式碼(一種描述晶片邏輯電路結構的專業語言,工程師用它來「畫」晶片內部線路)。在舊做法下,這類工作通常得由 3 到 5 名有多年經驗的晶片工程師花費數週才能完成;而豆包 Agent 在完全自主的情況下連續運行了將近 18 小時,歷經 9 輪自我反覆檢查與修改,最終交出了 6 個核心功能模組、共 1303 行完整 RTL 程式碼。這個案例具體說明瞭一件事:對於高度專業的工程類任務,AI Agent 已經能夠直接取代多人團隊數週的工作量,而不只是輔助或提示。
NVIDIA(輝達,一家以生產 AI 晶片聞名的科技公司)在 2026 年的 Automate 大會上,發布了一套叫做 Halos for Robotics 的機器人安全系統。這套系統涵蓋從最底層的硬體晶片、感測器、作業系統、AI 演算法(就是讓機器人做決策的程式),一路到產品上市安全認證的完整流程,被業界稱為「具身版安卓」——就像 Android 讓手機廠商不用從零開始造作業系統一樣,Halos 想讓機器人公司直接套用現成的安全框架。NVIDIA 把自己在自動駕駛汽車領域耗費超過 1.8 萬個工程師年、並驗證過的 700 萬行程式碼,全部移植到機器人產業。核心安全框架已開源(即公開讓任何人免費使用),目前已有波士頓動力、豐田、禾賽科技等 43 家企業加入這個生態圈。
假設一家新創公司要開發一臺在亞馬遜倉庫工作的搬運機器人。以前他們得自己從頭設計安全機制:如何確保機器人的 AI 不會做出危險動作?如何讓攝影機、雷達等各種感測器的資料統一處理?如何通過安全認證才能進工廠?每一關都要耗費大量時間與人力。採用 Halos for Robotics 之後,底層晶片 IGX Thor 內建「安全島」,把主系統和安全監控在硬體層級物理隔離,避免 AI 系統當機時連安全機制一起失效;Holoscan Sensor Bridge 統一整合攝影機、雷達等多種感測器資料;安全作業系統 Halos Core 限制 AI 模型的決策範圍,確保機械手臂不會因 AI 誤判而揮向旁邊的工人;最後 NVIDIA 認證實驗室協助取得全球認可的 ISO/IEC 17020 資質。整個上市流程從過去可能耗費數年,縮短到數個月,且所遵循的安全規範與波士頓動力、Agility 等大廠一致。
這是一項大規模審計研究,針對用 AI 來「評分」其他 AI 輸出結果的做法(業界稱為 LLM-as-a-Judge,也就是讓一個 AI 模型充當裁判,判斷另一個 AI 的回答好不好)進行系統性檢驗。研究涵蓋 21 個評審模型、9 家 AI 服務供應商、約 54 萬 1 千筆評判結果。研究發現,業界最常用的「一致率」計算方式(exact-match agreement,就是直接計算兩個評審幾次判斷一樣)會嚴重高估評審的可靠性;一旦改用更嚴謹的統計指標 Cohen's kappa(一種校正了「湊巧猜對」情況的一致性係數),分數會在知名評測基準 MT-Bench 上驟降 33 到 41 分,而且各評審模型的排名順序也跟著大洗牌。對於仰賴 AI 裁判模型做內部評測流程的開發團隊,這是一個嚴重的警訊。
假設一家公司正在開發一款客服 AI,想要自動評估 AI 回答的品質好壞,於是引入一個 LLM 評審模型(例如某款 GPT-4 等級的模型)來每天批次評分。他們用傳統的「一致率」計算兩個評審同時打「好」或「差」的比例,得到 87% 的一致率,認為評審相當可靠,便放心地用評審分數做 A/B 測試。但如果改用 Cohen's kappa 來計算,實際一致性可能只剩 46~54%——幾乎與隨機亂猜差不多。更麻煩的是,原本被認為「最可靠」的評審模型,在新指標下排名可能從第一名跌到中段班。換句話說,過去根據評審分數做出的模型選擇和改版決策,很可能建立在失真的數字上,需要重新用 Cohen's kappa 驗證才能信賴。
ByteDance(就是抖音、TikTok 的母公司)在 2026 年 6 月的火山引擎 FORCE 大會上,一口氣發布了五款新的 AI 模型,其中最受矚目的是 Seedance 2.5——一個專門用來「讓電腦自動生成影片」的 AI 系統(稱為「影片生成模型」)。這個模型最大的突破在於:它能直接輸出長達 30 秒的連續影片,而且不需要像過去那樣把多段短片拼接在一起,場景切換與速度變化都由 AI 自動處理。它還支援一次接受最多 50 個「參考素材」(例如圖片、音效等)來引導 AI 生成想要的畫面,生成後也可以針對局部進行編輯,同時保持整支影片的視覺風格一致。除了 Seedance 2.5,同場發布的還有語言模型(會對話、回答問題的 AI)Doubao 2.1 Pro——費用比同類競品便宜約 80%——以及圖像生成模型 Seedream 5.0 Pro 和音訊模型 Seed-Audio 1.0;Seedance 2.0 也同步升級,新增原生 4K 畫質與 10 位元色彩支援。Seedance 2.5 預計 2026 年 7 月初正式推出。
假設我是一位短影音創作者,想用 AI 製作一支 30 秒的產品廣告影片。過去使用 AI 影片工具時,每次只能生成 3~5 秒的短片段,要湊成 30 秒得分段生成再手動剪接,畫面銜接常常不自然、視覺風格也容易前後不一致,整個流程少說要花半天。現在改用 Seedance 2.5,我可以上傳產品圖片作為參考素材,搭配文字描述想要的場景(例如「產品從包裝盒中取出、特寫展示細節、最後放在書桌上的環境鏡頭」),讓 AI 直接輸出一段完整的 30 秒影片,場景轉換由模型自動完成,不需要我手動剪輯。如果生成後發現某段光線不對,還能針對那段單獨修改,同時整支影片的色調和風格不會跑掉。原本半天的剪輯工作,現在可能縮短為幾分鐘的等待時間加上少量微調。
阿里巴巴推出的 AI 影片生成模型(就是能根據文字或圖片自動生成影片的 AI 工具)HappyHorse 1.1,在全球 AI 影片生成排行榜上升至第二名,超越了 OpenAI 的 Sora(OpenAI 推出的知名 AI 影片生成服務)以及字節跳動(TikTok 母公司)的 Seedance。這個模型透過 API(讓不同軟體互相串接的技術介面)對外開放,讓企業可以直接把影片生成功能整合進自己的產品或工作系統,而不是只能在網頁上手動操作。目前已在阿里雲 Model Studio 平臺正式上線,並提供前兩週 40% 的折扣優惠。HappyHorse 1.1 支援文字轉影片、圖片轉影片、主體轉影片,以及影片剪輯等功能,能涵蓋商業影片製作從構思、拍攝到後製的完整流程。
假設你是小型電商業者,需要定期製作商品宣傳短影片。以前你需要聘請攝影師或後製人員,整個流程可能要花上好幾天。用 HappyHorse 1.1 的「圖片轉影片」功能,你只需上傳商品照片,並輸入描述文字(例如「展示這款皮革手提包的質感,打光柔和、背景簡潔俐落」),AI 便能自動生成一支可直接用於社群媒體或電商平臺的宣傳影片;若效果不滿意,再用內建的影片編輯功能微調,全程不需要攝影棚或專業後製軟體。與此前排名較高的 OpenAI Sora 和 ByteDance Seedance 相比,HappyHorse 1.1 在近期全球評測排名中表現更佳,且已開放 API 讓企業直接串接到既有的電商或軟體平臺,部署門檻更低。
Skybridge 是法國新創公司 Alpic AI 推出的開源框架(就是一套讓開發者快速建立應用程式的工具包),專門用來開發 MCP(Model Context Protocol,一種讓 AI 能夠呼叫外部工具和服務的標準通訊協定)應用程式。它讓開發者用 React(目前最流行的網頁前端程式語言之一)寫一套程式碼,就能同時讓 Claude、ChatGPT、VS Code 等不同 AI 平臺都能使用,不需要分別為每個平臺各寫一套。這個框架的定位類似「MCP 界的 React Native」——React Native 是讓開發者一套程式碼同時在 iOS 和 Android 上執行的工具,Skybridge 做的是同樣的事,只是對象換成了各家 AI 平臺。2026 年 6 月 22 日在 Product Hunt(一個科技新品評選社群平臺)上架當天就拿下 441 個讚、登上排行榜第一,GitHub 上已累積超過 1,800 個星星、每月下載量超過 10 萬次,並已驅動 Claude 和 ChatGPT 官方應用商店超過 10% 的 App,Datadog、Bitmovin 等大型企業也已採用。
假設我是一個開發者,想做一個「查詢公司股票資訊」的 MCP 工具,讓 Claude 和 ChatGPT 的用戶都能呼叫我的工具。舊做法:我要分別為 Claude 的 API 格式寫一套程式、為 ChatGPT 再寫一套,兩套格式不同、部署方式不同,維護起來工作量加倍。用 Skybridge:我只需跑一行指令 `npm create skybridge@latest stock-tool` 建立專案,用 React 撰寫 `server.registerTool('查股票', handler)` 定義工具邏輯,框架會自動把它轉成 Claude、ChatGPT、VS Code 等所有平臺都能讀取的格式。修改程式碼時不用重新連接 AI,本地端變更即時生效(Hot Reload 熱更新)。準備上架前還有 Beacon 功能自動掃描是否符合各平臺規定,降低被平臺拒絕的風險。一套程式碼,全平臺通用,省去跨平臺重複開發的時間。
Modal 推出「Auto Endpoints」功能,讓開發者只需一行指令就能在雲端部署自己的 LLM(大型語言模型,就是 ChatGPT 這類會對話的 AI)推論服務,不必依賴 OpenAI、Anthropic 等廠商的 API。這個工具解決三個核心痛點:一是廠商 API 隨時可能被漲價、降級或關閉,影響服務穩定性;二是傳統推論服務是黑盒,看不到底層設定與優化細節;三是自建推論伺服器工程量龐大,涵蓋 GPU(圖形處理器,用來加速 AI 運算的晶片)調優、容器部署、自動擴容等,需要大量工程師人力。Auto Endpoints 背後採用 Modal 的 GPU 雲端基礎設施,支援按流量自動增減運算資源,且完整公開效能指標(如回應延遲、解碼速度),讓開發者完全掌握自己的推論服務。整體定位是「介於完全自建與租用黑盒 API 之間」的折衷選項——操作簡便,但資料、設定與程式碼都掌握在開發者手中。
假設我是一家新創公司,目前使用 Anthropic Claude API,但擔心未來被漲價或服務中斷,想改用開源模型(例如 GLM-5.2)自行託管,卻又沒有人力招募一整組 MLOps(機器學習維運)工程師來維護 GPU 伺服器、撰寫自動擴容邏輯、調教推論引擎參數。用 Modal Auto Endpoints,只需在終端機執行 `modal endpoint create --name agent --model zai-org/GLM-5.2-FP8`,幾分鐘後便能得到一個與 OpenAI API 格式相容的推論端點,直接替換現有程式碼中的 API 呼叫。流量低時自動縮減 GPU、尖峰時自動擴增,完全不需手動介入。相比之下,舊做法需自行架設 vLLM 伺服器、撰寫 Kubernetes(雲端容器管理系統)設定、配置負載均衡器、持續調整引擎參數,工程量少說數週起跳,且日後仍要持續維護。
Lift4D 是一套 AI 研究框架,能從只有一支相機拍攝的普通影片(稱為「單目視角影片」),重建出動態物體完整的立體形狀、外觀與動作——包括相機沒有直接拍到的背面或被遮住的地方。這套方法融合了兩項關鍵 AI 技術:「擴散模型(一種能根據已有資訊腦補、猜測未知區域的 AI 生成技術,和 Stable Diffusion 這類圖片生成 AI 同屬一族)」以及「3D 高斯潑灑法(把三維空間用大量微小彩色小球描述出來、讓渲染速度更快的技術)」。傳統方法面臨兩大難題:一是逐幀重建容易造成時間上前後跳動不一致,二是被遮住的區域根本缺乏資料可用。Lift4D 透過「因果潛在傳播(讓 AI 在每幀生成時,自動參考前幾幀的隱含資訊,維持時間連貫)」來解決第一個問題,再用「遮擋感知優化(辨識哪些區域被遮住,改以 AI 先驗知識補全)」解決第二個問題,最終輸出完整、時間連貫的 4D(三維空間 + 時間維度)動態重建結果。
假設我有一段手機拍的影片,畫面中有人在跳舞,但相機只從正面拍,背部和側面完全不在鏡頭內。我想製作這個人跳舞的完整 3D 動畫模型,用傳統方法要麼需要多臺相機從四面八方同時拍(架設成本高、場地受限),要麼重建出來的模型背面會有大量破洞或缺失。用 Lift4D,輸入這段單視角影片後,系統先用擴散模型逐幀猜測背面與被遮住部位的立體形狀,再用 3D 高斯潑灑法把所有幀整合成一個可以連續播放的動態 3D 模型——人物轉身時背面不會破洞,跳躍時四肢形狀也不會在前後幀之間突然跳變。對比舊做法,舊方法要麼需要多相機設備,要麼單相機重建出的模型有明顯破損與閃爍,Lift4D 讓「單支手機拍的影片 → 完整 4D 動態模型」這條路變得可行,對遊戲動畫製作、虛擬實境內容生成、影視特效等場景有潛在應用價值。
Mistral(法國 AI 新創公司)於 2026 年 6 月 23 日發布 OCR 4,這是他們最新一代的文件智能辨識工具。OCR(光學字元辨識,就是讓電腦自動讀取掃描文件或 PDF 裡的文字)在 AI 時代已大幅進化,不只能抓文字,還能辨識表格、標題、公式、簽名等各種內容區塊,並標示每段文字的所在位置與信心分數(代表 AI 對該辨識結果有多確定)。OCR 4 支援多達 170 種語言,在多項公開基準測試中名列前茅,並在 600 多份真實多語言文件的人工評測中,平均有 72% 的勝率優於其他競爭方案,涵蓋其他 AI 原生 OCR 工具、大型語言模型及企業級解決方案。除了雲端 API 外,也可以打包成單一容器在企業內部自行架設,滿足資料不得出境的合規需求。定價為每 1,000 頁 $4 美元,批次處理打對折僅需 $2。
假設我是一家物流公司,每天要處理數百張來自全球各地的進口報關單,格式五花八門(中文、英文、越南文都有),且都是掃描 PDF。舊做法可能需要人工逐張輸入,或用傳統 OCR 軟體再反覆手動校對錯字。現在改用 Mistral OCR 4,直接把 PDF 丟進 API,它會自動辨識每個欄位(收件人、品名、金額、日期),並回傳結構化 JSON 格式的資料,同時附上每個欄位的信心分數。信心分數低的欄位(代表辨識結果可能有誤)可以自動標記給人工複核,其餘高信心的直接寫入資料庫。整個流程從原本一張單耗費數分鐘人工,變成幾秒鐘自動完成,多語言文件也不需個別設定,直接一套流程處理。
免疫學家 Derya Unutmaz 有一個困擾他整整 3 年的謎題:某種 T 細胞(人體免疫系統中負責對抗病原體、病毒及癌細胞的一種白血球)的行為模式無法用現有的生物醫學知識解釋。他藉助 GPT-5 Pro(OpenAI 旗下最新的強力 AI 語言模型,也就是目前最高階版本的 ChatGPT)來協助分析問題,最終成功取得突破性見解。這個發現不只解開了長達 3 年的謎題,更有望推進癌症免疫療法(利用人體自身免疫力攻擊癌細胞的治療方式)以及自體免疫疾病(免疫系統錯誤攻擊自身組織所引發的疾病,例如紅斑性狼瘡、類風濕性關節炎)的研究。這個案例代表著一個具體的信號:AI 正在成為加速科學發現的實用工具,而不只是輔助寫作或編程。
假設你是一位研究 T 細胞的科學家,長達 3 年不斷觀察到一種異常的細胞行為,卻始終找不到文獻可以解釋它。傳統做法是:大量搜尋論文、向同事討論、反覆設計實驗,這個循環可能耗費數年。Unutmaz 改為將這個問題拋給 GPT-5 Pro,讓 AI 在訓練時吸收的海量生物醫學文獻知識中,尋找不同學科之間可能被忽略的交叉連結與假說。GPT-5 Pro 提供了研究者此前未曾考慮的切入視角,最終幫助解開了這個謎題。相比舊做法——研究者靠個人閱讀量和直覺慢慢拼出假說,可能花 3 年、5 年——AI 能在對話中快速整合跨領域知識,大幅壓縮科學探索的時間成本。
這篇文章聚焦於「AI Agent」(就是能自主接收任務、自己規劃步驟並完成工作的 AI 程式,像個虛擬員工)正從一個概念工具,演變成真實參與企業日常生產流程的數位勞動力。亞馬遜雲端服務(AWS,全球最大的雲端平臺,企業向它租用伺服器與運算資源)扮演基礎設施提供者的角色,幫助小鵬汽車、月之暗面(Kimi 的母公司)、獵豹移動等中國公司,把 AI Agent 真正嵌入業務系統而非孤立使用。文章呈現了一套「五層技術架構」,從底層 GPU 算力、模型平臺(Amazon Bedrock,讓企業可統一調用多種 AI 模型的服務)、資料與知識管理、Agent 生命週期管理,到最上層的應用工具,缺一不可。核心論點是:AI Agent 的成功關鍵不在單點技術突破,而在於建立一套完整工程體系——算力、資料、權限、安全、全球部署全部整合起來,才能把技術選擇轉化為真實的業務成果。
我是小鵬汽車的工程師,以前發現一個程式缺陷(bug),從定位問題到修復完成要花將近兩天——工程師要手動追蹤錯誤來源、撰寫修復方案、測試、再部署,每個環節都靠人工接力。現在小鵬在 AWS 的 Amazon Bedrock 上建立了名為「靈犀」的 AI Agent 開發平臺,採用「Spec 驅動開發」——工程師只需把需求文件寫清楚,AI Agent 自動完成後續的設計、程式碼生成、測試到部署全流程。同樣的缺陷修復任務,時間從兩天壓縮到 10 分鐘,AI 自動產出的程式碼比例也超過整體的 70%。舊做法靠人工逐步處理,每個交接環節都有等待成本;新做法讓 AI Agent 把整條流水線串起來,工程師只需在關鍵節點確認結果即可。
可口可樂與百度旗下的「一鏡」平臺合作,利用 AI(人工智慧)技術製作了 2026 年世界盃的電視廣告(TVC,就是傳統電視臺播出的品牌宣傳片)。整支廣告並非由人類導演一鏡鏡拍攝,而是透過「提示詞」(Prompt,就是輸入給 AI 的文字指令)驅動 AI 自動生成畫面、人物動作和剪輯風格。這套系統背後使用的是百度的文心大模型(一種類似 ChatGPT 的大型語言 AI),搭配多個「智能體」(Agent,可以理解成各司其職的 AI 小助手)並行分工,分別負責創意規劃、人物動作生成、調色和聲音等工序。最終成片包含 5 個人物、橫跨 5 座城市,整體視覺品質據稱達到傳統專業製片水準,在廣告與 AI 業界引發不小關注。
假設廣告公司要製作一支在世界盃期間播出、主打「一罐可樂=社交重啟按鈕」概念的短片,傳統做法需要找導演、攝影師、美術指導、剪輯師、調色師、音效師分頭工作,前後耗費數週甚至數月。使用這套 AI 系統,創意人員只需輸入提示詞描述畫面氛圍、人物情緒、城市場景,系統便讓多個 AI 智能體同時運作——一個負責逐幀生成人物表情與動作,另一個專門「學習」可口可樂的品牌視覺規範,確保成品顏色和調性符合官方標準,而非隨機拼接泛用素材。整個流程端到端回應控制在 2 秒內,最終輸出一支跨 5 城市、運鏡風格統一的廣告片,相較傳統製作大幅壓縮了時間與人力成本。
Baseten(一家提供 AI 模型部署服務的公司)完成 15 億美元融資,押注「企業想自己掌控 AI 推論層」的趨勢。所謂推論(Inference),就是讓已訓練好的 AI 模型實際回答問題、生成內容的過程,通俗來說就是「讓 AI 開始工作」的那個環節。傳統上企業都是直接呼叫 OpenAI、Anthropic 等大廠的 API(遠端服務介面),現在越來越多公司想要自己部署開源模型(程式碼與模型參數對外公開、可自行架設的 AI 模型),並在上頭用自家資料做後訓練(Post-training,就是在通用 AI 的基礎上,再用公司自己的業務資料繼續訓練,讓它更懂自家業務)。Cursor(AI 程式碼編輯器)、Harvey(法律 AI)、Notion(筆記工具)等知名 AI 應用都已是 Baseten 的客戶,印證這個趨勢確實在發生。此外,另一家公司 Reflection 傳出與 SpaceX 簽署 63 億美元算力採購合約,顯示 GPU 算力租賃市場正成為獨立的戰略賽道,卡在模型開發商與硬體供應商之間。
假設我是一家法律科技公司,想打造一個專門分析合約的 AI 助理。若直接呼叫 OpenAI 或 Claude 的 API,合約文件都得送到第三方伺服器,法律事務所對此有隱私顧慮。改用 Baseten 這類推論基礎設施,我可以:1)把開源模型(如 LLaMA 或 Mistral)部署到自己的雲端帳號;2)用公司累積的合約資料與律師批註做後訓練,讓 AI 學會法律術語與判斷邏輯;3)所有資料留在自己的環境中不外流。以往這套流程只有 OpenAI、Google 這種大型 AI 實驗室才玩得起,現在透過 Baseten 這類工具,一般應用公司的工程團隊就能自行操作。舊做法依賴第三方 API、資料送出去、無法針對業務客製;新做法自己掌控,還能隨時用新案例持續改進模型。
Claude Tag 是 Anthropic(開發 Claude AI 的公司)為企業用戶推出的新功能,讓員工可以在 Slack(一款常用的企業即時通訊軟體)裡直接標記 @Claude,像邀請一位 AI 同事加入對話。與一般 AI 聊天工具不同,Claude Tag 具備「持久記憶」能力——它會持續追蹤所在頻道的歷史對話,對話累積愈多,它對公司業務、術語和工作流程的理解就愈深。同一頻道裡所有成員共用同一個 Claude 身份,方便交接任務時保留完整脈絡;它甚至能主動出聲更新團隊進度,不只是被動等人詢問。管理員可控制 Claude 能存取哪些頻道與工具,確保資料安全。此功能目前處於研究預覽階段,僅開放給 Claude Enterprise 和 Claude Team 的訂閱用戶使用。
假設我是一家公司的產品經理,每個月要撰寫「產品進度週報」。過去我得先翻閱工程頻道的歷史訊息、逐一詢問各負責人更新,再手動彙整成報告,前後至少耗費兩小時。有了 Claude Tag 後,只需在 Slack 頻道裡 @Claude「請幫我彙整本週的產品進度並草擬週報」。因為 Claude 已全程追蹤頻道內所有對話,它能直接根據工程師、設計師在頻道裡留下的討論紀錄,自動整理出本週完成事項、待解問題與下週計畫。舊做法要兩小時手動翻查,現在只需幾分鐘確認 Claude 的草稿即可完成,且不需要自己額外整理背景脈絡。
OpenAI(就是開發 ChatGPT 的公司)最近同時推出了好幾項專為網路資安設計的新工具。其中最受矚目的是 GPT-5.5-Cyber,這是一款專門為資安任務調校的 AI 模型(也就是把 AI 的理解能力特別強化在駭客防禦、漏洞偵測等工作上),目前僅對特定合作廠商開放,尚未大眾化。此外,OpenAI 發布了名為「Daybreak」的資安平臺,定位是「AI 時代的主動防禦工具組合」,不直接賣給一般用戶,而是透過合作夥伴嵌入現有資安產品裡。最後還有「Patch the Planet」這個開源計畫(開源代表程式碼對外公開,任何人都可查看或貢獻),目標是推動全球資安漏洞修補工作的普及與加速。
假設你是一家企業的資安工程師,每天需要審查大量程式碼,找出可能被駭客利用的安全漏洞(這叫「程式碼審計」)。過去這件事要靠人工一行行讀,或用傳統規則型掃描工具跑,但常常產生大量誤報(明明安全卻被標記為危險)。現在若你公司採購的資安掃描軟體已透過 Daybreak 合作計畫整合了 GPT-5.5-Cyber,你上傳程式碼後,AI 會自動指出哪段有風險、是什麼類型的漏洞(例如 SQL 注入(一種讓駭客塞入惡意指令的攻擊手法))、以及建議如何修補——準確率更高、誤報更少。整個流程不需要換用新系統,AI 能力直接嵌在你原本就在用的工具裡。
這篇發表於 LessWrong(一個以理性思考與 AI 研究著稱的討論平臺)的文章,系統性地分析了影響 AI 模型「能做多大」的兩大物理限制,並據此預測從 2023 到 2031 年每年可能出現的最大模型規模。第一個限制是「推理頻寬」——AI 模型在回答問題時,必須快速從記憶體(HBM,即晶片內部的高速記憶體)讀取大量數值,這個速度決定了模型最多能有多少參數(參數就是模型「記住」知識的數字,數量越多代表模型越聰明但也越重)。第二個限制是「預訓練算力」——訓練一個模型需要消耗大量電腦運算資源,算力多寡決定模型能學多深、學多廣。文章還考慮了「稀疏化」(Sparsity,讓模型每次只動用部分參數、大幅節省運算量)與量化(把模型數值精度壓縮以減少記憶體需求)等技術趨勢,最終預測到 2031 年,最先進的模型總參數量將高達 1.4 千兆(1.4 quadrillion,即 1.4×10¹⁵)個。
假設你是一家 AI 晶片公司的產品規劃師,需要決定 2028 年出貨的新一代 AI 加速器應支援多大的模型。按這份分析,2028 年主流前沿模型的「活躍參數」(每次推理實際運算到的部分)將達 7.9 兆個,加上 30 倍稀疏化後總參數量約 240 兆。這意味著你的晶片設計必須能以 80 tokens/秒的速度(讓使用者感覺流暢對話的基本門檻)服務這樣大小的模型——否則推理太慢、產品沒有競爭力。有了這份預測,你可以反推每張晶片所需的 HBM 頻寬和多卡互聯設計,而不是拍腦袋估算。相比之下,如果沿用 2024 年的設計思路(只考慮百億到千億參數規模),到 2028 年晶片就會直接被時代淘汰。
一篇技術文章探討如何用「知識型代理人」(Knowledge Agents,簡單說就是讓 AI 在回答前先查詢整理好的專屬知識庫的智慧助手)讓小型 AI 模型的表現追上甚至超越體積更大、費用更高的頂尖大模型(Frontier Models,指 GPT-4o、Claude 等最強等級的商業模型)。作者開發了一套方法,不需要使用最昂貴的大模型,只要搭配結構化的知識注入系統,就能讓參數量只有 27B(一種衡量模型大小的單位,數字越大代表模型越複雜)的 Qwen 3.6 模型應付高難度的專業查詢。文章背景同時提到 Anthropic(開發 Claude AI 的公司)近期撤回了代號 Mythos 的模型,凸顯頂尖模型的不穩定性,讓開發者開始重新思考過度依賴單一大型模型的風險。核心方法是透過嵌入(Embedding,把文字轉為數字向量以便電腦快速搜尋)、資料結構化,以及多輪搜尋,在模型回答前將正確的知識精準注入,讓小模型「只需思考已整理好的精華資料」,而非從零開始猜測。
假設你在一間企業擔任資料工程師,需要讓 AI 幫員工回答公司內部的 HR 政策、合約條款、技術文件等「公司私有資料」。若直接採用 GPT-4o 或 Claude 等頂尖大模型,每月費用高昂,而且這些模型本身完全不知道你公司的內部資訊,你得把大量文件塞進 prompt(輸入給 AI 的指令文字),容易超出限制或撈到錯誤段落。改用知識型 Agent 架構後,你選擇 Qwen 3.6 27B(一個開源、可自行部署的較小模型),搭配以下流程:先把公司文件切塊並做嵌入(轉成數字索引),員工提問時分多輪搜尋最相關的段落,再把這些段落精準注入 prompt,讓模型只需處理「已篩選過的精華資訊」。員工問「產假可以請幾天」,系統自動查出 HR 手冊第 12 條並注入,模型直接給出正確答案,準確率與大模型相當,但部署成本可能低數十倍。相較於傳統 RAG(Retrieval-Augmented Generation,讓 AI 回答前先查資料庫的技術)單輪語意搜尋容易撈錯段落的問題,多輪搜尋加結構化資料讓小模型的表現大幅提升。
Anthropic(就是開發 Claude、ChatGPT 主要競爭對手的 AI 公司)旗下有一套叫做 Cowork 的「AI 代理工作系統」(agent system,也就是讓 AI 自動幫你完成複雜任務、不需要你一直盯著的工具)。過去 Cowork 雖然能透過另一個叫做 Dispatch 的功能在手機上觸發,但有個根本限制:所有 AI 任務必須在使用者自己的桌機本機上執行,也就是說電腦必須一直保持開機才能讓任務順利跑完。現在 Anthropic 正準備把 Cowork 升級為雲端執行架構,AI 任務改在 Anthropic 的伺服器上運算,不再依賴本機。新版 iOS App 裡將加入一個統一的任務總覽頁面,讓使用者可以直接在手機上排定、啟動、追蹤工作進度,結果也能在手機、網頁版與桌機之間同步。這項功能目前已出現在 iOS 測試版的程式碼中,只是藏在「功能開關」(feature flag,開發者先做好但還沒公開啟用的設定)後面,代表正式上線應該不遠了。
假設我是一位業務主管,早上通勤時想交代 Cowork AI 幫我整理本週所有客戶往來信件、歸納出待處理事項、並草擬回覆草稿。舊版做法是:我必須先回到辦公室開電腦,而且電腦全程不能關機或進入睡眠,否則任務就中斷了。換成新版雲端架構後,我直接在手機 App 建立這個任務並送出,然後把手機收進口袋。Cowork 在 Anthropic 的雲端伺服器上自動跑完全流程,等我到公司打開 App,就能看到整理好的客戶事項清單和草稿,完全不管我的電腦有沒有開機、人在哪裡。這讓原本只適合「坐在桌機前」使用的 AI 代理工具,第一次真正能融入行動辦公場景。
Cisco(全球知名網路與資安設備大廠)宣佈計畫收購 WideField Security,並將其技術整合到 Splunk(一套企業常用的資安監控與日誌分析平臺)中。這項收購的核心目的,是解決 AI Agent(就是那種能自動執行任務的 AI 程式,例如自動寄信、自動查資料、自動操作系統的 AI 助理)快速普及後帶來的全新安全漏洞。現在企業系統裡不只有真人員工,還有大量「非人類身份」(Non-Human Identity,NHI,指 AI 程式、自動化腳本這類不是真人但被授予存取權限的帳號)在系統中活動。WideField 的技術能幫助 Splunk 把身份驗證紀錄、終端設備行為、網路流量、雲端存取等資料全部整合起來,讓資安團隊即時發現「身份合法、權限正確,但正在做危險操作」的 AI Agent 或人類使用者。
假設一家公司的客服系統中跑著一個 AI Agent,負責自動回覆客戶郵件並查詢訂單資料。這個 AI Agent 已通過公司驗證、擁有合法存取權限。但某天,它突然開始大量下載客戶個人資料,行為明顯異常。傳統的資安系統只檢查「這個帳號有沒有登入權限」,確認合法後就放行,完全察覺不到任何問題。整合了 WideField 技術後的 Splunk,能同時比對身份(這個 AI 帳號是什麼)、網路行為(它在下載什麼、下載量多少)、雲端存取紀錄(它觸碰了哪些資料庫),一旦偵測到「雖合法但出現風險行為」,立即告警給資安人員。舊做法:AI Agent 大規模洩漏資料,幾週後才被發現;新做法:異常行為發生當下就被攔截。
NVIDIA(美國知名的 AI 晶片大廠,旗下 GPU 是目前訓練 AI 最常用的硬體)建立了一個專門的安全測試實驗室,讓製造人形機器人(外型類似人體、能行走與操作物品的機器人)的廠商和企業客戶,在向政府監管單位申請認證之前,先來這裡完成前置安全測試。實驗室內有 NVIDIA 工程師提供協助,包括預先檢驗和必要時的設計調整。人形機器人的安全設計比自動駕駛車輛複雜許多——自動駕駛的安全邏輯主要是「不撞到東西」,但機器人必須學會判斷哪些物體可以碰觸、搬移或施力,哪些不行,情境更加多樣且危險。這個實驗室的設立,旨在協助整個機器人產業加快取得法規許可、順利進入實際應用場域。
假設一家公司開發了一款會在工廠協助工人搬運物料的人形機器人。在向主管機關申請認證之前,他們需要驗證:機器人在靠近工人時不會意外施力夾傷人、不會錯誤判斷哪些物品可以搬動、在緊急情況下能安全停止。過去廠商得自行建置昂貴的測試環境,或乾脆等監管單位排期檢查,一旦被退件又得耗時修改再送審。現在可以先進 NVIDIA 這個實驗室,由工程師協助跑完整套安全測試、找出潛在問題並修正,再拿這份測試報告去申請正式認證,整體時程有望大幅縮短,對有意快速商業化的機器人公司而言是重要助力。
FUTO Swipe 是一個開源的手機鍵盤滑動輸入系統,讓使用者不必逐一點按每個字母,而是用手指在鍵盤上滑過各字母路徑來輸入文字——就像 iOS 或 Android 上常見的「滑動輸入」功能,但這次是完全開源、可自行架設的版本。系統內部採用三個小型機器學習模型(用大量數據訓練出來、能自動辨識規律的 AI 模組)協同運作:第一個負責辨識不同語言鍵盤的通用滑動路徑;第二個是一個迷你語言模型(能理解語句前後文的 AI),負責過濾語意不合理的詞彙建議;第三個則針對特定語言與鍵盤配置做最終字詞預測。這三個模型加起來參數量極少(不到一百萬個),能在幾毫秒內於低階手機上完成推論,且全程在裝置本地端執行、完全不上傳任何資料,保護使用者隱私。目前已整合進 FUTO Keyboard(一款開源 Android 鍵盤 App),模型與程式碼也已公開在 HuggingFace 和 GitLab,供開發者自由取用或移植到其他語言。
假設我要在手機上輸入「beautiful」,傳統做法是逐一點按 b-e-a-u-t-i-f-u-l 九個鍵,慢且容易誤觸。改用 FUTO Swipe,我只需把手指從 b 快速滑過 e、a、u、t、i、f、u、l 的大致路徑再放開,系統的 Encoder 模型(路徑辨識模型)先分析滑動軌跡的形狀、ContextLM(語境語言模型)根據我前面打的句子過濾掉語意不對的詞、Decoder 模型(解碼模型)再結合英文字典鎖定「beautiful」——整個過程在毫秒內完成。相比過去需要高階手機才能流暢運行的同類方案,FUTO Swipe 只用一塊桌機 GPU 訓練完成,top-4 失敗率僅約 4%(即大多數情況下正確答案會出現在前四個候選詞中),且因為完全離線,不會把使用者打了什麼字回傳到任何伺服器。
2026 年 6 月 23 日,Anthropic(開發 Claude 系列 AI 的公司)旗下所有主要服務同時出現大規模錯誤,包括一般使用者常用的 claude.ai 網頁介面、供企業和開發者使用的 Claude API(就是讓開發者把 Claude 功能接入自家產品的程式介面)、Claude Console(開發者測試介面),以及 Claude Code(AI 輔助寫程式工具)和 Claude Cowork 共五個服務全數受影響。問題發生在臺灣時間 6 月 23 日晚間 10 點 08 分,歷時約一個半小時,至晚間 11 點 33 分完全恢復正常。事件在 Hacker News(一個工程師與科技從業者聚集的社群論壇)上引發熱烈討論,獲得 183 分支持與 236 則留言,顯示衝擊範圍相當廣泛。Anthropic 官方透過狀態頁面即時更新進度,並於確認修復後正式宣告事件結束,但未公開說明確切的技術根本原因。
若你是一位串接 Claude API 開發 AI 客服機器人的工程師,在那一個半小時內,你的服務用戶每次發送訊息,後端就會收到 API 回傳的錯誤碼,導致客服機器人完全無法回覆;相較之下,平時 Claude API 的可用率(SLA,就是廠商承諾的「幾乎全天可用」保證)一般維持在 99% 以上,這次集中停用時段代表若你的服務恰在這段時間高峰期,整批使用者體驗會受到嚴重衝擊。事件已解決,但也提醒依賴單一 AI 服務的產品,應考慮設計備援(fallback,也就是主服務掛掉時自動切換到另一家 AI)機制。
華盛頓大學 NLP(自然語言處理,就是讓電腦理解人類語言的技術)博士 Alisa Liu,歷經 57 場面試、46 次招募人員通話後,成功錄取 OpenAI(開發 ChatGPT 的公司)。她決定把整個求職過程與準備策略全部開源(就是公開分享,任何人都能免費取用)。開源內容分兩大部分:一是詳細的求職日誌,記錄面試時間線與應對策略;二是「LLM(大型語言模型,就是 ChatGPT 這類 AI 的核心技術)零基礎學習筆記」,從神經網路(模仿人腦運作的 AI 基礎架構)一路講到後訓練(讓 AI 更聽話、更安全的微調過程)。她也整理了頂級 AI 公司的七大面試類型,包括機器學習程式碼實作、研究討論、數學推導等,幫助後來者有系統地準備,消除求職資訊不對等。
假設你剛完成 AI 相關碩士學位,想申請 OpenAI 或 Google DeepMind 等頂級 AI 公司的研究職位,但不知道面試考什麼、怎麼準備。照著 Alisa 的學習筆記,你可以從「神經網路是什麼」這個基礎概念開始,依序學習 Transformer(目前最主流的 AI 模型架構,GPT 和 Claude 都用它)程式碼實作、訓練技巧,到後訓練微調全套流程。她的面試日誌告訴你:ML Coding 面試要求從頭手寫模型架構(不能靠 AI 補全程式碼)、Research Discussion 要能深入討論自己的論文方向、Behavioral 面試要準備具體的合作經驗故事。比起以前只能靠人脈打聽、資訊極度不透明的狀況,這份開源指南讓準備方向從漫無目的摸索變為有系統的技能樹學習。
Anthropic(開發 Claude 這款 AI 助理的美國公司)宣佈,從 2026 年 7 月 8 日起,部分 Claude 用戶在特定情況下,可能需要提交政府核發的身分證件(例如護照或駕照)才能繼續使用服務。這項政策並非針對所有人,只會套用在帳號被系統標記(但尚未被封禁)的少數使用者身上。Anthropic 委託第三方身份驗證服務商 Persona 來執行這套流程,但目前尚未公開說明哪些具體行為會觸發驗證要求。整體而言,這是 AI 公司為防止服務遭到濫用所採取的合規管控措施。
假設你是一個使用 Claude API(讓開發者透過程式呼叫 Claude 能力的介面)開發自動化工具的開發者,若你的帳號因某些使用模式——例如大量自動化呼叫、異常高頻請求——被 Anthropic 系統標記,你可能會收到要求,需上傳政府核發的身分證件(如護照掃描檔),才能解鎖帳號繼續使用。這與過去「付費即可匿名使用」的模式不同:一旦觸發驗證,就必須完成實名認證。對絕大多數正常使用的開發者或一般用戶而言,這不會造成任何影響;但對於使用行為偏離常態的帳號,就需要額外完成身份確認步驟。
開發者 Sami Honkonen 分享了一種讓 AI 助理更聰明地選用工具的方法:建立一個「能力索引庫」(capability library)。簡單說,就是幫 AI 準備一份工具說明書——維護一份叫 AGENTS.md 的索引文件,列出所有可用能力的簡介,每個能力再各自有一份詳細說明文件。AI 助理(他稱之為「Pi」)每次接到任務時,先掃描索引,判斷是否符合某項能力,再讀取對應的詳細文件決定怎麼做。目前這個庫包含七種能力,包括瀏覽器自動化(讓 AI 操控真實的 Chrome 瀏覽器去填表單、抓網頁)、本地 LLM(在自己電腦上跑的語言模型(就是 ChatGPT 這類會對話的 AI),不需要連外網)、隨需虛擬機(臨時開一臺 Linux 電腦執行任務)、私有 Git 託管(版本控制服務,就是用來存放和管理程式碼歷史紀錄的系統)等。最大優點是可以無限擴充:每次設置新工具只要新增一份說明文件、更新索引,AI 就自動「學會」這個新能力,不需要重新訓練或修改程式。
假設我平常用 AI 助理幫忙處理各種任務。我想讓它幫我自動填寫某個政府網站的申請表,但那個網站需要先登入、而且阻擋自動程式直接存取。用這套能力庫的做法:我在庫裡建立一份「瀏覽器自動化」能力文件,說明「這個能力可以驅動真實的 Chrome 瀏覽器,適合用在需要登入帳號、或網站阻擋一般自動存取的場景,使用方式是呼叫 XX 服務」。之後 AI 收到「幫我填那個表單」的任務,先掃索引,發現有「瀏覽器自動化」這個選項,再讀詳細說明,然後自動啟動 Chrome 去操作。對比舊做法:以前要在給 AI 的指令(提示詞)裡每次手動說明「你可以用瀏覽器,步驟是……」,或是乾脆沒有這個功能。現在 AI 自己查文件選工具,不需要每次提醒,也不會因為遺忘而沒用到。
軟體專案常有一個隱形問題:系統上線後,當初「為什麼這樣設計」的原因只存在少數幾個人的腦子裡,文件早就過時、沒人維護。這篇文章指出這不是紀律問題,而是結構性困境——趕工程、跨時區、臨時決策,文件根本跟不上。隨著 AI 讓開發速度愈來愈快,知識差距(就是「做了什麼事、為什麼這樣做」這類隱性知識的缺口)比以往更快速地惡化。文章提出,AI 工具的真正價值不是在專案初期幫你「一次性生成文件」,而是全程降低持續維護知識庫(就是把設計決策、架構理由持續記錄下來的活文件系統)的摩擦——讓工程師在做決策當下就能快速記錄理由,讓後來的人(或自己)不必靠猜的。
假設你的團隊在深夜緊急決定「這個 API 不走標準認證流程,改用 token 白名單」,當下根本沒時間更新文件。三個月後新人加入,想調整這段邏輯,完全不知道當初為什麼這樣做,只能猜或問原作者。若使用 AI 輔助的知識庫工作流,工程師做出這個決策後,AI 會立即提示記錄理由(例:「因為 B2B 客戶端不支援 OAuth,且合約規定不能要求對方改介接方式」),並存入可搜尋的知識庫。之後當有人提出「把白名單換成正規 OAuth」的需求,AI 能自動標示衝突:「此變更可能影響 X 合約客戶的介接,當初決策原因為…」,讓新人或 PM 能有根據地判斷,而不是盲目改動或重複踩坑。比起傳統做法(靠人自律更新 Confluence、靠口耳相傳),這個差異在多市場佈署、長期維護的專案中會非常顯著。