AI Daily Digest

📰 每日 AI 彙整

unknown  ·  共 13 則報導
T1 爆炸重要T2 值得關注T3 一般資訊T4 參考用T5 可略過
T2
T2
AI畫作奪冠,評審知情後拒撤獎

今天整集只講一個主題:AI 到底有沒有創意?先從一個真實故事說起。2022 年美國科羅拉多州博覽會的「數位藝術/數位處理」比賽,一幅叫《太空歌劇院》(Théâtre D'Opéra Spatial)的畫拿下首獎——作者 Jason M. Allen 事後承認,這幅畫是用 AI 生圖工具 Midjourney 生成的。但過程不是打一句話就出圖:他前後用了至少 624 次提示詞反覆修改、疊代才定稿。兩名評審是在完全不知道這是 AI 生成的情況下評選的,事後得知真相,仍然表示會維持得獎結果。後續發展更戲劇化:美國著作權局在 2023 年 9 月 5 日正式裁定這幅畫不受著作權保護,理由是缺乏「人類作者」這個關鍵創作要素;科羅拉多州博覽會隔年(2023年)也修改比賽規則,要求參賽者必須揭露是否使用 AI 工具。

同一時期,AI 創意的「市場價值」也早有實據:2018 年 Obvious 團隊用 GAN(生成對抗網路,一種讓兩個AI 互相對抗來生成圖像的技術)生成的畫作《Portrait of Edmond de Belamy》在佳士得拍出 43 萬 2,500 美元;OpenAI 的 MuseNet(一種 transformer 模型)能生成長達 4 分鐘、橫跨 10 種樂器、還能混合不同音樂風格的作品;藝術家 Refik Anadol 的《Machine Hallucination》裝置藝術處理了超過 1 億張紐約市影像來生成視覺資料。工程領域也有實績:Airbus 用 Autodesk Fusion 360 的生成式設計軟體重新設計A320 客機隔艙板,在維持所有結構安全性能的前提下減重 45%。AI 的產出能賣錢、能上飛機——但同一時期,學術界也開始出現「AI 打敗人類創意」的頭條研究,接下來幾段要逐一拆解這些說法到底站不站得住腳。

T2
頭條說AI贏人類,隔年就被打臉

上一段講到「AI 打敗人類創意」的頭條研究,第一個要拆的就是最常被引用的那篇。2024 年發表於Scientific Reports 的研究(Hubert, Awa & Zabelina)找了 151 名人類(透過 Prolific 平臺)跟151 個 GPT-4 回應配對比較,三項任務:另類用途測驗(AUT)、後果測驗(Consequences)、發散聯想測驗(DAT)。統計結果:AUT 原創性 F(1,600)=622.10,p<0.001,效果量 η²=0.51,GPT-4 顯著贏過人類——數字是真的,論文摘要也真的寫「AI 比人類更有原創性、更詳盡」。但這句話本身就有問題:論文自己的方法章節寫明,「詳盡度」(每則有效回答的字數)只在另類用途測驗跟後果測驗兩項算過,發散聯想測驗根本沒有這個指標——「三項任務都更詳盡」這句話對照原始論文是講錯的。更關鍵的是隔年(2025年)獨立團隊的複驗(Carolus, Koch & Feng,Scientific Reports)直接打臉:只要改善人類受試者的作答時間與指示說明,人類與 AI 的差距就縮小到統計上不顯著。同一年還有另一篇獨立研究(Koivisto & Grassini,Scientific Reports 2023,後續有作者更正)標題就叫「最厲害的人類仍然勝過人工智慧」。教訓很明確:單一頭條研究的「AI 贏了」,前一年說贏、隔年複驗就翻盤,用一篇論文下結論一定會出錯。

把這件事翻成白話:如果你看到一則新聞說「最新研究證實 AI 已經超越人類創意」,先別急著轉發——光是這一個研究團隊、同一個測驗方法,光是「改善作答時間和指示」這種很基本的實驗設計調整,就能讓「AI 完勝」的結論整個消失。這也是為什麼今天這一集我們每個數字都會標注原始論文,讓你自己判斷。

T2
10萬人研究:贏平均,輸最強

既然單篇研究不可靠,那嚴謹的大型研究怎麼說?2026 年 1 月 21 日發表在 Scientific Reports 的研究(作者群包括 AI 深度學習先驅 Yoshua Bengio),用了 10 萬名人類受試者的資料,橫跨多個 AI 模型,比較「發散思考」能力(發散思考是心理學衡量創意的經典角度:看你能不能想出彼此差很遠的點子)。結論分兩半:GPT-4 顯著超越「平均」人類的發散聯想測驗分數,GeminiPro 則跟人類平均在統計上沒有差異;但人類中最有創意的前 10%、前 25%、甚至中位數以上的族群,全面贏過測試中所有的 AI 模型。論文原文直接寫:「擔心 AI 即將取代創意工作者的憂慮,目前看來仍為時過早」,並把這個結論直接歸因於「即使最先進的 LLM,與表現最好的人類之間仍存在持續性落差」。不過要誠實講:不是所有研究都得到一樣的結論——2026 年另一篇發表在 Nature Human Behaviour 的大規模比較研究(Wang, Huang, Shen & Uzzi)反而發現「人類創意平均而言略高於 LLM」。兩篇研究方法不完全相同,但把所有研究攤開來看,目前沒有任何一篇顯示 AI 贏過人類裡最強的那群人——這一點是所有研究都同意的。

翻成日常語言:你們公司那個最會出點子的同事,AI 到今天還追不上他;但如果拿全公司的「平均」創意水準來比,AI 已經贏了。這也是為什麼同一批數據,有人讀出「AI 要取代創意工作者」、有人讀出「頂尖創意者更值錢了」——兩種讀法用的是同一組研究。

T2
GPT-5研究:贏工程任務,輸真創作

2026 年 2 月發表在《Journal of Intelligence》期刊(MDPI,Q1/SSCI/Scopus 收錄,非掠奪性期刊)的研究(Yang, Xin, Yu & Wu)換了個角度:不只看「贏不贏」,還看文本本身長什麼樣子。研究把1,265 篇文本(人類組 25 人、GPT-5 組 79 篇)依「原創性 × 有效性」分成四種創意剖面:Safe(安全保守型)、Plain(平實型)、Ideal(理想型)、Moderate(中庸型)。結果 GPT-5 的文本 73.38% 落在「安全保守型」,人類文本則 84.92% 落在「平實型」——卡方檢定 χ²=191.32,p<0.001,差異非常顯著。更關鍵的是「任務類型」決定了誰贏:在偏工程/命題式的任務上,GPT-5 的「有效性」(結構完整度、執行品質)大幅勝出,效果量 d 從 -0.84 到 -1.18(數字愈負代表 GPT-5 愈贏);但在真正需要創作的「高難度虛構寫作」任務上,原創性反而是人類顯著勝出——t(102)=3.764,p<0.001,d=0.74。同一份研究、同一組模型,結論完全相反,關鍵只在於「這是不是真的需要創意」。這篇論文還挖得更深:分析驅動原創性的語言機制發現,人類的原創性主要來自「詞彙多樣性」(一種叫 MTLD 的指標)跟大量使用第一人稱單數(「我」)——也就是說,人類的創意有很大一部分來自把個人真實經驗寫進去,這是 AI 天生缺乏的。研究還測了「人機協作」:讓人類搭配較舊版本的 AI 助理(GPT-2)一起寫作,結果這種粗糙的協作模式並沒有讓創作效果變好——比單獨人類寫作還差,代表「隨便找個 AI 幫忙」不是萬靈丹,工具版本跟協作方式都很關鍵。這篇論文是 2026 年 2 月最新發表,測的是目前主流的 GPT-5,比後面幾段會提到的 2023 年舊模型研究新非常多,這也是為什麼它的「任務類型決定勝負」這個結論特別值得重視。要誠實講的限制:人類樣本是國中生加大學生(非泛化到一般成人作家),評分者是否真正盲評也未完全確認。

白話翻譯:叫 AI 寫一份規格清楚的商業提案、產品文案,它可能真的贏過大多數人;但叫它寫一篇真正需要「無中生有」的短篇小說,人類目前還是贏。判斷該不該用 AI 代寫,先問自己:這個任務本質上是「填空題」還是「創作題」?

T2
467人基準測試:創意寫作AI最弱

再看另一個角度——如果同時測很多種創意任務,AI 在哪些領域強、哪些弱?2025 年發表在《Thinking Skills and Creativity》期刊(Elsevier,最早 2024 年 12 月以 arXiv 預印本形式公開)的研究,找了 467 名人類受試者,測 13 項不同的創意任務。結果:表現最好的 LLM(Claude 與 GPT-4)也僅排在人類創意分佈的第 52 百分位,5 個 LLM 平均只有第 46 百分位——換句話說,連最強的 AI 都只比一半左右的人類強一點點。分領域看更有意思:LLM 在「發散性思考」(第 55 百分位)與「問題解決」(第 59 百分位)表現較好,但在「創意寫作」這個領域,平均只排第 25 百分位——是所有領域裡表現最差的一項,剛好呼應前一段 GPT-5 研究的發現:真正的創作,AI 還是弱項。這篇論文也測了 population-based 方法(重複取樣、best-of-N):讓同一個 LLM 回答同一題 10 次、把其中最佳點子跟人類的最佳點子放在一起比較,「集體創意」水準可以達到 8 到 10 個人類集體貢獻的程度。但要澄清一個常被過度延伸的地方:這個效果在「問題解決」領域斜率高達 1.26,在「創意寫作」領域卻只有 0.14——差了將近 10 倍,不能說「AI 文案已經贏過一群作家」,這招在解題型任務上很猛,在真正創意寫作上效果小很多。另外一個必須揭露的限制:這篇研究測的模型是 2023 年 6 月版本的 Claude-1.3、Qwen-1.0、SparkDesk V1.5、GPT-3.5/4——現在都已經停用超過兩個世代,用來代表「2026 年現況」並不合適,只能當「當年的一個切片」看待。

把 8-10 人的數字用在對的地方:如果你的任務是「幫我想 10 個行銷 slogan 候選」這種發散型解題,叫 AI 連續生成、自己挑最好的,效率真的很高;但如果你要它「寫一篇打動人心的短篇故事」,同樣的招式效果會小很多。

T2
人類愛破壞規則,AI愛玩到極致

數字之外,AI 跟人類的創意「質地」也不一樣。2025 年 KES 研討會(收錄於 Elsevier 的 Procedia Computer Science 期刊)的一項對照實驗,找了 24 名非母語人類(B2 以上程度)跟 24 個 LLM,做 8 項語言創意任務,用 OCSAI 自動評分工具打分。整體而言 LLM 分數顯著高於人類(總分 t=-3.03,p=0.0044;原創性 t=-4.21,p=0.00014),但「詳盡度」這一項沒有顯著差異(t=-1.15,p=0.258)——不是每個面向 AI 都贏。真正有意思的是人工質性分析發現的系統性差異:人類傾向「E-creativity」(打破既有規則、另闢蹊徑),LLM 傾向「F-creativity」(在既有規則框架內窮舉大量變化)——這是語言學裡既有的分類架構(Sampson 2016 提出),不是這篇論文自創的。具體案例:要求命名「一隻很兇的小型犬」,LLM 的答案集中收斂成押韻、頭韻式的制式命名風格,作者稱之為「社會可接受但公式化」;48 名參與者中「最獨特」的個體(用嵌入向量算語意獨特度)是一名人類,其答案帶有無法被模型複製的個人特異慣用語。要誠實補充:這篇論文的方法是作者自稱的「肉眼觀察」式簡短質性分析,沒有正式的編碼系統或評分者間信度檢驗,用「系統性」來形容略嫌誇大——但 E/F-creativity 這個質地上的差異,本身是個真實、可重複觀察到的現象。

下次跟 AI 要點子卡住的時候,試試看故意要求它「打破常見的答案模式」——因為它天生的傾向是在你給的框架裡把變化玩到極致,而不是主動跳出框架,這件事需要你自己去逼它做。

T2
模型愈新,發散思考分數愈低

接下來這篇是 2026 年 5 月由伊利諾大學香檳分校(UIUC)團隊發表、涵蓋 54 個不同 LLM 的研究(已投稿 ICML 2026 創意生成式AI工作坊、NeurIPS 2026 審稿中),發現一件反直覺的事:創意寫作能力每年進步 1.22 個標準差、科學發想能力每年進步 1.00 個標準差,但「發散思考」能力卻逐年下降 0.47 個標準差——模型愈新,這項能力反而愈差。同一篇論文戳破了一個更根本的問題:目前最常拿來說「LLM 越來越有創意」的幾個創意寫作測驗,其實跟模型的「一般能力」高度混淆——相關係數 r 高達 0.98、0.83、0.79,意思是考高分很可能只是「整體變強」的副產品,不代表真的更有創意。這篇論文也系統性檢驗了四種創意測驗(DAT 發散聯想、CDAT、PACE、RAT 遠距聯想),發現沒有任何一個能可靠預測 LLM 的「科學發想」能力——打破「隨便一個創意測驗高分就代表全面有創意」的普遍假設。更根本的問題是:連拿來測 LLM 的這些測驗,在人類身上的「構念效度」本身就偏弱——例如最常用的「另類用途測驗」跟其他公認的創意力量表之間相關性也不高,等於整個評判創意的地基本身就不穩。要誠實揭露一個限制:這 54 個模型是「橫斷面」抽樣(不同公司的不同模型),不是「同一個模型家族的世代演進」追蹤,論文自己也把這個趨勢定位為「觀察到的現象」而非嚴格因果證明。

如果你發現最新版的 AI 助理感覺「講話越來越制式、越來越四平八穩」,你的感覺可能是對的——有研究支持這個觀察,而且原因(下一段揭曉)跟訓練方式本身有關,不是你的錯覺。

T2
問AI五十次,答案只剩兩三種

現在來到整集的核心:AI 創意真正的死穴,不是「單次回答的品質」,而是「多樣性」。NeurIPS 2025(AI 領域頂級會議)最佳論文獎得主〈Artificial Hivemind〉(人工蜂群心智,作者來自華盛頓大學)發現:對同一個開放式問題——例如「寫一個關於時間的比喻」——用高隨機性設定(temperature=1.0,top-p=0.9)讓同一個模型回答 50 次,79% 的情況下,回答之間的平均相似度超過 0.8(用 OpenAI text-embedding-3-small 算 cosine 相似度)——答案塌縮成僅僅兩三種固定套路的變體。研究也證實這不是「這些題目本來就只有一種好答案」的問題:人工標註者判定 81.27% 的開放式問題其實可以接受 3 種以上不同的好答案,34.66% 的問題甚至可以接受 20 種以上——代表「塌縮」是模型的問題,不是題目太窄。連「多找幾個不同模型一起用」這招也救不了:不同模型經常會塌縮到同一個失敗模式,單純把多個模型的答案集合起來(ensembling)並不能可靠解決同質化問題。要澄清一個常見的過度延伸:論文原文用的字眼是「語意重疊」「模式塌縮」,並沒有用「近乎重複」這麼強烈的說法——相似度超過 0.8 代表主題/結構高度接近,但不完全等於逐字複製,這個區別在轉述時要小心,不要講得比論文本身更誇張。

「寫一個關於時間的比喻」這種題目,理論上一百個人能寫出一百種:時間是小偷、是河流、是利息、是不回頭的箭。但同一個 AI 問 50 次,你會反覆拿到同兩三種套路的變體——這就是為什麼你用 AI 寫文案,第一次覺得驚豔、第十次開始覺得「怎麼都長這樣」。那不是你的錯覺,是被論文量化證實的現象。

T2
不同公司的AI,長得越來越像

同一篇〈Artificial Hivemind〉論文還有一個更驚人的發現:不只同一個模型自己會塌縮,不同公司建造的模型之間也在互相變像。GPT-4o、DeepSeek-V3、Qwen 這些完全不同公司的模型,兩兩之間的輸出相似度高達 71% 到 82%(DeepSeek-V3 跟 Qwen 之間 82%、跟 GPT-4o 之間 81%)——對照組(隨機不相關的一對回答)的相似度基準只有 10% 到 20%,證明這個現象是真實的、不是測量方法的巧合。但論文自己老實承認:確切原因不明,可能是各家公司共用類似的資料處理管線,也可能是訓練資料互相汙染——論文用的是「不清楚原因」這種保留的說法,並沒有宣稱這是「獨立收斂」(也就是說,不能講成「不同公司的AI各自演化卻殊途同歸」這麼確定的說法)。這裡有個值得補充的產業背景:OpenAI 先前曾公開指控 DeepSeek 透過 API 大量抓取、蒸餾其模型輸出——如果這個指控屬實,至少能部分解釋「為什麼不同公司的模型會長得像」,但這跟論文本身談的「同質化」現象是兩件可以分開討論的事:不管背後是巧合、共用資料,還是抄襲蒸餾,結果都是——各家 AI 產出的東西正在變得越來越像。

如果你同時用兩三個不同公司的 AI 工具、期待「多問幾家總能拿到更不一樣的答案」,這篇研究潑了一盆冷水:不同公司的 AI 本身就有相當高的機率給你長得很像的答案,換工具不保證換到真正不同的觀點。

T2
人類多樣性一直長,AI很快就停滯

如果同質化不是單次任務的偶然,而是規模放大後才看得出來的模式呢?喬治城大學團隊(Moon, Green & Kushlev)在《Computers in Human Behavior: Artificial Humans》期刊發表的三重前註冊研究(研究設計事先公開登記、防止事後湊結論),分析了約 2,200 篇大學申請作文,發現:隨著文章數量越來越多,人類寫的文章集合會持續增加彼此間的「集體語意多樣性」,但 GPT-4 生成的文章卻很快就收斂、停滯在相似的主題與風格上——即使研究者刻意用不同的提示詞手法想拉開差異,人類與 AI 之間的多樣性落差依然存在。論文的核心結論很關鍵:個別一篇 AI 文章的品質可以跟人類一樣好、甚至更好,問題出在「一整批」AI 產出彼此太像——這跟前面 Artificial Hivemind 的發現互相印證。這篇論文也額外做了一個對照實驗:要求 AI 先用思維鏈(Chain-of-Thought,就是先一步步推理再回答)方式作答,會讓「多樣性成長率」比起單純用基礎版 GPT-4 高出超過 4 倍(b=0.24,t(124)=4.19,p<0.001)——這是少數同時控制文章長度、避開字數混淆多樣性指標這個常見陷阱的乾淨實驗設計。有個小小的正名要做:這個現象常被媒體稱為「演算法單一文化」(algorithmic monoculture),但這個詞其實不是這篇論文發明的——它出自 Kleinberg & Raghavan 2021 年的另一篇論文,是不同的作者跟不同的研究脈絡,轉述時要注意別張冠李戴。這個「個別品質不輸、整批多樣性輸」的模式並不只出現在文字創作:2026 年 3 月一篇報告指出,同樣的模式橫跨 Gemini、GPT、Llama 三個不同家族都觀察得到,代表這不是單一公司模型的特例;而且拉高取樣溫度只在一個「窄範圍」內有效,溫度再往上拉,反而會讓回答品質下降得比多樣性提升得更快。2024 年 5 月另一篇研究把範圍擴大到「設計方案」而非文字創作:系統性測試了 8 種參數調整組合跟 8 種不同的提示工程技巧,拿 100 份人類群眾外包的設計方案當基準對照,結果人類設計方案的多樣性依然全面勝出——但事後的統計分析也發現,這個落差在不同設計主題之間並不平均,某些主題的語意落差特別明顯,代表「AI 缺乏多樣性」這件事可能還跟任務內容本身有關,不是每個領域都一樣嚴重。

如果你的工作是要產出「一整批」內容(例如同時要寫 10 篇不同角度的貼文),與其一次性叫 AI 生成 10 篇,不如先要求它「一步步推理、想清楚每篇的差異點」再動筆——這篇研究證實這樣做多樣性會差很多。

T2
元兇:對齊訓練壓低多樣性

前面看到 AI 的答案會塌縮成罐頭——這病是哪來的?答案很諷刺:是我們自己訓練出來的。現代 AI 出廠前都要經過「對齊」訓練(RLHF 之類的方法:用人類回饋反覆調教模型,讓它更聽話、更安全、更不會亂講話)。2024 年一項研究直接量化這個代價:經過對齊的 Llama-2 模型,其預測下一個字的「熵」(可以理解為選字時的選項豐富度)只剩基礎版的約三分之一。更具體的案例:重複要求模型描述同一位真實人物(電腦科學先驅 Grace Hopper)時,對齊後的模型會收斂成幾乎一模一樣的固定描述模板,基礎版則每次都不同。2025 年 9 月另一篇研究比較了四種主流對齊方法(PPO、DPO、ORPO、KTO),發現其中三種(PPO、DPO、KTO)都會降低迴應多樣性——只有把取樣溫度從 0.1 拉到 1.0,才能讓多樣性回升一些(但四種方法都適用這招,代表溫度確實能局部緩解,卻不能完全補償對齊造成的損失);順帶一提,這幾種方法在其他面向各有取捨:DPO 跟 KTO 在事實準確度上領先,PPO 跟 ORPO 則在其他方向較強。最狠的數字來自 2026 年 4 月的研究:走完現代模型的完整訓練後段流程(SFT→DPO→RL)之後,模型在創意寫作上的語意多樣性只剩下基礎模型的約 37%——三分之二的多樣性在訓練過程中被磨掉了。這篇研究也發現:塌縮嚴重程度主要取決於訓練資料的組成方式(例如只用少數幾個「老師模型」的蒸餾資料,塌縮會特別嚴重),而不只是對齊演算法本身的問題——這代表①拓寬訓練資料的來源多樣性、②調整訓練資料的組成比例,都是能局部緩解(但無法完全逆轉)的具體解法。還有一個重要的反直覺發現:在使用時把推理功能強行關閉(讓推理模型直接給答案),並不能恢復任何已經因對齊而流失的多樣性——代表塌縮是訓練階段就決定的,不是使用階段的一個開關能救回來的。

你每天用的聊天 AI 全部都是「對齊版」——所以你感受到的「AI 講話都一個調調」,在論文裡有精確的數字對應:熵剩三分之一、語意多樣性剩 37%。這不是產品沒做好,是「安全、聽話」跟「多樣、有創意」本來就是訓練過程裡互相拉扯的兩端,公司選擇了前者。

T2
五招被證實能救回AI創意

病灶講完了:問題在多樣性、元兇是對齊訓練。好消息是這件事治得了,以下方法全部有論文實測,而且幾乎都是「想辦法讓 AI 的產出更散開」。第一招:溫度是「多樣性」參數,不是「創意」參數——拉高溫度不會可靠地提升創意評分(各任務、各模型的最佳溫度並不一致),但確實可靠地提升同一回應內部各點子之間的差異度。第二招:Best-of-N(讓同一個模型答很多次、只挑最好的),前面提過 8-10 人的等效值,但要記得那個「解題強、創作弱」的斜率差異。第三招:思維鏈提示,前面提過的 4 倍多樣性成長率。第四招:口語化取樣(Verbalized Sampling),2026 年 ICML 的研究提出——一種免訓練、純粹改變提示方式的技巧(例如直接要求模型「給出多個彼此不同的候選答案並附機率」),證實能有效繞開模型的模式塌縮、拉開輸出多樣性。這點也直接反駁了前一段「多樣性缺失是訓練資料裡就決定死的、推論階段的招式都救不了」這種較悲觀的說法——至少有部分推論階段的技巧確實有用,這是這個領域還在演進、尚無定論的地方,兩派證據並存。第五招:Quality-Diversity/population-based 演化法(MAP-Elites 系列):不用微調模型本體,只演化「提示詞」——把 MAP-Elites 這類演算法應用在提示詞本身,系統性地讓提示詞的具體特徵(few-shot 範例數量、推理深度等)作為演化的「表現型空間」維度,在 7 個 BigBench Lite 任務、多個不同 LLM 上都驗證有效。2026 年 6 月的後續研究(QD-LLM)進一步做了消融實驗,證實效果來源明確是「提示詞嵌入向量的無梯度演化」這個機制本身,而非其他混雜因素;用這種方法產生的多樣化解答,拿去微調模型後也證實有實際下游效益。另外還有一篇 2026 年 2 月的研究發現:思維鏈搭配「角色設定」(persona)提示能降低同質化(雖然這篇沒有同時測量對品質有沒有影響)。

把論文原理翻成明天就能用的操作:①同一個問題別只問一次拿第一個答案——問個 5 到 10 次再挑;②要求 AI「先推理再回答」;③直接命令它「給我 10 個彼此完全不同方向的版本,並附上你對每個版本的信心」。三招全免費,都是論文驗證過的原理。

T2
創意根本沒法客觀評,全片總結

講了一整集的分數,最後必須誠實面對一件事:連「怎麼幫創意打分數」這件事本身,學界都還沒有共識。2026 年的研究檢驗了目前廣泛使用的四種創意測驗(DAT、CDAT、PACE、RAT),發現沒有任何一個能可靠預測 AI 模型的「科學發想」能力;更根本的是,這些測驗在人類身上的效度本來就偏弱。有一個角度值得補充:在「創意寫作」這個特定領域,有一種叫「創意指數」(Creativity Index,一種計算文字與既有語料庫重疊程度的 n-gram 指標)的方法,確實能有效區分人類寫的跟 AI 生成的文字——代表不是所有評判方法都沒用,只是要用對地方、用對領域。第二層更不可靠:讓 AI 模型來評創意分數(LLM-as-a-Judge),同一個裁判模型重複評同一份作品,前後給的分數經常對不上自己;即使是目前公認最強的裁判模型 Claude 3.7 Sonnet,它給的創意評分跟真正人類專家(針對科學論文的評分)之間相關也偏弱。最誇張的是:評分結果對問法極度敏感——光是把問題裡的一個字換掉(例如「這方案有沒有『新意』」改問「有沒有『傳統/慣例』」),裁判給出的創意判定就會反轉。所以,這一整集所有數字你都該帶著這層保留來聽——這也是為什麼每個數字都標注了原始論文,供你自己核對。最後,用兩個還沒被完全解答的真實案例收尾:Stephen Thaler 開發的 AI 系統 DABUS,是史上第一個被列為專利申請「發明人」的 AI,申請橫跨全球五大主要司法管轄區——這場「AI 能不能算發明人」的官司不是單一國家的孤例,而是一場全球同步的法律測試案,背後的發明本身早在 2018-2019 年就已經產生,只是專利申請的法律爭議一路打到現在。回顧整集:AI 早就贏了「平均」人類,但從沒贏過「最強」的人類;它的問題不是不夠聰明,而是同一顆腦袋想一百次都想到同一個答案,而且不同公司的腦袋也正在長得越來越像;解方——提高取樣多樣性、先推理再回答、換個問法、一群個性不同的 AI 一起想——已經找到且有效。AI 有沒有創意,答案不在模型裡,在用的人手上:有沒有把多樣性刻意設計進去,決定了你拿到的是罐頭,還是驚喜。

這也是為什麼「創意評分」連法律都還在吵:DABUS 案至今在多個國家有不同判決結果,沒有全球共識。評分沒共識、身分沒共識,這個領域的每個「定論」都值得多問一句:誰量的?怎麼量的?這句話,也適用於你今天看到的每一支「AI 很神」或「AI 沒創意」的影片——包括我們這一支。