近年來,人工智慧(AI)與電腦科學領域的研究投稿量呈現爆發式成長。以頂級國際機器學習會議(ICML)為例,今年獲選的論文高達近 6,000 篇,幾乎是前一年同期的兩倍。然而,具備專業能力的同儕審查(Peer Review)人力成長速度遠遠跟不上論文數量的激增,使整個學術評審體系瀕臨癱瘓。
更嚴重的問題在於「重現性危機」(Reproducibility Crisis)。在傳統同行評審中,審稿人主要針對論文的新穎性與邏輯進行判斷,極少有時間去跑程式碼或驗證數據。重現他人的研究不僅耗時費力、過程如偵探般繁瑣,且對審稿人自身的學術生涯幾乎沒有實質獎勵。這導致大量發表論文中的實驗主張從未被任何人二次驗證,學術界恐面臨「將未來知識建構於不穩固地基上」的風險。
黑客松實驗:AI 代理人大規模重現研究 為測試 AI 能否解決此難題,知名 AI 開源平台Hugging Face與alphaXiv聯合舉辦一場黑客松競賽。該活動旨在驗證:在提供數據、程式碼與方法的前提下,AI 代理人(AI agents)能否獨立重現實驗並得出相同結果?
- 參賽規模與成果: 競賽吸引超過 1,200 名參賽者,其中許多人並非專業 AI 研究員。例如,冠軍 Jansen Tang 本職為銀行資訊安全風險主管,他利用自行建構的 AI 代理人團隊(稱為 "KRACK"),在短短 19 天內自主重現363篇論文,成為重現數量最多的參賽者。
- 評估與裁決機制: 主辦單位先從 ICML 的 6,000 多篇論文中擷取核心科學結果,再由 AI 代理人嘗試執行程式碼與數據。若原數據缺失,代理人會尋找或生成合適的合成數據進行「簡化驗證」(Toy reproduction)。所有過程皆記錄於日誌中,最後由大語言模型(GLM-5.2)擔任裁判,給出四種裁決:已驗證(Verified)、偽造/不符(Falsified)、簡化驗證(Toy)或無結論(Inconclusive)。
主要發現:抓出人類審稿者遺漏的漏洞 本次黑客松共涵蓋2,226篇論文,成果揭露AI自動化驗證的巨大潛力與學術界現存的漏洞:
- 成功重現:約半數論文(1,112 篇)有至少一項結果被 AI 成功重現,其中 266 篇論文的所有實驗結果皆被完美驗證。
- 發現錯誤:共有496 篇論文包含至少一項無法重現或存在爭議的結果。目前 Hugging Face已覆核並確認,至少有12篇已獲選的論文包含實質性錯誤。
- 錯誤類型: 部分錯誤屬於作者更新程式碼後忘記修訂論文的無心之過(如麻省理工學院研究生的論文);但也有部分錯誤相當嚴重,直接推翻論文的核心論點。甚至有高分獲選的重點論文(Spotlight Paper),原本的審稿人就曾坦承「因未仔細檢查證明而給予低信心度分數」,而AI 成功補足這層防線。
應用瓶頸與未來的重大挑戰 儘管黑客松證明AI代理人能在初審階段抓出低級錯誤(Low-hanging issues),但要將其全面普及仍面臨三大關卡:
- 高昂的算力成本: 芝加哥大學 SAI Labs 的平行研究指出,他們使用開源代理人測試 ICML 的 120 篇口頭報告論文時,僅有 8 篇能重現 80% 以上的結果。部分論文若要重現完整實驗,估計需耗費高達 220 萬美元(約 7,000 萬台幣)的硬體與算力資源。
- 數據與程式碼不公開: 許多由科技巨頭(如 Google、Meta)主導的研究包含商業機密,未公開專有數據與程式碼。若學術會議強制要求公開,可能導致企業退出學術發表,損害產學合作。
- 算力資源消耗: 即使是參賽冠軍 Jansen Tang 也表示,為了跑完這些驗證,他已耗盡個人一整季的 AI 算力額度(Tokens),未來要如何持續運作仍是難題。
結論 AI 代理人無法完全取代人類專家對論文「創新價值」的審美判斷,但它能承擔起繁重、無償且無人願做的「基礎代碼與數據查核」工作。正如主辦人 Abubakar Abid 所言,理想狀況下,未來每篇論文提交時都應先經過 AI 代理人的自動化重現檢測,這將能大幅提升學術出版的嚴謹度與誠信。
閱讀更多
https://www.science.org/content/article/researchers-presented-6000-papers-major-meeting-could-ai-reproduce-their-findings