logo logo
焦點觀點
::: 首頁 焦點觀點專欄 學者在一場重要會議上提出了 6000 篇論文。AI 能否複製他們的實驗結果?

學者在一場重要會議上提出了 6000 篇論文。AI 能否複製他們的實驗結果?

2026-09-15
TAG AI Agents Reproducibility Crisis Peer Review

近年來,人工智慧(AI)與電腦科學領域的研究投稿量呈現爆發式成長。以頂級國際機器學習會議(ICML)為例,今年獲選的論文高達近 6,000 篇,幾乎是前一年同期的兩倍。然而,具備專業能力的同儕審查(Peer Review)人力成長速度遠遠跟不上論文數量的激增,使整個學術評審體系瀕臨癱瘓。

更嚴重的問題在於「重現性危機」(Reproducibility Crisis)。在傳統同行評審中,審稿人主要針對論文的新穎性與邏輯進行判斷,極少有時間去跑程式碼或驗證數據。重現他人的研究不僅耗時費力、過程如偵探般繁瑣,且對審稿人自身的學術生涯幾乎沒有實質獎勵。這導致大量發表論文中的實驗主張從未被任何人二次驗證,學術界恐面臨「將未來知識建構於不穩固地基上」的風險。

黑客松實驗:AI 代理人大規模重現研究 為測試 AI 能否解決此難題,知名 AI 開源平台Hugging FacealphaXiv聯合舉辦一場黑客松競賽。該活動旨在驗證:在提供數據、程式碼與方法的前提下,AI 代理人(AI agents)能否獨立重現實驗並得出相同結果?

主要發現:抓出人類審稿者遺漏的漏洞 本次黑客松共涵蓋2,226篇論文,成果揭露AI自動化驗證的巨大潛力與學術界現存的漏洞:

  1. 成功重現:約半數論文(1,112 )有至少一項結果被 AI 成功重現,其中 266 篇論文的所有實驗結果皆被完美驗證。
  2. 發現錯誤:共有496 篇論文包含至少一項無法重現或存在爭議的結果。目前 Hugging Face已覆核並確認,至少有12篇已獲選的論文包含實質性錯誤。
  3. 錯誤類型: 部分錯誤屬於作者更新程式碼後忘記修訂論文的無心之過(如麻省理工學院研究生的論文);但也有部分錯誤相當嚴重,直接推翻論文的核心論點。甚至有高分獲選的重點論文(Spotlight Paper),原本的審稿人就曾坦承「因未仔細檢查證明而給予低信心度分數」,而AI 成功補足這層防線。

應用瓶頸與未來的重大挑戰 儘管黑客松證明AI代理人能在初審階段抓出低級錯誤(Low-hanging issues),但要將其全面普及仍面臨三大關卡:

結論 AI 代理人無法完全取代人類專家對論文「創新價值」的審美判斷,但它能承擔起繁重、無償且無人願做的「基礎代碼與數據查核」工作。正如主辦人 Abubakar Abid 所言,理想狀況下,未來每篇論文提交時都應先經過 AI 代理人的自動化重現檢測,這將能大幅提升學術出版的嚴謹度與誠信。

閱讀更多

https://www.science.org/content/article/researchers-presented-6000-papers-major-meeting-could-ai-reproduce-their-findings

 

上一則 回索引頁