研究背景:審稿體系的崩潰與 AI 介入 隨著大語言模型(LLM)等生成式AI工具的普及,科學出版品數量呈爆發式成長,2025年全球發表量已突破800萬篇,五年內翻倍。然而,審稿人力嚴重不足,導致審稿週期拖延數月甚至一年以上。為緩解這場「同行評評審危機」,越來越多學者與出版社開始嘗試引入 AI 工具。Frontiers的調查顯示,2025年已有超過半數(51%)的研究員在審稿過程中使用AI,遠高於前一年的 29%,且大多數是在期刊缺乏明確規範的「灰色地帶」下秘密進行。
AI 審稿的獨特優勢:精準、一致與客觀 研究顯示,AI 在執行繁瑣、重複性高的審查任務上表現極佳,能補足人類審稿者因時間有限或疲勞而產生的忽視:
1. 細節與數據查核: 史丹佛大學James Zou等人的研究指出,GPT-5能精準檢查計算錯誤及內文與圖表數據的吻合度,並在2,500篇獲選論文中發現約三分之一包含影響重複性的錯誤(其中83%經人工證實)。
2. 客觀性與一致性: 相比人類審稿人常給出「缺乏熱情」等主觀且敷衍的評語,AI評語更為客觀一致。卡內基美隆大學Seungone Kim的研究顯示,GPT在綜合指標上的表現甚至超越最高分的人類審稿者,並能抓出約 25% 人類漏看的非瑣碎問題。
3. 輔助論文寫作與初審:Google的Gemini Paper Assistant工具在NeurIPS 大會測試中獲得86%作者的肯定;bioRxiv等預印本伺服器亦提供AI技術檢查,協助作者在投稿前修復漏洞。
AI 審稿的局限性與潛在風險 儘管AI表現出強大的輔助潛力,但在核心的學術價值判斷上仍存在嚴重缺陷:
· 學術偏見與「同質化」: 研究發現,AI容易偏好高知名度機構的論文,對低名氣機構存在拒稿偏見;同時,過度一致的評分可能形成「單一文化」,抑制具革命性或非主流的創新思想。
· 脈絡理解不足與幻覺: AI 受限於工作記憶,易忽視跨章節或附錄的細節。例如 AI 曾批評一篇粒子物理論文缺乏數據分析細節,卻不知該領域慣例是將數據集中存放於CERN資料庫。
· 過度繁瑣與無理要求:AI評語往往過於冗長且抓小放大,甚至提出需要數年實驗才能完成的非必要修改要求,缺乏人類專家的實務裁量權。
· 時間節省有限: UCL 的研究指出,審稿人使用AI雖能減少查閱文獻的時間,但需要花額外時間核對AI的給出資訊,實際省下的時間微乎其微。
研討會與期刊的實務試點 面對 AI 浪潮,多家頂級學術機構已開啟實體測試:
· AAAI 大會試點: AAAI 2026 大會處理高達 3 萬篇投稿,並為每篇論文提供一份 AI 評語。調查顯示作者普遍偏好 AI 評語的詳盡度,但裁判與作者均認同 AI 無法取代人類對「新穎性」與「整體價值」的直覺判斷。
· ICLR 大會實驗: 測試讓人類審稿者參考 AI 意見,結果 27% 的審稿人修訂評語,且三分之二的修訂版被評為品質提升。
· 《NEJM AI》快速通道: 該期刊推出 7 天快速審稿通道,由編輯結合 AI 分析進行裁決。編輯表示採用「信任但驗證」原則,AI 在抓出方法論瑕疵上發揮極大作用。
結論 學術界一致認為,AI 審稿人可以作為強大的「輔助工具」,但絕不能完全「取代」人類專家。理想的未來模式是「人類加上 AI 工具」的協同合作,由 AI 處理代碼執行、公式推導與數據比對等繁重工作,再由人類審稿者進行最終的學術價值裁決,以在提升效率的同時維護學術研究的嚴謹度。
閱讀更多