御藍教育學習方法

研究證實了家長的直覺:用 AI 寫作業的學生,考試考更差——但有一個例外

你可能看過那則報導:用 AI 幫忙做數學的學生,考試反而考得更差。

那是真的。而且不是網路傳言,是一份近千名高中生的隨機對照試驗, 2025 年發表在《美國國家科學院院刊》(PNAS)。

但報導多半漏了一件事——那篇論文的標題本身就有一個限定詞

這份研究做了什麼

賓州大學華頓商學院的 Bastani 等人,在 2023–24 學年於土耳其進行了一場預先註冊的隨機對照試驗。近 1,000 名九到十一年級的高中生,被隨機分成三組:

組別他們拿到什麼
對照組只有課本與筆記
GPT Base原版 ChatGPT,沒有任何限制
GPT Tutor加了老師設計的護欄——給提示,不給答案

三組用同樣的教材練習同樣的內容。練習結束後,把 AI 全部收走,讓三組考同一份試卷。

練習的時候,AI 組表現亮眼

組別練習時的表現(相對於對照組)
GPT Base+48%
GPT Tutor+127%

如果研究到這裡就結束,結論會是「AI 讓學生進步很多」。很多產品的宣傳素材,就是停在這一步。

但把 AI 收走之後

組別無 AI 考試(相對於對照組)
GPT Base-17%
GPT Tutor與對照組大致相同

用原版 ChatGPT 練習的那一組,考得比從來沒碰過 AI 的對照組還差 17%。 他們在練習時看起來進步最多的那 48%,一到考場就不見了——而且還倒扣。

研究者的解釋很直白:沒有護欄的時候,學生把 AI 當成拐杖。練習時走得很快,拐杖一拿走,自己就走不動了。

所以真正的分界,不是「用不用 AI」

是「AI 給不給答案」。

兩組用的是同一個 GPT-4,同樣的題目、同樣的時間。唯一的差別是 GPT Tutor 被設定成只給下一步的方向,不給完整解答。這一個差別,讓 −17% 變成 0。

而市面上大多數的免費解題工具,運作方式正是 GPT Base 那一組:拍照上傳,直接給你完整的解答過程。孩子看著那個解答,會覺得「我懂了」。研究告訴我們的是:那個「懂了」,在考場上是不成立的。

我們怎麼做

這也是我們從一開始就選擇的設計:

  • 卡住的那一刻,先給方向不給答案。分層提示先問「你剛才是怎麼想的」,再給下一步該往哪裡看。
  • 每個錯的選項,都寫明錯在哪一步。不是告訴你答案是 C,是告訴你選 B 的人在哪裡斷掉——那是兩種完全不同的資訊。

孩子選錯的時候,真正該被拆開的是他當時想的那條路,而不是把正確答案再抄一遍。

也要說清楚:我們平台的主體是題庫練習與錯題回溫——照你設定的考試範圍出題、 錯的題隔一段時間回來再考你。這部分不在這份研究的討論範圍內; 「反覆提取+間隔複習」的學習效果,是教育心理學裡證據最充分的另一批研究。 AI 提示只是你卡住那一刻的護欄,從來不是主角。

但我們也要把話說完

這份研究還有一個結論,對我們不利,但更該講:GPT Tutor 那一組,在考試上也沒有比對照組好。

護欄做到的是「不傷害」,不是「更有效」。那一組在練習時領先了 127%, 但拿掉 AI 之後,只是回到和只用課本的學生同一條線上。

所以我們不會說「用了我們就會進步」——這份研究不支持那句話,我們也不打算超譯它。我們能說的是:如果孩子已經在用 AI 寫數學,那麼它給不給答案,是有實證差別的。 一個給答案的工具,可能正在讓他練習時看起來很順、考場上卻更吃力。 至於能不能進步,要看有沒有人把錯的地方真正拆開來看——那件事,工具只能幫忙,不能代勞。

研究出處

Bastani, H., Bastani, O., Sungu, A., Ge, H., Kabakcı, Ö., & Mariman, R. (2025). Generative AI without guardrails can harm learning: Evidence from high school mathematics. PNAS. 原始論文華頓商學院官方摘要

每一場大型模考,我們會做一份考前藍圖:把四屆同場次試卷做結構統計(題型、配分、單元分佈),再排成逐日計畫。免費,不用註冊。

© 御藍教育 Royal Blue Education。歡迎分享本頁連結;全文轉載或改作請先來信取得同意。