你可能看過那則報導:用 AI 幫忙做數學的學生,考試反而考得更差。
那是真的。而且不是網路傳言,是一份近千名高中生的隨機對照試驗, 2025 年發表在《美國國家科學院院刊》(PNAS)。
但報導多半漏了一件事——那篇論文的標題本身就有一個限定詞。
賓州大學華頓商學院的 Bastani 等人,在 2023–24 學年於土耳其進行了一場預先註冊的隨機對照試驗。近 1,000 名九到十一年級的高中生,被隨機分成三組:
| 組別 | 他們拿到什麼 |
|---|---|
| 對照組 | 只有課本與筆記 |
| GPT Base | 原版 ChatGPT,沒有任何限制 |
| GPT Tutor | 加了老師設計的護欄——給提示,不給答案 |
三組用同樣的教材練習同樣的內容。練習結束後,把 AI 全部收走,讓三組考同一份試卷。
| 組別 | 練習時的表現(相對於對照組) |
|---|---|
| GPT Base | +48% |
| GPT Tutor | +127% |
如果研究到這裡就結束,結論會是「AI 讓學生進步很多」。很多產品的宣傳素材,就是停在這一步。
| 組別 | 無 AI 考試(相對於對照組) |
|---|---|
| GPT Base | -17% |
| GPT Tutor | 與對照組大致相同 |
用原版 ChatGPT 練習的那一組,考得比從來沒碰過 AI 的對照組還差 17%。 他們在練習時看起來進步最多的那 48%,一到考場就不見了——而且還倒扣。
研究者的解釋很直白:沒有護欄的時候,學生把 AI 當成拐杖。練習時走得很快,拐杖一拿走,自己就走不動了。
是「AI 給不給答案」。
兩組用的是同一個 GPT-4,同樣的題目、同樣的時間。唯一的差別是 GPT Tutor 被設定成只給下一步的方向,不給完整解答。這一個差別,讓 −17% 變成 0。
而市面上大多數的免費解題工具,運作方式正是 GPT Base 那一組:拍照上傳,直接給你完整的解答過程。孩子看著那個解答,會覺得「我懂了」。研究告訴我們的是:那個「懂了」,在考場上是不成立的。
這也是我們從一開始就選擇的設計:
孩子選錯的時候,真正該被拆開的是他當時想的那條路,而不是把正確答案再抄一遍。
也要說清楚:我們平台的主體是題庫練習與錯題回溫——照你設定的考試範圍出題、 錯的題隔一段時間回來再考你。這部分不在這份研究的討論範圍內; 「反覆提取+間隔複習」的學習效果,是教育心理學裡證據最充分的另一批研究。 AI 提示只是你卡住那一刻的護欄,從來不是主角。
這份研究還有一個結論,對我們不利,但更該講:GPT Tutor 那一組,在考試上也沒有比對照組好。
護欄做到的是「不傷害」,不是「更有效」。那一組在練習時領先了 127%, 但拿掉 AI 之後,只是回到和只用課本的學生同一條線上。
所以我們不會說「用了我們就會進步」——這份研究不支持那句話,我們也不打算超譯它。我們能說的是:如果孩子已經在用 AI 寫數學,那麼它給不給答案,是有實證差別的。 一個給答案的工具,可能正在讓他練習時看起來很順、考場上卻更吃力。 至於能不能進步,要看有沒有人把錯的地方真正拆開來看——那件事,工具只能幫忙,不能代勞。
Bastani, H., Bastani, O., Sungu, A., Ge, H., Kabakcı, Ö., & Mariman, R. (2025). Generative AI without guardrails can harm learning: Evidence from high school mathematics. PNAS. 原始論文|華頓商學院官方摘要
每一場大型模考,我們會做一份考前藍圖:把四屆同場次試卷做結構統計(題型、配分、單元分佈),再排成逐日計畫。免費,不用註冊。
© 御藍教育 Royal Blue Education。歡迎分享本頁連結;全文轉載或改作請先來信取得同意。