OpenAI 研究:ChatGPT 提升答案品質,批判思考訓練擴大創意範圍

OpenAI 分享一項超過 1,000 名大學生的隨機實驗:ChatGPT 令作業更完整、更有邏輯,因果推理訓練則帶來更多元和獨特的想法,兩者效果可以互補。

OpenAI 於 2026 年 8 月 27 日分享一項由 Bocconi University 研究員與 OpenAI Economic Research 合作的隨機實驗。研究對象是超過 1,000 名一年級大學生,任務是為大學紀念品店提出 marketing recommendations。學生按課堂時段分成四組:可使用 ChatGPT、接受 causal reasoning 訓練、兩者皆有,或兩者皆沒有。

結果把「答案寫得更好」和「想出更多不同方向」分開了。研究人員用受訓 human grader 的五分 rubric 評估作業,也用自動文字分析量度想法數量和多樣性、因果推理痕跡,以及與三名專家建議的相似程度。OpenAI 表示,能使用 ChatGPT 的學生在五分制上高出接近一分;他們提出更多想法、邏輯更清楚,答案也更接近專家建議。

這不等於學生把作業交給 ChatGPT 代做。研究描述的流程仍要求學生決定問什麼、判斷回覆是否有用,以及選擇哪些內容放入最後作業。換句話說,工具主要拉近了新手與專業答案之間的表面差距,但中間仍有提問、評估和取捨。

因果推理訓練帶來的是另一種效果。完成這個與 AI 無關的遊戲、例子、問題和 feedback exercise 的學生,較能解釋自己的構思為什麼可能有效、在什麼情況下會失效;但他們在原本只量度「提高認知和使用率」兩個 marketing 目標的 rubric 上,沒有得到更高分。自動分析卻顯示,他們提出的想法較多元,與同學答案的重疊較少。

同時獲得 ChatGPT 和因果推理訓練的組別,顯示最廣泛的改善:保留了 ChatGPT 帶來的邏輯清晰度和更多想法,也保留了訓練帶來的想法差異、假設檢驗和解釋能力。這個結果沒有支持「AI 或思考能力二選一」的簡單說法,反而指出兩者解決的是不同問題。

對學校和企業培訓而言,最值得注意的是評分方式。當 AI 可以協助產生 polished、接近專家格式的答案,只看 final output 便較難判斷一個人真正理解了什麼。更完整的評估可以要求保留推理過程、比較多個方案、解釋失敗條件,並為 originality 和 causal reasoning 設定明確評分點。

不過,這是一項在單一大學、單一商業個案和 ChatGPT(GPT-4o)設定下進行的研究,OpenAI 亦是合作方。結果對其他年齡層、科目、模型和教學環境是否同樣成立,仍需要更多獨立及跨場景研究。較穩妥的結論是:在這個實驗裡,AI 協助學生把答案做得更完整,批判思考訓練則令想法更闊;教育設計要同時量度兩者。

MODULE.002 //

更多 Insights

分享網站、AI automation、數碼營銷、AI news 和 VMTS 公司新聞。