OpenAI 研究:ChatGPT 提升答案质量,批判思考训练扩大创意范围

OpenAI 分享一项超过 1,000 名大学生的随机实验:ChatGPT 让作业更完整、更有逻辑,因果推理训练则带来更多元和独特的想法,两者效果可以互补。

OpenAI 于 2026 年 8 月 27 日分享一项由 Bocconi University 研究人员与 OpenAI Economic Research 合作的随机实验。研究对象是超过 1,000 名一年级大学生,任务是为大学纪念品店提出 marketing recommendations。学生按上课时段分成四组:可以使用 ChatGPT、接受 causal reasoning 训练、两者都有,或两者都没有。

结果把「答案写得更好」和「想出更多不同方向」分开了。研究人员用受训 human grader 的五分 rubric 评估作业,也用自动文字分析测量想法数量和多样性、因果推理痕迹,以及与三名专家建议的相似程度。OpenAI 表示,可以使用 ChatGPT 的学生在五分制上高出接近一分;他们提出更多想法、逻辑更清楚,答案也更接近专家建议。

这不等于学生把作业交给 ChatGPT 代做。研究描述的流程仍要求学生决定问什么、判断回复是否有用,以及选择哪些内容放入最后作业。换句话说,工具主要拉近了新手与专业答案之间的表面差距,但中间仍有提问、评估和取舍。

因果推理训练带来的是另一种效果。完成这个与 AI 无关的游戏、例子、问题和 feedback exercise 的学生,较能解释自己的构思为什么可能有效、在什么情况下会失效;但他们在原本只测量「提高认知和使用率」两个 marketing 目标的 rubric 上,没有得到更高分。自动分析却显示,他们提出的想法更多元,与同学答案的重叠更少。

同时获得 ChatGPT 和因果推理训练的组别,显示最广泛的改善:保留了 ChatGPT 带来的逻辑清晰度和更多想法,也保留了训练带来的想法差异、假设检验和解释能力。这个结果没有支持「AI 或思考能力二选一」的简单说法,反而指出两者解决的是不同问题。

对于学校和企业培训而言,最值得注意的是评分方式。当 AI 可以协助产生 polished、接近专家格式的答案,只看 final output 便较难判断一个人真正理解了什么。更完整的评估可以要求保留推理过程、比较多个方案、解释失败条件,并为 originality 和 causal reasoning 设置明确评分点。

不过,这是一项在单一大学、单一商业个案和 ChatGPT(GPT-4o)设置下进行的研究,OpenAI 也是合作方。结果对其他年龄层、科目、模型和教学环境是否同样成立,仍需要更多独立及跨场景研究。较稳妥的结论是:在这个实验里,AI 协助学生把答案做得更完整,批判思考训练则让想法更广;教育设计要同时测量两者。

MODULE.002 //

更多 Insights

分享网站、AI automation、数码营销、AI news 和 VMTS 公司新闻。