创作者经济

1053名学生实验:ChatGPT提高得分,原创性却靠因果训练

|作者: QUASA 编辑团队|2 分钟阅读| 6
1053名学生实验:ChatGPT提高得分,原创性却靠因果训练

2026年8月27日,博科尼大学与OpenAI合作开展的一项随机对照实验公布结果:1053名大一学生被分入ChatGPT、因果推理训练、两者兼有和对照四种条件。博科尼大学公布的数据 显示,ChatGPT使一次营销作业的五分制评分提高约0.86分,而学生之间想法差异的主要增量来自因果推理训练。

这项8月27日公布的实验给出的直接答案不是“AI改善或损害学习”二选一:ChatGPT提高了按既定标准评出的作品质量,却没有证明学生形成了可长期保持的独立能力;因果训练促成了更不常规的方案,开放ChatGPT也没有消除这项收益。所谓“原创性”,在这里特指文本中想法的多样性和语义差异,而非对现实创新价值的完整判断。

四组实验分别识别工具与训练的作用

CEPR讨论论文 将研究设计描述为2×2随机对照实验:参与者分别接受ChatGPT Edu访问、因果推理训练、两项干预,或两项都不接受。这样的设计可以单独估计语言模型和思维训练的效果,也能观察二者结合后是否相互加强或抵消。

  • 对照条件:没有ChatGPT访问,也不接受因果推理指导。
  • ChatGPT条件:可使用由GPT-4o支持的ChatGPT Edu,不接受因果训练。
  • 因果训练条件:学习建立因果链、解释作用机制并识别可能使结论失效的条件,不使用ChatGPT。
  • 组合条件:同时接受因果训练并获得ChatGPT访问。

所有学生处理同一项限时商业任务,为提高校友对大学纪念品商店的认知和使用提出顾问式建议。统一任务让组间比较更清楚,但也把结论限定在一个结构明确、标准营销知识丰富的问题上,不能直接外推到数学证明、开放式研究或长期课程学习。

0.86分提高的是作品评分,不是学习证明

评分者用五分量表审阅同一营销作业,ChatGPT辅助答案获得更高常规评分并更接近专家建议

学生答案按照1至5分量表评价,核心标准是建议能否提高商店认知度和使用率。获得ChatGPT访问后,评分相对估计为2.09分的对照基准提高约0.86分;答案还包含更多想法、逻辑更连贯,并更接近三名领域专家给出的建议。

这项优势不只是语言润色。控制文本特征、句式复杂度、逻辑连贯性和想法数量后,仍有约一半的评分效应未被这些因素解释,说明模型也改变了建议内容。不过,准确结论仍是ChatGPT改善了这一次特定任务的最终产出,而不是学生已经掌握了营销知识。

实验评估的是提交文本,没有通过延迟考试检验记忆,也没有要求AI组关闭工具后重新完成陌生任务。因此,高分无法说明学生能否解释方法、迁移推理,或在下一次独立作答时保持表现。

因果训练扩大了想法差异

接受因果推理训练的学生说明因果链、作用机制和失败条件,提出与同伴差异更大的方案

研究没有把常规总分直接当作创造力,而是分别分析每份答案包含多少核心想法、同一答案内的想法是否多样,以及一名学生的核心方案与其他参与者相距多远。这样可以区分“写出更多点子”和“提出别人较少想到的点子”。

ChatGPT明显增加了想法数量,却没有对学生之间的想法差异产生清晰的独立提升。因果训练的作用不同:学生更常说明建议为什么可能奏效、通过什么机制发生作用,以及在哪些条件下可能失败;他们的核心方案也与同伴更不相似。

组合条件保留了因果训练带来的多样性,同时获得了与单独使用ChatGPT相近的评分和想法数量。由此可以把标题中的“原创性靠因果训练”限定得更准确:在这项任务及其代理指标内,因果训练是扩大想法差异的主要驱动力;数据不支持“ChatGPT必然损害原创性”,也不能证明训练会普遍提升所有形式的创造力。

既有量表更奖励标准答案

因果训练没有带来更高的常规评分,并不等于训练没有改变思考。该量表重点奖励围绕“提高认知”和“促进使用”形成清晰、完整并符合标准营销知识的建议,没有单独奖励罕见方案、作用机制或可证伪条件。

统计分解显示,逻辑连贯和想法数量与高分相关;偏离典型答案、强调机制和失败条件的产出却没有获得同等回报。ChatGPT因而更容易帮助新手生成评分者熟悉的专家式答案,因果训练则把学生带向更宽的解题空间,而总分没有完整捕捉这种差异。

这揭示的是评价工具的边界。只看最终文本及其规范程度,无法区分学生真正理解了问题、善于调用模型,还是获得了一个更符合量表的答案;如果教学目标包含提出替代假设和解释机制,这些能力需要成为独立评价维度。

随机化增强了因果判断,场景仍然有限

随机设计比比较“经常使用AI”和“不使用AI”的学生更能隔离干预效应,四种条件也让研究者看到因果训练在ChatGPT可用时仍能发挥作用。但随机分配以课堂为单位,样本来自同一所大学的基础管理课程,实验只覆盖一次短时营销任务。

8月28日发表的一篇 独立方法解读 核对了任务约45分钟、答案上限180词等设计,并指出研究没有设置延迟保持测试、跨任务迁移测试或无AI后测。因此,实验能够回答两种干预如何改变当场提交的作品,却不能回答学生本人是否长期学得更好。

研究目前以CEPR讨论论文形式发布,尚无独立复现;想法差异也依赖自动文本分析和语义距离指标。这些指标适合比较大样本中的相对差异,但不能直接判断某项建议在现实中是否新颖、可行或有效。

现有证据支持的是互补关系:ChatGPT提高标准化任务的评分、逻辑和想法数量,因果训练主要增加机制解释、可证伪思考和方案差异。接下来仍需更长周期、更多学科和关闭AI后的测试,才能判断作品层面的提升是否转化为学生可保持、可迁移的能力。

分享:

订阅我们的新闻通讯

将最新 Web3、AI 和加密货币新闻直接发送到您的邮箱。

0