AI教育

IMPACT ENGLISH · SINCE 2002

AI 反馈:改得快不等于改得对

2026-09-29 19:07:13 AI教育研究组 25377

本文性质: 观察 + 假设(Observation / Hypothesis) 证据标签: 观察 Observation/模型 Model/假设 Hypothesis/实证 Evidence

本篇涉及的证据类型:观察 Observation/假设 Hypothesis/实证 Evidence。凡属本院课堂观察与教学模型的部分,均不作效果承诺。

写作批改这件事,过去要等三天,现在十分钟就能收到一份密密麻麻的批注。批注出现得快、条目多、语气客气,看上去比手改更周到。但反馈的价值从来不由速度决定,也不由条数决定,而由它有没有让人知道下一步该改什么决定。

反馈的价值不由速度决定,也不由条数决定

本院课堂观察里有一个反复出现的对比:教师手改时通常只挑两三处最关键的问题,学生第二天多半真的动了那两三处;自动批注一次给出十几条,学生的第一反应往往是先改最容易改的那几条——拼写、冠词、单复数,而段落之间的逻辑一条没动。原因并不神秘:人的注意力是有限的,反馈越多,注意力越会往门槛低的地方流。这不是学生偷懒,是设计问题。

反馈研究的元分析说了什么

反馈研究对此有相当明确的说法。Kluger 与 DeNisi 1996 年对六百多个效应量的元分析发现,反馈的平均效果并不大,而且有相当一部分干预产生了负向作用——被评价这件事本身会占用注意力。Hattie 与 Timperley 2007 年提出的模型把反馈分成三层:往哪去、现在在哪、下一步怎么走,并指出只评价结果、不给下一步路径的反馈,接收者往往不知道要改什么。Stevenson 与 Phakiti 2014 年关于计算机生成反馈的元分析发现,机器反馈对写作质量有正向作用,但效应大小受任务类型与反馈聚焦方式调节。换句话说,决定效果的是改什么,而不是谁改。

本院把自动反馈限定在可判定的维度

本院课程研发部的做法是把自动反馈限定在可判定的维度上:拼写、常见搭配、时态一致性、句子长度分布——这些机器判断稳定、重复性高;而论证是否成立、例子是否支撑论点、语气是否合适,交回教师与同伴。我们还加了一条硬规则:一条反馈如果附不出一个可执行的下一步,就不发出去。宁可少五条,也不要让学生面对一面红墙。

三条边界:不分水平、挤占时间、改错游戏

三点边界要说清楚。第一,自动批注不区分学生水平,同一个错误对初学者和进阶者的意义完全不同,机器不会替你排优先级。第二,批注总量上升会挤占学生与教师处理反馈的时间,反馈条数与有效反馈并不成正比。第三,如果评价只看红字清没清干净,写作会退化成改错游戏,学生学会的是躲错误,不是表达。本院没有做过对照实验,以上是课堂观察与文献推理的合并判断,不作为效果承诺。

今天就能开始

下次收到自动批注,先圈出三条,只改与这篇文章想说什么直接相关的那一条,其余先记下、不动手。

本文依据

  • 观察来源: 本院写作课与课程研发部课堂观察记录(2019 年至今):手改稿的修改率高于批量批注稿,属课堂观察,未做统计检验。
  • 模型出处: 可判定维度清单与「无下一步不发」规则为本院课程研发部内部教学建议,非外部研究成果。
  • 待验证项: 反馈聚焦度与写作质量提升之间的因果关系,需对照实验检验;本院尚无该实验。
  • 外部文献: Kluger & DeNisi 1996(Psychological Bulletin 反馈干预元分析);Hattie & Timperley 2007(Review of Educational Research 反馈模型);Stevenson & Phakiti 2014(Assessing Writing 计算机生成反馈元分析)。
首页 课程 研究 微信