AI教育

IMPACT ENGLISH · SINCE 2002

用 AI 出题:练习测到了什么

2026-10-03 19:13:24 AI教育研究组 27728

本文性质: 实证 + 假设(Evidence / Hypothesis) 证据标签: 观察 Observation/模型 Model/假设 Hypothesis/实证 Evidence

本篇涉及的证据类型:实证 Evidence/假设 Hypothesis/模型 Model。凡属本院课堂观察与教学模型的部分,均不作效果承诺。

工具可以几分钟生成一套练习题,但一套题能不能测到你想要的东西,和它长得像不像考题是两回事。

题做了不少,能力没动

本院教研组试过用工具批量出题,最初的印象是效率高得惊人。用了一段时间后发现两个问题:一是不少题目可以靠常识或选项排除法答对,不需要真正掌握考点;二是同一份材料生成的题目,反复测的都是几个表层事实,深层的推理与迁移没有被碰到。也有用得好的时候:把出题要求写清楚——要考哪一层、干扰项从哪些常见误解里取——生成的结果会比笼统一句「出几道题」好得多。以上为本院教研组的出题记录,属观察层。

题目测的是哪一层

测量学早就区分了不同层次的效度。Messick 1989 的构念效度框架指出,一道题真正要测的是某个能力,而不是它看起来像不像考题(后者是表面效度)。选择题的编写也有可循的原则:选项之间应互斥、干扰项要有吸引力但确实错误、避免出现语法线索或绝对化词汇泄露答案(Haladyna 等 2002)。另一方面,只要题目的形式恰当,练习本身就有检索的价值(Roediger & Karpicke 2006 关于提取练习的研究)。所以问题不在「要不要用工具出题」,而在「出了之后谁来把关」。

本院的三条校验

本院据此定了三条校验。第一,无知识者测验:把题给一个完全没学过这段内容的人做,如果他能靠排除法答对一半以上,这套题就不能用。第二,选项排他性检查:逐个看有没有两个选项都对、或者只有一个选项带绝对化词汇。第三,覆盖检查:把题目按「事实、理解、应用」三层分类,如果九成集中在事实层,就补题或换出题要求。

三条边界

三条边界。第一,工具出题的质量波动很大,同一提示词不同批次的差异超出预期,必须逐题过目。第二,校验本身要花时间,出题的效率优势会被抵消一部分,适合用在题量大、结构性强的科目上。第三,本院没有做过工具题与人工题在学生表现上的对照,不能断言两者等效。

今天就能开始

今天生成一套十道题,交给一个没学过这部分内容的人做一遍,看他能答对几道。

本文依据

  • 观察来源: 本院教研组出题记录(2024 年至今):工具生成题目在表层事实层集中、部分可被排除法破解,属教研观察。
  • 模型出处: 「无知识者测验、选项排他性检查、三层覆盖检查」三条,为本院内部出题校验模型。
  • 待验证项: 工具题与人工题在学生表现上的可比性,本院尚无对照数据,按待验证项处理。
  • 外部文献: Messick 1989(构念效度框架);Haladyna, Downing & Rodriguez 2002(选择题编写原则);Roediger & Karpicke 2006(提取练习的收益)。
首页 课程 研究 微信