引用与核查:AI 给的出处要自己走一遍
本文性质: 观察 + 实证(Observation / Evidence) 证据标签: 观察 Observation/模型 Model/假设 Hypothesis/实证 Evidence
本篇涉及的证据类型:观察 Observation/实证 Evidence/假设 Hypothesis。凡属本院课堂观察与教学模型的部分,均不作效果承诺。
让 AI 找一段研究的出处,它常常给出一个格式规整、期刊名眼熟的引用。问题是,格式规整和真实存在是两件事。核查的成本,正在成为使用 AI 的一项固定成本。
格式规整与真实存在是两件事
本院在整理研究述评时遇到过一次典型案例:一份看起来很完整的文献清单里,三条引用的期刊卷号对不上,一条的作者与年份组合查不到,逐条回溯花了将近一个小时。这不是个例,而是生成式模型的常见行为:语言模型的目标是生成通顺的文本,不是维护一个可查询的数据库。把通顺当成准确,是使用中最容易犯的错。
幻觉研究与横向阅读
Ji 等 2023 年对自然语言生成中的幻觉做了系统梳理,把虚构引用、事实错配、来源混淆归为不同类别的失真,并指出单纯依靠模型自检难以根除。Wineburg 与 McGrew 2019 年研究专业事实核查者的做法时提出了横向阅读:不深耕单个页面,而是离开当前页面去看别人怎么说这个来源——这个方法对 AI 给出的引用同样适用。需要说明的是,这两项研究都不是针对中文学习者设计的,迁移到本院场景属推理,未经本院实验检验。
本院的三步核查法
本院资源编辑部对带引用的稿件执行三步核查。第一步查存在:用期刊名加年份加标题去检索,至少找到一条能打开的原文。第二步查内容:原文是否真说了被引用的那句话。第三步查强度:原文是实验、元分析还是综述,能不能支撑文中给出的结论强度。三步过不完,就改成不加数字的表述——宁可少一个出处,不可错一个出处。
核查的时间成本必须计入计划
第一,核查需要时间,写一篇一千五百字的文章可能要多花二十分钟,这个成本必须计入计划。第二,中文文献的线上可见度参差,查不到不等于不存在,要区分查不到与对不上。第三,AI 给不出处时顺手编一个出处,是最严重的错误,一旦进入公开内容就无法收回。
今天就能开始
从今天起,凡是从 AI 那里拿来的出处,先搜一次能不能打开原文;打不开的,就先删掉。
本文依据
- 观察来源: 本院研究述评整理过程中的实际记录:一份 AI 提供的文献清单中多条卷号或作者年份无法核验。
- 模型出处: 查存在/查内容/查强度三步核查法,为本院资源编辑部内部编辑规范。
- 待验证项: 横向阅读方法迁移到 AI 引用核查的有效程度,未经本院实验检验。
- 外部文献: Ji 等 2023(ACM Computing Surveys 自然语言生成幻觉综述);Wineburg & McGrew 2019(Teachers College Record 横向阅读与事实核查)。