越推越窄:推荐算法与输入多样性
本文性质: 观察 + 假设(Observation / Hypothesis) 证据标签: 观察 Observation/模型 Model/假设 Hypothesis/实证 Evidence
本篇涉及的证据类型:观察 Observation/假设 Hypothesis。凡属本院课堂观察与教学模型的部分,均不作效果承诺。
打开一个学习类应用,它会先问你想要什么,然后一直给你类似的东西。用得越久推得越准,看到的东西也越像。对语言学习来说,这可能是一笔隐性代价。
一条被忽略的输入曲线
本院资源编辑部在整理学生自学记录时注意到一条曲线:刚开始使用推荐类应用的阶段,学生接触的话题面比较宽;使用三到六个月后,许多学生的话题分布明显收窄,集中在最初点开过的那几类。同一位学生,早期会点开科技、体育、生活类材料,后期基本只读历史与影视。这不是个别现象,在各年龄段都出现过。需要说明的是,这是阅读记录观察,不是实验,无法排除学生本身兴趣收窄的可能。
过滤气泡与输入分布的自我强化
推荐系统的目标函数通常是停留时长与点击率,而不是输入多样性。用户点得多的类别被加权,被加权的类别得到更多曝光,曝光又带来更多点击,形成一个自我强化的环。这一机制在信息传播研究中被称为过滤气泡(filter bubble,Pariser 2011)与回音室效应。需要说明的是,Pariser 的论述属观察与评论性质,学界对气泡效应的大小仍有争论——Dubois 与 Blank 2018 的研究指出,主动使用多种信息源的用户受算法收窄的影响有限。语言学习的特殊之处在于:词汇与语块的分布依赖输入的广度。只读一类材料,高频词会反复出现,而低频却与生活密切相关的词长期缺席(Nation 2006 对词汇分布与输入的关系有系统讨论)。
本院的使用口径:把推荐当入口,不当轨道
本院资源编辑部给学生的建议是把推荐当入口而不是轨道:每周固定一次跨场阅读,从推荐清单以外的两个类别里各挑一篇,读完记下三个新词;同时在材料选择上保留一条人工规则——同一话题连续出现三次就换一个。这个做法不是为了让算法变好,而是为了让输入分布不要完全由点击历史决定。以上为本院内部阅读建议,未经实验检验。
边界与适用
有三条边界。第一,气泡效应的大小本身有争议,Dubois 与 Blank 2018 的结论是主动型用户受收窄影响有限,所以不必把推荐系统当成洪水猛兽。第二,初学者阶段输入收窄并非全是坏事,高频词的集中复现对建立核心词汇有帮助。第三,跨场阅读会增加学生负担,如果每周阅读时间不足两小时,应优先保证完成度而不是广度。本院没有做过输入广度与词汇增长的对照研究。
今天就能开始
这周挑一篇推荐清单以外的材料,读完写下三个第一次见到的词,看看它们离你的常用话题有多远。
本文依据
- 观察来源: 本院资源编辑部学生自学记录整理(2022 年至今):部分学生使用推荐类应用三个月后话题分布收窄;属阅读记录观察,样本与统计口径未做控制。
- 模型出处: 「推荐当入口不当轨道」「同一话题连续三次即换」为本院内部阅读建议,非外部研究成果。
- 待验证项: 输入多样性对二语词汇广度增长的独立贡献,需带对照的纵向研究检验;本院尚无该研究。
- 外部文献: Pariser 2011(过滤气泡,评论性质);Dubois & Blank 2018(主动型用户受算法收窄影响有限);Nation 2006(词汇分布与输入)。