学习平台发现,频繁看提示的学生考试分数较低。能否据此关闭提示功能?不能。也许正是基础薄弱的学生更常求助,低分与提示同时出现,却不是提示导致低分。
机器学习擅长从历史数据预测“接下来可能发生什么”,因果推断则追问“如果我们改变教学动作,结果会怎样”。两者结合,才有机会把预测转化成有效干预。
## 预测问题与因果问题不同
预测模型可以根据作答时间、错误类型和学习路径估计谁可能掉队。这有助于发现对象,却不能直接决定该给谁更多练习。
因果问题需要比较同一个学生接受与不接受干预的潜在结果,但现实中只能观察其中一种。随机分配通过让两组在平均意义上可比,帮助估计未观察的反事实。
例如,把符合条件的班级随机分配为使用 AI 提示和使用普通提示,再比较之后不借助系统完成的测验。关键是测独立学习结果,而不是只看使用工具时做对了多少题。
## 教育实验通常是多层结构
学生属于班级,班级属于学校,同班学生共享老师、进度与同伴环境。若把每个学生当作完全独立样本,会低估不确定性。
教育随机实验常在班级或学校层面分组,分析时也要使用多层模型或聚类稳健标准误。Annual Review 对教育随机实验的综述强调了这种层级结构,以及依从性、外推和溢出等挑战。
样本量不能只数学生。十所学校里的一千名学生,与一百所学校里的一千名学生,能支持的结论并不相同。

## AI 最适合帮助哪一步
第一是形成假设。模型可以从访谈和日志中归纳常见卡点,建议可测试的教学动作,但最终因果图要由教学与统计人员核对。
第二是执行个性化干预。系统可以在随机规则允许的范围内分配提示、例题或复习间隔,并完整记录何时给了什么。
第三是分析异质效应。平均有效的工具,可能只对先验知识较低或自我调节能力较强的学生有效。因果森林、分层贝叶斯模型等方法可以探索差异,但必须防止在小样本中到处寻找“显著人群”。
第四是生成解释。模型能把统计结果改写成教师易读的语言,但数值和图表应来自可复现代码,而不是让模型心算。
## 处理“不按分组使用”的现实
被分到 AI 组的学生可能不用,被分到对照组的学生也可能在校外使用其他工具。最基础的意向治疗分析按原始分组比较,回答“提供这项工具”的整体效果。
如果只比较实际使用者与未使用者,动机和基础差异会重新造成偏差。研究者可在有合适随机工具变量时估计依从者平均效应,但需要明确更强假设。
2026 年关于生成式 AI 支持自我调节学习的随机研究,就同时使用意向治疗和依从者效应思路。两个结果回答的问题不同,不应挑更好看的一个替代另一个。
## 测量要与学习目标对齐
平台正确率、聊天次数和完成速度是过程指标。真正关心的结果可能是延迟一周后的保留、无辅助迁移题、概念解释质量和学习投入。
PNAS 发表的一项高中数学随机试验显示,提供无约束的生成式 AI 可能改善练习时表现,却伤害之后无辅助测验;带教学护栏的版本表现不同。这提醒我们:即时答对不等于学会。
测验题也可能被模型或学生记住。应准备平行题和迁移题,避免训练材料与结果测量过度重合。

## 个性化需要先证明净收益
预测分数最高的学生不一定最值得干预。因果个性化关注的是处理效应:谁在接受某种支持后比不接受时改善更多。
可以在随机实验数据上训练效应模型,再在新的预注册测试中验证分配策略。若同一数据既用来发现人群又用来宣告成功,结果通常过于乐观。
还要计入机会成本。把教师时间投入一个干预,可能减少对其他学生的帮助。最佳策略是在资源约束下最大化整体学习增益,而不是给每个人推荐最多功能。
## 溢出效应不能忽略
学生会互相讨论,老师也会因新工具改变整体教学。如果实验组学生把方法分享给对照组,简单组间差异会被稀释。
有时溢出正是产品价值,例如教师使用 AI 备课后,全班都受益。此时应把随机单位提升到班级或教师,并同时测量直接和间接效果。
## 从产品日志到因果证据
日志必须记录干预资格、分配概率、实际展示、学生响应、模型版本和结果时间。只有“用户最后点了什么”无法重建分配机制。
上线迭代可以使用小比例持续随机化,保留稳定对照;对高风险或资源昂贵的变化,先做小规模可逆测试。观察研究可用于发现问题,但结论要标明依赖哪些不可检验假设。
## 实用落地顺序
先写出因果问题:对哪些学生、在什么时间、比较哪两种干预、测什么结果。再画简洁因果图,确定混杂变量、随机单位和分析计划。
用预测模型识别候选场景,用随机或准实验识别效果,用教师解释异常,用新批次复现。AI 可以加快每个环节,却不能替代反事实设计。
教育因果推断的核心不是给模型加一个“因果”标签,而是建立可审计的干预、对照与结果链。只有这样,“个性化”才从听起来合理,变成有证据的帮助。
## 参考资料