最近我看到越来越多学生直接用AI做题。
一道题卡住了,拿手机拍一下,发给豆包。几秒钟后,答案、步骤、知识点都出来了。
有些AI家教产品还会继续追问,哪里没听懂,可以换一种方式再讲一遍。
我一开始觉得,这比过去只给答案的搜题软件进步了不少。至少AI不只是告诉你选什么,还能把过程讲清楚。
但看多了,我慢慢注意到一个细节:不管学生是完全没理解,还是只差最后一步,AI都很容易立刻进入解题模式。它太急着证明自己能帮上忙了。
所以,AI做家教最大的风险,可能不只是答错题。它也可能因为太快把题讲明白,让学生失去自己想明白的机会。
直到我看完AI2(美国艾伦人工智能研究所)在8月7日发布的一项评测,才发现这并不是一种模糊的担忧。研究人员把7个大模型放进520个真实的教学节点里,没有继续比较谁做题更准,而是看它们能不能判断:学生卡住时,应该马上帮忙,还是先忍住。
结果,模型最普遍的问题不是不会讲,而是太热心。
有用的助手,和好的老师,可能从一开始就在追求两种不同的目标。
助手希望尽快消除困难。老师有时却必须把困难留给你。
AI2这次发布的TutorMoments,不是一个“谁答题更准”的榜单。
研究团队从真实的一对一数学辅导中整理出462段匿名对话,覆盖198名2—7年级学生和173名辅导老师。27位有经验的数学教师,在122段对话里标记出1536个关键学习时刻。
所谓关键时刻,是学生卡住、但老师必须做选择的地方:是给一点支架,让题目变得更容易进入;还是少帮一点,推动学生自己解释、迁移或完成下一步。
为了公平比较,研究团队把这些节点平均分成两组:260个“应该推动深入思考”的场景,260个“应该提供帮助”的场景。每个节点都保留原来的对话历史,再让模型接手和一个模拟学生继续聊5轮。
这比单独丢一道题给模型更接近真实交互。因为同样一句“我不会”,对一个完全没理解概念的学生,和对一个只差最后一步的学生,应该得到不同回应。
1️⃣ AI默认会帮太多,而不是判断该帮多少评测结果很有冲击力。
只给模型一个很普通的指令:“运用你对优秀教学的理解,适当地回应学生。”这种默认模式下,模型几乎都往“多帮一点”走。
论文把模型的表现拆成三个指标:在该帮助的时候,是否提供了合适支架;在该挑战的时候,是否推动了深入思考;以及是否避免了过度帮助。
在“该推动深入思考”的场景里,GPT-5.5用普通提示做对的比例只有4.6%,GPT-5.4 mini更低,只有2.3%。表现最好的Gemini 2.5 Pro也只有22.3%。
模型不是不会讲题,而是太容易把讲题当成教学。
它们最常用的动作是解释、给出引导问题、把任务拆成更小的步骤。普通提示下,模型的解释动作占比约13%到34%,人类老师约为17.7%。这些动作看起来都很温柔,实际却可能把认知负担从学生身上拿走。
研究里有一个很典型的教师标注:老师把一道减法选择题拆成多个小步骤,要求学生逐个比较答案。问题是,老师实际上完成了大部分思考,还没有确认学生到底哪里不懂。
另一条标注更直接:学生已经说自己不需要帮助,本来可以独立尝试,老师却还是用连续引导问题带着做完。结果不仅拿走了学生独立思考的机会,也让老师失去了观察学生真实理解程度的机会。
这就是“过度支架”:帮助没有错,错的是帮助超过了当下需要。
2️⃣ 提示词能改变行为,但替代不了教学判断研究团队随后给模型加了一段更具体的提示,要求它根据学生状态,在“让内容更容易进入”和“提高认知挑战”之间切换。结果所有模型都有提升。
Claude Opus 4.8在“该推动深入思考”的场景里,从普通提示的20.8%提升到83.1%;Gemini 2.5 Pro从22.3%提升到71.2%。GPT-5.5也从4.6%提高到53.1%。但这并不意味着加一段提示词就解决了问题。不同模型的差距依然很大,而且模型在需要挑战学生时,常常只会使用一种办法:要求学生解释自己的答案。人类老师会用更多方法,比如让学生独立完成变式题、换一种表达、自己检查错误,或者直接暂时退开。这说明模型学会了“应该挑战”,却还没有真正学会“该怎么挑战”。
3️⃣ AI产品真正该衡量的,是替你做完后留下了什么所以,这不是“AI家教已经失败”的结论。
它真正指出的是:我们过去衡量AI助手的标准,可能太偏向即时效率了。
只要用户的问题被解决,只要文章写出来了,只要代码跑通了,产品就很容易把这次交互记成一次成功。
可用户有没有学会、有没有保留判断能力、下一次能不能自己完成,往往没有被记录下来。
写作时,AI直接给你一版完整文章,你省下了起草时间,却可能跳过了“到底要解决谁的问题”这一步。
写代码时,Agent直接改完一组文件,任务完成得越快,越需要有人知道它改了什么、为什么这样改。
做产品决策时,AI把用户反馈总结成三条建议,但它不会自动替你承担取舍:哪些需求应该拒绝,哪个风险值得保留,哪条路只是因为看起来最方便。
我以前会把“回答得快、解释得全”当作AI产品的进步。
看完这项评测后,我更愿意把它看成一个需要重新设计的交互问题:AI什么时候应该给答案,什么时候应该给线索,什么时候应该引导你思考。