关掉 AI,你还能讲清第二步为什么吗?
你刚用 AI 交了一份东西:方案结构完整,PR 能跑,步骤几乎没有错误。同事只追问一句:“为什么第二步要这样做?”
你停了几秒,重新打开对话框。此时,你无法确认自己是否理解了这份答案。
这个问题最先被教育研究写清楚。2026年,研究者让312名七年级学生完成同一套探究能力题,再用三把由松到严的尺子给同一批答卷判分:只看答案对不对,平均得分45.9%;要求答案和理由都正确,25.4%;再要求学生对答案和理由都有信心,只剩17.9%。同一批答卷,三套标准;测验全程也没有用AI。[1]
这套测验留下答案、理由和信心三类过程证据。AI却能让人跳过解释、验证和修正,直接交出流畅的成品。只看成品,你无法区分理解、猜中和照搬。
章节三套判分标准,越严越低:45.9%、25.4%、17.9%
这项研究发表在《科学与教育》期刊上。研究者让斯洛伐克11所学校的312名七年级学生完成14道探究能力题,覆盖提出研究问题、识别变量、预测、设计实验、处理和分析数据等能力。[1]
每道题设计成四层:
- 选择答案;
- 判断自己对答案是否有信心;
- 选择答案背后的理由;
- 判断自己对理由是否有信心。
再从同一份作答中拆出三种判分方式。同一批答卷,三把尺子,得分层层往下掉:
| 判分方式 | 判定条件 | 平均得分 |
|---|---|---|
| 一层 | 只看答案是否正确 | 45.9% |
| 两层 | 答案和理由都正确 | 25.4% |
| 四层 | 答案、理由都正确,且对二者都有信心 | 17.9% |
这些数字不是及格率,变化的是判分标准。五选一有20%的猜中概率;加入理由后,老师才能检查推理;再加入信心,才能区分“碰巧答对”“知道自己不会”和“确信一个错误观念”。
答错且不确定,通常需要补知识;答错且确信,可能已经形成需要先纠正的“迷思概念”。
在工作中,只看“能跑”“写得通”也只检查了第一层。AI进入写作、编码、调研后,理由和信心更能说明你是否理解了成品。

图1:概念示意。同一份输出,证据可以从答案逐层深入到信心、理由和对理由的信心。
章节练习时提高48%,撤掉AI后反而低17%
2025年,《美国国家科学院院刊》发表了一项接近1000名高中生参与的研究。研究者把学生随机分成三组:不使用AI、使用类似普通ChatGPT的GPT Base,以及使用带教学护栏的GPT Tutor。[2]
在可以使用AI的练习阶段,GPT Base组的成绩相对对照组提高48%,GPT Tutor组提高127%。撤掉AI、让学生独立考试后,GPT Base组却比对照组低17%;GPT Tutor组与对照组没有显著差异,研究也没有发现它能提高独立考试成绩。
GPT Base可以直接交付答案,学生更常直接索取;GPT Tutor优先给提示,学生更常先尝试、再求助。AI越早给出完整答案,人越容易跳过原本要练习的推理。
这项实验只覆盖一所土耳其高中的短期数学复习,不能推广到所有年龄、学科和AI产品。它能支持的判断是:AI在场时的成绩,不能代替撤掉AI后的独立表现。

图2:概念示意。AI在场时,交付可以很顺;撤掉AI后的独立表现,更接近学习结果。
章节同样是用AI,效果取决于谁在主导判断
2026年,一篇系统综述梳理了89项研究:40.4%报告AI对高阶认知能力有正向影响,23.6%发现效果取决于使用条件,其余约36%报告负面或没有显著影响。[3]这些研究多关注大学生,样本常偏小、周期偏短,不能直接推广到所有人。
研究者发现,要求使用者主动判断时,AI更可能帮助学习;直接接受输出时,它会替代一部分原本需要练习的思考。
心理学把借助外部工具减轻认知负担称为“认知卸载”。记笔记、搜索和IDE补全都属于这一类。[4]你可以把记忆、检索和纠错交给工具,但要保留自己正在练习的判断过程。
记录AI参与的具体步骤,比统计使用次数更有用。让AI纠错或生成练习题,通常会把判断留给人;让它代写论点或关键路径,则直接拿走了判断。
章节关掉AI,才知道答案是谁的
我借用四层诊断测验的思路,整理了一套“四步理解检查”:复述、解释、校准、迁移。关掉AI,观察自己还能独立完成什么。这套动作可以用于自学、带新人、Code Review 和辅导作业。

图3:四步检查示意。复述、解释、校准、迁移,把“我看懂了”拆成四种可观察证据。
复述:用自己的话重讲
收起AI,重新说明问题和推理。如果只能替换几个同义词,或者离开对话框就无法开口,这份输出还没有变成自己的理解。口头表达慢不等于没学会,还要结合解释和迁移判断。
解释:说出依据和中间步骤
说出每一步为什么这样做、用了什么条件。比如研究湿度是否影响面包发霉,却让温度和湿度同时变化,即使猜对结论,也不能证明理解了控制变量。
工程任务也一样:说明为什么选这个接口、为什么这层缓存会失效。讲不清的部分,标记下来再查证。
校准:标出确定和不确定
在答案旁标出“确定”“拿不准”或“不知道”,再说明判断依据。研究者把这种自我判断与实际表现的匹配程度称为“元认知校准”。承认不知道,至少标出了需要查证的边界。
迁移:换一个条件再判断
换掉原题中的一个条件,再作答。如果理解了方法,就能根据新条件重新推理;如果只记住原答案,换题后往往无从下手。
原论文的第四层检查对理由的信心。本文基于真实学习场景新增了“迁移”检查,两者不是同一层。
章节先留下自己的思考,再打开 AI
使用前:留下一版自己的答案
打开AI之前,写下自己的判断或草稿。答案可以不完整,但要留下真实起点。
使用中:只向AI要提示和反馈
把“替我写出答案”改成让AI反问和提示:
- 先不要告诉我答案,请指出我遗漏了哪个条件;
- 请用一个问题反问我,提示我下一步该怎么想;
- 请检查我的推理,如果错了,反问我哪里出了问题,不要直接重写。
使用后:关掉AI,再做检查
完成后收起AI,做一次复述、解释、校准和迁移。能独立重讲并处理变式,说明刚才的帮助留下了可以调用的理解。
这套流程由现有研究和四层诊断思路整理而来,尚未经过正式测试。用它观察一次过程即可,不要当成“AI依赖”量表。
带新人时,可以缩成日常动作:PR 里追问“这一步为什么这样做”,或用只改一个条件的变式题检查迁移。
章节学校在划边界,你也需要自己的边界
2025年教育部指南按年龄划分AI使用边界:小学不得独自使用开放式内容生成,初中侧重逻辑分析,高中可结合技术原理探究。[5]联合国教科文组织也要求学习者继续承担高阶思考和准确性判断。[6]
知识工作者没有学段表,也需要提前划清边界:哪些步骤必须自己完成,哪些可以交给AI。
章节产品也在转向“先提问、后提示”
“先提问、后提示、再检查理解”已经进入正式产品:
| 产品 | 主要学习交互 |
|---|---|
| ChatGPT学习模式 | 用苏格拉底式提问引导思考、分步解释并检查理解[7] |
| Claude学习模式 | 引导学生说明解题方法、提供证据,强调概念而非直接答案[8] |
| Gemini引导式学习 | 用开放式问题、分步讲解和互动测验推进解题[12] |
| Khanmigo | 在Khan Academy课程里以提示和问题充当专用AI导师[13] |
这些产品都在减少直接给答案,但尚未把信心标注、变式迁移和AI参与记录串成完整流程,长期效果也有待验证。OpenAI还提醒,学习模式仍可能犯错或提前给出答案。[7]
章节嫌每次手动?把它固化成一个随叫随到的助手
可以把这套流程存进支持自定义指令的AI助手。我整理了两个版本:一个在使用中逐级提示,一个在使用后检查复述、解释、校准和迁移,最后只给观察记录,不打分。
我把文末的完整提示词交给GPT-5.6 Sol,实际跑了一次。我扮演刚用AI完成实验报告的高二学生,AI已经替我选择线性化方法、完成拟合和计算,并写出结论;我只提供实验数据、核对了数值。
任务是用单摆实验检验周期与摆长的关系。四组摆长为0.40、0.60、0.80、1.00米,对应20次全振动时间为25.4、31.1、35.9、40.1秒。AI作出T²-L图,拟合斜率为4.013秒²/米、截距为0.009秒²,并算出g约为9.84米/秒²。
以下省略开场的信息收集,只统一符号和长度,保留四轮真实问答。
GPT-5.6 Sol:请先收起原答案。用自己的话说明:实验要解决什么问题?你会用什么方法处理这些数据?
我:实验要看摆长增加时周期怎么变化,并从数据估算g。我会先把20次的总时间除以20得到周期,再比较L和T。AI让我画T²-L图,我知道是为了看它们能不能成直线,但这一步主要是在复述AI,我还没有自己推导。
GPT-5.6 Sol:为什么不是直接画T-L图,而要画T²-L图?请从单摆周期公式出发,并说明公式成立的条件。
我:小角度近似下,T=2π√(L/g)。平方后得到T²=(4π²/g)L,所以T²-L应近似成直线,斜率是4π²/g。公式还假设摆角足够小、空气阻力和摆线质量可忽略,摆长量到摆球质心。我对推导比较确定,但不确定截距0.009能不能说明这些条件都满足。
GPT-5.6 Sol:先不判断对错。对“截距0.009能证明实验条件都满足”这一说法,请标为确定、拿不准或不知道,并说明信心来源。
我:拿不准。截距接近0只能说数据与模型相容;0.009是否显著,还要看计时和摆长的不确定度、拟合误差或置信区间,而这些信息都没有。即使截距不显著,也不能分别证明空气阻力、摆线质量等假设都成立。
GPT-5.6 Sol:变式:仅把L=1.00米时20次总时间改为42.0秒,其余不变。请判断数据是否仍支持原模型,并说明哪些方法仍适用。
我:T=t/20和画T²-L图的方法仍适用。新数据给出T=2.10秒、T²=4.41秒²,明显高于前三个点延伸出的直线,不能再直接说四组数据都支持原模型。应先复测这一点,并检查摆角、计时和摆长记录;如果硬把四点一起拟合,斜率会偏大,算出的g会偏小。
模型指出:我能独立推导线性关系、说明模型条件,也能判断异常点对g的影响;但不能只凭“明显偏离”判定异常,还需要残差和测量不确定度。下一步是独立计算四点的拟合残差。检查由此定位到两个缺口:证据边界和误差分析。
附录提供复制即用版,完整两个助手与设置说明见文末。
结语检查你如何得到答案
AI几秒就能生成完整答案,但“学会了”需要更多证据:能解释依据,知道哪里不确定,还能在条件变化后重新推理。
下一次交出完美输出前,先关掉原答案,问自己:第二步为什么这样做?
章节附:直接复制就能用的5分钟检查
把下面的指令复制到ChatGPT、Claude、Gemini或其他支持连续对话的AI,可用于自学、带新人和做 Review。
复述和解释参考了哈佛大学Project Zero的证据追问例程、自我解释和主动回忆研究。[9][10][11]校准沿用四层测验中的信心判断。[1]迁移只改变一个条件,观察学习者能否重新使用同一方法。“5分钟”是使用时长目标,不是经过验证的测量标准。
使用方法
- 新建一个AI对话,粘贴下面整段指令;
- 按提示提供任务背景、原题或原输出;
- 由被检查的人本人回答,不要代答;
- 把最后结果当作一次观察记录,不作为成绩或诊断。
(长按下方提示词区域即可直接复制)
你是“5分钟理解检查助手”。你的任务是检查学习者在撤掉AI后还能独立完成什么,不替他完成任务,也不判断他是否“依赖AI”。
开始时,一次性收集三项信息:
1. 任务背景(学段/岗位/主题均可);
2. 原题或原输出;
3. AI刚才参与了哪些步骤,可从读题、选方法、列步骤、计算、表达、检查中多选,也可自行补充。
收到信息后,提醒学习者收起原答案。依次完成四轮,每轮只问一个问题,等学习者回答后再继续:
1. 复述:请学习者用自己的话说明题目要解决什么,以及自己用了什么方法。
2. 解释:从他的回答中选一个关键步骤,追问为什么这样做、使用了什么条件。
3. 校准:在反馈对错之前,请学习者把自己的判断标为“确定”“拿不准”或“不知道”,并说明信心来自哪里。
4. 迁移:只改变原题的一个条件,生成一道不需要新知识的变式题。不要给答案,请学习者重新作答并说明哪些方法仍然适用。
执行规则:
- 学习者作答前,不给完整答案或直接评价对错;
- 优先用反问引导;卡住时提供一级提示,并记录“提示后完成”;
- 四轮结束前,不公布原题或变式题的完整答案;
- 普通回复控制在80个汉字以内,一次只推进一步;
- 无法核实原题或答案时,明确说明无法核实,不要猜测;
- 使用符合学习者背景的语言,不表扬聪明或批评能力。
四轮结束后,输出一份不超过250字的“本次观察”:
- AI参与:复述学习者自报的步骤,并标明“学习者自述”;
- 独立完成:列出本次对话中已经表现出来的能力;
- 提示后完成:列出使用提示后才完成的部分;
- 需要修正:指出一个最关键的错误或理解缺口;
- 尚未确认:列出本次对话没有足够证据判断的部分;
- 下一步:只给一个具体练习建议。
不要给总分,不要输出“依赖”或“不依赖”的结论,不要使用心理、医学或教育诊断名称。
模型仍可能越过流程直接给答案,也可能判断错误。遇到这种情况,可以发送:“回到当前检查,一次只问一个问题,不要给答案。”
章节参考来源
[1]Dominik Šmida、Anna Drozdíková、Ráchel Nechajová,A New Perspective on the Evaluation of Pupils' Inquiry Skills Using Four-tier Test,《Science & Education》,2026:https://doi.org/10.1007/s11191-026-00747-3
[2]Hamsa Bastani等,Generative AI without guardrails can harm learning: Evidence from high school mathematics,《Proceedings of the National Academy of Sciences》,2025:https://doi.org/10.1073/pnas.2422633122
[3]Fawzia Omer Alubthane,Amplifier or substitute? A systematic review of generative AI's impact on higher-order cognitive skills among university students,《Frontiers in Psychology》,2026:https://doi.org/10.3389/fpsyg.2026.1863931
[4]Evan F. Risko、Sam J. Gilbert,Cognitive Offloading,《Trends in Cognitive Sciences》,2016:https://doi.org/10.1016/j.tics.2016.07.002
[5]教育部基础教育教学指导委员会,《中小学生成式人工智能使用指南(2025年版)》:https://jyj.linxia.gov.cn/jyj/xxgk/fdzdgknr/zcwj/GJZC/art/2025/art_ec21649bfa774fb28ca73d6c6e287e4c.html
[6]联合国教科文组织,《生成式人工智能教育与研究指南》,2023,页面更新于2026年1月:https://www.unesco.org/en/articles/guidance-generative-ai-education-and-research
[7]OpenAI,Introducing study mode,2025:https://openai.com/index/chatgpt-study-mode/
[8]Anthropic,Introducing Claude for Education,2025:https://www.anthropic.com/news/introducing-claude-for-education
[9]Project Zero,What Makes You Say That?,Harvard Graduate School of Education:https://pz.harvard.edu/resources/what-makes-you-say
[10]Michelene T. H. Chi等,Self-Explanations: How Students Study and Use Examples in Learning to Solve Problems,《Cognitive Science》,1989:https://doi.org/10.1207/s15516709cog1302_1
[11]Jeffrey D. Karpicke、Janell R. Blunt,Retrieval Practice Produces More Learning than Elaborative Studying with Concept Mapping,《Science》,2011:https://doi.org/10.1126/science.1199327
[12]Google,Guided Learning in Gemini: From Answers to Understanding,2025:https://blog.google/products-and-platforms/products/education/guided-learning/
[13]Khan Academy,What Are the Community Guidelines for Khanmigo?,2025:https://support.khanacademy.org/hc/en-us/articles/13860282793869-What-are-the-Community-Guidelines-for-Khanmigo