经典拆解
必要难度逐节拆解
十页纸论证一件反直觉的事:让学习感觉更顺的条件,和让学习留得更久的条件,不是同一组条件。本站的教育理念就建立在这篇之上——包括它反对我们做的那几件事。
- 作者
- Elizabeth Ligon Bjork, Robert A. Bjork(2011)
- 校验
- sha256:aa461a9767f64eb890c8fd9416f64b016bde0570564d512eb097f50d543a36f0
- sha256,底本为 FABBS《Psychology and the Real World》第 5 章 PDF(10 页,正文页码 55–64)。全文英文引文逐条按此底本校对,PDF 换行连字符(如 how- to-study)已归一后比对。
怎么读这篇
这篇按原文分节走:每节先给一句话主旨,再逐段讲原文在说什么、 为什么这么写。术语和公式的解释放在正文右侧的边注里,读到哪看到哪。 每节末尾有一道自测题——答不出就说明那节没读懂,回头再看一遍比往下读划算。
适合谁读:高中生起。全文没有一个公式,唯一需要的准备是愿意接受"你对自己学得好不好的判断可能是反的"这个前提。做过考前突击的人读起来最有共鸣。
英文原文怎么查词:引文块保持整段可选中,任何划词翻译工具都能直接用 (iOS Safari 长按选词后选「查询」,桌面端可用沙拉查词一类扩展)。 本站只解释术语——像 proof-of-work、Merkle root 这种通用词典给不出 本文特定含义的词,会链到站内词条;普通生词交给你自己的词典更靠得住。
哪里真的难,不糊弄你
- 存储强度与提取强度的区分:这两个词在中文里都像"记得牢",但它们在原文里是两个可以背离的独立量。全篇都建立在这个区分上,读不透这里后面全是散点。
- 原文说 current performance is entirely a function of current retrieval strength——entirely 这个词意味着测验分数完全不直接反映存储强度。这一步很容易被读轻。
- 图 1 的判读:它不是在说效应量大小,而是在说主观判断与客观结果方向相反。这个区别决定了结论的强度。
- desirable 与 undesirable 的边界:作者花了整段划这条线,而传播中几乎总被丢掉。丢了它这篇就会被用成"越难越好"。
读之前:这篇不是实验报告,是一份证词
先说体裁,因为它决定了该怎么读。
这不是原始实验论文。它是 2011 年 FABBS 论文集《Psychology and the Real World》的第 5 章(正文页码 55–64),两位作者——加州大学洛杉矶分校的 Elizabeth Ligon Bjork 和 Robert A. Bjork,同一个实验室——把几十年研究压成十页,写给非专业读者。所以你不会看到显著性检验和误差棒,只会看到一句句”我们发现”。
这种体裁有一个好处和一个坏处。好处是每段都是结论,密度极高。坏处是证据链被折叠了:当作者说”研究表明”时,你看不见那些研究长什么样。所以这篇拆解会做一件原文没做的事——把他引的关键实验拆开,让你看见数字。
开篇就把整篇的立场摆出来了:
What we have discovered, broadly, across our careers in research, is that optimizing learning and instruction often requires going against one’s intuitions, deviating from standard instructional practices, and
我们在整个研究生涯中大致发现的是:要让学习和教学达到最优,往往需要违背自己的直觉、偏离标准的教学做法,并且——
这句话在原文里被一个页面分隔断开了,下半句在第 56 页接着说:
managing one’s own learning activities in new ways. Somewhat surprisingly, the trials and errors of everyday living and learning do not seem to result in the development of an accurate mental model of the self as learner
——用新的方式管理自己的学习活动。有些出人意料的是,日常生活与学习中的反复试错,似乎并不能让人形成一个关于”自己作为学习者”的准确心理模型。
注意 going against one's intuitions:不是说你的直觉不够精确,是说方向相反。整篇的分量都压在这个”反”字上。而第二句更进一步——你不能靠经验自我校准,因为试错本身不产生准确的自我认识。
1. 核心二分:扎得多深,和此刻调不调得出来
这是整篇的引擎。如果只记一件事,记这个。原文在标题 Storage Strength Versus Retrieval Strength 下把记忆拆成两个量:
Storage strength reflects how entrenched or interassociated a memory representation is with related knowledge and skills, whereas retrieval strength reflects the current activation or accessibility of that representation and is heavily influenced by factors such as situational cues and recency of study or exposure.
存储强度衡量一份记忆表征扎得有多深、与相关知识技能连结得有多密;提取强度衡量它此刻的激活程度或可及性,且严重受情境线索、以及”最近学过没有”这类因素影响。
接下来这句是整个理论的枢纽,请慢读:
Importantly, we assume that current performance is entirely a function of current retrieval strength, but that storage strength acts to retard the loss (forgetting) and enhance the gain (relearning) of retrieval strength.
重要的是,我们假定当下的表现完全是当下提取强度的函数,而存储强度的作用是延缓提取强度的流失(遗忘)、并放大它的回升(重学)。
entirely 这个词是刀。它意味着:你在测验上的分数,只反映提取强度,一丁点儿也不直接反映存储强度。而存储强度才是你真正想要的东西。于是:
The key idea for present purposes is that conditions that most rapidly increase retrieval strength differ from the conditions that maximize the gain of storage strength. In other words, if learners interpret current retrieval strength as storage strength, they become susceptible to preferring poorer conditions of learning to better conditions of learning.
就本文而言的关键在于:让提取强度涨得最快的条件,和让存储强度增益最大的条件,是不同的。换句话说,如果学习者把当下的提取强度误当成存储强度,他就会倾向于偏好较差的学习条件而非较好的学习条件。
这就是全篇的诊断书。不是学生懒,是仪表盘接错了线——你能读到的那个读数(顺畅感、当下答得出来)测的不是你想优化的那个量。
再看这条推论,它把遗忘从敌人改判成了条件:
Namely, that forgetting (losing retrieval strength) creates the opportunity for increasing the storage strength of to-be-learned information or skills. Said differently, when some skill or knowledge is maximally accessible from memory, little or no learning results from additional instruction or practice.
也就是说,遗忘(提取强度的流失)创造了提升存储强度的机会。换个说法:当某项技能或知识已经处在最容易被调取的状态时,再多的教学或练习几乎不产生学习。
后半句最反直觉。“我现在感觉很熟”恰恰是”继续练下去收益最低”的信号,而我们通常把这种熟练感当作学习顺利的证据。
自测按存储强度/提取强度这套框架,为什么刚读完一段马上重读一遍收效很差?
因为刚读完时提取强度处于峰值,而按原文那句 when some skill or knowledge is maximally accessible from memory, little or no learning results,此刻正是额外练习几乎不产生学习的时候。要涨存储强度,得等提取强度掉下来一点——也就是等你开始有点忘了再回来。这就是间隔优于连续的原因。
2. 变化练习:扔沙包的孩子
原文给了一个我认为是全篇最漂亮的实验,因为它的设计干净到不需要任何统计训练就能判断结论。
八岁和十二岁两组孩子,练习闭眼向地上的目标扔沙包。每个年龄组里,一半孩子只在固定距离练(八岁组是 3 英尺),另一半在更近和更远的距离练——注意,从不在 3 英尺练。然后所有孩子都在 3 英尺处测试。
Common sense would suggest that the children who practiced at the tested distance would perform better than those who had never practiced at that distance, but the opposite was true for both age groups.
常识会认为,在被测距离上练过的孩子应当表现更好——但两个年龄组的结果都是相反的。
请体会这个结果的荒谬程度:从没在 3 英尺练过的孩子,在 3 英尺上打得更准。原文给的解释是,变化练习让人学到的不是某一次投掷的肌肉记忆,而是如何调节投掷动作的参数:
The benefits of variation—perhaps learning something about adjusting the parameters of the motor program that corresponded to the throwing motion—outweighed any benefits of being tested at the practiced distance.
而且原文补了一句,把这个效应的适用范围推得更远:
Many other studies have shown that when testing after training takes place under novel conditions, the benefits of variation during learning are even larger.
许多其他研究表明,当训练后的测试发生在新条件下时,学习期变化带来的好处还要更大。
顺带,原文还提到一个同类结果,读起来会让很多人不适:
For example, studying the same material in two different rooms rather than twice in the same room leads to increased recall of that material (Smith, Glenberg, & Bjork, 1978)—an empirical result that flies in the face of the common how-to-study suggestion to find a quiet, convenient place and do all your studying there.
在两个不同房间各学一次,比在同一个房间学两次记得更多。作者明确指出,这个结果与”找个安静方便的固定地方、所有学习都在那儿完成”这条常见学习建议正面冲突。
自测扔沙包实验里,为什么必须让固定练习组的练习距离等于测试距离?
因为这样才构成对固定练习最有利的条件——它把”练习即考试”的优势全给了对照组。如果测试距离是两组都没练过的第三个距离,变化组赢了可以被解释为”离得近”。让固定组在自己的主场上输,结论才无法被这样解释掉。这是实验设计上的一个刻意让步。
3. 交错练习:63% 对 20%
这一节给了本文最大的效应量,也是最能直接改变你排练习表的一条。
原文先讲一个键盘按键实验,指出学习者和教师双双会被误导:
when participants who had learned three different keystroke patterns were asked to predict their performance on a test the next day, those given interleaved practice predicted their performance quite closely, whereas those given blocked practice were markedly overconfident (Simon & Bjork, 2001).
交错练习组对自己第二天表现的预测相当准确,而分块练习组则明显过度自信。作者的判词直接扣回第 1 节的框架:
they misinterpreted the retrieval strength of a given keystroke pattern as an index of its storage strength.
他们把某个按键模式的提取强度,误当成了它的存储强度的指标。
然后是数字。学习计算不同立体(比如截头圆锥)体积的公式,分块 vs 交错:
The size of the long-term advantage of interleaved practice was striking: 63 percent versus 20 percent of new problems worked correctly a week later (Rohrer & Taylor, 2007).
一周后新题做对的比例:交错 63%,分块 20%。
三倍多的差距。而且请注意这里量的是 new problems——不是背下来的题,是没见过的题。
4. 那张图:你以为的和实际的,正好相反
这是全篇的证据高点,也是我认为最该被印出来贴在墙上的一张图。
实验(Kornell & Bjork, 2008):让参与者学 12 位画家的风格,每人 6 幅画。一组把同一画家的画连着看(分块),一组把不同画家的画穿插着看(交错)。然后拿新画测试,看能不能认出作者。
原文自己承认这个结果反直觉:
This result is surprising because blocking would seem to make it easier to note the commonalities that characterize a particular artist’s style.
这个结果令人意外,因为分块看起来应该更容易让人注意到某位画家风格的共同点。
然后是那张图。原文对图 1 的说明是:
The left panel shows the proportion of participants who selected “blocked,” “interleaved,” or “the same” in response to the question: “Under which condition do you believe you learned better?” The right panel indicates the proportion of participants who actually performed better in the blocked or interleaved conditions or performed the same in the two conditions.
左图是自认为哪种条件学得更好,右图是实际上哪种条件表现更好。而结果是:
Indeed, as illustrated in Figure 1, the majority of participants—when asked after the test whether interleaving or blocking had helped them learn an artist’s style better—definitely had the impression that blocking had been more effective than interleaving…
如图 1 所示,大多数参与者确信分块比交错更有效。这句话在原文里被页脚截断,下一页接着写完:posite of their actual learning——完整的句子是 the opposite of their actual learning,与他们实际的学习结果正好相反。
自测这张图对'跟着感觉学'这条建议意味着什么?
意味着它在这类任务上不成立,而且比”不成立”更糟:主观感受与实际效果方向相反,所以越是忠实地跟着手感调整学法,越会稳定地选到较差的那一种。这也是为什么原文开头说日常试错不能形成准确的自我模型——试错反馈用的正是这个坏掉的仪表。
5. 生成效应:查答案就是在偷自己的东西
这一节给出本文最可操作的一条原则,措辞也最不客气:
Basically, any time that you, as a learner, look up an answer or have somebody tell or show you something that you could, drawing on current cues and your past knowledge, generate instead, you rob yourself of a powerful learning opportunity.
基本上,任何时候你作为学习者去查一个答案、或者让别人告诉你、给你看某个东西——而那个东西本是你可以凭现有线索和已有知识自己生成的——你就是在抢走自己的一个强大学习机会。
rob yourself 是原文的用词,不是我的加工。接着:
Retrieval, in effect, is a powerful “memory modifier” (Bjork, 1975).
提取实际上是一种强力的”记忆修改器”。
这句话把测验的身份改了:测验不是测量装置,是写入装置。所以原文说:
a test or retrieval attempt, even when no corrective feedback is given, can be considerably more effective in the long term than reading material over and over.
一次测验或提取尝试,即使不给任何纠正反馈,长期效果也可能远好于把材料反复重读。
“即使不给反馈”这个限定很重要——它说明作用不来自”看到正确答案”,而来自尝试调取本身。
原文顺手诊断了为什么重读如此流行:
The reason why rereading is such a typical mode of studying derives, we believe, from a faulty model of how we learn and remember
我们认为,重读之所以成为如此典型的学习方式,源自一个关于我们如何学习与记忆的错误模型。
6. 边界:作者自己划的那道线
这一节最容易在传播中被丢掉,而丢掉它就会把这篇论文用坏。原文用了一整段来强调 desirable 这个词:
Before proceeding further, we need to emphasize the importance of the word desirable. Many difficulties are undesirable during instruction and forever after.
在继续之前,我们需要强调 desirable(必要的、值得的)这个词的重要性。许多困难在教学过程中是有害的,而且此后一直有害。
那么什么样的困难才算 desirable:
Desirable difficulties, versus the array of undesirable difficulties, are desirable because they trigger encoding and retrieval processes that support learning, comprehension, and remembering. If, however, the learner does not have the background knowledge or skills to respond to them successfully, they become undesirable difficulties.
必要难度之所以”必要”,是因为它们触发了支持学习、理解和记忆的编码与提取过程。但是——如果学习者不具备成功应对它们所需的背景知识或技能,它们就变成了有害的困难。
这就是那道线。判据不是”难不难”,是难在能不能被成功应对的范围内。同一个难度对准备好的学习者是必要难度,对没准备好的就是纯障碍。
自测按作者的判据,给初学者直接扔一篇英文原始论文,属于必要难度还是有害困难?
取决于他是否具备成功应对的背景知识。如果连术语和符号都不认识,那是有害困难——它触发不了编码与提取过程,只触发放弃。要把它变成必要难度,得先把前置知识垫到”能读懂大部分、卡在少数几处”的水平,此时的费力才是有产出的。这也是本站把术语词条和引文注疏放在一起的理由。
附:这篇怎么反过来管住我们自己
这篇论文对本站是一把双刃刀,写在这里是为了让你能用它来检查我们。
它支持的:前置知识声明(背景知识是必要难度的前提条件)、每节末尾的自测题而非文末测验(生成效应 + 提取练习)、把术语链接到独立词条而非就地展开(迫使一次小的提取尝试)。
它反对的,或者至少要求我们警惕的:
- **逐词字典会破坏生成效应。**按第 5 节,凡是你能靠上下文猜出来的词,查了就是
rob yourself。所以英文引文不做逐词翻译、不内建词典,是这条原则的直接后果,不是偷懒。 - **过分顺滑的”一环套一环”可能是有害的。**如果每个概念都被前一个概念铺垫得毫无阻力,读者的流畅感会飙升而存储强度不涨——正是第 1 节警告的那种情形。所以拆解里保留了原文的难点,并在
hardParts里明说哪里真的难。 - **严格的线性阅读顺序不如交错。**第 3 节的 63% 对 20% 说的就是这个。所以词条之间做成图而非单线,允许读者从任意入口进入、在概念间跳转,反而更符合证据。
最后一句留给原文自己。它开头就说了,日常的试错不会让你形成关于”自己作为学习者”的准确模型——这也意味着,读完这篇文章带来的那种”我懂了”的感觉,同样不可信。真正的检验是一周以后,你还能不能不看原文说出存储强度和提取强度的区别。
继续读什么
按与原文的关系分组,每组内由浅入深。每条都说明为什么值得读——书单不给理由就只是摆设。
上游这篇论文站在谁的肩膀上
A new theory of disuse and an old theory of stimulus fluctuation深入
存储强度/提取强度这套二分的原始理论出处,本文正文明确引用它(Bjork & Bjork, 1992)作为解释框架。想知道两个强度为什么必须分开就读这篇
站内词条存储强度与提取强度
Specific and varied practice of a motor skill进阶
本文扔沙包实验的原始出处(1978)。八岁和十二岁两组,变化练习组在固定距离上反而赢了——这是全文最好的一个反直觉证据
站内词条必要难度
Learning concepts and categories: Is spacing the enemy of induction?进阶
本文图 1 的数据来源(2008)。判断自己学得更好的人和实际学得更好的人几乎相反,这张图是"流畅感骗人"最直接的实验证据
平行同一个问题的另一种答卷
Test-enhanced learning: Taking memory tests improves long-term retention进阶
提取练习的关键实验,本文参考文献之一。同一册书里 Roediger 团队写了并列的一章,两章互为补充
站内词条提取练习
Learning styles: Concepts and evidence进阶
同一批作者亲手拆掉"学习风格"这个流行概念。放这里是因为它示范了一件事: 本文推荐的做法都有实验支撑,而听起来同样合理的"视觉型/听觉型学习者"没有。 读者需要看到作者如何区分这两类主张
下游这个想法后来变成了什么
The shuffling of mathematics practice problems improves learning进阶
交错练习在数学题上的直接验证(2007),本文参考文献之一。想知道"打乱题型"具体怎么操作就看它
站内词条交错练习
反面质疑或限制原文结论的材料
交错并非总是赢:类别结构决定交错还是分块更好。本文写于 2011 年、语气偏乐观, 这篇给出的是"取决于材料"的边界条件
站内词条交错练习
Exploring the necessary conditions for observing interleaved practice benefits in math learning深入
2022 年的复现研究,直指交错效应在数学学习中出现所需的必要条件。 效应量在不同材料上并不稳定,读者应当知道后续十余年的证据比本文语气更参差
站内词条交错练习
2024 年把"必要难度"和认知负荷理论正面对撞。两套理论对难度的处方相反—— 一个说加难度,一个说减负荷。这是本文框架面临的最直接理论竞争
来源
- Making Things Hard on Yourself, But in a Good Way: Creating Desirable Difficulties to Enhance Learning (PDF)UCLA Bjork Learning and Forgetting Lab