Learning

望ましい困難:難しい学習ほど記憶に残る理由

学習がスムーズで、自信を持って進められていると感じるとき、あなたはたいてい思っているほど学べていません。ぎこちなく、遅く、少し苛立たしい。そう感じるやり方こそが、長く残る記憶を築いています。

25分で読める
重要なポイント
    • 望ましい困難とは、学習を遅くしながら学習を良くする条件のこと: Robert Bjorkは1994年、練習中のパフォーマンスを押し下げる一方で長期保持と転移を高める操作を指して、この言葉を作りました。
  • エビデンスが最も強いのは5つ、6つ目がすぐ後ろに続く: スペーシング、インターリービング、リトリーバル練習、生成、変動練習。そして生産的失敗(やり方を教わる前に問題へ挑むこと)です。
  • 流暢さは嘘をつく: 学べているという感覚(すらすら読み返せる、自信を持って見覚えがある、「これはもう分かった」)は、来週その内容を覚えているかどうかを予測しません。
  • 貯蔵強度と検索強度は別物: 記憶は深く貯蔵されていながら、一時的に取り出しにくいことがあります。取り出そうと苦闘すること自体が、次に取り出す力を強めます。
  • 困難が望ましいのは、ある範囲の内側にいるあいだだけ: 複雑な教材に取り組む初学者では生成が逆転し、解答例を学ぶほうが勝ちます。混ぜる対象が互いに紛らわしくないときは、インターリービングさえ逆向きに働きます。
  • AIは既定で困難を取り除く: 2025年のPNASの研究では、制約なしのGPT-4チューターを与えられた生徒は練習中に48%伸び、そのAIを取り上げると、AIを一度も使わなかった生徒より17%低い点数になりました。

望ましい困難とは何か

望ましい困難とは、取り組んでいる最中は練習が難しく、遅く感じられるのに、数週間後の保持と転移はむしろ良くなる、そういう学習条件のことです。逆説的なのは、その渦中にいるあいだは失敗しているようにしか見えないという点で、だからこそ、ほとんど誰も自分からは選びません。

この言葉は、UCLAのRobert A. Bjorkに由来します。彼は1994年にこの考えを名づけ、その後の数十年をかけてElizabeth Ligon Bjorkとともに発展させてきました。彼らの研究室は、同じ結果に何度もぶつかりました。学習の最中にパフォーマンスを押し下げる操作こそが、しばしばそのあとのパフォーマンスを高めていたのです。最もよく知られたまとめは、ElizabethとRobert Bjorkによる2011年の章で、そのタイトルが原理をそのまま述べています。「Making things hard on yourself, but in a good way(自分に対して物事を難しくする、ただし良い意味で)」。

数十年にわたる追試の蓄積を持つ条件が5つあります。

  • スペーシング: 学習を1回にまとめず、別々のセッションに分けて配置すること。
  • インターリービング: 1回のセッションの中で、問題タイプやトピックをまとめずに混ぜること。
  • リトリーバル練習: 情報を読み込み直すのではなく、記憶から引き出すこと。
  • 生成: 答えを見せられる前に、自分で答えを作り出すこと。
  • 変動練習: 毎回同じ条件ではなく、変化する条件のもとで練習すること。

6つ目の生産的失敗は別の研究系譜から育ってきたものですが、同じ系統に属します。これについては、後で独立した節を設けます。

これらに共通するのは、どれもが脳に「再認」ではなく「再構築」を強いる点です。再認は安上がりで、知識のように感じられます。再構築は高くつき、知識を実際に築きます。

ただし、摩擦を足すこと自体が目的ではありません。この考えが誤用されるのは、たいていここです。困難が困難として意味を持つのは、それがあなたに完遂できる追加の処理を引き起こすときだけです。ただ行く手をふさぐだけの困難は望ましくありません。それは障害物です。条件を満たさない例を挙げます。

困難に見えるもの本当に望ましいか望ましくない理由
集中できない騒がしいカフェで勉強するいいえ困難が教材と無関係です。何もエンコードしないまま注意だけを消費します
ひどい文章の教科書を読むいいえ苦闘の相手が概念ではなく文章です
自分の訓練水準を何段階も超えた問題いいえ何も生み出せないので、強化すべき想起が起こりません
個別にまだ理解していないトピックをインターリーブするいいえ識別すべきものがまだありません
章を3回目に読み返すいいえそもそも困難ではありません。流暢さを上げるだけで、貯蔵は手つかずです

流暢性の錯覚

すでに2回読んだ教科書の章を開いてみてください。ページに目を走らせます。文章には見覚えがあります。段落ごとにすっと腑に落ちます。本を閉じるとき、あなたは内容を分かったと確信しています。

1週間後、あなたはその中心的な主張をほとんど思い出せません。

認知心理学者はこれを流暢性の錯覚、あるいは能力の錯覚と呼びます。ほとんどの学習時間が無駄になる最大の原因が、これひとつです。情報がスムーズに処理されると、脳はそのスムーズさを習得の証拠だと解釈します。違います。スムーズさは、ただのスムーズさです。

データは容赦がありません。Dunloskyらが2013年にPsychological Science in the Public Interestで発表したレビューは、よく使われる10種類の学習テクニックを、エビデンスが示す有用性に応じて3つの階層に仕分けました。地球上で最も人気のある2つの方法、ハイライトと再読は、最下層に置かれました。最上層に入ったのは、練習テストと分散練習です。学習者が好む方法は弱い学習を生み、学習者が避ける方法が強い学習を生みます。

最も分かりやすいのが再読です。CallenderとMcDaniel(2009)は、テキストを直後に読み返すことについて一連の実験を行い、ごく一部の例外を除いて、後のテストへの効果はほとんど、あるいはまったくないことを見出しました。なじみは記憶ではありません。再認は再生ではありません。

この錯覚は構造的なものです。脳は処理のしやすさを「これは知っている」というヒューリスティックとして使います。そのヒューリスティックが、将来の想起を予測する用途にはたまたま向いていない、というだけのことです。自分の「分かった」という感覚を疑えるようになることが、学んだものが残る学習への第一歩です。


Bjorkが本当に発見したこと

Robert A. BjorkとElizabeth Ligon Bjorkは、なぜこれが起きるのかを40年かけて解きほぐしてきました。1992年の章「A New Theory of Disuse and an Old Theory of Stimulus Fluctuation」が、そのすべてを説明する枠組みを導入しました。

この理論は、記憶を2つの別々の次元に分けます。

**貯蔵強度(storage strength)**は、記憶がどれだけ深く配線されているかを測ります。異なる文脈にわたって、また時間をかけて、その教材にどれだけ関わってきたかの関数です。貯蔵強度は上がる一方で、下がることはありません。

**検索強度(retrieval strength)**は、いまこの瞬間にその記憶をどれだけ簡単に引き上げられるかを測ります。こちらは激しく変動します。学習した直後には上がり、使わなければ下がり、その瞬間に使える手がかりに大きく左右されます。

流暢性の錯覚は、この2つの隙間に住んでいます。章を読み返すと、教材が目の前にあるので検索強度は跳ね上がります。貯蔵強度はほとんど動きません。検索強度が薄れた瞬間、想起を支えるものは下に何も残っていないのです。

Bjorkの2手目が、この分野に名前を与えました。1994年、彼は、貯蔵強度が上がるのは、想起が難しい状況で情報を想起するときであって、簡単に思い出せる情報を再提示するときではない、と論じました。練習中の困難こそが、逆説的に、持続する学習を作るのです。だから、望ましい困難(desirable difficulties)です。

SoderstromとBjorkの2015年の論文「Learning versus Performance: An Integrative Review」は、この区別をさらに締め上げました。パフォーマンスとは、今日、練習中にできることです。学習とは、後で、新しい文脈でそれを行う能力における比較的永続的な変化です。学習習慣の大半は、パフォーマンスを最大化し、学習を損ないます。

教室での研究が20年ぶん積み上がったあと、Bjork夫妻は2020年のJournal of Applied Research in Memory and Cognitionの論文でこの主題に戻ってきました。そして、その語り口は変わっていました。メカニズムはもう十分に確立されていました。にもかかわらず、それを誰かに実行させる方法は、まったく確立されていませんでした。彼らはこう認めています。自分たちは「関連する研究知見を学習者や教師に伝えるだけで十分だと、非現実的にも前提しがちだった」。実際には、学習者は勉強についての素朴な理論を抱えてやってくるので、まずそれを取り除かなければなりません。同じ号のRohrerとHartwigの言葉を引けば、「あまりにも多くの場合、教室とは有望な介入が死にに行く場所である」。

要点は、ここから先のすべての中心に座っています。セッションが楽に感じるなら、働いているのは検索強度で、貯蔵強度はどこにも動いていません。セッションが生産的な意味で努力を要すると感じるなら(探し、失敗し、立て直し、手を伸ばしているなら)、貯蔵強度は登っています。不快さこそが入金なのです。

これは、Glaspの読者がすでに知っている手法群を一本につなぐものでもあります。アクティブリコール間隔反復、それにファインマン・テクニック、プロテジェ効果、ブラーティング法は、それぞれ無関係な小技ではありません。どれも、貯蔵強度を築く努力的な作業へと脳を追い込むための、異なる手段です。望ましい困難がメタ原理であり、残りはすべてその実装です。

楽に感じるが効かない難しく感じるが効く
同じ章を読み返す本を閉じて、覚えていることを書き出す
集中練習(一夜漬け)数日から数週間にわたる分散練習
1つのトピックを習得してから次に進む1回のセッションで複数のトピックをインターリーブする
すでに理解している内容の解答例を読む確認する前に自分で答えを生成する
まったく同じ問題タイプを反復する問題タイプと文脈を混ぜる
段落全体をハイライトする控えめにハイライトし、自分の言葉で余白注釈を書く

スペーシング:分散学習が一夜漬けに勝つ理由

スペーシング効果は、この文献全体で最も古く、最も多く追試されてきた知見です。Hermann Ebbinghausが1885年に記述しました。今でも効きます。

主張はシンプルです。ある教材を学ぶのに合計10分あるとしたら、その10分を1ブロックで使い切るより、複数のセッションに分けたほうが、遅延テストでより多くを覚えています。総時間は変わりません。効いているのは分布のほうです。

Cepedaらが2006年にPsychological Bulletinで行った統合分析は、184本の論文に含まれる317の実験から839の測定をまとめたもので、すべて言語的な再生課題でした。スペーシングは一貫して集中学習を上回り、しかも最良の保持をもたらす間隔は、保持期間が長くなるほど広がりました。同じグループによる2008年の後続実験が、その比率を突き止めています。最適な間隔は、どれだけ長く覚えていたいかに対する割合としては縮んでいきます。1週間だけ覚えておきたいならおよそ20〜40%、1年覚えておきたいならわずか5〜10%程度です。平たく言えば、1か月保たせたいなら数日おきに復習し、1年保たせたいなら間隔を数週間まで伸ばす、ということです。

メカニズムは貯蔵強度と検索強度の切り分けに直結します。同じものを続けて2回学ぶと、2回目の露出は検索強度がまだ高いうちに起きるので、その練習は実質タダで、貯蔵の増分はごくわずかです。3日後にもう一度学ぶと、検索強度は減衰しています。記憶を引き上げるには労力が要り、その労力こそが貯蔵を買っているのです。

実践上、スペーシングが戦う相手は2つ。一夜漬けと、予定に入っていない復習(つまり永遠に起きない復習)です。解決策はカレンダーのレベルにあります。本当に残したいものを選び、それぞれに繰り返しの復習枠を与え、「何にもっと注意が要るか」という自分の感覚よりもスケジュールを信じること。その感覚は、繰り返しになりますが、たいてい流暢さがしゃべっているだけです。


インターリービング:混ぜるほうがまとめるより効く理由

インターリービングとは、1つを習得し終えてから次に移るのではなく、1回の学習セッションの中で異なるトピックや問題タイプを混ぜることです。代数を学んでいるなら、二次方程式を20問続けては解きません。二次方程式を1問、次に連立方程式、次に関数の変換、そしてまた二次方程式に戻ります。

取り組んでいる最中の手応えは、むしろ悪くなります。セッション中のパフォーマンスは落ちます。学習者は、インターリーブ練習のほうから多く学べたと計測されたあとでさえ、そちらの効果を低く評価しがちです。このメタ認知のずれは、この分野で最も強力な錯覚の1つです。

Doug RohrerとKelli Taylorは2007年、知見をそのままタイトルにした研究でこれを示しました。「The Shuffling of Mathematics Problems Improves Learning」。大学生に数種類の問題の解き方を学ばせ、その後、タイプごとにブロック化して練習させるか、ランダムに混ぜて練習させました。1週間後にテストすると、混合グループのパフォーマンスは圧倒的に上でした。Rohrer、Dedrick、Stershicは2015年、これを実際の教室で再現しています。126人の7年生が3か月にわたってインターリーブまたはブロックの課題に取り組み、遅延テストで同じ結果が出ました。

なぜ効くのでしょうか。メカニズムは2つです。第一に、インターリービングは識別を強制します。同じ手順をオートパイロットで当てはめるわけにはいかず、それぞれの問題がどの手順を求めているのかを見極めなければなりません。その識別こそ、テストや実際の仕事であなたが本当に必要とする技能です。第二に、インターリービングは定義上、各トピックを分散させます。問題タイプAの項目のあいだは問題タイプBの項目で埋まるので、Aに戻るたびに本物の想起が起きるのです。

この識別というメカニズムは、インターリービングが効かなくなる境界も教えてくれます。そして、一般向けの解説がいちばん雑になるのがここです。BrunmairとRichterが2019年にPsychological Bulletinで発表したメタ分析「Similarity matters」は、59件の研究と238の効果量をまとめました。全体としてはインターリービングが中程度に勝ちましたが(Hedges' g = 0.42)、その利得は教材によって大きく割れています。絵画のような視覚的カテゴリで最大、数学の問題ではより小さく、ただの単語リストでは逆転して、ブロック練習が完勝しました。このパターンは理論の予測どおりです。混ぜているカテゴリが互いに紛らわしいなら、並置することで見分け方が身につきます。共通点が何もないなら、識別すべきものがなく、切り替えコストだけをただ払うことになります。

独学者にとって、インターリービングは聞こえるよりは簡単で、見た目よりは難しいものです。凝ったスケジューラは要りません。先へ進む前にトピックを「終わらせたい」という衝動を拒めばいいだけです。ストア哲学の章を読み、次に確率論の章、次にUIデザインの章、そしてまたストア哲学へ。脳は抗議します。脳のほうが間違っています。スケジューリングの実務は、インターリービング練習の詳しいガイドで扱っています。


リトリーバル練習:テスト効果

望ましい困難を1つだけ採り入れるなら、これにしてください。リトリーバル練習(テスト効果)とは、情報を記憶に押し戻すのではなく、記憶から引き出す行為です。アクティブリコール、フラッシュカード、ブラーティング法、そして教育で機能しているものの大半を動かしているエンジンが、これです。

Henry Roediger IIIとJeffrey Karpickeが2006年にPsychological Scienceで発表した「Test-Enhanced Learning: Taking Memory Tests Improves Long-Term Retention」が、その正典的な実証です。学生は散文の文章を学習し、その後、再学習するか自由再生テストを受けるかに分かれました。どちらの場合もフィードバックはありませんでした。最終テストは5分後、2日後、1週間後に行われました。5分後の時点では再学習組が勝ちました。1週間後には、テスト組の保持率がおよそ50%高くなっていました。総時間は同じで、違うのはやった作業です。失敗した想起も含め、あらゆる想起が、再提示にはできない仕方で根底の記憶を変えていたのです。

メカニズムは検索誘発性の再固定化です。記憶をうまく引き上げると、それを支える神経パターンが、そのとき活性化している手がかりとともに再エンコードされます。この再エンコードはパターンを強め、後でそれを引き起こせる手がかりの集合を広げます。失敗してから答えを学んだ場合には、その失敗した探索そのものが、訂正をより深くエンコードするための下地になります。Richland、Kornell、Kaoは2009年にこれを実証し、*pretesting effect(事前テスト効果)*と名づけました。

リトリーバル練習は何十もの形をとります。本を閉じたままの想起、フラッシュカード、自由形式の要約執筆、声に出して教えること、ファインマン・テクニック。共通しているのは根っこの動きです。見る前に、記憶から引き出すこと。

Glaspのウェブハイライターで章をハイライトしたら、いったんソースを閉じて、自分のハイライトだけから議論を再構築してみてください。それからページを開いて答え合わせをします。自分が出せたものと、そこに実際にあるものとの差が、あなたの貯蔵強度の不足分です。その差を埋めることが、作業の中身です。


生成:先に自分で答えを出す

生成効果はリトリーバル練習の近縁ですが、独立した項目を立てるだけの違いがあります。SlameckaとGraf(1978)は5つの実験を通じて、教材を自分で生成した学習者のほうが、同じ教材をただ読んだ学習者よりよく覚えていることを示しました。

彼らの実験パラダイムはルールにもとづくもので、拍子抜けするほど単純です。一方のグループは「lamp - light」のような単語ペアをそのまま読みました。もう一方には、ルール(associate、つまり連想)と刺激語の「lamp」、そして頭文字の「l」だけが渡され、自力で「light」を作り出さなければなりませんでした。読んだグループは答えを見ていたにもかかわらず、生成したグループが大差で勝ちました。

この原理はそのままスケールします。証明の解答を読むことは、自分で証明を試みてから見比べることより、力になりません。誰かの本の要約を読むことは、自分で要約を書くことより学びが少なくなります。誰かがコードを書くのを眺めることは、自分でコードを打ち、エラーにぶつかり、その理由を突き止めることより学びが少ないのです。

生成は、望ましい困難の純粋形です。もらえたら嬉しい情報をわざと差し控え、自分で作り出すことを強制します。半分思い出し、半分推測するときのあの苛立ちが、まさにメカニズムそのものです。答え合わせをする頃には、露出をエンコードに変える作業を、あなたはすでに終えています。

ハイライトは生成の道具にも、受動的な道具にもなります。全段落に黄色を絨毯爆撃するのは受動的です。判断を、未来の読み返しに外注しているだけだからです。控えめで意図的なハイライトは生成的です。「これはあれより重要だ」と、いまのあなたに態度表明を迫るからで、それ自体がすでに統合という作業です。ハイライトの科学でさらに深く掘り下げています。


変動練習:条件のほうを変える

変動練習とは、同じ技能を毎回まったく同じ条件で練習するのではなく、少しずつ異なる形式、文脈、条件のもとで練習することです。

KerrとBoothが1978年に行った、子どもにお手玉を投げさせる研究が教科書的な例になりました。8歳児と12歳児という2つの年齢群で実施されています。一方のグループは、1つの距離だけから練習しました。もう一方は、的の距離を挟み込みながら、その距離そのものは一度も含まない複数の距離から練習しました。変動グループは、一度も練習していないテスト投擲で、固定グループを上回ったのです。彼らはより一般的な運動表象を築いていました。

この設計の細部に注意してください。たいてい落とされてしまう点です。変動させた距離は、的を取り囲んでいました。変動性は、でたらめなノイズを入れてよいという免許ではありません。技能を一般化させたい範囲全体を、変動がカバーしているときに効くのです。

認知的な学習も同じパターンを示します。学ぶ定義の言い回しを変えてみましょう。新しい用語に出会う文脈を変えてみましょう。同じ教科書の別々の章ではなく、別々の分野で同じ概念について読んでみましょう。

変動性が支えるのは転移、つまり学んだことを、学んだときの条件の外で使う力です。転移こそ、ほとんどの学習者が欲しがっているものであり、ほとんどの学習習慣が積極的に妨げているものです。1つの形式だけで技能を練習すれば、その形式ごと技能をエンコードしてしまい、形式が変わった途端に苦労します。変動性は、技能を特定の形式から切り離します。


生産的失敗:説明の前に苦闘する

ETHチューリッヒのManu Kapurは、これを生産的失敗と呼びます。やり方を教える前に学習者へ難しい問題を与え、欠陥だらけの試行を自分で作らせ、そのあとで初めて説明を届ける、というやり方です。

試行はたいてい失敗します。それが設計です。失敗した試行が果たす役割は、問題空間の地図を作ることです。おかげで、正統な解法がやってきたとき、学習者にはそれを置く場所があり、自分のアプローチに何が欠けていたのかも見えます。

SinhaとKapurが2021年にReview of Educational Researchで発表したメタ分析は、166件の実験的比較をまとめました。「指導より先に問題解決」は、「問題解決より先に指導」を概念理解と転移で上回り(Hedges' g = 0.36)、しかも手続き的知識では何も失いませんでした。Kapurの設計原則に最も忠実に従った研究では、g = 0.58 に達しています。エビデンスの土台はSTEMに大きく偏っており、効果は年齢に沿って動きます。およそ6年生以上で最も強く、最年少の子どもたちではわずかにマイナスでした。生産的に失敗するための、問題解決の足場がまだできていないからです。

読書版は簡単に実行できます。半分だけ知っているトピックの記事を開く前に、2分だけ使って、自分なりの答えを書いてみてください。それから読みましょう。あなたの版はほぼ必ず、興味深い形で間違っています。そして、その版と著者の版とのあいだの差こそが、あなたの記憶に残るものです。

6つを一覧にすると、こうなります。

困難メカニズム具体例主要研究
スペーシング記憶が減衰するなかで本物の想起を強制する今日4回まとめるのではなく、1日目・3日目・7日目・21日目にノートを復習するCepeda et al. (2006)
インターリービング問題タイプ間の識別を強制する1回のセッションで代数・幾何・統計を混ぜるRohrer & Taylor (2007); Brunmair & Richter (2019)
リトリーバル練習新しい手がかりとともに記憶を再エンコードする本を閉じて覚えていることを書き、それから確認するRoediger & Karpicke (2006)
生成自分で答えを生成するほうが、読むより深いエンコードを強いる説明を読む前に答えを予測するSlamecka & Graf (1978)
変動練習文脈に依存しない表象を築く同じ概念を3つの異なる領域で解くKerr & Booth (1978)
生産的失敗失敗した試行が、説明の着地点になる地図を作るやり方を教わる前に問題へ挑むSinha & Kapur (2021)

困難が「望ましくない」に変わるとき

すべての困難が役に立つわけではありません。そして、どこで役に立たなくなるのかについての研究は、たいていの要約が認めているよりずっと具体的です。

困難が望ましくなくなるのは、学習者がそれに生産的に関われないときです。そもそも単語が解読できないなら、読む速度をさらに落としても助けにはなりません。微分が何かを知らないなら、微分と積分の問題をインターリーブしてもただの雑音です。リトリーバル練習が自分の貯蔵強度をはるかに超えていて何も出てこないなら、それは想起ではなく、空回りです。

認知負荷理論が、これにメカニズムを与えます。ワーキングメモリが同時に扱える相互作用する要素は、ほんの数個です。教材がすでに高い要素相互作用性を持っている(互いの関係のなかでしか意味をなさない部品が多い)とき、その上に生成やインターリービングを載せると、総負荷が容量を超えます。追加された困難を処理する余力が残っていないので、その困難は何も生みません。

Chen、Kalyuga、Swellerは2015年、Journal of Educational Psychologyの研究で、幾何の指導を使ってこの交差を直接示しました。要素相互作用性の低い教材では、生成効果は期待どおりに現れました。自分で答えを生成するほうが、答えを見せられるより勝ったのです。要素相互作用性の高い教材では逆転し、解答例を学ぶほうが生成に勝ちました。さらに、より知識のある学習者を対象にした第2実験では、実効的な複雑さが下がり、生成がすべてで勝ちました。これが熟達度逆転効果です。正しい学習方略は固定されていません。あなたが上達するにつれて動きます。

Bjorkの言い方が、これらすべてをまとめています。苦闘が着地するには、その下に十分な足場がなければならない、と。

正しいゾーンとは、たとえ不完全でも何かを生み出せる場所です。手を伸ばしているのであって、落下しているのではありません。いくつかの試行では失敗し、大半では成功しているのが目安です。全部正解できてしまうなら、教材が易しすぎるか、間隔が短すぎます。ほとんど何も出てこないなら、境界を越えています。そこで必要なのは根性ではなく、足場です。

だから、調整は両方向に行います。本当に手に余るときは、苦闘をロマン化しないこと。説明を読み、土台を整えてから戻ってきましょう。楽すぎると感じるときは、その心地よさに騙されないこと。間隔を広げ、難しいバリエーションを混ぜ、より生成的な形式に移りましょう。

一方の軸に貯蔵強度、もう一方の軸に検索強度を取って思い描いてみてください。高貯蔵/高検索は、最近練習していて、よく学べている状態です。高貯蔵/低検索は、リトリーバル練習が最も効く場所です。探索は難しいけれど、入金は本物だからです。低貯蔵/高検索が危険な象限です。たった今読み返したばかりで、知っている気になっているのに、まだ何も築けていないもの。一夜漬けはここに住んでいます。低貯蔵/低検索は本当に新しい教材で、まず足場が要ります。


AIツールは望ましい困難を消してしまうのか

既定では、そのとおりです。AIアシスタントは、貯蔵強度を築くまさにその努力を削除する、きわめて効率のよい機械です。そして、その代償についての最初のまともなエビデンスが2025年に出ました。

Hamsa Bastani、Osbert Bastaniらは、トルコの大規模校で高校数学を学ぶ1,000人近い生徒を対象にランダム化比較試験を実施し、PNASで発表しました。生徒は練習セッション中、2種類のGPT-4チューターのどちらかを使いました。「GPT Base」は、通常のChatGPTのインターフェースと同じ振る舞いをします。研究者は「GPT Tutor」のほうに安全策をプロンプトで組み込みました。最も重要なのは、答えを渡すのではなく、教師が設計したヒントを出させることです。

支援つきの練習中は、どちらも見事に機能しました。GPT Baseの生徒は対照群より48%向上し、GPT Tutorの生徒は127%向上しました。

そのあと研究者はツールを取り上げ、テストを実施しました。

GPT Baseで練習した生徒の点数は、AIをまったく使わなかった生徒より17%低いものでした。ツールを手にしていたときの見かけより落ちた、という話ではありません。ツールを一度も与えられなかった対照群より低かったのです。GPT Tutorのグループは対照群と統計的に区別がつかず、点推定値はほぼゼロでした。

これは、SoderstromとBjorkが言うパフォーマンスと学習の乖離が、チャットボットを使って、学校規模で再現されたということです。練習中に最も助けてくれたツールが、その後に最も害をなしました。そして、解決策が禁止ではなかったことに注目してください。解決策は、AIに答えを差し控えさせることでした。これは、帽子をかぶり替えただけの生成効果です。

大人のナレッジワークも同じ形を示します。CHI 2025で、Microsoft ResearchとCarnegie MellonのLeeらは、319人のナレッジワーカーに、AIを使った実際の業務936例について調査しました。多くが認知的な努力の低下を報告し、重要な相関はこう走っていました。AIへの信頼が高いほど批判的思考は少なく、自分自身への信頼が高いほど批判的思考は多くなっていました。ツールへの信頼が、思考の代わりになるのです。

広く共有されたMIT Media LabのKosmynaらの研究も、同じ方向を指しています。脳波の記録では、LLMを使ってエッセイを書いた参加者の神経結合が最も弱く、その参加者たちは、たった今自分が書いた文章を引用することにも苦労しました。ただし、確定ではなく示唆として扱ってください。まだプレプリントであり、参加者は54人しかおらず(うち最終セッションに参加したのは18人)、他の研究者からサンプルサイズと分析についての詳細な方法論的批判がすでに公開されています。

これらはどれも、AIを使うなという議論ではありません。AIをループのどこに置くかという議論です。

困難を消してしまう使い方困難を保つ使い方
読む前に「この記事を要約して」自分で読んで要約を書き、そのうえで見落としをAIに探させる
「この問題を解いて」「私はこう考えてこの答えになりました。推論はどこで壊れていますか」
先に説明を求める先に答えを予測し、そのあとで説明を求める
フラッシュカードを作らせて、それを読むフラッシュカードを作らせて、本を閉じたまま答える
最初の回答をそのまま受け入れる反対の立場で論じ直させ、そのうえで自分で判定する

目安はこうです。AIには答えさせるのではなく、採点させましょう。想起は自分でやり、何かを生み出し、そのうえで初めてモデルを呼んで、自分の出力をソースと突き合わせさせます。困難は自分に残し、採点だけを外注するのです。より広いトレードオフはAIと学習で扱っており、AI学習モード比較では、いまどのアシスタントが既定で答えを差し控えるのかを見ています。


望ましい困難を組み込んだルーティンの設計

原則を知っても、自動的にはなりません。意図的に設計として組み込む必要があります。最小抵抗の経路は、いつでも、心地よくて貯蔵の増えない選択肢のほうだからです。自学自習のシステムに困難を焼き付ける方法を挙げます。

マークするためではなく、生成するためにハイライトする。文には控えめに印をつけ、そのうえで自分の言葉で短いメモを書き、なぜその箇所が重要なのか、すでに知っていることとどうつながるのかを説明します。絞り込んだ選択が識別です。メモが生成です。メモのないハイライトが、受動的な罠です。

AIチャットは説明のためではなく、リトリーバルのために使う。AIアシスタントの間違った使い方は、まだ読んでいない章の要約を頼むことです。正しい使い方は、章を読み、閉じ、自分で要約を書き、それをGlaspのAIチャットに貼り付けて、自分の再構築をソースと突き合わせて採点してもらうことです。想起はあなたがやりました。比較はAIがやります。

記憶ではなくKindleハイライトでスペーシングする。いつ復習すべきかというあなたの感覚は壊れています。それを動かしているのは新しさと感情であって、貯蔵曲線ではありません。復習はカレンダーに入れ、3週間前に読んだ本のハイライトを呼び出し、スクロールする前に議論を再構築してみてください。機械的なスケジュールこそが、流暢さに駆動された直感からスペーシングを守ります。

コミュニティフィードでインターリーブする。同じ人物が書いた同じトピックの記事を、4本続けて読まないこと。回しましょう。認知科学、次に起業、次にライティング、そして1日置いてから認知科学へ戻ります。領域をまたぐ識別は、1つを深掘りするより強いトレーニングです。

YouTubeサマリーを見たら、自分をテストする。ページを閉じて、1年後にも覚えていたいことを3つ書き出します。トランスクリプトと比べます。その差が、あなたの作業の場です。

読む前に予測する。予備知識のないまま開くものには、生産的失敗の一手を打ってください。何に目が留まるかが変わります。

形式を変える。同じアイデアを、本で、論文で、スレッドで、動画で読みます。媒体ごとにアイデアのエンコードのされ方が違うので、脳はそれらを横断して抽象化しなければなりません。それが変動練習の狙いです。

システムとしての全体像は、学習OSの作り方を扱った姉妹記事にあります。望ましい困難は原則です。OSは日々のメカニクスです。


よくある質問

望ましい困難の5つとは何ですか

スペーシング(学習を時間的に分散させる)、インターリービング(トピックや問題タイプを混ぜる)、リトリーバル練習(読み返すのではなく思い出す)、生成(答えを見る前に自分で作る)、変動練習(練習の条件を変える)の5つです。やり方を教わる前に問題へ挑む生産的失敗が、これに密接に関連する6つ目です。6つに共通するメカニズムは1つ。再認ではなく再構築を強いる、という点です。

望ましい困難の例を教えてください

本を閉じて、記憶だけで要約を書くのが最も分かりやすい例です。一夜漬けではなく間隔を空けたスケジュールで復習すること、1回のセッションで問題タイプを混ぜること、説明を読む前に答えを予測することも同じです。判定基準は2つあります。困難が、教材そのものと、それへの関わり方から生じているか。そして、それでも何かを生み出せるか。気が散るカフェで勉強するのは、この基準を満たしません。困難が内容と無関係だからです。今の自分の水準をはるかに超えた問題も同じで、生産的に関わることができないからです。

「望ましい困難」という言葉はどこから来たのですか

Robert A. Bjorkが1994年に作った言葉です。多くの人が引用する読みやすいまとめは、ElizabethとRobert Bjorkによる2011年の章、Psychology and the Real World所収の「Making things hard on yourself, but in a good way: Creating desirable difficulties to enhance learning」です。中心的な主張はこうです。習得を遅らせ、練習中のパフォーマンスを悪く見せる条件が、しばしば長期的な保持と転移を良くします。そして学習者は、その短期的な落ち込みを体系的に失敗と読み違えます。Bjork夫妻は2020年、Journal of Applied Research in Memory and Cognitionでこの主題に戻っていますが、その主眼は、これらの考えを実際に採用してもらうことがいかに難しいかを述べる点にありました。

ハイライトは望ましい困難ですか

やり方しだいで完全に変わります。そして、ほとんどのハイライトは望ましい困難になっていません。段落まるごとに印をつけるのは、判断を、後でそのページを読み返す誰かに先送りしているだけです。1ページに1〜2箇所だけ控えめにハイライトし、それぞれに自分の言葉でメモを書けば、それは識別の課題であり、同時に生成の課題でもあります。ハイライトは、読書の代わりではなく、未来の想起の手がかりとして扱ってください。

すべての問題で苦闘すべきですか

いいえ。目指すのは生産的な苦闘であって、空回りではありません。何も生み出せていないなら、望ましいゾーンを越えて過負荷に入っています。いったん引き返し、土台を整えてから、その困難に戻ってください。ときどき失敗して、たいていは成功しているくらいがちょうどよいのです。そして、自分にとって本当に複雑で新しい教材については、研究は「まず解答例を学ぶほうが生成に勝つ」と言っています。Chen、Kalyuga、Sweller(2015)は、要素相互作用性の高い内容では、学習者が効果を反転させるだけの熟達度を得るまで、解答例が問題解決に勝つことを見出しました。

ChatGPTを使うと学習は損なわれますか

ループのどこに置くかで完全に変わります。2025年のPNASのランダム化比較試験では、制約なしのGPT-4チューターで練習した生徒は、後のテストで、AIを一度も使わなかった生徒より17%低い点数になりました。一方、答えではなくヒントを出すチューターを使った生徒には、そうしたペナルティは見られませんでした。想起をモデルに代行させれば、学習は失われます。想起を自分でやり、モデルは答え合わせに使えば、学習は残ります。

復習の間隔はどのくらい空けるべきですか

心地よく感じるよりは長く、そして毎回少しずつ長く。保持を最大化する間隔は、覚えておきたい期間が長くなるほど広がり、同時にその期間に対する割合としては縮みます。ですから1か月覚えておきたいなら復習と復習のあいだは数日、1年なら数週間です。復習が楽に感じたら、次の間隔を伸ばしましょう。難しく感じたら、縮めましょう。いずれにせよ、勘よりスケジュールのほうが上です。

望ましい困難は事実だけでなく技能にも当てはまりますか

はい、おそらく技能のほうがより強く当てはまります。変動性の研究は運動学習から生まれました。インターリービングは、教科書より先にスポーツや音楽で研究されています。識別、転移、想起の要素を持つ技能なら何でも恩恵を受けます。コーディング、ライティング、デザイン、語学、楽器、運動技術。練習の形は変わりますが、原則は変わりません。

なぜ私の学校はいまだに楽な方法で教えるのですか

楽な方法のほうが、短期的には見栄えがするからです。集中練習と再読は、指導の直後に行う小テストでは高い点を生み、1か月後には低い点を生みます。ほとんどの学校は遅延保持を測っていません。SoderstromとBjork(2015)はまさにこの点を指摘しました。パフォーマンスと学習を取り違えるのは構造的な問題であって、個人の問題ではない、と。独学者であるあなたは、機関が追いつくのを待つ必要はありません。


結論

持ち帰るべき原則はこれです。学習が楽に感じるなら、たぶんそれは学習ではない。努力は、持続する学びの代価です。脳は、スペーシング、インターリービング、想起、生成、変動性、あるいは生産的失敗によってあなたがそれを稼いだときにだけ支払います。

これは「もっと頑張れ」という意味ではなく、「もっと賢く頑張れ」という意味です。学習者の大半は、すでに時間を投じています。ただ、その時間を、流暢さを最大化し貯蔵を最小化する活動に使っているだけです。読み返し1回を、本を閉じたままの再構築1回に取り換えましょう。一夜漬け1回を、間隔を空けた復習4回に取り換えましょう。同じ問題ばかりの1ブロックを、混ぜたセットに取り換えましょう。どの取り換えも、短期の心地よさを長期の保持と交換しています。

2026年になって、賭け金は上がりました。机の上のあらゆるツールが、努力の要る部分を代わりにやりましょうと申し出てきます。そしてエビデンスによれば、その申し出を受けることは、あなたのパフォーマンスをよく見せてくれる一方で、学習を失わせます。同じ研究からの朗報はこうです。答えを差し控えるツールなら、そのペナルティは生じません。どちらを使うかは、あなたが選べます。

Glaspは、この取引を中心に作られています。控えめなハイライト、余白のメモ、AIが採点する再構築、過去に読んだものの間隔を空けた復習、そして既定でトピックを混ぜてくるコミュニティフィード。どれも、露出を貯蔵に変えるために設計された、小さな摩擦のかけらです。

明日、自分のルーティンのなかで最も楽なものを1つ選んで、その難しい版に置き換えてみてください。その取り換えこそが、このゲームのすべてです。

Start building your knowledge library

Highlight what matters as you read across the web. Save insights from articles, books, and YouTube videos in one place.

Get Started Free

Or highlight this page as you read it