AIチューターは効果があるのか。短い答え
答えを出し惜しむように作られているとき、AIチューターは効果があります。そうでないとき、効果はなく、何もしないより測定できるほど悪くなります。この1つの変数は、モデルよりも、科目よりも、国よりもはっきりと、本記事で扱う試験群を二分します。
両陣営の最も強い証拠は、2025年6月に3週間の間隔をおいて世に出ました。ハーバードのランダム化比較試験では、専用に設計されたAIチューターを使った学生は、アクティブラーニング形式の物理の授業を受けた学生より多くを学び、しかも所要時間は短くなりました。トルコの高校のおよそ50クラスを対象にしたPNASの試験では、通常のGPT-4を使えた生徒は、一度も使わなかった同級生より試験の成績が17%低くなりました。
どちらもGPT-4です。ハーバードのチューターは教授法上のルールで強く縛られていました。トルコ側の「GPT Base」条件は、ただのチャット画面でした。研究から1つだけ持ち帰るなら、これにしてください。AIチューターとはモデルの上に積み重ねた制約のセットであり、その制約こそが製品なのです。
ハーバードの試験:効果は2倍、時間は短く
ハーバードのKestinらは、2023年秋に大規模な学部の物理学の講義でこの試験を実施し、2025年6月3日に「AI tutoring outperforms in-class active learning」というタイトルでScientific Reportsに発表しました。サンプルは194人の学生です。
この研究を丁寧に読む価値があるのは、対照群のほうです。それは講義ではありませんでした。ハーバードの物理学プログラムはすでにアクティブラーニング形式の教室を運用しており、これは物理教育研究が数十年にわたって講義に勝ると示してきた形式です。AIチューターは、大学がやることの中で最悪のものではなく、現行のベストプラクティスと比較されたのです。
見出しになった結果はこうです。AIチューター群の学習効果の中央値は、対面授業群の2倍を超えました。時間の数字も同じくらい重要です。AI条件での作業時間の中央値は49分、対する授業時間はおよそ1時間でした。学生はまた、より没頭でき、意欲が高まったと報告しています。
チューターそのものは、気の利いた名前のついたチャットボットではありませんでした。研究者たちは教授法をプロンプトに書き込んでいます。1問ずつ進めること、学生に読ませるのではなく産出させ続けること、対面授業と同じ指導手順をたどること。論文自身の説明によれば、まず設計があり、モデルはそれを届けるための手段にすぎませんでした。
報道がたいてい飛ばす注意点が2つあります。これは、準備の整った学生が異例に多い大学の、1つの科目の2つの単元での結果であり、全員が両方の条件を経験するクロスオーバー設計で実施されました。対象は2レッスンであって、1学期ではありません。印象的ではありますが、15週間で何が起きるかについての主張には、まだなっていないのです。
トルコの試験:練習では大幅改善、試験では17%下落
Hamsa Bastani、Osbert Bastani、Alp Sungu、Haosen Ge、Özge Kabakcı、Rei Marimanのチームが、その反証を出しました。論文「Generative AI without guardrails can harm learning: Evidence from high school mathematics」は、2025年6月25日にPNASに掲載されています。
設計はハーバードより大きなものでした。トルコの高校の9年生、10年生、11年生のおよそ50クラス、1,000人近い生徒、90分のセッションが4回。条件は3つです。
- 対照群:AIなし。
- GPT Base:標準的なGPT-4のチャットインターフェース。
- GPT Tutor:後述する2つの安全策を加えたGPT-4。
練習の最中、AIは目覚ましく見えました。GPT Tutor条件の生徒は、対照群より127%良く練習問題を解きました。GPT Baseの生徒は48%良い成績でした。研究がそこで止まっていたら、教育テクノロジーで最も引用される結果になっていたでしょう。
そのあと研究者たちはAIを取り上げ、試験を実施しました。GPT Baseの生徒は、一度も触れたことのない生徒より17%低い点数でした。練習中の自分より悪かったのではありません。対照群より悪かったのです。著者らの読み筋は率直です。生徒はGPT-4を松葉杖として使い、その松葉杖は体重を支えていた、と。
GPT Tutor条件はこの損害を避けました。同時に、便益も生みませんでした。論文はこの条件の試験の点推定値を−0.004と報告しています。Base条件の害より1桁小さく、統計的にゼロと区別がつきません。ガードレールは「害をなさない」というところまでは正確に機能し、それ以上ではありませんでした。
この結果は、受けている以上の注目に値します。両陣営を同時に困らせるのが、まさにこれだからです。AI推進派は127%を引きます。AI批判派は17%を引きます。よく設計されたチューターが「何もしない」と横並びに着地したという発見を引く人は、ほとんどいません。
AIチューターが役に立つかどうかを決める、たった1つの設計上の選択
GPT TutorのプロンプトにあってBase条件になかったものは、これです。第1に、答えを直接与えずにヒントを出せという指示。第2に、各問題について教師が用意した材料、すなわち少なくとも1つの正解、生徒がその問題でよくする間違い、そしてその間違いへの応じ方です。
それだけです。同じモデル、同じ生徒、同じ90分。「何もしないより17%悪い」と「害なし」を分けたのは、数百語の指示と、生徒がどこでつまずくかという教師の知識でした。
ほかの試験を見渡しても、同じ変数が繰り返し現れます。スタンフォードのTutor CoPilotの研究では、AIの支援を受けたチューターは答えを渡してしまう確率が低く、誘導質問をする確率が高いと分かりました。GoogleのLearnLMは、まさに「ソクラテス式の質問を下書きする」点でチューターたちから評価されました。ハーバードのチューターは、学生に答えを受け取らせるのではなく、産出させ続けるように作られていました。
| 試験 | 対象 | N | AIに許されたこと | 結果 |
|---|---|---|---|---|
| Kestin et al. 2025(Sci Rep) | ハーバードの物理、1レッスン | 194 | 台本化された教授法、1問ずつ | 学習効果の中央値がアクティブラーニングの2倍超、しかも49分 |
| Bastani et al. 2025、GPT Base(PNAS) | トルコの高校数学 | 合計約1,000 | 何でも(素のGPT-4チャット) | 試験でAIなしより17%悪化 |
| Bastani et al. 2025、GPT Tutor(PNAS) | 同上 | 同上 | 教師が書いたヒントのみ、答えは出さない | 害なし、測定できる効果もなし(−0.004) |
| Wang et al.、Tutor CoPilot(スタンフォード) | 米国タイトルI校、実地の個別指導 | チューター900人、生徒1,800人 | 人間のチューターに誘導質問を提案 | トピック習熟が+4パーセントポイント、評価の低いチューターでは+9ポイント |
| De Simone et al. 2025(世界銀行) | ナイジェリア、放課後の英語 | 約760人を分析 | 教師監督下のセッション、練習にAIを使用 | 全体+0.31 SD、英語+0.23 SD |
| LearnLM / Eedi 2025 | 英国の中等学校5校 | 165 | 人間のチューターが承認するソクラテス式メッセージを下書き | 新規の問題で+5.5パーセントポイント |
AIチューターの試験群を貫くパターンは、微妙なものではありません。効果を生んだ条件はどれも、人間をループの中に残すか、答えを手の届かないところに置くか、その両方でした。摩擦をすべて取り除いた唯一の条件が、表の中で唯一の負の結果を生んでいます。
これは、学習科学が50年にわたって論じてきたことと重なります。望ましい困難とは、学習をつらく感じさせ、その分だけ定着させる条件のことです。制約のないチャットボットは、困難を取り除く機械です。次の20分を生産的に感じさせるのが非常にうまく、その感覚こそ能力の錯覚が描くものです。
撤回されたのに、いまも引用され続けるChatGPTのメタ分析
この1年でAIと学習について楽観的な文章を読んだことがあるなら、たぶんこの数字に出会っています。g = 0.867、「学習成果への大きな正の影響」です。出どころは、Jin WangとWenxiang Fanによる51件の研究のメタ分析で、2025年5月にHumanities and Social Sciences Communicationsに掲載されました。学習に対する認識についてはg = 0.456、高次思考についてはg = 0.457も報告しています。
この論文は2026年4月22日に撤回されました。
掲載誌が挙げた理由は「メタ分析における齟齬」であり、それが「分析の妥当性と、そこから導かれた結論に対する編集者の信頼を損なう」というものでした。懸念を提起したのは、ノルウェー北極大学(UiT The Arctic University of Norway)の研究者、Magnus IngebrigtsenとMarko Lukicの2人です。2人は、研究件数の計算が合わないこと、そして最も重い重みがついた2件の研究はそもそも分析に入るべきではなかったことを見つけました。最も鋭い指摘はこうです。論文自身のファンネルプロットは、統合効果量が0.867ではなく0.5に近いことを示しており、しかも論文にはフォレストプロットがありませんでした。メタ分析でそれが欠けているのは、奇妙なことです。
収録された研究群にも問題がありました。そのうち1件は、それ自体がすでに撤回されていました。ほかにも、ラベルが誤っているもの、規模が小さすぎるもの、信じるには大きすぎる効果を報告しているもの、明らかな交絡を統制していないものがありました。著者らは撤回に関する問い合わせに応答していません。
この論文はGoogle Scholarで800回以上、出版社自身のカウンターで435回引用されており、注目度は99パーセンタイルに位置します。撤回された数字は、撤回されたからといって流通を止めません。スライド資料やベンダーのページ、ニュース記事の中で、その後も何年にもわたって回り続けます。次に製品ページが疑わしいほどきりの良い改善率を掲げているのを見たとき、思い出す価値のあることです。同じ注意は、AI学習ツールをそのマーケティングで判断するときにも当てはまります。
ブルームの2シグマは、そもそもベンチマークではありませんでした
この分野につきまとうもう1つの数字は、Benjamin Bloomが1984年にEducational Researcherに発表した「The 2 Sigma Problem」の数字です。Bloomは、1対1の個別指導によって平均的な生徒が通常の教室より標準偏差2つ分上に動いたと報告し、それに匹敵する集団向けの方法を見つけることを課題として掲げました。「AIがすべての子どもに専属の家庭教師を与える」という売り込みは、自覚の有無にかかわらず、2シグマを約束しています。
それは一度も再現されていません。
Kurt VanLehnが2011年にEducational Psychologistで行ったレビューは、人間による個別指導をd = 0.79前後に、ステップ単位の知的チュータリングシステムを0.75から0.76に置きました。教育分野の基準では、これでも大きな効果です。同時に、Bloomの見出しが約束した値の半分にも届きません。2020年に行われた96件の個別指導研究のメタ分析は0.37に着地し、96件のどれも2シグマの効果を出していません。
元の数字が高く出た方法論上の具体的な理由があり、それは個別指導そのものではありません。Bloomの個別指導を受けた生徒は、各単元で追加の小テスト、是正フィードバック、再テストも受けており、そのうえで新しい問題による2回目の小テストを受けていました。クラス一斉の比較群は、その2回目をまったく受けていません。Education Nextのために2本の元の学位論文まで遡ったPaul von Hippelが、この差を記録しています。「2シグマ」の一部は、各群が受けたテストと是正の量の差なのです。
これはAIチューターの主張を読むうえで効いてきます。あるベンダーがAIは2シグマの差を埋めつつあると匂わせるなら、そこで語られている差は、誰も再現していない条件のもとで一度だけ測られたものです。良い介入が実際にもたらすd = 0.3から0.8を基準にツールを評価すれば、ハーバードの結果は印象的なまま残り、マーケティングの主張のほうが滑稽に見え始めます。
現場のAIチューター:ナイジェリア、スタンフォード、英国
3つのフィールド研究が、AIチューターをゼミ室の外へ押し出しました。
ナイジェリア。 世界銀行のチーム(De Simone、Tiberti、Barron Rodriguez、Manolio、Mosuro、Dikoru)が、2024年6月と7月の6週間、ベニンシティで放課後の英語プログラムを実施しました。高校1年生にあたる1,328人を無作為に割り付け、うち約760人が最終評価を受けています。生徒は週2回コンピュータ室に集まり、教師が各回の冒頭にプロンプトを提示してから机の間を回り、生徒はGPT-4で動くMicrosoft Copilotを使ってペアで作業しました。プログラムは総合評価で0.31標準偏差、英語単独で0.23の効果を生みました。チームの費用対効果分析は、この効果を通常の学校教育1.5年から2年分に相当するとし、記録に残る中で最も費用対効果の高い教育介入の1つに位置づけています。
その形に注目してください。論文は、教師が直接教えることはしなかったと明言しています。教師はセッションを準備し、見守りました。練習はAIが担いました。誰も誰かの代わりにはなっていません。
スタンフォード。 Rose Wang、Ana Ribeiro、Carly Robinson、Susanna Loeb、Dora DemszkyによるTutor CoPilotは、実際の個別指導の場で人間とAIが協働するシステムを対象にした、初のランダム化比較試験でした。タイトルI校のチューター900人と、幼稚園から高校までの生徒1,800人が対象です。チューターがこのツールを使えた生徒は、トピックを習熟する確率が4パーセントポイント高くなりました。評価が最も低かったチューターの生徒は9ポイント伸びています。システムの費用は、チューター1人あたり年間およそ20ドルでした。
これについて2点。面白いのは公平性への含意です。このツールは全員を等しく押し上げたのではなく、力の弱いチューターを、力のあるチューターがすでに取っていた振る舞いへ動かすことで、両者の差を縮めました。正直に付け加えるべき但し書きは、4ポイントの伸びがセッションごとの習熟度チェックでのものだという点です。研究者たちは、学年末の数学テストの成績に統計的に有意な改善を見つけてはいません。
英国。 GoogleのLearnLMチームがEediと組んで2025年に行った探索的な試験は、英国の中等学校5校の165人が対象でした。LearnLMの支援を受けた生徒は、あとの単元で新しい問題を解ける確率が5.5パーセントポイント高く、66.2%でした。人間のチューターだけで学んだ生徒は60.7%です。チューターはAIが下書きしたメッセージの76.4%を、修正なし、またはごくわずかな修正で採用しています。サンプルは小さく、設計も探索的ですが、方向性は一貫しています。
ChatGPTをAIチューターに変える方法:試験が検証した4つのルール
ハーバードのチューターを買うことはできません。ただ、それを機能させていた仕組みはインフラではなく指示だったので、効いていた部分のほとんどは再現できます。以下の4つは、試験が実際に検証したルールです。
1. 答えの禁止を、はっきり言葉にする。 どんな場合でも解答を出してはならず、次のヒントだけを出すように、モデルに伝えてください。PNASの害を害なしに変えたのは、まさにこの指示です。たとえば、こう書きます。「あなたは私のチューターです。私が2回尋ねても、答えや完全な解答は決して出さないでください。ヒントは一度に1つだけ出し、そのあと私にもう一度やってみるよう促してください。」
2. つまずきのパターンを読み込ませる。 GPT Tutorのプロンプトには、よくある間違いについて教師が書いたメモが入っていました。自分の間違った答案を貼り付け、直すのではなく推論のどこが誤っているかを診断させることで、これに近づけられます。
3. 質問する前に、まず自分で答えを出す。 尋ねる前に答えてください。学習が起きるのは想起の場面であり、自分の試行より先に到着したチューターは、努力を支えるのではなく置き換えてしまいます。これは、会話の相手がついたアクティブリコールです。
4. セッションはAIを閉じて終える。 トルコの試験が、まるごと警告になっています。ツールを閉じた状態で自分を試さない限り、教材を知っているのが自分なのかツールなのか、判断する材料はありません。
| 松葉杖モード | チューターモード |
|---|---|
| 「この問題を解いて」 | 「x = 4になったのですが間違いでした。最初に確認すべきことは何ですか」 |
| 「この章を要約して」 | 「この章について5問出してください。そのあと私の答えを採点してください」 |
| 「光合成を説明して」 | 「光合成をあなたに説明します。間違えたら途中で止めてください」 |
| 出力を読んで、分かった気になる | 答えを書いて、分かっているかどうかを知る |
3行目は、チャット画面の中のプロテジェ効果であり、このリストで最も安上がりな改善です。決して退屈しない辛抱強い聞き手に説明できること。それは、この技術が学習者にもたらした数少ない本当に新しいものの1つです。
AIチューターに何を与えるか:自分の読書をカリキュラムにする
ここまでの試験すべてに共通する、名指ししておく価値のある空白があります。どの試験も、内容はこちらで用意していました。ハーバードは物理のレッスンを書き、トルコの教師たちは数学の問題を書き、Eediは問題バンクを提供しました。教室の外では、誰もカリキュラムを手渡してはくれません。
つまり最初の仕事は、チューターを見つけることではありません。教わる対象になる具体的な何かを、自分が持っていることです。
ここに、ブックマークではなくハイライトを勧める実務上の理由があります。ブックマークはページを保存します。ハイライトは、そのページについて自分が下した判断を保存します。Glaspのウェブハイライターで読めば、抜き出した一節は出どころとつながったまま残ります。そのうち12件をチューターへのプロンプトに貼れば、モデルはそのテーマの最も一般的な説明へ流れることができません。自分が何を12件気にかけたのかを、こちらが伝えているからです。
同じことは動画にも当てはまります。いまや自学の多くは、そこで起きています。YouTube Summaryは文字起こしと要点を出してくれますし、講義を問題にできるようにするのは、この文字起こしです。そこからGlaspのAIチャットが、インターネットの平均的な理解ではなく、自分が保存した教材について質問してくれます。本を読み通す読者なら、Kindleのハイライトを同じ山に加えられます。
試験では測れないことが、もう1つあります。教えてくれる社会的な仕組みは、個別指導だけではありません。Glaspのコミュニティで記事を開くと、同じ文章のどの一節をほかの読者が印づけたかが見えます。これは1対1のセッションからは生まれないフィードバックです。ほかの誰かが残す価値があると考えたものの記録なのですから。個別指導のモデルが認めるよりも、読書はもともと社会的な営みだったという姿に近いものです。
AIチューターにまだできないこと
ごまかしているかどうかを見抜けません。 人間のチューターは口ごもりを読み取ります。モデルが読むのはテキストであり、混乱した学生の自信ありげな文章は、理解している学生の自信ありげな文章と見分けがつきません。PNASの松葉杖効果は、まさにこの盲点が働いた姿です。
目標を設定できません。 成功した試験にはどれも、定められたシラバスと定められた評価がありました。動機づけ、順序立て、何を学ぶ価値があるかの判断は、上の表のどの行でも人間の側に残っています。
いまも、流暢に間違えます。 もっともらしい手順を発明するチューターは、チューターがいないより悪い結果を招きます。誤りが権威の声で届き、確かめる理由がこちらに生まれないからです。
長期の証拠はまだ存在しません。 ここで扱った中で最も長い研究でも2か月です。AIチューターによる学習を1年続けたとき、定着する知識がどうなるかを教えてくれる公表研究はなく、そう主張する人がいるなら、それは外挿です。
そしてこのすべての下には、教わっていることと運ばれていることの境目はどこにあるのか、という問いが横たわっています。これについてはAIで勉強するのはズルなのかで別に扱いました。ここまでの研究が示すのは、正直な判定基準が許可の問題ではないということです。自分ひとりでまだできるかどうか、それが基準です。
よくある質問
AIチューターは本当に成績を上げるのですか
上げることもありますが、それはチューターがどう設定されているかに全面的に左右されます。ハーバードの制約を課したAIチューターは、アクティブラーニングの授業の2倍を超える学習効果の中央値を生みました。トルコの高校での試験では、制約のないGPT-4を使えた生徒は、AIを使わなかった同級生より試験の点数が17%低くなりました。モデルはどちらも同じです。その周りのルールが違っていました。
ChatGPTは良いチューターですか
そのままでは、良い解答マシンであって、チューターとしては貧弱です。そこが問題なのです。PNASの試験は、直し方が安上がりであることを示しました。解答ではなくヒントだけを出すこと、各ステップをまず自分で試させることを指示するだけです。この1つの変更が、1,000人近い生徒を対象にした研究で、測定された害を害なしに変えました。
2026年で最良のAIチューターはどれですか
商用製品どうしを順位づけした独立の試験は存在しないので、目にする順位はどれもマーケティングです。証拠が支持しているのはブランドではなく設計です。答えを出し惜しみし、1ステップずつ進み、その教材で学習者がする具体的な間違いを読み込ませてあるチューター。すでに課金しているどのチャットツールでも、それに近づけられます。
AIによる個別指導は人間の教師を置き換えられますか
公表された証拠の中に、それを支えるものはありません。ナイジェリアのプログラムでは教師が場を仕切り続け、AIは練習に使いました。スタンフォードのTutor CoPilotは人間のチューターを置き換えるのではなく上達させ、最も弱いチューターを最も助けました。LearnLMの試験では、人間のチューターがAIのメッセージを承認していました。ここまでの肯定的な結果はどれも、人間とAIの組み合わせによる結果です。
ChatGPTと学習のメタ分析はなぜ撤回されたのですか
Humanities and Social Sciences Communicationsは、結論への信頼を損なう齟齬があったとして、2026年4月22日にWangとFanの2025年のメタ分析を撤回しました。外部の研究者2人が、研究集合が水増しされ効果量が誇張されていることを見つけ、論文自身のファンネルプロットが、報告値の0.867ではなくg = 0.5に近い値を指していると指摘しています。この論文は800回以上引用されています。
AIチューターを使うと長期記憶に悪影響がありますか
想起の努力を取り除いてしまうなら、あり得ます。この仕組みはAI以前からよく確かめられています。自分で産出した内容は、読んだだけの内容より良く記憶されます。だからこそ、うまくいった試験はどれも、生徒にまず自分で試させたのです。AIを使うセッションには必ず、ツールを閉じた状態での自己テストと間隔を空けた復習を組み合わせてください。
AIチューターは効果があるのか。正直なところ
証拠は懐疑派が言うよりは良好で、ベンダーが匂わせるよりはずっと狭い範囲のものです。トップ大学でよく設計された試験が1つ、利用できる最良の授業形式に、より短い時間で勝ちました。高校で行われたより大規模な試験が1つ、同じ土台のモデルが制約なしに使われると実害が出ることを見つけました。そして同じチューターのガードレール付きの版は、何もしないのと同じ水準でした。
すべてを通して生き残るのは、1つのルールです。価値は、チューターが「しないこと」の中にあります。答えを渡さない。人がその教材で間違える具体的な道筋を読み込ませる。学習者に先に産出させる。そしてツールを閉じて試す。
それはそのまま、良い人間の教師がしていることの説明でもあります。結果がこの形に集まるのは、たぶんそのせいです。仕組みは古いのです。技術が加えたのは、その辛抱強い版が午前2時にも使えるという点だけです。
自分で選んだ教材から始めてください。読みながら大事なところをハイライトし、あとで問い直せる場所に置いておき、AIには自分に情報を与えさせるのではなく、自分を問い詰めさせてください。Glaspはこのループの前半のために作られています。後半は、研究が「飛ばせない」と言っている部分です。