Was ist der Protege-Effekt?
Der Protege-Effekt (auch "Protégé-Effekt" geschrieben) ist der Befund, dass Menschen Material gründlicher lernen, wenn sie sich darauf vorbereiten, es jemand anderem beizubringen, als wenn sie es nur für sich selbst durcharbeiten. Geprägt wurde der Begriff 2009 von Catherine Chase, Doris Chin, Marily Oppezzo und Daniel Schwartz, die schrieben, Lernende "make greater effort to learn for their TAs than they do for themselves" (sie strengen sich mehr an, wenn sie für ihre Lern-Agenten lernen, als wenn sie für sich selbst lernen). Über Dutzende Experimente gepoolt ist der Zuwachs moderat, je nach Synthese etwa g = 0.17 bis 0.56, und er hängt stark davon ab, ob man vorher weiß, dass man lehren wird.
Der Mechanismus ist nicht rätselhaft. Wenn Sie wissen, dass sich jemand anderes auf Ihre Erklärung verlassen wird, lernen Sie anders: Sie ordnen sorgfältiger und suchen gezielt nach den Lücken, weil Sie vorwegnehmen müssen, wo eine Leserin ins Stolpern gerät. Passives Lesen erreicht dieses Niveau selten.
Die meisten Menschen spüren das intuitiv. Denken Sie an eine Situation, in der Sie einer Kollegin ein Konzept erklärt haben. Das Erklären zwang Sie, die unscharfen Stellen im eigenen Verständnis zu konfrontieren. Dieses Unbehagen ist der Protege-Effekt bei der Arbeit.
Von anderen Lernstrategien unterscheidet ihn die soziale Dimension. Es geht nicht nur darum, Wissen umzuformulieren, das liegt näher an der Feynman-Technik. Es geht darum, Wissen für jemand anderen umzuformulieren. Ob diese soziale Ebene über die Umformulierung hinaus etwas beiträgt, ist eine der wirklich offenen Fragen dieser Literatur, und der Abschnitt zu den Grenzen weiter unten enthält die ehrliche Antwort.
Was die Forschung zeigt: Studien und Meta-Analysen
Chase et al. (2009): Die ursprüngliche Studie zu lehrbaren Agenten
Chase und Kollegen veröffentlichten "Teachable Agents and the Protege Effect: Increasing the Effort Towards Learning" im Journal of Science Education and Technology. Die Studie nutzte Betty's Brain, ein System, in dem Schülerinnen und Schüler einem virtuellen Agenten etwas beibrachten, indem sie Konzeptkarten zu naturwissenschaftlichen Themen bauten.
Wer glaubte, Betty zu unterrichten, verbrachte mehr Zeit mit Lernaktivitäten und schnitt besser ab als jene, die dasselbe System für sich selbst nutzten. Zum Design lohnt ein Hinweis: In der ersten Studie lief bei beiden Gruppen dieselbe Software, sie unterschieden sich nur in dem, was man ihnen sagte, und die Stichprobe umfasste 62 Achtklässler. Eine zweite Studie replizierte den Effekt auf die Bearbeitungszeit mit 24 Fünftklässlern und ging der Frage nach dem Warum mit Lautdenk-Protokollen nach. Das ist ein echter Befund auf schmaler Basis, keine gesicherte Größenangabe.
Nestojko et al. (2014): Die Erwartung allein kann genügen
John Nestojko, Dung Bui, Nate Kornell und Elizabeth Bjork isolierten die Variable Lehrerwartung. Eine Gruppe lernte einen Text in Erwartung eines Tests, die andere in der Erwartung, ihn zu lehren. Gelehrt hat am Ende niemand.
In Experiment 1 erinnerte die Gruppe mit Lehrerwartung mehr vom Text (d = 0.56), erinnerte ihn effizienter (d = 0.79), gruppierte ihre Wiedergabe enger entlang der Absatzstruktur des Textes (d = 0.65) und schnitt in einem Kurzantworttest besser ab. Experiment 2 wird üblicherweise weggelassen: Dort war der Haupteffekt der Erwartung nicht signifikant (p = .389), und der Vorteil bei den Kernaussagen des Textes war nur marginal (p = .083). Ein einflussreiches Experiment und eines, das es überwiegend nicht replizierte, in derselben Arbeit.
Kobayashi (2019, 2024): Um wie viel?
Einzelstudien zeigen eine Richtung, Meta-Analysen die Größenordnung. Keiichi Kobayashis Synthese von 2019 in Japanese Psychological Research poolte 28 Studien und fand g = 0.35 für die Vorbereitung auf das Lehren und g = 0.56 für Vorbereiten und anschließendes tatsächliches Lehren, jeweils gegenüber dem Lernen ohne Lehrerwartung.
Seine Meta-Analyse von 2024 in Educational Psychology Review poolte 39 Studien, berichtete insgesamt g = 0.27 und fand den Moderator, auf den es in diesem Artikel mehr ankommt als auf jeden anderen. Lehren nach einem Lernen mit vorheriger Lehrerwartung ergab g = 0.48. Lehren nach einem Lernen ohne diese Erwartung ergab g = -0.02, statistisch nicht von null zu unterscheiden. Die Arbeit leistet die Vorbereitung, nicht die Aufführung.
Eine weitere Arbeit von ihm aus dem Jahr 2019, in Frontiers in Psychology, untersuchte die Interaktivität und stellte das Lehren von Angesicht zu Angesicht indirekten Formaten wie einer aufgezeichneten Vorlesung oder einer schriftlichen Erklärung gegenüber. Die Erwartung, direkt zu lehren, kam gepoolt auf g = 0.50 gegenüber g = 0.27 für die indirekten Formate; wurde tatsächlich gelehrt, erreichte direktes Lehren g = 0.84 und indirektes g = 0.48. Mit der 0.84 ist Vorsicht geboten: Sie beruht auf vier Gruppenvergleichen, und Kobayashi selbst nennt die Evidenz "still inadequate and subject to some exceptions" (weiterhin unzureichend und mit Ausnahmen behaftet).
Ribosa und Duran (2022): Die niedrigste und konservativste Schätzung
Jesus Ribosa und David Duran poolten in Educational Research Review 23 Studien mit 62 Vergleichen und landeten bei g = 0.17, ohne Hinweis auf einen Publikationsbias. Zwei Einschränkungen sind wichtig. In ihren Studien erstellten die Lernenden Lehrmaterialien, etwa Videolektionen, Testfragen und Lehrtexte, statt eine Person zu unterrichten, was Kobayashi als überlappende, aber eigenständige Kategorie bezeichnet. Und der Nutzen zeigt sich, wenn gegen Interventionen verglichen wird, von denen man ohnehin keine Wirkung erwartet, nicht gegen solche, von denen man eine erwartet. An einer wirklich aktiven Kontrollbedingung gemessen ist der Vorteil nicht statistisch signifikant.
Koh, Lee und Lim (2018): Der Abruf leistet die Arbeit
Aloysius Koh, Sze Chi Lee und Stephen Lim prüften in Applied Cognitive Psychology, welcher Teil des Lehrens den Nutzen trägt. Sie verglichen vier Gruppen: Lehren aus dem Gedächtnis, Lehren beim Ablesen vorbereiteter Notizen, Abrufen des Materials ohne Lehren und eine Rechenaufgabe als Kontrolle.
Im Verständnistest eine Woche später schlugen Lehren aus dem Gedächtnis und reines Abruftraining die beiden anderen Bedingungen, während Lehren mit Notizen in der Hand nicht besser war als die Kontrolle. Schließen Sie das Buch, dann erklären Sie. Wer bei offener Quelle lehrt, überspringt den Abruf und verschenkt den Nutzen. Beachten Sie die andere Hälfte dieses Ergebnisses: Schlichtes Abruftraining, ganz ohne Lehren, war genauso gut.
Die Evidenz auf einen Blick
| Synthese | Gepoolte Studien | Gepoolte Schätzung | Der Haken |
|---|---|---|---|
| Kobayashi (2019), Japanese Psych. Research | 28 Studien | g = 0.35 Vorbereitung, 0.56 Vorbereitung und Lehren | Publikationsbias nur mit Rosenthals Fail-safe N geprüft, einer heute breit kritisierten Methode |
| Kobayashi (2019), Frontiers in Psychology | 44 Gruppenvergleiche | g = 0.50 direkte vs. 0.27 indirekte Erwartung | Die Schlagzeile 0.84 für direktes Lehren beruht auf k = 4 |
| Kobayashi (2024), Educational Psych. Review | 39 Studien | g = 0.27 insgesamt; 0.48 mit Erwartung, -0.02 ohne | Heterogenität von I-Quadrat 76 bis 94 %, der einzelne gepoolte Wert sagt also wenig |
| Ribosa und Duran (2022), Educational Research Review | 23 Studien, 62 Vergleiche | g = 0.17 | Gegen eine aktive Kontrolle nicht signifikant; kein Publikationsbias nachweisbar |
| Bisra et al. (2018), Educational Psych. Review | 69 Effektstärken | g = 0.55 für Selbsterklärung | Die Solo-Variante ohne Publikum liegt mindestens so hoch wie die soziale |
| Chang et al. (2025), Educational Psych. Review | 32 Studien | g = 0.39 für Tutoren im altersübergreifenden Tutoring | Keine Moderation durch Sitzungszahl, Tutorentyp oder Fachgebiet |
Grenzen und Moderatoren: Wann Lehren nicht hilft
Jede ernsthafte Übersicht über diese Literatur muss auch die Fehlschläge berichten, und es sind genug davon, um den Umgang mit der Technik zu verändern.
Die Lehrerwartung übersteht eine Verzögerung nicht zuverlässig. Fiorella und Mayer (2013) unterrichteten Studierende über den Dopplereffekt. Wer sich auf das Lehren vorbereitete, schlug die Kontrollgruppe im unmittelbaren Verständnistest, doch im Test eine Woche später brachte die Lehrerwartung keinen Vorteil mehr gegenüber der Kontrolle. Ihre Folgestudie von 2014 fand, dass jene im verzögerten Test am besten abschnitten, die tatsächlich gelehrt hatten.
Renkl (1995) fand überhaupt keinen Nutzen der Vorbereitung auf das Lehren bei Lösungsbeispielen zur Wahrscheinlichkeitsrechnung. Guerrero und Wiley (2021) ist die stärkste Arbeit der Gegenseite, mit rund 210 Teilnehmenden pro Experiment, doch ihre Effekte sind klein (partielles Eta-Quadrat von .02 in beiden Fällen), und der Befund zur Verzögerung stützt sich auf eine nicht signifikante Interaktion. Lachner und Kollegen eröffnen ihre Übersicht zu diesem Feld in Educational Psychology Review von 2022 mit der Frage, warum mehrere neuere Studien "did not replicate this effect" (diesen Effekt nicht replizierten).
Ein reales Publikum ist nicht klar besser als ein vorgestelltes. Das läuft der intuitiven Geschichte zuwider. Wang, Lin und Chen (2021) führten 597 Sekundarschülerinnen und -schüler durch ein Design, das die Lehrerwartung mit Peer-Lehren, vorgestelltem Lehren und keinem Lehren kreuzte. Vorgestelltes Lehren verbesserte sowohl das unmittelbare als auch das verzögerte Verständnis, Peer-Lehren nur das unmittelbare. Die Autoren raten in beide Richtungen zur Vorsicht. Kobayashis Interaktivitätsanalyse weist in die Gegenrichtung. Das Bild ist ungeklärt, und wer behauptet, ein echtes Publikum sei nötig, ist der Evidenz voraus.
Mehrere sauber durchgeführte Studien finden nichts. Jacob, Lachner und Scheiter (2021) verglichen über 137 Teilnehmende hinweg lautes Erklären, Schreiben in einem Editor, Schreiben in einem Messenger-Chat und eine Abrufkontrolle: keine Unterschiede im Lernen. Aufschlussreich ist, was sich sehr wohl unterschied. Erklären wurde als anstrengender, angenehmer und interessanter bewertet als Abrufen, bei gleichem Ergebnis. Anstrengung und Vergnügen sind kein Beleg für Lernen. Lachner, Jacob und Hoogerheide (2021) fanden in einem Experiment (N = 147) gar keinen Effekt des Erklärens, und in einem zweiten (N = 51) schlug Selbsterklären das Erklären gegenüber einem fiktiven Schüler.
Unerfahrene Lehrende erzählen eher, als dass sie erklären. Roscoe und Chi (2007) dokumentierten in der Review of Educational Research einen von ihnen so genannten knowledge-telling bias: Tutoren "simply revealed answers, summarized facts, or described procedures with little elaboration" (gaben schlicht Antworten preis, fassten Fakten zusammen oder beschrieben Abläufe, ohne sie auszuführen), und unerfahrene Tutoren schätzen ihr eigenes Verständnis des Gelehrten schlecht ein. Der kognitive Nutzen entsteht aus der Elaboration, und das Standardverhalten überspringt sie.
Ein dokumentierter Schaden, bei motorischen Fertigkeiten. Daou und Kollegen (2019) ließen Personen das Golf-Putten lernen, entweder in der Erwartung, es zu lehren, oder in der Erwartung eines Tests. Die Lehrgruppe war unter geringem Druck besser und fiel unter hohem Druck auf das Niveau der Testgruppe zurück. Eine als Registered Report angelegte Replikation mit 156 Teilnehmenden bestätigte das. Wer etwas lernt, das später unter Druck ausgeführt werden muss, ist die Vorbereitung auf das Lehren möglicherweise nicht neutral.
Was offenbar keine Rolle spielt: das Alter der Lernenden und das Fachgebiet. Ribosa und Duran beschreiben den Effekt als über Bildungsstufen und Inhaltsbereiche hinweg stabil, und Chang et al. (2025) fanden in 32 Studien zum altersübergreifenden Tutoring keine Moderation durch Sitzungszahl, Tutorentyp oder Fach.
Die verteidigungsfähige Aussage fällt also enger aus als die populäre. Sich vorab festzulegen, etwas zu erklären, und es dann aus dem Gedächtnis zu erklären, ist eine gute Verwendung von Lernzeit. Es ist nicht verlässlich besser, als sich schlicht selbst abzufragen, und das soziale Element leistet weniger, als die Erzählung nahelegt.
Warum Lehren wirkt: Die kognitiven Mechanismen
Lehren aktiviert mehrere Prozesse gleichzeitig, von denen jeder für sich genommen das Lernen verbessert. Welcher davon tatsächlich verantwortlich ist, bleibt umstritten.
Abruftraining
Koh, Lee und Lim schlugen die Abrufübungs-Hypothese vor: Lehren hilft, weil es Sie zwingt, Material aus dem Gedächtnis zu holen, und das Lehren selbst trägt wenig bei. Ihre Bedingung mit Notizen in der Hand, die den Abruf entfernt und das Lehren behält, ist der saubere Test, und sie zeigte keinen Nutzen.
Formulieren Sie das nicht zu stark. Kobayashi prüfte die Hypothese 2022 in Frontiers in Psychology und kam zu dem Schluss, "the currently available evidence is inadequate to assess the hypothesis" (die derzeit verfügbare Evidenz reicht nicht aus, um die Hypothese zu bewerten). Die Übersicht von Lachner und Kollegen aus dem Jahr 2022 behandelt den Abruf als einen von mehreren Kandidatenmechanismen, nicht als gesicherte Antwort.
Metakognitive Überwachung
Lehren zwingt Sie, Ihr eigenes Verständnis in Echtzeit zu bewerten. Während Sie erklären, prüfen Sie laufend, ob es trägt. Diese Form der Selbstüberwachung steht im Zentrum des selbstregulierten Lernens (Dunlosky und Metcalfe, 2009).
Wenn Sie für sich selbst lernen, können Sie über unscharfes Verständnis hinweggehen. Wenn Sie zum Lehren lernen, wird Unschärfe zu einem Problem, das Sie lösen müssen.
Elaborierter Abruf
Die Vorbereitung auf das Lehren bringt Sie dazu, Begründungen zu rekonstruieren, Beispiele zu erzeugen und Analogien zu bilden, statt nur Fakten zu erinnern, also genau jene Familie von Aktivitäten, die Fiorella und Mayer (2016) unter dem generativen Lernen zusammenfassten. Eine Warnung zu der Evidenz, die hier üblicherweise zitiert wird: Karpicke und Blunt (2011) zeigten in Science, dass Abruftraining das elaborierende Lernen mit Konzeptkarten schlug, und ihre eigene Schlussfolgerung läuft der Elaborationsdeutung zuwider, denn sie führen den Zuwachs auf "retrieval-specific mechanisms rather than by elaborative study processes" zurück (auf abrufspezifische Mechanismen statt auf elaborierende Lernprozesse).
Verantwortung, mit Vorbehalt
Die populäre Darstellung sagt, dass die Abhängigkeit einer anderen Person die Einsätze erhöht, und Biswas, Leelawong, Schwartz, Vye und die Teachable Agents Group at Vanderbilt (2005) behandelten Verantwortung als Gestaltungsprinzip für lehrbare Agenten. Dazu gehören zwei ehrliche Einschränkungen. Der Ausdruck "responsibility effect" (Verantwortungseffekt) kommt in jener Arbeit nicht vor und ist in dieser Literatur kein etablierter Begriff. Und Chase et al. führen die Beobachtung als anekdotische Evidenz dafür an, dass Lernende ein Gefühl der Verantwortung gegenüber ihren Agenten entwickelten, und auf diesem Weg kam sie in die Literatur.
Die gemessene Fassung der Behauptung ist schwächer und interessanter. Kobayashis Interaktivitätsanalyse ist damit vereinbar, dass ein reales Publikum hilft; das Experiment von Wang, Lin und Chen mit 597 Lernenden weist in die andere Richtung. Behandeln Sie Verantwortung als plausiblen, nicht als nachgewiesenen Mechanismus.
Organisatorische Verarbeitung
Um etwas zu lehren, müssen Sie entscheiden, was zuerst kommt, was wovon abhängt und was ausgelassen werden kann. Nestojko et al. beobachteten eine Variante davon: Teilnehmende mit Lehrerwartung gaben den Text in einer Reihenfolge wieder, die seiner Absatzstruktur enger folgte als bei der Gruppe mit Testerwartung. Beachten Sie, was das ist und was nicht. Es belegt eine Umstrukturierung hin zur Gliederung der Quelle, nicht den Aufbau einer tieferen Hierarchie, und ein zweites Organisationsmaß im selben Experiment zeigte keinen Unterschied.
Die Lernpyramide: Warum die 90-Prozent-Zahl ein Mythos ist
Sie haben die Lernpyramide vermutlich schon gesehen: ein ordentliches Dreieck, das jeder Aktivität eine Behaltensquote zuweist, mit "andere lehren" an der Spitze bei 90 % und Lesen bei 10 %. Zugeschrieben wird sie meist den National Training Laboratories in Bethel, Maine. Hier ist die Version, die kursiert:
| Lernaktivität | Behauptete Behaltensquote |
|---|---|
| Vorlesung (passives Zuhören) | 5 % |
| Lesen | 10 % |
| Audiovisuell | 20 % |
| Demonstration | 30 % |
| Diskussionsgruppe | 50 % |
| Praktische Übung | 75 % |
| Andere lehren | 90 % |
Diese Zahlen sind nicht echt. Kåre Letrud und Sigbjørn Hernes verfolgten die Geschichte der Pyramide in Cogent Education (2018) zurück und fanden, dass Versionen davon seit mehr als 160 Jahren in der Bildungsdebatte kursieren; ihr Schluss lautet, die Modelle "did not originate from empirical research" (gingen nicht aus empirischer Forschung hervor). Direkt auf die Zahlen angesprochen, antwortete NTL: "Yes, we believe it to be accurate, but no, we no longer have, nor can we find, the original research that supports the numbers" (ja, wir halten sie für zutreffend, aber nein, wir haben die ursprüngliche Forschung, die die Zahlen stützt, nicht mehr und können sie auch nicht finden; zitiert nach Lalley und Miller, 2007). Beachten Sie die genaue Aussage. NTL sagte, die Forschung sei nicht auffindbar, nicht, dass es sie nie gegeben habe. So oder so gibt es nichts zu prüfen.
Die verdächtig runden, gleichmäßig gestaffelten Werte sind das eigentliche Indiz. Echte Gedächtnisdaten reihen sich nie bei 10, 20, 30, 50 auf.
Warum also die Pyramide überhaupt zeigen? Weil die Rangfolge, die sie nahelegt, dass aktive Produktion passiven Konsum schlägt, breit gestützt ist, auch wenn die Prozentzahlen Fiktion sind (Dunlosky et al., 2013; Karpicke und Blunt, 2011). Benennen Sie den Nutzen als Effektstärke von rund 0.17 bis 0.56, nicht als 90 %. Wenn Sie die Pyramide als harte Daten zitiert sehen, werten Sie das als Hinweis auf die Qualität der Quelle.
Lernen für sich selbst vs. Lernen zum Lehren: Ein direkter Vergleich
Was ändert sich, wenn Sie von "ich lerne das für mich" zu "ich lerne das, um es jemand anderem beizubringen" wechseln?
| Dimension | Lernen für sich selbst | Lernen zum Lehren |
|---|---|---|
| Informationsorganisation | Folgt locker der Reihenfolge der Quelle | Umstrukturiert; die Wiedergabe folgt der Gliederung der Quelle enger |
| Fokus | Breite Abdeckung, will alles aufnehmen | Selektiver Fokus auf Schlüsselkonzepte und Beziehungen |
| Lückenerkennung | Gering; Verwirrung lässt sich leicht überspringen | Hoch; Lücken werden zum Hindernis für eine klare Erklärung |
| Behalten nach 1 Woche | Ausgangswert | Höher nur bei vorheriger Festlegung und Erklärung aus dem Gedächtnis |
| Verständnistiefe | Oberflächlich bis mittel | Tiefer, sofern tatsächlich elaboriert und nicht nur Wissen abgespult wird |
| Motivation | Extrinsisch (den Test bestehen) | Prosozial (jemandem beim Verstehen helfen) |
| Lernstrategie | Erneutes Lesen, Markieren, Notizen machen | Zusammenfassen, Beispiele erzeugen, Analogien bilden |
| Fehlerkorrektur | Oft aufgeschoben oder ignoriert | Sofort erledigt; Fehler würden die Lernenden verwirren |
Die Haltung des Lernens zum Lehren verlangt nicht mehr Zeit. Sie verlangt eine andere Absicht, gefasst bevor Sie zu lesen beginnen. Diese Reihenfolge ist keine Stilfrage: Sie ist in Kobayashis Daten von 2024 der Unterschied zwischen g = 0.48 und g = -0.02.
Der Protege-Effekt vs. die Feynman-Technik
Die Feynman-Technik und der Protege-Effekt sind verwandt, aber verschieden, und der Vergleich fällt weniger einseitig aus, als er üblicherweise dargestellt wird.
Die Feynman-Technik verlangt, ein Konzept in einfacher Sprache zu erklären, als würden Sie es einem Anfänger beibringen: ein Konzept wählen, es schlicht erklären, die Lücken finden, erneut vereinfachen. So wie sie normalerweise praktiziert wird, ist sie eine Einzelübung, bei der keine reale Person vom Ergebnis abhängt.
Der Protege-Effekt fügt die soziale Ebene hinzu. Doch hier ist der Befund, der die übliche Rangordnung dämpfen sollte: Die Selbsterklärung, die Solo-Verwandte, kommt über 69 Effektstärken hinweg gepoolt auf g = 0.55 (Bisra et al., 2018), also an den oberen Rand der Spanne für das Lernen durch Lehren und über die meisten Schätzungen dafür. Das Publikum trägt möglicherweise weniger bei, als die Rahmung suggeriert.
| Merkmal | Feynman-Technik | Protege-Effekt |
|---|---|---|
| Publikum | Vorgestellt oder man selbst | Reale Person oder öffentliches Publikum |
| Verantwortlichkeit | Nur intern | Sozial; jemand hängt von Ihrer Genauigkeit ab |
| Hauptmechanismus | Selbsterklärung, Lückenerkennung | Abruf plus metakognitive Überwachung |
| Am besten für | Tiefes Verständnis einzelner Konzepte | Anhaltende Motivation und einen Grund, es zu Ende zu bringen |
| Evidenzbasis | Gepoolt g = 0.55 für Selbsterklärung | Gepoolt g = 0.17 bis 0.56, mit der Erwartung als entscheidendem Moderator |
| Soziale Komponente | Optional | Vorhanden, ihr Mehrwert ist jedoch umstritten |
Praktisch gelesen: Machen Sie beides, und nehmen Sie nicht an, dass das Publikum die Wirkung trägt. Die beiden Dinge, die sich beide Methoden teilen, Abruf aus dem Gedächtnis und erzwungene Elaboration, sind die am besten belegten Bestandteile. Ein reales Publikum versteht man am besten als Selbstbindungsinstrument, und das ist nicht wenig, denn öffentliches Lernen sorgt dafür, dass Sie das Erklären tatsächlich tun.
Funktioniert der Protege-Effekt, wenn Ihr Schüler eine KI ist?
Da die ursprünglichen lehrbaren Agenten skriptgesteuert waren, liegt die Frage nahe, ob ein großes Sprachmodell den besseren Protege abgibt. Die Evidenz von 2024 bis 2026 sagt: noch nicht, und der Grund ist ein sehr spezifischer.
Der sauberste Test ist ein Nullbefund. Xu, Zhang, Tang und Lee (2026) randomisierten 96 Teilnehmende auf vier Bedingungen: Erklären gegenüber einem LLM in der Rolle eines Lernenden, eines Peers, eines Herausforderers oder einer nahezu passiven Kontrolle. Im Nachtest schlug keine Bedingung die Kontrolle (F(3,91) = 1.54, p = .21). Der Aufwand stieg deutlich, die Gruppe mit dem lernenden Agenten schrieb im Schnitt 353.8 Wörter gegenüber 121.3 in der Kontrolle. Nur schlug sich das nicht in Wissen nieder. Diese Gruppe berichtete zudem den höchsten Druck der drei Agentenrollen, 4.02 gegenüber 2.49 beim Peer und 2.93 beim Herausforderer, und lag damit auch nicht besser als die passive Kontrolle mit 4.06. Das ist das Gegenteil des ego-schützenden Puffers, den Chase et al. (2009) beschrieben, bei dem das Lehren eines Agenten die Lernenden vor dem Stachel des Irrtums bewahren sollte.
Eine viel zitierte Arbeit benennt den Defekt und misst nie Lernen. Jin, Lee, Shin und Kim (CHI 2024) bauten TeachYou und den LLM-Lernenden AlgoBo und berichteten, "LLMs' expansive knowledge as tutees discourages learners from teaching" (das ausufernde Wissen von LLMs in der Lernendenrolle hält Lernende vom Lehren ab). Ihr Name für diesen Fehlermodus lautet under-teaching: Die Lernenden hören auf, es zu versuchen, weil der Agent ohnehin schon alles weiß. Die Arbeit nennt als Einschränkung, dass sie keinen Vor- und Nachtest durchführte, und ihre Metakognitionsintervention zeigte keinen signifikanten Zuwachs.
Positive Ergebnisse gibt es, und jedes hat einen Haken. Chen, Wei, Le und Zhang (2025) fanden, dass Studierende, die einen ChatGPT-Agenten unterrichteten, in einem Wissenstest zum Programmieren besser abschnitten (n = 41), die Korrektheit des Codes unterschied sich jedoch nicht signifikant, und die Erklärung der Autoren ist aufschlussreich: ChatGPT erzeugt meist korrekten Code, was die Übung im Debuggen wegnimmt. Der größte Feldeinsatz, die semesterlange Studie von Wang und Kollegen an der EPFL (2026) mit 453 ausgewerteten Studierenden und 3.809 Dialogen, fand, dass die Lehrgruppe rund 4.9 Prozent weniger Quizversuche benötigte als eine Lesebedingung. Beachten Sie, worin das Ergebnis besteht: in Quizversuchen, nicht in einem Wissenstest, und es kostete 14.4 Minuten Arbeit gegenüber 3.4. Rund ein Viertel der Dialoge enthielt eingefügte externe Inhalte, und das sagte schlechtere Leistungen vorher.
Die Glaubwürdigkeit ist nicht das Hindernis. Rogers und Kollegen (2025) führten 119 Studierende durch vier Experimente, von denen eines einen LLM-Lernenden mit einer eingeweihten Person verglich, die einen Anfänger spielte. Die wahrgenommene Intelligenz unterschied sich nicht signifikant. Die Studierenden nehmen ihm die Rolle ab.
Das Modell bleibt kein Anfänger. Das ist der eigentliche Blocker. Song, Guo und Lin (2026) sagen es direkt: Selbst wenn man sie anweist, sich wie ein Anfänger zu verhalten, können LLMs "can still produce expert-level explanations" (weiterhin Erklärungen auf Expertenniveau hervorbringen) und driften damit über das beabsichtigte Wissensniveau hinaus. Schlimmer noch, sie geben nach. Do, Sonkar und Sachan (2026, ein Preprint) maßen, wie oft simulierte Lernende eine Fehlvorstellung aufgeben, und fanden, dass das kleinste getestete Modell, Qwen3-4B, seine Antwort in 92 Prozent der Fälle umwarf, wenn die Rückmeldung nicht mehr sagte als "you're wrong" (das ist falsch). Ein Gegenüber, das allem zustimmt, kann Ihnen nicht zeigen, dass Ihre Erklärung gescheitert ist, und genau um dieses Fehlersignal geht es.
Es gibt außerdem eine zitierbare Lücke in dieser Literatur: Niemand hat die ursprüngliche Verantwortungsmanipulation mit einem LLM in der Lernendenrolle repliziert. Die Arbeiten zu lehrbaren LLM-Agenten stützen sich für den Mechanismus auf Chase et al., ohne ihn zu prüfen.
Was daraus folgt. Nutzen Sie ein LLM als Probepartner statt als Protege. Erklären Sie aus dem Gedächtnis bei geschlossener Quelle, das ist der Teil mit der besten Evidenz, und bitten Sie es dann, die Lücken in dem zu finden, was Sie gesagt haben. Weisen Sie es an, eine falsche Position zu halten, bis Sie sie wirklich korrigieren, und werten Sie schnelle Zustimmung als Zeichen dafür, dass die Übung nicht funktioniert. Wenn Sie den Protege-Effekt im eigentlichen Sinn wollen, deutet die Evidenz weiterhin auf einen Menschen.
Fünf Wege zu "lehren", ohne Lehrer zu sein
Sie brauchen weder ein Klassenzimmer noch Schüler, um den Protege-Effekt auszulösen. Was Sie nach allem Gesagten brauchen, ist die Entscheidung vor dem Lesen, dass Sie das jemandem erklären werden, und danach das Erklären, ohne nachzuschauen.
1. Machen Sie Ihre Markierungen öffentlich
Wenn Sie eine Passage mit dem Web-Highlighter von Glasp markieren und eine Notiz hinzufügen, die erklärt, warum sie wichtig ist, vollziehen Sie einen Mikro-Lehrakt. Ihre Markierungen erscheinen auf Ihrem öffentlichen Profil, wo andere Lernende sie finden können. Diese Sichtbarkeit verschiebt Ihre Verarbeitung von "das ist für mich interessant" zu "das muss klar genug für jemand anderen sein".
Die Reihenfolge zählt mehr als das Werkzeug. Entscheiden Sie vor dem Artikel, dass Sie für eine Leserin annotieren, nicht danach. Mit der Zeit wird die Sammlung zu einer Lehrressource: eine kuratierte Leseliste mit Kontext, dem andere folgen können.
2. Schreiben Sie Blogbeiträge und Zusammenfassungen
Eine Zusammenfassung für ein Publikum zu schreiben, erzwingt dieselbe organisatorische und elaborierende Arbeit wie formales Lehren. Sie müssen entscheiden, was wesentlich ist, einen logischen Fluss bauen und Ideen in eigene Worte fassen. Das Publikum muss nicht groß sein.
Mit YouTube Summary die Kernpunkte aus Vorlesungen und Vorträgen zu ziehen, liefert Rohmaterial. Das Lernen passiert, wenn Sie es schließen und die Erklärung selbst schreiben.
3. Treten Sie Lerngruppen bei oder gründen Sie welche
Lerngruppen mit Lehrrotation aktivieren den Effekt systematisch; Gruppen, in denen alle still lesen, tun das nicht. Verteilen Sie bestimmte Konzepte im Voraus, damit jedes Mitglied schon Tage vorher weiß, dass es für eines verantwortlich ist. Lassen Sie jede Person ohne Notizen lehren, während die anderen Fragen stellen. Die Fragen leisten echte Arbeit, denn sie zwingen die lehrende Person zur Elaboration statt zum Aufsagen.
4. Üben Sie das Erklären gegenüber einer KI, mit realistischen Erwartungen
Mit Glasps KI-Chat können Sie eine Erklärung proben, ohne einen Menschen dafür zu gewinnen. Seien Sie sich im Klaren darüber, was Ihnen das bringt. Wie der Abschnitt weiter oben darlegt, ist die randomisierte Evidenz zum Lehren eines LLM derzeit ein Nullbefund, und was Sie verlässlich bekommen, sind Abruf und Lückensuche, nicht der soziale Mechanismus.
Nutzen Sie es also genau so. Schließen Sie die Quelle, erklären Sie das Konzept aus dem Gedächtnis und bitten Sie die KI danach, zu benennen, was Sie ausgelassen haben, was falsch war und was eine verwirrte Leserin immer noch fragen würde. Widersprechen Sie, wenn sie zu bereitwillig zustimmt. Sie nutzen sie als Prüferin, nicht als Schülerin.
5. Teilen Sie auf Community-Plattformen
Wenn Sie Ihr Gelerntes im Community-Feed posten, stellen Sie Ihr Verständnis vor echte Menschen. Wenn jemand kommentiert, eine Frage stellt oder eine andere Lesart anbietet, bekommen Sie Rückmeldung, die das Lernen im Alleingang nicht erzeugen kann. Ob ein reales Publikum über das Erklären selbst hinaus etwas beiträgt, ist ungeklärt, wie der Abschnitt zu den Grenzen sagt. Was es verlässlich bewirkt, ist, dass Sie es durchziehen.
Öffentliches Lernen: Der Protege-Effekt im großen Maßstab
Öffentliches Lernen ist der Protege-Effekt, angewandt auf Ihre gesamte Praxis. Statt privat zu lernen und gelegentlich zu lehren, teilen Sie selbstverständlich, was Sie lesen, und damit wird aus der Erwartung, an die Sie sich sonst erst erinnern müssten, die stehende Bedingung Ihres Lesens.
Das ist das stärkste Argument dafür. Der am besten belegte Moderator dieser Literatur ist, ein Publikum vor dem Lernen zu antizipieren, und eine Gewohnheit des Teilens bedeutet, dass Sie nie ohne eines lernen.
Glasp ist genau darum herum gebaut. Wenn Sie Ihre Markierungen exportieren und in einen Blogbeitrag überführen, sie teilen oder auf Ihrem Profil sichtbar lassen, muss die Annotation für jemanden Sinn ergeben, der nicht dabei war. Kombinieren Sie das mit aktivem Abruf, und Sie trainieren die beiden Mechanismen mit der besten Evidenz.
Der Nutzen reicht über das individuelle Behalten hinaus. Ihr öffentliches Lernen wird zu einem Beitrag zur kollektiven Intelligenz. Andere bauen auf Ihren Markierungen auf; durch ihre finden Sie neue Blickwinkel.
Häufig gestellte Fragen
Was ist der Protege-Effekt in einfachen Worten?
Der Protege-Effekt ist der Befund, dass Sie Material besser lernen, wenn Sie sich darauf vorbereiten, es jemand anderem beizubringen, als wenn Sie es nur für sich selbst durcharbeiten. Die Vorbereitung auf das Lehren drängt Sie dazu, den Stoff zu ordnen, eigene Lücken zu bemerken und ihn aus dem Gedächtnis abzurufen. Nestojko et al. (2014) zeigten, dass bereits die Erwartung zu lehren, ganz ohne tatsächliches Lehren, die Erinnerung in einem Experiment verbesserte, während ein zweites Experiment derselben Arbeit insgesamt keinen Effekt fand.
Um wie viel verbessert das Lehren anderer das Lernen?
Die ehrliche Antwort ist eine Spanne von Effektstärken, kein Prozentwert. Kobayashis Meta-Analyse von 2019 über 28 Studien fand g = 0.35 für die Vorbereitung auf das Lehren und g = 0.56 für Vorbereiten und Lehren. Seine Meta-Analyse von 2024 über 39 Studien fand insgesamt g = 0.27. Die konservativste Synthese, Ribosa und Duran (2022), fand g = 0.17 und keinen signifikanten Vorteil gegenüber einer aktiven Kontrolle. Ignorieren Sie die Angabe "90 % Behaltensquote" aus der Lernpyramide; Letrud und Hernes (2018) zeigten, dass sie keine empirische Quelle hat.
Was entscheidet am stärksten darüber, ob es wirkt?
Ausschlaggebend ist, ob Sie vorher wussten, dass Sie lehren würden. In Kobayashis Meta-Analyse von 2024 ergab Lehren nach einem Lernen mit vorheriger Lehrerwartung g = 0.48, Lehren nach einem Lernen ohne sie g = -0.02. Entscheiden Sie es, bevor Sie das Material aufschlagen, nicht danach.
Ist Lehren besser, als sich einfach selbst abzufragen?
Oft nicht, und das ist das am seltensten berichtete Ergebnis dieser Literatur. Koh, Lee und Lim (2018) fanden, dass reines Abruftraining im Verständnistest eine Woche später mit dem Lehren aus dem Gedächtnis gleichzog und dass beide das Lehren mit Notizen in der Hand schlugen. Die Selbsterklärung kommt gepoolt auf g = 0.55 (Bisra et al., 2018), höher als die meisten Schätzungen für das Lernen durch Lehren. Wenn es Ihnen allein ums Behalten geht, ist aktiver Abruf der günstigere Weg. Lehren fügt Motivation, ein Publikum und einen Grund hinzu, es zu Ende zu bringen.
Wie unterscheidet sich der Protege-Effekt von der Feynman-Technik?
Bei der Feynman-Technik geht es darum, ein Konzept in einfacher Sprache zu erklären, um die eigenen Wissenslücken zu finden, meist allein. Der Protege-Effekt fügt ein reales oder erwartetes Publikum hinzu. Die gemeinsamen Mechanismen, Abruf und Elaboration, sind am besten belegt; wie viel das Publikum selbst beiträgt, ist weiterhin umstritten, denn Wang, Lin und Chen (2021) fanden, dass vorgestelltes Lehren das verzögerte Verständnis verbesserte, tatsächliches Peer-Lehren dagegen nicht.
Funktioniert der Protege-Effekt, wenn man eine KI lehrt?
Nach derzeitiger Evidenz nicht verlässlich. Der sauberste randomisierte Test (Xu et al., 2026, N = 96) fand für das Erklären gegenüber einem LLM in der Lernendenrolle keinen Lernvorteil gegenüber einer nahezu passiven Kontrolle, obwohl die Teilnehmenden sichtbar mehr Aufwand betrieben. Der Hauptgrund ist, dass Sprachmodelle keine Anfänger bleiben: Sie driften in Erklärungen auf Expertenniveau ab und akzeptieren jede Korrektur, die man ihnen anbietet. Nutzen Sie eine KI, um sich zu einer aus dem Gedächtnis gegebenen Erklärung abfragen zu lassen, das ist der Teil mit Evidenz, statt sie als Schülerin zu unterrichten.
Muss ich Expertin oder Experte sein, um vom Lehren zu profitieren?
Nein, und es gibt ein reales Risiko in der Gegenrichtung. Chase et al. (2009) fanden Lernzuwächse bei Mittelschülern, die in nichts Experten waren. Roscoe und Chi (2007) dokumentierten allerdings, dass unerfahrene Tutoren standardmäßig ins Aufsagen von Wissen verfallen, also Fakten ohne Elaboration herunterbeten, und ihr eigenes Verständnis schlecht einschätzen. Der Nutzen steckt in der Elaboration, drängen Sie sich also dazu, das Warum zu erklären, nicht nur das Was.
Wie hängt der Protege-Effekt mit aktivem Abruf zusammen?
Lehren aus dem Gedächtnis ist eine Form des aktiven Abrufs: Sie rufen ab, Sie elaborieren und Sie überwachen Ihre Genauigkeit. Diese Überschneidung macht wahrscheinlich den Großteil des Effekts aus. Die Abrufübungs-Hypothese von Koh, Lee und Lim spricht das ausdrücklich aus, auch wenn Kobayashis Übersicht von 2022 zu dem Schluss kam, dass die Evidenz noch nicht ausreicht, um die Frage zu klären.
Fazit: Was die Evidenz tatsächlich stützt
Lernen durch Lehren funktioniert, und es funktioniert aus weniger mystischen Gründen, als die populäre Fassung behauptet. Über die guten Studien gepoolt ist es ein bescheidener bis moderater Zuwachs, irgendwo zwischen g = 0.17 und g = 0.56, und fast alles davon hängt daran, sich vorab zu entscheiden, dass man das jemandem erklären muss. Lehren Sie mit Ihren Notizen in der Hand, bekommen Sie nichts. Erfahren Sie erst nach dem Lernen, dass Sie lehren sollen, bekommen Sie nichts. Legen Sie sich zuerst fest und erklären Sie dann aus dem Gedächtnis, dann bekommen Sie einen echten Effekt, der sich stark mit schlichtem Abruftraining überschneidet.
Das ist eine engere Behauptung als "andere zu lehren bringt 90 % Behaltensquote", und sie ist nützlicher, weil sie Ihnen genau sagt, welchen Teil Sie behalten sollten.
Die praktische Fassung ist kurz. Bevor Sie etwas lesen, entscheiden Sie, wem Sie es erklären werden. Markieren Sie mit dem Web-Highlighter von Glasp, als würden Sie für diese Person annotieren. Schließen Sie den Tab und erklären Sie es aus dem Gedächtnis, einer Lerngruppe, einem Blogpublikum oder dem Community-Feed. Nutzen Sie Glasps KI-Chat, um die gerade gegebene Erklärung zu prüfen, statt eine Schülerin zu unterrichten, die die Antwort ohnehin kennt. Machen Sie aus einer YouTube Summary Ihre eigene schriftliche Argumentation statt eines Transkripts.
Die Festlegung kommt zuerst. Alles, was die Forschung stützt, folgt daraus.
Quellen
Bisra, K., Liu, Q., Nesbit, J. C., Salimi, F., and Winne, P. H. (2018). Inducing self-explanation: A meta-analysis. Educational Psychology Review, 30, 703-725. doi:10.1007/s10648-018-9434-x
Biswas, G., Leelawong, K., Schwartz, D., Vye, N., and The Teachable Agents Group at Vanderbilt (2005). Learning by teaching: A new agent paradigm for educational software. Applied Artificial Intelligence, 19(3-4), 363-392. doi:10.1080/08839510590910200
Chang, A., Mauer, E., Wanzek, J., Kim, S., Scammacca, N., and Swanson, E. (2025). Examining the academic effects of cross-age tutoring: A meta-analysis. Educational Psychology Review, 37. doi:10.1007/s10648-025-09997-z
Chase, C. C., Chin, D. B., Oppezzo, M. A., and Schwartz, D. L. (2009). Teachable agents and the protege effect: Increasing the effort towards learning. Journal of Science Education and Technology, 18(4), 334-352. doi:10.1007/s10956-009-9180-4
Chen, A., Wei, Y., Le, H., and Zhang, Y. (2025). Learning by teaching with ChatGPT: The effect of teachable ChatGPT agent on programming education. British Journal of Educational Technology, 57(1), 163-184. doi:10.1111/bjet.70001
Cabral, D. A. R., Daou, M., Bacelar, M. F. B., Parma, J. O., and Miller, M. W. (2023). Does learning a skill with the expectation of teaching it impair the skill's execution under psychological pressure if the skill is learned with analogy instructions? Psychology of Sport and Exercise, 66, 102323. doi:10.1016/j.psychsport.2022.102323
Daou, M., Hutchison, Z. J., Bacelar, M. F. B., Rhoads, J. A., Lohse, K. R., and Miller, M. W. (2019). Learning a skill with the expectation of teaching it impairs the skill's execution under psychological pressure. Journal of Experimental Psychology: Applied, 25(2), 219-229. doi:10.1037/xap0000191
Do, H., Sonkar, S., and Sachan, M. (2026). Simulating students or sycophantic problem solving? On misconception faithfulness of LLM simulators. arXiv:2605.12748 [preprint].
Dunlosky, J., and Metcalfe, J. (2009). Metacognition. Thousand Oaks, CA: SAGE Publications.
Dunlosky, J., Rawson, K. A., Marsh, E. J., Nathan, M. J., and Willingham, D. T. (2013). Improving students' learning with effective learning techniques: Promising directions from cognitive and educational psychology. Psychological Science in the Public Interest, 14(1), 4-58. doi:10.1177/1529100612453266
Fiorella, L., and Mayer, R. E. (2013). The relative benefits of learning by teaching and teaching expectancy. Contemporary Educational Psychology, 38(4), 281-288. doi:10.1016/j.cedpsych.2013.06.001
Fiorella, L., and Mayer, R. E. (2014). Role of expectations and explanations in learning by teaching. Contemporary Educational Psychology, 39(2), 75-85. doi:10.1016/j.cedpsych.2014.01.001
Fiorella, L., and Mayer, R. E. (2016). Eight ways to promote generative learning. Educational Psychology Review, 28(4), 717-741. doi:10.1007/s10648-015-9348-9
Guerrero, T. A., and Wiley, J. (2021). Expecting to teach affects learning during study of expository texts. Journal of Educational Psychology. doi:10.1037/edu0000657
Jacob, L., Lachner, A., and Scheiter, K. (2021). Does increasing social presence enhance the effectiveness of writing explanations? PLOS ONE, 16(4), e0250406. doi:10.1371/journal.pone.0250406
Jin, H., Lee, S., Shin, H., and Kim, J. (2024). Teach AI how to code: Using large language models as teachable agents for programming education. Proceedings of CHI 2024. doi:10.1145/3613904.3642349
Karpicke, J. D., and Blunt, J. R. (2011). Retrieval practice produces more learning than elaborative studying with concept mapping. Science, 331(6018), 772-775. doi:10.1126/science.1199327
Kobayashi, K. (2019). Interactivity: A potential determinant of learning by preparing to teach and teaching. Frontiers in Psychology, 9, 2755. doi:10.3389/fpsyg.2018.02755
Kobayashi, K. (2019). Learning by preparing-to-teach and teaching: A meta-analysis. Japanese Psychological Research, 61(3), 192-203. doi:10.1111/jpr.12221
Kobayashi, K. (2022). The retrieval practice hypothesis in research on learning by teaching: Current status and challenges. Frontiers in Psychology, 13, 842668. doi:10.3389/fpsyg.2022.842668
Kobayashi, K. (2024). Interactive learning effects of preparing to teach and teaching: A meta-analytic approach. Educational Psychology Review, 36(1), Article 26. doi:10.1007/s10648-024-09871-4
Koh, A. W. L., Lee, S. C., and Lim, S. W. H. (2018). The learning benefits of teaching: A retrieval practice hypothesis. Applied Cognitive Psychology, 32(3), 401-410. doi:10.1002/acp.3410
Lachner, A., Hoogerheide, V., van Gog, T., and Renkl, A. (2022). Learning-by-teaching without audience presence or interaction: When and why does it work? Educational Psychology Review, 34(2), 575-607. doi:10.1007/s10648-021-09643-4
Lachner, A., Jacob, L., and Hoogerheide, V. (2021). Learning by writing explanations: Is explaining to a fictitious student more effective than self-explaining? Learning and Instruction, 74, 101438. doi:10.1016/j.learninstruc.2020.101438
Lalley, J. P., and Miller, R. H. (2007). The learning pyramid: Does it point teachers in the right direction? Education, 128(1), 64-79.
Letrud, K., and Hernes, S. (2018). Excavating the origins of the learning pyramid myths. Cogent Education, 5(1), 1518638. doi:10.1080/2331186X.2018.1518638
Nestojko, J. F., Bui, D. C., Kornell, N., and Bjork, E. L. (2014). Expecting to teach enhances learning and organization of knowledge in free recall of text passages. Memory and Cognition, 42(7), 1038-1048. doi:10.3758/s13421-014-0416-z
Renkl, A. (1995). Learning for later teaching: An exploration of mediational links between teaching expectancy and learning results. Learning and Instruction, 5(1), 21-36. doi:10.1016/0959-4752(94)00015-H
Ribosa, J., and Duran, D. (2022). Do students learn what they teach when generating teaching materials for others? A meta-analysis through the lens of learning by teaching. Educational Research Review, 37, 100475. doi:10.1016/j.edurev.2022.100475
Rogers, K., Davis, M., Maharana, M., Etheredge, P., and Chernova, S. (2025). Playing dumb to get smart: Creating and evaluating an LLM-based teachable agent within university computer science classes. Proceedings of CHI 2025. doi:10.1145/3706598.3713644
Roscoe, R. D., and Chi, M. T. H. (2007). Understanding tutor learning: Knowledge-building and knowledge-telling in peer tutors' explanations and questions. Review of Educational Research, 77(4), 534-574. doi:10.3102/0034654307309920
Song, J., Guo, Z., and Lin, J. (2026). Simulating novice students using machine unlearning and relearning in large language models. Proceedings of AIED 2026, Lecture Notes in Computer Science. doi:10.1007/978-3-032-29744-0_42
Wang, Y., Lin, L., and Chen, O. (2021). The benefits of teaching on comprehension, motivation, and perceived difficulty: Empirical evidence of teaching expectancy and the interactivity of teaching. British Journal of Educational Psychology, 91(4), 1275-1290. doi:10.1111/bjep.12416
Wang, C., Petrie, C., Stouras, M., Ettlin, N., George, A., Mejia-Domenzain, P., Swamy, V., Kaeser, T., and Svensson, O. (2026). Turning 500+ students into teachers: A semester-long study of an AI teachable agent in an undergraduate algorithms course. Proceedings of the Thirteenth ACM Conference on Learning @ Scale, 350-360. doi:10.1145/3774398.3811623
Xu, Z., Zhang, J., Tang, A., and Lee, Y.-C. (2026). Who you explain to matters: Learning by explaining to conversational agents with different pedagogical roles. Proceedings of CHI 2026. doi:10.1145/3772318.3790298