AI

KI-Tutoren im Test: Funktionieren sie wirklich?

Zwei kontrollierte Studien liefen im selben Schuljahr und kamen zu gegensätzlichen Ergebnissen. Der Unterschied lag nicht am Modell. Er lag daran, ob die KI die Lösung herausgeben durfte.

15 Min. Lesezeit
Wichtige Erkenntnisse
    • Die beste und die schlechteste Studie nutzten beide GPT-4: Der KI-Tutor aus Harvard erzeugte einen medianen Lernzuwachs von mehr als dem Doppelten eines aktivierenden Unterrichts, und das in kürzerer Zeit. Eine türkische Oberschulstudie fand, dass Lernende mit schlichtem GPT-4 in der Prüfung 17% schlechter abschnitten als Mitschülerinnen und Mitschüler, die es nie hatten.
  • Eine einzige Designentscheidung trennt die beiden: In jeder Studie, in der die KI half, war der Tutor davon abgehalten, die Lösung herauszugeben. Wo er die Aufgabe lösen durfte, benutzten die Lernenden ihn als Krücke und lernten weniger.
  • Selbst der abgesicherte Tutor schlug die Kontrollgruppe in der Prüfung nicht: Die PNAS-Autorinnen und -Autoren berichten einen Punktschätzer von −0.004, statistisch nicht von Lernenden ganz ohne KI zu unterscheiden. Leitplanken verhinderten Schaden. Einen Vorteil erzeugten sie nicht.
  • Die meistzitierte Zahl dieser Debatte wurde zurückgezogen: Die Metaanalyse von 2025, die für ChatGPT g = 0.867 auf die Lernleistung berichtete, wurde am 22. April 2026 von ihrer Zeitschrift zurückgezogen, nach mehr als 800 Zitationen. Der eigene Funnel Plot deutete eher auf 0.5.
  • Blooms „zwei Sigma“ war nie der Maßstab, als den man es zitiert: Repliziert wurde es nie, und VanLehns Überblicksarbeit verortete echtes menschliches Tutoring eher bei d = 0.79. KI-Tutoren jagen keiner 2.0-Marke hinterher, die überhaupt jemand erreicht hätte.

Funktionieren KI-Tutoren? Die kurze Antwort

Ja, KI-Tutoren funktionieren, wenn sie darauf gebaut sind, Antworten zurückzuhalten. Nein, und messbar schlechter als gar nichts, wenn sie es nicht sind. Diese eine Variable trennt die Studien in diesem Artikel sauberer als das Modell, das Fach oder das Land.

Die stärksten Belege für beide Seiten erschienen im Juni 2025 im Abstand von drei Wochen. Eine randomisierte kontrollierte Studie aus Harvard fand, dass Studierende mit einem eigens gebauten KI-Tutor mehr lernten als Studierende in einem aktivierenden Physikkurs, und das in kürzerer Zeit. Eine PNAS-Studie über rund fünfzig türkische Oberschulklassen fand, dass Lernende mit gewöhnlichem GPT-4-Zugang in der Prüfung 17% schlechter abschnitten als Mitschülerinnen und Mitschüler ohne KI.

Beide nutzten GPT-4. Der Harvard-Tutor war durch didaktische Regeln streng eingehegt. Der türkische Arm „GPT Base“ war ein schlichtes Chatfenster. Wenn Sie aus der Forschung eine Sache mitnehmen, dann diese: Ein KI-Tutor ist eine Schicht von Beschränkungen über einem Modell, und die Beschränkungen sind das eigentliche Produkt.


Die Harvard-Studie: doppelter Zuwachs, in kürzerer Zeit

Kestin und Kolleginnen und Kollegen in Harvard führten die Studie im Herbst 2023 in einem großen Physikkurs des Grundstudiums durch und veröffentlichten sie am 3. Juni 2025 in Scientific Reports unter dem Titel „AI tutoring outperforms in-class active learning“. Die Stichprobe umfasste 194 Studierende.

Was diese Arbeit besonders lesenswert macht, ist die Kontrollgruppe. Sie war keine Vorlesung. Harvards Physikprogramm arbeitet ohnehin mit aktivierenden Lehrformaten, also mit dem Format, das die Vorlesung in Jahrzehnten physikdidaktischer Forschung geschlagen hat. Der KI-Tutor wurde am aktuellen Stand der guten Praxis gemessen, nicht am Schlechtesten, was eine Universität zu bieten hat.

Das Hauptergebnis: Der mediane Lernzuwachs der KI-Tutor-Gruppe lag bei mehr als dem Doppelten der Präsenzgruppe. Die Zeitwerte wiegen genauso schwer. Die mediane Bearbeitungszeit betrug in der KI-Bedingung 49 Minuten, gegenüber rund einer Stunde Unterrichtszeit. Die Studierenden berichteten außerdem, sich stärker eingebunden und motivierter zu fühlen.

Der Tutor selbst war kein Chatbot mit hübschem Namen. Die Forschenden schrieben die Didaktik in den Prompt: eine Frage nach der anderen durcharbeiten, die Lernenden produzieren lassen statt lesen lassen, derselben Lehrsequenz folgen wie der Unterricht. Die Arbeit stellt es selbst so dar, dass das Design zuerst kam und das Modell nur der Übertragungsweg war.

Zwei Einschränkungen, die in der Berichterstattung meist untergehen. Es ging um zwei Themen in einem einzigen Kurs an einer Universität mit ungewöhnlich gut vorbereiteten Studierenden, angelegt als Crossover, sodass jede Person beide Bedingungen durchlief. Abgedeckt sind zwei Unterrichtseinheiten, kein Semester. Beeindruckend, aber noch keine Aussage darüber, was über fünfzehn Wochen passiert.


Die türkische Studie: großer Übungsgewinn, 17% weniger in der Prüfung

Hamsa Bastani, Osbert Bastani, Alp Sungu, Haosen Ge, Özge Kabakcı und Rei Mariman lieferten das Gegengewicht. Ihre Arbeit „Generative AI without guardrails can harm learning: Evidence from high school mathematics“ erschien am 25. Juni 2025 in PNAS.

Die Anlage war größer als in Harvard: knapp 1.000 Lernende in rund fünfzig Klassen der Jahrgangsstufen 9, 10 und 11 an einer türkischen Oberschule, vier Sitzungen zu je 90 Minuten. Drei Arme:

  • Kontrolle: keine KI.
  • GPT Base: eine gewöhnliche GPT-4-Chatoberfläche.
  • GPT Tutor: GPT-4 mit zwei Sicherungen, siehe unten.

Während der Übungsphase sah die KI spektakulär aus. Lernende im Arm GPT Tutor lösten Übungsaufgaben 127% besser als die Kontrollgruppe. Die Lernenden im Arm GPT Base lagen 48% über der Kontrollgruppe. Hätte die Studie an dieser Stelle aufgehört, wäre es das meistzitierte Ergebnis der Bildungstechnologie.

Dann nahmen die Forschenden die KI weg und ließen eine Prüfung schreiben. Die GPT-Base-Lernenden schnitten 17% schlechter ab als Lernende, die sie nie angefasst hatten. Nicht schlechter, als sie in der Übungsphase gewesen waren. Schlechter als die Kontrollgruppe. Die Deutung der Forschenden ist unmissverständlich: Die Lernenden benutzten GPT-4 als Krücke, und die Krücke trug das Gewicht.

Der Arm GPT Tutor vermied den Schaden. Einen Nutzen brachte er aber auch nicht. Die Arbeit gibt den Punktschätzer für die Prüfung in diesem Arm mit −0.004 an, eine Größenordnung kleiner als der Schaden in der Basisbedingung und statistisch nicht von null zu unterscheiden. Die Leitplanken wirkten genau so weit wie „nicht schaden“, und keinen Schritt weiter.

Dieses Ergebnis verdient mehr Aufmerksamkeit, als es bekommt, denn es ist dasjenige, das beiden Lagern die Rechnung verdirbt. KI-Befürworter zitieren die 127%. KI-Kritiker zitieren die 17%. Fast niemand zitiert den Befund, dass der gut gebaute Tutor auf dem Niveau von Nichtstun landete.


Die eine Designentscheidung, die über den Nutzen entscheidet

Das hier stand im GPT-Tutor-Prompt und fehlte in der Basisbedingung. Erstens eine Anweisung, Hinweise zu geben, ohne die Lösung direkt zu nennen. Zweitens von Lehrkräften geliefertes Material zu jeder Aufgabe: mindestens eine richtige Lösung, die Fehler, die Lernende dabei typischerweise machen, und wie darauf zu reagieren ist.

Mehr war es nicht. Gleiches Modell, gleiche Lernende, gleiche 90 Minuten. Der Unterschied zwischen „17% schlechter als nichts“ und „kein Schaden“ bestand aus ein paar hundert Wörtern Anweisung und dem Wissen einer Lehrkraft darüber, wo Lernende stolpern.

Schaut man auf die übrigen Studien, taucht dieselbe Variable immer wieder auf. Stanfords Studie zu Tutor CoPilot fand, dass Tutorinnen und Tutoren mit KI-Unterstützung seltener die Lösung verrieten und häufiger leitende Fragen stellten. Googles LearnLM wurde von Tutorinnen und Tutoren ausdrücklich für das „Entwerfen sokratischer Fragen“ gelobt. Harvards Tutor war darauf gebaut, Lernende Antworten produzieren zu lassen statt sie empfangen zu lassen.

StudieKontextNWas die KI durfteErgebnis
Kestin et al. 2025 (Sci Rep)Harvard, Physik, eine Unterrichtseinheit194Skriptierte Didaktik, eine Frage nach der anderenMedianer Zuwachs mehr als 2x aktivierender Unterricht, in 49 Minuten
Bastani et al. 2025, GPT Base (PNAS)Türkische Oberschule, Mathematik~1.000 insgesamtAlles (schlichter GPT-4-Chat)17% schlechter in der Prüfung als ohne KI
Bastani et al. 2025, GPT Tutor (PNAS)EbendaEbendaNur Hinweise, von Lehrkräften verfasst, keine LösungenKein Schaden, kein messbarer Nutzen (−0.004)
Wang et al., Tutor CoPilot (Stanford)US-Title-I-Schulen, Tutoring in Echtzeit900 Tutoren, 1.800 LernendeMenschlichen Tutoren leitende Fragen vorschlagen+4 Prozentpunkte Themenbeherrschung, +9 Prozentpunkte bei schwächer bewerteten Tutoren
De Simone et al. 2025 (Weltbank)Nigeria, Englisch am Nachmittag~760 ausgewertetVon Lehrkräften begleitete Sitzungen, KI für die Übung+0.31 SD insgesamt, +0.23 SD in Englisch
LearnLM / Eedi 2025Fünf britische Sekundarschulen165Sokratische Nachrichten für menschliche Tutoren entwerfen+5.5 Prozentpunkte bei neuartigen Aufgaben

Das Muster über die Studien zu KI-Tutoren hinweg ist nicht subtil. Jeder Arm, der einen Zuwachs erzeugte, behielt einen Menschen in der Schleife, oder hielt die Lösung außer Reichweite, oder beides. Der eine Arm, der jede Reibung entfernte, lieferte das einzige negative Ergebnis der Tabelle.

Das passt zu etwas, das die Lernwissenschaft seit fünfzig Jahren vertritt. Wünschenswerte Erschwernisse sind jene Bedingungen, unter denen sich Lernen mühsamer anfühlt und dafür besser hängen bleibt. Ein unbeschränkter Chatbot ist eine Maschine zur Beseitigung von Schwierigkeiten. Er ist sehr gut darin, die nächsten zwanzig Minuten produktiv wirken zu lassen, und genau dieses Gefühl beschreibt die Illusion von Kompetenz.


Die zurückgezogene ChatGPT-Metaanalyse, die weiter zitiert wird

Wenn Sie im letzten Jahr irgendetwas Optimistisches über KI und Lernen gelesen haben, ist Ihnen vermutlich diese Zahl begegnet: g = 0.867, „ein großer positiver Effekt auf die Lernleistung“. Sie stammt aus einer Metaanalyse von 51 Studien von Jin Wang und Wenxiang Fan, veröffentlicht im Mai 2025 in Humanities and Social Sciences Communications. Berichtet wurden dort außerdem g = 0.456 für die Lernwahrnehmung und g = 0.457 für Denken höherer Ordnung.

Zurückgezogen wurde sie am 22. April 2026.

Die Zeitschrift nannte als Grund „Unstimmigkeiten in der Metaanalyse“, die „das Vertrauen der Redaktion in die Gültigkeit der Analyse und der daraus gezogenen Schlüsse untergraben“. Vorgebracht hatten die Bedenken Magnus Ingebrigtsen und Marko Lukic, zwei Forscher an der UiT The Arctic University of Norway. Sie stellten fest, dass die Zahl der eingeschlossenen Studien nicht aufging und dass die zwei am stärksten gewichteten Studien überhaupt nicht in die Analyse gehört hätten. Ihr schärfster Punkt: Der Funnel Plot der Arbeit deutete auf einen gepoolten Effekt näher an 0.5 als an 0.867, und die Arbeit enthielt keinen Forest Plot, was bei einer Metaanalyse eine merkwürdige Leerstelle ist.

Auch die eingeschlossenen Studien hatten Probleme. Eine davon war selbst zurückgezogen worden. Andere waren falsch etikettiert oder zu klein, berichteten Effekte, die zu groß waren, um glaubwürdig zu sein, oder kontrollierten offensichtliche Störvariablen nicht. Auf Korrespondenz zur Rücknahme antworteten die Verfasser nicht.

Die Arbeit wurde bei Google Scholar mehr als 800-mal zitiert, 435-mal nach dem Zähler des Verlags selbst, und liegt bei der Aufmerksamkeit im 99. Perzentil. Eine zurückgezogene Zahl hört nicht auf zu zirkulieren, nur weil sie zurückgezogen ist. Sie kursiert noch jahrelang in Foliensätzen, auf Anbieterseiten und in Nachrichtenbeiträgen, was man sich merken sollte, wenn das nächste Mal eine Produktseite eine verdächtig runde Verbesserungszahl nennt. Dieselbe Vorsicht ist angebracht, wenn Sie ein KI-Lernwerkzeug nach seinem Marketing beurteilen.


Blooms zwei Sigma war nie der Maßstab

Die andere Zahl, die dieses Feld heimsucht, stammt von Benjamin Bloom, aus einem Aufsatz von 1984 im Educational Researcher mit dem Titel „The 2 Sigma Problem“. Bloom berichtete, dass Einzelunterricht die durchschnittliche lernende Person zwei Standardabweichungen über eine konventionelle Klasse hob, und formulierte daraus die Aufgabe, Gruppenmethoden zu finden, die damit gleichziehen. Jeder Pitch nach dem Muster „KI gibt jedem Kind einen persönlichen Tutor“ verspricht, wissentlich oder nicht, zwei Sigma.

Repliziert wurde das nie.

Kurt VanLehns Überblicksarbeit von 2011 im Educational Psychologist verortete menschliches Tutoring eher bei d = 0.79 und schrittbasierte intelligente Tutorensysteme bei 0.75 bis 0.76. Nach den Maßstäben der Bildungsforschung ist das immer noch ein großer Effekt. Es ist aber auch weniger als die Hälfte dessen, was Blooms Schlagzeile versprach. Eine Metaanalyse von 2020 über 96 Tutoring-Studien landete bei 0.37, und keine der 96 erzeugte einen Effekt von zwei Sigma.

Es gibt einen konkreten methodischen Grund, warum die ursprüngliche Zahl so hoch ausfiel, und es ist nicht das Tutoring. Blooms tutorierte Lernende bekamen zusätzlich Tests, korrigierendes Feedback und Wiederholungsprüfungen in jeder Einheit, danach einen zweiten Test mit frischen Fragen, den die Vergleichsgruppe im Klassenverband überhaupt nie schrieb. Paul von Hippel, der für Education Next auf die beiden zugrunde liegenden Dissertationen zurückgegangen ist, dokumentiert diese Lücke. Ein Teil der „zwei Sigma“ ist ein Unterschied darin, wie viel Prüfung und Korrektur jede Gruppe erhielt.

Das ist wichtig für die Lektüre von Aussagen über KI-Tutoren. Wenn ein Anbieter nahelegt, KI schließe eine Lücke von zwei Sigma, dann wurde diese Lücke ein einziges Mal gemessen, unter Bedingungen, die niemand reproduziert hat. Messen Sie das Werkzeug an d = 0.3 bis 0.8, also an dem, was gute Interventionen tatsächlich liefern, und das Harvard-Ergebnis bleibt beeindruckend, während die Marketingaussagen albern zu wirken beginnen.


KI-Tutoren im Feld: Nigeria, Stanford und Großbritannien

Drei Feldstudien haben KI-Tutoren aus dem Seminarraum herausgeholt.

Nigeria. Ein Team der Weltbank (De Simone, Tiberti, Barron Rodriguez, Manolio, Mosuro und Dikoru) führte im Juni und Juli 2024 über sechs Wochen ein Englischprogramm am Nachmittag in Benin City durch. Randomisiert wurden 1.328 Schülerinnen und Schüler des ersten Jahrgangs der gymnasialen Oberstufe, von denen rund 760 die Abschlusserhebung mitschrieben. Die Lernenden trafen sich zweimal pro Woche in Computerräumen, eine Lehrkraft eröffnete jede Sitzung mit einem Impuls und ging dann herum, und die Lernenden arbeiteten zu zweit mit Microsoft Copilot auf Basis von GPT-4. Das Programm erzeugte 0.31 Standardabweichungen in der Gesamterhebung und 0.23 speziell in Englisch. Die Kosten-Wirksamkeits-Analyse des Teams beziffert den Zuwachs auf das Äquivalent von 1,5 bis 2 Jahren gewöhnlicher Beschulung und ordnet das Programm damit unter den kostenwirksamsten je dokumentierten Bildungsinterventionen ein.

Beachten Sie die Form. Die Arbeit sagt ausdrücklich, dass die Lehrkräfte keinen direkten Unterricht erteilten: Sie richteten die Sitzung ein und beaufsichtigten. Die Übung übernahm die KI. Ersetzt wurde niemand.

Stanford. Tutor CoPilot von Rose Wang, Ana Ribeiro, Carly Robinson, Susanna Loeb und Dora Demszky war die erste randomisierte Studie zu einem Mensch-KI-System im laufenden Tutoring: 900 Tutorinnen und Tutoren sowie 1.800 K-12-Lernende an Title-I-Schulen. Lernende, deren Tutoren Zugang hatten, beherrschten Themen mit einer um 4 Prozentpunkte höheren Wahrscheinlichkeit. Lernende der am schlechtesten bewerteten Tutoren gewannen 9 Punkte. Das System kostete rund 20 US-Dollar pro Tutor und Jahr.

Dazu zwei Anmerkungen. Der interessante Teil ist die Implikation für Chancengerechtigkeit: Das Werkzeug verkleinerte den Abstand zwischen starken und schwachen Tutoren, statt alle gleichmäßig anzuheben, indem es schwache Tutoren zu jenem Verhalten hinführte, das starke ohnehin zeigten. Die ehrliche Einschränkung lautet, dass sich der Zuwachs von 4 Punkten auf Beherrschungsprüfungen je Sitzung bezieht. Eine statistisch signifikante Verbesserung der Mathematiktests am Jahresende fanden die Forschenden nicht.

Großbritannien. Eine explorative Studie des LearnLM-Teams von Google mit Eedi umfasste 2025 165 Lernende an fünf britischen Sekundarschulen. Von LearnLM unterstützte Lernende lösten neuartige Aufgaben zu späteren Themen mit einer um 5.5 Prozentpunkte höheren Wahrscheinlichkeit, 66.2% gegenüber 60.7% bei allein arbeitenden menschlichen Tutoren. Die Tutorinnen und Tutoren übernahmen 76.4% der von der KI entworfenen Nachrichten ohne oder mit minimalen Änderungen. Kleine Stichprobe, exploratives Design, aber die Richtung ist konsistent.


ChatGPT zum KI-Tutor machen: 4 Regeln aus den Studien

Den Harvard-Tutor können Sie nicht kaufen. Das meiste von dem, was ihn wirksam machte, können Sie nachbauen, denn der Mechanismus bestand aus Anweisungen, nicht aus Infrastruktur. Diese vier Regeln sind jene, die in den Studien tatsächlich geprüft wurden.

1. Verbieten Sie die Lösung, und zwar ausdrücklich. Sagen Sie dem Modell, dass es Ihnen unter keinen Umständen eine Lösung geben darf, sondern nur den nächsten Hinweis. Genau diese Anweisung sorgte dafür, dass der in der PNAS-Studie gemessene Schaden verschwand. Etwa so: „Sie sind mein Tutor. Geben Sie mir niemals die Antwort oder eine vollständige Lösung, auch wenn ich zweimal frage. Geben Sie mir einen Hinweis nach dem anderen und fordern Sie mich dann auf, es erneut zu versuchen.“

2. Füttern Sie es mit den Fehlerbildern. Der GPT-Tutor-Prompt enthielt von Lehrkräften verfasste Notizen zu häufigen Fehlern. Sie können das annähern, indem Sie Ihren eigenen falschen Versuch einfügen und das Modell bitten, den Denkfehler zu diagnostizieren, statt ihn zu beheben.

3. Produzieren Sie zuerst selbst. Antworten Sie, bevor Sie fragen. Der Abruf ist der Ort, an dem Lernen stattfindet, und ein Tutor, der vor Ihrem eigenen Versuch eintrifft, hat die Anstrengung ersetzt, statt sie zu stützen. Das ist Active Recall mit einem Gesprächspartner daneben.

4. Beenden Sie die Sitzung ohne die KI. Die türkische Prüfung ist die ganze Warnung. Wenn Sie sich nie bei geschlossenem Werkzeug selbst prüfen, wissen Sie nicht, wer von Ihnen beiden den Stoff beherrscht.

KrückenmodusTutormodus
„Lösen Sie diese Aufgabe“„Ich habe x = 4 heraus und es ist falsch. Was sollte ich zuerst prüfen?“
„Fassen Sie dieses Kapitel zusammen“„Stellen Sie mir fünf Fragen zu diesem Kapitel und bewerten Sie dann meine Antworten“
„Erklären Sie die Photosynthese“„Ich erkläre Ihnen jetzt die Photosynthese. Unterbrechen Sie mich, wenn ich falschliege.“
Liest die Ausgabe, fühlt sich informiertSchreibt die Antwort, findet es heraus

Die dritte Zeile ist der Protégé-Effekt im Chatfenster, und sie ist das billigste Upgrade auf dieser Liste. Jemandem etwas zu erklären, der geduldig zuhört und nie gelangweilt ist, gehört zu den wenigen wirklich neuen Dingen, die diese Technologie Lernenden bietet.


Womit man einen KI-Tutor füttert: das eigene Lesen als Lehrplan

In all diesen Studien steckt eine Lücke, die man benennen sollte: Jede einzelne lieferte die Inhalte gleich mit. Harvard schrieb die Physikstunde, die türkischen Lehrkräfte schrieben die Mathematikaufgaben, Eedi stellte den Fragenpool. Außerhalb eines Klassenzimmers reicht Ihnen niemand einen Lehrplan.

Das heißt: Die erste Aufgabe besteht nicht darin, einen Tutor zu finden. Sie besteht darin, etwas Konkretes zu haben, worin er Sie unterrichten kann.

Das ist das praktische Argument für Hervorheben statt Lesezeichen. Ein Lesezeichen sichert eine Seite. Eine Hervorhebung sichert die Entscheidung, die Sie über sie getroffen haben. Wenn Sie mit Glasps Web-Highlighter lesen, bleiben die herausgezogenen Passagen mit ihrer Herkunft verbunden. Fügen Sie zwölf davon in einen Tutor-Prompt ein, und das Modell kann nicht zu seiner generischsten Fassung des Themas abdriften, weil Sie ihm gesagt haben, welche zwölf Dinge Ihnen wichtig waren.

Dasselbe gilt für Video, wo heute ein großer Teil des selbstgesteuerten Lernens stattfindet. YouTube Summary liefert Ihnen das Transkript und die Kernpunkte, und erst das Transkript macht einen Vortrag abfragbar. Von dort aus kann Glasps KI-Chat Sie zu Ihrem eigenen gespeicherten Material befragen statt zum durchschnittlichen Verständnis des Internets davon. Wer sich durch Bücher arbeitet, kann Kindle-Hervorhebungen auf denselben Stapel legen.

Eines können die Studien nicht messen. Tutoring ist nicht die einzige soziale Struktur, die lehrt. Öffnen Sie einen Artikel in Glasps Community, und Sie sehen, welche Passagen andere Lesende im selben Text markiert haben. Das ist eine Rückmeldung, die keine Einzelsitzung erzeugt: eine Aufzeichnung dessen, was jemand anderes für aufbewahrenswert hielt. Es liegt näher daran, wie Lesen immer schon funktioniert hat, als das Tutoring-Modell zugibt.


Was KI-Tutoren immer noch nicht können

Sie merken nicht, wenn jemand nur so tut. Ein menschlicher Tutor liest Zögern. Ein Modell liest Text, und selbstsicherer Text von einer verwirrten Person sieht genauso aus wie selbstsicherer Text von einer kompetenten. Der Krückeneffekt aus der PNAS-Studie ist genau dieser blinde Fleck in Aktion.

Sie können das Ziel nicht setzen. Jede erfolgreiche Studie hatte einen festgelegten Lehrplan und eine festgelegte Prüfung. Motivation, Reihenfolge und das Wissen darum, was zu lernen sich lohnt, blieben in jeder Zeile der obigen Tabelle beim Menschen.

Sie irren sich weiterhin manchmal, und das eloquent. Ein Tutor, der einen plausiblen Zwischenschritt erfindet, ist schlimmer als gar kein Tutor, denn der Fehler kommt in der Stimme der Autorität, und Sie haben keinen Anlass, ihn zu überprüfen.

Belege für die lange Frist gibt es noch nicht. Die längste Studie hier lief zwei Monate. Nichts Veröffentlichtes sagt Ihnen, was ein Jahr KI-gestützten Lernens mit dauerhaftem Wissen macht, und wer etwas anderes behauptet, extrapoliert.

Und darunter liegt die Frage, wo die Grenze zwischen Tutoriert-Werden und Getragen-Werden verläuft. Das haben wir gesondert betrachtet: Ist es Betrug, mit KI zu lernen? Die Forschung legt nahe, dass der ehrliche Test nicht von Erlaubnis handelt. Er lautet, ob Sie es immer noch allein können.


Häufig gestellte Fragen

Verbessern KI-Tutoren tatsächlich die Noten?

Manchmal, und es hängt vollständig davon ab, wie der Tutor eingestellt ist. Harvards eingeschränkter KI-Tutor erzeugte einen medianen Lernzuwachs von mehr als dem Doppelten eines aktivierenden Kurses. Uneingeschränkter GPT-4-Zugang ließ Lernende in einer türkischen Oberschulstudie in der Prüfung 17% schlechter abschneiden als Mitschülerinnen und Mitschüler ohne KI. Das Modell war in beiden Fällen dasselbe. Die Regeln darum herum nicht.

Ist ChatGPT ein guter Tutor?

So wie es aus der Packung kommt, ist es eine gute Antwortmaschine und ein schlechter Tutor, und genau darin liegt das Problem. Die PNAS-Studie zeigte, dass die Korrektur billig ist: Weisen Sie es an, nur Hinweise und niemals Lösungen zu geben und Sie jeden Schritt zuerst selbst versuchen zu lassen. Diese eine Änderung machte in einer Studie mit knapp 1.000 Lernenden aus einem gemessenen Schaden einen Nullbefund.

Was ist der beste KI-Tutor im Jahr 2026?

Keine unabhängige Studie hat kommerzielle Produkte gegeneinander gestellt, jedes Ranking, das Sie lesen, ist also Marketing. Die Evidenz stützt ein Design, keine Marke: einen Tutor, der Antworten zurückhält, in einzelnen Schritten arbeitet und mit den konkreten Fehlern gefüttert ist, die Lernende bei diesem Stoff machen. Das lässt sich in jedem Chatwerkzeug annähern, für das Sie ohnehin schon zahlen.

Kann KI-Tutoring menschliche Lehrkräfte ersetzen?

Nichts in der veröffentlichten Evidenz stützt das. Beim nigerianischen Programm behielt die Lehrkraft die Sitzung in der Hand, und die KI übernahm die Übung. Stanfords Tutor CoPilot machte menschliche Tutoren besser, statt sie zu ersetzen, und half den schwächsten am meisten. In der LearnLM-Studie gaben menschliche Tutoren die Nachrichten der KI frei. Jedes positive Ergebnis bisher ist ein Ergebnis von Mensch und KI zusammen.

Warum wurde die ChatGPT-Metaanalyse zum Lernen zurückgezogen?

Humanities and Social Sciences Communications zog die Metaanalyse von Wang und Fan aus dem Jahr 2025 am 22. April 2026 zurück und verwies auf Unstimmigkeiten, die das Vertrauen in ihre Schlussfolgerungen untergruben. Zwei externe Forscher fanden den Studienpool aufgebläht und die Effektstärken überzeichnet und wiesen darauf hin, dass der Funnel Plot der Arbeit selbst näher an g = 0.5 lag als an den berichteten 0.867. Zitiert wurde sie mehr als 800-mal.

Schadet ein KI-Tutor dem Langzeitgedächtnis?

Das kann er, wenn er die Abrufanstrengung entfernt. Der Mechanismus ist lange vor der KI gut belegt: Material, das Sie selbst erzeugen, wird besser erinnert als Material, das Sie nur lesen. Deshalb zwangen die Studien, die funktionierten, die Lernenden dazu, es zuerst selbst zu versuchen. Kombinieren Sie jede KI-Sitzung mit Selbsttests und verteilter Wiederholung, und zwar bei geschlossenem Werkzeug.


Funktionieren KI-Tutoren? Die ehrliche Fassung

Die Evidenz ist besser, als die Skeptiker sagen, und viel schmaler, als die Anbieter nahelegen. Eine gut angelegte Studie an einer Spitzenuniversität schlug das beste verfügbare Unterrichtsformat, und das in kürzerer Zeit. Eine größere Studie an einer Oberschule fand, dass dasselbe zugrunde liegende Modell ohne Beschränkungen echten Schaden anrichtete. Die abgesicherte Fassung desselben Tutors lag gleichauf mit Nichtstun.

Was über all das hinweg Bestand hat, ist eine einzige Regel: Der Wert liegt in dem, was der Tutor verweigert. Die Antwort zurückhalten, ihn mit den konkreten Arten füttern, wie Menschen genau hier danebenliegen, die lernende Person zuerst produzieren lassen und danach bei geschlossenem Werkzeug prüfen.

Das ist zugleich eine passable Beschreibung dessen, was eine gute Lehrkraft tut, und vielleicht liegen die Ergebnisse deshalb dort, wo sie liegen. Der Mechanismus ist alt. Was die Technologie hinzufügt, ist eine geduldige Fassung davon, verfügbar um zwei Uhr morgens.

Beginnen Sie mit Material, das Sie tatsächlich selbst gewählt haben. Heben Sie beim Lesen hervor, was zählt, bewahren Sie es dort auf, wo Sie es später befragen können, und nutzen Sie die KI, um sich abfragen zu lassen statt sich informieren zu lassen. Glasp ist für die erste Hälfte dieser Schleife gebaut, und die zweite Hälfte ist der Teil, den man laut Forschung nicht überspringen kann.

Start building your knowledge library

Highlight what matters as you read across the web. Save insights from articles, books, and YouTube videos in one place.

Get Started Free

Or highlight this page as you read it