AI

Tuteurs IA : fonctionnent-ils vraiment ?

Deux essais contrôlés menés la même année scolaire ont abouti à des conclusions opposées. Ce qui les séparait n'était pas le modèle : c'était le droit, ou non, pour l'IA de donner la réponse.

15 min de lecture
Points clés
    • Le meilleur essai et le pire utilisaient tous deux GPT-4 : le tuteur IA de Harvard a produit des gains d'apprentissage médians plus de deux fois supérieurs à ceux d'une classe en apprentissage actif, et en moins de temps. Un essai mené dans un lycée turc a montré que les élèves utilisant GPT-4 sans encadrement obtenaient 17% de moins à l'examen que leurs camarades qui n'y avaient jamais eu accès.
  • Un seul choix de conception les sépare : dans chaque essai où l'IA a aidé, le tuteur était détourné de la possibilité de livrer la réponse. Là où il avait le droit de résoudre le problème, les élèves s'en servaient comme d'une béquille et apprenaient moins.
  • Même le tuteur encadré n'a pas battu le groupe témoin à l'examen : les auteurs de PNAS rapportent une estimation ponctuelle de −0.004, statistiquement indiscernable des élèves qui n'avaient aucune IA. Les garde-fous ont évité le dommage. Ils n'ont pas fabriqué d'avantage.
  • Le chiffre le plus cité de ce débat a été rétracté : la méta-analyse de 2025 annonçant g = 0.867 pour ChatGPT sur la performance d'apprentissage a été retirée par sa revue le 22 avril 2026, après plus de 800 citations. Son propre graphique en entonnoir pointait plutôt vers 0.5.
  • Le « deux sigma » de Bloom n'a jamais été la référence qu'on en a faite : il n'a jamais été répliqué, et la revue de VanLehn situe le tutorat humain réel plus près de d = 0.79. Les tuteurs IA ne courent pas après une cible de 2.0 : personne ne l'a jamais atteinte.

Les tuteurs IA fonctionnent-ils ? La réponse courte

Oui, les tuteurs IA fonctionnent lorsqu'ils sont conçus pour retenir les réponses. Non, et de façon mesurablement pire que rien du tout, lorsqu'ils ne le sont pas. Cette seule variable sépare les essais réunis dans cet article bien plus nettement que ne le font le modèle, la matière ou le pays.

Les preuves les plus solides de chaque camp sont tombées à trois semaines d'intervalle, en juin 2025. Un essai contrôlé randomisé de Harvard a montré que des étudiants utilisant un tuteur IA conçu sur mesure apprenaient davantage que des étudiants d'un cours de physique en apprentissage actif, et y parvenaient en moins de temps. Un essai publié dans PNAS, mené dans une cinquantaine de classes de lycée en Turquie, a montré que les élèves disposant d'un accès ordinaire à GPT-4 obtenaient 17% de moins à l'examen que leurs camarades qui n'y avaient jamais eu accès.

Les deux utilisaient GPT-4. Le tuteur de Harvard était fortement contraint par des règles pédagogiques. Le bras « GPT Base » turc n'était qu'une simple fenêtre de conversation. S'il ne faut retenir qu'une chose de la recherche, que ce soit celle-ci : un tuteur IA est un ensemble de restrictions posées par-dessus un modèle, et ce sont les restrictions qui constituent le produit.


L'essai de Harvard : deux fois plus de gains, en moins de temps

Kestin et ses collègues de Harvard ont mené leur essai dans un grand cours de physique de premier cycle à l'automne 2023 et l'ont publié dans Scientific Reports le 3 juin 2025, sous le titre « AI tutoring outperforms in-class active learning ». L'échantillon comptait 194 étudiants.

Ce qui rend cette étude digne d'une lecture attentive, c'est son groupe témoin. Ce n'était pas un cours magistral. Le programme de physique de Harvard fonctionne déjà en classes d'apprentissage actif, le format qui surpasse le cours magistral dans des décennies de recherche en didactique de la physique. Le tuteur IA a donc été mesuré face à la meilleure pratique du moment, et non face à ce qu'une université fait de pire.

Le résultat principal : les gains d'apprentissage médians du groupe tuteur IA ont été plus de deux fois supérieurs à ceux du groupe en classe. Les chiffres de temps comptent tout autant. Le temps médian passé sur la tâche en condition IA était de 49 minutes, contre environ une heure de cours. Les étudiants se sont également déclarés plus engagés et plus motivés.

Le tuteur lui-même n'était pas un agent conversationnel affublé d'un joli nom. Les chercheurs ont inscrit la pédagogie dans le prompt : traiter une question à la fois, maintenir l'étudiant en production plutôt qu'en lecture, suivre la même séquence pédagogique que les séances en classe. L'article le présente lui-même ainsi : la conception est venue en premier, le modèle n'était qu'un mécanisme de livraison.

Deux réserves que la couverture médiatique saute généralement. Il s'agissait de deux thèmes dans un seul cours, dans une université dont les étudiants sont exceptionnellement bien préparés, et l'essai était croisé, chaque étudiant passant par les deux conditions. Cela couvre deux leçons, pas un semestre. Impressionnant, mais ce n'est pas encore une affirmation sur ce qui se produit au bout de quinze semaines.


L'essai turc : de gros gains à l'entraînement, 17% de chute à l'examen

Hamsa Bastani, Osbert Bastani, Alp Sungu, Haosen Ge, Özge Kabakcı et Rei Mariman ont apporté le contrepoids. Leur article, « Generative AI without guardrails can harm learning: Evidence from high school mathematics », est paru dans PNAS le 25 juin 2025.

Le dispositif était plus vaste que celui de Harvard : près de 1 000 élèves répartis dans une cinquantaine de classes de 9e, 10e et 11e année d'un lycée turc, sur quatre séances de 90 minutes. Trois bras :

  • Témoin : aucune IA.
  • GPT Base : une interface de conversation GPT-4 standard.
  • GPT Tutor : GPT-4 doté de deux garde-fous, décrits plus bas.

Pendant l'entraînement, l'IA paraissait spectaculaire. Les élèves du bras GPT Tutor résolvaient les exercices 127% mieux que le groupe témoin. Ceux de GPT Base faisaient 48% mieux. Si l'étude s'était arrêtée là, ce serait le résultat le plus cité de toute la technologie éducative.

Puis les chercheurs ont retiré l'IA et fait passer un examen. Les élèves de GPT Base ont obtenu 17% de moins que ceux qui n'y avaient jamais touché. Pas moins bien que pendant leur propre entraînement : moins bien que le groupe témoin. La lecture des auteurs est sans détour : les élèves se sont servis de GPT-4 comme d'une béquille, et la béquille portait tout le poids.

Le bras GPT Tutor a évité les dégâts. Il n'a pas non plus produit de bénéfice. L'article donne pour ce bras une estimation ponctuelle à l'examen de −0.004, soit un ordre de grandeur de moins que le dommage observé en condition de base, et statistiquement indiscernable de zéro. Les garde-fous ont fonctionné exactement jusqu'à « ne pas nuire », et pas au-delà.

Ce résultat mérite plus d'attention qu'il n'en reçoit, car c'est celui qui complique la tâche des deux camps. Les partisans de l'IA citent les 127%. Ses détracteurs citent les 17%. Presque personne ne cite le constat selon lequel le tuteur bien conçu fait jeu égal avec l'absence totale d'intervention.


Le choix de conception qui décide si un tuteur IA aide ou non

Voici ce que contenait le prompt de GPT Tutor et que la condition de base n'avait pas. D'abord, une consigne : fournir des indices à l'élève sans jamais donner directement la réponse. Ensuite, du matériel fourni par les enseignants pour chaque problème : au moins une solution correcte, les erreurs que les élèves commettent couramment dessus, et la manière de réagir à ces erreurs.

C'est tout. Même modèle, mêmes élèves, mêmes 90 minutes. La différence entre « 17% de moins que rien du tout » et « aucun dommage » tenait à quelques centaines de mots de consigne et à la connaissance qu'a un enseignant des endroits où les élèves trébuchent.

Parcourez les autres essais et la même variable réapparaît sans cesse. L'étude Tutor CoPilot de Stanford a montré que les tuteurs assistés par l'IA étaient moins enclins à livrer la réponse et plus enclins à poser des questions d'orientation. LearnLM, de Google, a été salué par les tuteurs précisément pour sa façon de « rédiger des questions socratiques ». Le tuteur de Harvard, lui, était bâti pour que les étudiants produisent les réponses au lieu de les recevoir.

EssaiContexteNCe que l'IA avait le droit de faireRésultat
Kestin et al. 2025 (Sci Rep)Physique à Harvard, une leçon194Pédagogie scriptée, une question à la foisGains médians >2x l'apprentissage actif, en 49 min
Bastani et al. 2025, GPT Base (PNAS)Maths au lycée turc~1 000 au totalTout (conversation GPT-4 brute)17% de moins à l'examen que sans IA
Bastani et al. 2025, GPT Tutor (PNAS)IdemIdemIndices seulement, rédigés par l'enseignant, aucune réponseAucun dommage, aucun gain mesurable (−0.004)
Wang et al., Tutor CoPilot (Stanford)Écoles Title I américaines, tutorat en direct900 tuteurs, 1 800 élèvesSuggérer des questions d'orientation à un tuteur humain+4 pp de maîtrise des thèmes, +9 pp pour les tuteurs les moins bien notés
De Simone et al. 2025 (Banque mondiale)Nigeria, anglais après la classe~760 analysésSéances supervisées par un enseignant, IA pour l'entraînement+0.31 SD au global, +0.23 SD en anglais
LearnLM / Eedi 2025Cinq établissements secondaires britanniques165Rédiger des messages socratiques que des tuteurs humains valident+5.5 pp sur des problèmes inédits

Le schéma qui traverse les essais de tuteurs IA n'a rien de subtil. Chaque bras ayant produit un gain gardait un humain dans la boucle, ou maintenait la réponse hors de portée, ou les deux. Le seul bras qui supprimait toute friction a produit le seul résultat négatif du tableau.

Cela rejoint ce que la science de l'apprentissage soutient depuis cinquante ans. Les difficultés désirables sont ces conditions qui rendent l'apprentissage plus pénible sur le moment et plus durable ensuite. Un agent conversationnel sans contraintes est une machine à supprimer la difficulté. Il excelle à donner aux vingt prochaines minutes une impression de productivité, et c'est exactement la sensation que décrit l'illusion de compétence.


La méta-analyse ChatGPT rétractée que l'on cite encore

Si vous avez lu quoi que ce soit d'optimiste sur l'IA et l'apprentissage au cours de l'année écoulée, vous avez probablement croisé ce chiffre : g = 0.867, « un impact positif important sur la performance d'apprentissage ». Il provient d'une méta-analyse de 51 études signée Jin Wang et Wenxiang Fan, publiée dans Humanities and Social Sciences Communications en mai 2025. Elle annonçait par ailleurs g = 0.456 pour la perception de l'apprentissage et g = 0.457 pour la pensée d'ordre supérieur.

Elle a été rétractée le 22 avril 2026.

Le motif avancé par la revue tenait à des « divergences dans la méta-analyse » qui « minent la confiance de l'éditeur dans la validité de l'analyse et des conclusions qui en sont tirées ». Les objections avaient été soulevées par Magnus Ingebrigtsen et Marko Lukic, deux chercheurs de UiT The Arctic University of Norway. Ils ont constaté que le décompte des études ne tombait pas juste, et que les deux études au poids le plus lourd n'auraient jamais dû figurer dans l'analyse. Leur remarque la plus incisive : le graphique en entonnoir de l'article lui-même pointait vers un effet agrégé plus proche de 0.5 que de 0.867, et l'article ne comportait aucun graphique en forêt, ce qui, pour une méta-analyse, constitue une absence pour le moins étrange.

Les études incluses posaient elles aussi problème. L'une d'elles avait elle-même été rétractée. D'autres étaient mal étiquetées, ou trop petites, ou rapportaient des effets trop importants pour être crédibles, ou encore ne contrôlaient pas des facteurs de confusion évidents. Les auteurs n'ont pas répondu aux courriers relatifs à la rétractation.

L'article a été cité plus de 800 fois sur Google Scholar, 435 fois selon le compteur de l'éditeur, et se situe dans le 99e centile en matière d'attention reçue. Un chiffre rétracté ne cesse pas de circuler pour autant. Il poursuit sa route pendant des années dans les présentations, les pages des vendeurs et les articles de presse, ce qu'il vaut la peine de garder en tête la prochaine fois qu'une page produit citera un pourcentage d'amélioration suspectement rond. La même prudence vaut lorsque vous jugez un outil d'étude fondé sur l'IA à partir de son marketing.


Le « deux sigma » de Bloom n'a jamais été la référence

L'autre chiffre qui hante ce domaine est celui de Benjamin Bloom, tiré d'un article de 1984 paru dans Educational Researcher sous le titre « The 2 Sigma Problem ». Bloom y rapportait que le tutorat individuel plaçait l'élève moyen deux écarts-types au-dessus d'une classe conventionnelle, et posait comme défi de trouver des méthodes collectives capables d'en faire autant. Tout argumentaire promettant que « l'IA offrira à chaque enfant un tuteur personnel » promet, sciemment ou non, deux sigma.

Ce résultat n'a jamais été répliqué.

La revue de 2011 de Kurt VanLehn, dans Educational Psychologist, situait le tutorat humain plus près de d = 0.79, avec des systèmes tutoriels intelligents procédant étape par étape entre 0.75 et 0.76. Cela reste un effet important au regard des standards de l'éducation. C'est aussi moins de la moitié de ce que promettait le titre de Bloom. Une méta-analyse de 2020 portant sur 96 études de tutorat aboutissait à 0.37, et aucune des 96 ne produisait un effet de deux sigma.

Il existe une raison méthodologique précise pour laquelle le chiffre d'origine était si élevé, et elle ne tient pas au tutorat. Les élèves tutorés de Bloom recevaient aussi des quiz supplémentaires, des rétroactions correctives et des réévaluations à chaque unité, puis un second quiz aux questions inédites que le groupe de comparaison en classe entière n'a jamais passé. Paul von Hippel, qui est remonté aux deux thèses sous-jacentes pour Education Next, documente cet écart. Une partie du « deux sigma » n'est qu'une différence dans la quantité d'évaluation et de correction reçue par chaque groupe.

Cela compte pour lire les promesses des tuteurs IA. Si un vendeur laisse entendre que l'IA comble un écart de deux sigma, l'écart qu'il décrit n'a été mesuré qu'une seule fois, dans des conditions que personne n'a reproduites. Jugez l'outil à l'aune de d = 0.3 à 0.8, ce que produisent réellement les bonnes interventions, et le résultat de Harvard reste impressionnant tandis que les promesses marketing commencent à paraître ridicules.


Les tuteurs IA sur le terrain : Nigeria, Stanford et Royaume-Uni

Trois études de terrain ont fait sortir les tuteurs IA de la salle de séminaire.

Nigeria. Une équipe de la Banque mondiale (De Simone, Tiberti, Barron Rodriguez, Manolio, Mosuro et Dikoru) a mené un programme d'anglais après la classe à Benin City, pendant six semaines, en juin et juillet 2024. Elle a randomisé 1 328 élèves de première année du secondaire supérieur, dont environ 760 ont passé l'évaluation finale. Les élèves se retrouvaient deux fois par semaine en salle informatique, un enseignant ouvrait chaque séance par une consigne puis circulait, et les élèves travaillaient en binômes avec Microsoft Copilot fonctionnant sur GPT-4. Le programme a produit 0.31 écart-type sur l'évaluation globale et 0.23 en anglais spécifiquement. L'analyse coût-efficacité de l'équipe évalue ces gains à l'équivalent de 1.5 à 2 années de scolarité ordinaire, ce qui place le programme parmi les interventions éducatives les plus rentables jamais recensées.

Notez la forme du dispositif. L'article est explicite : les enseignants ne dispensaient aucun enseignement direct, ils installaient la séance et supervisaient. L'IA se chargeait de l'entraînement. Personne n'a remplacé personne.

Stanford. Tutor CoPilot, de Rose Wang, Ana Ribeiro, Carly Robinson, Susanna Loeb et Dora Demszky, a été le premier essai randomisé d'un système humain-IA en tutorat réel : 900 tuteurs et 1 800 élèves de la maternelle à la terminale, dans des écoles Title I. Les élèves dont les tuteurs y avaient accès avaient 4 points de pourcentage de chances supplémentaires de maîtriser les thèmes. Les élèves des tuteurs les moins bien notés gagnaient 9 points. Le système coûtait environ 20 $ par tuteur et par an.

Deux remarques à ce sujet. L'implication en matière d'équité est la partie intéressante : l'outil a comprimé l'écart entre bons et mauvais tuteurs au lieu d'élever tout le monde de façon uniforme, en rapprochant les tuteurs faibles des comportements que les bons avaient déjà. La réserve honnête, c'est que le gain de 4 points porte sur des vérifications de maîtrise séance par séance. Les chercheurs n'ont trouvé aucune amélioration statistiquement significative des résultats aux tests de mathématiques de fin d'année.

Royaume-Uni. Un essai exploratoire de 2025, mené par l'équipe LearnLM de Google avec Eedi, a porté sur 165 élèves répartis dans cinq établissements secondaires britanniques. Les élèves accompagnés par LearnLM avaient 5.5 points de pourcentage de chances supplémentaires de résoudre des problèmes inédits sur des thèmes ultérieurs, soit 66.2% contre 60.7% pour les tuteurs humains travaillant seuls. Les tuteurs acceptaient 76.4% des messages rédigés par l'IA sans aucune retouche ou avec des retouches minimes. Échantillon réduit, dispositif exploratoire, mais la direction est cohérente.


Transformer ChatGPT en tuteur IA : 4 règles testées par les essais

Vous ne pouvez pas acheter le tuteur de Harvard. Vous pouvez en revanche reconstituer l'essentiel de ce qui l'a fait fonctionner, car le mécanisme tenait à des consignes et non à une infrastructure. Ces quatre règles sont celles que les essais ont réellement testées.

1. Interdisez la réponse, explicitement. Dites au modèle qu'il n'a en aucun cas le droit de vous donner une solution, seulement l'indice suivant. C'est précisément la consigne qui a transformé le dommage mesuré dans PNAS en absence de dommage. Quelque chose comme : « Tu es mon tuteur. Ne me donne jamais la réponse ni une solution complète, même si je te la demande deux fois. Donne-moi un indice à la fois, puis demande-moi de réessayer. »

2. Donnez-lui les modes de défaillance. Le prompt de GPT Tutor incluait des notes rédigées par les enseignants sur les erreurs courantes. Vous pouvez vous en approcher en collant votre propre tentative ratée et en demandant au modèle de diagnostiquer l'erreur de raisonnement plutôt que de la corriger.

3. Obligez-vous à produire d'abord. Répondez avant de demander. C'est dans la récupération en mémoire que se joue l'apprentissage, et un tuteur qui arrive avant votre tentative a remplacé l'effort au lieu de le soutenir. C'est le rappel actif avec un partenaire de conversation en prime.

4. Terminez la séance sans l'IA. L'examen turc résume tout l'avertissement. Si vous ne vous testez jamais outil fermé, vous n'avez aucune idée de qui, de vous ou de lui, connaît la matière.

Mode béquilleMode tuteur
« Résous ce problème »« J'ai trouvé x = 4 et c'est faux. Quelle est la première chose à vérifier ? »
« Résume ce chapitre »« Pose-moi cinq questions sur ce chapitre, puis corrige mes réponses »
« Explique la photosynthèse »« Je vais t'expliquer la photosynthèse. Interromps-moi quand je me trompe. »
Lit la réponse produite, se sent informéÉcrit la réponse, découvre ce qu'il sait

Cette troisième ligne, c'est l'effet protégé dans une fenêtre de conversation, et c'est l'amélioration la moins coûteuse de cette liste. Expliquer à un auditeur patient qui ne s'ennuie jamais est l'une des rares choses réellement nouvelles que cette technologie offre à celui qui apprend.


Quoi donner à un tuteur IA : vos lectures comme programme

Il y a dans tous ces essais un manque qu'il vaut la peine de nommer : chacun d'eux fournissait le contenu. Harvard a écrit la leçon de physique, les enseignants turcs ont écrit les problèmes de maths, Eedi a fourni la banque de questions. En dehors d'une salle de classe, personne ne vous tend de programme.

Ce qui veut dire que la première tâche n'est pas de trouver un tuteur. C'est d'avoir quelque chose de précis sur quoi il puisse vous faire travailler.

C'est l'argument pratique en faveur du surlignage plutôt que du marque-page. Un marque-page enregistre une page. Un surlignage enregistre la décision que vous avez prise à son sujet. Lorsque vous lisez avec le surligneur web de Glasp, les passages que vous extrayez restent rattachés à leur source d'origine. Collez-en douze dans un prompt de tutorat et le modèle ne peut plus dériver vers sa version la plus générique du sujet, puisque vous lui avez indiqué quelles douze choses comptaient pour vous.

Il en va de même pour la vidéo, où se déroule aujourd'hui une grande partie de l'apprentissage autodirigé. YouTube Summary vous donne la transcription et les points clés, et c'est la transcription qui rend une conférence interrogeable. À partir de là, le chat IA de Glasp peut vous questionner sur votre propre matériel enregistré plutôt que sur la compréhension moyenne qu'en a Internet. Les lecteurs qui avancent dans des livres peuvent verser leurs surlignages Kindle dans la même pile.

Une dernière chose que les essais ne savent pas mesurer. Le tutorat n'est pas la seule structure sociale qui enseigne. Ouvrez un article dans la communauté de Glasp et vous verrez quels passages d'autres lecteurs ont marqués dans le même texte. C'est un retour qu'aucune séance individuelle ne produit : la trace de ce qu'une autre personne a jugé digne d'être conservé. On est plus proche de la façon dont la lecture a toujours fonctionné que le modèle du tutorat ne veut bien l'admettre.


Ce que les tuteurs IA ne savent toujours pas faire

Ils ne savent pas repérer quand vous bluffez. Un tuteur humain lit l'hésitation. Un modèle lit du texte, et un texte assuré écrit par un élève perdu est identique à un texte assuré écrit par un élève compétent. L'effet béquille observé dans PNAS, c'est exactement cet angle mort à l'œuvre.

Ils ne savent pas fixer l'objectif. Chaque essai réussi disposait d'un programme défini et d'une évaluation définie. La motivation, la progression et le discernement de ce qui mérite d'être appris sont restés du côté des humains dans chaque ligne du tableau ci-dessus.

Ils se trompent encore parfois, avec aisance. Un tuteur qui invente une étape plausible est pire que pas de tuteur du tout, car l'erreur arrive avec la voix de l'autorité et vous n'avez aucune raison de la vérifier.

Les preuves de long terme n'existent pas encore. L'étude la plus longue citée ici a duré deux mois. Rien de publié ne vous dit ce qu'une année d'étude tutorée par IA fait à la connaissance durable, et quiconque prétend le contraire extrapole.

Et il y a la question tapie sous tout cela : où passe la frontière entre être tutoré et être porté ? Nous l'avons traitée à part dans étudier avec l'IA, est-ce tricher. La recherche présentée ici suggère que le test honnête n'est pas une affaire de permission. Il s'agit de savoir si vous êtes encore capable de le faire seul.


Questions fréquentes

Les tuteurs IA améliorent-ils vraiment les notes ?

Parfois, et cela dépend entièrement de la façon dont le tuteur est configuré. Le tuteur IA encadré de Harvard a produit des gains d'apprentissage médians plus de deux fois supérieurs à ceux d'une classe en apprentissage actif. Un accès non encadré à GPT-4, dans un essai mené dans un lycée turc, a laissé les élèves 17% en dessous de leurs camarades sans IA à l'examen. Le modèle était le même dans les deux cas. Les règles qui l'entouraient ne l'étaient pas.

ChatGPT est-il un bon tuteur ?

Tel quel, c'est une bonne machine à réponses et un mauvais tuteur, et c'est précisément le problème. L'essai PNAS a montré que le correctif coûte peu : demandez-lui de ne donner que des indices, jamais de solutions, et de vous faire tenter chaque étape d'abord. Ce seul changement a transformé un dommage mesuré en absence de dommage, dans une étude portant sur près de 1 000 élèves.

Quel est le meilleur tuteur IA en 2026 ?

Aucun essai indépendant n'a comparé les produits commerciaux entre eux : tout classement que vous lirez relève donc du marketing. Les preuves soutiennent une conception, pas une marque : un tuteur qui retient les réponses, avance une étape à la fois et se nourrit des erreurs précises que les apprenants commettent sur la matière. Vous pouvez vous en approcher avec n'importe quel outil de conversation que vous payez déjà.

Le tutorat par IA peut-il remplacer les enseignants humains ?

Rien dans les preuves publiées ne va dans ce sens. Le programme nigérian a gardé l'enseignant aux commandes de la séance et réservé l'IA à l'entraînement. Tutor CoPilot, à Stanford, a rendu les tuteurs humains meilleurs au lieu de les remplacer, et a le plus aidé les plus faibles d'entre eux. Dans l'essai LearnLM, des tuteurs humains validaient les messages de l'IA. Tous les résultats positifs obtenus jusqu'ici sont des résultats humain-IA.

Pourquoi la méta-analyse sur ChatGPT et l'apprentissage a-t-elle été rétractée ?

Humanities and Social Sciences Communications a rétracté la méta-analyse de Wang et Fan le 22 avril 2026, en invoquant des divergences qui minaient la confiance dans ses conclusions. Deux chercheurs extérieurs ont montré que l'ensemble d'études retenu était gonflé et les tailles d'effet surestimées, et ont relevé que le graphique en entonnoir de l'article pointait plus près de g = 0.5 que du 0.867 annoncé. Elle a été citée plus de 800 fois.

Utiliser un tuteur IA nuit-il à la mémoire à long terme ?

Cela peut arriver, s'il supprime l'effort de récupération. Le mécanisme est solidement établi bien avant l'IA : on retient mieux ce que l'on produit soi-même que ce que l'on se contente de lire. C'est pourquoi les essais qui ont fonctionné obligeaient les élèves à tenter d'abord. Associez chaque séance avec l'IA à de l'autotest et à une révision espacée, outil fermé.


Les tuteurs IA fonctionnent-ils ? La version honnête

Les preuves sont meilleures que ne le disent les sceptiques et beaucoup plus étroites que ne le laissent entendre les vendeurs. Un essai bien conçu dans une université de premier plan a battu le meilleur format de classe disponible, et en moins de temps. Un essai plus vaste, dans un lycée, a montré que le même modèle sous-jacent, laissé sans contraintes, causait de vrais dégâts. La version encadrée de ce même tuteur a fait jeu égal avec l'absence d'intervention.

Ce qui survit à tout cela tient en une seule règle : la valeur réside dans ce que le tuteur refuse de faire. Retenir la réponse, le charger des façons précises dont on se trompe sur le sujet, faire produire l'apprenant en premier, puis tester outil fermé.

C'est d'ailleurs une description assez juste de ce que fait un bon enseignant humain, ce qui explique peut-être pourquoi les résultats se regroupent là où ils se regroupent. Le mécanisme est ancien. Ce que la technologie y ajoute, c'est une version patiente, disponible à deux heures du matin.

Commencez par une matière que vous avez réellement choisie. Surlignez ce qui compte au fil de votre lecture, gardez-le quelque part où vous pourrez l'interroger plus tard, et servez-vous de l'IA pour vous questionner plutôt que pour vous informer. Glasp est conçu pour la première moitié de cette boucle, et la seconde moitié est celle dont la recherche dit qu'on ne peut pas en faire l'économie.

Start building your knowledge library

Highlight what matters as you read across the web. Save insights from articles, books, and YouTube videos in one place.

Get Started Free

Or highlight this page as you read it