¿Funcionan los tutores de IA? La respuesta corta
Sí, los tutores de IA funcionan cuando están construidos para no dar la respuesta. No, y de forma medible peor que nada, cuando no lo están. Esa única variable separa los ensayos de este artículo con más nitidez que el modelo, la materia o el país.
La evidencia más sólida de cada bando llegó con tres semanas de diferencia en junio de 2025. Un ensayo controlado aleatorizado de Harvard encontró que los estudiantes que usaron un tutor de IA creado a propósito aprendieron más que los estudiantes de una clase de física con aprendizaje activo, y lo hicieron en menos tiempo. Un ensayo publicado en PNAS, realizado en unas cincuenta clases de un instituto turco, encontró que los alumnos con acceso a GPT-4 corriente rindieron un 17% peor en el examen que sus compañeros que nunca lo tuvieron.
Ambos usaron GPT-4. El tutor de Harvard estaba fuertemente restringido por reglas pedagógicas. El grupo turco de "GPT Base" era una ventana de chat sin más. Si se queda con una sola idea de la investigación, que sea esta: un tutor de IA es un conjunto de restricciones superpuestas a un modelo, y las restricciones son el producto.
El ensayo de Harvard: el doble de ganancias y en menos tiempo
Kestin y sus colegas de Harvard realizaron el ensayo en un curso universitario numeroso de física durante el otoño de 2023 y lo publicaron en Scientific Reports el 3 de junio de 2025 con el título "AI tutoring outperforms in-class active learning". La muestra fue de 194 estudiantes.
Lo que hace que este estudio merezca una lectura atenta es el grupo de control. No era una clase magistral. El programa de física de Harvard ya funciona con aulas de aprendizaje activo, el formato que supera a la clase magistral en décadas de investigación sobre enseñanza de la física. El tutor de IA se midió contra la mejor práctica actual, no contra lo peor que hace una universidad.
El resultado principal: las ganancias de aprendizaje medianas del grupo con tutor de IA resultaron más del doble que las del grupo presencial. Las cifras de tiempo importan igual. El tiempo mediano dedicado a la tarea en la condición con IA fue de 49 minutos, frente a aproximadamente una hora de clase. Los estudiantes también dijeron sentirse más involucrados y más motivados.
El tutor en sí no era un chatbot con un nombre bonito. Los investigadores escribieron la pedagogía dentro del prompt: trabajar una pregunta a la vez, mantener al estudiante generando en lugar de leyendo, seguir la misma secuencia didáctica que usaban las lecciones presenciales. El propio planteamiento del artículo es que el diseño vino primero y el modelo fue un mecanismo de entrega.
Dos matices que la cobertura suele omitir. Se trató de dos temas dentro de un único curso, en una universidad con estudiantes inusualmente bien preparados, con un diseño cruzado en el que cada estudiante pasó por ambas condiciones. Cubre dos lecciones, no un semestre. Impresionante, pero todavía no es una afirmación sobre lo que ocurre a lo largo de quince semanas.
El ensayo turco: gran avance en la práctica, una caída del 17% en el examen
Hamsa Bastani, Osbert Bastani, Alp Sungu, Haosen Ge, Özge Kabakcı y Rei Mariman aportaron el contrapeso. Su artículo, "Generative AI without guardrails can harm learning: Evidence from high school mathematics", apareció en PNAS el 25 de junio de 2025.
El diseño era mayor que el de Harvard: casi 1,000 estudiantes repartidos en unas cincuenta clases de 9.º, 10.º y 11.º grado de un instituto turco, en cuatro sesiones de 90 minutos. Tres grupos:
- Control: sin IA.
- GPT Base: una interfaz de chat estándar de GPT-4.
- GPT Tutor: GPT-4 con dos salvaguardas, descritas más abajo.
Durante la práctica, la IA parecía espectacular. Los estudiantes del grupo GPT Tutor resolvieron los problemas de práctica un 127% mejor que el control. Los de GPT Base, un 48% mejor. Si el estudio se hubiera detenido ahí, sería el resultado más citado de la tecnología educativa.
Entonces los investigadores retiraron la IA y pusieron un examen. Los estudiantes de GPT Base sacaron un 17% peor que quienes nunca la habían tocado. No peor de lo que habían estado durante la práctica: peor que el grupo de control. La lectura de los autores es rotunda: los estudiantes usaron GPT-4 como muleta, y la muleta sostenía el peso.
El grupo GPT Tutor evitó el daño. Tampoco produjo un beneficio. El artículo reporta la estimación puntual del examen para ese grupo en −0.004, un orden de magnitud menor que el daño de la condición base y no distinguible estadísticamente de cero. Las salvaguardas funcionaron justo hasta "no hacer daño", y ni un paso más.
Ese resultado merece más atención de la que recibe, porque es el que complica a los dos bandos. Los entusiastas de la IA citan el 127%. Los críticos citan el 17%. Casi nadie cita el hallazgo de que el tutor bien diseñado quedó a la par de no hacer nada.
La única decisión de diseño que determina si un tutor de IA ayuda
Esto es lo que contenía el prompt de GPT Tutor y la condición base no. Primero, una instrucción para dar pistas al estudiante sin entregar directamente la respuesta. Segundo, material aportado por los profesores para cada problema: al menos una solución correcta, los errores que los estudiantes cometen habitualmente en él y cómo responder a esos errores.
Eso es todo. Mismo modelo, mismos estudiantes, mismos 90 minutos. La diferencia entre "un 17% peor que nada" y "sin daño" fueron unos cientos de palabras de instrucciones y el conocimiento de un profesor sobre dónde tropiezan los estudiantes.
Al mirar los demás ensayos, la misma variable reaparece. El estudio Tutor CoPilot de Stanford encontró que los tutores con asistencia de IA eran menos propensos a regalar la respuesta y más propensos a hacer preguntas guía. Los tutores elogiaron LearnLM de Google precisamente por "redactar preguntas socráticas". El tutor de Harvard se construyó para que los estudiantes siguieran produciendo respuestas en lugar de recibirlas.
| Ensayo | Contexto | N | Qué se le permitía hacer a la IA | Resultado |
|---|---|---|---|---|
| Kestin et al. 2025 (Sci Rep) | Física en Harvard, una lección | 194 | Pedagogía guionizada, una pregunta a la vez | Ganancias medianas >2x el aprendizaje activo, en 49 min |
| Bastani et al. 2025, GPT Base (PNAS) | Matemáticas en un instituto turco | ~1,000 en total | Cualquier cosa (chat de GPT-4 sin más) | 17% peor en el examen que sin IA |
| Bastani et al. 2025, GPT Tutor (PNAS) | Igual | Igual | Solo pistas, escritas por profesores, sin respuestas | Sin daño, sin ganancia medible (−0.004) |
| Wang et al., Tutor CoPilot (Stanford) | Escuelas Title I de EE. UU., tutoría en vivo | 900 tutores, 1,800 alumnos | Sugerir preguntas guía a un tutor humano | +4 pp de dominio del tema, +9 pp con los tutores peor valorados |
| De Simone et al. 2025 (Banco Mundial) | Nigeria, inglés extraescolar | ~760 analizados | Sesiones supervisadas por docentes, IA para practicar | +0.31 DE en general, +0.23 DE en inglés |
| LearnLM / Eedi 2025 | Cinco institutos del Reino Unido | 165 | Redactar mensajes socráticos para que los aprueben tutores humanos | +5.5 pp en problemas nuevos |
El patrón en los ensayos de tutores de IA no es sutil. Todos los grupos que produjeron una ganancia mantuvieron a un humano en el circuito, o dejaron la respuesta fuera de alcance, o ambas cosas. El único grupo que eliminó toda fricción produjo el único resultado negativo de la tabla.
Esto encaja con algo que la ciencia del aprendizaje lleva cincuenta años defendiendo. Las dificultades deseables son las condiciones que hacen que aprender se sienta más difícil y se fije mejor. Un chatbot sin restricciones es una máquina de eliminar dificultades. Es muy bueno consiguiendo que los próximos veinte minutos se sientan productivos, que es exactamente la sensación que describe la ilusión de competencia.
El metaanálisis retractado sobre ChatGPT que se sigue citando
Si ha leído algo optimista sobre la IA y el aprendizaje en el último año, probablemente se haya topado con esta cifra: g = 0.867, "un gran impacto positivo en el rendimiento de aprendizaje". Procede de un metaanálisis de 51 estudios firmado por Jin Wang y Wenxiang Fan, publicado en Humanities and Social Sciences Communications en mayo de 2025. Reportaba además g = 0.456 para la percepción del aprendizaje y g = 0.457 para el pensamiento de orden superior.
Fue retractado el 22 de abril de 2026.
La razón declarada por la revista fueron "discrepancias en el metaanálisis" que "socavan la confianza del editor en la validez del análisis y en las conclusiones extraídas de él". Las objeciones las plantearon Magnus Ingebrigtsen y Marko Lukic, dos investigadores de UiT The Arctic University of Norway. Encontraron que el recuento de estudios no cuadraba y que los dos estudios con mayor peso jamás deberían haber entrado en el análisis. Su argumento más afilado: el propio gráfico de embudo del artículo apuntaba a un efecto combinado más cercano a 0.5 que a 0.867, y el artículo no contenía ningún forest plot, algo extraño de echar en falta en un metaanálisis.
Los estudios incluidos también tenían problemas. Uno de ellos había sido retractado a su vez. Otros estaban mal etiquetados, o eran demasiado pequeños, o reportaban efectos demasiado grandes para resultar creíbles, o no controlaban factores de confusión evidentes. Los autores no respondieron a la correspondencia sobre la retractación.
El artículo se ha citado más de 800 veces en Google Scholar, 435 según el contador de la propia editorial, y se sitúa en el percentil 99 de atención. Una cifra retractada no deja de circular por el hecho de haber sido retractada. Sigue circulando en presentaciones, páginas de proveedores y artículos de prensa durante años, algo que conviene recordar la próxima vez que una página de producto cite una mejora sospechosamente redonda. La misma cautela aplica cuando esté juzgando cualquier herramienta de estudio con IA por su marketing.
Las dos sigmas de Bloom nunca fueron el punto de referencia
La otra cifra que persigue a este campo es la de Benjamin Bloom, de un artículo de 1984 en Educational Researcher titulado "The 2 Sigma Problem". Bloom reportó que la tutoría individual movía al estudiante promedio dos desviaciones estándar por encima de un aula convencional, y planteó el reto de encontrar métodos grupales capaces de igualarlo. Todo discurso del tipo "la IA le dará a cada niño un tutor personal" está prometiendo, a sabiendas o no, dos sigmas.
Nunca se ha replicado.
La revisión de Kurt VanLehn de 2011 en Educational Psychologist situó la tutoría humana más cerca de d = 0.79, con los sistemas de tutoría inteligente basados en pasos entre 0.75 y 0.76. Sigue siendo un efecto grande para los estándares educativos. También es menos de la mitad de lo que prometía el titular de Bloom. Un metaanálisis de 2020 sobre 96 estudios de tutoría se quedó en 0.37, y ninguno de los 96 produjo un efecto de dos sigmas.
Hay una razón metodológica concreta por la que la cifra original salió alta, y no es la tutoría. Los estudiantes tutorizados de Bloom recibieron además cuestionarios extra, retroalimentación correctiva y reevaluaciones en cada unidad, y luego un segundo cuestionario con preguntas nuevas que el grupo de comparación de clase completa nunca llegó a hacer. Paul von Hippel, que volvió a las dos tesis doctorales originales para Education Next, documenta esa brecha. Parte de las "dos sigmas" es una diferencia en cuánta evaluación y corrección recibió cada grupo.
Esto importa a la hora de leer afirmaciones sobre tutores de IA. Si un proveedor insinúa que la IA está cerrando una brecha de dos sigmas, esa brecha se midió una sola vez, en condiciones que nadie ha reproducido. Juzgue la herramienta frente a d = 0.3 a 0.8, que es lo que de verdad entregan las buenas intervenciones, y el resultado de Harvard sigue siendo impresionante mientras las afirmaciones de marketing empiezan a parecer ridículas.
Tutores de IA sobre el terreno: Nigeria, Stanford y el Reino Unido
Tres estudios de campo han sacado a los tutores de IA de la sala de seminarios.
Nigeria. Un equipo del Banco Mundial (De Simone, Tiberti, Barron Rodriguez, Manolio, Mosuro y Dikoru) dirigió un programa extraescolar de inglés en Benin City durante seis semanas, en junio y julio de 2024. Aleatorizó a 1,328 estudiantes de primer año de secundaria superior, de los cuales unos 760 hicieron la evaluación final. Los estudiantes se reunían dos veces por semana en salas de informática, un profesor abría cada sesión con una consigna y después circulaba por el aula, y trabajaban por parejas con Microsoft Copilot funcionando sobre GPT-4. El programa produjo 0.31 desviaciones estándar en la evaluación general y 0.23 en inglés específicamente. El análisis de costo-efectividad del equipo situó las ganancias en el equivalente a entre 1.5 y 2 años de escolarización ordinaria, lo que lo coloca entre las intervenciones educativas más costo-efectivas registradas.
Fíjese en su forma. El artículo dice explícitamente que los profesores no impartieron instrucción directa: montaban la sesión y supervisaban. La IA se encargaba de la práctica. Nadie sustituyó a nadie.
Stanford. Tutor CoPilot, de Rose Wang, Ana Ribeiro, Carly Robinson, Susanna Loeb y Dora Demszky, fue el primer ensayo aleatorizado de un sistema humano e IA en tutoría en vivo: 900 tutores y 1,800 alumnos de K-12 en escuelas Title I. Los alumnos cuyos tutores tenían acceso tuvieron 4 puntos porcentuales más de probabilidad de dominar los temas. Los alumnos de los tutores peor valorados ganaron 9 puntos. El sistema costaba unos $20 por tutor y año.
Dos apuntes al respecto. La implicación en términos de equidad es la parte interesante: la herramienta comprimió la brecha entre tutores fuertes y débiles en lugar de elevar a todos por igual, acercando a los débiles al comportamiento que los fuertes ya tenían. El matiz honesto es que la ganancia de 4 puntos se mide en comprobaciones de dominio por sesión. Los investigadores no encontraron una mejora estadísticamente significativa en las notas de matemáticas de fin de curso.
El Reino Unido. Un ensayo exploratorio de 2025 del equipo de LearnLM de Google junto con Eedi abarcó 165 estudiantes de cinco institutos británicos. Los estudiantes apoyados por LearnLM tuvieron 5.5 puntos porcentuales más de probabilidad de resolver problemas nuevos en temas posteriores, un 66.2% frente al 60.7% de los tutores humanos trabajando solos. Los tutores aceptaron el 76.4% de los mensajes redactados por la IA sin ediciones o con ediciones mínimas. Muestra pequeña y diseño exploratorio, pero la dirección es consistente.
Cómo convertir ChatGPT en un tutor de IA: 4 reglas que los ensayos probaron
No puede comprar el tutor de Harvard. Sí puede reconstruir casi todo lo que lo hacía funcionar, porque el mecanismo eran instrucciones, no infraestructura. Estas cuatro reglas son las que los ensayos probaron de verdad.
1. Prohíba la respuesta, y dígalo en voz alta. Indíquele al modelo que no puede darle una solución bajo ninguna circunstancia, solo la siguiente pista. Esta es exactamente la instrucción que convirtió el daño del estudio de PNAS en ausencia de daño. Algo así: "Usted es mi tutor. No me dé nunca la respuesta ni una solución completa, aunque se la pida dos veces. Deme una pista cada vez y luego pídame que lo intente de nuevo."
2. Dele los modos de fallo. El prompt de GPT Tutor incluía notas escritas por los profesores sobre los errores habituales. Puede aproximarlo pegando su propio intento equivocado y pidiéndole al modelo que diagnostique el error de razonamiento en lugar de corregirlo.
3. Oblíguese a generar primero. Responda antes de preguntar. La recuperación es donde ocurre el aprendizaje, y un tutor que llega antes que su intento ha sustituido el esfuerzo en vez de apoyarlo. Esto es recuerdo activo con un interlocutor conversacional acoplado.
4. Cierre la sesión sin la IA. El examen turco es toda la advertencia que hace falta. Si nunca se pone a prueba con la herramienta cerrada, no tiene forma de saber quién de los dos conoce la materia.
| Modo muleta | Modo tutor |
|---|---|
| "Resuelva este problema" | "Obtuve x = 4 y está mal. ¿Qué es lo primero que debería revisar?" |
| "Resuma este capítulo" | "Hágame cinco preguntas sobre este capítulo y luego califique mis respuestas" |
| "Explique la fotosíntesis" | "Le voy a explicar la fotosíntesis. Interrúmpame cuando me equivoque." |
| Lee la salida y se siente informado | Escribe la respuesta y lo descubre |
Esa tercera fila es el efecto protégé dentro de una ventana de chat, y es la mejora más barata de esta lista. Explicarle algo a un oyente paciente que nunca se aburre es una de las pocas cosas genuinamente nuevas que esta tecnología le ofrece a quien aprende.
Qué darle a un tutor de IA: sus propias lecturas como programa
Hay un vacío en todos estos ensayos que conviene nombrar: todos ellos aportaron el contenido. Harvard escribió la lección de física, los profesores turcos escribieron los problemas de matemáticas, Eedi puso el banco de preguntas. Fuera de un aula, nadie le entrega un programa de estudios.
Lo que significa que la primera tarea no es encontrar un tutor. Es tener algo concreto sobre lo que ser tutorizado.
Ese es el argumento práctico a favor de subrayar en lugar de guardar marcadores. Un marcador guarda una página. Un subrayado guarda la decisión que usted tomó sobre ella. Cuando lee con el subrayador web de Glasp, los pasajes que extrae quedan anclados al lugar del que salieron. Pegue doce de ellos en un prompt de tutoría y el modelo no podrá derivar hacia su versión más genérica del tema, porque usted ya le ha dicho cuáles son las doce cosas que le importaban.
Lo mismo vale para el vídeo, donde hoy ocurre buena parte del aprendizaje autodirigido. YouTube Summary le da la transcripción y los puntos clave, y la transcripción es lo que permite convertir una clase en preguntas. A partir de ahí, el chat de IA de Glasp puede interrogarle sobre su propio material guardado en lugar de sobre la comprensión promedio que internet tiene del tema. Quien lea libros puede volcar sus subrayados de Kindle en el mismo montón.
Una cosa más que los ensayos no pueden medir. La tutoría no es la única estructura social que enseña. Abra un artículo en la comunidad de Glasp y verá qué pasajes marcaron otros lectores en el mismo texto. Eso es una retroalimentación que ninguna sesión individual produce: el registro de lo que otra persona consideró digno de guardar. Se parece más a cómo la lectura siempre ha funcionado de lo que el modelo de tutoría admite.
Lo que los tutores de IA todavía no pueden hacer
No pueden detectar cuándo está fingiendo. Un tutor humano lee la vacilación. Un modelo lee texto, y un texto seguro escrito por un estudiante confundido es idéntico a un texto seguro escrito por uno competente. El efecto muleta de PNAS es exactamente ese punto ciego en acción.
No pueden fijar el objetivo. Todos los ensayos con éxito tenían un temario definido y una evaluación definida. La motivación, la secuenciación y saber qué merece la pena aprender se quedaron del lado humano en todas las filas de la tabla anterior.
Todavía se equivocan a veces, y con mucha fluidez. Un tutor que inventa un paso plausible es peor que ningún tutor, porque el error llega con voz de autoridad y usted no tiene motivo para comprobarlo.
La evidencia de largo plazo todavía no existe. El estudio más largo que aparece aquí duró dos meses. Nada de lo publicado le dice qué le hace a la memoria duradera un año de estudio con tutoría de IA, y quien afirme lo contrario está extrapolando.
Y debajo de todo esto está la pregunta de dónde queda la línea entre recibir tutoría y ser llevado en brazos. Eso lo tratamos aparte en ¿es hacer trampa usar IA para estudiar?. La investigación sugiere que la prueba honesta no va de permisos. Va de si todavía puede hacerlo por su cuenta.
Preguntas frecuentes
¿De verdad mejoran las notas los tutores de IA?
A veces, y depende por completo de cómo esté configurado el tutor. El tutor de IA restringido de Harvard produjo ganancias de aprendizaje medianas más del doble que las de una clase de aprendizaje activo. El acceso a GPT-4 sin restricciones en un ensayo de instituto turco dejó a los alumnos un 17% peor en el examen que a sus compañeros sin IA. El modelo era el mismo en ambos casos. Las reglas a su alrededor, no.
¿Es ChatGPT un buen tutor?
Tal como viene, es una buena máquina de respuestas y un mal tutor, y ese es justamente el problema. El ensayo de PNAS mostró que la solución es barata: indíquele que dé solo pistas, nunca soluciones, y que le pida intentar cada paso primero. Ese único cambio convirtió un daño medido en ausencia de daño, en un estudio con casi 1,000 estudiantes.
¿Cuál es el mejor tutor de IA en 2026?
Ningún ensayo independiente ha comparado productos comerciales entre sí, así que cualquier clasificación que lea es marketing. La evidencia respalda un diseño, no una marca: un tutor que retiene las respuestas, trabaja paso a paso y viene cargado con los errores concretos que comete quien aprende esa materia. Puede aproximar eso en cualquier herramienta de chat que ya pague.
¿Puede la tutoría con IA sustituir a los profesores humanos?
Nada en la evidencia publicada lo respalda. El programa nigeriano mantuvo al profesor al frente del aula y usó la IA para practicar. Tutor CoPilot de Stanford hizo mejores a los tutores humanos en lugar de sustituirlos, y ayudó sobre todo a los tutores más débiles. En el ensayo de LearnLM había tutores humanos aprobando los mensajes de la IA. Todo resultado positivo hasta ahora es un resultado de humanos con IA.
¿Por qué se retractó el metaanálisis sobre ChatGPT y el aprendizaje?
Humanities and Social Sciences Communications retractó el metaanálisis de 2025 de Wang y Fan el 22 de abril de 2026, alegando discrepancias que socavaban la confianza en sus conclusiones. Dos investigadores externos encontraron el conjunto de estudios inflado y los tamaños de efecto sobrestimados, y señalaron que el propio gráfico de embudo del artículo apuntaba más cerca de g = 0.5 que al 0.867 reportado. Se ha citado más de 800 veces.
¿Usar un tutor de IA daña la memoria a largo plazo?
Puede hacerlo, si elimina el esfuerzo de recuperación. El mecanismo está bien establecido desde mucho antes de la IA: el material que uno mismo genera se recuerda mejor que el material que solo lee. Por eso los ensayos que funcionaron obligaban a los estudiantes a intentarlo primero. Acompañe cualquier sesión con IA de autoevaluación y repaso espaciado, con la herramienta cerrada.
¿Funcionan los tutores de IA? La versión honesta
La evidencia es mejor de lo que dicen los escépticos y mucho más estrecha de lo que insinúan los proveedores. Un ensayo bien diseñado en una universidad de primer nivel superó al mejor formato de aula disponible, y en menos tiempo. Un ensayo mayor en un instituto encontró que el mismo modelo subyacente, sin restricciones, hizo un daño real. La versión con salvaguardas de ese mismo tutor quedó igualada con no hacer nada.
Lo que sobrevive a todo ello es una sola regla: el valor está en lo que el tutor se niega a hacer. Retenga la respuesta, cárguelo con las formas concretas en que la gente se equivoca en esto, haga que quien aprende produzca primero y evalúese después con la herramienta cerrada.
Esa es también una descripción decente de lo que hace un buen profesor humano, y quizá por eso los resultados se agrupan donde se agrupan. El mecanismo es antiguo. Lo que añade la tecnología es una versión paciente de él, disponible a las dos de la mañana.
Empiece con material que haya elegido usted. Subraye lo que importa mientras lee, guárdelo en un sitio donde pueda interrogarlo después y use la IA para que le pregunte a usted en lugar de para que le informe. Glasp está hecho para la primera mitad de ese bucle, y la segunda mitad es la parte que la investigación dice que no se puede saltar.