La respuesta corta
Sí, ChatGPT puede resumir un video de YouTube, pero no viéndolo. La app de ChatGPT para el público general no tiene comprensión nativa de video de YouTube: no puede abrir un video, ver los fotogramas ni escuchar el audio. Lo que sí puede hacer es resumir la transcripción del video, es decir, el texto de lo que realmente se dijo. Pega eso y el resumen resulta genuinamente útil. Pega en cambio solo el enlace y obtendrás un párrafo muy seguro de sí mismo sobre el tema, no sobre el video.
Esa distinción es la diferencia entre un resumen que puedes citar y un resumen por el que vas a tener que disculparte. En 2026 hay cinco rutas disponibles, y no son igual de confiables:
| Qué haces | Qué recibe ChatGPT | Qué tan confiable es |
|---|---|---|
| Pegar solo la URL | Título, descripción, metadatos de la página | Poco confiable, a menudo inventado |
| Pegar el texto de la transcripción | Cada línea hablada | Confiable, el método de referencia |
| Usar una extensión de transcripciones | La transcripción, enviada de forma automática | Confiable y rápido |
| Preguntar desde el propio navegador de ChatGPT | Lo que la página esté mostrando en ese momento | Confiable si el panel de transcripción está abierto |
| Transcribir el audio tú mismo | Una transcripción que generaste tú | Confiable, funciona sin subtítulos |
El resto de este artículo trata de por qué la ruta uno falla, cómo ejecutar las otras cuatro en menos de un minuto y cómo notar cuándo un resumen está inventando cosas en silencio.
Lo que ChatGPT ve en realidad cuando pegas un enlace
Un modelo de lenguaje trabaja con tokens, que son fragmentos de texto. La app de ChatGPT para el público general no tiene un decodificador de video conectado al cuadro de chat, así que nada del video, ni los píxeles ni el audio, se convierte nunca en un token que pueda leer.
Cuando pegas un enlace pasa una de dos cosas. O el modelo no tiene ningún paso de recuperación, en cuyo caso responde puramente a partir de la cadena de la URL y de sus datos de entrenamiento, o ejecuta una herramienta de navegación que descarga la página. El segundo caso suena mejor de lo que es. Una página de reproducción de YouTube dibuja el reproductor y el panel de transcripción en el navegador después de que la página carga, así que el HTML que descarga un rastreador trae el título, la descripción, algunos metadatos estructurados y una enorme cantidad de scripts. No trae las palabras habladas en ninguna forma utilizable. YouTube además se esfuerza mucho por bloquear las descargas automatizadas, así que una captura del lado del servidor suele volver con menos de lo que ves en pantalla.
Entonces el modelo hace lo que hacen los modelos de lenguaje: produce la continuación más plausible. Una continuación plausible de "resume este video sobre ayuno intermitente" es un ensayo competente sobre ayuno intermitente. Fluido, estructurado y ajeno a ese video. Esta es, de lejos, la forma más común en que la gente sale quemada, y como el texto está bien escrito, nada en él parece equivocado.
El modelo no está mintiendo. Hiciste una pregunta de lectura y no le entregaste nada que leer.
Los cuatro métodos que funcionan en 2026
Método 1: copiar la propia transcripción de YouTube
Abre el video, haz clic o toca "...más" para expandir la descripción, baja hasta el final y presiona "Mostrar transcripción". Se abre un panel con cada línea hablada y su marca de tiempo. En computadora puedes seleccionar y copiar ese texto. Pégalo en ChatGPT con una línea de instrucción, algo como "Resume esta transcripción en tres partes: la afirmación central en una frase, las tres pruebas más fuertes y cualquier cosa sobre la que el orador dijo no estar seguro. Cita la línea exacta para cada una". Más abajo hay mejores prompts, pero ese basta para obtener una respuesta utilizable.
Es gratis, no requiere instalar nada y es el método del que todos los demás son un atajo. El problema está en el celular. Tocar una línea en el panel de la app de YouTube salta el reproductor a ese momento, lo cual es útil, pero el texto en sí no se puede seleccionar, así que no hay nada que pegar. O pides el sitio de escritorio desde un navegador móvil, o usas algo que obtenga el texto por ti, como la app móvil de Glasp. Nuestra guía sobre cómo obtener la transcripción de un video de YouTube cubre todas las alternativas.
Método 2: una extensión que le pasa la transcripción por ti
Copiar a mano una transcripción de 9,000 palabras cansa rápido. Una extensión de navegador instalada en la página de YouTube puede tomar la transcripción y enviarla directo a un modelo, lo que reduce toda la rutina a un clic. YouTube Summary de Glasp hace exactamente eso, devuelve un resumen estructurado con marcas de tiempo en las que puedes hacer clic y mantiene la transcripción al lado para que puedas verificar cualquier afirmación contra la línea que la produjo. Si prefieres ver primero solo la transcripción, la herramienta de transcripciones de Glasp la extrae desde una URL.
La razón para preferir una extensión frente a un sitio donde pegas la URL no es la velocidad, es la verificación. Cuando el texto fuente está junto al resumen puedes detectar una afirmación equivocada en segundos. Cuando no lo está, la herramienta te está pidiendo que confíes en ella.
Método 3: la extensión de Chrome de ChatGPT o el navegador de escritorio
Desde que OpenAI reintegró su trabajo de navegador en ChatGPT, puedes preguntar sobre la página en la que estás desde la extensión de Chrome de ChatGPT o desde el navegador integrado en la app de escritorio. Ambos dependen de tu plan, tu región y tu espacio de trabajo, así que si no ves la opción, ese es el motivo, y el Método 1 sigue funcionando. En una página de YouTube hay una condición: abre primero el panel de transcripción. El asistente responde a partir de lo que hay en la página, así que si la transcripción está renderizada, está disponible. Si el panel está cerrado, vuelves a adivinar con título y descripción, y la respuesta no te va a avisar cuál de las dos cosas acaba de pasar.
Método 4: transcribir el audio tú mismo
Cuando no hay pista de subtítulos, nada de lo anterior funciona, porque no hay texto que obtener. Así que créalo: extrae el audio con un descargador, pásalo por un modelo de voz a texto como Whisper, alojado en la nube o de forma local si te sientes cómodo en una terminal, y luego resume lo que salga. Es la ruta más lenta, es la única que funciona en un video que nadie subtituló nunca, y con acentos cerrados o jerga técnica densa le gana de lejos a los subtítulos automáticos de YouTube.
| Método | Tiempo de preparación | Tiempo por video |
|---|---|---|
| Copiar la transcripción de YouTube | Ninguno | Alrededor de 1 minuto |
| Extensión | Menos de un minuto, una sola vez | Alrededor de 10 segundos |
| Extensión de ChatGPT o navegador de escritorio | Menos de un minuto, una sola vez | Alrededor de 30 segundos |
| Transcribir el audio | Moderado | Varios minutos |
Atlas cerró en agosto de 2026. Esto es lo que lo reemplazó
Si seguiste un tutorial de finales de 2025, probablemente te decía que hicieras esto dentro de ChatGPT Atlas. Ese consejo ya no funciona.
OpenAI anunció Atlas el 21 de octubre de 2025 y lo lanzó para macOS. Su función estrella era una barra lateral de "Ask ChatGPT" que respondía preguntas sobre la página que estabas viendo sin que tuvieras que copiar nada a un chat aparte, lo que la convertía en una respuesta muy limpia al problema de YouTube: abres un video, abres la barra lateral, preguntas.
Atlas cerró el 9 de agosto de 2026, menos de diez meses después de su lanzamiento. OpenAI descontinuó el navegador independiente y movió el trabajo agéntico basado en navegador hacia ChatGPT y Codex, en concreto a una extensión de ChatGPT para Google Chrome y al navegador integrado en la app de escritorio de ChatGPT, que ganó soporte de varias pestañas, descargas, mejor navegación y manejo del inicio de sesión de cuentas. OpenAI pidió a los usuarios exportar sus marcadores de Atlas como archivo HTML antes de la fecha de cierre e importarlos en otro navegador; las pestañas abiertas y el historial de navegación no se transfirieron en absoluto.
La traducción práctica: la capacidad sobrevivió, el producto no. Si hoy quieres la experiencia de barra lateral en una página de YouTube, lo que quieres es la extensión de Chrome o el navegador integrado de la app de escritorio, no Atlas. El vaivén es la lección. Una función que definía a un navegador entero en octubre era un punto más en la lista de otro producto al verano siguiente, lo cual es un buen argumento para quedarte con tu propia transcripción y tus propias notas en vez de depender de la superficie de turno.
Gemini sí puede ver el video. ChatGPT sigue sin poder
Este es el único punto donde los dos grandes asistentes se diferencian de verdad, y los detalles importan, porque "Gemini puede con YouTube" se repite con mucha más seguridad de la que respalda la documentación.
Google sí documenta soporte nativo de URLs de YouTube, en la API de Gemini. Puedes pasar una URL de YouTube directamente a la API como parte de tu solicitud y el modelo le aplica su comprensión multimodal, sin que tú descargues nada. Las restricciones publicadas a septiembre de 2026, todas ellas límites de la API y no de la app de Gemini para el público general:
| Restricción | Lo que documenta Google |
|---|---|
| Privacidad del video | Solo videos públicos, ni privados ni no listados |
| Techo del nivel gratuito | No más de 8 horas de video de YouTube al día en el nivel gratuito de la API |
| Nivel de pago | Sin límite por duración del video |
| Videos por solicitud | Hasta 10 en Gemini 2.5 y posteriores, 1 en modelos anteriores |
| Muestreo de fotogramas | 1 fotograma por segundo en modo estático |
| Audio | Procesado a 1 Kbps, un solo canal, unos 32 tokens por segundo |
| Estado | Vista previa, por ahora gratis, con precios y límites de uso que probablemente cambien |
Vuelve a leer la fila del muestreo de fotogramas, porque fija el techo de lo que significa "ver". A un fotograma por segundo el modelo está mirando una presentación de diapositivas, no movimiento. Va a resumir bien un argumento y no va a tener base alguna para decir cuántas veces falló una demostración en un montaje de cortes rápidos. El audio y la transcripción concentran casi toda la señal real, que es exactamente lo mismo que ocurre con ChatGPT, solo que aquí la descarga la resuelven por ti.
Eso deja una elección sencilla, y no siempre gana Gemini:
| Si quieres... | Usa | Por qué |
|---|---|---|
| Resumir solo con el enlace, lo más rápido posible | La API de Gemini | Es la única que va y trae el video por sí misma |
| Trabajar con un video privado o no listado | ChatGPT, con la transcripción pegada | El soporte de URLs de Gemini es solo para videos públicos |
| Hacer preguntas de seguimiento durante la hora siguiente | ChatGPT, con la transcripción pegada | El texto completo se queda en el contexto para todo lo que preguntes después |
| Guardar juntos el resumen, las líneas fuente y tus notas | Una herramienta dedicada | Ambos chatbots tratan el video como una consulta de una sola vez |
Ninguno de los dos elimina la necesidad de revisar la salida. Si estás eligiendo un asistente para estudiar y no para un solo video, Claude vs ChatGPT para aprender los enfrenta a tareas de estudio reales. Y para marcas de tiempo en las que se puede hacer clic, algo que ningún chatbot te da, las mejores herramientas para resumir YouTube en 2026 cubre las opciones dedicadas.
Prompts que producen un resumen utilizable
El prompt de la mayoría de la gente es "resume esto". Eso te devuelve un párrafo sin forma, porque no especificaste estructura, ni longitud, ni requisito de fundamentación.
Tres prompts que vale la pena guardar. Pega la transcripción y luego agrega uno de estos.
Para una charla o una clase:
Resume esta transcripción en tres partes: la afirmación central en una frase, las tres pruebas más fuertes que se dan para sostenerla y cualquier cosa sobre la que el orador haya admitido no estar seguro. Cita la línea exacta de la transcripción para cada prueba. Si algo no está en la transcripción, dilo en lugar de rellenarlo.
Para un tutorial:
Convierte esta transcripción en una lista numerada de las acciones que realiza el presentador, en orden. Una línea por acción, en imperativo. Anota la marca de tiempo junto a cualquier paso donde advierta que algo puede salir mal.
Para una entrevista larga o un podcast:
Enumera cada tema distinto de esta transcripción con su marca de tiempo de inicio. Todavía no resumas. Después resume solo los tres temas con más tiempo de discusión.
Dos cosas hacen el trabajo, y deberías pegarlas en los tres. La primera es la instrucción de citar: un modelo obligado a producir líneas textuales queda clavado al texto fuente, y uno que no encuentra la línea tiene que decírtelo, lo que convierte el resumen en algo verificable en lugar de una simple afirmación. La segunda es el permiso explícito para decir "no está en la transcripción", que le quita la presión de inventar.
Dónde se rompe: subtítulos, duración y marcas de tiempo inventadas
Cinco modos de fallo, desde el que te frena en seco hasta los que corrompen la salida sin hacer ruido.
Sin pista de subtítulos. Algunos videos no tienen subtítulos en absoluto: música, ciertos videos en idiomas distintos del inglés, creadores que los desactivan y transmisiones que acaban de terminar. Sin subtítulos no hay transcripción, lo que significa que no hay texto, lo que significa que todos los métodos salvo la transcripción del audio nacen muertos.
Marcas de tiempo inventadas. Esta es la señal que vale la pena memorizar. El panel de transcripción de YouTube muestra marcas de tiempo, pero una copia simple a veces las pierde, y muchas herramientas de transcripción las eliminan. Si el texto que pegaste no tenía marcas de tiempo y el resumen está lleno de ellas, cada uno de esos números fue fabricado. Se van a ver correctos. Van a estar espaciados de forma plausible. No te van a llevar al momento descrito.
Duración. Una persona hablando a ritmo normal cubre unas 150 palabras por minuto, así que una charla de una hora ronda las 9,000 palabras y un podcast de tres horas se acerca a las 27,000. Las ventanas de contexto modernas se tragan eso, pero tragar no es lo mismo que atender. Liu y sus colegas (2024), en "Lost in the Middle" en Transactions of the ACL, encontraron que el desempeño del modelo es más alto cuando la información relevante está justo al principio o justo al final de una entrada larga, y cae de forma significativa cuando queda enterrada en el medio. Por eso el resumen de un video largo suele ser nítido sobre los primeros diez minutos y los últimos cinco, y vago sobre la hora que hay en medio. Un modelo más pequeño con una ventana más ajustada falla de otra manera: trunca y pierde el final por completo. Recorrimos los dos mecanismos en deterioro del contexto y recuperación en contextos largos. La jugada práctica es dividir la transcripción en bloques de dos a tres mil palabras, resumir cada uno y después resumir los resúmenes.
Errores de subtítulos. Los subtítulos automáticos destrozan nombres propios, términos técnicos y cifras. Un modelo al que le entregan "Lee Kwan you" o "diez a la menos nueve" no señala el destrozo; lo suaviza hasta convertirlo en lo más plausible que se le parezca. Los nombres y las cifras son justo lo que querrías citar después, así que revísalos contra el video, no contra el resumen.
Menciones de patrocinadores e introducciones. Las transcripciones incluyen el anuncio, la promoción del canal y la lista de mecenas. A menos que le digas al modelo que omita los segmentos que no son contenido, el resumen de un video patrocinado puede abrir con un párrafo muy seguro de sí mismo sobre un colchón.
La prueba de precisión de 30 segundos
No tienes que creerle a un resumen sin más. Dos comprobaciones, y la primera es la versión de treinta segundos.
La prueba de la cita va primero. Pide una frase textual del video que respalde la afirmación principal del resumen y luego busca en la transcripción una expresión distintiva de esa frase. Si la línea está ahí, el modelo estaba leyendo. Si no está, o si recibes una frase que suena exactamente como el video y no aparece por ningún lado en él, estás ante una reconstrucción, y todas las demás afirmaciones de ese resumen merecen la misma sospecha.
La pregunta trampa es la segunda comprobación, y es la más cruel. Pregunta por algo que no está en el video en absoluto. "¿Qué dijo el orador sobre Kubernetes?" en un video que nunca menciona Kubernetes. Un modelo fundamentado te dirá que no se habló de eso. Cualquier otra respuesta, y ya sabes exactamente qué hace esa herramienta cuando no sabe.
Haz las dos la primera vez que uses cualquier herramienta o flujo nuevo, y otra vez después de una actualización. Los valores por defecto cambian sin avisar, y un flujo que estaba fundamentado el mes pasado puede dejar de traer la transcripción sin decírtelo. Una vez que el resumen pasa la prueba, cómo resumir videos de YouTube cubre los prompts, los métodos manuales y el calendario de repaso que lo convierten en algo que recuerdas.
Por qué el resumen no es el aprendizaje
Incluso un resumen perfecto de un gran video hace casi nada por lo que vas a saber la semana que viene.
Leer un resumen se siente como aprender porque es fluido y no cuesta esfuerzo, y la fluidez es una señal famosamente mala de retención. Dunlosky y sus colegas (2013), al revisar diez técnicas de estudio comunes en Psychological Science in the Public Interest, califican resaltar y subrayar como de baja utilidad: "In most situations that have been examined and with most participants, highlighting does little to boost performance." Es decir: en la mayoría de las situaciones examinadas y con la mayoría de los participantes, resaltar hace poco por mejorar el desempeño. Las dos técnicas que se llevaron su calificación más alta fueron la práctica de evocación y la práctica distribuida. Leer de forma pasiva un resumen hecho por IA es más débil que cualquiera de ellas, porque la única parte donde entraba tu juicio, elegir qué importaba, ya ocurrió sin ti.
Lo que de verdad mueve la aguja toma unos dos minutos por encima del resumen:
- Resalta tres líneas de la transcripción, no treinta. Sí, el equipo de Dunlosky calificó el resaltado como de baja utilidad, y la razón es que la mayoría de la gente resalta todo. Un tope duro de tres lo da vuelta: no puedes marcar una línea sin descartar las otras, y ese descarte es el juicio que el resumen acaba de hacer por ti.
- Escribe una frase de memoria, antes de releer. Cierra el resumen. ¿Cuál era el argumento? Ese intento de evocación es lo que construye el recuerdo, y funciona incluso cuando te equivocas. La evocación activa explica por qué.
- Agrega la pregunta que el video no respondió. Eso te deja un hilo del que tirar la próxima vez y convierte una pila de resúmenes en una línea de indagación de verdad.
Este es el flujo alrededor del cual está construido el resaltador web de Glasp: resalta las líneas que importan en una transcripción o un artículo, guarda tu propia nota junto a ellas y vuelve a encontrar toda la colección meses después, en vez de desplazarte hacia atrás por un historial de chat. Como los resaltados en Glasp son públicos por defecto, también puedes ver qué líneas sacaron otras personas del mismo video en la comunidad, que es una forma rápida de descubrir qué te perdiste. Más sobre cómo hacer que todo esto se quede en cómo recordar lo que lees.
Preguntas frecuentes
¿Puede ChatGPT resumir un video de YouTube solo con el enlace?
No de forma confiable. Sin la transcripción trabaja a partir del título, la descripción y su propio conocimiento previo del tema, así que la respuesta describe el tema y no el video. Pega el texto de la transcripción y describirá el video.
¿Existe un plugin o una extensión de ChatGPT para YouTube?
OpenAI cerró la tienda de plugins original en abril de 2024. El nombre volvió en julio de 2026, cuando OpenAI renombró el App Directory como Plugin Directory, pero esos plugins empaquetan habilidades y apps conectadas, y ninguno se sienta contigo en la página de YouTube. Así que la respuesta funcional de ChatGPT para YouTube sigue siendo una extensión de navegador: toma la transcripción de la página y se la entrega a un modelo en un clic, que es lo que hace YouTube Summary de Glasp. También hay una comparación lado a lado de ese enfoque frente a ChatGPT a secas.
¿Se puede resumir un video de YouTube con ChatGPT gratis?
Sí. El panel "Mostrar transcripción" que YouTube trae de fábrica es gratuito, y el nivel gratuito de ChatGPT resumirá el texto que pegues. El único costo real es copiar y pegar, que una extensión elimina.
¿Cuál es el mejor prompt para resumir un video de YouTube?
Uno que especifique estructura y exija citas. Pide una afirmación central en una frase, los tres puntos de apoyo más fuertes con la línea exacta de la transcripción para cada uno, y permiso explícito para decir cuándo algo no está en la transcripción. El requisito de citar es lo que mantiene al modelo anclado a la fuente.
¿Puede ChatGPT resumir un video de YouTube sin subtítulos?
No directamente, porque no hay texto que pueda leer. Transcribe primero el audio con un modelo de voz a texto como Whisper y luego resume la transcripción que generaste.
¿Qué tan largo puede ser un video de YouTube para que ChatGPT lo resuma?
Las transcripciones largas caben en las ventanas de contexto actuales, pero la precisión decae en el medio de las entradas muy largas. Para cualquier cosa que pase de una hora, divide la transcripción en bloques de dos a tres mil palabras, resume cada bloque y luego resume esos resúmenes.
¿Es Gemini mejor que ChatGPT para YouTube?
Para el trabajo concreto de aceptar solo un enlace de YouTube, sí. Google documenta soporte nativo de URLs de YouTube en la API de Gemini, limitado a videos públicos, con el nivel gratuito de la API limitado a 8 horas de video al día. Para todo lo que viene después del resumen, la diferencia es menor de lo que sugiere el titular, porque ambos trabajan sobre todo a partir del audio y la transcripción.
¿ChatGPT Atlas todavía funciona?
No. Atlas cerró el 9 de agosto de 2026. OpenAI movió el trabajo agéntico basado en navegador a una extensión de ChatGPT para Chrome y al navegador integrado en la app de escritorio de ChatGPT.
Conclusión: fundamentar le gana a adivinar
Toda forma confiable de resumir un video de YouTube con ChatGPT es una variación de una sola idea: poner el texto real delante del modelo. Copia la transcripción, usa una extensión que la copie por ti, abre el panel de transcripción antes de preguntarle al asistente del navegador, o genera el texto tú mismo cuando no existan subtítulos. Todo lo que sale mal se remonta a la misma causa. Las marcas de tiempo inventadas, el ensayo muy seguro de sí mismo sobre un video que nunca vio, el nombre destrozado que ibas a citar: todo eso es un modelo al que le pidieron que informara sobre algo que nunca le mostraron.
Después haz la prueba de la cita una vez, porque cuesta treinta segundos y es lo único que se interpone entre tú y un resumen que suena correcto.
Y cuando el resumen sea bueno, no te detengas ahí. Saca tres líneas de la transcripción, escribe una frase de memoria y anota la pregunta que el video dejó abierta. YouTube Summary de Glasp te da la transcripción, las marcas de tiempo y el resaltado en un solo lugar, para que ese último paso tome dos minutos en vez de quedarse en eso que pensabas hacer y no hiciste. El resumen es el borrador. Nadie recuerda un borrador que no escribió.