AI

Chatear con un PDF: cómo hacerlo y qué se rompe

Subir un PDF y hacerle preguntas da la sensación de leer diez veces más rápido. Entre tu pregunta y la respuesta pasan cuatro cosas que nadie te enseña, y tres de ellas pueden devolverte una respuesta segura, bien citada y falsa.

13 min de lectura
Puntos clave
    • Muchas herramientas nunca leen tu PDF entero: la documentación de Anthropic sitúa una página de PDF en 1.500 a 3.000 tokens de texto extraído, con las imágenes de página facturadas aparte, así que un libro de 300 páginas asciende a cientos de miles de tokens. Muchas herramientas recuperan unos pocos fragmentos y responden a partir de ellos.
  • Analizar un PDF no es un problema resuelto: en PureDocBench, un benchmark de 2026 con 40 parsers y modelos de visión, el mejor sistema apenas sacó unos 74 sobre 100. Tu archivo se destroza antes de que el modelo lea una sola palabra.
  • Estar anclado al documento no es lo mismo que acertar: investigadores de Stanford probaron una IA jurídica creada expresamente para responder desde documentos y descubrieron que aun así alucinaba entre el 17% y el 33% de las veces, y que dos de las tres herramientas respondían con precisión en menos de la mitad de las consultas.
  • La posición dentro del documento importa: en el benchmark NoLiMa, 11 modelos cayeron por debajo de la mitad de su propia puntuación con contexto corto al llegar a 32K tokens, y hasta una de las dos excepciones más sólidas, GPT-4o, bajó del 99,3% al 69,7%.
  • Hazle preguntas que pueda responder de verdad: las de localización y definición son fiables. Contar, comparar entre capítulos y "qué omitió el autor" son el terreno donde el chat con PDF se inventa cosas sin avisar.

La respuesta corta

Para chatear con un PDF, ábrelo en una herramienta capaz de leerlo (una extensión de navegador, Gemini Notebook, ChatGPT, Claude, Acrobat Studio o una app específica de chat con PDF) y pregúntale en lenguaje corriente. La mayoría de las herramientas convierten el documento en texto, buscan los pasajes que parecen relevantes para tu pregunta y le piden a un modelo de lenguaje que responda usando solo esos pasajes.

Esa última parte lo explica todo. No estás hablando con algo que leyó tu PDF. Estás hablando con algo que leyó unos pocos párrafos, elegidos por un paso de búsqueda que tú nunca ves. Todo lo útil del chat con PDF, y todo lo peligroso, se deriva de ahí.

La regla práctica: úsalo para encontrar y aclarar, no para contar ni para concluir. Y revisa la página que cita antes de citarla tú.


Qué ocurre en realidad cuando "chateas" con un PDF

Entre tu pregunta y la respuesta pasan cuatro cosas, y cada una puede torcerse por su cuenta.

Análisis (parsing). El PDF se convierte en texto. Un PDF es un formato de impresión, no un formato de texto, así que esto es genuinamente difícil. El archivo no guarda ningún orden de lectura garantizado, las tablas suelen ser solo líneas y caracteres sueltos, y una página escaneada es una fotografía sin nada de texto dentro.

Troceado (chunking). El texto extraído se corta en pedazos, normalmente de unos cientos de palabras cada uno, y se convierte en vectores para poder buscarlos por significado y no por palabra clave.

Recuperación (retrieval). Tu pregunta también se convierte en un vector, y el sistema devuelve el puñado de fragmentos que quedan más cerca de ella. Este es el paso del que la gente se olvida. Al modelo no se le entrega tu documento. Se le entrega un montoncito de extractos.

Generación. El modelo redacta una respuesta usando esos extractos y, en las buenas herramientas, adjunta una cita que apunta de vuelta a ellos.

Algunas herramientas se saltan la recuperación y meten el documento entero en la ventana de contexto del modelo. Eso cambia un modo de fallo por otro, y da para un tema entero. Cubrimos el lado de ingeniería de esa disyuntiva en context rot y el debate entre RAG y contexto largo. Para alguien que tiene un PDF abierto, lo que importa es saber cuál de los dos está usando, porque se rompen de formas distintas.


Fallo uno: el archivo se rompe antes de que el modelo lo lea

Pregúntale a una herramienta de chat con PDF por qué leyó mal una tabla y recibirás una disculpa, no una explicación. La explicación suele ser que la tabla nunca sobrevivió a la extracción.

En mayo de 2026, un grupo de investigación publicó PureDocBench, un benchmark construido para evaluar con honestidad el análisis de documentos. Probaron 40 modelos entre parsers en pipeline, especialistas de extremo a extremo y modelos generales de visión y lenguaje, sobre 10 dominios y 1.475 páginas renderizadas en versiones limpias, degradadas digitalmente y degradadas de forma real. Su titular: analizar documentos está lejos de ser un problema resuelto. El mejor modelo sacó unos 74 sobre 100, con 44,6 puntos de diferencia entre el más fuerte y el más débil.

El mismo equipo auditó OmniDocBench, el benchmark que el campo venía usando, y encontró 2.580 errores en 21.353 bloques evaluados, un 12,08%. La vara de medir estaba torcida.

Hay dos hallazgos que importan a cualquiera que chatee con un documento real:

  • Las fórmulas son el cuello de botella compartido. Promediando las tres pistas del benchmark, ningún modelo superó el 67% en reconocimiento de fórmulas. Si estás chateando con un artículo de física o un manual de finanzas, las ecuaciones son la parte menos fiable de la respuesta.
  • La degradación da la vuelta a la clasificación. Los modelos generales de visión y lenguaje perdieron 0,99 y 8,52 puntos con degradación digital y real. Los parsers en pipeline perdieron 4,90 y 14,21, suficiente para invertir el ranking por completo. Una herramienta que gana con páginas limpias puede hundirse en cuanto baja la calidad de la página.

Por eso la misma pregunta da una respuesta impecable sobre un informe nacido en digital y una respuesta rarísima sobre un capítulo fotocopiado. Los artículos académicos a varias columnas se leen cruzando las columnas en horizontal en lugar de recorrerlas hacia abajo. Las notas al pie caen en mitad de una frase. El encabezado se repite en cada página y contamina la recuperación. Nada de esto lo ves tú, porque la herramienta te enseña su respuesta, no su transcripción.

Si tu fuente es un escaneo o un artículo denso a dos columnas, trata cada cifra extraída como no verificada hasta que mires la página. La señal habitual es un número que no acaba de encajar con la frase que lo rodea.


Fallo dos: la recuperación solo encuentra aquello por lo que ya preguntaste

Esta es la aritmética que todo el mundo se salta. La documentación de Anthropic explica que Claude convierte cada página del PDF en una imagen y extrae su texto, y que solo el texto extraído cuesta normalmente 1.500 a 3.000 tokens por página, con las imágenes de página cobradas aparte. Un libro de 300 páginas son, por tanto, entre 450.000 y 900.000 tokens de texto antes de contar una sola imagen.

Existen ventanas de contexto así de grandes, pero llenarlas es lento y caro, así que muchas herramientas de consumo prefieren recuperar fragmentos. Y la recuperación tiene un punto ciego muy concreto: encuentra fragmentos que se parecen a tu pregunta. Las preguntas cuya respuesta no está concentrada en ningún pasaje no tienen fragmentos que encontrar.

Eso rompe una categoría de preguntas perfectamente predecible:

  • "¿Cuántas veces menciona el autor X?" No hay ningún fragmento que contenga el recuento.
  • "¿Qué diferencia de tono hay entre el capítulo 2 y el capítulo 9?" La respuesta vive en dos sitios a la vez.
  • "¿Qué deja fuera este informe?" La ausencia no tiene vector.

Pregunta cualquiera de esas cosas y una buena herramienta te dirá que no puede saberlo. Una herramienta corriente responde igual, con lo que le haya tocado recuperar, y la respuesta se lee exactamente igual que las fiables.

Las herramientas de contexto largo fallan de otra forma, pero con la misma constancia. En el benchmark NoLiMa, presentado en ICML 2025, Modarressi y sus colegas redujeron al mínimo el solapamiento literal de palabras que vuelve fáciles las pruebas clásicas de aguja en un pajar. Con 32K tokens, 11 de los modelos evaluados cayeron por debajo del 50% de su propia línea base con contexto corto. GPT-4o fue una de las dos excepciones que mejor aguantaron, y aun así bajó del 99,3% al 69,7%. Nelson Liu y sus coautores ya habían mostrado esa misma forma en TACL: la curva en U que hoy se conoce como "lost in the middle" ("perdido en el medio"). Los modelos rinden mejor con la información situada al principio y al final de una entrada larga, y peor con la del centro. Si el dato que necesitas está en la página 140 de 300, ese es el peor sitio posible.


Fallo tres: estar anclado no significa acertar

La promesa más seductora de esta categoría es que anclar el modelo a tu documento elimina las alucinaciones. No las elimina, y ya existe una medición cuidadosa de cuánto ayuda en realidad.

Varun Magesh, Faiz Surani, Matthew Dahl, Mirac Suzgun, Christopher Manning y Daniel Ho llevaron a cabo la primera evaluación prerregistrada de herramientas de investigación jurídica con IA, publicada en el Journal of Empirical Legal Studies en 2025. Probaron productos de LexisNexis y Thomson Reuters construidos específicamente para responder desde un corpus jurídico curado, con un conjunto fijo de 202 consultas. No son chatbots adivinando de memoria. Son sistemas de recuperación sobre documentos revisados, vendidos con la promesa de ser "hallucination-free" ("sin alucinaciones").

Los resultados:

SistemaRespondió con precisiónAlucinó
Lexis+ AI65%17%
Westlaw AI-Assisted Research41%33%
Ask Practical Law AI19%17%
GPT-4, sin anclaje, como comparaciónSin cifra en el texto, solo en el gráfico43%

Ask Practical Law AI devolvió una respuesta incompleta, es decir, una negativa o algo sin anclaje, en el 62% de las consultas. Los autores lo atribuyen a su conjunto documental más estrecho y no a la prudencia: solo se nutre de artículos de práctica jurídica, no de sentencias, leyes ni reglamentos. (La introducción del artículo redondea la precisión de Westlaw al 42%; el 41% de arriba sale de su propio desglose de los tres sistemas.)

Lee esa tabla dos veces, porque dice dos cosas distintas. El anclaje funcionó contra la alucinación: los tres sistemas anclados a documentos redujeron el 43% de GPT-4 a un 17%, un 17% y un 33%. Pero no hizo nada por la fiabilidad. Dos de esos tres respondieron con precisión en menos de la mitad de las consultas, y por motivos distintos. El déficit de Westlaw fue sobre todo alucinación, un 33% frente a un 25% de respuestas incompletas. El de Ask Practical Law AI fue casi todo prudencia, un 62% de incompletas frente a un 17% de alucinadas. El resumen de los propios autores es que las promesas de los proveedores están infladas y que las alucinaciones siguen siendo "substantial" ("sustanciales").

Ahora traslada eso a tu situación. Esos sistemas recuperan de una base jurídica curada por profesionales y correctamente analizada, construida por empresas con incentivos enormes para acertar. Tu herramienta recupera de un PDF que un parser adivinó como pudo esta mañana. No hay motivo para esperar un resultado mejor, y la cita que acompaña a la respuesta se verá igual de solvente en un caso y en el otro.


Las preguntas que el chat con PDF responde bien de verdad

Casi toda la decepción con estas herramientas viene de hacer preguntas con la forma equivocada. Ajusta la pregunta al mecanismo y la tecnología es realmente excelente.

Tipo de preguntaEjemploFiabilidadPor qué
Localizar"¿Dónde define ella la reflexividad?"AltaLa recuperación es literalmente un buscador, y esto es una búsqueda
Definir o explicar"Explica el tercer supuesto en lenguaje llano"AltaEl pasaje está presente; el modelo parafrasea, no razona a lo largo del archivo
Extraer de un solo sitio"¿Qué tamaño de muestra usó el estudio 2?"Media a altaFiable si el análisis del texto salió limpio; revisa tablas y fórmulas
Traducir o simplificar"Reformula este párrafo para alguien que no es especialista"AltaTrabajo puramente local sobre un texto que tienes a la vista
Comparar entre secciones"¿Cómo revisa el capítulo 7 lo planteado en el capítulo 3?"BajaLa respuesta no está en ningún fragmento concreto
Contar o agregar"¿Con qué frecuencia se usa 'agencia'?"Muy bajaNingún fragmento contiene el total; los modelos estiman y suenan seguros
Detectar ausencias"¿Qué no llega a abordar el artículo?"Muy bajaNo puedes recuperar algo que no está escrito
Juzgar la calidad"¿Es sólida esta metodología?"BajaExige el documento entero más conocimiento externo

Acierta con esa distinción y la mitad del problema desaparece. Usa el chat con PDF como un ayudante de investigación rapidísimo y muy leído que sabe encontrar cosas. No lo uses como a alguien que se terminó el libro.


Las mejores herramientas de chat con PDF, y la única función que importa

Olvida las listas de funciones por un momento. Lo que separa a una herramienta de chat con PDF útil de una peligrosa es si te dice exactamente de dónde salió cada respuesta para que puedas comprobarla. Un clic es la mejor versión de eso. Un número de página que tienes que buscar tú es la versión aceptable. No ofrecer ninguna de las dos debería descalificar a una herramienta sin más.

HerramientaCómo trata el archivo¿Puedes volver a la fuente con un clic?Detalle verificado que conviene saber
GlaspEnvía el texto completo del documento, etiquetado con sus límites de página, en lugar de recuperar fragmentosSin clic. Imprime la página, como "(p. 3)", y tú vas a buscarlaNo hay paso de recuperación, así que el problema del fragmento ausente no aplica, aunque a cambio hereda el problema del contexto largo; el plan gratuito permite 20 mensajes de chat al mes, y los subrayados que hagas en ese PDF se guardan aparte en tu biblioteca, no se envían al chat
Gemini Notebook (antes NotebookLM)Indexa cada fuente que añades a un cuadernoSí, las citas en línea saltan al pasaje que respalda la respuesta en la fuenteEl plan gratuito limita las fuentes por cuaderno, así que planifica qué metes
ChatGPTSube el archivo dentro de la conversaciónNo está documentado a nivel de página, así que verifica a mano512 MB por archivo, y los archivos de texto están limitados a 2M de tokens cada uno
ClaudeConvierte cada página en una imagen y extrae el texto de la páginaCitas de texto sí, citas de imagen no, y los escaneos sin texto extraíble "are not citable" ("no se pueden citar")1.500 a 3.000 tokens de texto por página más los tokens de imagen; 100 páginas por solicitud, o 600 con una ventana de contexto de 1M de tokens
Acrobat StudioTrabaja sobre los PDF que ya están en tu biblioteca de AcrobatSí, citas numeradas que llevan de vuelta a la fuenteAI Assistant viene incluido en Studio y se vende como complemento aparte en los demás planes de Acrobat
ChatPDFSube e indexa un documento cada vezCita la páginaEl plan gratuito analiza 2 documentos al día, y alterna entre GPT-4o y GPT-4o-mini

Algunas notas para elegir. Si tus PDF viven en la web abierta, una herramienta que funciona en el navegador te ahorra el paso de subirlos por completo, que es el caso del chat con PDF de Glasp y parte de por qué encaja con un subrayador de PDF en vez de sustituirlo. Si estás sintetizando muchos documentos a la vez, gana una herramienta con forma de cuaderno. Si tu corpus es confidencial, comprueba antes que nada dónde se procesa el archivo, porque ninguna de las preguntas sobre precisión importa si el documento no debería haber salido de tu máquina.

Comparamos la parte de anotación en los mejores subrayadores de PDF en 2026.


Una rutina de verificación de 30 segundos

No necesitas auditar cada respuesta. Necesitas un hábito que no cueste casi nada y que atrape los errores capaces de dejarte en ridículo.

  1. Haz clic en la cita. No para leerla por encima, sino para confirmar que la frase que el modelo le atribuyó existe de verdad. Este único paso caza la mayoría de las invenciones, y las herramientas que lo ponen difícil deberían perder tu confianza.
  2. Contrasta el número de página con la página. Los parsers desalinean los límites de página constantemente, sobre todo en escaneos. Una cita a la página 46 que en realidad está en la 44 es señal de que toda la extracción se desplazó.
  3. Vuelve a preguntar con una premisa deliberadamente falsa. "¿Dónde sostiene el autor que el efecto desapareció después de 2015?" Si la herramienta te da la razón sobre algo que te acabas de inventar, no está leyendo tu documento con la atención suficiente para contradecirte, y también deberías desconfiar de la respuesta anterior.
  4. Ante cualquier cifra, mira la tabla original. Las tablas son el eslabón más débil de la extracción, y los números son justo lo que más probabilidades tienes de repetir en voz alta.

El paso 3 es el que la gente se salta y el que más revela, porque pone a prueba la maquinaria en lugar de la respuesta. Una herramienta que te da la razón sobre algo que inventaste no está consultando tu documento. Está escribiendo prosa plausible con la voz de tu documento.

Una matización justa sobre ese truco: en el estudio de Stanford, la precisión fue la más alta precisamente en las preguntas de premisa falsa, en todos los sistemas evaluados, y Lexis+ AI, Westlaw e incluso GPT-4 a secas corregían a menudo la premisa equivocada sin rodeos. Parte de eso viene de la propia rúbrica del estudio, que puntuaba como correcto un "no encuentro ninguna autoridad para esto". El chat con PDF de consumo no está construido para ninguno de esos dos estándares. La versión general de este hábito, para salidas de IA que no son un PDF, está en la comprobación de alucinaciones en 60 segundos.


Primero subraya, después chatea

El chat con PDF tiene un segundo coste que no tiene nada que ver con la precisión. Puedes obtener una respuesta perfecta y no retener nada.

Cuando la herramienta busca, selecciona y condensa, ha hecho todo el trabajo que habría fijado el material en tu memoria. Esto no es un argumento contra la herramienta. Es un argumento sobre el orden.

La secuencia que funciona:

  • Lee y subraya antes de preguntar nada. Elegir qué importa es el paso cognitivo caro, y es el que merece la pena conservar. Además te deja un mapa del documento con el que contrastar las respuestas.
  • Después chatea, para atacar los huecos. Hazle a la herramienta las preguntas que te dejaron tus subrayados: qué significa un término, dónde se defiende una afirmación, si existe alguna salvedad.
  • Escribe la respuesta con tus propias palabras junto al subrayado. Una respuesta de IA copiada se degrada hasta convertirse en algo que guardaste. Una reformulada es algo que aprendiste.
  • Quédate con los subrayados, no con el chat. Las conversaciones son desechables. Los pasajes que elegiste son el artefacto duradero, y siguen siendo buscables mucho después de que la sesión desaparezca.

Ese es el flujo alrededor del cual está construido el subrayador web de Glasp: subraya el PDF o el artículo, guarda los pasajes en un solo sitio y luego chatea con tus subrayados sobre todo lo que has leído, en vez de archivo por archivo. Nuestra metodología de anotación de PDF profundiza en la parte del subrayado.


Preguntas frecuentes

¿Puede ChatGPT leer un PDF?

Sí. Puedes subir un PDF directamente a una conversación, con un límite de 512 MB por archivo y un tope de 2M de tokens para archivos de texto y documentos, según la propia documentación de OpenAI. Lo que no puede hacer de forma fiable es garantizar que cada afirmación corresponde a una página concreta, así que verifica cualquier cosa que pienses citar. Los PDF escaneados y las tablas pesadas son donde los resultados se vuelven menos predecibles.

¿Cómo puedo chatear con un PDF gratis?

Hay varias opciones. Gemini Notebook tiene un plan gratuito con un tope de fuentes por cuaderno, el plan gratuito de ChatPDF analiza dos documentos al día, y las herramientas que funcionan en el navegador te dejan chatear con PDF ya abiertos en la web sin subir nada. Los planes gratuitos suelen limitar el número de documentos, de páginas o de preguntas diarias, y no la calidad de la respuesta.

¿Por qué la IA cita la página equivocada en un PDF?

Porque los números de página que tú ves y los límites de página que produjo el parser son dos cosas distintas. Un PDF guarda maquetación, no estructura, así que la extracción puede fusionar o partir páginas, sobre todo en escaneos, y las páginas preliminares numeradas con romanos corren la numeración varias páginas. Si una cita está desviada una cantidad constante, da por hecho que todas lo están.

¿Puede la IA leer un PDF escaneado?

A veces, y peor que con un archivo nacido en digital. Un escaneo no tiene capa de texto, así que necesita OCR o un modelo de visión que lea la página como imagen. Anthropic lo dice sin rodeos: los PDF que son escaneos sin texto extraíble "are not citable" ("no se pueden citar") para Claude. En la pista de degradación real de PureDocBench, los parsers en pipeline perdieron 14,21 puntos mientras que los modelos generales de visión y lenguaje perdieron 8,52, lo que invirtió la clasificación entre ambos tipos de herramienta. Prueba tu escaneo concreto con un pasaje que ya conozcas antes de fiarte de nada más de lo que diga.

¿Es seguro subir un PDF a una IA?

Eso depende por completo del proveedor, y es la pregunta que hay que resolver antes que cualquiera de las de precisión. Comprueba tres cosas en los términos: si tus archivos subidos se usan para entrenar modelos, cuánto tiempo se conservan y si el plan gratuito recibe un trato distinto al de pago, porque a menudo lo recibe. Para cualquier cosa bajo un acuerdo de confidencialidad, secreto profesional o investigación sin publicar, la opción segura por defecto es una herramienta que nunca envíe el documento fuera de tu máquina, o una cuenta con una política documentada de no entrenamiento.

¿Chatear con un PDF es una buena forma de estudiar?

Te ayuda a encontrar cosas, y eso es real. Lo que no hace es el trabajo de codificación. Si la herramienta selecciona y condensa en tu lugar, has subcontratado justo la parte de la lectura que construye memoria. Subraya primero, luego usa el chat para cerrar huecos concretos, y escribe las respuestas con tus propias palabras en vez de pegarlas.


Conclusión

El chat con PDF es una de las pocas funciones de IA que se gana claramente su sitio. Convierte un documento de 300 páginas en algo que puedes interrogar en segundos y, para encontrar, definir y aclarar, es excelente.

También es una cadena con tres puntos de fallo sin señalizar. El parser destroza el archivo, la recuperación le entrega al modelo unos extractos en lugar de tu documento, y el modelo escribe prosa fluida sobre lo que le haya llegado. El resultado de Stanford es el que conviene recordar: sistemas creados a propósito y anclados profesionalmente seguían alucinando entre el 17% y el 33% de las veces, y dos de los tres acertaban en menos de la mitad de lo que se les preguntaba. La fluidez y una cita no son pruebas.

Así que úsalo bien. Pídele que localice, no que concluya. Haz clic en una cita antes de citar nada. Y subraya tú mismo el documento primero, porque los pasajes que elijas son lo que seguirás teniendo el mes que viene, cuando la conversación ya no exista.

¿Listo para probarlo con algo que estés leyendo de verdad? Abre un PDF con el chat con PDF de Glasp, subraya lo que importa y haz tus preguntas con la fuente justo al lado de la respuesta.

Start building your knowledge library

Highlight what matters as you read across the web. Save insights from articles, books, and YouTube videos in one place.

Get Started Free

Or highlight this page as you read it