AI

Ingeniería de contexto: qué es y sus 4 fallos

La era del prompt ingenioso terminó. Lo que separa hoy una buena salida de IA de una mediocre vive aguas arriba del prompt mismo.

21 min de lectura
Puntos clave
    • Una definición en una línea: la ingeniería de contexto es la práctica de decidir qué información ve un modelo de IA antes de responder. La versión de Anthropic es más ceñida: curar "the smallest possible set of high-signal tokens that maximize the likelihood of some desired outcome", el conjunto más pequeño posible de tokens de alta señal que maximiza la probabilidad de un resultado deseado.
  • El nombre cambió a propósito: en junio de 2025, Tobi Lütke y Andrej Karpathy popularizaron el término. Gartner publicó "Context engineering is in, and prompt engineering is out" (la ingeniería de contexto entra y la de prompts sale) al mes siguiente. El oficio pasó de escribir mejores frases a ensamblar mejores entradas.
  • Las ventanas de contexto más grandes empeoraron esto: Liu et al. (2024) mostraron que la información situada en mitad de un contexto largo se ignora. El estudio "Context Rot" de Chroma (2025) encontró que los 18 modelos de frontera se degradan mucho antes de que la ventana se llene. Databricks situó el inicio cerca de los 32.000 tokens.
  • La contaminación de contexto tiene cuatro formas con nombre: la taxonomía de Drew Breunig (envenenamiento, distracción, confusión y choque) es el diagnóstico práctico. Cada una tiene un arreglo distinto, y añadir más contexto empeora tres de ellas.
  • La curación es la nueva alfabetización: pegar un PDF de 200 páginas no es ingeniería de contexto. Alimentar los 40 pasajes subrayados que de verdad importan, sí. Aquí es donde tu historial de lectura se convierte en infraestructura.

Qué es la ingeniería de contexto

La ingeniería de contexto es la práctica de decidir, ensamblar y entregar todo lo que un modelo de IA necesita para hacer bien una tarea, antes de que el modelo se ejecute. Abarca el prompt del sistema, los documentos que adjuntas, lo que el modelo recuerda sobre ti, qué herramientas puede invocar y lo que ya hay en la conversación. La ingeniería de prompts afina una frase. La ingeniería de contexto afina toda la pila de entrada.

La definición de Anthropic es la más ceñida que circula: "the set of strategies for curating and maintaining the optimal set of tokens (information) during LLM inference", el conjunto de estrategias para curar y mantener el conjunto óptimo de tokens (información) durante la inferencia del LLM. Vale la pena memorizar el principio rector que dan, porque funciona además como prueba de si lo estás haciendo bien: encontrar "the smallest possible set of high-signal tokens that maximize the likelihood of some desired outcome", el conjunto más pequeño posible de tokens de alta señal que maximiza la probabilidad de un resultado deseado. (Anthropic, 2025)

Piénsalo como informar a un consultor nuevo. Un mal informe es un correo de una línea. Un buen informe incluye los antecedentes de la empresa, el historial relevante, los archivos que va a necesitar, quiénes son las partes interesadas, cómo se ve el éxito y qué queda fuera del alcance. Si contratas a un consultor brillante y le das un mal informe, obtienes un entregable mediocre. Con la IA pasa exactamente lo mismo.

Fíjate en lo que no aparece en la definición: la astucia. No hay una formulación mágica ni una palabra secreta que te consiga un modelo mejor. El trabajo se parece más a editar que a lanzar un conjuro. Estás decidiendo qué entra en la sala antes de que empiece la conversación y, con la misma importancia, qué no.


El tuit que le puso nombre

El 19 de junio de 2025, Tobi Lütke, CEO de Shopify, publicó en X que prefería el término "context engineering" (ingeniería de contexto) frente a "prompt engineering" (ingeniería de prompts). Lo describió como "the art of providing all the context for the task to be plausibly solvable by the LLM": el arte de proporcionar todo el contexto para que la tarea sea plausiblemente resoluble por el LLM. Seis días después, Andrej Karpathy, una de las voces más respetadas de la IA, amplificó el término. Su definición fue más afilada: "context engineering is the delicate art and science of filling the context window with just the right information for the next step", el delicado arte y ciencia de llenar la ventana de contexto con la información justa para el paso siguiente. (Karpathy, 2025)

La expresión en sí no era nueva. Walden Yan, de Cognition, el equipo detrás del agente autónomo de programación Devin, había publicado "Don't Build Multi-Agents" una semana antes, el 12 de junio, y llamaba a la ingeniería de contexto "effectively the #1 job of engineers building AI agents", en la práctica el trabajo número uno de los ingenieros que construyen agentes de IA. Pero fueron las publicaciones de Lütke y Karpathy las que llevaron la etiqueta al gran público. Al mes siguiente, Gartner publicó un informe titulado "Lead the Shift to Context Engineering as Prompt Engineering Fades", con una línea de resumen contundente: "Context engineering is in, and prompt engineering is out", la ingeniería de contexto entra y la de prompts sale. La previsión que lo acompañaba: para 2028, las funciones de ingeniería de contexto estarán integradas en el 80 por ciento de las herramientas de software que se usan para construir aplicaciones de IA, y mejorarán la precisión de la IA agéntica al menos un 30 por ciento. (Gartner, 2025)

Lo que ocurrió no fue un cambio de marca. Fue una corrección. La comunidad de IA admitió en voz baja que la habilidad llamada "ingeniería de prompts" siempre había sido un subconjunto de algo más grande, y que ese subconjunto ya no era la parte interesante. Un prompt es un componente. El contexto es toda la sala.

Esto importa porque los trabajadores del conocimiento han pasado dos años aprendiendo la habilidad equivocada. Memorizaron plantillas de prompts. Coleccionaron hilos de Twitter con el "prompt definitivo". Trataron el prompt como un hechizo. Ese esfuerzo no es inútil, pero ya no basta. La pregunta no es cómo formulas tu petición. La pregunta es qué pones al lado de tu petición.


¿Está muerta de verdad la ingeniería de prompts?

Respuesta corta: el puesto de trabajo murió, las técnicas no.

Es tentador tratar esto como un cambio generacional en el que todo lo viejo está equivocado. Es un encuadre perezoso. La cadena de pensamiento, los ejemplos few-shot, la asignación de rol y los formatos de salida explícitos siguen moviendo la aguja, y siguen apareciendo dentro de contextos bien diseñados.

Lo que cambió es el techo. En 2023, un prompt bien formulado podía duplicar la calidad de una respuesta porque los modelos subyacentes se confundían con facilidad ante la ambigüedad. Podías convertir a GPT-3.5 de becario torpe en analista coherente con la estructura de frase adecuada. Esa brecha era real, y la ingeniería de prompts la explotaba.

Los modelos de frontera de 2026 no necesitan que los lleves de la mano. Claude Opus 5, GPT-5.6 y Gemini 3.1 Pro manejan razonablemente bien las peticiones ambiguas. El retorno marginal del fraseo ha caído. Pero el retorno marginal de aportar material fuente relevante, memoria acotada y ejemplos curados ha subido con fuerza. La palanca se movió de sitio.

Aquí está la comparación, expuesta.

DimensiónIngeniería de promptsIngeniería de contexto
Qué ajustasLa redacción de tu peticiónToda la pila de entrada que recibe el modelo
Unidad principalUna fraseUn paquete: prompt del sistema, documentos, memoria, herramientas, historial
Para quién esCualquiera que use una caja de chatCualquiera cuya calidad de salida dependa de la IA
Habilidad requeridaBuena escritura, reconocimiento de patronesCuración, arquitectura de la información, criterio
Cuándo fallaEl modelo malinterpreta la instrucciónEl modelo entiende bien, pero le faltan los hechos, los ejemplos o el historial para responder bien
Arreglo cuando te atascasReformular, añadir ejemplos, especificar el formato de salidaAñadir la fuente correcta, recortar las incorrectas, ajustar la memoria, acotar la recuperación
Época de apogeoDe 2022 a 2024De 2025 en adelante

Fíjate en la última fila. La ingeniería de prompts no murió porque estuviera equivocada. Murió porque el cuello de botella se movió a otra parte.


¿También está muerta la ingeniería de contexto?

Respuesta corta: la etiqueta se está apagando, la práctica no.

La reacción en contra es tan real que ya tiene género propio. Joe Reis publicó "Gartner Declares 2026 The Year of Context™" en marzo de 2026, donde se burla del ingeniero de contexto como una mezcla de "data engineer, ontologist, librarian, corporate anthropologist, and therapist" (ingeniero de datos, ontólogo, bibliotecario, antropólogo corporativo y terapeuta) cuyo trabajo real consiste en "updating a YAML file", actualizar un archivo YAML. Si quitas los chistes, quedan tres objeciones en pie, y dos de ellas contienen algo cierto.

"Los modelos lo absorberán." La afirmación es que los entornos de ejecución de agentes ya gestionan la compactación, la recuperación y la memoria de forma automática, así que el humano ya no tiene que pensar en el contexto. Aquí hay sustancia real. La compactación automática y la recuperación justo a tiempo eliminaron de verdad una categoría de trabajo manual. Pero la automatización movió el trabajo en lugar de borrarlo. Alguien sigue decidiendo qué va en el archivo de memoria, qué fuentes puede tocar el recuperador y qué se le dice al agente que ignore. Se automatizó la fontanería. El criterio no.

"Siempre fue una palabra de moda para decir buenas entradas." En parte es justo. Curar las entradas no es una idea nueva, y el término se estiró hasta cubrir casi cualquier cosa de la mano de proveedores que vendían productos de contexto. Pero ponerle nombre a algo cambia lo en serio que se lo toma la gente. Nadie auditaba sus entradas de IA de forma sistemática en 2023. Muchos equipos lo hacen ahora, y lo hacen porque el nombre le dio forma a la práctica.

"El deterioro del contexto significa que no puedes salir de esto a base de ingeniería." Esta está al revés. Que los modelos se degraden a medida que crece la entrada es el argumento a favor del trabajo deliberado sobre el contexto, no en contra. Si más contexto fuera siempre mejor, la curación no tendría sentido y podrías volcarlo todo.

La lectura honesta a mediados de 2026: la expresión ya pasó su pico de exageración, y el cargo de "context engineer" como tal es emergente más que estándar. Adobe publica ofertas con ese nombre exacto, pero en la mayoría de las empresas el trabajo vive dentro de puestos ya existentes de ingeniería de IA, de datos o de plataforma. La práctica que hay debajo está más asentada que nunca. Espera que la etiqueta pase a un segundo plano, igual que le pasó al "diseño responsive", absorbida por la definición por defecto de un trabajo competente.


Las seis capas del contexto

Para hacer ingeniería de contexto de forma deliberada, tienes que saber qué estás diseñando. Toda interacción moderna con IA tira de seis capas, pienses en ellas o no. La habilidad está en saber cuáles ajustar.

CapaPropósitoEjemplo
Prompt del sistemaDefine quién es el modelo, qué reglas sigue y qué tono adoptaUn archivo claude.md en tu repositorio, el .cursorrules de Cursor o una instrucción de GPT personalizado como "Eres un editor sénior. Prefiere la voz activa. No uses nunca guiones largos."
Memoria persistenteCosas que el modelo recuerda sobre ti entre conversacionesLa función de memoria de ChatGPT guardando tu profesión, tu estilo de escritura y tus proyectos en curso
Recuperación (RAG)Extrae fragmentos relevantes de una base de conocimiento mayor cuando hacen faltaPreguntarle a tu IA "¿qué subrayé sobre efectos de red el mes pasado?" y que recupere los pasajes exactos
Uso de herramientasPermite al modelo actuar u obtener datos en vivoEl modelo llama a una calculadora, ejecuta código, busca en la web o consulta tu calendario
AdjuntosArchivos, imágenes o URL cargados en esta sesión concretaUn contrato en PDF que sueltas para que lo revise, o una captura que pegas para depurar
Historial de conversaciónLo que ya se ha dicho en este hiloEl ida y vuelta que hay por encima de tu mensaje actual, incluidas correcciones y preferencias anteriores

Un contexto bien diseñado usa las seis de forma deliberada. Un contexto mal diseñado vuelca todo en una sola capa (normalmente los adjuntos, a menudo el historial de conversación) y confía en que el modelo lo ordene.

El error que cometen la mayoría de los trabajadores del conocimiento es tratar la IA como una interfaz de chat cuando en realidad es un ensamblador de contexto. Casi todo lo que determina la respuesta ya ha ocurrido para cuando empiezas a escribir.

Para un ángulo relacionado sobre cómo la arquitectura de información personal moldea la utilidad de la IA, consulta la gestión del contexto personal.


Por qué las ventanas de contexto más grandes empeoraron esto, no lo mejoraron

En 2023, una ventana de contexto de 100K tokens era exótica. Para 2026, un millón de tokens es la referencia normal: alrededor de 1.050.000 en GPT-5.6, 1.048.576 en Gemini 3.6 Flash y 1.000.000 en Claude Opus 5. Llama 4 Scout anuncia 10 millones. Puedes soltar el texto completo de Guerra y paz en un solo prompt y varias veces. Así que la suposición natural es que la ingeniería de contexto se está volviendo más fácil. Más espacio, menos triaje, ¿verdad?

Falso. Se volvió más difícil.

El artículo fundacional aquí es Liu et al. (2024), "Lost in the Middle: How Language Models Use Long Contexts", publicado en TACL. Los investigadores comprobaron si los modelos podían encontrar y usar información concreta según el lugar en el que estuviera colocada dentro de un contexto largo. El hallazgo fue incómodo: el rendimiento tiene forma de U. Los modelos prestan la máxima atención a la información del principio y del final del contexto. La del medio queda sistemáticamente infravalorada, y a veces se ignora del todo. (Liu et al., 2024)

Pon una instrucción crítica en mitad de un documento de 50 páginas y el modelo puede actuar como si nunca la hubiera visto. Ese no es un fallo del que puedas salir a base de prompts.

Después, en julio de 2025, Chroma publicó "Context Rot: How Increasing Input Tokens Impacts LLM Performance", de Kelly Hong, Anton Troynikov y Jeff Huber. Probaron 18 modelos de frontera, entre ellos GPT-4.1, Claude 4, Gemini 2.5 y Qwen3. El resultado fue consistente en todos: el rendimiento se degradaba a medida que crecía la entrada, mucho antes de que la ventana de contexto estuviera ni de lejos llena. Los modelos no usan su contexto de manera uniforme. La precisión cayó decenas de puntos porcentuales entre los 10.000 y los 100.000 tokens aproximadamente, que en un modelo de un millón de tokens es la primera décima parte de la ventana.

El detalle crucial es que el umbral sigue un recuento absoluto de tokens, no una fracción de la ventana. Databricks midió que la corrección se venía abajo en torno a los 32.000 tokens con Llama 3.1 405B, y antes todavía en modelos más pequeños. Comprar una ventana más grande no mueve ese número. Una ventana de un millón de tokens no te compra un millón de tokens utilizables, solo te compra más espacio para empeorar el problema. Meta publica una recuperación de aguja en un pajar casi perfecta a lo largo de los 10 millones de tokens completos de Llama 4 Scout, pero encontrar un dato plantado no es lo mismo que razonar sobre el corpus, y ningún benchmark publicado muestra que la calidad del razonamiento se sostenga a esa longitud.

Anthropic plantea la causa de fondo de una forma que hace obvio el arreglo. El contexto es "a finite resource with diminishing marginal returns" (un recurso finito con rendimientos marginales decrecientes), y los modelos operan con un "attention budget", un presupuesto de atención en el que "every new token introduced depletes this budget by some amount": cada token nuevo que se introduce agota ese presupuesto un poco más. La arquitectura explica por qué: un transformer tiene que calcular n² relaciones por pares para n tokens, así que la atención se vuelve más fina a medida que crece la entrada. (Anthropic, 2025)

Este es el coste oculto de la era del millón de tokens. La ventana creció más rápido que la capacidad de los modelos para usarla, y convirtió "¿qué debería dejar fuera?" en la pregunta más valiosa de toda la pila. Para la versión arquitectónica de este problema, incluido cuándo recurrir a la recuperación en su lugar, consulta Context Rot, RAG y contexto largo.


Las cuatro formas en que falla el contexto

La contaminación de contexto es el término paraguas para un contexto degradado por material que no debería estar ahí. Es una expresión útil y un diagnóstico inútil, porque saber que tu contexto está contaminado no te dice qué hay que quitar. El desglose más práctico vino de Drew Breunig, que publicó "How Long Contexts Fail" el 22 de junio de 2025. Dividió la contaminación de contexto en cuatro modos de fallo distintos, y la razón por la que la taxonomía cuajó es que cada uno tiene un arreglo diferente.

Modo de falloQué esSeñal delatoraArreglo
Envenenamiento de contextoUna alucinación o un error entra en el contexto y se cita una y otra vezEl modelo repite con seguridad un dato que tú nunca le disteAbre un hilo nuevo. Valida lo que entra en la memoria
Distracción de contextoEl contexto crece tanto que el modelo se centra en exceso en él y descuida lo que aprendió en el entrenamientoLas respuestas se vuelven repetitivas, el modelo reutiliza acciones pasadas en lugar de razonarCompacta o resume, y luego reinicia
Confusión de contextoSe usa contenido superfluo para generar una respuesta de peor calidadSe invocan herramientas irrelevantes, aparecen detalles fuera de tema en la salidaRecorta la lista de herramientas y la de fuentes
Choque de contextoInformación o herramientas nuevas entran en conflicto con otra información ya presente en el contextoEl modelo se cubre, se contradice o elige la instrucción equivocadaElimina la contradicción. Enuncia la regla una sola vez

Los ejemplos que hay detrás son concretos. Para el envenenamiento, Breunig señala un agente Gemini 2.5 jugando a Pokémon que alucinaba estados de juego, los escribía en su sección de objetivos y luego pasaba tramos largos persiguiendo metas imposibles. Para la distracción, cita el mismo resultado de Databricks que ancla la sección anterior: la corrección empieza a resbalar en torno a los 32.000 tokens en un modelo cuya ventana es muchas veces mayor.

La confusión es la que tiene la evidencia más accionable. En el Berkeley Function-Calling Leaderboard, según el resumen de Breunig, "every model performs worse when provided with more than one tool" (todos los modelos rinden peor cuando se les da más de una herramienta), y de vez en cuando invocan herramientas que no tienen nada que ver con la petición. En una prueba del benchmark GeoEngine, un Llama 3.1 8B cuantizado falló la tarea con 46 herramientas y la resolvió con 19. Mismo modelo, misma tarea, menos opciones.

Para el choque, Breunig cita investigación de Microsoft y Salesforce sobre prompts "fragmentados" (sharded), en los que la misma información se reparte entre varios mensajes en lugar de entregarse de una vez. El rendimiento cayó un 39 por ciento de media, y o3 se desplomó de 98,1 a 64,1 en las tareas afectadas.

Aquí está el patrón que conviene interiorizar: tres de estos cuatro empeoran cuando añades contexto. Solo uno, el de un dato genuinamente ausente, mejora. Esa asimetría es todo el argumento a favor de la curación.


Lo que dice la investigación: los artículos que importan

Cuatro documentos cargan con casi todo el peso, y si solo lees estos irás por delante de casi cualquiera que discuta sobre el tema en internet. El ancla es "A Survey of Context Engineering for Large Language Models" (arXiv:2507.13334), presentado el 17 de julio de 2025. Ocupa 166 páginas y recorre 1.411 artículos citados, lo que lo convierte en lo más parecido a un mapa que tiene el campo.

El encuadre de esta revisión es que la ingeniería de contexto "transcends simple prompt design to encompass the systematic optimization of information payloads for LLMs": va más allá del simple diseño de prompts para abarcar la optimización sistemática de las cargas de información que reciben los LLM. Divide el campo en componentes fundamentales (recuperación y generación de contexto, procesamiento de contexto, gestión de contexto) y luego en las implementaciones de sistema construidas encima: RAG, sistemas de memoria, razonamiento con herramientas integradas y arquitecturas multiagente. Si alguna vez te has preguntado dónde queda RAG respecto a la ingeniería de contexto, esa es la respuesta: la recuperación es una máquina dentro de la disciplina mayor.

El hallazgo más interesante es un hueco que los autores marcan como "a defining priority for future research", una prioridad definitoria para la investigación futura. Los modelos aumentados con buena ingeniería de contexto "demonstrate remarkable proficiency in understanding complex contexts" (demuestran una destreza notable para entender contextos complejos), pero "exhibit pronounced limitations in generating equally sophisticated, long-form outputs": muestran limitaciones marcadas al generar salidas largas igual de sofisticadas. Dicho en llano: hemos mejorado mucho más en darles información a los modelos que en sacarles trabajo largo y de calidad. Cualquiera que haya visto a una IA producir un resumen brillante y después un borrador mediocre de 3.000 palabras lo ha sentido en carne propia.

El otro documento que vale la pena leer entero es "Effective context engineering for AI agents", de Anthropic, publicado el 29 de septiembre de 2025. Es el que dio a los profesionales el vocabulario de trabajo que hoy usan la mayoría de las herramientas:

  • Recuperación justo a tiempo (just-in-time retrieval): mantén identificadores ligeros (rutas de archivo, consultas, enlaces) en el contexto y carga los datos reales en tiempo de ejecución, en lugar de precargarlo todo.
  • Compactación (compaction): cuando una conversación se acerca al límite de la ventana, resúmela y reinicializa una ventana nueva. Anthropic señala que la dificultad está por completo en la selección, porque una "overly aggressive compaction", una compactación demasiado agresiva, pierde el contexto sutil cuya importancia solo aparece más tarde.
  • Toma de notas estructurada (structured note-taking): haz que el agente escriba notas en una memoria persistente fuera de la ventana de contexto y que las vuelva a leer cuando las necesite.
  • Arquitecturas de subagentes (sub-agents): entrega tareas acotadas a agentes especializados con ventanas de contexto limpias y deja que un agente principal sintetice los resultados.

Esas cuatro técnicas se diseñaron para agentes autónomos. Las cuatro tienen un equivalente manual que una persona puede ejecutar en una ventana de chat, que es el asunto de las dos secciones siguientes. Para ver cómo aparecen estas ideas en las herramientas de agentes del día a día, consulta Skills, subagentes y hooks.


La habilidad que nadie nombró: la curación

Si el deterioro del contexto es el problema, la curación es la solución. Y resulta que la curación es una habilidad que la mayoría de los trabajadores del conocimiento ya practican, sin llamarla así.

Cada vez que subrayas un pasaje de un artículo, estás curando. Estás diciendo: esto importa. El resto es fondo. Cuando anotas un PDF, marcas un artículo o guardas una cita, haces lo mismo. Estás construyendo un filtro de señal y ruido sobre un mundo lleno de texto.

El problema, hasta hace poco, era que esa curación quedaba atrapada. Tus subrayados vivían en una app. Tus notas de Kindle, en otra. Tu investigación web, en el historial del navegador. Cuando te sentabas a informar a una IA, no podías llevar nada de eso a la ventana de contexto de forma eficiente. Acababas releyéndolo todo o, peor, pegando fuentes en bruto y confiando en la suerte.

La ingeniería de contexto como disciplina tiene un hueco enorme justo aquí. Las empresas lo resolvieron construyendo bases de conocimiento internas y pipelines de RAG. Pero los trabajadores del conocimiento individuales no tienen un equipo de ingeniería. Tienen el mismo problema (demasiado material fuente, poca señal) y nada de esa infraestructura.

Por eso las herramientas de lectura que capturan subrayados de forma duradera se han convertido, discretamente, en infraestructura de IA. El subrayador web de Glasp existe exactamente para resolver esto: convierte tu lectura en contexto estructurado y recuperable. Cuando subrayas un párrafo en una entrada de blog, ese subrayado se convierte en una pieza de contexto que puedes entregarle a cualquier IA más adelante, filtrada por tema, por fuente o por fecha.

El mismo principio se aplica a la lectura de formato largo. Tus subrayados de Kindle son probablemente la señal de mayor calidad que has generado nunca sobre lo que te importa. Prestaste atención el tiempo suficiente para subrayarlos. Ese es un filtro caro, y se desperdicia si los subrayados se quedan en un sistema cerrado.


Ingeniería de contexto para individuos (no solo para ingenieros)

La mayor parte de lo que se escribe sobre ingeniería de contexto apunta a desarrolladores. Va de construir sistemas de IA de producción: cómo dar forma a un prompt del sistema para un agente de programación, cómo trocear documentos para la recuperación, cómo cablear las llamadas a herramientas. Eso es útil si publicas software. Es menos útil si eres consultor, investigador, escritor, analista o estudiante y solo quieres mejores salidas de IA.

Pero se aplica la misma disciplina. Solo que la ejecutas a mano.

Diseñas prompts del sistema, de manera informal. Cada GPT personalizado, cada proyecto de Claude, cada archivo de instrucciones al estilo claude.md que configuras es un prompt del sistema. Cuando escribes "eres mi asistente de investigación, trabajo en política de energías renovables, prefiere los resúmenes escépticos", estás diseñando un prompt del sistema. Hazlo de forma deliberada.

Gestionas la memoria. La función de memoria de ChatGPT y los proyectos de Claude te dejan fijar hechos que persisten entre conversaciones. La mayoría de la gente o ignora esto (y pierde continuidad) o lo vuelca todo ahí (y genera ruido). El movimiento correcto es curar la memoria como curarías un currículum: solo aquello que quieres que el modelo use cada vez.

Haces recuperación, manualmente. Pegar el artículo correcto en un chat es RAG manual. La pregunta es de dónde sale "el artículo correcto". Si sale de desplazarte a la desesperada por el historial del navegador, no tienes sistema de recuperación. Si sale de una biblioteca de pasajes que ya marcaste como interesantes, sí lo tienes.

Cargas adjuntos con intención. La tentación es subir el libro entero. El mejor movimiento es subir las 40 páginas que de verdad subrayaste. Estás esquivando el deterioro del contexto haciendo el filtrado aguas arriba.

Además están las cuatro técnicas de agentes del manual de Anthropic, y cada una tiene su versión manual:

Técnica de agenteLa versión manual que puedes usar hoy
Recuperación justo a tiempoMantén en el hilo una lista de enlaces a las fuentes y pega el texto completo solo cuando el modelo lo necesite de verdad
CompactaciónCuando un hilo se alarga y las respuestas se vuelven repetitivas, pide un resumen de las decisiones tomadas hasta ahí y abre un chat nuevo con ese resumen arriba
Toma de notas estructuradaMantén el estado actual de un proyecto en un documento fuera del chat y vuelve a pegar la versión vigente en vez de fiarte de lo que quedó más arriba en el hilo
SubagentesAbre chats separados para subtareas separadas en lugar de un megahilo, y junta después solo las conclusiones

La compactación es la que más gente se está saltando. Los hilos largos empeoran con el tiempo porque los mensajes viejos dominan el contexto sin aportar nada, y ese es exactamente el modo de fallo por distracción de la tabla anterior. Abrir un hilo nuevo para una subtarea nueva, con un informe limpio, suele ganarle a continuar el megahilo.

Nada de esto exige habilidad de ingeniería. Exige la misma habilidad que ya tienen los buenos investigadores y los buenos periodistas: saber qué incluir, qué cortar y de dónde sacar cada cosa.


Tus subrayados son tu contexto competitivo

Aquí viene la parte infravalorada.

La mayoría de la gente trata sus notas y sus subrayados como ayudas para la memoria. Cosas a las que volver algún día. Ese encuadre tenía sentido en 2010, cuando volver a ellas era la única manera de usarlas. En 2026 está obsoleto.

Tus subrayados son ahora un flujo que puedes entregarle a una IA. Cada pasaje que has marcado, cada cita que has guardado, cada anotación que has hecho es una pieza de contexto. Y como lo generaste prestando atención, tiene más señal que cualquier cosa raspada al azar de la web.

Piensa en lo que esto significa en términos competitivos. Dos trabajadores del conocimiento usan el mismo modelo de IA. Uno tiene tres años de lectura y subrayado estructurados. El otro tiene tres años de pestañas de navegador que nunca volvió a abrir. Cuando le hacen la misma pregunta a la IA, la primera persona puede alimentarla con su propio corpus curado. La segunda se queda con los datos de entrenamiento genéricos del modelo y con lo que se acuerde de pegar. La brecha no es una brecha de prompting. Es una brecha de contexto.

Por eso Glasp ha ido cambiando su forma de posicionarse. El planteamiento original era un subrayador web social: subrayas cosas, ves lo que subrayaron otros, construyes una identidad de lector. Todo eso sigue siendo cierto. Pero el valor profundo ahora es que cada subrayado es un token de contexto esperando a ser usado. Tu historial de lectura se acumula en un corpus RAG personal, un párrafo cada vez.

Cuando lo combinas con el chat con IA de Glasp, el flujo de trabajo se acerca a lo que los ingenieros construyen para sus empresas. Subrayas mientras lees. Más tarde haces preguntas y la IA tira de aquello que de verdad te importó, no de un índice web genérico. Eso es ingeniería de contexto, salvo que el contexto es tu propia biblioteca.

Para más sobre cómo esto le da la vuelta a la relación entre lectura e IA, consulta los asistentes de lectura con IA.


Un marco simple para diseñar el contexto de cualquier tarea de IA

Basta de teoría. Aquí tienes un flujo de trabajo concreto que puedes ejecutar la próxima vez que abras un chat.

Paso 1: define el trabajo antes de escribir. Una frase. ¿Qué aspecto tiene "terminado"? "Redacta un memorando de 500 palabras que resuma los tres argumentos principales contra la semana laboral de cuatro días, escrito para un director de operaciones escéptico." Eso es un trabajo. "Ayúdame con este artículo" no lo es.

Paso 2: reúne tus fuentes y luego recórtalas. Junta el material que de verdad incide en la tarea. Si tienes subrayados sobre el tema, empieza por ahí, no por los artículos completos. Si tienes la memoria configurada, comprueba si ya contiene antecedentes útiles. Deja fuera todo lo que solo esté relacionado de forma tangencial. El deterioro del contexto es real.

Paso 3: fija el rol y las reglas. Antes de la tarea, dile al modelo quién es y qué reglas aplican. "Estás editando para un director de operaciones escéptico. Sin jerga. Sin medias tintas. Números antes que adjetivos." Esta es la capa del prompt del sistema. Cuesta diez segundos y cambia el tono de todo lo que viene después.

Paso 4: entrega la tarea y el paquete, en orden. Pon el contexto más importante al principio y la tarea al final. Por el efecto Lost in the Middle, quieres la instrucción y el material más afilado al comienzo y al cierre. El medio es un pantano.

Paso 5: diagnostica antes de iterar. Si la salida es mala, resiste el impulso de reescribir tu prompt de doce maneras. Recorre en su lugar los cuatro modos de fallo como una lista de comprobación. ¿Hay un dato falso ahí dentro que no para de volver (envenenamiento)? ¿Es el hilo largo y repetitivo (distracción)? ¿Adjuntaste tres fuentes cuando solo una era pertinente (confusión)? ¿Diste dos instrucciones que se contradicen (choque)? Cada una tiene un arreglo distinto, y ninguno de ellos es reformular.

Haz esto unas cuantas docenas de veces y se vuelve un reflejo. Dejarás de preguntarte "¿cómo formulo este prompt?" y empezarás a preguntarte "¿qué necesita ver el modelo antes de responder?". Ese cambio es toda la disciplina.


Preguntas frecuentes

¿Qué es la ingeniería de contexto en términos simples?

Es decidir qué ve un modelo de IA antes de responder. Eso incluye las instrucciones que le das, los documentos que adjuntas, lo que recuerda sobre ti, las herramientas que puede usar y la conversación hasta ese punto. La ingeniería de prompts cubre solo la redacción de tu petición, que es una entrada entre muchas.

¿Está muerta de verdad la ingeniería de prompts?

La expresión se está retirando. Las técnicas que hay debajo siguen funcionando. La cadena de pensamiento, los ejemplos few-shot y los formatos de salida claros siguen siendo útiles. Lo que está muerto es la idea de que un buen fraseo, por sí solo, te da una gran salida. En 2026, el fraseo es una palanca menor. El ensamblaje del contexto es la palanca mayor. Cuando alguien dice "la ingeniería de prompts ha muerto", es esto lo que quiere decir.

¿La ingeniería de contexto está muerta o es solo una palabra de moda?

El término ya pasó su pico de exageración, y el cargo de "context engineer" como tal es emergente más que estándar: Adobe publica ofertas con ese nombre exacto, pero en la mayoría de las empresas el trabajo vive dentro de puestos ya existentes de ingeniería de IA, de datos o de plataforma. La práctica está más asentada que nunca, y se está absorbiendo dentro del trabajo normal con IA en lugar de desaparecer. La compactación y la recuperación automáticas de las herramientas de agentes modernas eliminaron algunos pasos manuales, pero alguien sigue decidiendo qué entra en la memoria y qué fuentes puede ver el modelo. Esa decisión es el trabajo.

¿Qué es la contaminación de contexto?

Es el término general para un contexto degradado por material que no debería estar ahí. La taxonomía de Drew Breunig divide la contaminación de contexto en cuatro modos: envenenamiento (entra un error y se repite), distracción (el contexto se alarga tanto que el modelo se apoya en exceso en él), confusión (contenido irrelevante empeora la respuesta) y choque (dos piezas de contexto se contradicen). Diagnosticar cuál de ellos tienes importa, porque los arreglos son distintos.

¿Cuáles son los mejores artículos sobre ingeniería de contexto?

Empieza por "A Survey of Context Engineering for Large Language Models" (arXiv:2507.13334), una revisión de 166 páginas sobre 1.411 artículos. Para la evidencia de fallo con contextos largos, lee Liu et al. (2024) "Lost in the Middle" en TACL y el informe técnico "Context Rot" de Chroma (2025). Para la práctica aplicada, "Effective context engineering for AI agents" de Anthropic (septiembre de 2025) es el documento no académico más útil.

¿Cuál es la diferencia entre la ingeniería de contexto y RAG?

RAG (retrieval-augmented generation, generación aumentada por recuperación) es una capa de la ingeniería de contexto, en concreto la capa de recuperación. Es la maquinaria que extrae fragmentos relevantes de una base de conocimiento cuando hacen falta. La ingeniería de contexto es la disciplina más amplia que incluye RAG, más los prompts del sistema, la memoria, el uso de herramientas, los adjuntos y el historial de conversación.

¿No resolverán esto al final las ventanas de contexto más grandes?

No lo han hecho hasta ahora, y la evidencia sugiere que no lo harán. Liu et al. (2024) mostraron que los modelos ignoran el medio de los contextos largos. El estudio de Chroma de 2025 mostró que los 18 modelos de frontera evaluados se degradan mucho antes de que la ventana se llene. Las ventanas anunciadas con 10 millones de tokens tienen resultados de recuperación de aguja en un pajar, pero ningún benchmark publicado muestra que la calidad del razonamiento se sostenga a esa longitud. El cuello de botella no es el tamaño de la ventana. Es el reparto de la atención dentro de la ventana.

¿Necesito tener perfil técnico para hacer ingeniería de contexto?

No. La metáfora de la ingeniería despista a algunas personas, pero solo significa hacer el trabajo de forma deliberada en lugar de por accidente. Un consultor preparando un informe, un periodista investigando un reportaje, un estudiante organizando material fuente para un ensayo: todo eso es ingeniería de contexto disfrazada. Las habilidades centrales son la curación y el criterio.

¿Qué relación tiene esto con las funciones de "memoria" de la IA?

La memoria (como la memoria persistente de ChatGPT o los proyectos de Claude) es una capa del contexto. Es lo que el modelo sabe sobre ti entre sesiones. La ingeniería de contexto incluye la memoria, pero es más amplia. La memoria es la capa siempre activa. La recuperación, los adjuntos y los prompts del sistema son las capas por tarea. Un buen ingeniero de contexto las usa todas juntas.

¿No es esto tomar notas con un nombre elegante?

En parte. La diferencia es que la toma de notas tradicional está optimizada para que tú releas tus notas. La ingeniería de contexto está optimizada para que un modelo consuma tus notas. Los requisitos de formato son distintos (importan más la estructura, la atomicidad y la recuperabilidad), pero la práctica de fondo de capturar lo que vale la pena recordar es la misma. Quien ya toma buenas notas parte con ventaja.


Conclusión: la nueva alfabetización

Cada era de la informática ha tenido una alfabetización que separaba a los aficionados de los usuarios serios. En los años 2000 era aprender a buscar bien en Google. En la década de 2010 era aprender a estructurar información en apps como Notion o Airtable. En 2026 es aprender a diseñar el contexto de la IA.

Las personas que resuelvan esto se adelantarán mucho a las que no. No porque tengan mejor acceso a los modelos (todo el mundo tiene los mismos modelos), sino porque llegan a cada tarea con mejor material. Saben qué meter. Saben qué dejar fuera. Saben dónde está su mejor fuente sobre un tema, porque se molestaron en capturarla hace meses.

Por eso la curación se está convirtiendo, discretamente, en la metahabilidad más valiosa de la era de la IA. Cada subrayado que guardas, cada pasaje que anotas, cada lectura que procesas de verdad es un depósito en un motor de contexto personal. El futuro de la productividad con IA no son las personas con prompts secretos. Son las personas con bibliotecas bien pensadas.

Ya haces la lectura. Ya tienes opiniones sobre lo que importa. La única pregunta es si algo de eso permanece el tiempo suficiente para serle útil a tu yo futuro, y a la IA que trabaja a tu lado. Las herramientas existen. El hábito es la parte difícil.

Elige hoy algo que valga la pena leer. Subraya las partes que importan. Eso es ingeniería de contexto. Todo lo demás es técnica.

Start building your knowledge library

Highlight what matters as you read across the web. Save insights from articles, books, and YouTube videos in one place.

Get Started Free

Or highlight this page as you read it