GelişimStrateji
0

¿Qué es la ingeniería de contexto? La habilidad que está sustituyendo en silencio a la ingeniería de prompts

A person at a sunlit table sorting papers into two piles beside a laptop

En resumen: la ingeniería de contexto es la práctica de decidir qué entra en la ventana de contexto de un modelo, en qué orden y a qué coste, en lugar de decidir únicamente cómo redactar la petición. Se ha convertido en la habilidad determinante porque la evidencia de las evaluaciones se volvió decididamente en contra del supuesto de que una ventana de contexto grande es una ventana de contexto utilizable. La evaluación NoLiMa, publicada en ICML 2025, probó trece modelos que anuncian al menos 128.000 tokens de soporte y halló que once de ellos caían por debajo del cincuenta por ciento de su propia línea base de contexto corto con solo 32.000 tokens, con GPT-4o bajando del 99,3 por ciento al 69,7 por ciento. Investigadores de IBM midieron degradación en la llamada a funciones del 7 al 85 por ciento a medida que crecen los catálogos de herramientas, del 7 al 91 por ciento a medida que se alargan las salidas de herramientas y del 13 al 40 por ciento a medida que se extienden las conversaciones. El trabajo fundacional de TACL sobre contextos largos mostró que los modelos recuperan bien del principio y del final de una entrada y mal del medio. Juntos dicen lo mismo: la atención es un recurso escaso que se asigna, no un contenedor gratuito que se llena. Esta guía ofrece la tabla de degradación medida, un ratio derivado entre tamaño anunciado y punto de degradación, un presupuesto de contexto de cinco partes y una auditoría práctica. Una directiva asigna capital escaso con criterio; una estudiante vuelve a medir cuando llega el siguiente modelo.

Durante unos tres años, la historia que nos contamos sobre trabajar con modelos de lenguaje fue una historia sobre redacción. Si la salida era mala, el prompt era malo. Añade un rol. Añade ejemplos. Pídele que piense paso a paso. Di: eres una experta. Todo un género de consejos creció en torno a la idea de que la capacidad estaba en el modelo y el prompt era la llave que la desbloqueaba.

Esa historia nunca fue exactamente falsa, pero se ha convertido en una parte pequeña de un problema mucho mayor, y ese desplazamiento tiene una causa concreta. Los modelos consiguieron ventanas de contexto largas. Luego la gente las llenó. Luego los resultados empeoraron de maneras que ninguna reformulación arreglaba, y el campo tuvo que desarrollar un vocabulario para lo que estaba ocurriendo de verdad.

Ese vocabulario es la ingeniería de contexto, y lo importante no es que sea un término de moda. Es que el fallo que aborda está medido, publicado y es grande.

La definición, formulada con precisión

La ingeniería de prompts pregunta: ¿cómo redacto la instrucción para que el modelo haga lo correcto?

La ingeniería de contexto plantea una pregunta distinta y estrictamente mayor: ¿cuál es el conjunto más pequeño de información de alta señal que el modelo necesita en su ventana para hacer esto bien, y cómo consigo que entre exactamente eso y nada más?

La distinción se ve más fácil en lo que controla cada una. La ingeniería de prompts controla un componente de la ventana: la instrucción. La ingeniería de contexto controla toda la ventana, que en cualquier sistema real contiene al menos cinco ocupantes que compiten: las instrucciones de sistema, las definiciones de herramientas y funciones, los documentos o conocimiento recuperados, el historial de conversación y la salida acumulada de llamadas y acciones anteriores.

Ese replanteamiento importa porque la instrucción suele ser la más pequeña de esas cinco por un orden de magnitud, y es la única que la mayoría de la gente toca. Si tu sistema falla y sigues editando la redacción del prompt, estás optimizando un error de redondeo.

La ingeniería de contexto no sustituye a la ingeniería de prompts en el sentido de dejarla obsoleta. La engloba. La redacción es una palanca dentro de un problema de asignación mayor, igual que la fijación de precios es una palanca dentro de dirigir un negocio. Quien haya trabajado por qué la ingeniería de prompts no basta reconocerá la forma: la habilidad que parecía ser todo el trabajo resulta ser una capa de una pila.

Por qué la ventana no es lo que dice la etiqueta

Esta es la evidencia que forzó el cambio, y merece lectura atenta porque las cifras son más severas de lo que sugiere el discurso general.

El primer resultado es fundacional. La investigación publicada en las Transactions of the Association for Computational Linguistics sobre cómo usan los modelos de lenguaje los contextos largos halló una curva de rendimiento en forma de U consistente en preguntas y respuestas multidocumento y recuperación clave-valor. El rendimiento era máximo cuando la información relevante aparecía al principio o al final de la entrada, y se degradaba notablemente cuando el modelo tenía que encontrarla en el medio. La posición dentro de la ventana no es neutra. Dónde colocas algo cambia si el modelo puede usarlo.

El segundo resultado debería cambiar tus valores por defecto. La evaluación NoLiMa, publicada en ICML 2025, se diseñó para cerrar un resquicio de la prueba estándar de la aguja en el pajar. En la prueba clásica el dato oculto suele compartir vocabulario obvio con la pregunta, de modo que un modelo puede acertar por coincidencia literal sin razonar de verdad sobre el contexto. NoLiMa eliminó esa muleta construyendo preguntas y datos objetivo con solapamiento léxico mínimo, obligando al modelo a inferir la asociación.

Los resultados sobre trece modelos que anuncian al menos 128.000 tokens: el rendimiento era fuerte por debajo de 1.000 tokens, y once de los trece caían por debajo del cincuenta por ciento de su propia línea base de contexto corto al llegar a 32.000 tokens. GPT-4o, de los más sólidos, bajó del 99,3 por ciento de precisión en línea base al 69,7 por ciento en longitud extendida.

El tercer resultado lleva esto de la recuperación a los flujos agénticos que hoy componen la mayor parte del uso profesional. Investigadores de IBM presentaron LongFuncEval para medir cómo funcionan los modelos de contexto largo en la llamada a funciones cuando el contexto crece, y reportaron tres curvas de degradación distintas: una caída de rendimiento del 7 al 85 por ciento a medida que crece el catálogo de herramientas, una degradación del 7 al 91 por ciento en la recuperación de respuestas a medida que se alargan las respuestas de herramientas, y una degradación del 13 al 40 por ciento a medida que se extienden las conversaciones de varios turnos.

Tabla 1: degradación medida en contexto largo (fuentes verificadas)

Estudio Qué midió Degradación medida
Lost in the Middle, Transactions of the ACL Posición de la información relevante dentro del contexto Curva en U: máxima al principio y al final de la entrada, notablemente degradada en el medio
NoLiMa, ICML 2025 Recuperación asociativa sin solapamiento léxico, 13 modelos que anuncian 128K o más 11 de 13 modelos por debajo del 50 por ciento de su línea base de contexto corto con 32.000 tokens; GPT-4o del 99,3 al 69,7 por ciento
LongFuncEval, IBM Research Llamada a funciones a medida que crece el contexto Caída del 7 al 85 por ciento al crecer el catálogo de herramientas; caída del 7 al 91 por ciento en recuperación de respuestas al alargarse las salidas; caída del 13 al 40 por ciento al alargarse las conversaciones

Fíjate en lo que comparten: tres grupos de investigación independientes, tres familias de tareas distintas, una conclusión coherente. La capacidad de aceptar tokens y la capacidad de usarlos son propiedades separadas, y la brecha entre ambas es donde vive la mayoría de los fallos del mundo real.

Cuánto valen realmente las cifras anunciadas

La cifra de marketing y la cifra de trabajo no son la misma, y conviene hacer explícito el ratio. El cálculo siguiente es un ratio derivado por CEOtudent, no una medición: toma el punto en el que NoLiMa observó que la mayoría de los modelos caían por debajo de la mitad de su línea base y lo expresa como fracción de la ventana que anuncia cada modelo.

Tabla 2: ventana anunciada frente al punto de reducción a la mitad observado (marco editorial de CEOtudent, derivado de NoLiMa)

Ventana de contexto anunciada Punto de reducción a la mitad observado en la mayoría de modelos probados Proporción entre ese punto y la ventana anunciada
128.000 tokens 32.000 tokens 25,0 por ciento
200.000 tokens 32.000 tokens 16,0 por ciento
1.000.000 de tokens 32.000 tokens 3,2 por ciento

Lee el método antes que las cifras. Los 32.000 tokens son el punto en el que once de los trece modelos de NoLiMa habían caído por debajo de la mitad de su propia línea base de contexto corto en una tarea de recuperación asociativa diseñada para ser difícil. No es un precipicio universal, no se traslada a todo tipo de tarea, y un modelo que falla esta prueba a 32.000 tokens todavía puede hacer trabajo útil de coincidencia literal mucho más allá. Lo que el ratio sí establece es la dirección y la magnitud aproximada del descuento que deberías aplicar cuando un proveedor anuncia un tamaño de ventana. Tratar una ventana anunciada de un millón de tokens como un millón de tokens utilizables no es un error pequeño: es un error de un orden de magnitud en la clase de tarea más difícil.

La implicación conductual es simple y algo contraintuitiva: añadir más contexto a un sistema que va mal suele ser el movimiento equivocado. Pasado un umbral que llega mucho antes de lo que sugiere la etiqueta, los tokens adicionales diluyen en lugar de informar.

El presupuesto de contexto de cinco partes

Si la atención es escasa, entonces todo lo que hay en la ventana la está gastando. Este es el marco que usamos para auditar ese gasto. Cada fila nombra a un ocupante de la ventana, el fallo documentado concreto que provoca y el movimiento de ingeniería que lo aborda.

Tabla 3: el presupuesto de contexto (marco editorial de CEOtudent)

Ocupante de la ventana Cuota típica del problema Fallo documentado que provoca El movimiento
Instrucciones de sistema Pequeñas en tokens, grandes en efecto Reglas contradictorias o caducadas que anulan tu petición en silencio Mantenerlas breves, quitar reglas obsoletas, declarar la prioridad de forma explícita
Definiciones de herramientas y funciones Crece en silencio al añadir capacidades LongFuncEval: degradación del 7 al 85 por ciento al crecer el catálogo Exponer solo las herramientas relevantes para esta tarea, no el catálogo completo
Documentos recuperados Normalmente el ocupante mayor Lost in the Middle: el material enterrado en mitad del contexto se recupera mal Recuperar menos, ordenar con más rigor, colocar lo decisivo al principio o al final
Historial de conversación Crece de forma monótona hasta que intervienes LongFuncEval: degradación del 13 al 40 por ciento al acumularse los turnos Resumir y reiniciar deliberadamente en lugar de dejar los hilos correr sin fin
Salida de herramientas acumulada El invisible; el que crece más rápido en flujos agénticos LongFuncEval: degradación del 7 al 91 por ciento al alargarse las respuestas de herramientas Truncar y resumir los retornos de herramientas antes de que vuelvan a entrar en la ventana

La quinta fila es donde la mayoría pierde sin saberlo. En un flujo agéntico cada llamada a una herramienta devuelve algo, y ese algo permanece en la ventana en todos los turnos siguientes. Un puñado de respuestas prolijas puede consumir más presupuesto que toda la descripción de la tarea, y nada en la interfaz te dice que ha ocurrido. Si delegas trabajo de varios pasos a sistemas de IA, esto es lo más valioso que puedes instrumentar, y encaja directamente con los conceptos de nuestra guía sobre qué entender antes de delegar trabajo a agentes de IA.

Una auditoría práctica que puedes hacer esta semana

No necesitas infraestructura para empezar. Necesitas el hábito de preguntar qué hay en la ventana y si se ha ganado su sitio.

Pregunta uno: ¿qué hay ahí dentro realmente? La mayoría no sabe responderlo sobre sus propios flujos. Enumera los cinco ocupantes de una tarea que ejecutes con regularidad y estima la cuota de cada uno. Que la estimación sea aproximada da igual; descubrir que dominan los documentos recuperados o el historial de herramientas suele ser toda la revelación.

Pregunta dos: ¿qué quitaría si la ventana fuera diez veces más pequeña? Esa es la función forzadora. Identifica de forma fiable el material presente por costumbre y no por necesidad. En la mayoría de configuraciones en uso, buena parte de lo que ocupa la ventana está ahí porque nadie lo quitó, no porque alguien decidiera que debía estar.

Pregunta tres: ¿dónde está la información decisiva? Dada la curva en U documentada en el trabajo de TACL, el material enterrado en mitad de una entrada larga es el que menos probablemente se use. Mueve aquello de lo que depende la respuesta al principio o al final y comprueba si la salida cambia. Con frecuencia cambia, y es una réplica barata y hecha por ti misma de un efecto publicado.

Pregunta cuatro: ¿este fallo es de redacción o de contexto? El diagnóstico es directo. Si el modelo produce una respuesta segura pero equivocada sobre los datos que le diste, es un problema de contexto: el material estaba presente pero no se usó, o faltaba cuando supusiste que estaba. Si el modelo produce los datos correctos con el formato equivocado, es un problema de redacción. Los dos se ven idénticos desde fuera y tienen arreglos completamente distintos, y recurrir al prompt cuando el fallo está en el contexto es la hora perdida más común en este trabajo.

Pregunta cinco: ¿cuándo volví a medir por última vez? Cada cifra de este artículo está atada a una generación de modelos concreta. Los resultados de NoLiMa describen los modelos probados en 2025. Las curvas de LongFuncEval describen los sistemas disponibles cuando se escribió el artículo. Cada nueva generación mueve estas fronteras, en general en la dirección correcta, y ninguna ha cerrado todavía la brecha entre capacidad anunciada y capacidad utilizable. Adquirir el hábito de comprobar es más duradero que memorizar cualquier umbral, que es exactamente el argumento que defendemos sobre la habilidad de juzgar las salidas de la IA.

Por qué es una habilidad real y no un cambio de nombre

Hay una objeción razonable: que la ingeniería de contexto sea ingeniería de prompts con un nombre más impresionante, inventado porque el antiguo empezaba a sonar poco serio.

La objeción falla en una prueba concreta. Las dos disciplinas se distinguen por lo que pueden y no pueden arreglar, y la frontera es nítida. Ninguna reformulación de una instrucción repara un dato recuperado pero colocado en mitad muerta de una entrada de 60.000 tokens. Ningún juego de roles ni encuadre paso a paso recupera una llamada a función que falló porque había cargadas cuarenta definiciones de herramientas cuando cuatro eran relevantes. Son fallos estructurales en la composición de la ventana, y solo se abordan cambiando esa composición.

Esa es la marca de una disciplina real y no de un cambio de nombre: tiene sus propios modos de fallo, sus propios diagnósticos y sus propios arreglos, y a ninguno se llega desde la práctica de la que surgió.

La literatura académica ya ha tomado la misma decisión. Una revisión sobre ingeniería de contexto para grandes modelos de lenguaje, publicada en julio de 2025 tras el análisis sistemático de más de 1.400 artículos de investigación, la trata explícitamente como una disciplina formal que va más allá del diseño de prompts y la descompone en tres componentes fundamentales: recuperación y generación de contexto, procesamiento de contexto y gestión de contexto. Esos tres se corresponden casi exactamente con el presupuesto práctico de arriba, señal tranquilizadora de que el marco describe algo real y no algo inventado para un titular.

También conviene ser honestos sobre a quién le sirve esto. Si tu uso de la IA se reduce a peticiones conversacionales sueltas, la redacción del prompt es de verdad la mayor parte de tu palanca y la ingeniería de contexto resulta bastante académica. En cuanto construyes algo persistente, es decir, un flujo que recupera documentos, llama a herramientas o se extiende a muchos turnos, el equilibrio se invierte con fuerza, y lo hace sin avisar. Entender cómo funcionan realmente los modelos de lenguaje hace evidente el motivo: la ventana es todo el mundo del modelo durante una petición, y todo lo que hay dentro compite por la misma atención finita.

La directiva y la estudiante

El encuadre directivo hace esto inmediatamente intuitivo. El contexto es un presupuesto. Tiene un techo duro, el valor marginal de lo que metes cae mucho más rápido de lo que ese techo sugiere, y todo lo que añades desplaza a otra cosa. Nadie dirigiría un negocio gastando cada unidad de capital disponible solo porque está disponible. Y eso es exactamente lo que parece llenar una ventana de contexto.

El encuadre estudiantil aporta la disciplina que el presupuesto necesita. Cada umbral citado aquí es una instantánea de un sistema en movimiento. La respuesta correcta a una cifra publicada no es memorizarla sino aprender la prueba que la produjo, para que cuando llegue la siguiente generación de modelos puedas averiguar dónde está la nueva frontera en vez de adivinarla. NoLiMa existe porque alguien notó que la prueba estándar tenía un resquicio y construyó una más dura. Ese instinto, comprobar si la medición mide de verdad lo que dice medir, es la parte transferible.

Quienes mejor trabajen con estos sistemas en los próximos años no serán quienes tengan los prompts mejor redactados. Serán quienes sepan, en cualquier momento, qué hay en la ventana y por qué.

Preguntas frecuentes

¿Cuál es la diferencia entre ingeniería de contexto e ingeniería de prompts en una frase?
La ingeniería de prompts optimiza la instrucción; la ingeniería de contexto optimiza todo lo que hay en la ventana del modelo, de lo cual la instrucción suele ser la parte más pequeña.

¿Una ventana de contexto mayor resuelve el problema?
No de forma fiable. La evaluación NoLiMa probó trece modelos que anuncian al menos 128.000 tokens y halló once por debajo de la mitad de su línea base de contexto corto con 32.000 tokens. La capacidad de aceptar tokens no es la misma propiedad que la capacidad de usarlos.

¿Está muerta la ingeniería de prompts?
No. Es un componente, no la disciplina entera. La redacción sigue importando en tareas conversacionales de un solo turno y sigue siendo el primer diagnóstico correcto cuando el modelo produce datos correctos en un formato equivocado.

¿Cuál es la mejora más rápida que puedo hacer?
Reduce lo que hay en la ventana y mueve el material decisivo al principio o al final. El efecto posicional en U documentado en el trabajo de TACL es fácil de replicar en tus propias tareas en unos minutos, y el resultado suele sorprender.

¿Por qué los flujos agénticos se degradan más rápido que el chat?
Porque acumulan dos ocupantes que el chat no tiene: definiciones de herramientas y salidas de herramientas. Las mediciones de LongFuncEval de IBM sitúan la degradación entre el 7 y el 85 por ciento al crecer el catálogo y entre el 7 y el 91 por ciento al alargarse las respuestas de herramientas, además del 13 al 40 por ciento que aporta la longitud de la conversación por sí sola.

¿Necesito herramientas especiales para practicar esto?
No. Las cinco preguntas de auditoría de este artículo no requieren nada más que atención a lo que envías. Las herramientas ayudan a escala, pero la mayor ganancia individual, quitar material que está en la ventana por costumbre y no por necesidad, está disponible de inmediato para cualquiera.

Fuentes

  • Liu, Lin, Hewitt, Paranjape, Bevilacqua, Petroni y Liang, Lost in the Middle: How Language Models Use Long Contexts, Transactions of the Association for Computational Linguistics
  • Modarressi, Deilamsalehy, Dernoncourt, Bui, Rossi, Yoon y Schütze, NoLiMa: Long-Context Evaluation Beyond Literal Matching, International Conference on Machine Learning, 2025
  • Kate, Pedapati, Basu, Rizk, Chenthamarakshan, Chaudhury, Agarwal y Abdelaziz, LongFuncEval: Measuring the Effectiveness of Long Context Models for Function Calling, IBM Research, 2025
  • Mei, Yao, Ge, Wang, Bi, Cai y colegas, A Survey of Context Engineering for Large Language Models, julio de 2025

Este contenido fue recopilado con el apoyo de la IA tras una investigación exhaustiva, y luego redactado y preparado para su publicación por el equipo editorial de CEOtudent.

This post is also available in: Türkçe English Français Deutsch

Benzer içerikler