En resumen. Todo asistente importante expone hoy tres capas de configuración: un informe permanente que escribes una vez, un proyecto o espacio de trabajo que acota el contexto a un solo frente de trabajo y una memoria que la propia herramienta rellena. La mayoría de los profesionales usa una de las tres, casi siempre mal, y concluye que la herramienta no entiende su trabajo. Los propios proveedores no se ponen de acuerdo sobre cómo llenar esas capas: la guía oficial de Gems de Google aconseja aportar todo el contexto posible, mientras que la documentación oficial de Anthropic limita su equivalente a unas 200 líneas y afirma sin rodeos que los archivos más largos reducen el cumplimiento. La evidencia revisada por pares respalda con claridad la segunda posición. En el estudio Lost in the Middle, entregar al modelo el único documento correcto elevó la precisión entre 27,8 y 50,4 puntos porcentuales, mientras que cuadruplicar la ventana de contexto o multiplicarla por 12,5 la movió 0,3 puntos. Es una ventaja de entre 93 y 107 a favor de elegir bien frente a almacenar más. La conclusión práctica no es “escribe más contexto”. Es: “asigna cada dato a la capa donde todavía se va a leer”.
Qué fracaso resuelve esto
La queja es conocida. Explicas al principio de la conversación tu rol, tus clientes, tus restricciones y el estilo de la casa. El resultado mejora. Al día siguiente abres una conversación nueva y lo explicas todo otra vez. A la cuarta repetición decides que la herramienta no está hecha para trabajo real.
Sí lo está. Estás dando el contexto en el único lugar diseñado para olvidar: la conversación. Las tres capas de configuración existen precisamente para retener lo que no debería volver a escribirse. Lo que casi nadie hace es decidir, de forma deliberada, qué dato pertenece a qué capa. Ese problema de asignación es toda la disciplina, y es distinto de escribir una buena instrucción. Si aún no has creado un documento único sobre tu trabajo, empieza por el archivo de contexto; este artículo trata de dónde debe vivir realmente su contenido.
Cuáles son las tres capas
La terminología cambia según el proveedor, pero la arquitectura ha convergido.
Capa 1, el informe permanente. Instrucciones que se aplican a todo lo que haces con la herramienta. ChatGPT lo llama instrucciones personalizadas. Las herramientas para desarrolladores de Anthropic usan un archivo de instrucciones de ámbito de usuario en ~/.claude/CLAUDE.md. El equivalente de Google, aplicado por asistente y no de forma global, es el bloque de instrucciones de un Gem. Esta capa se carga en cada sesión.
Capa 2, el proyecto o espacio de trabajo. Contexto acotado a un solo frente de trabajo: un cliente, un producto, una línea de investigación. Archivos, documentos de referencia e instrucciones que rigen dentro de esa frontera y en ningún otro sitio. Anthropic lo documenta como un archivo de instrucciones de ámbito de proyecto, guardado junto al trabajo, más reglas de ámbito de ruta que solo se cargan cuando el material coincidente está en juego.
Capa 3, la memoria. Notas que el asistente escribe sobre ti sin que se lo pidas. La documentación de Anthropic es inusualmente explícita en este reparto: los archivos de instrucciones los escribes tú y contienen “instrucciones y reglas”, mientras que la memoria automática la escribe el modelo y contiene “aprendizajes y patrones”, en concreto tus preferencias, las correcciones que has dado y el contexto de proyecto que el modelo no puede deducir por su cuenta. Añade que el índice de memoria carga en cada sesión solo sus primeras 200 líneas o 25 KB, lo que ocurra antes, y que el resto no se carga al iniciar la sesión.
Ese último detalle pesa más de lo que parece. La capa 3 tiene un presupuesto estricto y aplicado en silencio. Todo lo que lo supera sencillamente no está.
La evidencia: la selección supera a la capacidad en dos órdenes de magnitud
La tentación con cualquiera de estas capas es llenarlas. Las ventanas de contexto se anuncian en cientos de miles de tokens, así que guardarlo todo parece gratis. La evidencia controlada dice que no lo es.
Liu y sus colegas, en Transactions of the Association for Computational Linguistics, ejecutaron una tarea de respuesta a preguntas sobre varios documentos bajo dos condiciones de referencia. En la condición a libro cerrado el modelo no recibía documentos y debía apoyarse en lo que ya sabía. En la condición oráculo recibía exactamente un documento, el que contenía la respuesta. Todo lo demás en el estudio variaba dónde se situaba la respuesta entre distractores.
Datos verificados. Precisión a libro cerrado y en condición oráculo, respuesta a preguntas sobre varios documentos (Liu et al., TACL 2024).
| Modelo | Libro cerrado | Oráculo |
|---|---|---|
| LongChat-13B (16K) | 35,0 % | 83,4 % |
| MPT-30B-Instruct | 31,5 % | 81,9 % |
| GPT-3.5-Turbo | 56,1 % | 88,3 % |
| GPT-3.5-Turbo (16K) | 56,0 % | 88,6 % |
| Claude-1.3 | 48,3 % | 76,1 % |
| Claude-1.3 (100K) | 48,2 % | 76,4 % |
Lee la tabla de arriba abajo y verás que dos filas son casi gemelas, y es intencionado. GPT-3.5-Turbo aparece con ventana de 4K y de 16K. Claude-1.3 aparece con 8K y con 100K. Misma familia de modelo, misma tarea, distinta capacidad. Ese emparejamiento permite aislar qué compra la capacidad por sí sola, algo que el artículo no tabula.
Marco editorial de CEOtudent: la prima de la selección. Derivada de la tabla anterior; ganancia del documento correcto frente a la ganancia de la ventana mayor.
| Comparación | Qué cambió | Cambio de precisión | Proporción |
|---|---|---|---|
| GPT-3.5-Turbo, de libro cerrado a oráculo | Se le dio el único documento correcto | +32,2 puntos (+57,4 %) | referencia |
| GPT-3.5-Turbo, ventana de 4K a 16K | Capacidad de contexto por 4 | +0,3 puntos (+0,34 %) | selección 107 veces más valiosa |
| Claude-1.3, de libro cerrado a oráculo | Se le dio el único documento correcto | +27,8 puntos (+57,6 %) | referencia |
| Claude-1.3, ventana de 8K a 100K | Capacidad de contexto por 12,5 | +0,3 puntos (+0,39 %) | selección 93 veces más valiosa |
| LongChat-13B, de libro cerrado a oráculo | Se le dio el único documento correcto | +48,4 puntos (+138,3 %) | mayor ganancia individual observada |
| MPT-30B-Instruct, de libro cerrado a oráculo | Se le dio el único documento correcto | +50,4 puntos (+160,0 %) | mayor ganancia individual observada |
Multiplicar por 12,5 la ventana de contexto de Claude-1.3 movió la precisión oráculo del 76,1 % al 76,4 %. Darle al mismo modelo el documento correcto la movió del 48,3 % al 76,1 %. La segunda intervención fue 93 veces mayor que la primera. Para GPT-3.5-Turbo el múltiplo es 107. Ambas cifras a libro cerrado se movieron ligeramente en el sentido equivocado al ampliar la ventana, 0,1 puntos, lo que es ruido pero desde luego no una mejora.
Ese es el número que conviene retener cuando decides si pegar la carpeta entera de un cliente dentro de un proyecto. La restricción no es la capacidad. Es la selección.
Cuándo más contexto es peor que ninguno
El hallazgo más fuerte es el incómodo. Liu y sus colegas informan de que, cuando la información relevante se situaba en el medio de la entrada, el rendimiento de GPT-3.5-Turbo podía caer más de un 20 %, y de que en el peor caso el rendimiento en las condiciones de 20 y 30 documentos quedó por debajo de su propia puntuación a libro cerrado del 56,1 %.
Traducido a lenguaje de trabajo: al modelo se le dio la respuesta. Rindió peor que cuando no se le dio nada. Diecinueve o veintinueve documentos irrelevantes rodeando a uno correcto hicieron más daño del bien que hizo el correcto.
El mecanismo que describen los autores es una curva en U: uso fuerte del material situado al principio y al final del contexto, uso degradado de todo lo intermedio. Lo que entierras en mitad de un informe permanente largo es, funcionalmente, el material con más riesgo.
Por eso “añádelo todo, quizá ayude” no es una estrategia neutra. Tiene un coste medible, y ese coste crece con la cantidad de material verosímil pero irrelevante que incluyes. Sobre la cuestión vecina de qué hacer cuando la salida es confiada y errónea, véase por qué la IA alucina.
Los proveedores no coinciden entre sí
Aquí va una comparación que, hasta donde alcanzamos, nadie ha puesto lado a lado: la guía oficial escrita de dos grandes proveedores sobre cómo llenar la capa del informe permanente.
Datos verificados. Guía oficial de cada proveedor para redactar la capa del informe permanente, tomada de su propia documentación.
| Guía del proveedor | Sobre la extensión | Sobre la concreción | Qué es en realidad |
|---|---|---|---|
| Anthropic, documentación de memoria | “Apunta a menos de 200 líneas por archivo CLAUDE.md. Los archivos más largos consumen más contexto y reducen el cumplimiento.” Los archivos más cortos producen, según la documentación, mejor cumplimiento. | Prefiere instrucciones concretas y comprobables: “Usa sangría de 2 espacios” en lugar de “Formatea el código correctamente”; “Ejecuta npm test antes de hacer commit” en lugar de “Prueba tus cambios”. |
Explícitamente no es configuración impuesta. Se documenta como contexto entregado como mensaje de usuario después del mensaje de sistema, sin garantía de cumplimiento estricto. |
| Google, documentación de ayuda de Gems de Gemini | Recomienda cuatro componentes: persona, tarea, contexto y formato. Bajo contexto, el consejo es: “Aporta todo el contexto posible.” | “Sé específico al indicar la estructura deseada” para el componente de formato; la persona define el rol y el estilo de respuesta. | Un bloque de instrucciones asociado a un asistente creado para un propósito, no un ajuste global por defecto. |
Ambas son oficiales. Y apuntan en direcciones opuestas justo en la pregunta que más necesita responder quien empieza: ¿cuánto debo escribir?
Los resultados de Lost in the Middle dictan sentencia. La palanca no es el volumen, sino la colocación y la pertinencia. El consejo de Google es defendible para el caso estrecho para el que se crea un Gem: allí el contexto sí es la tarea y el asistente hace una sola cosa. Aplicado a un informe permanente general que se carga en cada sesión hagas lo que hagas, “todo el contexto posible” se acerca a la condición experimental que quedó por debajo del libro cerrado.
Hay además una segunda contradicción dentro de la propia documentación de Anthropic que merece notarse, porque es instructiva y no descuidada. Recomienda dividir los archivos de instrucciones grandes en importaciones por organización, y a continuación aclara que los archivos importados igualmente se cargan en la ventana de contexto al inicio, de modo que dividir “no reduce el contexto”. Organización y coste son problemas distintos, y la documentación no deja que el primero finja resolver el segundo. La mayoría de los consejos de productividad sobre configuración de IA difumina exactamente esa línea.
La especificación de contexto de trabajo
El problema de asignación necesita una regla, no una preferencia. La nuestra aplica pruebas a cada dato, una tras otra.
Marco editorial de CEOtudent: la especificación de contexto de trabajo. Una regla de asignación para los datos sobre tu trabajo.
| Prueba | Pregunta | Si la respuesta es sí |
|---|---|---|
| Alcance | ¿Es cierto para todo lo que hago con esta herramienta? | Capa 1, informe permanente |
| Frontera | ¿Es cierto solo dentro de un cliente, producto o línea? | Capa 2, proyecto |
| Origen | ¿Lo descubrí únicamente porque la herramienta se equivocó y yo corregí? | Capa 3, memoria |
| Derivabilidad | ¿Podría la herramienta deducirlo del material que ya ve? | Ninguna capa. Bórralo. |
| Volatilidad | ¿Será falso dentro de un trimestre? | Ninguna capa. Dilo en la conversación. |
Las pruebas cuarta y quinta hacen casi todo el trabajo, porque son las que mantienen las capas lo bastante pequeñas como para sobrevivir al problema de las 200 líneas.
La derivabilidad es la prueba que la gente se salta. Si tu proyecto ya contiene la guía de estilo, repetirla en el informe permanente no aporta nada y cuesta colocación. La documentación de Anthropic aplica exactamente esta regla a su propia memoria automática: dice que omite todo lo derivable del código y todo lo que los archivos de instrucciones ya dicen.
La volatilidad es la prueba que la gente entiende al revés. Las prioridades del trimestre, el acuerdo que se cierra esta semana, el plazo dentro de once días: todo parece contexto importante y todo será falso en un trimestre, momento en el cual deja de ser ruido neutro para convertirse en desinformación activa situada en la posición de máxima prioridad de cada sesión futura.
Asignación trabajada para un profesional a mitad de carrera:
- “Trabajo en marketing farmacéutico regulado; cada afirmación necesita fuente.” Supera la prueba de alcance. Capa 1.
- “Nunca uses listas con viñetas en notas dirigidas a clientes.” Supera la prueba de alcance y es lo bastante concreta para comprobarse. Capa 1.
- “La voz de marca de este cliente evita superlativos, véase la guía adjunta.” Prueba de frontera. Capa 2, con la guía dentro del proyecto en lugar de citada en las instrucciones.
- “Pido una y otra vez aperturas más cortas y recibo una y otra vez tres frases de preámbulo.” Prueba de origen. Capa 3 si la herramienta lo escribe allí sola; si no, sube la regla corregida en una línea a la capa 1.
- “Nuestro flujo de aprobación tiene cuatro etapas”, cuando el documento del flujo ya está en el proyecto. No supera la prueba de derivabilidad. Bórralo.
- “El objetivo del tercer trimestre es un 14 % de crecimiento.” No supera la prueba de volatilidad. Dilo en la conversación donde aplique.
Un informe permanente construido así suele quedar entre 15 y 40 líneas. No es una cifra inventada por elegancia: es lo que sobrevive a las cinco pruebas en la mayoría de profesionales con un único rol, y encaja con holgura dentro del único presupuesto de líneas que algún proveedor haya fijado por escrito.
Tres errores de configuración que conviene nombrar
Escribir una persona en lugar de una especificación. “Eres una consultora de estrategia de talla mundial” es un disfraz, no información. No es comprobable, no restringe la salida y ocupa la posición de mayor valor del contexto. Sustitúyelo por las restricciones que de verdad difieren de los valores por defecto de la herramienta.
Tratar la memoria como un archivador. La memoria la rellena el modelo a partir de tus correcciones. Está diseñada para guardar aprendizajes y tiene un presupuesto de carga declarado. Meter material de referencia allí compite con las correcciones que la hacen útil, y todo lo que excede el presupuesto se descarta en silencio al iniciar la sesión.
No auditar nunca. La documentación de Anthropic advierte de que si dos reglas se contradicen el modelo “puede elegir una de forma arbitraria”, y recomienda revisiones periódicas para eliminar instrucciones obsoletas o contradictorias. La configuración caduca. Un informe permanente escrito hace ocho meses, cuando tenías otro rol y otros clientes, es hoy un conjunto de instrucciones que dirige activamente la salida hacia un trabajo que ya no haces. Pon en el calendario una revisión trimestral de 20 minutos cuya acción por defecto sea borrar.
Cómo se ve esto como práctica
La puesta a punto lleva alrededor de una hora, una sola vez.
- Anota cada dato que hayas vuelto a escribir en una conversación más de dos veces en el último mes. Esa es tu lista de candidatos, y debe salir de tu conducta real, no de tu idea de lo que importa.
- Pasa cada candidato por las cinco pruebas. Cuenta con eliminar entre un tercio y la mitad en las pruebas de derivabilidad y volatilidad.
- Coloca los supervivientes en su capa asignada. Escríbelos como instrucciones concretas, no como descripciones.
- Ordena el informe permanente de modo que las dos o tres restricciones cuya violación más te molestaría queden arriba y abajo, no en el medio. No cuesta nada y ataca directamente la curva en U.
- Agenda una revisión trimestral cuya acción por defecto sea borrar.
La razón para hacerlo no es el orden. Es que la diferencia entre un asistente que conoce tu trabajo y uno que no se midió entre 27,8 y 50,4 puntos de precisión, y provino de la selección, no del almacenamiento. Para la habilidad más amplia en la que esto se inscribe, véase qué es la ingeniería de contexto; para delegar tareas enteras en lugar de contexto, véase el marco de briefing para agentes de IA.
Dirige la configuración como una directora que redacta un mandato: pocas restricciones, todas vinculantes, revisadas según calendario. Aprende como un estudiante: fíjate en qué corrección repites sin parar y trata esa repetición como la señal de que falta una línea en el informe.
Preguntas frecuentes
¿Debo poner todo mi currículum en el informe permanente?
Casi con seguridad no. Pásalo línea por línea por la prueba de alcance. Tu rol actual y las restricciones que impone la superan. Tu historial laboral de hace una década no afecta a ninguna salida y consume las posiciones donde deberían estar las restricciones vinculantes.
¿Una ventana de contexto mayor justifica relajar todo esto?
La evidencia de este artículo es la prueba directa de esa pregunta. Multiplicar la ventana por 12,5 movió la precisión oráculo 0,3 puntos. El efecto del documento correcto fue 93 veces mayor. Con esta evidencia, el crecimiento de la capacidad no ha hecho menos importante la selección.
Los proveedores cambian los límites constantemente. ¿Eso rompe el marco?
Los límites concretos de caracteres y líneas cambian a menudo, y por eso el marco se apoya en las pruebas y no en las cifras. Alcance, frontera, origen, derivabilidad y volatilidad no dependen del tope vigente de ningún proveedor. Consulta el límite actual en la documentación de tu propia herramienta y no en un resumen de terceros, porque estas cifras se mueven más deprisa que la mayoría de las guías publicadas.
¿Sirve de algo si la herramienta simplemente se equivoca en los datos?
En parte. El contexto correcto reduce una clase de error: la causada por un modelo que rellena un hueco que nunca debió tener. No elimina los errores confiados que nacen del propio proceso de generación, que son un problema aparte.
¿Y si mi empresa gestiona estos ajustes de forma centralizada?
Entonces la capa 1 puede quedar en parte fuera de tu alcance. Anthropic documenta un archivo de instrucciones gestionado a nivel de organización que los ajustes individuales no pueden excluir. Tu palanca se desplaza a la capa 2, donde el alcance del proyecto suele seguir siendo diseño tuyo.
Fuentes
- Liu, Lin, Hewitt, Paranjape, Bevilacqua, Petroni y Liang, Lost in the Middle: How Language Models Use Long Contexts, Transactions of the Association for Computational Linguistics, 2024. Precisión a libro cerrado y en condición oráculo para seis modelos; la curva posicional en U; el hallazgo de que las condiciones con 20 y 30 documentos pueden caer por debajo del rendimiento a libro cerrado.
- Anthropic, documentación oficial de Claude Code, página de referencia sobre memoria. La distinción entre archivos de instrucciones y memoria automática; los cuatro niveles de alcance; la recomendación de menos de 200 líneas y la afirmación de que los archivos más largos reducen el cumplimiento; el límite de carga de 200 líneas o 25 KB del índice de memoria; la nota de que los archivos de instrucciones son contexto y no configuración impuesta; las indicaciones sobre concreción, reglas contradictorias e importaciones.
- Google, documentación oficial de ayuda de Gemini Apps sobre cómo escribir instrucciones eficaces para Gems. La estructura de cuatro componentes de persona, tarea, contexto y formato, y el consejo de aportar todo el contexto posible.
Este contenido fue recopilado con el apoyo de la IA tras una investigación exhaustiva, y luego redactado y preparado para su publicación por el equipo editorial de CEOtudent.
This post is also available in:









