En resumen. La ventana de contexto es la parte de un modelo de IA que contiene lo que le das en una sola petición, y en 2026 es enorme. Anthropic, OpenAI y Google ofrecen modelos insignia con alrededor de un millón de tokens de contexto, lo que, según la propia tasa de conversión de Google (100 tokens equivalen a unas 60-80 palabras en inglés), supone aproximadamente entre 600.000 y 800.000 palabras. La tentación es pegarlo todo y dejar que el modelo lo ordene. La investigación dice que es un error. En el benchmark RULER, los 17 modelos evaluados anunciaban 32K tokens o más, pero solo la mitad mantenía un rendimiento satisfactorio a 32K (Hsieh y colaboradores, 2024). En NoLiMa, una prueba que elimina las coincidencias literales de palabras clave, 11 de 13 modelos cayeron por debajo de la mitad de su puntuación de contexto corto a 32K, y GPT-4o bajó del 99,3 al 69,7 por ciento (Modarressi y colaboradores, 2025). La propia documentación de Anthropic llama ya a la ventana de contexto la “memoria de trabajo” del modelo y advierte de que la precisión y la recuperación se degradan a medida que crece el número de tokens. Los humanos tenemos la misma limitación a menor escala: la memoria de trabajo retiene unos cuatro bloques de información nueva (Cowan, 2001), y la teoría de la carga cognitiva demuestra desde 1988 que la forma de presentar la información importa tanto como su cantidad (Sweller, van Merrienboer y Paas, 2019). El movimiento de CEO es tratar el contexto como un presupuesto con un coste por token. El movimiento de estudiante es escribir prompts que tú mismo podrías revisar, con el método Prompt Load-Fit que encontrarás más abajo.
Este artículo forma parte de la serie Oficio del prompt y del contexto. Si todavía no has escrito una descripción permanente de tu trabajo para las herramientas de IA, empieza por el archivo de contexto y por cómo configurar instrucciones personalizadas, proyectos y memoria. Esta pieza trata de la petición individual: qué incluir, en qué orden y en qué cantidad.
¿Qué es una ventana de contexto, en palabras sencillas?
Una ventana de contexto es la cantidad máxima de texto, medida en tokens, que un modelo puede leer y escribir en una sola petición. Todo cuenta: tus instrucciones, los documentos que pegas, la conversación hasta ese momento y la respuesta del modelo. Los tokens no son palabras. La documentación de Google ofrece la conversión que la mayoría necesita: para los modelos Gemini “un token equivale a unos 4 caracteres” y “100 tokens equivalen a unas 60-80 palabras en inglés”. Los tokenizadores de otros proveedores difieren ligeramente, así que toma cualquier conversión como una estimación.
La documentación de Anthropic describe la ventana en términos humanos. Dice que la ventana de contexto “representa una ‘memoria de trabajo’ para el modelo”, que “más contexto no es automáticamente mejor” y que “a medida que crece el número de tokens, la precisión y la recuperación se degradan, un fenómeno conocido como context rot”. Es un planteamiento de proveedor, no un experimento, pero es el punto de partida correcto: la ventana de contexto no es un disco duro. Se parece más a un escritorio, y un escritorio desordenado ralentiza a todo el mundo.
¿Qué tamaño tienen las ventanas de contexto en 2026?
La tabla siguiente recoge los límites documentados de los modelos insignia actuales, consultados en las páginas de modelos de cada proveedor el 7 de octubre de 2026. Estas cifras cambian a menudo; comprueba la página del proveedor antes de basarte en ellas.
| Proveedor | Modelo | Ventana de contexto | Salida máxima por petición | Fuente |
|---|---|---|---|---|
| Anthropic | Claude Fable 5.1, Opus 5.5, Sonnet 5.5 | 1M tokens | 128K tokens | Anthropic models overview |
| Anthropic | Claude Haiku 4.5 | 200K tokens | 64K tokens | Anthropic models overview |
| OpenAI | GPT-6 Astra, GPT-6.1 Sol, GPT-6 Luna | 1,05M tokens | 128K tokens | Página de modelos de OpenAI |
| Gemini 3.1 Pro Preview | 1.048.576 tokens | 65.536 tokens | Página del modelo en la API de Gemini | |
| Gemini 3.8 Flash | 1.048.576 tokens | 65.536 tokens | Página del modelo en la API de Gemini |
Google ofrece una idea de la escala: en la práctica, dice, un millón de tokens equivaldría a “50.000 líneas de código”, “8 novelas en inglés de extensión media” o “transcripciones de más de 200 episodios de pódcast de duración media”. Aplicando la propia proporción de Google, una ventana de 1.048.576 tokens corresponde aproximadamente a entre 629.000 y 839.000 palabras en inglés (cálculo de CEOtudent: 1.048.576 tokens x 0,60 a 0,80 palabras por token).
La cifra principal responde a una pregunta: ¿cuánto puedes enviar? No responde a la que importa para tu trabajo: ¿cuánto aprovechará realmente bien el modelo?
¿Una ventana más grande significa que el modelo la usa entera?
No, y es el hallazgo más constante de la investigación sobre contextos largos.
La posición importa. En “Lost in the Middle”, Liu y colaboradores (2024) comprobaron que “el rendimiento es máximo cuando la información relevante aparece al principio (sesgo de primacía) o al final del contexto de entrada (sesgo de recencia), y se degrada de forma significativa cuando los modelos deben acceder a información situada en el medio y utilizarla”. En su prueba de respuesta a preguntas con varios documentos, el rendimiento de GPT-3.5-Turbo podía “caer más de un 20%”, y en el peor caso quedaba por debajo de su rendimiento sin ningún documento (56,1 por ciento). Eran modelos de 2023, así que las magnitudes no se trasladan directamente a los modelos de 2026. La forma del problema, un centro débil, ha seguido apareciendo.
La longitud anunciada no es la longitud efectiva. RULER (Hsieh y colaboradores, 2024) evaluó 17 modelos de contexto largo en 13 tareas. Casi todos obtuvieron puntuaciones casi perfectas en la sencilla prueba de “la aguja en el pajar”, pero “solo la mitad puede mantener un rendimiento satisfactorio con una longitud de 32K”. NoLiMa (Modarressi y colaboradores, 2025) endureció la prueba eliminando la coincidencia literal de palabras entre la pregunta y la respuesta, algo más parecido a cómo funcionan las preguntas reales. De 13 modelos que anunciaban al menos 128K tokens, “11 modelos caen por debajo del 50% de sus sólidas referencias en longitud corta” a 32K.
El contexto irrelevante resta precisión incluso cuando la respuesta está ahí. El informe “Context Rot” de Chroma (2025), un informe del sector elaborado por una empresa de bases de datos de recuperación y sin revisión por pares, evaluó 18 modelos. En un experimento comparó prompts enfocados de unos 300 tokens con la versión completa de 113k tokens de la misma tarea conversacional, que incluía material irrelevante, y observó “una degradación constante del rendimiento con la entrada completa”.
Los proveedores dicen lo mismo en sus propias guías. La guía de GPT-4.1 de OpenAI informa de un rendimiento muy bueno en la prueba de la aguja en el pajar hasta 1M tokens, pero añade que “el rendimiento con contexto largo puede degradarse a medida que hay que recuperar más elementos o realizar un razonamiento complejo que requiere conocer el estado de todo el contexto”. La documentación de Google sobre contexto largo señala que con varias “agujas” el modelo “no rinde con la misma precisión”.
Contexto anunciado frente a contexto efectivo: lo que encontraron los benchmarks
Los dos benchmarks definen la “longitud efectiva” de forma distinta. RULER usa la mayor longitud a la que un modelo sigue superando un umbral fijo (85,6 por ciento, la puntuación de Llama2-7B a 4K). NoLiMa usa la mayor longitud a la que un modelo conserva al menos el 85 por ciento de su propia puntuación de contexto corto. La columna de proporción es un cálculo de CEOtudent (efectivo dividido entre anunciado, tomando K como 1.000).
| Modelo (año del benchmark) | Contexto anunciado | Contexto efectivo | Efectivo como parte del anunciado | Benchmark |
|---|---|---|---|---|
| GPT-4 (2024) | 128K | 64K | 50% | RULER |
| GPT-4o (2025) | 128K | 8K | 6,3% | NoLiMa |
| Claude 3.5 Sonnet (2025) | 200K | 4K | 2% | NoLiMa |
| Gemini 1.5 Pro (2025) | 2M | 2K | 0,1% | NoLiMa |
Síntesis original del marco editorial de CEOtudent a partir de la Tabla 3 de RULER y de la tabla de resultados de NoLiMa. Son modelos antiguos evaluados en tareas de recuperación deliberadamente difíciles; es probable que los modelos actuales lo hagan mejor, y cuando se escribió este texto no había ningún benchmark independiente de los modelos de 2026 citados arriba. Lo importante es la brecha, no la cifra exacta.
La lección para un trabajador del conocimiento es sencilla: la ventana de contexto es un techo, no una garantía. Si tu respuesta depende de algo enterrado en la página 140 de un documento pegado, el modelo puede pasarlo por alto, y puede que tú no lo notes.
¿Qué dice la ciencia cognitiva sobre la memoria de trabajo humana?
El lado humano del problema es más antiguo y está mejor estudiado.
La capacidad es pequeña. El artículo de George Miller de 1956 observaba que “esta capacidad ronda los siete elementos”, pero también señalaba que se mide en bloques, no en bits sin procesar: “podemos aumentar la cantidad de bits de información que contiene simplemente construyendo bloques cada vez más grandes”. La revisión de Nelson Cowan de 2001 sostenía que el siete de Miller era “más una estimación aproximada y un recurso retórico que un límite real de capacidad” y proponía “un único límite central de capacidad de unos cuatro bloques de media”.
La carga es de tres tipos. La teoría de la carga cognitiva, que nació con el trabajo de John Sweller de 1988 sobre resolución de problemas, distingue tres fuentes de carga. La revisión de 2019 de Sweller, van Merrienboer y Paas las resume así:
– La carga intrínseca es la complejidad real de la tarea. “Solo puede cambiarse cambiando lo que hay que aprender o cambiando la pericia de quien aprende”.
– La carga extrínseca es el coste de una mala presentación. “No está determinada por la complejidad intrínseca de la información, sino por cómo se presenta la información y por lo que se exige hacer a quien aprende”.
– La carga germana se definió originalmente como la carga “necesaria para aprender”. La revisión de 2019 la replantea como la memoria de trabajo dedicada a la tarea intrínseca, no como una carga aparte.
Lo conocido sale barato. La misma revisión señala que la memoria de trabajo “tenía una capacidad y una duración limitadas al tratar información nueva, pero esas limitaciones desaparecían en la práctica cuando la memoria de trabajo trataba información transferida desde la memoria a largo plazo”. Los expertos pueden manejar entradas largas y densas de su campo porque las leen como unos pocos bloques grandes.
La información dividida y redundante perjudica. Chandler y Sweller (1991) comprobaron en seis experimentos que “la información de fuentes divididas puede generar una carga cognitiva elevada, porque el material debe integrarse mentalmente antes de que pueda empezar el aprendizaje”, y que “un material explicativo aparentemente útil pero no esencial” podía tener “efectos perjudiciales” incluso una vez integrado.
Lo que ayuda a los principiantes puede perjudicar a los expertos. Kalyuga y colaboradores (2003) bautizaron el efecto de inversión de la pericia: técnicas que son “muy eficaces con aprendices sin experiencia pueden perder su eficacia e incluso tener consecuencias negativas cuando se usan con aprendices más experimentados”.
¿Dónde se encuentran el modelo y el humano?
Las dos literaturas se construyeron por separado, pero describen el mismo problema de diseño: un lector con atención limitada, mucho texto disponible y una tarea que depende de encontrar y combinar las partes adecuadas. El equipo de ingeniería de Anthropic hizo explícita la comparación en septiembre de 2025: “Al igual que los humanos, que tienen una capacidad de memoria de trabajo limitada, los LLM tienen un ‘presupuesto de atención’”, y “cada nuevo token introducido agota este presupuesto en cierta medida”. Los autores del benchmark IFScale usan el mismo lenguaje cuando describen modelos que “empiezan a tener dificultades bajo carga cognitiva” a medida que aumenta el número de instrucciones. Son analogías, no pruebas de que los modelos y los cerebros funcionen igual. Resultan útiles porque los consejos de diseño de ambos lados convergen.
| Problema de diseño | Evidencia humana | Evidencia del modelo | Qué significa para tu prompt |
|---|---|---|---|
| Demasiado a la vez | Unos cuatro bloques de información nueva (Cowan, 2001) | La mitad de 17 modelos se degrada a 32K (RULER) | Envía el conjunto mínimo de material que responde a la pregunta |
| Efectos de posición | No lo cubren las fuentes revisadas aquí | Mejor al principio o al final, centro débil (Liu y colaboradores, 2024) | Pon el material primero y la pregunta al final, o repite las instrucciones clave |
| Material irrelevante | La explicación no esencial puede perjudicar (Chandler y Sweller, 1991) | La entrada completa de 113k tokens rinde peor que una versión enfocada de 300 tokens (Chroma, 2025) | Elimina lo que tú mismo te saltarías |
| Instrucciones contradictorias | Las fuentes divididas deben integrarse antes de empezar a trabajar | GPT-5 “gasta tokens de razonamiento buscando una forma de conciliar las contradicciones” (OpenAI) | Resuelve las contradicciones antes de enviar |
| Demasiadas reglas | Límites de la memoria de trabajo ante reglas nuevas | El mejor de 20 modelos llega a un 68% de precisión con 500 instrucciones (IFScale) | Mantén pocas reglas permanentes y que sean específicas |
| Pericia | El material conocido cuesta poco (Sweller y colaboradores, 2019) | Anthropic: “las etiquetas XML ayudan a Claude a interpretar prompts complejos sin ambigüedad” | Estructura las entradas para que se lean como unos pocos bloques grandes |
Tabla comparativa: marco editorial de CEOtudent, elaborada a partir de las fuentes citadas en cada celda.
El Prompt Load-Fit: un método en cinco pasos
El método siguiente es un marco editorial de CEOtudent. No es un protocolo probado; traduce la evidencia anterior a pasos que puedes aplicar a cualquier prompt serio. Su premisa es que un prompt debe encajar en dos memorias de trabajo a la vez: la del modelo, para que aproveche bien el contexto, y la tuya, para que puedas revisar la respuesta.
Paso 1. Nombra la carga intrínseca en una frase. Escribe en qué consiste realmente la tarea antes de añadir nada. “Decide si la cláusula 7 de este contrato entra en conflicto con nuestra política de datos” es una tarea. “Mira este contrato” no lo es. Si no puedes escribir la frase, el problema no es el modelo.
Paso 2. Recorta la carga extrínseca. Repasa cada documento e instrucción que ibas a pegar y pregúntate: ¿necesitaría esto para hacer la tarea yo mismo? Elimina el resto. Los ingenieros de Anthropic describen el objetivo como “el conjunto más pequeño posible de tokens con mucha señal que maximice la probabilidad de un resultado deseado”. En la práctica eso significa extractos en lugar de archivos completos, una versión de un documento en lugar de tres borradores y ningún contexto de fondo que te saltarías si te lo entregara un colega.
Paso 3. Agrupa en bloques lo que queda. Etiqueta cada bloque de material con un encabezado o una etiqueta breve para que se lea como un solo bloque, igual que un experto lee material conocido. Limita las reglas permanentes a una lista corta. La heurística de los cuatro bloques, no más de unas cuatro exigencias distintas por petición, es una regla práctica editorial derivada de la estimación de Cowan para humanos; no es un límite medido en los modelos.
Paso 4. Coloca según la posición. Para entradas largas, Anthropic recomienda poner “tus documentos y entradas largas cerca del principio del prompt, por encima de tu consulta”, y afirma que “las consultas al final pueden mejorar la calidad de la respuesta hasta en un 30 por ciento en las pruebas”. Google da el mismo consejo. La guía de GPT-4.1 de OpenAI comprobó que colocar las instrucciones “tanto al principio como al final del contexto proporcionado” funcionaba mejor. Una opción segura por defecto que satisface a los tres: una línea con la tarea arriba, el material en el medio y la pregunta completa más el formato de salida al final.
Paso 5. Haz que la respuesta se pueda verificar. Pide al modelo que cite los pasajes en los que se ha basado antes de responder. Anthropic sugiere exactamente esto para documentos largos: “pide a Claude que cite primero las partes relevantes de los documentos”. Las citas convierten un contexto largo en uno corto para ti, que revisas, y dejan al descubierto cuándo el modelo ha ido al centro débil y ha vuelto con lo que no era.
El Mapa de carga del prompt
| Tipo de carga | En un prompt, se ve así | Señal de que es demasiado alta | Solución |
|---|---|---|---|
| Intrínseca | La dificultad real de la tarea | No puedes formular la tarea en una frase | Divide la tarea en prompts secuenciales |
| Extrínseca | Archivos pegados, borradores antiguos, reglas contradictorias, historial de chat largo | La respuesta cita la sección equivocada o ignora un dato clave | Reduce a extractos; empieza una conversación nueva con un resumen |
| Germana (redirigida) | Etiquetas, ejemplos, un formato de salida explícito | Dedicas más tiempo a interpretar la respuesta que a leerla | Añade estructura: encabezados, una plantilla, un ejemplo resuelto |
Marco editorial de CEOtudent, adaptado de las tres categorías de carga de Sweller, van Merrienboer y Paas (2019).
¿Por qué importa esto para tu propio pensamiento?
En cada prompt hay una segunda memoria de trabajo: la tuya. Los prompts y las respuestas largas desplazan el esfuerzo de pensar a revisar, y la evidencia sugiere que la gente no siempre está a la altura.
- En una encuesta a 319 trabajadores del conocimiento que compartieron 936 ejemplos, Lee y colaboradores (CHI 2025) encontraron que “una mayor confianza en la IA generativa se asocia con menos pensamiento crítico, mientras que una mayor confianza en uno mismo se asocia con más pensamiento crítico”. La naturaleza del pensamiento crítico se desplazó “hacia la verificación de la información, la integración de respuestas y la supervisión de la tarea”. Son datos autodeclarados y correlacionales.
- Gerlich (2025) encuestó y entrevistó a 666 participantes e informó de “una correlación negativa significativa entre el uso frecuente de herramientas de IA y la capacidad de pensamiento crítico, mediada por una mayor descarga cognitiva”. También correlacional.
- En una preimpresión del MIT Media Lab que aún no ha pasado revisión por pares, Kosmyna y colaboradores (2025) siguieron a 54 participantes mientras escribían ensayos. En la primera sesión, el 83,3 por ciento del grupo asistido por IA (15 de 18) no pudo citar correctamente su propio ensayo, frente al 11,1 por ciento (2 de 18) en cada uno de los otros dos grupos. La muestra es pequeña y el contexto, limitado.
- En un experimento de campo preregistrado con 758 trabajadores del conocimiento, Dell’Acqua y colaboradores (Organization Science, 2026) comprobaron que, en 18 tareas dentro de las capacidades de la IA, quienes usaban IA completaron un 12,2 por ciento más de tareas, un 25,1 por ciento más rápido y con una calidad significativamente mejor. En una tarea fuera de esas capacidades, tenían “un 19% menos de probabilidades de producir soluciones correctas”. Saber a qué lado de la línea está una tarea es un trabajo humano.
Risko y Gilbert (2016) definen la descarga cognitiva como el uso de “la acción física para alterar los requisitos de procesamiento de información de una tarea con el fin de reducir la demanda cognitiva”. Descargar no es el problema; es como las personas han ampliado siempre su mente. El problema es descargar la verificación. Un prompt que no puedes revisar en unos minutos es un prompt que aprobarás sin revisarlo. Para profundizar en ese equilibrio, consulta si la IA te está volviendo peor pensando y el presupuesto de carga cognitiva.
¿Cuándo conviene usar igualmente el contexto largo?
El objetivo no son los prompts cortos por sí mismos. El contexto largo es la herramienta adecuada cuando:
– La tarea es una búsqueda en un gran volumen que no puedes filtrar previamente, como encontrar todas las menciones de un proveedor en un año de actas de reuniones. Cuenta con que habrá omisiones y pide citas.
– Lo que importa es la coherencia de todo el documento, como revisar contradicciones en una propuesta de 60 páginas. Divídela en secciones y pide al modelo que resuma cada una antes de compararlas.
– Estás montando un espacio de trabajo reutilizable, como un proyecto con documentos de referencia permanentes. Aquí la estructura del material importa más que su tamaño: un archivo de contexto limpio y etiquetado vale más que una carpeta de exportaciones en bruto. Cómo elegir el modelo adecuado para ese trabajo se explica en qué modelo de IA para qué tarea, y cómo mantener reutilizables tus mejores prompts, en bibliotecas de prompts para profesionales.
Es la herramienta equivocada cuando la razón sincera por la que lo pegas todo es que no has decidido cuál es la pregunta.
Una comprobación Load-Fit de 10 minutos
Hazla antes de cualquier prompt cuya revisión te vaya a llevar más de cinco minutos:
- ¿Puedo formular la tarea en una frase?
- ¿He eliminado todos los documentos que yo mismo no necesitaría?
- ¿Hay una sola versión de cada documento?
- ¿He resuelto las instrucciones contradictorias?
- ¿Hay cuatro exigencias distintas o menos?
- ¿Está etiquetado cada bloque de material?
- ¿Está el material arriba y la pregunta al final?
- ¿He indicado el formato de salida?
- ¿He pedido citas o referencias a los pasajes de origen?
- ¿Podría revisar la respuesta en el tiempo del que dispongo?
Lista de comprobación: marco editorial de CEOtudent.
Preguntas frecuentes
¿Entonces una ventana de contexto de 1M tokens no sirve para nada?
Sí sirve. Elimina un límite rígido, lo que es valioso para búsquedas y para espacios de trabajo reutilizables. Los benchmarks muestran que la calidad del uso cae mucho antes de llegar al límite, así que conviene tratar la ventana como margen y no como objetivo.
¿Se aplican estos resultados de benchmarks a los modelos más recientes?
No directamente. RULER y NoLiMa evaluaron modelos de 2024 y principios de 2025, y es probable que los modelos más nuevos lo hagan mejor. Las guías de los proveedores para los modelos actuales siguen recomendando un contexto enfocado y una colocación cuidadosa, y cuando se escribió este artículo no había ningún benchmark independiente de los modelos de 2026 citados arriba.
¿Las instrucciones van arriba o abajo?
Los proveedores difieren ligeramente. Anthropic y Google recomiendan el material largo primero y la pregunta al final. La guía de GPT-4.1 de OpenAI comprobó que las instrucciones al principio y al final funcionaban mejor, y que, si solo se ponen una vez, mejor por encima del contexto que por debajo. Una línea breve con la tarea arriba más la pregunta completa al final cubre ambos casos.
¿Sigue siendo “siete más o menos dos” la regla de la memoria de trabajo?
El propio Miller describió el siete como aproximado y medido en bloques. La revisión de Cowan de 2001 sitúa el límite en unos cuatro bloques de información nueva. El número exacto importa menos que el principio: menos bloques, más grandes y bien etiquetados.
¿Significa esto que la IA hace que la gente piense menos?
La evidencia es dispar y sobre todo correlacional. La lectura más prudente es que la confianza en la herramienta tiende a reducir el esfuerzo que se dedica a verificarla. Diseñar prompts cuyas respuestas puedas comprobar mantiene ese esfuerzo en su sitio.
Fuentes
- Anthropic. Models overview; Context windows; Prompting best practices (long context prompting). Claude Platform Docs. Consultado el 7 de octubre de 2026.
- Anthropic Applied AI team. Effective context engineering for AI agents. Anthropic Engineering, 29 de septiembre de 2025.
- OpenAI. Models. Documentación de la API de OpenAI. Consultado el 7 de octubre de 2026.
- OpenAI. GPT-4.1 Prompting Guide; GPT-5 prompting guide. OpenAI Cookbook, 2025.
- Google. Páginas de modelo de Gemini 3.1 Pro Preview y Gemini 3.8 Flash; Long context; Understand and count tokens. Documentación de la API de Gemini. Consultado el 7 de octubre de 2026.
- Liu NF, Lin K, Hewitt J, Paranjape A, Bevilacqua M, Petroni F, Liang P. Lost in the Middle: How Language Models Use Long Contexts. Transactions of the Association for Computational Linguistics. 2024;12:157-173.
- Hsieh CP, Sun S, Kriman S, Acharya S, Rekesh D, Jia F, Zhang Y, Ginsburg B. RULER: What’s the Real Context Size of Your Long-Context Language Models? COLM 2024.
- Modarressi A, Deilamsalehy H, Dernoncourt F, Bui T, Rossi R, Yoon S, Schuetze H. NoLiMa: Long-Context Evaluation Beyond Literal Matching. ICML 2025.
- Hong K, Troynikov A, Huber J. Context Rot: How Increasing Input Tokens Impacts LLM Performance. Chroma Technical Report, 14 de julio de 2025. Informe del sector, sin revisión por pares.
- Jaroslawicz D, Whiting B, Shah P, Maamari K. How Many Instructions Can LLMs Follow at Once? arXiv 2507.11538, 2025. Preimpresión.
- Miller GA. The magical number seven, plus or minus two: Some limits on our capacity for processing information. Psychological Review. 1956;63(2):81-97.
- Cowan N. The magical number 4 in short-term memory: A reconsideration of mental storage capacity. Behavioral and Brain Sciences. 2001;24(1):87-114. Resumen.
- Sweller J. Cognitive load during problem solving: Effects on learning. Cognitive Science. 1988;12(2):257-285. Resumen.
- Sweller J, van Merrienboer JJG, Paas F. Cognitive Architecture and Instructional Design: 20 Years Later. Educational Psychology Review. 2019;31:261-292.
- Chandler P, Sweller J. Cognitive Load Theory and the Format of Instruction. Cognition and Instruction. 1991;8(4):293-332. Resumen.
- Kalyuga S, Ayres P, Chandler P, Sweller J. The Expertise Reversal Effect. Educational Psychologist. 2003;38(1):23-31. Resumen.
- Risko EF, Gilbert SJ. Cognitive Offloading. Trends in Cognitive Sciences. 2016;20(9):676-688. Resumen.
- Lee HP, Sarkar A, Tankelevitch L, Drosos I, Rintel S, Banks R, Wilson N. The Impact of Generative AI on Critical Thinking: Self-Reported Reductions in Cognitive Effort and Confidence Effects From a Survey of Knowledge Workers. CHI 2025.
- Gerlich M. AI Tools in Society: Impacts on Cognitive Offloading and the Future of Critical Thinking. Societies. 2025;15(1):6. Resumen.
- Kosmyna N, Hauptmann E, Yuan YT, Situ J, Liao XH, Beresnitzky AV, Braunstein I, Maes P. Your Brain on ChatGPT: Accumulation of Cognitive Debt when Using an AI Assistant for Essay Writing Task. MIT Media Lab, arXiv 2506.08872, 2025. Preimpresión, sin revisión por pares.
- Dell’Acqua F, McFowland E III, Mollick E, Lifshitz-Assaf H, y colaboradores. Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality. Organization Science. 2026;37(2). Resumen.
La tabla de contexto anunciado frente a efectivo, la tabla comparativa entre humano y modelo, el método Prompt Load-Fit, el Mapa de carga del prompt y la comprobación de 10 minutos son análisis de CEOtudent basados en las fuentes anteriores. Todas las demás cifras se recogen tal como aparecen publicadas en esas fuentes; las fuentes leídas solo en forma de resumen están indicadas. Dos cifras muy repetidas no se usaron porque no se encontraron en los textos publicados: un resultado de “un 40 por ciento más de calidad” atribuido al estudio de la frontera irregular y una regla de “tres cuartos de palabra por token” atribuida a OpenAI.
Este contenido fue recopilado con el apoyo de la IA tras una investigación exhaustiva, y luego redactado y preparado para su publicación por el equipo editorial de CEOtudent.
This post is also available in:












