Dijitalİş
0

Bibliotecas de prompts para profesionales: cómo crear, organizar y reutilizar tus mejores prompts

A professional at a bright home office desk sorting blank index cards into a wooden card box, building a reusable prompt library

Resumen. La mayoría de los profesionales ya usa la IA en el trabajo, y casi ninguno conserva lo que funciona. La encuesta de Gallup de mayo de 2026 encontró que el 52 % de los empleados de EE. UU. usa la IA en su puesto al menos unas pocas veces al año, el 30 % unas pocas veces por semana o más y el 15 % a diario, frente al 40, el 19 y el 8 % un año antes. Solo el 25 % afirma que su organización ha comunicado un plan claro para integrarla. La serie de encuestas del Banco de la Reserva Federal de San Luis cifra el tiempo ahorrado por los trabajadores que usan IA generativa en el 5,4 % de sus horas, unas 2,2 horas en una semana de 40 horas, y la proporción de todas las horas de trabajo ahorradas pasó del 1,6 % al 2,2 % entre finales de 2024 y mediados de 2026. Tres líneas de investigación muestran por qué una biblioteca de prompts personal es la forma más barata de hacer que ese tiempo se capitalice. Los prompts son frágiles: cambiar solo separadores, espaciado o mayúsculas movió la exactitud hasta 76 puntos en un estudio de referencia, y una sola plantilla de prompt produce clasificaciones de modelos poco fiables en muchas tareas. Las personas diseñan mal los prompts por defecto: en un estudio de Berkeley, los no expertos iteraban de forma oportunista y daban el éxito por conseguido tras una sola salida buena. Y la calidad del prompt importa: en una muestra controlada de estudiantes explicó entre el 53 y el 78 % de la varianza en la calidad de la salida. Un análisis de CEOtudent cruza las encuestas de adopción con ocho experimentos de campo en un Índice de prioridad de plantillas que te dice qué familias de tareas merecen una plantilla primero, y después aporta la ficha de prompt, la estructura de carpetas y las reglas de mantenimiento. La jugada del CEO es tratar tus prompts como activos versionados. La jugada del estudiante es tratar cada uno como una hipótesis con casos de prueba.

Este artículo es el complemento de sistemas de nuestro hub sobre la pila de alfabetización en IA. Aquel texto sostenía que el prompting es una capa entre varias. Este trata de la capa que la mayoría de los profesionales se salta: almacenar, probar y reutilizar los prompts que ya les funcionan.

¿Por qué importa más una biblioteca que un prompt mejor?

Cuatro hallazgos, cada uno procedente de un tipo de estudio distinto, apuntan a la misma conclusión.

Los prompts son frágiles, así que reutiliza exactamente el que funcionó. En un artículo de ICLR 2024, Sclar, Choi, Tsvetkov y Suhr no cambiaron más que el formato de prompts few-shot (separadores, espaciado, mayúsculas y minúsculas en los nombres de campo) y hallaron “diferencias de rendimiento de hasta 76 puntos de exactitud” para LLaMA-2-13B, con unos 10 puntos de variación de media en más de 50 tareas y varios modelos. La sensibilidad se redujo, pero no desapareció, en los modelos más grandes y ajustados por instrucciones; GPT-3.5 mostró una dispersión mediana de 0,064 con un máximo de 0,562 en 53 tareas. Mizrahi y colaboradores, al evaluar 20 modelos en 39 tareas con más de 5.000 paráfrasis de instrucciones, encontraron que una sola plantilla “conduce a clasificaciones poco fiables en muchas de las tareas”, con la mayoría de las puntuaciones de concordancia por debajo de 0,85. La lectura práctica no es que debas diseñar el prompt perfecto. Es que, una vez que un formato funciona para tu tarea, volver a teclearlo de memoria cada vez tira el resultado por la borda.

Las personas iteran mal por defecto. Zamfirescu-Pereira, Wong, Hartmann y Yang observaron a 10 no expertos diseñando prompts para chatbots en un estudio para CHI 2023. Los participantes “exploraron los diseños de prompts de forma oportunista, no sistemática”, sobregeneralizaron “a partir de observaciones aisladas de éxito y de fracaso”, y “la mayoría declara el éxito tras una sola instancia y pasa a otra cosa”. Varios insistían en empezar cada instrucción con “por favor”. Una biblioteca con casos de prueba es una contramedida directa: un prompt no se promociona hasta que ha funcionado con más de una entrada.

La calidad del prompt predice la calidad de la salida. En un estudio de 2024 con 45 estudiantes universitarios realizado por Knoth, Tolzin, Janson y Leimeister, la calidad del prompt (puntuada en seis componentes) explicó el 53 % de la varianza en la calidad de la salida en una tarea de planificación de viajes y el 78 % en una tarea de planificación de proyectos. La muestra es pequeña y las tareas son académicas, pero la dirección coincide con todos los experimentos de campo que siguen.

Las ganancias son reales pero desiguales, así que necesitas un mapa de dónde están. Los experimentos de campo resumidos en la sección siguiente informan de grandes efectos sobre la productividad en familias de tareas concretas y de una penalización medible cuando la IA se usa fuera de su competencia. Una biblioteca es donde registras ambas caras: para qué usar un prompt y para qué no.

¿Qué han medido realmente los experimentos de campo?

Estudio (fuente primaria) Contexto y muestra Familia de tareas Efecto verificado Salvedad registrada en el artículo
Noy y Zhang, 2023, Science 453 profesionales con estudios universitarios, tareas de redacción incentivadas, la mitad con acceso a ChatGPT Redacción profesional Tiempo medio un 40 % menor, calidad un 18 % mayor; los trabajadores expuestos eran 2 veces más propensos a usarla en su trabajo dos semanas después Tareas cortas calificadas por evaluadores; una sola herramienta y una sola generación de modelo
Dell’Acqua y colaboradores, 2023, documento de trabajo de Harvard Business School 758 consultores de una misma firma, 18 tareas realistas dentro de la frontera de la IA, una tarea fuera Análisis, redacción, memorandos de estrategia Dentro de la frontera: 12,2 % más tareas, 25,1 % más rápido, más del 40 % de mayor calidad; los de rendimiento inferior a la media ganaron un 43 %, los superiores a la media un 17 %. El grupo que recibió una introducción a la ingeniería de prompts elevó las puntuaciones de calidad un 25,1 % frente al 17,9 % de la IA sola Fuera de la frontera, los usuarios de IA tenían 19 puntos porcentuales menos de probabilidad de acertar (control en torno al 84,5 %, grupos con IA 60 y 70 %)
Brynjolfsson, Li y Raymond, 2025, Quarterly Journal of Economics (versión de arXiv) 5.172 agentes de atención al cliente, despliegue escalonado de un asistente de IA Atención al cliente por chat Incidencias resueltas por hora un 15 % más de media; alrededor del 30 % para los agentes menos experimentados, 36 % en el quintil de menor cualificación; los agentes siguieron las recomendaciones el 35 % de las veces Ganancias mínimas y pequeñas caídas de calidad para los agentes más experimentados
Peng, Kalliamvakou, Cihon y Demirer, 2023, arXiv 95 programadores profesionales, una tarea de servidor HTTP Programación El grupo tratado fue un 55,8 % más rápido (71,17 frente a 160,89 minutos), intervalo de confianza del 21 al 89 % Una sola tarea y una muestra pequeña, por lo que el intervalo de confianza es amplio
Cui, Demirer, Jaffe, Musolff, Peng y Salz, 2025 (Microsoft, Accenture y una empresa de la lista Fortune 100) 4.867 desarrolladores en tres despliegues aleatorizados Programación 26,08 % más tareas completadas (error estándar 10,3); los desarrolladores júnior ganaron entre un 21 y un 40 %, los sénior entre un 7 y un 16 % Cada experimento es ruidoso por sí solo; la adopción entre los desarrolladores tratados osciló entre el 42,5 y el 75,6 % en distintos momentos, así que los efectos son por usuario
Chatterji y colaboradores, 2025, NBER (uso de ChatGPT) Alrededor de 1,1 millones de conversaciones muestreadas, de mayo de 2024 a junio de 2025 Todo el uso laboral La redacción supone el 40 % de los mensajes de trabajo; unos dos tercios de los mensajes de redacción piden al modelo modificar texto aportado por el usuario en lugar de redactar desde cero; alrededor del 81 % de los mensajes de trabajo corresponden a dos actividades amplias, gestionar información y tomar decisiones o resolver problemas Solo planes de consumo; basado en un clasificador

El patrón que recorre la tabla es la base del índice que sigue. Las ganancias son mayores donde la tarea es frecuente, está bien especificada y cae dentro de la competencia del modelo, y son mayores para las personas con menos experiencia en la tarea. El único estudio que probó directamente la orientación sobre prompts (el grupo con introducción de Dell’Acqua) halló que mejoraba aún más la calidad. El único estudio que probó una tarea fuera de la frontera encontró una penalización lo bastante grande como para anular el beneficio.

¿Cuánto se usa la IA y cuánto tiempo ahorra?

Dos programas de encuestas independientes siguen la misma pregunta con definiciones distintas, así que los mantenemos en filas separadas y no los empalmamos.

Fuente Medida Últimos valores verificados Tendencia
Panel trimestral de Gallup sobre la fuerza laboral (empleados de EE. UU., de 19.043 a 23.717 encuestados por oleada) Usa la IA en su puesto unas pocas veces al año o más / unas pocas veces por semana o más / a diario 52 / 30 / 15 % (mayo de 2026) 40 / 19 / 8 % en mayo de 2025; uso diario del 4 % en mayo de 2024
Gallup, mismo panel La organización ha comunicado un plan claro de IA 25 % (mayo de 2026) 22 % en mayo de 2025; el 47 % dice que su organización ha integrado herramientas de IA
Gallup, mismo panel Usos más comunes entre los usuarios de IA Redacción y edición 51 %, búsqueda o investigación 49 %, asistencia general o resolución de problemas 39 % Oleada de mayo de 2026
Bick, Blandin y Deming, Real-Time Population Survey, documento de trabajo 32966 del NBER Proporción de trabajadores de EE. UU. que usan IA generativa en el trabajo; tiempo ahorrado 26,5 % algún uso, 9,0 % todos los días laborables, 22,9 % semanalmente (agosto y noviembre de 2024); los usuarios ahorran el 5,4 % de sus horas de trabajo, el 1,4 % en el conjunto de los trabajadores Tareas situadas entre las dos principales: redacción 39,5 %, administrativas 25,6, interpretar o resumir 22,7, búsqueda de datos 18,0, generación de ideas 13,2, programación 12,9, documentación 12,7
Rastreador de adopción de IA generativa de la Fed de San Luis (misma encuesta, definiciones revisadas) Uso laboral semanal; horas asistidas; horas ahorradas 39,2 % de uso semanal (segundo trimestre de 2026); 6,3 % de las horas asistidas; 2,2 % de las horas ahorradas Desde el 28,2, el 4,1 y el 1,6 % en el tercer trimestre de 2024

Dos cifras de estas tablas fijan lo que está en juego. Un trabajador que usa IA generativa ahorra unas 2,2 horas a la semana según su propia estimación, y tres de cada cuatro trabajadores no tienen ningún plan organizativo que les ayude. El sistema que exista va a ser personal.

El Índice de prioridad de plantillas

La tabla siguiente es un marco editorial de CEOtudent. Cruza tres fuentes verificadas que no se habían combinado antes: las cuotas de casos de uso de Gallup entre los usuarios de IA, las tareas laborales mejor clasificadas de la encuesta de la Fed y la evidencia de los experimentos de campo por familia de tareas. La prioridad se asigna según una regla explícita, no solo por criterio: Prioridad 1 significa que la familia de tareas es a la vez frecuente (entre las tres primeras en cualquiera de las dos encuestas) y está respaldada por al menos un estudio de campo aleatorizado o cuasialeatorizado; Prioridad 2 significa que cumple una de las dos condiciones; Prioridad 3 significa que no cumple ninguna, o que la evidencia lleva una advertencia de verificación.

Familia de tareas Porcentaje de usuarios de IA (Gallup, mayo de 2026) Porcentaje que la sitúa entre sus dos principales (encuesta de la Fed, 2024) Evidencia de campo más sólida Repetibilidad (editorial) Prioridad
Editar y reescribir texto que tú aportas 51 % (redacción y edición) 39,5 % (redacción) Noy y Zhang: 40 % más rápido, 18 % más de calidad; dos tercios de los mensajes de redacción en ChatGPT son ediciones Alta: mismas entradas, misma audiencia, cada semana 1
Redactar documentos rutinarios y texto administrativo Dentro del 51 % 25,6 % (administrativas), 12,7 % (documentación) Brynjolfsson, Li y Raymond: 15 % más incidencias resueltas en trabajo de soporte con guion Alta 1
Resumir, interpretar y traducir No se informa por separado 22,7 % Dell’Acqua: las tareas dentro de la frontera incluían análisis y síntesis, 12,2 % más tareas, más del 40 % de calidad Media: las entradas varían 2
Análisis estructurado y resolución de problemas 39 % (asistencia general o resolución de problemas) No se informa por separado Dell’Acqua: grandes ganancias dentro de la frontera, 19 puntos porcentuales peor fuera Media, con una marca de frontera en cada ficha 2
Investigación y búsqueda de datos 49 % 18,0 % Ningún estudio de campo aleatorizado midió la exactitud de la búsqueda con IA en el trabajo Baja: cada salida necesita verificación 3
Programación No se informa por separado 12,9 % Peng: 55,8 % más rápido; Cui: 26,08 % más tareas Alta para desarrolladores 1 para desarrolladores; en otro caso, no aplica
Generación de ideas No se informa por separado 13,2 % Ningún estudio de campo la aisló; Noy y Zhang describen un desplazamiento de las tareas hacia la generación de ideas y la edición Baja: las salidas no son comparables 3

Lee el índice como un orden de construcción. Tus tres primeras fichas deberían cubrir la edición de texto que escribiste tú, los documentos rutinarios que produces cada semana y (si programas) tu tarea de programación más habitual. Los prompts de investigación van los últimos y llevan un paso de verificación por diseño.

La ficha de prompt: una plantilla, nueve campos

Una biblioteca vale lo que vale su unidad de almacenamiento. Recomendamos una ficha de nueve campos, guardada en texto plano para que sobreviva a cualquier cambio de herramienta. Los campos se corresponden con la investigación: el formato fijo responde a Sclar y Mizrahi, los casos de prueba responden al estudio de Berkeley, la línea de frontera responde a Dell’Acqua.

Campo Qué contiene Por qué existe
Nombre y versión Familia-verbo-objeto más un número de versión, por ejemplo “edit-exec-summary-v3” (editar-resumen-ejecutivo) Tendrás cinco variantes en un mes; los nombres frenan la deriva
Disparador La situación concreta que reclama esta ficha, por ejemplo “cualquier borrador de más de 300 palabras dirigido a quien decide” Las fichas se recuperan por situación, no por ingenio
Entradas requeridas Exactamente lo que debes pegar o adjuntar: borrador, audiencia, decisión buscada, límite de extensión Las entradas que faltan son la causa más común de salidas flojas
Cuerpo del prompt (congelado) El texto completo, incluidos separadores y mayúsculas, nunca reescrito de memoria Los cambios de formato por sí solos alteran los resultados
Modelo y ajustes En qué modelo y modo lo probaste, con una referencia a tu regla de enrutamiento Los resultados no se transfieren intactos entre modelos
Casos de prueba Tres entradas con la salida que aceptaste, guardadas junto a la ficha Una ficha se promociona solo tras tres aciertos, no uno
Modos de fallo conocidos Qué hace mal este prompt cuando falla, por ejemplo “añade hechos que el borrador no contenía” Convierte una mala sorpresa en una barrera permanente
Línea de frontera La frase explícita de “no usar para”, por ejemplo “no para redacción legal o financiera” La penalización fuera de la frontera es el mayor riesgo documentado
Última verificación y responsable La fecha en que ejecutaste por última vez los casos de prueba; quién mantiene la ficha en un equipo Los modelos cambian; una ficha sin fecha es un rumor

Una ficha completada

Nombre y versión: edit-exec-summary-v3.
Disparador: Cualquier borrador de más de 300 palabras que vaya a leer alguien que decide algo.
Entradas requeridas: El borrador; el rol del lector; la única decisión que el lector debe tomar; el límite de extensión en palabras.
Cuerpo del prompt (congelado): “Estás editando, no escribiendo. Conserva cada afirmación factual exactamente como está y no añadas ningún hecho, cifra o ejemplo que no figure en el borrador. Lector: [rol]. Decisión que el lector debe tomar tras leer: [decisión]. Reescribe el borrador de modo que el primer párrafo enuncie la recomendación y la única cifra que la respalda, el segundo párrafo dé las dos razones más sólidas y el párrafo final nombre el riesgo y lo que haría cambiar la recomendación. Máximo [N] palabras. Donde al borrador le falte un dato que el lector necesitará, inserta el marcador [FALTA: qué falta] en lugar de rellenarlo. Devuelve solo el texto reescrito.”
Modelo y ajustes: El modelo de propósito general de nuestra regla de enrutamiento para redacción; sin navegación.
Casos de prueba: Un memorando de presupuesto, un correo de estado de proyecto y unas notas de diapositivas, cada uno con la salida aceptada guardada.
Modos de fallo conocidos: Elimina matizadores como “preliminar” al comprimir; de vez en cuando fusiona dos razones en una.
Línea de frontera: No para lenguaje contractual, presentaciones regulatorias ni nada con efecto legal; no para borradores sin cifras (usa en su lugar la ficha de redacción).
Última verificación y responsable: 2026-10, tú.

Observa que la ficha incorpora el hallazgo de los datos de uso de ChatGPT: dos tercios de las peticiones de redacción profesional son ediciones de texto que el usuario ya tiene. La ficha más valiosa de la mayoría de las bibliotecas es una ficha de edición, no una de redacción.

¿Cómo se organiza la biblioteca?

Carpetas por familia de tareas, no por herramienta. Las herramientas cambian; las familias de tareas del índice anterior se han mantenido estables en todas las encuestas desde 2024. Usa las siete familias como carpetas de primer nivel y deja vacía la de programación si no programas.

Tres niveles dentro de cada familia. Las fichas Núcleo son las que ejecutas cada semana; tienen tres casos de prueba y una fecha. Las fichas Situacionales se ejecutan una vez al mes o menos; tienen un caso de prueba. Las fichas Experimentales son todo lo que probaste una vez; viven en la carpeta pero no llevan número de versión hasta que se promocionan. El hallazgo de Berkeley es la razón del sistema de niveles: el comportamiento humano por defecto es promocionar tras un solo éxito.

Un único archivo índice. Una sola página que liste cada ficha Núcleo con su disparador. La recuperación se hace por disparador (“borrador dirigido a quien decide”), que es como lo recordarás de verdad bajo presión de tiempo.

Guarda las entradas por separado. Tu contexto permanente (rol, audiencia, estilo de la casa, restricciones) pertenece a un documento de contexto, no al interior de cada ficha. Nuestros artículos sobre el archivo de contexto y sobre configurar instrucciones personalizadas, proyectos y memoria cubren esa capa; así las fichas se mantienen cortas y portátiles. En qué modelo se prueba una ficha lo decide tu regla de enrutamiento.

Seis reglas operativas a partir de la evidencia

  1. Congela el formato. Copia el cuerpo del prompt al pie de la letra. No “ordenes” separadores, mayúsculas ni espaciado entre ejecuciones. Sclar y colaboradores señalan que, para quienes construyen sistemas sobre un modelo, elegir un formato que funcione y mantenerlo es un método válido.
  2. Tres casos antes de promocionar. Un prompt pasa de Experimental a Núcleo solo después de que tres entradas distintas hayan producido una salida aceptada. La evaluación multiprompt de Mizrahi es la versión investigadora de la misma regla.
  3. Escribe primero la línea de frontera. Antes de guardar una ficha, escribe la frase que dice para qué no debe usarse. Los consultores de Dell’Acqua perdieron 19 puntos porcentuales de exactitud en la única tarea que la herramienta no podía hacer, y no se dieron cuenta.
  4. Registra los fallos como campos, no como recuerdos. Cada vez que una ficha falla, el fallo va al campo de fallos conocidos ese mismo día. Los participantes de Berkeley sobregeneralizaron a partir de fallos aislados con la misma facilidad que a partir de éxitos aislados; un registro escrito evita ambas cosas.
  5. Fecha y vuelve a probar cada trimestre. Vuelve a ejecutar los tres casos de prueba en el modelo actual cada trimestre. Si la salida cambia de forma sustancial, sube la versión.
  6. Comparte el nivel Núcleo. Gallup encuentra que tres de cada cuatro empleados no tienen un plan organizativo de IA y, en la encuesta de Microsoft de 2024 a 31.000 trabajadores del conocimiento, el 78 % de los usuarios llevaba sus propias herramientas de IA al trabajo. Una carpeta Núcleo compartida por el equipo es la unidad más pequeña de un plan de IA que existe de verdad. También cierra la brecha de experiencia que los experimentos de campo encuentran una y otra vez: los novatos ganaron entre un 30 y un 43 % en los estudios de soporte y consultoría, y una ficha compartida es la forma en que un novato toma prestado el prompt de un experto.

La mirada del CEO y la mirada del estudiante

Gestiona la biblioteca como un registro de activos. Cada ficha tiene un responsable, una versión, una fecha de última verificación y una regla de retiro (sin uso en seis meses significa archivar). Mídela una vez al trimestre con la propia vara de medir de la encuesta de la Fed: ¿cuántas horas te ahorraron las fichas Núcleo esta semana, según tu estimación honesta? Si la respuesta está por debajo de las 2,2 horas semanales que declara el usuario medio, la biblioteca no está cubriendo tus tareas frecuentes y el índice anterior te dice qué familia falta.

Aprende de ella como de un cuaderno de laboratorio. Cada ficha es una hipótesis sobre lo que funciona; los casos de prueba son el experimento; el campo de fallos conocidos es el resultado que no querías. La investigación le da al estudiante un dato tranquilizador: las personas que más ganaron con la asistencia de la IA en todos los experimentos de campo fueron las menos experimentadas, y el mecanismo fue el acceso a buenas prácticas codificadas. Una biblioteca son buenas prácticas codificadas que escribiste para ti. Encaja de forma natural con el marco de calidad de las preguntas: la ficha guarda el formato, el marco comprueba si la pregunta que contiene merece hacerse.

Lo que esta evidencia no puede decirte

  • Ningún estudio aleatorizado ha probado “mantener una biblioteca de prompts” como intervención. El argumento aquí se arma a partir de estudios sobre la fragilidad de los prompts, el comportamiento de los novatos, la calidad de los prompts y la productividad por tarea. Trátalo como una inferencia bien respaldada, no como un efecto medido.
  • Los experimentos de campo usaron modelos de 2023 a 2025 en tareas concretas de empresas concretas. Los tamaños del efecto serán distintos para tus tareas y para los modelos actuales; justo por eso la ficha lleva fecha y casos de prueba.
  • Los resultados de fragilidad se midieron sobre todo en modelos de pesos abiertos en entornos few-shot. Los modelos más nuevos pueden ser menos sensibles, pero el artículo de Sclar encontró que la sensibilidad persistía tras el escalado y el ajuste por instrucciones, y el coste de congelar un formato es casi cero.
  • Las cifras de las encuestas son autodeclaradas y los dos programas de encuestas definen el uso de forma distinta. Nunca combinamos una cifra de Gallup con una de la Fed en la misma frase.
  • El estudio de Knoth tiene 45 estudiantes y tareas académicas; el estudio de Berkeley tiene 10 participantes. Ambos se usan aquí para el mecanismo, no para la magnitud.

Preguntas frecuentes

¿Una biblioteca de prompts es lo mismo que una guía de ingeniería de prompts?
No. Una guía te da principios; una biblioteca guarda los prompts concretos que han superado tus casos de prueba en tus tareas. El experimento de Dell’Acqua sugiere que una breve introducción a la ingeniería de prompts mejora los resultados, y la biblioteca es donde esa introducción se convierte en práctica reutilizable.

¿Cuántas fichas necesito?
Menos de las que crees. Empieza con tres fichas Núcleo de las familias de Prioridad 1. El uso semanal de IA de la mayoría de los profesionales se concentra en edición, documentos rutinarios y búsqueda, y por eso el índice las sitúa primero.

¿Debería guardar las fichas en la función de prompts guardados de la propia herramienta de IA?
Guarda la copia maestra en texto plano bajo tu control y replícala en las funciones de la herramienta por comodidad. Las funciones de las herramientas cambian, y los casos de prueba y los campos de fallos de la ficha no suelen tener sitio allí.

¿Y los prompts para agentes de IA en lugar de chat?
Sirve la misma ficha, con la línea de frontera haciendo una parte mayor del trabajo. Nuestros artículos sobre delegar en un agente de IA y sobre ingeniería de contexto cubren los campos adicionales que necesita el brief de un agente.

¿Cómo sé que una ficha sigue siendo buena tras una actualización del modelo?
Vuelve a ejecutar los tres casos de prueba. Si dos de las tres salidas cambian de un modo que no habrías aceptado, la ficha vuelve a Experimental hasta que los supere de nuevo.

Fuentes

  • Gallup, “AI Use at Work Has Nearly Doubled in Two Years” (junio de 2025), “Organizational AI Adoption Jumps Six Points” (julio de 2026) y el Gallup Indicator on Artificial Intelligence (datos a mayo de 2026).
  • Bick, Blandin y Deming, “The Rapid Adoption of Generative AI”, National Bureau of Economic Research Working Paper 32966 (revisado en febrero de 2025); Federal Reserve Bank of St. Louis, “The Impact of Generative AI on Work Productivity” (febrero de 2025) y FRED Blog, “Does generative AI save time at work?” (agosto de 2026).
  • Chatterji, Cunningham, Deming, Hitzig, Ong, Shan y Wadman, “How People Use ChatGPT”, National Bureau of Economic Research Working Paper 34255, septiembre de 2025.
  • Sclar, Choi, Tsvetkov y Suhr, “Quantifying Language Models’ Sensitivity to Spurious Features in Prompt Design”, International Conference on Learning Representations 2024.
  • Mizrahi, Kaplan, Malkin, Dror, Shahaf y Stanovsky, “State of What Art? A Call for Multi-Prompt LLM Evaluation”, Transactions of the Association for Computational Linguistics, volumen 12, 2024.
  • Zamfirescu-Pereira, Wong, Hartmann y Yang, “Why Johnny Can’t Prompt: How Non-AI Experts Try (and Fail) to Design LLM Prompts”, Proceedings of CHI 2023.
  • Knoth, Tolzin, Janson y Leimeister, “AI literacy and its implications for prompt engineering strategies”, Computers and Education: Artificial Intelligence, volumen 6, 2024.
  • Noy y Zhang, “Experimental evidence on the productivity effects of generative artificial intelligence”, Science, 381(6654), 2023, páginas 187 a 192.
  • Dell’Acqua, McFowland, Mollick, Lifshitz-Assaf, Kellogg, Rajendran, Krayer, Candelon y Lakhani, “Navigating the Jagged Technological Frontier”, Harvard Business School Working Paper 24-013, 2023.
  • Brynjolfsson, Li y Raymond, “Generative AI at Work”, Quarterly Journal of Economics, 140(2), 2025 (cifras de la versión de arXiv de noviembre de 2024).
  • Peng, Kalliamvakou, Cihon y Demirer, “The Impact of AI on Developer Productivity: Evidence from GitHub Copilot”, arXiv 2302.06590, 2023.
  • Cui, Demirer, Jaffe, Musolff, Peng y Salz, “The Effects of Generative AI on High-Skilled Work: Evidence from Three Field Experiments with Software Developers”, 2025 (versión de los autores, junio de 2025); Microsoft y LinkedIn, 2024 Work Trend Index Annual Report (para la cifra de uso de herramientas de IA propias).

Este contenido fue recopilado con el apoyo de la IA tras una investigación exhaustiva, y luego redactado y preparado para su publicación por el equipo editorial de CEOtudent.

This post is also available in: Türkçe English Français Deutsch

Benzer içerikler