Gelişimİş
0

El flujo de trabajo de IA en cinco capas: cómo los mejores trabajadores del conocimiento construyen un día que escala

Professional structuring the working day at a sunlit desk

En resumen: La evidencia controlada sobre IA y trabajo del conocimiento parece contradictoria hasta que se ordena. Un experimento publicado en Science con 453 profesionales halló que el tiempo medio de tarea cayó un 40 por ciento. Un estudio del Quarterly Journal of Economics con 5.172 agentes de atención al cliente halló un 15 por ciento más de casos resueltos por hora, con los agentes más experimentados ganando casi nada en velocidad y perdiendo algo de calidad. Un experimento de campo publicado en Organization Science con 758 consultores de Boston Consulting Group halló un 12,2 por ciento más de tareas completadas y un 25,1 por ciento más de rapidez en 18 tareas dentro de la frontera, pero una probabilidad de respuesta correcta un 19 por ciento menor en una tarea colocada deliberadamente fuera de esa frontera. Un ensayo aleatorizado de 2025 con 16 desarrolladores de código abierto experimentados que llevaban unos cinco años trabajando en los mismos repositorios halló que la IA los hacía un 19 por ciento más lentos, cuando ellos predecían que los haría un 24 por ciento más rápidos. Ordenados según la experiencia del usuario en la tarea concreta, esos cinco resultados forman un gradiente limpio: cuanto más profundo es su dominio previo de esa tarea exacta, menor y finalmente más negativo es el efecto medido. Por tanto, un día que escala es un día por capas, con la IA concentrada donde la experiencia es superficial y deliberadamente contenida donde es profunda.

La mayoría de los consejos sobre trabajar con IA se escriben como si la herramienta tuviera un único tamaño de efecto. Adóptala y ve más rápido. La evidencia controlada no respalda eso, y el desacuerdo entre estudios no es ruido. Es el hallazgo.

Cuatro grupos de investigación han realizado ya experimentos creíbles sobre IA generativa y trabajo profesional, con poblaciones, tareas y diseños distintos. Sus cifras principales abarcan un rango de unos sesenta puntos, desde una reducción del 40 por ciento del tiempo empleado hasta un aumento del 19 por ciento. Cualquier marco que no pueda explicar esa dispersión no es un marco. Es una preferencia.

Qué midieron realmente cinco resultados controlados

Cada cifra siguiente procede del resumen publicado del estudio citado. Nada aquí se ha inferido ni redondeado a partir de coberturas secundarias.

Estudio Población y diseño Efecto medido
Noy y Zhang, Science, 2023 453 profesionales con estudios superiores; experimento en línea preinscrito; tareas de redacción de nivel intermedio propias de cada ocupación, con incentivos; la mitad expuesta al azar a ChatGPT El tiempo medio empleado disminuyó un 40 por ciento; la calidad de la producción subió un 18 por ciento; la desigualdad entre trabajadores se redujo
Brynjolfsson, Li y Raymond, Quarterly Journal of Economics, 2025 5.172 agentes de atención al cliente; introducción escalonada de un asistente conversacional basado en IA generativa Los casos resueltos por hora subieron un 15 por ciento de media; los trabajadores menos experimentados y con menor cualificación mejoraron tanto la velocidad como la calidad; los más experimentados y cualificados registraron pequeñas ganancias de velocidad y pequeñas caídas de calidad
Dell’Acqua y colegas, Organization Science 758 trabajadores del conocimiento en Boston Consulting Group; preinscrito; tres condiciones; 18 tareas de consultoría realistas dentro de la frontera de capacidades de la IA Quienes usaron IA completaron un 12,2 por ciento más de tareas y las terminaron un 25,1 por ciento más rápido de media, con calidad significativamente mejorada
Dell’Acqua y colegas, mismo experimento, tarea fuera de la frontera Una tarea directiva compleja seleccionada para quedar fuera de la frontera de capacidades de la IA Quienes usaron IA tuvieron un 19 por ciento menos de probabilidad de producir soluciones correctas que quienes no la usaron
Ensayo controlado aleatorizado de METR, 2025 16 desarrolladores de código abierto experimentados con experiencia moderada en IA; 246 tareas en proyectos maduros con una media de cinco años de trayectoria previa Permitir la IA aumentó el tiempo de finalización un 19 por ciento; esos mismos desarrolladores habían pronosticado antes una reducción del 24 por ciento y estimaron después una del 20 por ciento

Dos detalles de esa tabla merecen leerse dos veces.

El primero es el error de predicción de la última fila. Los desarrolladores no eran novatos. Habían usado las herramientas, trabajaban en código que conocían a fondo y se les pidió predecir el efecto antes y estimarlo después. Se equivocaron en la misma dirección las dos veces, unos cuarenta puntos respecto al resultado medido. Los economistas a quienes se pidió predecir el mismo experimento esperaban una reducción del 39 por ciento, y los investigadores de aprendizaje automático del 38 por ciento. La intuición de que la IA está ayudando no es prueba fiable de que lo haga, y es menos fiable justo donde la gente se siente más segura.

El segundo es la división interna de la fila de Brynjolfsson. La misma herramienta, en el mismo puesto, en la misma empresa, ayudó a los agentes menos experimentados tanto en velocidad como en calidad, mientras producía pequeñas ganancias de velocidad y pequeñas caídas de calidad en los más experimentados. La media del 15 por ciento es una cifra real que no describe a casi nadie.

El gradiente que nadie nombra

Coloque los cinco resultados en un solo orden: cuánta experiencia específica en la tarea tenía ya el usuario en el trabajo exacto que se midió. No la antigüedad general ni los años en la profesión, sino la profundidad en esa tarea concreta.

Tabla: efecto medido de la IA ordenado según la experiencia del usuario en la tarea concreta (marco editorial de CEOtudent, derivado de los cinco estudios citados arriba)

Puesto Quién hacía el trabajo Profundidad en esa tarea exacta Dirección medida
1 Profesionales que redactan documentos de nivel intermedio que producen ocasionalmente y que no son su oficio principal Superficial Tiempo un 40 por ciento menos, calidad un 18 por ciento más
2 Agentes de atención con menos experiencia y menor nivel de partida Superficial Velocidad y calidad mejoraron ambas
3 Consultores en 18 tareas analíticas y creativas estándar Media Tiempo un 25,1 por ciento menos, volumen un 12,2 por ciento más
4 Agentes de atención con más experiencia y mayor nivel de partida Profunda Pequeña ganancia de velocidad, pequeña pérdida de calidad
5 Consultores en una tarea directiva fuera de la competencia del modelo Profunda, y la tarea queda fuera de la frontera Un 19 por ciento menos de probabilidad de acertar
6 Desarrolladores en repositorios en los que llevaban unos cinco años Muy profunda Tiempo un 19 por ciento más

La dirección es monótona. A medida que sube la profundidad específica en la tarea, el efecto medido cae, pasa aproximadamente por cero en torno al puesto cuatro y se vuelve negativo. Este orden es de CEOtudent; los resultados subyacentes son de los investigadores.

Conviene ser preciso sobre qué establece esto y qué no. Son cinco experimentos distintos con poblaciones, tareas y medidas de resultado diferentes, así que el orden es una síntesis interpretativa y no una única curva estimada. Ningún estudio ha variado todavía de forma experimental la experiencia específica en la tarea manteniendo todo lo demás constante. Lo que sí puede decirse es que la ordenación es coherente en los cinco, que ningún resultado la contradice y que cada equipo investigador informó de forma independiente, dentro de sus propios datos, de una división por nivel o experiencia que va en la misma dirección.

El mecanismo no es misterioso. La asistencia de IA sustituye la parte del trabajo que de otro modo habría que construir desde cero. Cuando se tiene poca estructura propia para una tarea, esa sustitución es enorme. Cuando la estructura propia ya es profunda, la salida del modelo llega como algo que hay que leer, evaluar, contrastar con lo que ya se sabe y, casi siempre, reparar. Evaluar no es gratis. Pasada cierta profundidad de experiencia, el coste de comprobar supera al de hacer. Por esa misma razón juzgar el resultado de la IA es una destreza propia y no un subproducto de usar las herramientas.

Las cinco capas

Si el beneficio varía con la profundidad, la unidad de diseño no es la herramienta ni el día. Es la capa. La jornada de un trabajador del conocimiento se descompone en cinco tipos de trabajo con perfiles de experiencia estructuralmente distintos, y cada uno merece una política permanente propia.

Tabla: el flujo de trabajo de IA en cinco capas (marco editorial de CEOtudent)

Capa Qué ocurre aquí Política permanente de IA Por qué, en términos de evidencia
1. Entrada Lectura, búsqueda, reuniones, mensajes entrantes, recopilación de materia prima Delegación máxima. Resumir, recuperar, agrupar, cribar La profundidad es superficial por definición: aún no se ha formado un criterio. Es la zona de los puestos 1 y 2
2. Borrador Producir primeras versiones: documentos, planes, esqueletos de código, respuestas, esquemas Delegación alta, siempre como primer borrador y nunca como versión final Aquí viven Noy y Zhang y los resultados de consultoría dentro de la frontera. Ganancias grandes, fiables y bien replicadas
3. Criterio Elegir entre opciones, fijar dirección, aceptar concesiones, decidir qué no hacer La decisión es del humano. Usar la IA de forma adversaria: pedirle que argumente en contra de su elección El resultado fuera de la frontera fue un fallo de criterio que parecía una tarea de análisis. El modelo no dio señal alguna de haber cruzado la línea
4. Oficio El trabajo estrecho en el que usted es realmente experto y donde reside su reputación Contención. Delegar solo subpasos mecánicos y mantener el trabajo sustantivo manual por defecto El resultado de METR. Es la única capa donde el efecto medido fue negativo, y los usuarios no podían percibirlo
5. Verificación Comprobar, conciliar, atrapar lo que las capas anteriores hicieron mal No delegable al mismo sistema que produjo la salida. Reserve tiempo real para ello Cada ganancia en las capas 1 y 2 aumenta el volumen que llega a la capa 5. Saltársela es como la frontera acaba con usted

Las capas no son un horario. Son un conjunto de reglas. Cualquier hora puede contener varias, y lo importante es que la postura correcta ante la IA cambia entre ellas aunque la herramienta en pantalla no cambie.

La regla de reasignación

Aquí es donde falla la mayoría de las adopciones, y es un error estructural más que de disciplina.

Las capas 1 y 2 se comprimen enormemente con IA. Esa es toda la promesa, y la evidencia la respalda. Pero la capa 5 no se comprime. Se expande, porque ahora tiene más producción que comprobar, generada más rápido, por un sistema cuyos modos de fallo no se distinguen visualmente de sus aciertos. El hallazgo de Organization Science es exactamente eso: la tarea que quedaba fuera de la frontera no parecía más difícil que las dieciocho de dentro, y el modelo no dio indicio alguno de haber cruzado.

La regla es sencilla y casi nadie la sigue. El tiempo ahorrado en entrada y borrador no es gratis. Una parte definida de él pertenece de forma permanente a la verificación.

Un reparto inicial práctico: devuelva aproximadamente un tercio del ahorro de tiempo medido a la capa 5 durante el primer trimestre de cualquier flujo nuevo asistido por IA y luego ajuste según cuántos errores atrape realmente la verificación. Si la verificación no atrapa nada durante varias semanas, el presupuesto es demasiado grande y el trabajo probablemente se ha desplazado a capas donde la IA ya era segura. Si la verificación atrapa cosas que usted habría publicado, el presupuesto es demasiado pequeño. Este reparto es una regla de trabajo y no un óptimo medido, y debe tratarse como una hipótesis inicial que se ajusta contra su propio registro de errores.

La segunda mitad de la regla afecta a la capa 4. Proteger su capa de oficio del uso casual de la IA no es nostalgia ni una decisión de productividad. Es un problema de medición. Los desarrolladores de METR experimentaron una aceleración mientras eran ralentizados, y su estimación seguía siendo errónea una vez terminado el trabajo. Si no puede percibir el efecto en su propio trabajo experto, no puede gestionarlo por intuición, y la única opción por defecto correcta es la contención hasta haberlo medido. Esa es también la razón honesta para realizar una auditoría estructurada de su flujo de trabajo en lugar de fiarse de su impresión sobre adónde va el tiempo.

Aplicarlo durante una semana

Un marco solo sirve si cambia un calendario. Una implantación mínima lleva una semana y produce evidencia en lugar de opiniones.

Días uno y dos: etiquetar, no cambiar. Repase su jornada actual y marque cada bloque con una de las cinco capas. La mayoría descubre dos cosas. La capa 3 casi no tiene tiempo propio y ocurre en los huecos entre otros trabajos. La capa 5 no tiene ninguno, porque hoy la verificación se supone en lugar de programarse.

Día tres: fijar las políticas permanentes. Escriba una línea por capa que indique qué puede hacer la IA allí. El valor está en escribirlo, porque una política no escrita acaba siendo lo que la herramienta hace más fácil, y lo que la herramienta hace más fácil es usarla en todas partes.

Días cuatro y cinco: aplicar las políticas y registrar cada corrección. Cada vez que la verificación atrape algo, anote qué capa lo produjo. Ese registro es el único instrumento fiable que tiene, y sobre él deberían construirse unos límites de delegación deliberados en lugar de la intuición.

Fin de semana: reasignar. Compare dónde se ahorró tiempo con dónde se encontraron errores. Mueva el tiempo de calendario en consecuencia. Después repita cada mes, porque la frontera se mueve y sus políticas deberían llevar fecha.

Este es el mismo método de fondo que auditar qué tareas automatizar primero y encaja de forma natural junto a un marco de briefing estructurado para delegar en agentes. La diferencia que añade el modelo por capas es que deja de tratar toda su jornada como una única decisión de delegación.

Por qué esto es a la vez un problema de directivo y de estudiante

La mitad directiva del trabajo es la asignación. Dadas cinco capas con rendimientos medidos distintos, la pregunta ejecutiva es adónde va la capacidad, y la respuesta no es “a todas partes donde la herramienta funcione”. Es: delegación máxima donde la profundidad es superficial, contención donde es profunda y un presupuesto permanente para la función de comprobación que crezca con todo lo que usted haya automatizado.

La mitad de estudiante es más difícil, porque exige aceptar que su percepción de su propio rendimiento es el instrumento menos fiable que posee, precisamente en el terreno que mejor conoce. Los desarrolladores del ensayo de METR eran expertos, estaban siendo medidos y aun así no pudieron sentir una ralentización del 19 por ciento. La única defensa frente a eso es seguir midiendo en lugar de seguir creyendo.

Un día que escala no es un día con más IA dentro. Es un día en el que la IA se coloca por capas, en el que el ahorro se reasigna conscientemente y en el que el trabajo experto se defiende hasta que la evidencia, y no el entusiasmo, diga lo contrario.

Preguntas frecuentes

¿Significa esto que los expertos no deberían usar IA en absoluto?
No. Significa que no deberían usarla por defecto en su estrecha área de dominio y que deberían seguir usándola con intensidad en las otras cuatro capas. Las capas de entrada y borrador de un experto no son capas de experto. Un desarrollador senior que resume una especificación está en el puesto uno del gradiente, no en el seis.

¿Cómo sé qué parte de mi trabajo es la capa 4?
La prueba práctica: es el trabajo por el que la gente acude específicamente a usted, y aquel en el que un error sutil sería visible para alguien que conoce el campo. Si cualquier lector competente detectaría una respuesta equivocada, probablemente sea capa 2. Si solo la detectaría un colega del oficio, es capa 4.

¿Es generalizable el resultado de la ralentización del 19 por ciento?
Es un ensayo con 16 desarrolladores y 246 tareas, así que debe leerse como una señal fuerte más que como un parámetro asentado. Los autores recogieron y evaluaron evidencia sobre 20 propiedades de su entorno que a priori podrían haber contribuido a la ralentización, e informaron de que el efecto se mantuvo robusto a lo largo de sus análisis, señalando a la vez que no pueden descartarse por completo los artefactos experimentales. Su valor principal es que es la única entrada de la tabla donde una medición cuidadosa contradijo todas las predicciones, incluidas las de los propios participantes.

¿Por qué la verificación es una capa propia y no parte del borrador?
Porque tiene otro responsable y otro modo de fallo. El borrador falla de forma visible, al no producir nada. La verificación falla de forma invisible, al producir confianza. Las capas con modos de fallo invisibles necesitan su propio tiempo de calendario, o quedan absorbidas por lo que suene más fuerte.

¿Y si mi organización solo mide volumen de producción?
Entonces el gradiente predice que será recompensado los dos primeros trimestres y quedará expuesto en el tercero, porque las capas 1 y 2 mueven el volumen de inmediato mientras que los fallos de la capa 5 afloran más tarde. La posición defendible es llevar su propio registro de errores, de modo que cuando lleguen las preguntas sobre calidad tenga evidencia sobre el origen de los errores en lugar de una discusión sobre esfuerzo.

Fuentes

Noy, S. y Zhang, W. Experimental evidence on the productivity effects of generative artificial intelligence. Science, 2023.

Brynjolfsson, E., Li, D. y Raymond, L. Generative AI at Work. The Quarterly Journal of Economics, 2025.

Dell’Acqua, F. y colegas. Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality. Organization Science.

METR. Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity. Informe de ensayo controlado aleatorizado, 2025.

Harvard Business School Digital Data Design Institute y Division of Research and Faculty Development, financiadores declarados del experimento de campo en Boston Consulting Group.


Este contenido fue recopilado con el apoyo de la IA tras una investigación exhaustiva, y luego redactado y preparado para su publicación por el equipo editorial de CEOtudent.

This post is also available in: Türkçe English Français Deutsch

Benzer içerikler