{"id":325633,"date":"2026-09-02T05:07:13","date_gmt":"2026-09-02T02:07:13","guid":{"rendered":"https:\/\/ceotudent.com\/supervision-humana-por-diseno-puntos-de-control-agentes-ia"},"modified":"2026-09-02T05:07:13","modified_gmt":"2026-09-02T02:07:13","slug":"supervision-humana-por-diseno-puntos-de-control-agentes-ia","status":"publish","type":"post","link":"https:\/\/ceotudent.com\/es\/supervision-humana-por-diseno-puntos-de-control-agentes-ia","title":{"rendered":"Supervisi\u00f3n humana por dise\u00f1o: d\u00f3nde colocar los puntos de control cuando los agentes de IA hacen el trabajo"},"content":{"rendered":"<p><strong>TL;DR:<\/strong> &ldquo;Mant\u00e9n a un humano en el bucle&rdquo; se ha convertido en la respuesta est\u00e1ndar a cualquier pregunta sobre agentes de IA, y no es una respuesta. Un bucle tiene una forma: d\u00f3nde se sit\u00faa la persona, qu\u00e9 se le muestra, qu\u00e9 puede detener y qu\u00e9 ocurre cuando se le escapa algo. Las mediciones p\u00fablicas permiten dise\u00f1ar esa forma en lugar de adivinarla. El trabajo de METR sobre horizontes temporales encuentra que la duraci\u00f3n de tarea que un agente completa con un 80 por ciento de \u00e9xito es unas cinco veces m\u00e1s corta que con un 50 por ciento, con una diferencia de 59 a 15 minutos en el modelo m\u00e1s fuerte de su muestra, y que ambos horizontes se duplican aproximadamente al mismo ritmo, cada siete meses. El banco de pruebas tau-bench midi\u00f3 un \u00e9xito en un solo intento por debajo del 50 por ciento y una consistencia en ocho intentos por debajo del 25 por ciento para agentes punteros con llamada a funciones, cifra muy por encima de lo que producir\u00eda el fallo aleatorio por intento, lo que implica que los fallos se concentran en tareas concretas. A partir de esos dos hallazgos, m\u00e1s el art\u00edculo 14 del Reglamento de IA de la UE y la literatura sobre sesgo de automatizaci\u00f3n, este art\u00edculo construye una matriz de colocaci\u00f3n basada en dos preguntas: cu\u00e1nto cuesta deshacerlo y te dar\u00edas cuenta si saliera mal.<\/p>\n<p>Hay un momento concreto que se repite ahora mismo en el trabajo profesional. Un agente se ejecuta, produce un bloque de salida seguro de s\u00ed mismo, y una persona lo mira once segundos y lo aprueba. Nada en ese momento es un punto de control. Tiene la forma de la supervisi\u00f3n y ninguna de sus funciones, y quien lo hace normalmente lo sabe.<\/p>\n<p>El impulso de arreglarlo mirando con m\u00e1s atenci\u00f3n es equivocado, porque el problema no es la atenci\u00f3n. Es la colocaci\u00f3n. Un punto de control en la posici\u00f3n equivocada cuesta la misma atenci\u00f3n y no atrapa nada.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_84 counter-hierarchy ez-toc-counter ez-toc-grey ez-toc-container-direction\">\n<div class=\"ez-toc-title-container\">\n<p class=\"ez-toc-title\" style=\"cursor:inherit\">Table of Contents<\/p>\n<span class=\"ez-toc-title-toggle\"><a href=\"#\" class=\"ez-toc-pull-right ez-toc-btn ez-toc-btn-xs ez-toc-btn-default ez-toc-toggle\" aria-label=\"Alternar tabla de contenidos\"><span class=\"ez-toc-js-icon-con\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Toggle<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #999;color:#999\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewBox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #999;color:#999\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewBox=\"0 0 24 24\" version=\"1.2\" baseProfile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/span><\/a><\/span><\/div>\n<nav><ul class='ez-toc-list ez-toc-list-level-1 ' ><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/ceotudent.com\/es\/supervision-humana-por-diseno-puntos-de-control-agentes-ia\/#Que-dicen-realmente-los-datos-de-fiabilidad\" >Qu\u00e9 dicen realmente los datos de fiabilidad<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/ceotudent.com\/es\/supervision-humana-por-diseno-puntos-de-control-agentes-ia\/#La-inferencia-que-nadie-extrae-de-pass8\" >La inferencia que nadie extrae de pass^8<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/ceotudent.com\/es\/supervision-humana-por-diseno-puntos-de-control-agentes-ia\/#Donde-corresponde-un-punto-de-control-dos-preguntas-cuatro-respuestas\" >D\u00f3nde corresponde un punto de control: dos preguntas, cuatro respuestas<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/ceotudent.com\/es\/supervision-humana-por-diseno-puntos-de-control-agentes-ia\/#La-estructura-de-supervision-que-merece-la-pena-tomar-prestada-de-la-regulacion\" >La estructura de supervisi\u00f3n que merece la pena tomar prestada de la regulaci\u00f3n<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/ceotudent.com\/es\/supervision-humana-por-diseno-puntos-de-control-agentes-ia\/#Por-que-un-punto-de-control-existente-puede-fallar-igualmente\" >Por qu\u00e9 un punto de control existente puede fallar igualmente<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/ceotudent.com\/es\/supervision-humana-por-diseno-puntos-de-control-agentes-ia\/#Todo-junto-un-caso-trabajado\" >Todo junto: un caso trabajado<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/ceotudent.com\/es\/supervision-humana-por-diseno-puntos-de-control-agentes-ia\/#Dimensionar-el-bloque-sin-supervision\" >Dimensionar el bloque sin supervisi\u00f3n<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/ceotudent.com\/es\/supervision-humana-por-diseno-puntos-de-control-agentes-ia\/#Preguntas-frecuentes\" >Preguntas frecuentes<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/ceotudent.com\/es\/supervision-humana-por-diseno-puntos-de-control-agentes-ia\/#Fuentes\" >Fuentes<\/a><\/li><\/ul><\/nav><\/div>\n<h2 id=\"qu-dicen-realmente-los-datos-de-fiabilidad\"><span class=\"ez-toc-section\" id=\"Que-dicen-realmente-los-datos-de-fiabilidad\"><\/span>Qu\u00e9 dicen realmente los datos de fiabilidad<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Dos mediciones hacen aqu\u00ed casi todo el trabajo, y ninguna trata de lo listos que son los modelos.<\/p>\n<p>La primera es la investigaci\u00f3n de METR sobre horizontes temporales, que plantea una pregunta con una forma inusualmente pr\u00e1ctica: qu\u00e9 duraci\u00f3n de tarea, medida por lo que tarda un experto humano en hacerla, puede completar un modelo con una tasa de \u00e9xito dada. En los modelos publicados entre 2019 y 2025, el horizonte temporal al 50 por ciento ha crecido de forma exponencial con un tiempo de duplicaci\u00f3n de unos siete meses. Ese titular se cita constantemente. La parte que importa para dise\u00f1ar puntos de control casi nunca.<\/p>\n<p>METR tambi\u00e9n calcul\u00f3 el horizonte al 80 por ciento de \u00e9xito. El tiempo de duplicaci\u00f3n es casi id\u00e9ntico, 213 d\u00edas frente a 212 del horizonte al 50 por ciento, as\u00ed que el ritmo de crecimiento no es el problema. Lo son los niveles. En palabras de METR, los horizontes en el umbral de fiabilidad m\u00e1s alto son aproximadamente cinco veces m\u00e1s cortos en el conjunto de modelos estudiados, y el modelo con el horizonte al 80 por ciento m\u00e1s largo de la muestra, Claude 3.7 Sonnet, se situaba en torno a 15 minutos frente a un horizonte al 50 por ciento de 59 minutos, una diferencia de algo menos de cuatro veces para ese modelo concreto.<\/p>\n<table>\n<thead>\n<tr>\n<th>Medida (METR, modelos publicados entre 2019 y 2025)<\/th>\n<th>Tasa de \u00e9xito del 50 por ciento<\/th>\n<th>Tasa de \u00e9xito del 80 por ciento<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Horizonte m\u00e1s largo medido en la muestra (Claude 3.7 Sonnet)<\/td>\n<td>59 minutos<\/td>\n<td>unos 15 minutos<\/td>\n<\/tr>\n<tr>\n<td>Modelos punteros anteriores (GPT-4, Claude 3 Opus) en el conjunto de tareas dif\u00edciles<\/td>\n<td>Rango de 5 a 30 minutos<\/td>\n<td>No informado por separado<\/td>\n<\/tr>\n<tr>\n<td>Tiempo de duplicaci\u00f3n del horizonte<\/td>\n<td>212 d\u00edas<\/td>\n<td>213 d\u00edas<\/td>\n<\/tr>\n<tr>\n<td>Horizonte con tasas de \u00e9xito muy altas, por ejemplo el 95 por ciento<\/td>\n<td>No medido; METR afirma que no puede medirlo con confianza con su conjunto de datos<\/td>\n<td>No medido<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><em>Datos verificados. Fuente: METR, Measuring AI Ability to Complete Long Tasks, secci\u00f3n que compara los horizontes temporales al 50 y al 80 por ciento de \u00e9xito.<\/em><\/p>\n<p>Lee con atenci\u00f3n la \u00faltima fila, porque es la l\u00ednea m\u00e1s \u00fatil de la tabla. Nadie ha publicado una medici\u00f3n fiable de qu\u00e9 duraci\u00f3n de tarea puede completar un agente con el nivel de fiabilidad que realmente exigir\u00edas antes de dejar algo sin supervisi\u00f3n. El estado honesto de la evidencia es que el horizonte de alta fiabilidad no es largo: est\u00e1 sin medir.<\/p>\n<p>La segunda medici\u00f3n trata de consistencia y no de duraci\u00f3n. El banco de pruebas tau-bench, construido por Yao, Shinn, Razavi y Narasimhan, eval\u00faa agentes en dominios simulados de comercio minorista y aerol\u00edneas donde deben usar herramientas, seguir una pol\u00edtica de dominio escrita y conversar con un usuario simulado. Introdujo una m\u00e9trica llamada pass^k, que no pregunta si un agente acierta una vez sino si acierta en los k intentos independientes sobre la misma tarea. El hallazgo del art\u00edculo es rotundo: agentes punteros con llamada a funciones como gpt-4o resuelven menos del 50 por ciento de las tareas, y pass^8 cae por debajo del 25 por ciento en el dominio minorista.<\/p>\n<h2 id=\"la-inferencia-que-nadie-extrae-de-pass8\"><span class=\"ez-toc-section\" id=\"La-inferencia-que-nadie-extrae-de-pass8\"><\/span>La inferencia que nadie extrae de pass^8<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Aqu\u00ed es donde los dos conjuntos de datos dejan de ser contexto y se convierten en un dato de dise\u00f1o.<\/p>\n<p>Si los fallos fueran aleatorios de intento a intento, un agente con un 50 por ciento de probabilidad en cada intento acertar\u00eda ocho veces seguidas en torno al 0,4 por ciento de las tareas. Eso es 0,5 elevado a ocho. La cifra medida est\u00e1 por debajo del 25 por ciento. Ambas cifras del banco de pruebas se informan como cotas superiores, as\u00ed que el m\u00faltiplo exacto no puede fijarse, pero la consistencia medida est\u00e1 m\u00e1s de un orden de magnitud por encima de lo que producir\u00eda el fallo aleatorio por intento.<\/p>\n<table>\n<thead>\n<tr>\n<th>Modelo de fallo<\/th>\n<th>Proporci\u00f3n prevista de tareas superadas las ocho veces<\/th>\n<th>Medido<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Fallos independientes por intento, probabilidad uniforme del 50 por ciento<\/td>\n<td>0,4 %<\/td>\n<td>No aplicable<\/td>\n<\/tr>\n<tr>\n<td>tau-bench minorista, agente puntero con llamada a funciones<\/td>\n<td>No aplicable<\/td>\n<td>Menos del 25 %<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><em>Marco editorial de CEOtudent: la cifra de independencia la calcula CEOtudent a partir de la tasa de \u00e9xito en un intento que informa el banco de pruebas, para compararla con el resultado pass^8 que este informa. El hallazgo es la distancia entre ambas, no ninguna de las dos por separado.<\/em><\/p>\n<p>La distancia revela la estructura de los fallos. Si la tasa observada de ocho de ocho estuviera cerca de la predicci\u00f3n de independencia, los errores de los agentes ser\u00edan esencialmente ruido y la respuesta correcta ser\u00eda la redundancia: ejecutar dos veces, comparar. No est\u00e1 cerca de esa predicci\u00f3n. Una gran parte de las tareas acierta siempre y una gran parte falla siempre. La variaci\u00f3n vive en la tarea, no en la ejecuci\u00f3n.<\/p>\n<p>Ese \u00fanico hecho estructural descarta las dos estrategias de supervisi\u00f3n m\u00e1s habituales hoy.<\/p>\n<p>El muestreo aleatorio es err\u00f3neo, porque los fallos no est\u00e1n repartidos al azar. Revisar una de cada diez salidas de un conjunto mezclado confirmar\u00e1 una y otra vez las tareas fiables mientras las poco fiables fallan de forma consistente y sin vigilancia.<\/p>\n<p>Ejecutar dos veces y comparar tambi\u00e9n es err\u00f3neo, por la misma raz\u00f3n. Una tarea que el agente falla de forma consistente producir\u00e1 dos respuestas seguras, coincidentes y equivocadas. La coincidencia entre dos ejecuciones no es evidencia cuando el modo de fallo es espec\u00edfico de la tarea.<\/p>\n<p>Lo que la estructura exige en su lugar es clasificaci\u00f3n. Hay que saber qu\u00e9 tareas pertenecen al conjunto fiable y cu\u00e1les no, y la \u00fanica forma de saberlo es haber medido, que es la disciplina descrita en <a href=\"\/en\/the-delegation-ceiling-why-professionals-fail-to-scale-ai-agents\">el techo de la delegaci\u00f3n<\/a>. El punto de control va sobre la clase, no sobre la muestra.<\/p>\n<h2 id=\"dnde-corresponde-un-punto-de-control-dos-preguntas-cuatro-respuestas\"><span class=\"ez-toc-section\" id=\"Donde-corresponde-un-punto-de-control-dos-preguntas-cuatro-respuestas\"><\/span>D\u00f3nde corresponde un punto de control: dos preguntas, cuatro respuestas<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Todo lo anterior se estrecha hasta una regla de colocaci\u00f3n. Dos propiedades de una tarea determinan d\u00f3nde debe situarse la persona, y ninguna tiene que ver con lo dif\u00edcil que sea.<\/p>\n<p>La primera es la reversibilidad: cu\u00e1nto cuesta deshacerlo. La segunda es la detectabilidad: si el agente se equivoc\u00f3, \u00bfel error se anunciar\u00e1 solo o se quedar\u00e1 seis semanas callado en una hoja de c\u00e1lculo?<\/p>\n<table>\n<thead>\n<tr>\n<th><\/th>\n<th><strong>El error es evidente<\/strong><\/th>\n<th><strong>El error es silencioso<\/strong><\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td><strong>Barato de deshacer<\/strong><\/td>\n<td><strong>Dejar correr.<\/strong> Sin punto de control. Corregir al descubrirlo, porque el descubrimiento est\u00e1 garantizado y la correcci\u00f3n es barata. Borradores, b\u00fasqueda exploratoria, esquemas, primeros res\u00famenes.<\/td>\n<td><strong>Muestrear y puntuar.<\/strong> Revisi\u00f3n de una proporci\u00f3n fija con una regla de puntuaci\u00f3n escrita, sobre una clase de tareas definida y no al azar. Extracci\u00f3n de datos, etiquetado, categorizaci\u00f3n, transcripci\u00f3n.<\/td>\n<\/tr>\n<tr>\n<td><strong>Caro de deshacer<\/strong><\/td>\n<td><strong>Barrera antes de confirmar.<\/strong> Una aprobaci\u00f3n obligatoria inmediatamente antes del paso irreversible, no antes en la cadena. Publicar, enviar, presentar, fusionar.<\/td>\n<td><strong>Preautorizar y verificar de forma independiente.<\/strong> Define el conjunto de acciones permitidas antes de la ejecuci\u00f3n y verifica el resultado contra una fuente que no sea el propio resumen del agente. Asientos financieros, compromisos externos, borrados, todo lo que toque el registro de un tercero.<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><em>Matriz de Colocaci\u00f3n de Puntos de Control de CEOtudent. Marco editorial. El eje de reversibilidad es pr\u00e1ctica est\u00e1ndar de teor\u00eda de la decisi\u00f3n; el eje de detectabilidad y las cuatro colocaciones son construcci\u00f3n de CEOtudent.<\/em><\/p>\n<p>Tres cosas de esta matriz conviene decirlas de forma expl\u00edcita, porque son donde la gente se equivoca.<\/p>\n<p>La casilla inferior izquierda dice que la barrera va inmediatamente antes del paso irreversible, y esa palabra inmediatamente carga con todo el peso. Buena parte de lo que pasa por supervisi\u00f3n es una aprobaci\u00f3n colocada al principio de una cadena, sobre un plan, seguida de la ejecuci\u00f3n no supervisada de ese plan. Aprobar el plan no es un punto de control sobre el resultado. El momento es la confirmaci\u00f3n; ah\u00ed corresponde el punto de control.<\/p>\n<p>La casilla superior derecha es la que casi todo el mundo desatiende. Los errores silenciosos en trabajo barato de deshacer parecen inofensivos, que es exactamente la raz\u00f3n por la que se acumulan. Una fila mal clasificada no cuesta nada ese d\u00eda y lo cuesta todo el trimestre en que se decide sobre el agregado.<\/p>\n<p>La casilla inferior derecha contiene la \u00fanica instrucci\u00f3n de la matriz que exige una segunda fuente. Preguntar al agente si hizo bien la tarea no es verificaci\u00f3n; es pedirle al fallo que se califique a s\u00ed mismo. El resumen que el agente hace de su propia ejecuci\u00f3n lo produce el mismo proceso que produjo la ejecuci\u00f3n.<\/p>\n<h2 id=\"la-estructura-de-supervisin-que-merece-la-pena-tomar-prestada-de-la-regulacin\"><span class=\"ez-toc-section\" id=\"La-estructura-de-supervision-que-merece-la-pena-tomar-prestada-de-la-regulacion\"><\/span>La estructura de supervisi\u00f3n que merece la pena tomar prestada de la regulaci\u00f3n<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Hay un texto que resuelve un problema en el que la mayor\u00eda de los flujos de trabajo individuales no ha pensado, y est\u00e1 en la ley.<\/p>\n<p>El art\u00edculo 14 del Reglamento de Inteligencia Artificial de la Uni\u00f3n Europea establece requisitos de supervisi\u00f3n humana para los sistemas de IA de alto riesgo. Vincula a proveedores y responsables del despliegue de esos sistemas, no a particulares que usan un asistente conversacional, y este art\u00edculo no sostiene lo contrario. Lo que lo hace digno de lectura es que no dice &ldquo;una persona debe revisar la salida&rdquo;. Especifica cinco capacidades distintas que la persona que supervisa debe poder ejercer, y esas cinco encajan limpiamente sobre los modos de fallo del trabajo corriente con agentes.<\/p>\n<table>\n<thead>\n<tr>\n<th>Requisito del art\u00edculo 14, apartado 4, para sistemas de IA de alto riesgo<\/th>\n<th>Traducci\u00f3n a un flujo de trabajo individual con agentes<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>(a) Entender adecuadamente las capacidades y limitaciones del sistema y vigilar su funcionamiento, incluida la detecci\u00f3n de anomal\u00edas, disfunciones y rendimiento inesperado<\/td>\n<td>Lleva un registro escrito de en qu\u00e9 clases de tareas falla tu agente. Sin ese registro no puedes clasificar, y sin clasificaci\u00f3n la matriz anterior es inservible.<\/td>\n<\/tr>\n<tr>\n<td>(b) Ser consciente de la posible tendencia a confiar autom\u00e1tica o excesivamente en la salida<\/td>\n<td>Da por hecho que revisar\u00e1s menos de lo debido. Haz la revisi\u00f3n mec\u00e1nica y programada en lugar de dejarla al criterio del momento.<\/td>\n<\/tr>\n<tr>\n<td>(c) Interpretar correctamente la salida del sistema, teniendo en cuenta las herramientas y m\u00e9todos de interpretaci\u00f3n disponibles<\/td>\n<td>Exige pasos intermedios y fuentes, no conclusiones. Una respuesta que no puedes rastrear es una respuesta que no puedes comprobar.<\/td>\n<\/tr>\n<tr>\n<td>(d) Decidir no utilizar el sistema, o desatender, anular o revertir su salida<\/td>\n<td>Mant\u00e9n una lista escrita de acciones que el agente nunca puede ejecutar sin supervisi\u00f3n. Un l\u00edmite que solo vive en tu cabeza no es un l\u00edmite.<\/td>\n<\/tr>\n<tr>\n<td>(e) Interrumpir el sistema mediante un bot\u00f3n de parada o procedimiento similar que permita detenerlo en un estado seguro<\/td>\n<td>Define antes de empezar qu\u00e9 significa &ldquo;detenido con seguridad&rdquo;. \u00bfQu\u00e9 estado debe quedar recuperable si cortas la ejecuci\u00f3n en el minuto cuatro?<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><em>La columna izquierda recoge en sustancia texto regulatorio verificado del art\u00edculo 14, apartado 4, del Reglamento (UE) 2024\/1689. La columna derecha es la traducci\u00f3n editorial de CEOtudent y carece de valor jur\u00eddico.<\/em><\/p>\n<p>El requisito (e) es el que sistem\u00e1ticamente falta en los flujos de trabajo individuales. Casi todo el mundo puede detener un agente. Muchos menos han decidido de antemano en qu\u00e9 estado debe quedar el trabajo cuando lo hagan. Si tu agente va por la mitad de renombrar 400 archivos cuando lo interrumpes, la pregunta de si eso es recuperable se decidi\u00f3 antes de empezar, no al pulsar el bot\u00f3n.<\/p>\n<p>El mismo instinto estructural aparece en el Marco de Gesti\u00f3n de Riesgos de Inteligencia Artificial del National Institute of Standards and Technology, que organiza el trabajo sobre riesgo en cuatro funciones, gobernar, mapear, medir y gestionar, en lugar de en un \u00fanico paso de revisi\u00f3n. El hilo com\u00fan de ambos documentos es que la supervisi\u00f3n es una propiedad del sistema, decidida de antemano, y no un acto de atenci\u00f3n al final.<\/p>\n<h2 id=\"por-qu-un-punto-de-control-existente-puede-fallar-igualmente\"><span class=\"ez-toc-section\" id=\"Por-que-un-punto-de-control-existente-puede-fallar-igualmente\"><\/span>Por qu\u00e9 un punto de control existente puede fallar igualmente<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La colocaci\u00f3n es necesaria y no suficiente, y la evidencia de ello es m\u00e1s de una d\u00e9cada anterior a la generaci\u00f3n actual de herramientas.<\/p>\n<p>Goddard, Roudsari y Wyatt publicaron en 2012 en el Journal of the American Medical Informatics Association una revisi\u00f3n sistem\u00e1tica sobre el sesgo de automatizaci\u00f3n, definido como la tendencia a confiar en exceso en la automatizaci\u00f3n. Cribaron 13.821 art\u00edculos e incluyeron 74. La revisi\u00f3n trata de apoyo a la decisi\u00f3n cl\u00ednica, pero sus hallazgos estructurales se trasladan directamente, porque el mecanismo va de humanos supervisando m\u00e1quinas y no de medicina.<\/p>\n<p>Dos de sus resultados deber\u00edan cambiar c\u00f3mo construyes el propio punto de control.<\/p>\n<p>Primero, qu\u00e9 empeora el sesgo de automatizaci\u00f3n. La revisi\u00f3n identific\u00f3 mediadores ambientales como la carga de trabajo, la complejidad de la tarea y la restricci\u00f3n de tiempo, que describe como presiones sobre los recursos cognitivos. Esa es la raz\u00f3n pr\u00e1ctica de la aprobaci\u00f3n en once segundos. Un punto de control programado en la hora m\u00e1s ocupada de tu semana es un punto de control dise\u00f1ado para fallar, y ninguna intenci\u00f3n de mirar con cuidado corregir\u00e1 una restricci\u00f3n de tiempo estructural.<\/p>\n<p>Segundo, qu\u00e9 lo mitiga. Entre los mitigadores identificados figuraban factores de implantaci\u00f3n como la formaci\u00f3n y el \u00e9nfasis en la responsabilidad del usuario, y factores de dise\u00f1o como la posici\u00f3n del consejo en la pantalla, los niveles de confianza actualizados adjuntos a la salida y la provisi\u00f3n de informaci\u00f3n en lugar de recomendaci\u00f3n.<\/p>\n<p>Ese \u00faltimo punto es la l\u00ednea m\u00e1s accionable de toda la revisi\u00f3n. Informaci\u00f3n en lugar de recomendaci\u00f3n. Un sistema que te tiende una recomendaci\u00f3n invita a la aprobaci\u00f3n; un sistema que te tiende la evidencia exige una decisi\u00f3n. Traducido a la pr\u00e1ctica con agentes: indica al agente que devuelva lo que encontr\u00f3 y lo que hizo, con los pasos intermedios, en lugar de un veredicto acabado para que lo bendigas. El mismo prompt que produce una salida m\u00e1s limpia produce un punto de control m\u00e1s d\u00e9bil. Este es el n\u00facleo operativo de <a href=\"\/en\/how-to-delegate-to-an-ai-agent-briefing-framework\">informar bien a un agente<\/a>, y va en contra del impulso de pedir la respuesta m\u00e1s pulcra posible.<\/p>\n<p>El hallazgo sobre responsabilidad merece tomarse igual de literalmente. Escribe tu propio nombre en el registro antes de la ejecuci\u00f3n, como persona responsable del resultado. Suena a teatro. La revisi\u00f3n encontr\u00f3 que funciona.<\/p>\n<h2 id=\"todo-junto-un-caso-trabajado\"><span class=\"ez-toc-section\" id=\"Todo-junto-un-caso-trabajado\"><\/span>Todo junto: un caso trabajado<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Tomemos un caso concreto. Se pide a un agente que revise 300 facturas de proveedores, extraiga importes y fechas, se\u00f1ale anomal\u00edas y actualice una hoja de seguimiento.<\/p>\n<p>Clasifica primero las subtareas, porque la matriz opera sobre clases de tareas y esto son cuatro tareas con un solo abrigo.<\/p>\n<p>La extracci\u00f3n de importes y fechas es barata de deshacer y silenciosa cuando falla: arriba a la derecha. Muestrear y puntuar, sobre una proporci\u00f3n fija, con una regla escrita de qu\u00e9 cuenta como correcto. No al azar sobre todo el lote, sino estratificado por formato de factura, porque la estructura que revela tau-bench predice que los fallos se agrupan por tipo de tarea, y aqu\u00ed el tipo de tarea es el formato de factura.<\/p>\n<p>El se\u00f1alamiento de anomal\u00edas es barato de deshacer y evidente cuando falla, al menos en la direcci\u00f3n del falso positivo: arriba a la izquierda. Dejar correr. Una marca falsa aflora en cuanto la miras. La direcci\u00f3n del falso negativo es silenciosa, lo que es una limitaci\u00f3n real, y la respuesta honesta es tratar el se\u00f1alamiento como una ayuda y no como una cobertura.<\/p>\n<p>Actualizar la hoja de seguimiento es caro de deshacer y silencioso: abajo a la derecha. Preautoriza las operaciones permitidas, solo a\u00f1adir, sin sobrescribir, sin borrar, y verifica una muestra de las filas escritas contra las facturas de origen y no contra el informe del agente sobre lo que escribi\u00f3.<\/p>\n<p>Cualquier cosa que dispare un pago est\u00e1 abajo a la izquierda y es suficientemente evidente: barrera antes de confirmar, inmediatamente antes, sin agrupar aprobaciones.<\/p>\n<p>F\u00edjate en lo que esto produce. Cuatro reg\u00edmenes de supervisi\u00f3n distintos para un solo trabajo, tres de ellos m\u00e1s baratos que leerlo todo, uno m\u00e1s estricto que lo que la mayor\u00eda aplica hoy. Esa asimetr\u00eda es la clave. La revisi\u00f3n uniforme es a la vez demasiado cara en el trabajo seguro y demasiado d\u00e9bil en el peligroso, que es precisamente por lo que resulta agotadora y aun as\u00ed deja pasar errores.<\/p>\n<h2 id=\"dimensionar-el-bloque-sin-supervisin\"><span class=\"ez-toc-section\" id=\"Dimensionar-el-bloque-sin-supervision\"><\/span>Dimensionar el bloque sin supervisi\u00f3n<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Una \u00faltima consecuencia pr\u00e1ctica de las cifras de METR.<\/p>\n<p>Si quieres que el trabajo corra sin supervisi\u00f3n con algo cercano al 80 por ciento de fiabilidad, el horizonte publicado para el modelo m\u00e1s fuerte medido era de unos 15 minutos de trabajo humano equivalente. Esa es la unidad en torno a la que dise\u00f1ar: segmenta el trabajo de modo que ning\u00fan tramo sin supervisi\u00f3n represente m\u00e1s de aproximadamente una cuarta parte de lo que el mismo sistema puede intentar con fiabilidad de cara o cruz.<\/p>\n<p>Tres salvedades honestas acompa\u00f1an a eso. Las tareas de METR est\u00e1n fuertemente sesgadas hacia la ingenier\u00eda de software y la investigaci\u00f3n en aprendizaje autom\u00e1tico, as\u00ed que las cifras no se trasladan limpiamente al procesamiento de facturas o al correo. Los horizontes se duplican aproximadamente cada siete meses, as\u00ed que cualquier cifra concreta en minutos tiene una vida \u00fatil corta. Y METR afirma con claridad que no puede medir con confianza los horizontes con tasas de \u00e9xito muy altas, as\u00ed que la cifra que m\u00e1s querr\u00edas es la que nadie tiene.<\/p>\n<p>Lo que sobrevive a las tres salvedades es la proporci\u00f3n y su direcci\u00f3n. Una fiabilidad exigida m\u00e1s alta compra tramos aut\u00f3nomos dr\u00e1sticamente m\u00e1s cortos, y ambos horizontes mejoran al mismo ritmo, de modo que la distancia entre ellos no se cierra. Modelos mejores dejar\u00e1n que los agentes trabajen m\u00e1s tiempo. Con esta evidencia, no cerrar\u00e1n la distancia entre &ldquo;suele funcionar&rdquo; y &ldquo;funciona con suficiente fiabilidad para dejarlo solo&rdquo;. En esa distancia vive el punto de control, y es estructural y no transitoria.<\/p>\n<p>Es el emparejamiento del CEO y el estudiante en su forma m\u00e1s literal. El CEO decide de antemano d\u00f3nde est\u00e1n los pasos irreversibles y qui\u00e9n responde por ellos. El estudiante mantiene al d\u00eda el registro de fallos, porque la clasificaci\u00f3n solo vale lo que valen las mediciones del mes pasado. Ninguna mitad funciona sin la otra, y ninguna mejora de los modelos har\u00e1 por ti ninguno de los dos trabajos.<\/p>\n<h2 id=\"preguntas-frecuentes\"><span class=\"ez-toc-section\" id=\"Preguntas-frecuentes\"><\/span>Preguntas frecuentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p><strong>\u00bfEsto solo es relevante si uso agentes aut\u00f3nomos?<\/strong><br \/>\nNo. La matriz se apoya en la reversibilidad y la detectabilidad, no en el grado de autonom\u00eda. Una sola respuesta de asistente conversacional que pegas en un correo a un cliente es una tarea cara de deshacer y con error evidente, lo que la sit\u00faa en la casilla de barrera-antes-de-confirmar, haya corrido algo sin supervisi\u00f3n o no. Lo que importa es qu\u00e9 toca la salida, no c\u00f3mo se produjo. La pregunta de frontera relacionada se trata en <a href=\"\/en\/should-you-let-ai-make-the-decision-delegation-boundaries\">qu\u00e9 decisiones delegar y cu\u00e1les no automatizar nunca<\/a>.<\/p>\n<p><strong>\u00bfPor qu\u00e9 no basta con ejecutar la tarea dos veces y comparar?<\/strong><br \/>\nPorque el resultado pass^8 de tau-bench indica que los fallos se agrupan por tarea en lugar de dispersarse entre intentos. Dos ejecuciones de una tarea que el agente lleva mal tender\u00e1n a producir dos respuestas parecidas, seguras y equivocadas. La coincidencia entre ejecuciones solo es evidencia si los fallos son independientes, y los datos medidos dicen que no lo son.<\/p>\n<p><strong>\u00bfMe aplica el art\u00edculo 14 del Reglamento de IA de la UE?<\/strong><br \/>\nCasi con seguridad no del modo en que aplica al proveedor de un sistema de alto riesgo, y el art\u00edculo no sugiere lo contrario. Se usa aqu\u00ed como una lista de comprobaci\u00f3n bien redactada de lo que la supervisi\u00f3n tiene que poder hacer, porque nombra cinco capacidades concretas en lugar de aludir vagamente a una revisi\u00f3n. Toma prestada la estructura; no reclames el cumplimiento.<\/p>\n<p><strong>\u00bfDe qu\u00e9 tama\u00f1o debe ser la muestra en la casilla de muestrear y puntuar?<\/strong><br \/>\nLa literatura de revisi\u00f3n no da un n\u00famero universal, e inventar uno ser\u00eda falsa precisi\u00f3n. La regla de dise\u00f1o que se deriva de los datos va de estratificaci\u00f3n y no de tama\u00f1o: muestrea dentro de clases de tareas, no sobre todo el lote, porque ah\u00ed se concentran los fallos. Empieza con suficientes casos por clase para distinguir un fallo consistente de uno puntual, y luego ajusta seg\u00fan tu propio registro de fallos.<\/p>\n<p><strong>\u00bfY si mi punto de control nunca encuentra nada?<\/strong><br \/>\nDos posibilidades, y piden respuestas distintas. O bien esa clase de tareas es realmente fiable, en cuyo caso s\u00fabela en la matriz y recupera el tiempo, o bien est\u00e1s aprobando en lugar de comprobando. La revisi\u00f3n sobre sesgo de automatizaci\u00f3n apunta primero al entorno: comprueba si la revisi\u00f3n est\u00e1 programada en una franja con tiempo real, y si el agente te tiende una recomendaci\u00f3n para bendecir en lugar de evidencia para juzgar.<\/p>\n<h2 id=\"fuentes\"><span class=\"ez-toc-section\" id=\"Fuentes\"><\/span>Fuentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Thomas Kwa, Ben West, Joel Becker y colegas, Measuring AI Ability to Complete Long Tasks, METR, 2025, incluida la secci\u00f3n que compara los horizontes temporales al 50 y al 80 por ciento de \u00e9xito.<\/p>\n<p>Shunyu Yao, Noah Shinn, Pedram Razavi y Karthik Narasimhan, tau-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains, 2024, que introduce la m\u00e9trica de fiabilidad pass^k.<\/p>\n<p>Reglamento (UE) 2024\/1689 del Parlamento Europeo y del Consejo por el que se establecen normas armonizadas en materia de inteligencia artificial, art\u00edculo 14 sobre supervisi\u00f3n humana, en particular los apartados 1, 2 y 4.<\/p>\n<p>Kate Goddard, Abdul Roudsari y Jeremy C. Wyatt, Automation bias: a systematic review of frequency, effect mediators, and mitigators, Journal of the American Medical Informatics Association, volumen 19, n\u00famero 1, 2012.<\/p>\n<p>National Institute of Standards and Technology, Artificial Intelligence Risk Management Framework 1.0, 2023, y sus cuatro funciones principales.<\/p>\n<p>METR, Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity, 2025, y la nota de febrero de 2026 que revisa la posici\u00f3n de la organizaci\u00f3n sobre ese resultado.<\/p>\n<p>Oficina del Censo de los Estados Unidos, Business Trends and Outlook Survey, estimaciones de uso de inteligencia artificial para el periodo de diciembre de 2025 a mayo de 2026.<\/p>\n<hr>\n<p><em>Este contenido fue recopilado con el apoyo de la IA tras una investigaci\u00f3n exhaustiva, y luego redactado y preparado para su publicaci\u00f3n por el equipo editorial de CEOtudent.<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>La mayor\u00eda de los consejos sobre supervisar agentes de IA se reducen a &#8216;revisa la salida&#8217;, que no es un dise\u00f1o sino una esperanza. Las mediciones publicadas apuntan a algo m\u00e1s concreto. METR informa de que la duraci\u00f3n de tarea que un agente resuelve con un 50 por ciento de \u00e9xito es unas cinco veces la que resuelve con un 80 por ciento, y en el modelo con el horizonte al 80 por ciento m\u00e1s largo que midi\u00f3 eso supuso 59 minutos frente a 15. El banco de pruebas tau-bench hall\u00f3 que agentes punteros con llamada a funciones resuelven menos del 50 por ciento de las tareas en un solo intento y menos del 25 por ciento cuando la misma tarea se ejecuta ocho veces. Esa segunda cifra es muy superior a lo que predecir\u00eda el fallo aleatorio, lo que significa que los fallos de los agentes se agrupan por tarea en lugar de dispersarse por azar, y esa sola inferencia cambia d\u00f3nde corresponde situar un punto de control. Este art\u00edculo deriva la Matriz de Colocaci\u00f3n de Puntos de Control de CEOtudent a partir de la reversibilidad y la detectabilidad, traduce a un flujo de trabajo individual las cinco capacidades de supervisi\u00f3n humana recogidas en el art\u00edculo 14 del Reglamento de Inteligencia Artificial de la Uni\u00f3n Europea, y explica con la literatura sobre sesgo de automatizaci\u00f3n por qu\u00e9 un punto de control existente puede fallar igualmente.<\/p>\n","protected":false},"author":1,"featured_media":325634,"comment_status":"open","ping_status":"","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[5,18],"tags":[],"class_list":["post-325633","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-is","category-strateji"],"_links":{"self":[{"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/posts\/325633","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/comments?post=325633"}],"version-history":[{"count":0,"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/posts\/325633\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/media\/325634"}],"wp:attachment":[{"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/media?parent=325633"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/categories?post=325633"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/tags?post=325633"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}