TL;DR. Los errores de la IA son lo bastante frecuentes en el trabajo real como para ser un suministro constante de material de práctica, y la mayoría de la gente tira ese material a la basura. En un experimento de campo aleatorizado con casi mil estudiantes de matemáticas de secundaria (Bastani y colaboradores, PNAS, 2025), una interfaz simple de GPT-4 elevó las notas de práctica un 48 %, pero esos estudiantes obtuvieron un 17 % menos que el grupo de control cuando se retiró la herramienta. Esa misma herramienta dio una respuesta correcta solo el 51 % de las veces. Una evaluación de Stanford y Yale concluyó que las principales herramientas de investigación jurídica alucinan entre el 17 y el 33 % de las veces. En el lado del aprendizaje, un metaanálisis de 24 estudios sobre el entrenamiento en gestión de errores halló un efecto medio positivo de d = 0,44, que sube a d = 0,80 en la transferencia a tareas estructuralmente nuevas. La jugada del CEO: ser dueño de un Registro de Errores de IA y de una política de verificación por escrito, para que los errores sean un riesgo gestionado y no una sorpresa. La jugada del estudiante: tratar cada error detectado como una repetición de práctica, clasificarlo, rehacerlo sin la herramienta y revisar el registro cada semana.
Este artículo pertenece al clúster de evaluación. Empieza por la pieza central, la habilidad de evaluación: juzgar los resultados de la IA, para conocer el método general. Para la mecánica que hay detrás de los errores, consulta por qué la IA alucina y cómo detectar pronto los errores del modelo. Para decidir cuánta comprobación merece una tarea, consulta calibración de la confianza: cuándo fiarse de las recomendaciones de la IA.
¿Por qué tratar un error de la IA como datos de entrenamiento y no como una molestia?
La reacción habitual ante un error del modelo es corregirlo y seguir adelante. Eso resuelve el resultado y desperdicia la lección. Dos líneas de investigación sugieren un uso mejor.
La primera es la psicología del aprendizaje a partir de los errores. La revisión de Janet Metcalfe en el Annual Review of Psychology (2017) resume la evidencia de laboratorio en una frase: “el aprendizaje con errores seguido de retroalimentación correctiva es beneficioso para el aprendizaje”. Añade una condición que importa a cualquiera que trabaje con IA: “La retroalimentación correctiva, incluido el análisis del razonamiento que condujo al error, es crucial”. Corregir una cifra equivocada no basta. La ganancia procede de averiguar por qué estaba equivocada.
La segunda es la evidencia sobre lo que ocurre cuando la gente usa la IA sin ese análisis. Los autores del experimento de campo de PNAS exponen el riesgo con claridad. Como la IA generativa es falible, “los usuarios deben comprobar con vigilancia sus resultados y corregir cualquier problema presente; si no aprenden las habilidades subyacentes, puede que carezcan de la pericia necesaria para hacerlo”. La habilidad de comprobar depende de la habilidad de hacer. Si el uso de la IA erosiona la segunda, la primera se va con ella.
Cada respuesta errónea de un modelo es o bien un pequeño impuesto pagado y olvidado, o bien un problema con la retroalimentación incluida. Esa es la mirada de CEO y de estudiante aplicada a un mismo objeto. Un director ejecutivo no trata un defecto como mala suerte; el defecto se registra, se clasifica y se rastrea hasta un proceso. Un buen estudiante no trata una respuesta incorrecta como una vergüenza; la respuesta incorrecta es el elemento más informativo de la página. El Registro de Errores de IA que se describe más abajo es ambas cosas a la vez.
¿Con qué frecuencia se equivoca realmente la IA?
La respuesta honesta es que no existe una tasa única. Las tasas de error publicadas difieren en más de un orden de magnitud según la tarea. Las cifras siguientes aparecen tal como están impresas en sus fuentes.
| Tarea y sistema evaluado | Cifra publicada | Fuente |
|---|---|---|
| Resumir un documento de noticias proporcionado, mejores modelos de la clasificación HHEM | Tasa de alucinación más baja 1,3 % (dos modelos empatados), después 1,4 % y 1,5 % | Stanford HAI, AI Index Report 2025 |
| Preguntas breves de búsqueda de hechos (SimpleQA, más de 4.000 preguntas) | El modelo con mejor rendimiento respondió con éxito el 42,7 % de las preguntas | Stanford HAI, AI Index Report 2025 |
| Problemas de práctica de matemáticas de secundaria, GPT-4 tras una interfaz de chat simple | Respuesta correcta el 51 % de las veces; errores lógicos 42 %; errores aritméticos 8 % | Bastani et al., PNAS, 2025 |
| Preguntas de investigación jurídica, herramientas comerciales con recuperación (202 consultas) | Alucinación entre el 17 % y el 33 % de las veces | Magesh et al., preprint de 2024 |
| Preguntas directas y verificables sobre casos de tribunales federales, modelos de propósito general | Alucinación entre el 58 % (ChatGPT 4) y el 88 % (Llama 2) de las veces | Dahl et al., 2024 |
Fuentes: Stanford Institute for Human-Centered AI, AI Index Report 2025, capítulo 3; Bastani et al., PNAS 122, 2025; Magesh et al., preprint de arXiv 2405.20362, 2024; Dahl et al., arXiv 2401.01301, de próxima publicación en el Journal of Legal Analysis. Todas las cifras describen los modelos y las fechas concretos evaluados y no son tasas actuales de ningún producto.
De la tabla se desprenden tres puntos.
Primero, la tasa depende de la tarea mucho más que de la marca. El experimento de Harvard Business School y Boston Consulting Group dio nombre a esta irregularidad. Su resumen describe una “frontera tecnológica irregular”, en la que la ayuda de la IA “mejora el rendimiento en algunas tareas pero lo empeora en otras, incluso dentro del mismo flujo de trabajo de conocimiento y con un nivel de dificultad aparentemente similar”.
Segundo, las herramientas especializadas reducen los errores sin eliminarlos. El estudio jurídico evaluó productos cuyos proveedores habían anunciado el fin de las alucinaciones. Los autores informan de que Lexis+ AI respondió con exactitud el 65 % de las consultas, de que AI-Assisted Research de Westlaw fue exacto el 42 % de las veces y de que “Más de 1 de cada 6” consultas llevaron a Lexis+ AI y a Ask Practical Law AI a responder con información engañosa o falsa. Su definición es útil para cualquier registro de errores: una respuesta cuenta como alucinada “si es incorrecta o está mal fundamentada”.
Tercero, los modelos son malos jueces de sus propios errores. Dahl y colaboradores concluyen que los modelos “tienen dificultades para predecir sus propias alucinaciones y a menudo aceptan sin crítica las suposiciones jurídicas incorrectas de los usuarios”. Un tono seguro no es una prueba.
¿Qué ocurre cuando la gente no aprende de los errores de la IA?
El experimento de PNAS es la evidencia más clara, porque midió tanto el rendimiento con ayuda como el rendimiento sin ayuda posterior. El estudio se llevó a cabo en un instituto de secundaria de Turquía en el semestre de otoño del curso académico 2023-2024, a lo largo de cuatro sesiones de 90 minutos y unas cincuenta clases. Los estudiantes practicaron con una de dos herramientas de GPT-4 o solo con libros de texto, y después hicieron un examen a libro cerrado.
| Medida | Control (solo libros de texto) | GPT Base (interfaz de chat simple) | GPT Tutor (prompts diseñados por docentes) |
|---|---|---|---|
| Nota de práctica con ayuda, variación frente al control (sobre 1) | Media 0,28 | +0,137 | +0,361 |
| Mejora en la práctica tal como está impresa | – | 48 % | 127 % |
| Examen sin ayuda, variación frente al control (sobre 1) | – | -0,054 | -0,004 |
| Efecto en el examen tal como está impreso | – | Reducción del 17 % | Estadísticamente indistinguible del control |
Fuente: Bastani H, Bastani O, Sungu A, Ge H, Kabakcı Ö, Mariman R, PNAS 122, e2422633122, 2025.
Dos detalles hacen que esto sea más que una advertencia sobre escolares. Los autores auditaron la herramienta simple planteándole diez veces cada uno de los 57 problemas de práctica. La herramienta “da una respuesta correcta solo el 51 % de las veces de media”, con errores lógicos el 42 % de las veces y errores aritméticos el 8 % de las veces. Los estudiantes practicaban con un tutor que se equivocaba aproximadamente la mitad de las veces, y el examen sin ayuda muestra que no convirtieron esos errores en aprendizaje.
Tampoco se dieron cuenta. Los estudiantes del grupo GPT Base “no percibieron que rindieran peor ni que aprendieran menos”. La sensación de progreso y el hecho del progreso se separaron.
El experimento de consultoría muestra el mismo patrón en el trabajo profesional. Entre 758 trabajadores del conocimiento, quienes usaron GPT-4 en 18 tareas dentro de la frontera completaron un 12,2 % más de tareas y las terminaron un 25,1 % más rápido. En una tarea seleccionada para quedar fuera de la frontera, tenían “un 19 % menos de probabilidades de producir soluciones correctas en comparación con quienes no usaban IA”. La herramienta no anunciaba de qué lado de la frontera estaba una tarea. Solo quienes comprobaban podían saberlo.
La investigación anterior sobre sistemas de apoyo a la decisión explica el mecanismo. Una revisión sistemática del sesgo de automatización en el Journal of the American Medical Informatics Association examinó 13.821 artículos e incluyó 74. En su análisis agrupado de cuatro estudios, la razón de riesgo fue de 1,26 (IC del 95 %: 1,11 a 1,44): cuando el consejo del sistema era erróneo, “aumentó en un 26 % el riesgo de que se tomara una decisión incorrecta”. La revisión describe dos clases de error humano: la comisión, seguir un consejo incorrecto, y la omisión, no actuar porque el sistema no lo indicó. Ambas pertenecen a un registro de errores, porque ambas son tuyas, no del modelo.
¿Qué dice la ciencia del aprendizaje sobre los errores que se corrigen?
Si los errores sin corregir perjudican, la investigación sobre los errores corregidos apunta en sentido contrario. Las cifras aparecen tal como están impresas en cada fuente.
| Hallazgo | Base de evidencia | Tamaño del efecto tal como está impreso |
|---|---|---|
| Entrenamiento en gestión de errores, global (Keith y Frese, 2008) | 24 estudios, N = 2.183 | d de Cohen = 0,44 |
| Ídem, transferencia posterior al entrenamiento | Análisis de moderadores | d = 0,56 |
| Ídem, tareas estructuralmente distintas (transferencia adaptativa) | Análisis de moderadores | d = 0,80 |
| Resolución de problemas antes de la instrucción (Sinha y Kapur, 2021) | 53 estudios, 166 comparaciones | g de Hedge 0,36, IC del 95 %: 0,20 a 0,51 |
| Ídem, alta fidelidad a los principios del fracaso productivo | Subconjunto | g de Hedge entre 0,37 y 0,58 |
Fuentes: Keith N, Frese M, Journal of Applied Psychology 93(1), 2008; Sinha T, Kapur M, Review of Educational Research 91(5), 2021. Ambos leídos solo a nivel de resumen.
Cuatro hallazgos se trasladan directamente a la práctica con la IA.
Los errores ayudan sobre todo en problemas nuevos. Keith y Frese hallaron el mayor efecto en la transferencia adaptativa, 0,80 frente a 0,44 en el conjunto, unas 1,8 veces la media. El entrenamiento basado en errores es “más adecuado que los métodos de entrenamiento que evitan los errores para fomentar la transferencia a tareas novedosas”. Las tareas novedosas son aquello de lo que se compone cada vez más un empleo en la era de la IA.
Intentarlo primero importa, incluso cuando el intento fracasa. Kornell, Hays y Bjork realizaron seis experimentos en los que los participantes tenían que adivinar respuestas que no podían conocer antes de verlas. Su conclusión: “Los intentos de recuperación fallidos mejoraron el aprendizaje con ambos tipos de materiales”. La implicación para el uso de la IA es una regla de secuencia. Formula tu propia respuesta, estimación o esquema antes de leer la del modelo.
Los errores cometidos con seguridad son los más corregibles. Butterfield y Metcalfe esperaban que los errores de alta confianza fueran los más difíciles de arreglar. Encontraron lo contrario: “los errores de alta confianza fueron los que con mayor probabilidad se corrigieron en una prueba posterior”. Por eso el registro de más abajo anota tu confianza antes de la comprobación. Las entradas en las que estabas seguro y te equivocaste son las más valiosas.
La retroalimentación tiene que incluir el razonamiento. La condición de Metcalfe, citada más arriba, descarta la versión perezosa de un registro de errores. Una lista de resultados erróneos enseña poco. Una lista de resultados erróneos con la causa y la comprobación que los habría detectado es un plan de estudios.
Una cautela: Sinha y Kapur informan de que, para “el aprendizaje de habilidades de dominio general”, los tamaños del efecto favorecieron la instrucción primero. Comprobar los resultados de la IA es en parte una habilidad general, así que aprende también las comprobaciones de forma explícita. La taxonomía siguiente es esa instrucción.
¿Qué habilidad humana entrena cada tipo de error de la IA?
Marco editorial de CEOtudent: la taxonomía de errores de la IA. Las seis primeras filas son errores del lado del modelo; las dos últimas son errores del lado humano, tomados de la literatura sobre el sesgo de automatización. La correspondencia con las habilidades es un juicio editorial, no un resultado medido.
| Código | Tipo de error | Qué aspecto tiene | Habilidad humana que entrena | La repetición |
|---|---|---|---|---|
| F | Fuente o hecho inventado | Una cita, un caso, una declaración o una estadística que no existe | Verificación de fuentes | Abre el original y localiza la línea exacta antes de usarla |
| M | Afirmación mal fundamentada | Una fuente real citada para algo que no dice | Lectura atenta | Compara la afirmación con el pasaje citado palabra por palabra |
| L | Error lógico | Pasos plausibles que no se siguen, o el método equivocado | Razonamiento y estructuración de problemas | Rehaz los dos primeros pasos sin ayuda y después localiza dónde se separan los caminos |
| A | Error aritmético o de unidades | Método correcto, número incorrecto | Estimación | Escribe una estimación de orden de magnitud antes de leer la respuesta |
| P | Premisa falsa aceptada | El modelo construye sobre una suposición errónea del prompt | Formulación de preguntas | Haz la misma pregunta con la premisa planteada de forma neutra |
| S | Desviación del alcance o respuesta incompleta | Responde a una pregunta cercana u omite una parte requerida | Redacción de encargos | Reescribe el encargo con una definición de terminado y vuelve a ejecutarlo |
| C | Comisión (humana) | Aceptaste un resultado erróneo sin comprobarlo | Disciplina de verificación | Nombra la comprobación que se omitió y añádela a la política |
| O | Omisión (humana) | Pasaste algo por alto porque el modelo no lo planteó | Exploración independiente | Enumera lo que debe contener una buena respuesta antes de escribir el prompt |
Los códigos siguen distinciones hechas en las fuentes: respuestas incorrectas frente a mal fundamentadas en el estudio jurídico, errores lógicos frente a aritméticos en la auditoría de PNAS (42 frente a 8 %), premisas falsas aceptadas en Dahl y colaboradores, y comisión frente a omisión en la revisión sobre el sesgo de automatización.
Un patrón en los códigos es un diagnóstico. Muchas entradas S significan que los encargos son débiles. Muchas entradas C significan que no se está siguiendo la política de verificación. Muchas entradas F y M en un mismo dominio significan que la herramienta ha sobrepasado su frontera para esa tarea. Para el lado de la redacción de encargos de este ciclo, consulta el manual de gestión de la IA.
¿Qué debe contener un Registro de Errores de IA?
Marco editorial de CEOtudent: la plantilla del Registro de Errores de IA. Una fila por cada error detectado. Basta con una hoja de cálculo o un archivo de notas.
| Columna | Qué escribir | Por qué está ahí |
|---|---|---|
| Fecha y tarea | Qué se estaba produciendo y para quién | Muestra qué flujos de trabajo generan errores |
| Nivel de riesgo | Bajo, medio o alto | Vincula la entrada con la política de verificación |
| Herramienta y modo | Modelo, con o sin búsqueda o documentos | Las tasas de error difieren según la tarea y la configuración |
| El error, citado | La frase o el número erróneo exacto | Evita el recuerdo vago |
| Código | F, M, L, A, P, S, C u O | Hace posible el recuento semanal |
| Cómo se detectó | Qué comprobación, o quién lo encontró aguas abajo | Muestra qué comprobaciones compensan su tiempo |
| Confianza antes de la comprobación | De 0 a 100 en que el resultado era correcto | Saca a la luz los fallos cometidos con seguridad, el tipo más corregible |
| Causa en el lado humano | Encargo débil, contexto ausente, comprobación omitida, dominio desconocido | Traslada la lección del modelo al usuario |
| Respuesta correcta y fuente | La corrección, con el lugar donde se verificó | La retroalimentación correctiva en sí |
| Cambio de regla | La línea añadida a la política de verificación, o “ninguno” | Convierte el error en un cambio de proceso |
| Fecha de repetición de la prueba | Cuándo rehacer este elemento sin ayuda | Programa la repetición de práctica |
Dos columnas hacen la mayor parte del trabajo. Las entradas detectadas aguas abajo por un colega, un cliente o un revisor son fugas; su proporción sobre el total de entradas muestra si la comprobación está funcionando. La columna de confianza protege frente a la brecha de percepción del estudio de PNAS: un número escrito antes de la comprobación no puede revisarse después.
Para el mismo formato de antes y después aplicado a las decisiones, consulta la plantilla y el protocolo del diario de decisiones.
¿Cuánto material de práctica hay?
Análisis de CEOtudent de las tasas publicadas anteriores. La tabla convierte cada tasa impresa en lo que encontraría una persona que comprueba todos los resultados. Supone que cada resultado es una extracción independiente a la tasa impresa, lo cual es una simplificación: los errores reales se agrupan por tipo de tarea.
| Contexto y tasa impresa | Errores esperados por cada 20 resultados | Probabilidad de al menos un error en 10 resultados | Un error de media cada | Errores encontrados en 50 semanas con 20 resultados comprobados a la semana |
|---|---|---|---|---|
| Resúmenes de documentos, mejores modelos, 1,3 % | 0,3 | 12,3 % | 76,9 resultados | 13 |
| Herramientas de investigación jurídica, extremo inferior, 17 % | 3,4 | 84,5 % | 5,9 resultados | 170 |
| Herramientas de investigación jurídica, extremo superior, 33 % | 6,6 | 98,2 % | 3,0 resultados | 330 |
| Respuestas de matemáticas de GPT-4 simple, 49 % (100 menos 51) | 9,8 | 99,9 % | 2,0 resultados | 490 |
| Chatbot general en preguntas de jurisprudencia, extremo inferior, 58 % | 11,6 | más del 99,9 % | 1,7 resultados | 580 |
Fuente: cálculos de CEOtudent (calc.py) a partir de las tasas impresas en el AI Index Report 2025, Magesh et al. 2024, Bastani et al. 2025 y Dahl et al. 2024. Ilustrativo, no una previsión para ninguna herramienta actual.
Con una tasa del 17 %, quien acepta diez resultados sin comprobar tiene un 84,5 % de probabilidades de que al menos uno sea erróneo. La misma tasa, con comprobación, proporciona unos 170 ejemplos resueltos con retroalimentación en un año. El extremo inferior del chatbot general es 3,4 veces el de las herramientas especializadas, de modo que la elección de la herramienta cambia la carga sin eliminarla.
Con un 1,3 %, un error llega aproximadamente una vez cada 77 resultados, la condición en la que la atención se dispersa. Las tareas de tasa baja necesitan una regla fija de muestreo en la política, no vigilancia.
¿Cómo se hace la revisión semanal?
Protocolo editorial de CEOtudent: 20 minutos, una vez a la semana. A lo largo de 50 semanas esto supone unas 16,7 horas.
- Contar y clasificar (5 minutos). Suma las entradas de la semana por código. Anota las fugas, las entradas que detectó otra persona.
- Rehacer un error sin ayuda (5 minutos). Toma la entrada con la confianza más alta antes de la comprobación. Sin la herramienta, produce la respuesta correcta o el método correcto. Este es el intento de recuperación; funciona incluso cuando fracasa, siempre que después se revise la respuesta correcta.
- Rastrear la causa (5 minutos). Para los dos códigos más frecuentes, escribe una frase sobre la causa del lado humano. Usa la condición de Metcalfe como prueba: la nota debe describir el razonamiento que condujo al fallo, no solo el fallo.
- Cambiar una regla (3 minutos). Añade, endurece o elimina una línea de la política de verificación. Un cambio a la semana es suficiente; más no se cumplirán.
- Programar la repetición de la prueba (2 minutos). Fija una fecha para volver a rehacer el elemento de esta semana, y rehaz el elemento de una semana anterior al que le ha llegado el turno.
Una vez al mes, comprueba que la proporción de fugas está bajando y que la mezcla de códigos se aleja de C y S.
¿Cómo es el lado del CEO: la política de verificación?
Un registro sin política es un diario. La política es un documento escrito breve que dice cuánta comprobación recibe cada clase de trabajo antes de salir de tus manos. La investigación sobre el sesgo de automatización respalda ponerla por escrito. La revisión de JAMIA incluye “la formación y el énfasis en la responsabilidad del usuario” entre los mitigadores, e informa de un estudio en el que las personas que se percibían a sí mismas como responsables cometieron menos errores de sesgo de automatización. Parasuraman y Manzey son menos optimistas y concluyen que el sesgo de automatización “no puede prevenirse mediante formación o instrucciones”. Las dos revisiones coinciden en el punto práctico: las buenas intenciones no son un control. Un responsable con nombre y un procedimiento fijo sí lo son.
Marco editorial de CEOtudent: una política de verificación de tres niveles.
| Nivel | Trabajo típico | Comprobación mínima |
|---|---|---|
| 1. Riesgo bajo, reversible | Borradores, lluvia de ideas, notas internas | Leer una vez; comprobar por muestreo un hecho por documento |
| 2. Riesgo medio | Texto dirigido a clientes, análisis que fundamenta una decisión, código que se va a ejecutar | Verificar cada número, nombre, fecha y cita con una fuente; repetir los cálculos de forma independiente |
| 3. Riesgo alto o fuera de tu especialidad | Contenido jurídico, médico, financiero o de seguridad; cualquier cosa firmada o publicada | Comprobaciones del nivel 2 más la revisión de una persona cualificada; sin fuente, no hay afirmación |
Dos reglas mantienen la honestidad de la política. Cada fuga sube ese tipo de tarea un nivel hasta que pase un mes sin otra. Y cada regla nombra su comprobación, no una intención (“abre la página citada”, no “ten cuidado”).
La encuesta de Lee y colaboradores, de Microsoft Research y Carnegie Mellon, muestra por qué la política no puede apoyarse en la sensación. Entre 319 trabajadores del conocimiento que compartieron 936 ejemplos de uso de la IA generativa en el trabajo, “una mayor confianza en la IA generativa se asocia con menos pensamiento crítico, mientras que una mayor confianza en uno mismo se asocia con más pensamiento crítico”. La confianza en la herramienta redujo la comprobación justo donde la comprobación era la única salvaguarda. La distancia entre la confianza en la herramienta y la confianza en uno mismo es el tema de la brecha de discernimiento.
¿Estás aprendiendo de los errores de la IA? Un cuestionario de 8 preguntas
Cuestionario editorial de CEOtudent. Puntúa cada pregunta con 0 (no), 1 (a veces) o 2 (de forma constante). Máximo 16.
- ¿Formulas tu propia estimación, esquema o respuesta antes de leer la del modelo?
- ¿Anotas en algún sitio los errores detectados, con el texto erróneo exacto?
- ¿Clasificas cada error por tipo?
- ¿Escribes tu confianza antes de comprobar?
- ¿Anotas la causa del lado humano, no solo el fallo del modelo?
- ¿Rehaces al menos un error sin ayuda cada semana?
- ¿Tienes una política de verificación por escrito con niveles según el riesgo?
- ¿Haces seguimiento de los errores que otra persona detectó después de ti?
| Puntuación | Lectura | Siguiente paso |
|---|---|---|
| 0-6 | Los errores se corrigen y se olvidan | Empieza el registro con cinco columnas: tarea, error, código, causa, corrección |
| 7-11 | Los errores se capturan, pero aún no se convierten | Añade la columna de confianza y el trabajo semanal de rehacer sin ayuda |
| 12-16 | Los errores son un plan de estudios en funcionamiento | Sigue la proporción mensual de fugas y poda las reglas que nunca se activan |
Lo que esto no significa
Los errores de la IA no son buenos, y más errores no es mejor. La investigación sobre el aprendizaje trata de errores corregidos en contextos de bajo riesgo. La revisión de Metcalfe recomienda permitir los errores “mientras se encuentren en situaciones de aprendizaje de bajo riesgo”, no en un trabajo que llega a un cliente o a un tribunal.
El vínculo entre los errores de la IA y la habilidad humana es una inferencia. Los estudios sobre aprendizaje citados aquí examinan los errores de las propias personas, sobre todo en aulas, laboratorios y cursos de formación. Ningún estudio abierto para este artículo puso a prueba si registrar los errores de un modelo mejora el juicio del usuario. El marco aplica principios establecidos a un contexto nuevo; no es un efecto medido.
Las tasas de error son instantáneas. Describen modelos concretos evaluados en 2023 y 2024. Los autores del estudio jurídico advierten de que su estimación “no pretende ser una estimación insesgada” de la tasa poblacional de alucinaciones en las consultas de IA jurídica. Las herramientas actuales pueden hacerlo mejor o peor en cualquier tarea dada.
La tabla de material de práctica es aritmética, no predicción. Supone errores independientes a una tasa constante y que todos los errores se detectan.
Preguntas frecuentes
¿Cuántos errores hacen falta para que un registro sea útil?
Unos pocos. El protocolo semanal funciona con una sola entrada, porque el paso 2 solo necesita un elemento que rehacer. Los patrones en los códigos suelen necesitar unas semanas de entradas.
¿Deben registrarse los errores cuando el riesgo era trivial?
Sí, brevemente. Los errores de bajo riesgo son el material de práctica más seguro, y revelan las mismas debilidades en los encargos y en las comprobaciones que causan los errores de alto riesgo.
¿Merece la pena registrar los errores que fueron culpa del usuario?
Esas son las entradas más útiles. Los códigos C y O existen porque la literatura sobre el sesgo de automatización trata como errores humanos el seguir un consejo erróneo y el pasar por alto cuestiones no señaladas.
¿Un modelo mejor hace innecesario el registro?
No. Unas tasas de error más bajas hacen que cada error sea más raro y, por tanto, más fácil de pasar por alto. El registro pasa entonces de ser una fuente de práctica a ser un registro de muestreo que demuestra que las comprobaciones se siguen haciendo.
¿Cuál es el primer paso más rápido?
Antes de la próxima respuesta de la IA sobre algo que importe, escribe una estimación de una línea de cuál debería ser la respuesta. Después compara. Ese único hábito aplica el hallazgo sobre la recuperación y hace que la primera entrada del registro sea fácil de escribir.
Fuentes
- Bastani H, Bastani O, Sungu A, Ge H, Kabakcı Ö, Mariman R. Generative AI without guardrails can harm learning: Evidence from high school mathematics. Proceedings of the National Academy of Sciences 122, e2422633122, 2025. Una corrección de 2025 afecta únicamente a la afiliación de un autor.
- Magesh V, Surani F, Dahl M, Suzgun M, Manning CD, Ho DE. Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools. Preprint de arXiv 2405.20362, 2024.
- Dahl M, Magesh V, Suzgun M, Ho DE. Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models. arXiv 2401.01301, 2024, de próxima publicación en el Journal of Legal Analysis.
- Maslej N, et al. The AI Index 2025 Annual Report. AI Index Steering Committee, Institute for Human-Centered AI, Stanford University, abril de 2025. Capítulo 3, Responsible AI.
- Dell’Acqua F, McFowland E, Mollick E, Lifshitz-Assaf H, Kellogg KC, et al. Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality. Organization Science 37(2): 403-423, 2026. Solo resumen.
- Goddard K, Roudsari A, Wyatt JC. Automation bias: a systematic review of frequency, effect mediators, and mitigators. Journal of the American Medical Informatics Association 19(1): 121-127, 2012.
- Parasuraman R, Manzey DH. Complacency and Bias in Human Use of Automation: An Attentional Integration. Human Factors 52(3): 381-410, 2010. Solo resumen.
- Lee HP, Sarkar A, Tankelevitch L, et al. The Impact of Generative AI on Critical Thinking: Self-Reported Reductions in Cognitive Effort and Confidence Effects From a Survey of Knowledge Workers. CHI Conference on Human Factors in Computing Systems, 2025.
- Metcalfe J. Learning from Errors. Annual Review of Psychology 68: 465-489, 2017. Solo resumen.
- Keith N, Frese M. Effectiveness of Error Management Training: A Meta-Analysis. Journal of Applied Psychology 93(1): 59-69, 2008. Solo resumen.
- Sinha T, Kapur M. When Problem Solving Followed by Instruction Works: Evidence for Productive Failure. Review of Educational Research 91(5): 761-798, 2021. Solo resumen.
- Kornell N, Hays MJ, Bjork RA. Unsuccessful Retrieval Attempts Enhance Subsequent Learning. Journal of Experimental Psychology: Learning, Memory, and Cognition 35(4): 989-998, 2009.
- Butterfield B, Metcalfe J. Errors Committed With High Confidence Are Hypercorrected. Journal of Experimental Psychology: Learning, Memory, and Cognition 27(6): 1491-1494, 2001. Solo resumen.
Las tablas de datos recogen las cifras tal como están impresas en sus fuentes. La taxonomía de errores, la plantilla del Registro de Errores, la tabla de material de práctica, el protocolo de revisión semanal, la política de verificación y el cuestionario son análisis o marcos editoriales de CEOtudent; los múltiplos 1,8 y 3,4 son cálculos de CEOtudent. No utilizados: la versión en documento de trabajo del experimento de consultoría, que no pudo abrirse; los valores del estudio jurídico para GPT-4 disponibles solo en gráfico; la estimación ajustada por sesgo de 0,87 en Sinha y Kapur; y las afirmaciones populares de que los chatbots se equivocan una proporción fija de las veces, que ninguna fuente abierta aquí respalda.
Este contenido fue recopilado con el apoyo de la IA tras una investigación exhaustiva, y luego redactado y preparado para su publicación por el equipo editorial de CEOtudent.
This post is also available in:











