{"id":325703,"date":"2026-09-05T05:05:41","date_gmt":"2026-09-05T02:05:41","guid":{"rendered":"https:\/\/ceotudent.com\/por-que-la-ia-alucina-mecanica-errores-modelo-detectarlos-pronto"},"modified":"2026-09-05T05:05:41","modified_gmt":"2026-09-05T02:05:41","slug":"por-que-la-ia-alucina-mecanica-errores-modelo-detectarlos-pronto","status":"publish","type":"post","link":"https:\/\/ceotudent.com\/es\/por-que-la-ia-alucina-mecanica-errores-modelo-detectarlos-pronto","title":{"rendered":"Por qu\u00e9 la IA alucina: la mec\u00e1nica de los errores de modelo y c\u00f3mo detectarlos pronto"},"content":{"rendered":"<p><strong>En resumen.<\/strong> Un modelo de lenguaje que se inventa una referencia no est\u00e1 averiado. Est\u00e1 haciendo exactamente aquello para lo que se le puntu\u00f3. En septiembre de 2025, cuatro investigadores, tres en OpenAI y uno en Georgia Tech, publicaron un argumento seg\u00fan el cual la alucinaci\u00f3n sobrevive por la forma en que se califica a los modelos: en una escala binaria de correcto o incorrecto, un modelo que adivina siempre gana a un modelo id\u00e9ntico que admite incertidumbre. Revisaron diez evaluaciones destacadas y hallaron que nueve usan calificaci\u00f3n binaria y que ninguna concede cr\u00e9dito pleno a un \u00abno lo s\u00e9\u00bb calibrado. Nosotros tomamos los propios resultados de SimpleQA de OpenAI y calculamos una columna que su art\u00edculo no recoge: la tasa de farol, es decir, la proporci\u00f3n de fallos en los que el modelo respondi\u00f3 mal en lugar de abstenerse. Va del 20,5% al 99,0%, una horquilla de 4,8 veces, y es casi independiente de la exactitud. Luego consultamos la tabla de alucinaciones de Vectara, actualizada el 11 de mayo de 2026, para ver qu\u00e9 ocurre cuando los hechos se aportan en la indicaci\u00f3n. El anclaje ayuda mucho, pero produjo un resultado que no esper\u00e1bamos: en cuatro comparaciones separadas dentro de la misma familia, subir el esfuerzo de razonamiento elev\u00f3 la tasa de alucinaci\u00f3n, y los res\u00famenes se alargaron sin excepci\u00f3n. A continuaci\u00f3n: los cinco mecanismos verificados, en qu\u00e9 r\u00e9gimen est\u00e1 tu tarea y una prueba de detecci\u00f3n para cada uno.<\/p>\n<p>Esta es la capa mec\u00e1nica bajo nuestros trabajos sobre <a href=\"https:\/\/ceotudent.com\/en\/the-evaluation-skill-judging-ai-output\">juzgar la producci\u00f3n de la IA<\/a> y sobre <a href=\"https:\/\/ceotudent.com\/en\/trust-calibration-when-to-trust-ai-recommendations\">la calibraci\u00f3n de la confianza<\/a>. Aquellos art\u00edculos dicen cu\u00e1ndo confiar. Este dice por qu\u00e9 los fallos ocurren donde ocurren.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_84 counter-hierarchy ez-toc-counter ez-toc-grey ez-toc-container-direction\">\n<div class=\"ez-toc-title-container\">\n<p class=\"ez-toc-title\" style=\"cursor:inherit\">Table of Contents<\/p>\n<span class=\"ez-toc-title-toggle\"><a href=\"#\" class=\"ez-toc-pull-right ez-toc-btn ez-toc-btn-xs ez-toc-btn-default ez-toc-toggle\" aria-label=\"Alternar tabla de contenidos\"><span class=\"ez-toc-js-icon-con\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Toggle<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #999;color:#999\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewBox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #999;color:#999\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewBox=\"0 0 24 24\" version=\"1.2\" baseProfile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/span><\/a><\/span><\/div>\n<nav><ul class='ez-toc-list ez-toc-list-level-1 ' ><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/ceotudent.com\/es\/por-que-la-ia-alucina-mecanica-errores-modelo-detectarlos-pronto\/#La-respuesta-en-una-frase\" >La respuesta en una frase<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/ceotudent.com\/es\/por-que-la-ia-alucina-mecanica-errores-modelo-detectarlos-pronto\/#La-tasa-de-farol-una-columna-propia\" >La tasa de farol: una columna propia<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/ceotudent.com\/es\/por-que-la-ia-alucina-mecanica-errores-modelo-detectarlos-pronto\/#El-segundo-regimen-que-pasa-cuando-aportas-tu-los-hechos\" >El segundo r\u00e9gimen: qu\u00e9 pasa cuando aportas t\u00fa los hechos<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/ceotudent.com\/es\/por-que-la-ia-alucina-mecanica-errores-modelo-detectarlos-pronto\/#El-hallazgo-que-no-esperabamos-el-esfuerzo-de-razonamiento-empeora-la-alucinacion-con-fuente-aportada\" >El hallazgo que no esper\u00e1bamos: el esfuerzo de razonamiento empeora la alucinaci\u00f3n con fuente aportada<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/ceotudent.com\/es\/por-que-la-ia-alucina-mecanica-errores-modelo-detectarlos-pronto\/#Los-cinco-mecanismos-y-que-aspecto-tiene-cada-uno\" >Los cinco mecanismos y qu\u00e9 aspecto tiene cada uno<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/ceotudent.com\/es\/por-que-la-ia-alucina-mecanica-errores-modelo-detectarlos-pronto\/#Un-protocolo-de-trabajo\" >Un protocolo de trabajo<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/ceotudent.com\/es\/por-que-la-ia-alucina-mecanica-errores-modelo-detectarlos-pronto\/#Lo-que-esto-no-significa\" >Lo que esto no significa<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/ceotudent.com\/es\/por-que-la-ia-alucina-mecanica-errores-modelo-detectarlos-pronto\/#Preguntas-frecuentes\" >Preguntas frecuentes<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/ceotudent.com\/es\/por-que-la-ia-alucina-mecanica-errores-modelo-detectarlos-pronto\/#Fuentes\" >Fuentes<\/a><\/li><\/ul><\/nav><\/div>\n<h2 id=\"la-respuesta-en-una-frase\"><span class=\"ez-toc-section\" id=\"La-respuesta-en-una-frase\"><\/span>La respuesta en una frase<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Los modelos alucinan porque adivinar punt\u00faa mejor que abstenerse, y todo lo dem\u00e1s es un detalle sobre cu\u00e1ndo.<\/p>\n<p>Ese encuadre procede de \u00abWhy Language Models Hallucinate\u00bb, publicado en arXiv el 4 de septiembre de 2025 por Adam Tauman Kalai y Ofir Nachum de OpenAI, Santosh S. Vempala de Georgia Tech y Edwin Zhang de OpenAI. Su analog\u00eda es la de un estudiante en un examen. Ante una pregunta que no sabes responder, dejarla en blanco vale cero y adivinar vale cero o uno. Bajo esa regla la estrategia racional es siempre adivinar, y adivinar de forma espec\u00edfica, porque \u00ab30 de septiembre\u00bb y \u00aben alg\u00fan momento del oto\u00f1o\u00bb se califican igual si ambas son falsas, pero solo la primera puede ser correcta.<\/p>\n<p>Los modelos de lenguaje, sostienen los autores, viven permanentemente en ese examen. Se optimizan frente a referencias que imitan pruebas estandarizadas y, por tanto, est\u00e1n siempre en modo examen.<\/p>\n<p>La aportaci\u00f3n m\u00e1s concreta del art\u00edculo es un repaso de lo que hacen realmente las referencias. Los autores examinaron diez evaluaciones de uso extendido y clasificaron cada una seg\u00fan si su m\u00e9trica principal es exactitud estricta de correcto o incorrecto y si una abstenci\u00f3n puede obtener alg\u00fan cr\u00e9dito.<\/p>\n<table>\n<thead>\n<tr>\n<th>Referencia<\/th>\n<th>M\u00e9todo de puntuaci\u00f3n<\/th>\n<th>Calificaci\u00f3n binaria<\/th>\n<th>Cr\u00e9dito por \u00abno lo s\u00e9\u00bb<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>GPQA<\/td>\n<td>Exactitud de opci\u00f3n m\u00faltiple<\/td>\n<td>S\u00ed<\/td>\n<td>Ninguno<\/td>\n<\/tr>\n<tr>\n<td>MMLU-Pro<\/td>\n<td>Exactitud de opci\u00f3n m\u00faltiple<\/td>\n<td>S\u00ed<\/td>\n<td>Ninguno<\/td>\n<\/tr>\n<tr>\n<td>IFEval<\/td>\n<td>Verificaci\u00f3n program\u00e1tica de instrucciones<\/td>\n<td>S\u00ed<\/td>\n<td>Ninguno<\/td>\n<\/tr>\n<tr>\n<td>Omni-MATH<\/td>\n<td>Calificaci\u00f3n por equivalencia<\/td>\n<td>S\u00ed<\/td>\n<td>Ninguno<\/td>\n<\/tr>\n<tr>\n<td>WildBench<\/td>\n<td>R\u00fabrica calificada por un modelo de lenguaje<\/td>\n<td>No<\/td>\n<td>Parcial<\/td>\n<\/tr>\n<tr>\n<td>BBH<\/td>\n<td>Opci\u00f3n m\u00faltiple \/ coincidencia exacta<\/td>\n<td>S\u00ed<\/td>\n<td>Ninguno<\/td>\n<\/tr>\n<tr>\n<td>MATH (subconjunto de nivel 5)<\/td>\n<td>Calificaci\u00f3n por equivalencia<\/td>\n<td>S\u00ed<\/td>\n<td>Ninguno<\/td>\n<\/tr>\n<tr>\n<td>MuSR<\/td>\n<td>Exactitud de opci\u00f3n m\u00faltiple<\/td>\n<td>S\u00ed<\/td>\n<td>Ninguno<\/td>\n<\/tr>\n<tr>\n<td>SWE-bench<\/td>\n<td>El parche pasa las pruebas unitarias<\/td>\n<td>S\u00ed<\/td>\n<td>Ninguno<\/td>\n<\/tr>\n<tr>\n<td>HLE<\/td>\n<td>Opci\u00f3n m\u00faltiple \/ calificaci\u00f3n por equivalencia<\/td>\n<td>S\u00ed<\/td>\n<td>Ninguno<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><em>Fuente: Kalai, Nachum, Vempala y Zhang, \u00abWhy Language Models Hallucinate\u00bb, preprint de arXiv 2509.04664v1, septiembre de 2025, tabla 2. Nuestro recuento de sus filas: 9 de 10 usan calificaci\u00f3n binaria; 9 de 10 no dan cr\u00e9dito a la abstenci\u00f3n; 0 de 10 dan cr\u00e9dito pleno a una abstenci\u00f3n calibrada. La r\u00fabrica de WildBench solo ofrece cr\u00e9dito parcial, y los autores se\u00f1alan que su escala de 1 a 10 a\u00fan puede puntuar una abstenci\u00f3n por debajo de una respuesta segura pero alucinada.<\/em><\/p>\n<p>Esa \u00faltima l\u00ednea contiene todo el problema en miniatura. Incluso la \u00fanica referencia que no usa calificaci\u00f3n binaria puede seguir premiando una falsedad segura por encima de un honesto \u00abno lo s\u00e9\u00bb.<\/p>\n<p>La soluci\u00f3n que proponen no es una nueva referencia de alucinaci\u00f3n. Es cambiar la puntuaci\u00f3n de las referencias que ya dominan las tablas, enunciando un umbral de confianza en las instrucciones: responde solo si tienes m\u00e1s de t de confianza, porque los errores se penalizan con t\/(1-t) puntos, las respuestas correctas suman 1 punto y \u00abno lo s\u00e9\u00bb suma 0.<\/p>\n<p>Una nota sobre esa f\u00f3rmula, para quienes comprueban la aritm\u00e9tica. El preprint enumera como valores naturales t = 0,5 (penalizaci\u00f3n 1), t = 0,75 (penalizaci\u00f3n 2) y t = 0,9 (penalizaci\u00f3n 9). Aplicando la f\u00f3rmula que el propio art\u00edculo enuncia, t\/(1-t), sale 1 para t = 0,5 y 9 para t = 0,9, ambos coinciden, pero 3 para t = 0,75, no 2. El par\u00e9ntesis del valor intermedio es incoherente con la f\u00f3rmula a la que acompa\u00f1a. Es un desliz menor en un preprint por lo dem\u00e1s cuidadoso y no cambia nada del argumento. Lo se\u00f1alamos porque es exactamente el tipo de n\u00famero derivado que este art\u00edculo te pide recalcular, y la lecci\u00f3n no se detiene en los art\u00edculos de los laboratorios de frontera. La observaci\u00f3n se refiere a la versi\u00f3n 1 del preprint de arXiv con fecha 4 de septiembre de 2025; las versiones publicadas posteriormente pueden diferir.<\/p>\n<h2 id=\"la-tasa-de-farol-una-columna-propia\"><span class=\"ez-toc-section\" id=\"La-tasa-de-farol-una-columna-propia\"><\/span>La tasa de farol: una columna propia<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Aqu\u00ed es donde la teor\u00eda se vuelve medible.<\/p>\n<p>OpenAI public\u00f3 SimpleQA en noviembre de 2024, una referencia de 4.326 preguntas factuales breves escritas para resultar dif\u00edciles a GPT-4o, cada una con una \u00fanica respuesta indiscutible. Su calificaci\u00f3n tiene tres resultados en lugar de dos: correcta, incorrecta y no intentada, categor\u00eda esta \u00faltima que cubre las respuestas que no dan por completo la respuesta de referencia, incluido un \u00abno lo s\u00e9\u00bb expl\u00edcito.<\/p>\n<p>Esa tercera categor\u00eda es lo que hace \u00fatil aqu\u00ed al conjunto de datos, porque separa dos cosas que las referencias binarias funden: no saber y fingir que se sabe.<\/p>\n<p>La tabla publicada informa de correcta, no intentada e incorrecta para ocho modelos. No informa del cociente que m\u00e1s importa a un profesional en activo. Si un modelo va a fallarte, \u00bfqu\u00e9 aspecto tiene ese fallo? \u00bfTe dice que no lo sabe o te entrega algo falso sin pesta\u00f1ear?<\/p>\n<p>Es una sola divisi\u00f3n: incorrecta dividida por la suma de incorrecta y no intentada. La calculamos para cada fila.<\/p>\n<table>\n<thead>\n<tr>\n<th>Modelo<\/th>\n<th>Correcta (%)<\/th>\n<th>No intentada (%)<\/th>\n<th>Incorrecta (%)<\/th>\n<th>Tasa de farol (%)<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>GPT-4o-mini<\/td>\n<td>8,6<\/td>\n<td>0,9<\/td>\n<td>90,5<\/td>\n<td>99,0<\/td>\n<\/tr>\n<tr>\n<td>GPT-4o<\/td>\n<td>38,2<\/td>\n<td>1,0<\/td>\n<td>60,8<\/td>\n<td>98,4<\/td>\n<\/tr>\n<tr>\n<td>OpenAI o1-preview<\/td>\n<td>42,7<\/td>\n<td>9,2<\/td>\n<td>48,1<\/td>\n<td>83,9<\/td>\n<\/tr>\n<tr>\n<td>OpenAI o1-mini<\/td>\n<td>8,1<\/td>\n<td>28,5<\/td>\n<td>63,4<\/td>\n<td>69,0<\/td>\n<\/tr>\n<tr>\n<td>Claude-3.5-sonnet (2024-06-20)<\/td>\n<td>28,9<\/td>\n<td>35,0<\/td>\n<td>36,1<\/td>\n<td>50,8<\/td>\n<\/tr>\n<tr>\n<td>Claude-3-opus (2024-02-29)<\/td>\n<td>23,5<\/td>\n<td>39,6<\/td>\n<td>36,9<\/td>\n<td>48,2<\/td>\n<\/tr>\n<tr>\n<td>Claude-3-haiku (2024-03-07)<\/td>\n<td>5,1<\/td>\n<td>75,3<\/td>\n<td>19,6<\/td>\n<td>20,7<\/td>\n<\/tr>\n<tr>\n<td>Claude-3-sonnet (2024-02-29)<\/td>\n<td>5,7<\/td>\n<td>75,0<\/td>\n<td>19,3<\/td>\n<td>20,5<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><em>Marco editorial de CEOtudent. Las columnas correcta, no intentada e incorrecta est\u00e1n tomadas literalmente de OpenAI, \u00abMeasuring short-form factuality in large language models\u00bb, preprint de arXiv 2411.04368, tabla 3. La tasa de farol es c\u00e1lculo nuestro: incorrecta \/ (incorrecta + no intentada), esto es, la proporci\u00f3n de respuestas no correctas en las que el modelo afirm\u00f3 una respuesta falsa en lugar de abstenerse. Cada fila de la tabla original suma 100,0, lo que hemos verificado. Los modelos y las fechas corresponden a la evaluaci\u00f3n de finales de 2024 y los sistemas actuales difieren; la columna se incluye para mostrar la amplitud del comportamiento de abstenci\u00f3n, no para ordenar proveedores hoy.<\/em><\/p>\n<p>Dos lecturas, y la segunda es la importante.<\/p>\n<p>La lectura obvia es la amplitud. GPT-4o-mini, cuando no sabe, te responde igualmente 99 veces de cada 100. Claude-3-sonnet, en la misma situaci\u00f3n, declina cuatro de cada cinco veces. Es una diferencia de 4,8 veces en c\u00f3mo se presenta el fallo.<\/p>\n<p>La lectura que m\u00e1s importa: la tasa de farol est\u00e1 en gran medida desacoplada de la exactitud. GPT-4o-mini respondi\u00f3 correctamente al 8,6% de las preguntas. Claude-3-haiku al 5,1%. Una diferencia de 3,5 puntos porcentuales en competencia y una diferencia de 78 puntos en c\u00f3mo se comportan cuando est\u00e1n fuera de su alcance. Estos dos modelos saben casi igual de poco. Uno lo dice y el otro no.<\/p>\n<p>Es precisamente lo que predice el art\u00edculo sobre la alucinaci\u00f3n. El comportamiento de abstenci\u00f3n no es un subproducto de la capacidad. Es una disposici\u00f3n separada y entrenada, fijada por lo que el proceso de entrenamiento y evaluaci\u00f3n recompens\u00f3. Y como nueve de cada diez referencias destacadas no pagan nada por abstenerse, el gradiente de incentivos apunta en una sola direcci\u00f3n.<\/p>\n<p>La consecuencia pr\u00e1ctica: no puedes inferir fiabilidad a partir de las puntuaciones de referencia. El modelo que encabeza una tabla puede ser el que con m\u00e1s probabilidad te entregue una cita fabricada, porque la posici\u00f3n en la tabla y la disposici\u00f3n a farolear las produce la misma presi\u00f3n.<\/p>\n<h2 id=\"el-segundo-rgimen-qu-pasa-cuando-aportas-t-los-hechos\"><span class=\"ez-toc-section\" id=\"El-segundo-regimen-que-pasa-cuando-aportas-tu-los-hechos\"><\/span>El segundo r\u00e9gimen: qu\u00e9 pasa cuando aportas t\u00fa los hechos<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Todo lo anterior se refiere al recuerdo a libro cerrado, en el que el modelo responde solo desde sus par\u00e1metros. La mayor parte del trabajo profesional no es as\u00ed. Pegas un documento, adjuntas un informe, se\u00f1alas una base de c\u00f3digo. \u00bfLo arregla eso?<\/p>\n<p>Vectara mantiene una tabla p\u00fablica de alucinaciones basada en su Hallucination Evaluation Model. La tarea es deliberadamente estrecha: a cada modelo se le da un documento y se le pide que lo resuma usando \u00fanicamente hechos presentes en \u00e9l, y despu\u00e9s se revisa el resumen en busca de afirmaciones que la fuente no respalda. El conjunto de datos contiene m\u00e1s de 7.700 art\u00edculos de actualidad, tecnolog\u00eda, ciencia, medicina, derecho, deporte, econom\u00eda y educaci\u00f3n, de 50 a 24.000 palabras, se mantiene privado para evitar el sobreajuste y los modelos se invocan a temperatura 0. La versi\u00f3n siguiente se actualiz\u00f3 por \u00faltima vez el 11 de mayo de 2026 y cubre 106 modelos.<\/p>\n<p>En toda la tabla, las tasas de alucinaci\u00f3n con fuente aportada van del 1,8% en el mejor caso al 24,2% en el peor.<\/p>\n<p>Comp\u00e1ralo con las cifras a libro cerrado de m\u00e1s arriba, donde GPT-4o respondi\u00f3 incorrectamente al 60,8% de las preguntas de SimpleQA. Son tareas, modelos y fechas distintos, as\u00ed que no es una comparaci\u00f3n de modelos en igualdad de condiciones y no debe leerse as\u00ed. Es una comparaci\u00f3n de dos reg\u00edmenes, y la distancia entre ellos es aproximadamente de un orden de magnitud. Poner el hecho en la ventana de contexto es la mayor intervenci\u00f3n de la que dispones, y est\u00e1 disponible en cualquier tarea, gratis, ahora mismo.<\/p>\n<p>Pero no lleva la tasa a cero, y la forma del error residual es donde la cosa se pone interesante.<\/p>\n<h2 id=\"el-hallazgo-que-no-esperbamos-el-esfuerzo-de-razonamiento-empeora-la-alucinacin-con-fuente-aportada\"><span class=\"ez-toc-section\" id=\"El-hallazgo-que-no-esperabamos-el-esfuerzo-de-razonamiento-empeora-la-alucinacion-con-fuente-aportada\"><\/span>El hallazgo que no esper\u00e1bamos: el esfuerzo de razonamiento empeora la alucinaci\u00f3n con fuente aportada<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Al leer la tabla notamos que varias familias de modelos aparecen m\u00e1s de una vez con distintos ajustes de razonamiento. Eso crea comparaciones controladas naturales: misma familia, misma ejecuci\u00f3n de la referencia, misma fecha, una variable cambiada.<\/p>\n<p>Hay cinco pares de ese tipo. Esto es lo que muestran.<\/p>\n<table>\n<thead>\n<tr>\n<th>Familia<\/th>\n<th>Ajuste de esfuerzo bajo<\/th>\n<th>Tasa<\/th>\n<th>Palabras<\/th>\n<th>Ajuste de esfuerzo alto<\/th>\n<th>Tasa<\/th>\n<th>Palabras<\/th>\n<th>Cambio en la tasa<\/th>\n<th>Cambio en longitud<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>GPT-5.2<\/td>\n<td>bajo<\/td>\n<td>8,4%<\/td>\n<td>126,5<\/td>\n<td>alto<\/td>\n<td>10,8%<\/td>\n<td>186,3<\/td>\n<td>+2,4 puntos<\/td>\n<td>+59,8 palabras<\/td>\n<\/tr>\n<tr>\n<td>GPT-5.1<\/td>\n<td>bajo<\/td>\n<td>10,9%<\/td>\n<td>165,5<\/td>\n<td>alto<\/td>\n<td>12,1%<\/td>\n<td>254,4<\/td>\n<td>+1,2 puntos<\/td>\n<td>+88,9 palabras<\/td>\n<\/tr>\n<tr>\n<td>Grok-4.1-fast<\/td>\n<td>sin razonamiento<\/td>\n<td>17,8%<\/td>\n<td>87,5<\/td>\n<td>con razonamiento<\/td>\n<td>19,2%<\/td>\n<td>99,5<\/td>\n<td>+1,4 puntos<\/td>\n<td>+12,0 palabras<\/td>\n<\/tr>\n<tr>\n<td>Grok-4-fast<\/td>\n<td>sin razonamiento<\/td>\n<td>19,7%<\/td>\n<td>141,9<\/td>\n<td>con razonamiento<\/td>\n<td>20,2%<\/td>\n<td>173,9<\/td>\n<td>+0,5 puntos<\/td>\n<td>+32,0 palabras<\/td>\n<\/tr>\n<tr>\n<td>o4-mini<\/td>\n<td>bajo<\/td>\n<td>18,6%<\/td>\n<td>130,9<\/td>\n<td>alto<\/td>\n<td>18,6%<\/td>\n<td>127,7<\/td>\n<td>0,0 puntos<\/td>\n<td>-3,2 palabras<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><em>Marco editorial de CEOtudent. Todas las tasas y longitudes medias de resumen est\u00e1n tomadas literalmente de la tabla de alucinaciones de Vectara en su versi\u00f3n del 11 de mayo de 2026; el emparejamiento, las columnas de cambio y la lectura de la longitud son nuestros. Cuatro de los cinco pares dentro de una misma familia muestran la tasa de alucinaci\u00f3n y la longitud del resumen subiendo juntas con el esfuerzo de razonamiento. El quinto, o4-mini, no muestra movimiento apreciable en ninguna de las dos, lo que resulta coherente con la misma relaci\u00f3n en lugar de ser una excepci\u00f3n.<\/em><\/p>\n<p>Los cuatro pares que se movieron lo hicieron en la misma direcci\u00f3n y en las dos variables a la vez. El quinto par no se movi\u00f3 en ninguna. En estos datos no hay ni un caso en el que m\u00e1s esfuerzo de razonamiento produjera una tasa de alucinaci\u00f3n m\u00e1s baja con fuente aportada.<\/p>\n<p>La columna de longitud sugiere el porqu\u00e9, y el mecanismo no tiene nada de glamuroso. Un mayor esfuerzo de razonamiento produce una salida m\u00e1s larga. GPT-5.1 con esfuerzo alto escribe 254 palabras donde el ajuste bajo escribe 166, un aumento del 54%. Cada frase adicional de un resumen es otra oportunidad de afirmar algo que el documento fuente no respalda. El modelo no razona hasta la falsedad; escribe m\u00e1s, y las afirmaciones sin respaldo se acumulan con el volumen.<\/p>\n<p>El mismo patr\u00f3n aparece en toda la familia de OpenAI en esa \u00fanica ejecuci\u00f3n de la tabla: gpt-5.4-nano, el modelo m\u00e1s peque\u00f1o listado, se sit\u00faa en el 3,1%, mientras que o3-pro, un buque insignia de razonamiento, se sit\u00faa en el 23,3%. Es una horquilla de 7,5 veces dentro de la gama de un solo proveedor, y va en sentido contrario a la capacidad del modelo.<\/p>\n<p>Dos advertencias antes de sobreinterpretar esto. La referencia mide una tarea estrecha, el resumen fiel de un documento aportado, y las ventajas de un modelo de razonamiento en matem\u00e1ticas, c\u00f3digo y an\u00e1lisis de varios pasos sencillamente no son lo que se punt\u00faa aqu\u00ed. Adem\u00e1s son mediciones \u00fanicas sin intervalos de confianza publicados, de modo que las dos diferencias m\u00e1s peque\u00f1as, 0,5 y 1,2 puntos, deben tomarse como indicativas y no como decisivas. Lo que sostiene el peso es la coherencia entre familias independientes, no ninguna fila aislada.<\/p>\n<p>La versi\u00f3n accionable: en extracci\u00f3n y resumen, donde el trabajo consiste en permanecer dentro de un documento fuente, recurrir al mayor modelo de razonamiento no es autom\u00e1ticamente la opci\u00f3n segura, y puede ser lo contrario. Pide una salida m\u00e1s corta. Es la misma palanca.<\/p>\n<h2 id=\"los-cinco-mecanismos-y-qu-aspecto-tiene-cada-uno\"><span class=\"ez-toc-section\" id=\"Los-cinco-mecanismos-y-que-aspecto-tiene-cada-uno\"><\/span>Los cinco mecanismos y qu\u00e9 aspecto tiene cada uno<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>El art\u00edculo sobre la alucinaci\u00f3n enumera los factores estad\u00edsticos detr\u00e1s de estos errores. Aqu\u00ed est\u00e1n, asociados a lo que puedes hacer realmente con cada uno. Los mecanismos son del art\u00edculo; las pruebas de detecci\u00f3n y la columna de exposici\u00f3n son nuestras.<\/p>\n<table>\n<thead>\n<tr>\n<th>Mecanismo<\/th>\n<th>Qu\u00e9 lo causa<\/th>\n<th>Qu\u00e9 aspecto tiene<\/th>\n<th>Prueba de detecci\u00f3n<\/th>\n<th>Tareas m\u00e1s expuestas<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Hechos arbitrarios<\/td>\n<td>El hecho no tiene un patr\u00f3n generalizable y apareci\u00f3 rara vez o nunca en el entrenamiento. El art\u00edculo lo formaliza con una tasa de singletons: si una fracci\u00f3n de los hechos apareci\u00f3 exactamente una vez, los modelos base deber\u00edan alucinar al menos en esa fracci\u00f3n<\/td>\n<td>Seguro, espec\u00edfico, plausible, falso. Fechas, nombres, citas, cifras, n\u00fameros de p\u00e1gina<\/td>\n<td>Haz la misma pregunta en tres sesiones separadas. Respuestas inestables significan que est\u00e1 adivinando. Respuestas estables no prueban correcci\u00f3n, pero la inestabilidad es casi prueba de error<\/td>\n<td>Citas, detalles biogr\u00e1ficos, estad\u00edsticas, entidades poco conocidas<\/td>\n<\/tr>\n<tr>\n<td>Mal ajuste del modelo<\/td>\n<td>La arquitectura representa mal la tarea, con independencia del conocimiento. El ejemplo del art\u00edculo es contar letras<\/td>\n<td>Falla en algo trivialmente f\u00e1cil mientras acierta en algo dif\u00edcil. Recuentos de caracteres, manipulaci\u00f3n de cadenas, aritm\u00e9tica exacta<\/td>\n<td>Dale una tarea que puedas verificar a mano en dos segundos. Si falla ah\u00ed, desconf\u00eda de la clase de tarea, no del tema<\/td>\n<td>Contar, tokenizar, trabajo exacto con cadenas, aritm\u00e9tica con n\u00fameros largos<\/td>\n<\/tr>\n<tr>\n<td>Dureza computacional<\/td>\n<td>El problema es intratable. Ning\u00fan sistema, por capaz que sea, escapa a los l\u00edmites de complejidad<\/td>\n<td>Una respuesta fluida a algo que no tiene soluci\u00f3n eficiente<\/td>\n<td>Preg\u00fantate si una respuesta correcta es siquiera computable a esa escala. Si no lo es, la respuesta fluida es decoraci\u00f3n<\/td>\n<td>Consultas criptogr\u00e1ficas, optimizaci\u00f3n combinatoria grande, b\u00fasqueda exhaustiva<\/td>\n<\/tr>\n<tr>\n<td>Desplazamiento de distribuci\u00f3n<\/td>\n<td>La indicaci\u00f3n no se parece a nada del entrenamiento. Las entradas fuera de distribuci\u00f3n rompen los clasificadores, y los modelos no son la excepci\u00f3n<\/td>\n<td>Fallos extra\u00f1os en preguntas trampa, formulaciones inusuales o situaciones genuinamente nuevas<\/td>\n<td>Reformula en forma convencional y vuelve a preguntar. Si la respuesta cambia, el problema era la formulaci\u00f3n original<\/td>\n<td>Escenarios in\u00e9ditos, encuadres deliberadamente inusuales, sucesos muy recientes<\/td>\n<\/tr>\n<tr>\n<td>Basura entra, basura sale<\/td>\n<td>El error estaba en el corpus de entrenamiento. El modelo lo reproduce fielmente<\/td>\n<td>Repite con seguridad un error extendido, una cifra obsoleta o una cita err\u00f3nea muy difundida<\/td>\n<td>Comprueba la fuente primaria, no un resultado de b\u00fasqueda. Las cifras muy repetidas son la categor\u00eda de mayor riesgo precisamente porque la repetici\u00f3n es lo que las meti\u00f3 en el entrenamiento<\/td>\n<td>Estad\u00edsticas populares, ciencia de andar por casa, historia disputada, normas superadas<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><em>Marco editorial de CEOtudent. Los cinco mecanismos y su base t\u00e9cnica proceden de Kalai, Nachum, Vempala y Zhang, preprint de arXiv 2509.04664v1, secciones 3.3 y 3.4. Las pruebas de detecci\u00f3n, las valoraciones de exposici\u00f3n y la correspondencia con tareas son s\u00edntesis nuestra y no hallazgos de ese art\u00edculo.<\/em><\/p>\n<p>La quinta fila merece \u00e9nfasis porque es la que atrapa a la gente cuidadosa. Una estad\u00edstica repetida en cien art\u00edculos tiene m\u00e1s probabilidades de ser reproducida por un modelo que una estad\u00edstica registrada una sola vez en la fuente primaria, y la repetici\u00f3n no es evidencia. Nos hemos topado con esto directamente: cifras omnipresentes en la cobertura secundaria y sencillamente ausentes del estudio subyacente.<\/p>\n<p>La regla que se deduce es inc\u00f3moda y correcta. Si una cifra importa, abre el documento primario y encuentra la cifra en \u00e9l. No un resumen del documento. El documento.<\/p>\n<h2 id=\"un-protocolo-de-trabajo\"><span class=\"ez-toc-section\" id=\"Un-protocolo-de-trabajo\"><\/span>Un protocolo de trabajo<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Cinco pasos, en el orden que m\u00e1s atrapa con menos esfuerzo.<\/p>\n<p><strong>Establece en qu\u00e9 r\u00e9gimen est\u00e1s.<\/strong> \u00bfLa respuesta est\u00e1 en la ventana de contexto o en los par\u00e1metros del modelo? El recuerdo a libro cerrado es aproximadamente un orden de magnitud m\u00e1s arriesgado. Si puedes convertir una pregunta a libro cerrado en una anclada pegando la fuente, hazlo primero. Es el movimiento de mayor apalancamiento disponible.<\/p>\n<p><strong>Nunca aceptes una cita que no hayas abierto.<\/strong> T\u00edtulos, autores, a\u00f1os, nombres de revistas y n\u00fameros de p\u00e1gina son el fallo can\u00f3nico por hechos arbitrarios: sin patr\u00f3n generalizable, con alta plausibilidad cuando se fabrican. Trata toda referencia no abierta como no verificada.<\/p>\n<p><strong>Vuelve a preguntar en una sesi\u00f3n nueva.<\/strong> Barato, r\u00e1pido y explota el mecanismo directamente. Un modelo que adivina un hecho \u00fanico producir\u00e1 conjeturas distintas. El art\u00edculo sobre la alucinaci\u00f3n abre exactamente con esto: preguntado por el cumplea\u00f1os de un autor en tres intentos, un modelo de frontera produjo tres fechas err\u00f3neas distintas.<\/p>\n<p><strong>Pide salidas m\u00e1s cortas en tareas ancladas.<\/strong> Los pares de la tabla muestran que la longitud y las afirmaciones sin respaldo suben juntas. La longitud es la palanca que t\u00fa controlas.<\/p>\n<p><strong>Pregunta por la confianza y da permiso expl\u00edcito para abstenerse.<\/strong> Di expl\u00edcitamente que \u00abno lo s\u00e9\u00bb es una respuesta aceptable. Es la versi\u00f3n del lado del usuario de la soluci\u00f3n que propone el art\u00edculo. No vas a cambiar c\u00f3mo se punt\u00faan las referencias, pero s\u00ed puedes cambiar la regla de puntuaci\u00f3n dentro de tu propia indicaci\u00f3n.<\/p>\n<h2 id=\"lo-que-esto-no-significa\"><span class=\"ez-toc-section\" id=\"Lo-que-esto-no-significa\"><\/span>Lo que esto no significa<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>No significa que los modelos sean poco fiables en general. Tasas ancladas del 2 al 7% para buenos modelos en resumen fiel son una tasa de error manejable para una primera pasada, siempre que sepas que no es cero y compruebes las partes que importan.<\/p>\n<p>No significa que la alucinaci\u00f3n vaya a eliminarse por ingenier\u00eda el a\u00f1o que viene. El argumento del art\u00edculo es estructural: mientras las evaluaciones dominantes no paguen nada por la incertidumbre calibrada, los modelos optimizados para esas evaluaciones seguir\u00e1n adivinando. Arreglarlo exige cambiar el marcador, lo que es un problema de coordinaci\u00f3n de todo el campo m\u00e1s que un problema de modelado en un laboratorio.<\/p>\n<p>Y tampoco significa que debas verificarlo todo, que ser\u00eda simplemente negarse a usar la herramienta. Significa que debes saber a cu\u00e1l de los cinco mecanismos est\u00e1 expuesta tu tarea concreta y comprobar ah\u00ed. El esfuerzo de verificaci\u00f3n repartido de forma uniforme es esfuerzo de verificaci\u00f3n desperdiciado.<\/p>\n<p>La competencia que se describe aqu\u00ed no es escepticismo. Es calibraci\u00f3n: saber d\u00f3nde viven los errores para dejar de mirar en todas las dem\u00e1s partes. Es la misma destreza tratada en <a href=\"https:\/\/ceotudent.com\/en\/ai-literacy-vs-ai-fluency\">alfabetizaci\u00f3n frente a fluidez en IA<\/a>, aplicada a la superficie de fallos en lugar de a la de capacidades.<\/p>\n<h2 id=\"preguntas-frecuentes\"><span class=\"ez-toc-section\" id=\"Preguntas-frecuentes\"><\/span>Preguntas frecuentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p><strong>\u00bfAlucinan menos los modelos m\u00e1s nuevos?<\/strong><br \/>\nNo de forma fiable, ni en todas las tareas. En la tabla de resumen anclado actualizada en mayo de 2026, el modelo m\u00e1s peque\u00f1o de la familia de OpenAI listada obtuvo un 3,1% mientras que un buque insignia de razonamiento de la misma familia obtuvo un 23,3%. Capacidad y fidelidad son ejes distintos y en esta tarea concreta pueden apuntar en sentidos opuestos.<\/p>\n<p><strong>\u00bfLo resuelve la generaci\u00f3n aumentada por recuperaci\u00f3n?<\/strong><br \/>\nTe traslada al mejor r\u00e9gimen, lo que es una gran ganancia, pero las tasas ancladas de este art\u00edculo se miden con el documento fuente ya aportado. Cada una de esas cifras es un error residual que el anclaje no elimin\u00f3. La recuperaci\u00f3n a\u00f1ade adem\u00e1s su propio modo de fallo: recuperar el documento equivocado produce una respuesta segura fielmente anclada en la fuente equivocada.<\/p>\n<p><strong>\u00bfPor qu\u00e9 suena el modelo tan seguro cuando se equivoca?<\/strong><br \/>\nPorque se recompens\u00f3 la especificidad y no la cautela. Bajo calificaci\u00f3n binaria, una respuesta vaga y una respuesta falsa punt\u00faan igual a cero, mientras que una conjetura espec\u00edfica tiene posibilidad de puntuar uno. La seguridad fluida es el resultado entrenado de ese incentivo, no una se\u00f1al sobre la respuesta.<\/p>\n<p><strong>\u00bfSirve de algo preguntarle al modelo si est\u00e1 seguro?<\/strong><br \/>\nPoco. La confianza declarada se sobreestima sistem\u00e1ticamente. Los autores de SimpleQA lo midieron directamente pidiendo a los modelos que declararan un porcentaje de confianza y compar\u00e1ndolo con su exactitud real, y encontraron sobreestimaci\u00f3n constante. El muestreo repetido en sesiones nuevas es mejor se\u00f1al que la autodeclaraci\u00f3n, porque mide comportamiento y no una afirmaci\u00f3n sobre el comportamiento.<\/p>\n<p><strong>\u00bfQu\u00e9 h\u00e1bito \u00fanico atrapa m\u00e1s errores?<\/strong><br \/>\nAbrir fuentes primarias para cualquier cifra o cita que vaya a afectar a una decisi\u00f3n. Ataca los dos mecanismos responsables de la mayor\u00eda de los errores profesionales con consecuencias, los hechos arbitrarios y basura entra basura sale, y cuesta alrededor de un minuto por elemento.<\/p>\n<h2 id=\"fuentes\"><span class=\"ez-toc-section\" id=\"Fuentes\"><\/span>Fuentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ul>\n<li>Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala y Edwin Zhang, \u00abWhy Language Models Hallucinate\u00bb, preprint de arXiv 2509.04664 versi\u00f3n 1, septiembre de 2025. Tabla 2 sobre la puntuaci\u00f3n de referencias; secciones 3.3 y 3.4 sobre mecanismos de error; secci\u00f3n 4.2 sobre objetivos expl\u00edcitos de confianza.<\/li>\n<li>OpenAI, \u00abMeasuring short-form factuality in large language models\u00bb, preprint de arXiv 2411.04368, noviembre de 2024, que presenta la referencia SimpleQA. Tabla 3 sobre el rendimiento de los modelos; secci\u00f3n 4 sobre calibraci\u00f3n.<\/li>\n<li>Vectara, Hallucination Leaderboard, calculada con el Hallucination Evaluation Model sobre un corpus privado de m\u00e1s de 7.700 documentos, versi\u00f3n actualizada el 11 de mayo de 2026.<\/li>\n<li>Vapnik y Chervonenkis, trabajo fundacional sobre la dimensi\u00f3n de familias de funciones, citado por Kalai y colegas como base del an\u00e1lisis de hechos arbitrarios.<\/li>\n<li>I. J. Good, sobre la estimaci\u00f3n de frecuencias poblacionales de especies no observadas, el estimador de masa faltante que sustenta el argumento de la tasa de singletons.<\/li>\n<li>Stanford Institute for Human-Centered Artificial Intelligence, Artificial Intelligence Index Report, sobre la pr\u00e1ctica de evaluaci\u00f3n de modelos y la saturaci\u00f3n de referencias.<\/li>\n<\/ul>\n<hr>\n<p><em>Este contenido fue recopilado con el apoyo de la IA tras una investigaci\u00f3n exhaustiva, y luego redactado y preparado para su publicaci\u00f3n por el equipo editorial de CEOtudent.<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>La alucinaci\u00f3n no es un misterio ni un fallo que vaya a parchearse. Es el resultado predecible de un sistema de puntuaci\u00f3n que paga a los modelos por adivinar y no les paga nada por reconocer que no saben. De los propios resultados de SimpleQA de OpenAI derivamos una columna que el art\u00edculo no publica: la tasa de farol. Cuando estos modelos fallan, uno responde mal el 99% de las veces mientras otro se abstiene en cuatro de cada cinco casos. Despu\u00e9s revisamos la tabla de alucinaciones de Vectara y encontramos algo m\u00e1s extra\u00f1o. En cuatro comparaciones independientes dentro de la misma familia, subir el esfuerzo de razonamiento empeor\u00f3 la alucinaci\u00f3n con fuente aportada en lugar de mejorarla, y los res\u00famenes se alargaron todas las veces. Este art\u00edculo explica los cinco mecanismos verificados, ofrece una prueba de detecci\u00f3n para cada uno y muestra a cu\u00e1l est\u00e1 expuesta realmente tu tarea.<\/p>\n","protected":false},"author":1,"featured_media":325704,"comment_status":"open","ping_status":"","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[4599,5],"tags":[],"class_list":["post-325703","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-gelisim","category-is"],"_links":{"self":[{"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/posts\/325703","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/comments?post=325703"}],"version-history":[{"count":0,"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/posts\/325703\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/media\/325704"}],"wp:attachment":[{"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/media?parent=325703"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/categories?post=325703"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/tags?post=325703"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}