<\/span><\/h2>\nTres cosas, que conviene vigilar en lugar de dar por supuestas.<\/p>\n
El resultado sobre poes\u00eda no se asienta en una literatura indiscutida, y los autores lo dicen ellos mismos. Se\u00f1alan que sus hallazgos contrastan con trabajos anteriores en los que los participantes s\u00ed<\/em> lograban distinguir a poetas profesionales de poemas generados sin humano en el bucle, y con otros trabajos que encontraban a los participantes meramente en el nivel del azar y no por debajo. Los estudios anteriores adem\u00e1s sol\u00edan encontrar que los poemas generados se evaluaban de forma m\u00e1s negativa, lo contrario de lo que produjeron estos experimentos. La lectura m\u00e1s probable es que los modelos avanzaron, no que los investigadores anteriores estuvieran equivocados, pero eso es una interpretaci\u00f3n y no algo que los datos establezcan.<\/p>\nAmbos estudios usan muestras de poblaci\u00f3n general que realizan una tarea poco familiar en condiciones artificiales. Ninguno comprob\u00f3 si un experto que eval\u00faa trabajo en su propio dominio<\/em>, con tiempo y con algo en juego, se comporta de otro modo. Porter y Machery comprobaron la experiencia po\u00e9tica entre lectores de poes\u00eda, lo cual se aproxima m\u00e1s, pero un bagaje po\u00e9tico autoinformado no equivale a experiencia profesional. El resultado nulo sobre la experiencia es real y replicado, pero es un resultado nulo sobre la experiencia que estos estudios midieron.<\/p>\nEl resultado de Jones y Bergen es una preimpresi\u00f3n en el momento de escribir, y las dos poblaciones discreparon de forma apreciable en varias medidas exploratorias. La condici\u00f3n de persona de LLaMa, por ejemplo, fue del 45 % entre estudiantes y del 65 % entre participantes de Prolific, una diferencia de 20 puntos en la misma condici\u00f3n. Los efectos de poblaci\u00f3n aqu\u00ed no son peque\u00f1os.<\/p>\n
Nada de eso cambia lo que hay que hacer este trimestre. Deje de usar la autor\u00eda como sustituto de la calidad, porque la autor\u00eda no se puede recuperar. Retire las etiquetas antes de juzgar. Pregunte qu\u00e9 hay de nuevo en vez de si se lee bien.<\/p>\n
<\/span>Preguntas frecuentes<\/span><\/h2>\n\u00bfDe verdad la gente es peor que el azar detectando texto de IA?<\/strong>
\nEn este estudio s\u00ed, y de forma significativa: 46,6 % de acierto en 16.340 juicios donde adivinar dar\u00eda el 50 %, chi cuadrado(1) = 75,13, p < 0,0001. Los autores interpretan el desempe\u00f1o por debajo del azar junto con el acuerdo entre participantes por encima del azar como prueba de una heur\u00edstica compartida pero invertida, no de respuestas aleatorias.<\/p>\n\u00bfAyuda saber mucho sobre IA?<\/strong>
\nSeg\u00fan la evidencia disponible, no. Jones y Bergen no encontraron efecto significativo del nivel de conocimiento sobre modelos de lenguaje ni de la frecuencia de interacci\u00f3n con chatbots en ninguno de sus dos estudios, y se\u00f1alan que el acierto era homog\u00e9neo incluso entre quienes investigan estos sistemas. Porter y Machery no encontraron ninguna variable de experiencia po\u00e9tica con efecto positivo significativo.<\/p>\n\u00bfEn qu\u00e9 se\u00f1ales se apoya la gente err\u00f3neamente?<\/strong>
\nEn los pronombres de primera persona, las contracciones y los temas familiares o personales. Un an\u00e1lisis computacional a lo largo de seis experimentos las identific\u00f3 como las heur\u00edsticas con que los lectores infieren autor\u00eda humana, y los autores demostraron despu\u00e9s experimentalmente que, por ser predecibles, pueden convertirse en blanco, produciendo texto valorado como m\u00e1s humano que lo humano. Si se sorprende pensando que un pasaje suena humano porque dice “yo” y usa contracciones, ese es exactamente el modo de fallo documentado.<\/p>\n\u00bfEntonces la confianza siempre se relaciona inversamente con el acierto?<\/strong>
\nNo, y la respuesta honesta es m\u00e1s desordenada. Porter y Machery encontraron un efecto negativo significativo de la confianza (b = -0,021673, p < 0,0001). Jones y Bergen encontraron el acierto autoestimado correlacionado positivamente con el acierto real entre estudiantes (p = 0,03) pero no entre participantes de Prolific (p = 0,45). La confianza no es una se\u00f1al fiable en ninguna direcci\u00f3n, y esa es la conclusi\u00f3n utilizable.<\/p>\n\u00bfSignifica esto que la IA escribe mejor que los humanos?<\/strong>
\nNo. Significa que los lectores la puntuaron m\u00e1s alto en las dimensiones que premian la suavidad, 13 de 14, con el ritmo como la mayor en d = 0,847. En originalidad, la \u00fanica dimensi\u00f3n que exige que el lector detecte algo nuevo, los poemas realmente escritos por IA no mostraron ventaja significativa (d = 0,040, p = 0,098). Ese es un hallazgo sobre qu\u00e9 premian los lectores, no sobre m\u00e9rito literario.<\/p>\n\u00bfDeber\u00eda etiquetar el trabajo asistido por IA?<\/strong>
\nEsa es una cuesti\u00f3n \u00e9tica que estos datos no pueden zanjar, pero s\u00ed pueden decirle el coste. Etiquetar un trabajo como generado por IA redujo las puntuaciones de calidad en 0,814 puntos en una escala de siete, d = -0,508. Los lectores penalizan la etiqueta con independencia del trabajo. Quien decida sobre la divulgaci\u00f3n deber\u00eda incorporarlo al c\u00e1lculo en vez de llevarse una sorpresa.<\/p>\n\u00bfCu\u00e1l es el cambio m\u00e1s \u00fatil?<\/strong>
\nEvaluar a ciegas. El efecto de la etiqueta es en torno a tres cuartas partes del efecto real de calidad, y es la \u00fanica variable que controla por completo. Retirar las firmas antes de juzgar un trabajo sobre el que piensa actuar no cuesta nada y elimina un sesgo de tama\u00f1o medido.<\/p>\n<\/span>Fuentes<\/span><\/h2>\nPorter y Machery. AI-generated poetry is indistinguishable from human-written poetry and is rated more favorably. Scientific Reports.<\/p>\n
Jones y Bergen. Large Language Models Pass the Turing Test. Preimpresi\u00f3n de arXiv, Computation and Language.<\/p>\n
Jakesch, Hancock y Naaman. Human heuristics for AI-generated language are flawed. Proceedings of the National Academy of Sciences, 2023.<\/p>\n
Kobis y Mossink, paradigmas con y sin humano en el bucle para evaluar poes\u00eda generada por m\u00e1quina, tal como se caracterizan en Porter y Machery.<\/p>\n
Nota de alcance: la cifra combinada de 6.518 participantes en los tres estudios de detecci\u00f3n es una suma de CEOtudent de tama\u00f1os muestrales publicados, usada solo para indicar escala. Los tres estudios difieren en dise\u00f1o, poblaci\u00f3n y medida de resultado, y no se agregan estad\u00edsticamente en ninguna parte de este art\u00edculo.<\/p>\n
\nEste contenido fue recopilado con el apoyo de la IA tras una investigaci\u00f3n exhaustiva, y luego redactado y preparado para su publicaci\u00f3n por el equipo editorial de CEOtudent.<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"Tres grandes estudios realizados por tres laboratorios independientes en dominios completamente distintos convergen en el mismo hallazgo inc\u00f3modo: las personas no identifican de forma fiable el trabajo generado por m\u00e1quinas, la experiencia no ayuda y la confianza corre en la direcci\u00f3n equivocada. Peor a\u00fan, la evaluaci\u00f3n misma es unas tres cuartas partes tan sensible a la etiqueta que lleva un trabajo como al trabajo. Este art\u00edculo re\u00fane los datos, deriva cu\u00e1nto vale realmente la capa de presentaci\u00f3n frente a la capa de sustancia y expone las \u00fanicas estrategias que mejoraron la precisi\u00f3n de forma medible.<\/p>\n","protected":false},"author":1,"featured_media":325915,"comment_status":"open","ping_status":"","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[4599,18],"tags":[],"class_list":["post-325914","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-gelisim","category-strateji"],"_links":{"self":[{"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/posts\/325914","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/comments?post=325914"}],"version-history":[{"count":0,"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/posts\/325914\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/media\/325915"}],"wp:attachment":[{"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/media?parent=325914"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/categories?post=325914"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/ceotudent.com\/es\/wp-json\/wp\/v2\/tags?post=325914"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}