Gelişimİş
0

Entrenar con IA: cómo ensayar entrevistas, negociaciones y conversaciones difíciles con modelos de lenguaje

Two people rehearsing a difficult conversation across a table in bright window light

En resumen: Usar un modelo de IA para ensayar una entrevista, una negociación o una conversación que temes funciona, pero la versión por defecto de ese ejercicio es casi inútil, y ya existe una razón medida que lo explica. Kamoi y sus colegas presentaron CoCoEval en marzo de 2026, un marco de evaluación que detecta diez tipos de comportamiento incoherente y no cooperativo turno a turno, y lo usaron para comparar conversaciones simuladas por GPT-4.1, GPT-5.1 y Claude Opus 4 con conversaciones humanas reales procedentes de reuniones académicas, empresariales y gubernamentales, además de debates. Tres hallazgos importan a cualquiera que practique. Primero, bajo indicaciones ordinarias las conversaciones simuladas mostraron muchos menos comportamientos incoherentes y no cooperativos que las humanas. Segundo, la ingeniería de prompts no ofreció un control fiable: prompts distintos produjeron infraproducción o sobreproducción de esos comportamientos. Tercero, el ajuste supervisado sobre conversaciones humanas llevó a los modelos a sobreproducir un conjunto estrecho de comportamientos, como la repetición. En lenguaje llano: tu compañero de entrenamiento de IA es sistemáticamente más fácil que la persona a la que te vas a enfrentar de verdad, no puedes arreglarlo con una instrucción ingeniosa, y la solución tiene que ser estructural. A continuación: el protocolo de cinco fases, una tabla de especificación de dificultad con la señal correspondiente a cada tipo de escenario, prompts listos para pegar que mantienen separados al adversario y al entrenador, y los límites de lo que el ensayo aporta.

Casi todo el que usa estos modelos ha hecho alguna versión de esto. Se acerca una reunión difícil. Abres una ventana de chat, describes la situación, le pides al modelo que interprete a la otra persona y repasas la escena unas cuantas veces.

Resulta productivo. Sales más tranquilo. Luego llega la conversación real y la otra persona hace algo que tu ensayo nunca hizo: entiende mal tu segundo punto, te interrumpe antes de que llegues al motivo, sencillamente no acepta una premisa que dabas por cerrada.

Esa brecha no es mala suerte, ni es una debilidad de tu prompt. Ha sido medida.

El hallazgo que debería cambiar tu forma de ensayar

Kamoi, Godbole, Yang, Zhang, Wan y Zhou publicaron en marzo de 2026 “Evaluating LLM-Simulated Conversations in Modeling Inconsistent and Uncollaborative Behaviors in Human Social Interaction”. Su marco, CoCoEval, detecta diez tipos de comportamiento incoherente y no cooperativo a nivel de turnos individuales, usando un modelo como juez, y lo aplicaron a conversaciones generadas por GPT-4.1, GPT-5.1 y Claude Opus 4, comparando la frecuencia de esos comportamientos con la de conversaciones humanas reales tomadas de reuniones académicas, empresariales y gubernamentales, además de debates.

Sus conclusiones declaradas son tres, y cada una tiene una consecuencia directa sobre cómo deberías practicar.

Hallazgo Lo que informan los autores Lo que significa para el ensayo
Infraproducción con indicaciones por defecto Las conversaciones simuladas por IA muestran muchos menos comportamientos incoherentes y no cooperativos que las conversaciones humanas Tu compañero por defecto es más fácil que la realidad. Practicar contra él construye una confianza que la conversación real no va a honrar
La ingeniería de prompts no es fiable La ingeniería de prompts no ofrece un control fiable sobre esos comportamientos, y prompts distintos llevan a su infraproducción o sobreproducción No lo resolverás con un único prompt de sistema bien escrito. Un solo prompt puede quedarse corto o pasarse, y no sabrás cuál de las dos
El ajuste fino distorsiona El ajuste supervisado sobre conversaciones humanas puede llevar a los modelos a sobreproducir un conjunto estrecho de comportamientos, como la repetición Ni siquiera la solución pesada produce una dificultad equilibrada. Cambia una distorsión por otra

Esta tabla recoge los hallazgos del estudio citado; las implicaciones para el ensayo de la tercera columna son nuestras.

Fíjate bien en lo que descarta el segundo hallazgo. El consejo estándar ante este problema es “solo dile que sea más duro”. El resultado del propio estudio es que el control a nivel de instrucción no es fiable en ninguna de las dos direcciones. Así que el método no puede apoyarse en acertar con la instrucción. Tiene que apoyarse en algo que puedas verificar desde fuera, y eso significa repetir el escenario más de una vez y comprobar si la dificultad apareció de verdad.

Ese único cambio estructural es la mayor parte del valor de este artículo.

Por qué practicar con un modelo

Conviene ser claro sobre qué problema resuelve esto, porque el argumento honesto a favor del ensayo con IA es más estrecho y mejor que el habitual.

Yang, Ziems, Held, Shaikh, Bernstein y Mitchell, de Stanford, lo plantearon en abril de 2024 en “Social Skill Training with Large Language Models”. Su observación inicial es toda la cuestión: las personas dependen de habilidades sociales como la resolución de conflictos para comunicarse con eficacia y prosperar tanto en el trabajo como en la vida personal; sin embargo, los entornos de práctica para habilidades sociales suelen estar fuera del alcance de la mayoría.

Esa es la restricción real. No que los modelos sean buenos interlocutores. Sino que casi nadie tiene acceso a un interlocutor dispuesto, paciente y repetible que recorra con él la misma conversación difícil once veces a las once de la noche.

Lo segundo que merece la pena tomar de ese trabajo es la estructura que proponen. Describen un marco de compañero de IA y mentor de IA que combina el aprendizaje experiencial con práctica realista y retroalimentación personalizada. El compañero interpreta al interlocutor. El mentor da la retroalimentación. Son roles separados.

La mayoría de la gente funde esos dos roles en un solo chat, y es la causa individual más frecuente de que la práctica fracase. Un modelo que es a la vez tu adversario y tu entrenador no puede ser un adversario convincente, porque un buen adversario no se detiene a mitad de frase para decirte que tu encuadre fue sólido. Mantenerlos separados no es una cuestión de estilo. Es lo que hace que el adversario sostenga el personaje.

Qué exige realmente la práctica deliberada

La razón por la que el ensayo funciona, cuando funciona, está bien documentada, y también la razón por la que normalmente no lo hace.

Ericsson, Krampe y Tesch-Römer expusieron el marco en 1993 en “The Role of Deliberate Practice in the Acquisition of Expert Performance”, en Psychological Review. Su explicación del rendimiento experto es que resulta de actividades prolongadas y esforzadas diseñadas específicamente para mejorar el rendimiento, y no de la experiencia acumulada. La palabra operativa es diseñadas. Hacer la cosa repetidamente no es práctica. Hacer la parte concreta en la que eres malo, con retroalimentación, sí lo es.

También encontraron algo útil sobre la duración: al revisar estudios en distintos dominios, informaron de que esencialmente no hay beneficio en duraciones superiores a cuatro horas diarias, un beneficio reducido más allá de dos, y sugirieron que la duración efectiva de la práctica deliberada podría acercarse más a una hora al día. Para el ensayo, eso favorece con fuerza las sesiones cortas y densas frente a las largas.

Hay una segunda razón por la que corto y denso gana, procedente de otra literatura. Roediger y Karpicke, en “Test-enhanced learning: taking memory tests improves long-term retention”, en Psychological Science en 2006, hicieron que estudiantes estudiaran textos en prosa y después o bien volvieran a estudiarlos o bien realizaran pruebas de recuerdo, con una prueba final a los cinco minutos, dos días o una semana. A los cinco minutos ganó volver a estudiar. En los intervalos demorados, haber sido examinado antes produjo una retención sustancialmente mayor que estudiar.

El paralelismo con el ensayo es exacto. Leer tus notas sobre lo que vas a decir es volver a estudiar. Decirlo en voz alta, sin apoyo, contra resistencia, es recuperación. Lo primero sienta mejor de inmediato. Lo segundo es lo que sobrevive hasta el día de la reunión.

El mismo principio, generar antes de recibir, impulsa el método del prompt socrático para material de aprendizaje, y este artículo es su equivalente conductual.

El protocolo de entrenamiento

Cinco fases. Las fases existen para resolver problemas documentados concretos, por eso la tercera columna nombra cuál.

Fase Lo que haces tú Lo que hace el modelo El problema que resuelve
1. Informe Especifica identidad, interés, restricción y estado de ánimo del interlocutor, además de los comportamientos difíciles exigidos. Dale al modelo información que tú no tienes Lee y sostiene el papel, incluida la información privada Los papeles vagos producen papeles complacientes. Un interlocutor con un interés declarado tiene algo que defender
2. Combate Di o escribe tus palabras reales en tiempo real. Sin acotaciones, sin metacomentario, sin reinicios Permanece en el personaje. Nunca entrena, nunca rompe el marco, nunca resume Recuperación bajo resistencia, no reestudio. Romper el marco convierte la práctica de nuevo en lectura
3. Congelar Termina la escena en el momento más duro, no en una resolución Se detiene El desenlace es la parte menos útil. El momento en que no supiste qué decir es el material
4. Revisión Pasa a una conversación separada con el rol de mentor. Pega la transcripción Responde a tres preguntas concretas, sin elogios generales Separar compañero y mentor mantiene creíble al adversario y utilizable la retroalimentación
5. Repetición Repite el mismo escenario con una variable cambiada y una especificación de dificultad distinta Interpreta a un interlocutor claramente diferente La falta de fiabilidad documentada del control por prompt. Una sola pasada no dice nada sobre dificultad. Tres pasadas dan el rango

Esta tabla es un marco editorial de CEOtudent. Combina la separación entre compañero y mentor descrita por Yang y sus colegas con los principios de práctica deliberada y práctica de recuperación citados arriba, y añade el requisito de pasadas múltiples como respuesta directa al hallazgo de CoCoEval sobre el control poco fiable por prompt.

La fase cinco es la que la gente se salta y la que más importa. Si el control de dificultad a nivel de prompt no es fiable en ninguna dirección, una sola pasada es una única muestra no verificada. Hacer tres y tomar la más dura como referencia es una solución tosca, pero es una que no depende de que la instrucción haya funcionado.

Especificar la dificultad y detectar cuándo falló

Puesto que no puedes confiar en que una instrucción produzca dificultad, tienes que nombrar los comportamientos concretos que quieres y después comprobarlo. Peticiones genéricas como “sé un entrevistador duro” son exactamente el tipo de instrucción que el estudio halló poco fiable.

Esta es la especificación por escenario, con la señal observable de que tu interlocutor se ha ablandado.

Escenario Comportamientos difíciles a exigir explícitamente La señal de que se ablandó
Entrevista de trabajo Interrumpir una respuesta larga en el segundo 30; repetir la misma pregunta porque la primera respuesta no convenció; pérdida visible de interés; negarse a reconocer una fortaleza que afirmas tener Cada respuesta recibe un “Es un ejemplo estupendo”. Las repreguntas se apoyan en tu respuesta en lugar de atacar su premisa
Negociación salarial Declarar una restricción firme y no moverse de ahí; quedarse callado tras tu cifra; reencuadrar tu valor a la baja; terminar el intercambio sin acuerdo El interlocutor cede en tres turnos, o te explica su propio razonamiento sin que se lo pidas
Objeción de un cliente Recordar mal lo acordado; plantear una objeción que ya respondiste; traer la opinión de un decisor ausente; cuestionar un alcance que dabas por cerrado Acepta tu versión del historial. Los clientes reales rara vez lo hacen
Retroalimentación difícil a alguien de tu equipo Ponerse a la defensiva; discutir el ejemplo concreto que citas; desviarlo hacia otra persona; quedarse en silencio Te agradece la retroalimentación en los dos primeros turnos y se compromete a cambiar
Decir no a un superior No aceptar el motivo; reformular la petición como si no hubieras dicho que no; aplicar presión de tiempo; insinuar consecuencias Dice “me parece justo, buscaré a otra persona”
Ronda de preguntas de inversores o compradores Encadenar la segunda y la tercera pregunta en lugar de pasar a otro tema; cuestionar un supuesto de tus números; expresar escepticismo sin explicarlo Hace una pregunta por tema y recorre tu documento en orden

Esta tabla es un marco editorial de CEOtudent. Las categorías de comportamiento se apoyan en las clases de comportamiento incoherente y no cooperativo que CoCoEval fue construido para detectar; la correspondencia con los escenarios y las señales de fallo son nuestras.

Usa la tercera columna como comprobación en vivo durante la sesión. Si ves la señal, la pasada no cuenta. Reinicia nombrando de nuevo y con más filo el comportamiento concreto, y trata la pasada blanda como prueba de que este modelo, hoy, necesita una especificación más pesada.

Los dos prompts

Dos conversaciones separadas. No las fusiones.

El prompt del compañero. Abre una conversación nueva y pega esto, relleno.

Interpretas un único papel en un ensayo. Eres [papel, nivel jerárquico, relación conmigo]. Tu interés en esta conversación es [lo que quiere]. Tu restricción es [lo que le limita]. Tu estado de ánimo al entrar es [ánimo]. Sabes algo que yo no sé: [información privada que posee el interlocutor].

Comportamientos obligatorios durante esta escena, que debes ejecutar realmente y no solo describir: [elige tres de la tabla de dificultad]. Ejecuta cada uno al menos una vez.

Reglas: permanece en el personaje durante toda la escena. No me entrenes nunca. No comentes nunca mi actuación. No resumas nunca. No rompas el marco por ningún motivo, ni siquiera si te lo pido. Habla solo como el personaje, un turno cada vez, con la extensión que ese personaje usaría de verdad. No resuelvas la conversación. Si digo la palabra ALTO, termina la escena de inmediato y no añadas nada.

Empieza. Hablas tú primero.

La línea de la información privada hace más trabajo del que parece. Un interlocutor que sabe algo que tú ignoras tiene motivos para comportarse de maneras que no puedes anticipar, y eso es lo más parecido a una dificultad genuina que puedes instalar mediante instrucción.

El prompt del mentor. Conversación nueva, pega la transcripción y luego esto.

Abajo hay la transcripción de un ensayo en el que yo era [yo] y la otra parte era [papel]. Analiza únicamente mis turnos.

Responde exactamente a tres preguntas y a nada más.
1. ¿Qué intentaba conseguir, juzgando solo por lo que dije realmente y no por lo que probablemente pretendía?
2. ¿Dónde exactamente perdí terreno, citando la línea exacta, y cuál fue el mecanismo de esa pérdida?
3. ¿Cuál es el único cambio en mi próximo intento que más alteraría el resultado, formulado como una frase que yo pudiera decir de verdad?

No elogies nada. No resumas la transcripción. No des consejos generales de comunicación. Si mis turnos fueron adecuados de principio a fin, dilo en una frase y para.

Esas tres preguntas no son arbitrarias. Hattie y Timperley, en “The Power of Feedback”, publicado en la Review of Educational Research en 2007, sostuvieron que la retroalimentación eficaz debe responder a tres preguntas: adónde voy, cómo voy y hacia dónde después. Su conclusión más amplia merece tenerse presente al leer la valoración que un modelo hace de ti: la retroalimentación está entre las influencias más poderosas sobre el aprendizaje y el rendimiento, pero su impacto puede ser positivo o negativo, y el tipo de retroalimentación y la forma de darla tienen eficacia desigual. El elogio sin dirección es el modo de fallo, y es precisamente lo que un modelo produce por defecto.

Los límites honestos

Esto es un método de ensayo. No es una garantía de rendimiento, y la distancia entre ambas cosas es mayor de lo que admite la mayoría de los consejos sobre este tema.

Afirmación Estado Base
Un modelo puede simular a un interlocutor Respaldada Documentado en la literatura sobre juego de rol con LLM y base de la comparación de CoCoEval
La simulación por defecto es más fácil que un interlocutor real Respaldada El hallazgo directo de CoCoEval sobre tres modelos punteros frente a datos de reuniones y debates humanos
Decirle al modelo que sea difícil lo arregla Refutada El mismo estudio encontró que la ingeniería de prompts no ofrecía control fiable, produciendo infra o sobreproducción según el prompt
Ensayar una entrevista mejorará tu desempeño en la entrevista No establecida Ningún estudio citado aquí midió la transferencia del ensayo con IA a resultados reales. El mecanismo es plausible; el efecto, no medido
Suficiente práctica te hará bueno en esto Parcial en el mejor caso El metaanálisis de Macnamara, Hambrick y Oswald encontró que la práctica deliberada explicaba el 26 por ciento de la varianza del rendimiento en juegos, el 21 en música, el 18 en deportes, el 4 en educación y menos del 1 en profesiones

Esta tabla es un marco editorial de CEOtudent. Cada afirmación se califica frente a la prueba publicada más sólida a nuestro alcance, donde Respaldada significa que un estudio la puso a prueba directamente, Refutada que la prueba más sólida la contradice, y No establecida que ningún estudio citado la midió en un sentido ni en otro.

Esa última fila merece más de una línea. Macnamara, Hambrick y Oswald publicaron en 2014 en Psychological Science “Deliberate Practice and Performance in Music, Games, Sports, Education, and Professions: A Meta-Analysis”, y encontraron que la práctica deliberada explicaba el 26 por ciento de la varianza del rendimiento en juegos, el 21 en música, el 18 en deportes, el 4 en educación y menos del 1 en profesiones. Su conclusión fue que la práctica deliberada es importante, pero no tanto como se había sostenido.

El rendimiento profesional es la fila en la que estás. Menos del 1 por ciento de la varianza.

Eso no es un argumento contra ensayar. Es un argumento contra esperar que el ensayo sea lo que decida el resultado. Lo que el ensayo hace de forma fiable es eliminar un fallo concreto: no haber dicho nunca las palabras. Es un fallo real y merece la pena eliminarlo. Lo que no hace es sustituir la sustancia de tu caso, tu poder real en la negociación o la preparación que nada tiene que ver con la exposición.

Practica la exposición. No la confundas con el argumento.

Una sesión realista

Veinte minutos, tres pasadas, un escenario.

Minutos 0 a 3: escribe el informe. Papel, interés, restricción, ánimo, información privada, tres comportamientos exigidos de la tabla.

Minutos 3 a 8: pasada uno. Di tus palabras reales. Congela en el momento más duro, no en la resolución. Comprueba la columna de señales. Si el interlocutor se ablandó, esta pasada no cuenta.

Minutos 8 a 12: pasada dos, mismo escenario, una variable cambiada y una especificación de dificultad más afilada. Aquí es donde la falta de fiabilidad del control por prompt se absorbe en lugar de discutirse.

Minutos 12 a 16: pasada tres, con la especificación más dura que sepas escribir.

Minutos 16 a 20: pega las tres transcripciones en la conversación de mentor y plantea las tres preguntas sobre el conjunto, no pasada por pasada. El patrón a lo largo de tres intentos informa más que cualquier crítica aislada, porque muestra lo que haces siempre bajo presión en lugar de lo que hiciste una vez.

Después para. Ericsson y sus colegas encontraron que la duración efectiva de la práctica deliberada podría acercarse más a una hora al día que a las cuatro o más que sugiere la intuición, y veinte minutos densos contra resistencia real valen más que una tarde entera de juego de rol cómodo.

Para las capas de alrededor: tutores de IA en 2026 compara qué productos están hechos para enseñar en lugar de para responder, qué dice la evidencia sobre el aprendizaje ordena las técnicas de estudio por solidez de la investigación, el protocolo de tutor de IA de 20 horas es la versión comprimida para conocimiento y no para conducta, y la ingeniería de contexto trata la habilidad más amplia de especificar qué necesita sostener un modelo para comportarse como necesitas.

Preguntas frecuentes

¿Pueden ChatGPT o Claude simular de verdad a un entrevistador?
Pueden sostener el papel de forma convincente. Lo que no hacen por defecto es comportarse como uno difícil. La evaluación de CoCoEval encontró que las conversaciones simuladas por GPT-4.1, GPT-5.1 y Claude Opus 4 contenían muchos menos comportamientos incoherentes y no cooperativos que las conversaciones humanas reales bajo indicaciones ordinarias. Así que espera un entrevistador competente, cooperativo y anormalmente atento salvo que especifiques otra cosa y verifiques que la especificación prendió.

¿Cómo hago que la IA sea un compañero de práctica más duro?
Nombra comportamientos concretos en vez de pedir dificultad en general: interrumpir, recordar mal lo acordado, sacar una objeción ya respondida, quedarse callado tras tu cifra. Después verifica desde fuera repitiendo el escenario más de una vez y vigilando las señales observables de ablandamiento. El estudio que documentó el problema de infraproducción también encontró que la ingeniería de prompts no ofrecía control fiable en ninguna dirección, y por eso la verificación a lo largo de varias pasadas importa más que la redacción de una instrucción aislada.

¿Debería la IA darme retroalimentación durante el juego de rol?
No. Usa dos conversaciones separadas, compañero y mentor, siguiendo el marco descrito por Yang y sus colegas. Un modelo que entrena en mitad de la escena no puede sostener un personaje adversario creíble, y romper el marco convierte el ejercicio de práctica de recuperación otra vez en lectura, que la investigación sobre el efecto de prueba señala como la más débil de las dos a cualquier demora.

¿Practicar con IA mejora realmente el rendimiento real?
Ningún estudio citado aquí lo establece. Los mecanismos subyacentes, práctica de recuperación y práctica deliberada, están bien evidenciados en otros dominios, pero ninguna de las investigaciones examinadas aquí midió la transferencia del ensayo con IA a resultados reales de entrevista o negociación. Trata el método como la eliminación de una carencia concreta, la de no haber dicho nunca las palabras en voz alta bajo resistencia, y no como una mejora de rendimiento demostrada.

¿Cuánto debería durar una sesión de práctica?
Corta y densa. Ericsson y sus colegas informaron de que esencialmente no hay beneficio en practicar más de cuatro horas al día, con beneficio reducido más allá de dos, y sugirieron que la duración efectiva podría acercarse más a una hora. Para el ensayo conversacional, veinte minutos que cubran tres pasadas de un escenario más la revisión son una unidad razonable, y superan a una hora de juego de rol complaciente.

¿Merece la pena hacer esto en cada conversación difícil?
No. Resérvalo para conversaciones en las que tu exposición bajo presión sea de verdad la restricción vinculante y en las que no vayas a tener un segundo intento. Donde la restricción sea la solidez de tu caso, tu poder de negociación o los hechos que has reunido, el ensayo te hará sentir más preparado sin hacerte más probable el éxito, y merece la pena evitar esa ilusión concreta.

Fuentes

  • Kamoi, Godbole, Yang, Zhang, Wan y Zhou, Evaluating LLM-Simulated Conversations in Modeling Inconsistent and Uncollaborative Behaviors in Human Social Interaction, preimpresión de arXiv, marzo de 2026, sin revisión por pares
  • Yang, Ziems, Held, Shaikh, Bernstein y Mitchell, Social Skill Training with Large Language Models, preimpresión de arXiv, abril de 2024, sin revisión por pares
  • Ericsson, Krampe y Tesch-Römer, The Role of Deliberate Practice in the Acquisition of Expert Performance, Psychological Review, volumen 100, número 3, 1993
  • Macnamara, Hambrick y Oswald, Deliberate Practice and Performance in Music, Games, Sports, Education, and Professions: A Meta-Analysis, Psychological Science, volumen 25, 2014, páginas 1608 a 1618
  • Roediger y Karpicke, Test-enhanced learning: taking memory tests improves long-term retention, Psychological Science, volumen 17, número 3, 2006, páginas 249 a 255
  • Hattie y Timperley, The Power of Feedback, Review of Educational Research, volumen 77, número 1, 2007, páginas 81 a 112

Este contenido fue recopilado con el apoyo de la IA tras una investigación exhaustiva, y luego redactado y preparado para su publicación por el equipo editorial de CEOtudent.

This post is also available in: Türkçe English Français Deutsch

Benzer içerikler