Resumen. Las respuestas se han vuelto casi gratuitas. En julio de 2025, solo ChatGPT contaba con más de 700 millones de usuarios semanales que enviaban más de 2.500 millones de mensajes al día, y la proporción de esos mensajes que eran preguntas (“Asking”) pasó de un reparto a partes iguales con las solicitudes de tareas en julio de 2024 al 51,6 % a finales de junio de 2025. Los usuarios, además, valoran mejor las respuestas a preguntas que el resultado de las tareas. Al mismo tiempo, los datos de Anthropic muestran que crece el hábito contrario: las conversaciones en las que el usuario delega una tarea completa casi sin ida y vuelta pasaron del 27 % al 39 % en ocho meses. Así que el factor diferencial ya no es quién puede obtener una respuesta, sino quién sabe formular la pregunta que merece ser respondida. La investigación sobre el acto de preguntar, desde las aulas de la década de 1990 hasta los juegos de laboratorio de 2018 y una encuesta de 2025 a 319 trabajadores del conocimiento, converge en tres hallazgos. Las personas reconocen una buena pregunta mucho mejor de lo que la generan. Hacer más preguntas no equivale a hacer mejores preguntas. Y la ambigüedad es la norma, no la excepción. Un análisis de CEOtudent de nueve estudios primarios convierte estas conclusiones en un Marco de Calidad de Preguntas de seis dimensiones, puntuado de 0 a 12, con un ejemplo resuelto. Se trata de un marco editorial, no de un instrumento validado, y señalamos dónde su evidencia es más débil.
Este artículo acompaña a nuestro texto central sobre la economía del juicio. Aquel sostenía que el juicio se está convirtiendo en la habilidad escasa. Este se centra en el primer acto del juicio: decidir qué preguntar. El movimiento del CEO consiste en tratar sus preguntas como los insumos de mayor apalancamiento que controla. El movimiento del estudiante consiste en practicar deliberadamente la generación de preguntas, porque la evidencia indica que no mejora por sí sola.
¿Por qué la calidad de las preguntas se ha convertido de repente en el cuello de botella?
Dos conjuntos de datos publicados en septiembre de 2025 describen cómo habla realmente la gente con los sistemas de IA y, leídos juntos, explican el cambio.
El primero es un documento de trabajo de economistas de OpenAI y David Deming, de Harvard, publicado a través del National Bureau of Economic Research. Clasificó una muestra de alrededor de 1,1 millones de conversaciones de ChatGPT entre mayo de 2024 y junio de 2025 en tres intenciones. “Asking” (preguntar) significa buscar información o aclaraciones para fundamentar una decisión. “Doing” (hacer) significa producir un resultado o ejecutar una tarea. “Expressing” (expresar) significa compartir opiniones o sentimientos. A lo largo del periodo, el 49 % de los mensajes fueron de tipo Asking, el 40 % Doing y el 11 % Expressing. En julio de 2024, Asking y Doing estaban repartidos a partes iguales; a finales de junio de 2025 el reparto era 51,6 % Asking, 34,6 % Doing y 13,8 % Expressing. Los autores también informan de que los mensajes de tipo Asking son “valorados sistemáticamente como de mayor calidad”, tanto por un clasificador de satisfacción como por la opinión directa de los usuarios. El uso relacionado con el trabajo, por su parte, cayó del 47 % de los mensajes en junio de 2024 al 27 % en junio de 2025, no porque el uso laboral se redujera, sino porque todo lo demás creció más deprisa.
El segundo es el Anthropic Economic Index. Su primer informe, que cubría finales de 2024 y principios de 2025, halló que el 57 % de las conversaciones en Claude.ai mostraba patrones de potenciación (aprender, iterar, validar) y el 43 % patrones de automatización. Para el informe de septiembre de 2025, las conversaciones “directivas”, en las que el usuario entrega una tarea completa y se queda con el resultado con una mínima ida y vuelta, habían saltado del 27 % al 39 %, y la automatización y la potenciación estaban casi igualadas en Claude.ai (49 % de automatización con el clasificador actual). El informe señala que este aumento “se produjo principalmente a costa de la iteración de tareas y de las interacciones de aprendizaje”.
Si se juntan ambos conjuntos de datos, el cuadro es claro. Una proporción cada vez mayor de lo que la gente envía a la IA es una pregunta, y las preguntas obtienen las mejores respuestas. Pero una parte creciente de los usuarios pregunta una vez, toma el resultado y se va. La segunda pregunta, la que pone a prueba o afina la primera respuesta, es exactamente la que está desapareciendo. Eso es un problema de calidad de las preguntas, y es anterior a la IA en varias décadas.
¿Qué ha medido realmente la investigación sobre las preguntas?
La mayor parte de los consejos sobre “hacer mejores preguntas” es folclore. Los estudios que siguen midieron algo concreto. Todas las cifras proceden de los textos primarios; ninguna viene de un resumen secundario.
| Estudio (fuente primaria) | Contexto y muestra | Qué se midió | Hallazgo verificado |
|---|---|---|---|
| Graesser y Person, 1994, American Educational Research Journal | Síntesis de la literatura sobre el aula, más 27 estudiantes universitarios en tutoría y una muestra de álgebra de 7.º curso | Frecuencia y profundidad de las preguntas; correlación con las notas de los exámenes | Un solo estudiante hace unas 0,11 preguntas por hora en clase frente a 26,5 por hora en tutoría, aproximadamente 241 veces más. Los profesores hacen unas 69 por hora, el 96 % de todas las preguntas del aula, y solo el 4 % de las suyas son de alto nivel. En la primera mitad del curso, el número total de preguntas correlacionó negativamente con las notas de los exámenes (r = -0,56); la proporción de preguntas de razonamiento profundo correlacionó positivamente (0,36, subiendo a 0,47 más adelante) |
| Rosenshine, Meister y Chapman, 1996, Review of Educational Research | 26 estudios de intervención que enseñaban a los estudiantes a generar sus propias preguntas | Efecto en pruebas de comprensión lectora | Mediana del tamaño del efecto de 0,36 en pruebas estandarizadas y de 0,86 en pruebas elaboradas por los experimentadores. El tipo de andamiaje más potente, las plantillas genéricas de pregunta como “¿Cómo afecta … a …?”, alcanzó una mediana de 1,12 en cuatro estudios |
| Huang, Yeomans, Brooks, Minson y Gino, 2017, Journal of Personality and Social Psychology | 199 díadas de conversación, 368 transcripciones codificadas, 110 participantes en citas rápidas y 1.961 observaciones de citas | Tipos de pregunta y cuánto agradaba a la otra persona quien preguntaba | Las parejas de quienes hacían muchas preguntas declararon un agrado de 5,79 frente a 5,31 (d = 0,35). Solo las preguntas de seguimiento predecían el agrado. En las citas rápidas, una diferencia del 8 % en la tasa de preguntas de seguimiento se asoció con una segunda cita adicional a lo largo de una velada de 20 citas |
| Rothe, Lake y Gureckis, 2018, Computational Brain and Behavior | 40 participantes que generaban preguntas libres sobre 18 tableros tipo Batalla naval (605 preguntas categorizadas); 45 y 41 participantes que evaluaban preguntas | Ganancia de información esperada (EIG) de las preguntas generadas frente a las evaluadas | La frecuencia con la que se generaba una pregunta correlacionó con su valor informativo solo en r = 0,16. Cuando el mismo tipo de participantes clasificó preguntas escritas por otros, sus clasificaciones correlacionaron con el valor informativo en r = 0,89. Alrededor del 3 % de las preguntas generadas no aportaba ninguna información |
| Ruggeri, Lombrozo, Griffiths y Xu, 2016, Developmental Psychology | 24 niños de siete años, 23 de diez años y 23 adultos en un juego jerárquico de 20 preguntas | Número de preguntas hasta la solución; nivel de la primera pregunta; preguntas formuladas cuando la respuesta ya estaba determinada | La estrategia óptima requiere 2,85 preguntas. Los adultos necesitaron 3,36; los de diez años, 4,38; los de siete años, 4,92. De tres rondas, los adultos abrieron en el nivel más informativo 1,87 veces frente a 0,41 en los niños de siete años. Aun así, el 52 % de los adultos hizo al menos una pregunta que ya no podía cambiar la respuesta |
| Min, Michael, Hajishirzi y Zettlemoyer, 2020, EMNLP (AmbigQA) | 14.042 preguntas reales del benchmark de dominio abierto Natural Questions, extraídas de búsquedas de Google | Proporción de preguntas con más de una interpretación válida | “Más de la mitad” de las preguntas de desarrollo y de prueba eran ambiguas (el 47 % en la partición de entrenamiento), con la dependencia temporal y las referencias a entidades entre las principales fuentes |
| Lee, Sarkar, Tankelevitch, Drosos, Rintel, Banks y Wilson, 2025, CHI (Microsoft Research) | 319 trabajadores del conocimiento, 936 ejemplos de primera mano de uso de IA generativa en el trabajo | Pensamiento crítico autodeclarado y qué lo predice | Se declaró pensamiento crítico en el 59,29 % de los ejemplos. La confianza en la IA se asoció negativamente con el pensamiento crítico (beta = -0,69); la confianza en la propia capacidad (0,26) y en la capacidad de evaluar el resultado de la IA (0,31) se asociaron positivamente. El esfuerzo se desplazó “de la recopilación de información a la verificación de información” |
Bajo la tabla hay tres salvedades. Las cifras del aula son estimaciones de la década de 1990 que Graesser y Person agregaron a partir de estudios anteriores. Los juegos de laboratorio miden las preguntas frente a un óptimo definido matemáticamente que las decisiones reales rara vez tienen. Y la encuesta de Microsoft es autodeclarada y, como afirman los autores, “no establece causalidad”. Usamos estos estudios para entender la forma del problema, no para hacer pronósticos precisos sobre su próximo prompt.
¿Qué patrón comparten los estudios?
Leídos en paralelo, los siete estudios describen los mismos cuatro fallos, y cada fallo tiene su gemelo en la era de la IA.
1. La brecha de generación. Rothe y sus colegas encontraron que las personas son malas produciendo la mejor pregunta (r = 0,16 entre frecuencia y valor) y buenas reconociéndola (r = 0,89). Es el hallazgo más importante para cualquiera que trabaje con IA. Significa que el cuello de botella no es el criterio, sino la producción. Usted reconocerá una gran pregunta cuando la vea; rara vez escribirá una sin ayuda. La revisión de Rosenshine muestra la solución: los estudiantes a los que se enseñó explícitamente a generar sus propias preguntas mejoraron de forma sustancial en pruebas de comprensión diseñadas en torno al material (mediana del tamaño del efecto de 0,86, el percentil 81), y las plantillas genéricas de pregunta fueron el tipo de andamiaje más potente (mediana de 1,12 en cuatro estudios). Generar preguntas es una habilidad entrenable, y se entrena con andamiajes, no con exhortaciones.
2. Cantidad no es calidad. En los datos de Graesser y Person, los estudiantes que hacían más preguntas al principio del curso obtenían peores notas en los exámenes, mientras que aquellos cuyas preguntas eran más a menudo de tipo “por qué, cómo, qué pasaría si” obtenían mejores notas. Los adultos de Ruggeri, bastante más eficientes que los niños, seguían haciendo preguntas redundantes en más de la mitad de los casos. Una ventana de chat sin coste por mensaje hace que este fallo sea barato e invisible: puede hacer veinte preguntas superficiales y sentirse productivo.
3. La ambigüedad es la norma. AmbigQA halló que más de la mitad de las preguntas de búsqueda corrientes tienen más de una respuesta legítima según el momento, la entidad o el alcance. Un experto humano responde a una pregunta ambigua devolviendo otra. Un modelo de lenguaje suele responder a la lectura estadísticamente más probable sin decirle que ha elegido. Esa elección silenciosa es uno de los mecanismos detrás del sesgo de la primera conclusión que describimos anteriormente: la primera respuesta parece completa porque la ambigüedad de la pregunta se resolvió por usted, de forma invisible.
4. El valor está en el seguimiento. El equipo de Huang descubrió que solo las preguntas de seguimiento, y no el total de preguntas, predecían si uno le caía bien a su interlocutor, y el efecto se trasladaba a las decisiones sobre una segunda cita. Los datos de Anthropic muestran que la conducta de seguimiento (iterar tareas, aprender) es precisamente lo que se redujo a medida que creció el uso directivo. La encuesta de Lee añade el mecanismo: cuando las personas confían más en la IA, piensan menos críticamente, y el pensamiento crítico que queda se ha desplazado a la verificación. Una pregunta de seguimiento es la forma más barata de verificación.
El Marco de Calidad de Preguntas
La tabla siguiente es un marco editorial de CEOtudent. Es nuestra síntesis de los estudios anteriores, no un instrumento validado frente a resultados. Cada una de las seis dimensiones se puntúa con 0, 1 o 2. Una pregunta obtiene entre 0 y 12 puntos.
| Dimensión | Cómo es un 0 | Cómo es un 2 | Anclaje en la investigación |
|---|---|---|---|
| Vínculo con la decisión | Ninguna decisión depende de la respuesta; curiosidad o relleno | Puede nombrar la decisión que la respuesta cambiará y el umbral que la haría cambiar de sentido | Definición del NBER de “Asking” como fundamentar una decisión; preguntas por déficit de conocimiento de Graesser |
| Desambiguación | Admite varias lecturas de momento, entidad, alcance o audiencia | El marco temporal, la entidad, el alcance y la audiencia quedan fijados en la propia pregunta | AmbigQA (más de la mitad de las preguntas reales son ambiguas) |
| Poder de partición | Prueba una conjetura cada vez (“¿Es X?”) | Divide el espacio de posibilidades aproximadamente por la mitad en el nivel más general que resulte útil | Preguntas de nivel superordinado primero, de Ruggeri; ganancia de información esperada, de Rothe |
| Tipo de profundidad | Sí/no, quién, qué, cuántos | Por qué, cómo, qué pasaría si, por qué no: pide mecanismo, causa o consecuencia | Categorías de razonamiento profundo de Graesser, que correlacionaron con el rendimiento |
| Forma de la respuesta | Aceptaría cualquier respuesta fluida | Ha escrito cómo sería una respuesta equivocada y qué evidencia zanjaría la cuestión | Lee et al.: el esfuerzo se desplaza a la verificación; plantillas genéricas de Rosenshine |
| Plan de seguimiento | La primera respuesta cierra la sesión | Ya conoce la segunda pregunta para cada respuesta probable | Huang et al. (el seguimiento predice el agrado y los resultados); la iteración decreciente en los datos de Anthropic |
Bandas de puntuación (editoriales): de 0 a 4 es una consulta de búsqueda, válida para datos que verificará en otra parte. De 5 a 8 es una pregunta de trabajo, suficiente para borradores y exploración. De 9 a 12 es una pregunta de nivel de decisión, la única clase que debería entregar a un sistema de IA o a un colega sénior cuando de ella depende una elección real.
Un ejemplo resuelto
Tomemos una pregunta profesional habitual: “¿Debería aprender Python?”
- Vínculo con la decisión: 0. No se enuncia ninguna decisión ni umbral.
- Desambiguación: 0. ¿Para qué puesto, para cuándo, en lugar de qué?
- Poder de partición: 0. Prueba una opción contra nada.
- Tipo de profundidad: 0. Invita a un sí o un no.
- Forma de la respuesta: 0. Se aceptaría cualquier respuesta segura de sí misma.
- Plan de seguimiento: 0. Un “sí” cierra la conversación.
Puntuación: 0 de 12. Cualquier respuesta es ruido, y la mayoría de las herramientas de IA ofrecerán un sí genérico y lleno de aplomo.
Ahora la misma necesidad, reescrita: “Soy analista de marketing con dos años de experiencia y en los próximos 30 días decido si dedico mis 60 horas de formación de este trimestre a Python para análisis de datos o a SQL avanzado. ¿Cuál de los dos aparece con más frecuencia como requisito en las ofertas de analista en empresas de mi tamaño, y cuál produce resultados utilizables más rápido para los informes semanales? Si la respuesta es Python, ¿cuál es el proyecto más pequeño que lo demostraría en cuatro semanas? Si es SQL, ¿a qué estaría renunciando?”
- Vínculo con la decisión: 2. Una decisión con fecha y con presupuesto.
- Desambiguación: 2. Puesto, experiencia, horizonte, alternativas.
- Poder de partición: 2. Dos opciones vivas, comparadas con dos criterios explícitos.
- Tipo de profundidad: 1. Pregunta “cuál” y “qué”, con el mecanismo implícito en lugar de exigido.
- Forma de la respuesta: 1. Los criterios están nombrados, pero no se fija ningún umbral (“requerido en al menos X de las ofertas”).
- Plan de seguimiento: 2. Ambas ramas ya tienen su siguiente pregunta.
Puntuación: 10 de 12. Observe que nada en la segunda versión es ingenioso. Es la primera versión más el andamiaje que, según la investigación, las personas no añaden por sí solas.
¿Cómo se practica como estudiante?
La revisión de Rosenshine es clara en que la generación de preguntas mejora con andamiajes explícitos, y en que las plantillas genéricas funcionaron mejor. Tenga a mano una lista breve y úsela antes de abrir cualquier herramienta de IA:
- ¿Cómo afecta … a …?
- ¿Cuáles son las fortalezas y debilidades de …?
- ¿Cómo encaja … con lo que ya sabemos?
- ¿Cuál es un ejemplo nuevo de …?
- ¿Qué conclusiones se pueden extraer sobre …?
- ¿Por qué es importante que …?
Un ejercicio práctico: durante una semana, escriba su pregunta en un archivo de texto plano antes de teclearla en una ventana de chat, puntúela en las seis dimensiones y no envíe nada por debajo de 5. Después, exíjase una pregunta de seguimiento por sesión, elegida de su plan y no improvisada como reacción a la respuesta. El método del prompt socrático es una forma estructurada de ejecutar ese seguimiento, y el diario de decisiones es donde las columnas Vínculo con la decisión y Forma de la respuesta viven a lo largo del tiempo.
¿Cómo se gestiona como CEO de uno mismo?
Trate las preguntas como un presupuesto, no como un reflejo. De la evidencia se desprenden tres reglas.
Pregunte antes de delegar. Nuestro artículo sobre qué decisiones dejar en manos de la IA fijó límites por tipo de decisión. El marco añade una puerta de control: una tarea que no puede formularse como una pregunta de 9 o más puntos no está lista para delegarse, ni a un agente de IA ni a una persona, porque todavía no ha dicho qué sería una buena respuesta.
Calibre la confianza con el seguimiento, no con la primera respuesta. La encuesta de Lee halló que la confianza en la IA era el predictor negativo más fuerte del pensamiento crítico. El contrapeso más barato es una segunda pregunta planificada. La calibración de la confianza explica cuándo confiar; el plan de seguimiento es cómo se gana esa confianza caso por caso.
Audite mensualmente su mezcla de preguntas. Las correlaciones de rendimiento de Graesser seguían la proporción de preguntas profundas, no su número. Una vez al mes, tome diez de sus propios prompts y clasifíquelos como superficiales (quién, qué, sí/no) o profundos (por qué, cómo, qué pasaría si). Si la proporción de profundos está por debajo de un tercio, sus herramientas están bien y el problema son sus preguntas. La auditoría de supuestos es una fuente ya preparada de preguntas profundas sobre su propio sector, y la brecha de discernimiento explica por qué las preguntas superficiales producen resultados que no puede distinguir del pensamiento.
Lo que este marco no puede decirle
- No está validado. Ningún estudio ha comprobado si puntuar las preguntas en estas seis dimensiones mejora las decisiones. Las dimensiones están ancladas en la investigación; la puntuación es editorial.
- Los datos de uso son específicos de cada plataforma y se basan en clasificadores. Las cifras del NBER describen los planes de consumo de ChatGPT y excluyen a los usuarios que rechazaron compartir sus datos; las cifras de Anthropic describen el tráfico de Claude.ai y de la API clasificado por los propios modelos de Anthropic. Ninguna de las dos es un censo del uso de la IA.
- Los estudios de laboratorio definen “bueno” como ganancia de información frente a un espacio de respuestas conocido. La mayoría de las preguntas estratégicas no tienen ese espacio, y por eso las dimensiones Vínculo con la decisión y Forma de la respuesta pesan más en la práctica que en el laboratorio.
- Las tasas del aula tienen décadas y se agregaron a partir de varios estudios; tome la diferencia de 241 veces como un orden de magnitud, no como una cifra precisa.
- Lee y sus colegas midieron el pensamiento crítico autodeclarado y afirman con claridad que su análisis no establece causalidad.
Preguntas frecuentes
¿Es esto lo mismo que la ingeniería de prompts?
No. La ingeniería de prompts trata de dar formato a las instrucciones para que un modelo ejecute bien una tarea; nuestros artículos sobre la pila de alfabetización en IA y la ingeniería de contexto cubren ese terreno. Este marco trata de si lo que está preguntando merece ser preguntado, algo que importa igual cuando quien está al otro lado de la mesa es un ser humano.
Si las personas reconocen tan bien las buenas preguntas, ¿por qué no pedirle a la IA que mejore mi pregunta?
Es un uso razonable de la brecha de generación, y lo recomendamos como un paso. Pero el hallazgo de Rothe fue que las personas clasifican bien las preguntas cuando se les proporcionan las alternativas. Aun así tiene que evaluar la reescritura de la IA, lo que significa que necesita tener las seis dimensiones en la cabeza de todos modos.
¿Hacer más preguntas de seguimiento me ralentiza?
En los datos de Huang, la cita rápida media ya contenía 4,51 preguntas de seguimiento en cuatro minutos, así que el coste es pequeño. El tiempo que se ahorra al no actuar sobre una pregunta mal interpretada es la cifra mayor, aunque ningún estudio de los que encontramos lo ha medido directamente para el uso de la IA.
¿Cuál es el cambio de mayor valor?
Escribir la pregunta de seguimiento antes de ver la primera respuesta. Obliga a completar las columnas Vínculo con la decisión y Forma de la respuesta, y es la conducta que, según los datos de uso de 2025, está disminuyendo más rápido.
¿Puedo usar el marco en reuniones, y no solo con la IA?
Sí. Las cifras del aula de Graesser y Person (los profesores hacen el 96 % de las preguntas, y solo el 4 % de ellas son de alto nivel) describen la mayoría de las reuniones de avance. Las mismas seis columnas se aplican a la pregunta que lleva a su jefe o a su equipo.
Fuentes
- Chatterji, Cunningham, Deming, Hitzig, Ong, Shan y Wadman, “How People Use ChatGPT”, National Bureau of Economic Research Working Paper 34255, septiembre de 2025.
- Anthropic Economic Index, “Uneven geographic and enterprise AI adoption”, informe de septiembre de 2025, y Handa, Tamkin et al., “Which Economic Tasks are Performed with AI? Evidence from Millions of Claude Conversations”, marzo de 2025 (arXiv 2503.04761).
- Graesser y Person, “Question Asking During Tutoring”, American Educational Research Journal, 31(1), 1994, páginas 104 a 137.
- Rosenshine, Meister y Chapman, “Teaching Students to Generate Questions: A Review of the Intervention Studies”, Review of Educational Research, 66(2), 1996, páginas 181 a 221.
- Huang, Yeomans, Brooks, Minson y Gino, “It Doesn’t Hurt to Ask: Question-Asking Increases Liking”, Journal of Personality and Social Psychology, 113(3), 2017, páginas 430 a 452.
- Rothe, Lake y Gureckis, “Do People Ask Good Questions?”, Computational Brain and Behavior, 1, 2018, páginas 69 a 89.
- Ruggeri, Lombrozo, Griffiths y Xu, “Sources of Developmental Change in the Efficiency of Information Search”, Developmental Psychology, 52(12), 2016, páginas 2159 a 2173.
- Min, Michael, Hajishirzi y Zettlemoyer, “AmbigQA: Answering Ambiguous Open-domain Questions”, Proceedings of EMNLP 2020.
- Lee, Sarkar, Tankelevitch, Drosos, Rintel, Banks y Wilson, “The Impact of Generative AI on Critical Thinking: Self-Reported Reductions in Cognitive Effort and Confidence Effects From a Survey of Knowledge Workers”, Proceedings of CHI 2025, Microsoft Research.
Este contenido fue recopilado con el apoyo de la IA tras una investigación exhaustiva, y luego redactado y preparado para su publicación por el equipo editorial de CEOtudent.
This post is also available in:












