En resumen. La mayoría de los consejos sobre pensamiento de futuro se venden por su verosimilitud y no por su acierto medido, y ambas cosas se correlacionan mal. Trabajando solo con resultados publicados que pudimos abrir y recalcular, destacan cuatro hallazgos. Primero, la intervención con mayor efecto medido sobre el acierto individual no es una técnica: es la selección por historial. Vale una reducción del error del 73,1 % en la condición publicada más fuerte, y del 20 al 23 % en un estudio distinto de 2024. Segundo, la mejor técnica cambia con el momento: en la primera semana de una pregunta, la formación en probabilidad superó a la discusión de grupo; para la última semana, la discusión era una palanca 4,5 veces más fuerte. Tercero, la formación en escenarios, la familia a la que pertenece la mayor parte del trabajo prospectivo corporativo, produjo exactamente un 0,0 % de mejora para individuos en el periodo intermedio y empeoró un 9,1 % las predicciones de equipo en la última semana. Cuarto, y lo más incómodo, un reanálisis publicado en 2025 en la misma revista halló que, una vez modelada la varianza de método no controlada, los efectos de formación y de equipo quedaban sustancialmente reducidos, eliminados o, en un caso, invertidos. Lo que queda es una lista corta, y no es la lista que vende la industria de la prospectiva.
Por qué esta pregunta tiene respuesta
El trabajo de futuros tiene un problema de medición que rara vez admite. La mayoría de las técnicas se evalúan según si los participantes encontraron valioso el taller, no según si las predicciones resultantes se acercaron a lo que ocurrió. Son preguntas distintas y pueden tener respuestas opuestas.
Hay una gran excepción. Entre 2011 y 2015, la Intelligence Advanced Research Projects Activity organizó el torneo Aggregative Contingent Estimation, en el que grupos de investigación rivales reclutaron a miles de voluntarios corrientes, los asignaron al azar a condiciones y puntuaron cada predicción frente a resultados geopolíticos reales con una regla de puntuación propia. Ese diseño es lo que hace posible una clasificación: las técnicas no se compararon por satisfacción, sino por error.
Los resultados los publicaron Mellers y sus colegas en Psychological Science en 2014, y los reanalizaron Hauenstein y sus colegas en la misma revista en 2025. Todo lo que sigue se apoya en esos dos artículos más otros tres cuerpos de evidencia publicada. Si llevas registro de tus propias decisiones, esto encaja directamente con el protocolo del diario de decisiones y con pensar en apuestas.
La evidencia en bruto
Las puntuaciones de Brier miden el acierto de las predicciones probabilísticas. Menos es mejor. Quien dice 90 % y acierta obtiene 0,02 en la escala usada en el artículo; quien dice 90 % y falla obtiene 1,62.
Datos verificados. Puntuación de Brier media por condición y por periodo de la vida de una pregunta (Mellers et al., Psychological Science, 2014, tabla 1). Solo se incluyen preguntas abiertas al menos un mes.
| Condición | Primera semana | 2 semanas centrales | Última semana |
|---|---|---|---|
| Año 1 | |||
| Individual, sin formación | 0,44 | 0,40 | 0,31 |
| Individual, formación en escenarios | 0,41 | 0,40 | 0,29 |
| Individual, formación en probabilidad | 0,40 | 0,36 | 0,29 |
| Creencia de la multitud, sin formación | 0,42 | 0,39 | 0,30 |
| Creencia de la multitud, formación en probabilidad | 0,36 | 0,34 | 0,23 |
| Equipo, sin formación | 0,42 | 0,33 | 0,22 |
| Equipo, formación en escenarios | 0,36 | 0,33 | 0,24 |
| Equipo, formación en probabilidad | 0,35 | 0,30 | 0,19 |
| Año 2 | |||
| Individual, sin formación | 0,46 | 0,39 | 0,26 |
| Individual, formación en probabilidad | 0,42 | 0,36 | 0,24 |
| Equipo, sin formación | 0,38 | 0,32 | 0,16 |
| Equipo, formación en probabilidad | 0,40 | 0,28 | 0,16 |
| Superpronosticadores | 0,25 | 0,19 | 0,07 |
El artículo informa de que tanto la formación como el trabajo en equipo resultaron beneficiosos en los tres periodos. Es cierto y es lo menos interesante de la tabla. Convierte cada celda en un porcentaje de mejora frente al individuo sin formación del mismo periodo y aparece un patrón que el artículo nunca enuncia en cifras.
Hallazgo original 1: la mejor palanca cambia con el momento
Marco editorial de CEOtudent: el giro temporal. Reducción porcentual de la puntuación de Brier frente al individuo sin formación del mismo periodo, calculada a partir de las filas del Año 1.
| Periodo | Solo formación en probabilidad | Solo discusión de equipo | Ambas juntas | Discusión dividida por formación |
|---|---|---|---|---|
| Primera semana | 9,1 % mejor | 4,5 % mejor | 20,5 % mejor | 0,50x |
| 2 semanas centrales | 10,0 % mejor | 17,5 % mejor | 25,0 % mejor | 1,75x |
| Última semana | 6,5 % mejor | 29,0 % mejor | 38,7 % mejor | 4,50x |
En la primera semana de una pregunta, la formación era el doble de palanca que la discusión. Para la última semana la relación se había invertido casi nueve veces en términos relativos: la discusión valía 4,5 veces lo que valía la formación.
El mecanismo resulta intuitivo con los números delante. Al principio nadie tiene información, así que la única ventaja disponible es la disciplina de razonamiento: clases de referencia, tasas base, promediar las propias estimaciones. Más tarde la información existe en el mundo y la ventaja es el acceso a ella, que es lo que aporta un grupo. El artículo señala que el mayor acierto en equipos provenía de los miembros que reunían y compartían información, y que el número de comentarios publicados por una persona correlacionaba con su acierto, r = -0,19 en el Año 1 y -0,22 en el Año 2, donde negativo significa mejor.
La instrucción práctica para una persona no es, por tanto, “usa la técnica X”. Es: cuando una pregunta es reciente, trabaja tu razonamiento; cuando madura, trabaja tus entradas. La mayoría hace lo contrario, piensa con más intensidad al principio y calla según se acerca el plazo.
Hallazgo original 2: la formación en escenarios es la palanca más débil medida
En este torneo, la formación en escenarios enseñaba a generar futuros nuevos, a considerar activamente más posibilidades, a usar árboles de decisión y a evitar sobrestimar el cambio. Es una descripción reconocible de lo que hace la mayor parte del trabajo prospectivo corporativo. Se asignó al azar y se puntuó por separado, lo que la convierte en la comparación directa publicada más limpia entre formación prospectiva basada en escenarios y basada en probabilidad.
Marco editorial de CEOtudent: formación en escenarios frente a formación en probabilidad. Reducción porcentual de la puntuación de Brier frente a la condición sin formación del mismo tipo de pronosticador, Año 1.
| Periodo | Individuos: escenarios | Individuos: probabilidad | Dentro de equipos: escenarios | Dentro de equipos: probabilidad |
|---|---|---|---|---|
| Primera semana | 6,8 % mejor | 9,1 % mejor | 14,3 % mejor | 16,7 % mejor |
| 2 semanas centrales | 0,0 % (sin cambio) | 10,0 % mejor | 0,0 % (sin cambio) | 9,1 % mejor |
| Última semana | 6,5 % mejor | 6,5 % mejor | 9,1 % peor | 13,6 % mejor |
La formación en escenarios perdió frente a la formación en probabilidad en cinco de las seis comparaciones y empató en la sexta. En el periodo intermedio no produjo ninguna mejora medible, ni para individuos ni dentro de equipos. En la última semana dentro de equipos fue activamente peor que no dar formación alguna al equipo, moviendo la puntuación de Brier de 0,22 a 0,24.
El artículo original recoge la prueba de significación tras la comparación individual: la formación en probabilidad fue más eficaz que la de escenarios, t(1053) = 2,23, p = 0,026, y la formación en escenarios a su vez superó a la ausencia de formación, t(1056) = 3,25, p < 0,001. Así que la formación en escenarios no carece de valor. Simplemente es la más débil de las dos, y su ventaja desaparece justo en las condiciones en que la mayoría de profesionales la usaría: en grupo y cerca de una decisión.
Una salvedad que la versión honesta de este argumento debe llevar consigo: el acierto no es lo único que la planificación por escenarios dice aportar. Sus practicantes sostienen que mejora la preparación y la conversación organizativa más que las predicciones puntuales. Puede ser cierto, pero es otra afirmación y no es la medida aquí. Si adoptas el trabajo por escenarios, adóptalo para aquello en lo que fue medido, y eso no es el acierto predictivo.
Hallazgo original 3: la selección supera a toda técnica
Vuelve a mirar la fila de superpronosticadores del Año 2, el 2 % con mejor desempeño del Año 1 colocado en equipos de élite. Frente al individuo sin formación del mismo periodo, puntuaron un 45,7 % mejor en la primera semana, un 51,3 % mejor en la central y un 73,1 % mejor en la última. Ninguna condición de formación o de equipo de la tabla se acerca.
No es un resultado aislado. Atanasov y sus colegas, en un trabajo publicado en el International Journal of Forecasting, compararon multitudes de élite pequeñas con multitudes no élite más grandes en dos sistemas de colaboración masiva a lo largo de 136 preguntas.
Datos verificados. Puntuaciones de Brier agregadas por tipo de multitud y sistema de predicción (Atanasov et al., International Journal of Forecasting, 2024).
| Sistema | Multitud no élite | Multitud de élite | Ventaja de la élite |
|---|---|---|---|
| Mercados de predicción | 0,215 | 0,173 | 20 % |
| Encuestas de predicción | 0,203 | 0,156 | 23 % |
Recalcular esos porcentajes a partir de las medias subyacentes da 19,5 % y 23,2 %, coherente con las cifras redondeadas del artículo. En un modelo de efectos mixtos, los autores sitúan el efecto de élite en b = -0,045, una mejora de acierto del 21 %, mientras que la elección entre mercado y encuesta no fue significativa, b = -0,015, p = 0,13.
De ahí se siguen dos conclusiones, incómodas de maneras distintas. Para una organización, la inversión prospectiva de mayor retorno no es comprar una metodología; es encontrar al puñado de personas con historial y preguntarles. Para un individuo no hay atajo hacia ese grupo salvo el lento: predecir, registrar, puntuar, repetir y averiguar si de verdad eres bueno. Fíjate también en la conducta de los superpronosticadores en el torneo: hicieron una media de 7,8 predicciones por pregunta, frente a 1,4 a 1,6 del resto. Sea lo que sea lo que capturó la selección, capturó a gente que actualiza.
La parte incómoda: la evidencia estrella está en disputa
En enero de 2025, Hauenstein, Thomas, Illingworth y Dougherty publicaron en Psychological Science un reanálisis de exactamente estos datos. Su argumento es metodológico: los pronosticadores elegían qué preguntas responder y cuándo, y esas elecciones no son aleatorias. Alguien en un equipo puede responder preguntas distintas, y más tarde, que alguien que predice en solitario, y esa diferencia por sí sola puede producir una aparente ventaja de acierto que nada tiene que ver con la discusión.
Modelaron la capacidad predictiva latente con teoría de respuesta al ítem incluyendo esas variables extrañas. Los tamaños del efecto se movieron con fuerza.
Marco editorial de CEOtudent: qué ocurre con los efectos cuando se controla la varianza de método. Tamaños del efecto de capacidad predictiva latente, d de Cohen, de Hauenstein et al. (Psychological Science, 2025, tabla 4). M2 es el modelo base; M7 es el modelo completo de varianza de método.
| Conjunto de datos | Factor | d base (M2) | d varianza de método (M7) | Cambio |
|---|---|---|---|---|
| Año 1 | Formación | +0,050 | -0,144 | inversión de signo |
| Año 1 | Trabajo en equipo | +0,766 | -0,285 | inversión de signo, desplazamiento de 1,051 |
| Año 2, sin superpronosticadores | Formación | +0,174 | +0,038 | 78,2 % menor |
| Año 2, sin superpronosticadores | Trabajo en equipo | +0,256 | +0,065 | 74,6 % menor |
| Año 2, con superpronosticadores | Formación | +0,328 | +0,227 | 30,8 % menor |
| Año 2, con superpronosticadores | Trabajo en equipo | +0,390 | +0,247 | 36,7 % menor |
El efecto de equipo del Año 1 es el que conviene dejar reposar. En el modelo base es d = +0,766, un efecto grande y el espinazo empírico de una década de consejos sobre predecir en grupo. Bajo el modelo completo es d = -0,285, apuntando al otro lado, un movimiento total de 1,051 desviaciones estándar.
Para los datos del Año 2 sin superpronosticadores, los autores formulan su conclusión sin rodeos: preguntados si el trabajo en equipo y la formación afectan al acierto predictivo, la respuesta es “no” una vez que los modelos incorporan la selección de ítems y el momento de respuesta. Para el Año 2 informan de que los modelos con mejor ajuste ni siquiera incluyen parámetros que permitan que la habilidad predictiva varíe según equipo y formación.
Conviene mantener dos cosas separadas aquí, porque es fácil excederse en cualquiera de las dos direcciones. Las diferencias brutas de Brier de la tabla 1 son reales; nadie discute que los pronosticadores formados en equipo puntuaron mejor. Lo que está en disputa es la atribución causal: si la formación y el trabajo en equipo produjeron la mejora o simplemente la acompañaron. Y de manera notable, el reanálisis no disolvió la brecha de los superpronosticadores; complicó su interpretación, al mostrar que rasgos asociados a la respuesta estratégica también distinguen a ese grupo del resto.
Para una persona que decide dónde invertir esfuerzo, esto no es motivo de parálisis. Es motivo para ponderar los métodos que aguantan mejor el escrutinio, que es lo que hace la tarjeta de puntuación siguiente.
Dos métodos de fuera del torneo
Proceso de grupo estructurado (Delphi). La revisión de la literatura evaluativa de Rowe y Wright cuenta estudios en lugar de agregar efectos. Informan de que los grupos Delphi superaron a la simple agregación estadística de las mismas personas por 12 estudios frente a 2 con 2 empates, y a las reuniones de grupo tradicionales no estructuradas por 5 frente a 1. Una discrepancia menor que conviene señalar a quien lo cite: el cuerpo del capítulo habla, en las comparaciones con grupos tradicionales, de “cinco estudios frente a uno, con dos empates”, mientras que su propio resumen dice “cinco frente a uno con un empate”. El recuento de votos es además una forma de evidencia más débil que la agregación de tamaños del efecto, así que tómalo como apoyo direccional y no como una magnitud medida. Lo que sí respalda es concreto: la estructura supera a una reunión no estructurada, y estimaciones independientes seguidas de retroalimentación superan a una sola ronda.
Predicción por clase de referencia. El trabajo de Flyvbjerg sobre proyectos de infraestructura documenta el problema de fondo con cifras inusualmente duras: una inexactitud media en las previsiones de coste del 44,7 % en ferrocarril, 33,8 % en puentes y túneles y 20,4 % en carreteras, mientras que las previsiones de demanda de pasajeros ferroviarios se desvían de media un -51,4 % y el 84 % de los proyectos ferroviarios yerra en más de un 20 % en un sentido u otro. El remedio es predecir desde la distribución de proyectos comparables ya terminados en lugar de desde dentro del proyecto actual. La implementación del Departamento de Transporte británico convirtió esa distribución en recargos requeridos: para carreteras, un 15 % si se acepta un 50 % de riesgo de sobrecoste y un 45 % si solo se acepta un 10 %; para ferrocarril, un 40 % y un 68 % respectivamente. La American Planning Association respaldó el método en 2005.
La razón por la que esto pertenece a una clasificación pensada para individuos es que es la única técnica aquí que una sola persona puede ejecutar en una tarde sin grupo, sin programa de formación y sin historial, y ataca el mayor error documentado de toda la literatura.
La tarjeta de puntuación
Marco editorial de CEOtudent: métodos de prospectiva puntuados para uso individual. La fuerza de la evidencia y la robustez son juicios sobre el registro publicado citado en este artículo, no mediciones nuevas. Ejecutable en solitario y coste son valoraciones prácticas.
| Método | Mejor efecto medido | Sobrevive al reanálisis | Ejecutable en solitario | Coste | Veredicto |
|---|---|---|---|---|---|
| Selección por historial | 73,1 % de reducción del error (torneo); 20 a 23 % (multitudes de élite) | La brecha se mantiene; la interpretación se disputa | Solo convirtiéndote en el historial | Alto, se mide en años | Hazlo igualmente. Nada se le acerca. |
| Predicción por clase de referencia | Ataca errores base documentados del 20 al 51 % | No cuestionada en la literatura revisada | Sí, por completo | Bajo, una tarde por decisión | Empieza aquí. El mejor retorno por hora. |
| Formación en probabilidad | 9,1 a 10,0 % al inicio de una pregunta | Muy reducida o invertida al modelar la varianza de método | Sí | Bajo, un módulo llevó unos 45 minutos | Vale por los hábitos, no por la cifra de titular. |
| Proceso de grupo estructurado | Delphi superó a la agregación estadística 12 a 2 con 2 empates | Solo recuento de votos, sin tamaños del efecto agregados | No, requiere tres personas o más | Medio | Úsalo cuando tengas a la gente. |
| Discusión de equipo | 29,0 % al final de una pregunta | Reducida a casi cero, signo invertido en el Año 1 | No | Medio | Úsala para acceder a información, no como técnica. |
| Mercados de predicción | Empatados estadísticamente con las encuestas de equipo | No cuestionados por separado | No, requiere una multitud | Alto | Sin caso de uso individual. |
| Exposición a la creencia de la multitud | 2,5 a 4,5 % solo por ver las cifras ajenas | No modelada por separado | Sí, si existe una predicción pública | Muy bajo | Gratis, pequeño, tómalo. |
| Planificación y formación por escenarios | 0,0 % en el periodo intermedio; 9,1 % peor dentro de equipos | No es la afirmación más fuerte que hace | Sí | Medio a alto | No para el acierto. Adóptala solo para aquello en lo que fue medida. |
Qué hacer en realidad
Una práctica prospectiva personal defendible a partir de esta evidencia tiene cuatro partes y ninguna requiere un taller.
- Construye la clase de referencia antes que la predicción. Sea lo que sea lo que predices, busca los diez a treinta casos terminados más comparables y mira qué les pasó realmente. Esto ataca el mayor error medido de la literatura y no necesita el permiso de nadie.
- Reparte tu esfuerzo por etapa. Al principio de cualquier pregunta abierta, dedica el tiempo a la disciplina de razonamiento: tasas base, múltiples estimaciones independientes, promediar. Después, dedícalo a reunir e intercambiar información. La proporción de palanca medida entre esos dos movimientos pasa de 0,50x a 4,50x a lo largo de la vida de una pregunta.
- Lleva la cuenta, por escrito, con números. Es la única vía hacia el grupo con la mayor ventaja medida. Una predicción sin una probabilidad registrada y una fecha de resolución no se puede puntuar, y un pronosticador sin puntuar no puede mejorar. Actualiza a menudo: los superpronosticadores actualizaron alrededor de cinco veces más que los demás.
- Degrada los ejercicios de escenarios a aquello en lo que midieron bien. Si los usas, úsalos para ampliar el conjunto de posibilidades consideradas, no para afinar una probabilidad. En afinar una probabilidad obtuvieron aquí la peor medición.
Dirige la práctica como una directora general: elige los dos métodos con mejor retorno medido y rechaza el resto, por muy de moda que esté. Aprende como un estudiante: mantén la tarjeta honesta incluso cuando diga que tu técnica favorita no hizo nada, porque todo el valor de esta literatura reside en que estuvo dispuesta a publicar ese resultado sobre sí misma. Dos veces.
Para la pregunta previa de qué merece la pena predecir, véase cómo detectar señales débiles; para cómo se resolvió realmente una década de predicciones expertas seguras, véase el boletín de predicciones.
Preguntas frecuentes
¿El reanálisis de 2025 significa que la formación y los equipos son inútiles?
No, y el artículo no lo afirma. Afirma que las conclusiones causales originales no se sostienen una vez modelados la selección de preguntas y el momento de respuesta. Los pronosticadores formados en equipo siguieron registrando mejores puntuaciones brutas. Lo dudoso es que la formación y el trabajo en equipo lo causaran. En la práctica, eso aconseja ponderar métodos que no se construyeron sobre esa inferencia concreta, y por eso aquí la predicción por clase de referencia queda por encima de la formación en probabilidad.
¿Por qué es tan popular la planificación por escenarios si midió lo peor?
Porque se evalúa por un resultado distinto. El trabajo por escenarios se compra por preparación, alineamiento y calidad de la conversación interna, y puede que los entregue. Este artículo mide solo el acierto predictivo, y en ese resultado fue la palanca más débil de las probadas.
¿La superpredicción es simplemente talento?
La evidencia del torneo apunta más a la conducta que a una capacidad innata: los superpronosticadores hicieron una media de 7,8 predicciones por pregunta frente a 1,4 a 1,6 en otras condiciones, y la identificación misma fue un historial, no una prueba. El reanálisis de 2025 lo complica al mostrar que rasgos de estrategia de respuesta también separan al grupo, así que la respuesta honesta es que puntuar identifica algo real cuya composición no está zanjada.
¿Cuántos casos comparables necesito para una clase de referencia?
La literatura no fija un número, y cualquier cifra que te diéramos sería inventada. Lo que muestra la implementación británica es la forma del requisito: suficientes casos terminados y genuinamente comparables como para ver una distribución en vez de un punto, establecidos estadísticamente como similares en riesgo antes de usarlos.
¿Puedo hacer un proceso Delphi con dos colegas?
El mecanismo central, estimaciones independientes recogidas antes de que nadie oiga a nadie, luego retroalimentación, luego revisión, funciona a pequeña escala y no cuesta casi nada. La base de evidencia compara paneles y no parejas, así que trata una versión de tres personas como una aplicación sensata del principio y no como algo medido.
Fuentes
- Mellers, Ungar, Baron, Ramos, Gurcay, Fincher, Scott, Moore, Atanasov, Swift, Murray, Stone y Tetlock, Psychological Strategies for Winning a Geopolitical Forecasting Tournament, Psychological Science, 2014, volumen 25, número 5, páginas 1106 a 1115. Tabla 1 de puntuaciones de Brier por condición y periodo; las pruebas de significación entre formación en probabilidad y en escenarios; las correlaciones del número de comentarios; las predicciones por pregunta.
- Hauenstein, Thomas, Illingworth y Dougherty, Rethinking the Role of Teams and Training in Geopolitical Forecasting: The Effect of Uncontrolled Method Variance on Statistical Conclusions, Psychological Science, 2025, volumen 36, número 1, páginas 3 a 18. Reanálisis mediante teoría de respuesta al ítem; tabla 4 con tamaños del efecto de capacidad latente para el modelo base y el completo; la conclusión para los datos del Año 2 sin superpronosticadores.
- Atanasov, Witkowski, Mellers y Tetlock, Crowd Prediction Systems: Markets, Polls, and Elite Forecasters, International Journal of Forecasting, 2024. Puntuaciones de Brier agregadas por tipo de multitud y sistema en 136 preguntas; el coeficiente de élite del modelo de efectos mixtos y la comparación no significativa entre mercado y encuesta.
- Rowe y Wright, Expert Opinions in Forecasting: The Role of the Delphi Technique, en Principles of Forecasting, Kluwer Academic Publishers, 2001. Recuentos de Delphi frente a grupos estadísticos y tradicionales, y los principios para conducir un panel Delphi.
- Flyvbjerg, From Nobel Prize to Project Management: Getting Risks Right, Project Management Journal, 2006. Inexactitud media de las previsiones de coste y demanda por tipo de proyecto; los recargos por sesgo de optimismo del Departamento de Transporte británico en los niveles del 50 % y el 80 %; el respaldo de la American Planning Association a la predicción por clase de referencia en 2005.
Este contenido fue recopilado con el apoyo de la IA tras una investigación exhaustiva, y luego redactado y preparado para su publicación por el equipo editorial de CEOtudent.
This post is also available in:












