
¿Qué ocurre cuando un programa que “no funciona” en promedio produce, sin embargo, resultados muy diferentes para distintos grupos? El Causal Machine Learning abre una posibilidad particularmente sugerente para la evaluación: pasar de preguntarnos simplemente “¿funciona?” a preguntarnos “¿qué funciona, para quién y bajo qué condiciones?”.
Durante décadas, una de las preguntas centrales de la evaluación de impacto ha sido aparentemente sencilla:¿funciona el programa?
Detrás de ella existe una sofisticada arquitectura metodológica. Ensayos controlados aleatorios, regresiones discontinuas, diferencias en diferencias y otros diseños intentan identificar de manera creíble qué cambios pueden atribuirse a una intervención.
Pero existe un problema menos visible: frecuentemente terminamos resumiendo toda esa complejidad mediante un efecto promedio.
Y los promedios pueden ocultar historias muy diferentes.
Imaginemos un programa social cuyo impacto medio sea prácticamente cero. Podríamos concluir que “el programa no funciona”. Sin embargo, detrás de ese cero podrían coexistir efectos positivos importantes para algunos grupos, efectos pequeños para otros y efectos negativos para otros.
El promedio puede ser correcto. Pero puede no ser suficiente para tomar una buena decisión.
Del “¿funciona?” al “¿para quién funciona?”
Aquí aparece una de las conexiones más interesantes entre evaluación e inteligencia artificial: el Causal Machine Learning (CML).
El problema de partida es muy concreto. Los gobiernos pueden disponer de evidencia sobre si determinados programas funcionan en promedio y, sin embargo, saber mucho menos sobre qué funciona, para quién, bajo qué condiciones y a qué coste (UNICEF, 2026: p. 1).
El Causal Machine Learning intenta profundizar precisamente en esa heterogeneidad.
La pregunta:
¿Funciona este programa?
empieza a transformarse en:
¿Para quién funciona, para quién funciona menos y bajo qué circunstancias?
La diferencia parece pequeña, pero sus implicaciones para la política pública son enormes.
Si un programa tiene poco efecto en promedio, una interpretación podría ser cuestionar su continuidad. Pero si descubrimos que funciona especialmente bien para determinados grupos, aparece una conversación completamente distinta:
¿Podemos focalizarlo mejor? ¿Podemos rediseñarlo? ¿Podemos utilizar mejor los recursos disponibles?
La evaluación empieza así a acercarse no solamente a la medición del impacto, sino también a la optimización de las políticas públicas.
De evaluar programas a mejorar decisiones
Esta es precisamente la lógica de una iniciativa que UNICEF está impulsando a partir de una experiencia previa en Kazajistán. Su propósito es fortalecer la capacidad de los gobiernos para aplicar inteligencia artificial y Causal Machine Learning a la mejora del diseño, focalización y optimización de políticas relacionadas con la infancia (UNICEF, 2026: p. 1).
Hay un matiz especialmente importante: el énfasis está puesto en el desarrollo de capacidades liderado por los propios gobiernos, no en realizar externamente el análisis. Los equipos gubernamentales identificarían preguntas de política pública, analizarían la disponibilidad de datos, recibirían formación, desarrollarían modelos piloto y traducirían los resultados en conocimiento relevante para sus decisiones (UNICEF, 2026: p. 1).
Esto transforma también nuestra manera de entender la evaluación.
El objetivo final no sería producir un modelo técnicamente sofisticado, sino conseguir que la evidencia permita mejorar una decisión real.
Pero la IA no fabrica causalidad
Aquí necesitamos una cautela fundamental.
Añadir machine learning a una gran base de datos no convierte automáticamente correlaciones en relaciones causales.
El potencial de estas metodologías para investigar heterogeneidad no elimina los requisitos tradicionales de la inferencia causal. Tampoco todos los programas son automáticamente susceptibles de este tipo de análisis. La propia metodología de selección de la iniciativa examina cómo se asigna la intervención y si existe variación en la probabilidad de recibirla (UNICEF, 2026: p. 1).
Y los datos son fundamentales.
Antes de plantearnos algoritmos sofisticados necesitamos saber si disponemos de información sobre el resultado que queremos explicar, la intervención que estamos evaluando y las características que permitirían investigar diferencias relevantes entre grupos (UNICEF, 2026: p. 2).
En otras palabras:
Sin una buena pregunta, un diseño creíble y datos adecuados, una mayor sofisticación algorítmica no garantiza una mejor evaluación.
Tal vez el algoritmo no sea lo más importante
Paradójicamente, cuanto más sofisticadas se vuelven nuestras herramientas, más importantes parecen las preguntas básicas:
¿Qué decisión queremos mejorar?
¿Para quién funciona el programa?
¿Qué datos tenemos para saberlo?
¿Tiene el gobierno capacidad para interpretar y utilizar los resultados?
¿Cómo integramos equidad, derechos de la infancia, transparencia, gobernanza de datos y salvaguardas éticas?
Estos últimos elementos forman explícitamente parte de la ambición de la iniciativa (UNICEF, 2026: p. 1).
Quizás ahí se encuentre lo verdaderamente transformador del Causal Machine Learning para la evaluación.
No en sustituir al evaluador por un algoritmo, ni simplemente en producir análisis más complejos, sino en ayudarnos a avanzar hacia una pregunta potencialmente mucho más poderosa:
No solamente si una política funciona, sino qué funciona, para quién, bajo qué condiciones y qué podemos aprender de ello para hacerla mejor.
Referencias
Komura, T., Bargagli-Stoffi, F. J., Arah, O. A., & Inoue, K. (2026). Estimating and discovering heterogeneous treatment effects using machine learning in epidemiological studies: A practical guide. International Journal of Epidemiology, 55(3), dyag092.
Miratrix, L., Polskaia, P., Dorsett, R., Zhu, P., Commins, N., & Selby, J. D. (2025). Comparing Machine Learning Methods for Estimating Heterogeneous Treatment Effects in Randomized Trials: A Comprehensive Simulation Study. EdWorkingPaper 25-1276. Annenberg Institute at Brown University. [edworkingpapers.com]
OECD. (2026). AI in Government: Policy Evaluation. OECD.AI.
Pryce, M., Diaz-Ordaz, K., Keogh, R. H., & Vansteelandt, S. (2025). Causal machine learning for heterogeneous treatment effects in the presence of missing outcome data. Biometrics, 81(3), ujaf098. [academic.oup.com]
Rehill, P., & Biddle, N. (2024). Transparency challenges in policy evaluation with causal machine learning: Improving usability and accountability. Data & Policy, 6, e43. [cambridge.org]
UNICEF. (2026). First Cohort for AI in Impact Evaluation Initiative: Screening Criteria. Center for AI, Children and Public Policy. Documento interno.