
¿Qué ocurre cuando un programa que “no funciona” en promedio produce, sin embargo, resultados muy diferentes para distintos grupos? El Causal Machine Learning abre una posibilidad particularmente sugerente para la evaluación: pasar de preguntarnos simplemente “¿funciona?” a preguntarnos “¿qué funciona, para quién y bajo qué condiciones?”.
Durante décadas, una de las preguntas centrales de la evaluación de impacto ha sido aparentemente sencilla:¿funciona el programa?
Detrás de ella existe una sofisticada arquitectura metodológica. Ensayos controlados aleatorios, regresiones discontinuas, diferencias en diferencias y otros diseños intentan identificar de manera creíble qué cambios pueden atribuirse a una intervención.
Pero existe un problema menos visible: frecuentemente terminamos resumiendo toda esa complejidad mediante un efecto promedio.
Y los promedios pueden ocultar historias muy diferentes.
Imaginemos un programa social cuyo impacto medio sea prácticamente cero. Podríamos concluir que “el programa no funciona”. Sin embargo, detrás de ese cero podrían coexistir efectos positivos importantes para algunos grupos, efectos pequeños para otros y efectos negativos para otros.
El promedio puede ser correcto. Pero puede no ser suficiente para tomar una buena decisión.
Del “¿funciona?” al “¿para quién funciona?”
Aquí aparece una de las conexiones más interesantes entre evaluación e inteligencia artificial: el Causal Machine Learning (CML).
El problema de partida es muy concreto. Los gobiernos pueden disponer de evidencia sobre si determinados programas funcionan en promedio y, sin embargo, saber mucho menos sobre qué funciona, para quién, bajo qué condiciones y a qué coste (UNICEF, 2026: p. 1).
El Causal Machine Learning intenta profundizar precisamente en esa heterogeneidad.
La pregunta:
¿Funciona este programa?
Sigue leyendo