Este artículo fue escrito por Sumayyah Tasnim, asesor de políticas de What Works en la Unidad de Implementación del Primer Ministro en la Oficina del Gabinete del Reino Unido.


Comprender si una política funciona es fundamental para garantizar que los programas gubernamentales se beneficien del público. El reciente presupuesto del Reino Unido se comprometió a garantizar que "todos los programas estén respaldados por planes sólidos de implementación y evaluación". ¿Pero por dónde empiezas? ¿Cómo va a evaluar su póliza?

El Equipo What Works ha ideado una serie de preguntas para ayudar a los responsables políticos a identificar métodos potenciales que podrían utilizar para evaluar su política. Hágase estas preguntas cuando comience a desarrollar una política. Esto ayudará a asegurarse de que su póliza esté configurada de una manera que permita una evaluación efectiva.

Descargo de responsabilidad: esta no es una lista exhaustiva de todos los tipos de métodos (¡sería imposible cubrirlos todos en un solo artículo!). Dicho esto, esperamos que estas preguntas le ayuden a pensar en las diversas formas en que puede averiguar si su póliza funciona.

1. ¿Cómo se ve el éxito o el fracaso?

Antes de pensar en los métodos de evaluación, primero pregúntese: ¿qué pretende lograr su política? ¿Cómo se ve el éxito o el fracaso? ¿En qué contexto estás operando? Intente responder las preguntas en el marco TIDieR .

El siguiente paso es desarrollar una "Teoría del Cambio" para su política o programa para ayudarlo a trazar sus metas y objetivos y cómo su política o programa debería ayudar a lograrlos. Este proceso lo alienta a pensar en todas las demás cosas que podrían influir en el éxito de su política y puede ayudarlo a identificar lo que necesita medir para comprender si su política ha funcionado, por qué / por qué no, para quién y en qué condiciones. Echa un vistazo a la multitud de recursos en línea acerca de cómo desarrollar una teoría de cambio por ejemplo, aquí , aquí y aquí .

2. ¿Podría probar la política antes de comenzar a entregar a gran escala?

Un ensayo sólido a pequeña escala puede ser una forma rentable de averiguar si una intervención debe implementarse a escala. Los ensayos controlados aleatorios (ECA) implican la asignación aleatoria de participantes a un grupo de tratamiento que recibe una intervención o un grupo de control que no la recibe. La diferencia en los resultados de ambos grupos se mide y analiza luego de un período de tiempo para determinar la efectividad de la intervención. Los ECA bien diseñados suelen ser la forma más precisa de determinar si una intervención está funcionando.

Caso de ejemplo: The Family Nurse Partnership

Lea más sobre el desarrollo de políticas públicas con RCT en Test, Learn, Adapt y consulte esta publicación de blog de la Education Endowment Foundation sobre los pros y los contras de RCT, además de algunos de los mejores consejos.

3. ¿Podría probar una serie de variaciones de la política para comprender el enfoque más eficaz?

En lugar de poner todos los huevos en una canasta, ¿por qué no diseñar una política con una variación incorporada para probar qué versión es más efectiva?

Los RCT de múltiples armados prueban simultáneamente más de una variación de una política. En este enfoque, los participantes se asignan al azar para recibir una de las variantes. Esto permite una comparación de todas las diferentes variantes y le ayuda a establecer cuál funciona o funciona mejor. Uno de los mayores beneficios de un RCT de múltiples brazos es que no necesita incluir un grupo de control, por lo que es una gran solución si no es posible denegar o retrasar la implementación de la política a los participantes elegibles.

Caso de ejemplo: Prueba de intervenciones de bajo costo para mejorar la seguridad vial

4. ¿Podría escalonar la implementación del programa para ayudarlo a comprender su impacto?

Los recursos limitados o la logística simple pueden significar que la entrega de un programa debe ser escalonada usando una lista de espera o implementación por etapas . Esto ofrece la oportunidad de utilizar un diseño de cuña escalonada o un diseño de lista de espera que permite que aquellos que aún no han recibido una intervención se utilicen como grupo de control temporal.

Es posible estimar el impacto al (1) comparar los resultados de los grupos de tratamiento y de control durante el período de tiempo antes de que el grupo de control reciba la intervención, o (2) comparar los resultados entre los grupos que han estado expuestos a la intervención durante períodos de tiempo variables . Si bien el orden en el que los participantes reciben la intervención se puede asignar al azar, este método se usa a menudo cuando no es posible la asignación al azar.

Caso de ejemplo: evaluación del papel de la formación lingüística en la integración

5. ¿Puede extraer datos existentes o explotar la variación natural para comprender el impacto del programa ?

Si ya se dispone de datos administrativos de buena calidad, es posible construir grupos de control basados en características demográficas observables (por ejemplo, género, edad, ocupación). El objetivo es construir un grupo de control (o de comparación "emparejado") que al comienzo de un programa se parezca lo más posible al grupo de intervención. Luego, se hace un seguimiento de los resultados de ambos grupos y se comparan para estimar la efectividad de la intervención.

Sin embargo, el emparejamiento puede volverse impráctico rápidamente cuando se requiere que los equipos de evaluación coincidan con un número elevado de características (por ejemplo, perfil delictivo, edad, género, etnia, origen socioeconómico, situación laboral y zona de residencia).

La coincidencia de puntuación de propensión (PSM) proporciona una solución en esta situación. La técnica implica la construcción de un modelo que predice la probabilidad de que un individuo esté expuesto a una intervención en función de sus características observables. Los “puntajes de propensión” generados a través de este proceso se utilizan para crear grupos de comparación que permiten analizar el efecto de la intervención. Esto sucede al emparejar a los beneficiarios y no beneficiarios de la intervención que tienen puntajes similares y comparar sus resultados. Para obtener una gran explicación sobre la comparación de datos y PSM que usamos regularmente, consulte esta guía del Gobierno de Canadá.

Caso de ejemplo: evaluación del apoyo a familias con problemas

Si existen datos de tendencias históricas, podría ser posible utilizar el enfoque de diferencias en diferencias . Esto implica comparar los resultados entre un grupo de tratamiento y un grupo de control que históricamente han seguido la misma tendencia en los resultados de interés (por ejemplo, dos países cuyos resultados de exámenes han permanecido paralelos a lo largo del tiempo). Si los resultados para los dos grupos difieren después de una intervención (por ejemplo, la abolición de las tablas de clasificación de las escuelas), el cambio en el tamaño de la diferencia se puede utilizar para estimar el efecto de la intervención (por lo tanto, "diferencia en la diferencia").

Caso de ejemplo: usar diferencias en diferencias para evaluar el impacto de la publicación de tablas de clasificación de escuelas

Si el programa tiene un umbral de elegibilidad cuantificable (por ejemplo, 18 años o nivel de ingresos <£ 50,000), entonces el diseño de regresión discontinua es una buena opción de evaluación. En realidad, el grupo que queda fuera del límite es muy similar al grupo que acaba de calificar. Es probable que cualquier diferencia se deba al azar, por lo que las diferencias en los resultados entre los dos grupos pueden atribuirse al programa.

Caso de ejemplo: el impacto de los préstamos personales

6. ¿Tiene la capacidad para realizar ensayos y realizar evaluaciones? ¿Necesitas ayuda?

Una vez que haya pensado en las posibles formas en que puede evaluar, deberá pensar en los detalles de cómo diseñar y llevar a cabo la evaluación. Considere buscar ayuda de analistas dentro de su departamento. O podría considerar encargar una evaluación a un proveedor experto. Para aquellos en la administración pública del Reino Unido, hay recursos adicionales disponibles para ayudar, por ejemplo:

Si desea obtener más información sobre los métodos mencionados en este blog, consulte las siguientes guías útiles:

  • HM Treasury, UK Government - Magenta Book - Orientación oficial del gobierno del Reino Unido sobre el diseño de una evaluación
  • Unidad de Impacto e Innovación, Gobierno de Canadá - Midiendo el impacto por diseño (2019 )
  • Alliance for Useful Evidence, The Experimenter's Inventory (2020 ): una guía sin jerga sobre métodos experimentales con consejos sencillos sobre los pros y los contras de diferentes métodos.

- Sumayyah Tasnim

(Crédito de la imagen: Unsplash)


Asegúrate de compartir tus propias ideas con el autor dejando un comentario abajo