# A tibble: 2 × 4
treatment mean std n
<dbl> <dbl> <dbl> <int>
1 0 3.45 1.99 2266
2 1 3.49 2.04 2199
Tarea 2
Preguntas
Fecha de entrega: martes 6 de octubre a las 20:00 en Teams
La tarea deberá entregarse en Teams. Deberá incluir dos documentos:
Un primer documento donde se incluyan las respuestas a las preguntas teóricas y conceptuales. Este documento debe estar en formato pdf y debe ser generado usando un software de procesamiento de textos científicos, por ejemplo, usando los leguajes LaTeX o Markdown. En este documento también se deben incluir las conclusiones que se desprenden de las secciones prácticas. Por ejemplo, si una pregunta pide obtener la media de la variable x en cierta base de datos, entonces el documento de respuestas debe incluir la respuesta correspondiente: “la media de la variable x es 32.6”. En este documento también deberán incluirse las tablas y gráficas que se requieran para el análisis.
Un segundo archivo deberá contener el código replicable usado para generar los resultados de la sección práctica, incluyendo las tablas y gráficas. Los archivos de código se verificarán para comprobar su replicabilidad de manera aleatoria.
Datos
Pregunta 1
En Crépon et al. (2015)1 se estudia una intervención en Marruecos en la que se analiza el efecto de la adopción de microfinanzas, a través de un experimento de campo. En 81 de 162 localidades estudiadas se introdujo aleatoriamente una empresa de microfinanzas. Para seleccionar las localidades de tratamiento, primero se emparejaron localidades de acuerdo a características observables y, para cada pareja se asignó una a tratamiento y otra a control. La variable que identifica a las parejas es paire. La base de datos crepon_morocco_balance.csv contiene los datos de este estudio usados para mostrar la integridad del diseño. La variable treatment es la variable de asignación aleatoria, mientras que la variable client es la variable de adopción.
[3 puntos] Primero recordaremos cómo mostrar que el tratamiento efectivamente fue asignado de manera aleatoria. El siguiente código lee los datos que debemos usar y se queda con las observaciones de la línea base. Con estos datos, mostraremos que la variable nadults_resid_bl, que indica el número de personas adultas que viven en cada hogar, está balanceado entre los grupos asignados a tratamiento y control. Noten que la media del número de personas adultas que viven en el hogar en el grupo de control es 3.45 (d.e. 1.99) y que hay 2,266 hogares en dicho grupo de control. Esto es exactamente lo que se reporta en la fila correspondiente a Number members en la tabla 1 del artículo.
Obtenga ahora el valor de la diferencia entre el grupo de tratamiento y el de control, así como su valor \(p\) (últimas dos columnas). Para ello, estime una regresión en la que la variable dependiente sea número de personas adultas que vive en el hogar nadults_resid_bl, en función de la variable de asignación treatment y variables dummy de pareja de localidad (la variable paire indica cuáles son las parejas). La regresión permite recuperar la diferencia de 0.03 personas adultas que se reporta en la fila correspondiente en la tabla 1. Para recuperar el valor \(p\), estime errores agrupados usando la variable demi_paire, que es la clave de las distintas localidades, como variable de agrupación. Una forma de realizar esto es con la función coef_test del paquete clubSandwich.2
[2 puntos] Ahora mostremos que efectivamente este es un ejemplo de una intervención con cumplimiento imperfecto. Genere un cuadro que indique: 1) cuántas personas que fueron asignadas a recibir el tratamiento efectivamente fueron clientes; 2) cuántas personas que fueron asignadas a recibir el tratamiento no se convirtieron en clientes; 3) cuántas personas que no fueron asignadas a recibir el tratamiento sí se convirtieron en clientes; y 4) cuántas personas que no fueron asignadas a recibir el tratamiento tampoco se convirtieron en clientes.
[5 puntos] Ahora mostraremos que la adopción, es decir, convertirse en cliente, no es independiente de las características de los hogares. Considere las variables act_business_bl (indicadora de si el hogar tiene un negocio activo) y consumption_bl (consumo del hogar). Para cada una de estas dos variables, utilice la misma especificación que en la parte a., pero ahora usando la variable client como regresor. ¿Qué concluye?
[5 puntos] Con estos elementos estamos convencidos de que es necesario emplear lo que sabemos sobre cumplimiento imperfecto. Usaremos ahora los datos en crepon_morocco_analysis.csv, que contiene los datos empleados para evaluar el impacto de la adopción. Estos datos están listos para analizarse. Estime la forma reducida del efecto de ser asignado al tratamiento sobre el valor total de los activos del hogar, assets_total. Comente los resultados, en particular, comente sobre la magnitud y la significancia estadística de la variable treatment. Aquí y en adelante, incluya los siguientes controles en la regresión: members_resid_bl, nadults_resid_bl, head_age_bl, act_livestock_bl, act_business_bl, borrowed_total_bl, members_resid_d_bl, nadults_resid_d_bl, head_age_d_bl, act_livestock_d_bl, act_business_d_bl, borrowed_total_d_bl, ccm_resp_activ, other_resp_activ, ccm_resp_activ_d y other_resp_activ_d. Además, incluya efectos fijos por pareja introduciendo la variable paire como factor. Use los mismos errores estándar que en la parte a. Con esto deberá poder recuperar el coeficiente y el error estándar de la columna (3) de la tabla 3.
[5 puntos] Estime ahora la primera etapa, es decir, estime por MCO el efecto causal de la asignación sobre la adopción. Comente sobre la magnitud, la significancia estadística y la interpretación de la variable treatment en términos del comportamiento de los cumplidores. Debería poder replicar el coeficiente y el error estándar de la columna 1 en la tabla 2 del artículo.
[5 puntos] Considere la columna 1 del panel A en la Tabla 9 del artículo. Aquí se reporta la estimación por MCO de la relación entre client y el valor de los activos, con los mismos controles y tipo de errores que antes. Replique este resultado. ¿Se puede interpretar de forma causal el coeficiente sobre client?
[5 puntos] ¿Cuáles son los dos supuestos econométricos que permiten la estimación del Local Average Treatment Effect (LATE) en el contexto de este problema? Comente sobre la evidencia que respalda el supuesto de que los instrumentos no son débiles en este problema.
[5 puntos] Estime el efecto del cumplimiento sobre el valor de los activos, usando la asignación aleatoria como instrumento del cumplimiento. Es decir, estime el LATE. Use los mismos controles y tipo de errores que en c. Este resultado se reporta en la columna 1 del panel B en la Tabla 9. ¿Cuál es la interpretación del coeficiente de la variable client? En R, la función ivreg del paquete AER le permite hacer la estimación de MC2E.
Pregunta 2
Sea una variable de resultados \(y_i\), una variable de asignación aleatoria \(Z_i\) y una variable de adopción \(D_i\). El estimador de Wald se define como:
\[\hat{\beta}_{Wald}=\frac{\bar{Y}_{Z_i=1}-\bar{Y}_{Z_i=0}}{\bar{D}_{Z_i=1}-\bar{D}_{Z_i=0}}\]
En esta pregunta mostraremos cómo el estimador de Wald es equivalente al estimador de VI cuando no hay controles. Use nuevamente los datos en crepon_morocco_analysis.csv.
[10 puntos] Obtenga el estimador de Wald como el cociente de la diferencia en el valor de los activos entre los hogares asignados a tratamiento y control dividido por la diferencia en la probabilidad de adopción entre los hogares asignados a tratamiento y control. Recuerde que el valor de los activos es assets_total.
[5 puntos] Ahora estime por MC2E el efecto de la adopción sobre el valor de los activos, usando la variable de asignación como instrumento para la adopción. Use ivreg para estimar el efecto directamente. ¿Qué ventaja observa con respecto al estimador de Wald?
[10 puntos] Ahora estime por MC2E el efecto de la adopción sobre el valor de los activos, usando la variable de asignación como instrumento para la adopción. A diferencia del punto previo, realice la estimación a mano, es decir, primero estime los valores ajustados de la variable endógena en una primera etapa y luego use estos valores ajustados en la estimación estructural. ¿Qué desventaja observa con respecto a la estimación del punto previo?
Pregunta 3
En la Pregunta 2, parte a, obtuvo el estimador de Wald para aproximar el efecto de la adopción en el valor de los activos como un cociente de dos diferencias de medias.
[5 puntos] Utilice un procedimiento bootstrap a mano para estimar el error estándar del estimador de Wald usando 50 repeticiones. Es decir, debe realizar un remuestreo de los datos originales y para cada muestra obtener el estimador de Wald. Luego, obtenga la desviación estándar de los 50 estadísticos calculados. Utilice una semilla para poder replicar sus resultados.
[5 puntos] Reemplace la semilla de la parte a. por una nueva semilla y estime nuevamente el error estándar del estimador de Wald con 50 repeticiones. Comente sobre la diferencia entre este error estándar y el de la parte a.
[5 puntos] Regrese el valor de la semilla al usado en a. y estime nuevamente el error estándar del estimador de Wald, esta vez usando 1,000 repeticiones. Comente sobre la diferencia entre este error estándar y el de la parte a.
Pregunta 4
En esta pregunta pondremos en práctica lo aprendido sobre múltiples hipótesis. En el archivo datos_indices.csv se presentan los datos de una intervención a 2,457 individuos. La intervención asignó a un tercio de los individuos a ser tratados y se busca estimar el efecto causal sobre 49 variables que miden distintas dimensiones de bienestar. Estas variables pueden agruparse en seis familias. Se recolectaron además cinco características de línea base que funcionan como controles para la estimación de los efectos causales. En el estudio se trabaja con \(\alpha=0.05\).
[5 puntos] Para cada variable, estime el impacto del tratamiento con una regresión del tipo:
\[y_{ij}^k=\beta_{j}^k+\beta_{1j}^k T_i + B_{k}X_i + \varepsilon_{ij}^k\] donde \(j\) indexa a las \(1,...,J\) variables de la familia \(k\).
Genere un cuadro de resumen donde indique qué hipótesis nulas se rechazan en este estudio si se ignora el problema de las hipótesis múltiples.
[5 puntos] Realice la corrección propuesta por Bonferroni. De nuevo, genere un cuadro de resumen donde indique qué hipótesis nulas se rechazan en este estudio si se realiza este procedimiento.
[5 puntos] Realice la corrección propuesta por Benjamini y Hochberg. De nuevo, genere un cuadro de resumen donde indique qué hipótesis nulas se rechazan en este estudio si se realiza este procedimiento.
[5 puntos] Considere la variable variedad_dieta. Estandarice dicha variable para obtener su versión \(z\)-score. Luego, estime:
\[z_{ij}^k=\beta_{j}'^k+\beta_{1j}'^k T_i + B_{k}'X_i + \varepsilon_{ij}'^k\] ¿Cómo se interpreta \(\hat{\beta}_{1j}'^k\)? ¿Cómo se compara su conclusión con la que se obtiene en la parte a.?
[5 puntos] Construya ahora el índice de Kling, Liebman y Katz, \(z_i\), para cada una de las seis familias. Luego estime el efecto causal para cada una de ellas:
\[z_{i}^k=\tau_0^k+\tau_1^k T_i + \Omega^k X_i + \nu_i^k\] Genere un cuadro de resumen donde muestre el efecto causal para cada uno de los índices de las seis familias. ¿Qué se concluye para cada una?
Notas
Crépon, B., Devoto, F., Duflo, E., & Parienté, W. (2015). Estimating the impact of microcredit on those who take it up: Evidence from a randomized experiment in Morocco. American Economic Journal: Applied Economics, 7(1), 123-50.↩︎
Por ejemplo, suponga que estima un modelo al que llame modelo1. Entonces, si ejecuta
coef_test(modelo1, vcov="CR1S", cluster=mis_datos$demi_paire)[1:2,]obtendrá los coeficientes con los errores agrupados requeridos. La opción CR1S toma en cuenta el número de grupos o clusters para realizar inferencia. Puede leer más al respecto en la ayuda al ejecutar ?vcovCR. Este es el tipo de ajuste de muestras finitas que usan los autores. Esta corrección consiste en multiplicar la matriz de sándwich agrupada CR0 por \(\frac{G(N-1)}{(G-1)(N-p)}\), donde \(G\) es el número de grupos, \(N\) es el número total de observaciones y \(p\) es el número de regresores.↩︎