Tarea 1

Preguntas

Fecha de entrega: lunes 22 de septiembre a las 20:00 en Teams

La tarea deberá entregarse en Teams. Deberá incluir dos documentos:

Un primer documento donde se incluyan las respuestas a las preguntas teóricas y conceptuales. Este documento debe estar en formato pdf y debe ser generado usando un software de procesamiento de textos científicos, por ejemplo, usando los leguajes LaTeX o Markdown. En este documento también se deben incluir las conclusiones que se desprenden de las secciones prácticas. Por ejemplo, si una pregunta pide obtener la media de la variable x en cierta base de datos, entonces el documento de respuestas debe incluir la respuesta correspondiente: “la media de la variable x es 32.6”. En este documento también deberán incluirse las tablas y gráficas que se requieran para el análisis.

Un segundo archivo deberá contener el código replicable usado para generar los resultados de la sección práctica, incluyendo las tablas y gráficas. Los archivos de código se verificarán para comprobar su replicabilidad de manera aleatoria.

Datos

data-salud.csv

merged_all_surveys.dta

Pregunta 1

Los datos en data-salud.csv contienen los registros de 915 pacientes que participaron en un ensayo clínico en el que se trabaja con \(\alpha=0.10\). Se incluye un índice de salud que resume la calidad de la salud de cada paciente (a mayor índice de salud mejor es la salud), así como 10 características observadas de dichas personas. Un cuarto de los pacientes fue asignado aleatoriamente a un tratamiento identificado como D en los datos.

  1. [5 puntos] Para verificar la integridad del diseño, compruebe que cada una de las características observables está balanceada. Para ello, estime una regresión de cada una de las características en función de la variable de tratamiento. Construya una tabla con los coeficientes de interés estimados y el valor \(p\) correspondiente.

  2. [2 puntos] ¿Cuál es la hipótesis nula que se plantea al realizar cada una de las regresiones en la parte a.?

  3. [2 puntos] ¿Qué concluye a partir de las estimaciones de la parte a.?

  4. [5 puntos] Estime ahora una regresión de la variable asignación al tratamiento en función del conjunto de características observables. Luego, realice una prueba \(F\) de significancia conjunta, calculando el estadístico \(F\) y su correspondiente valor \(p\).

  5. [2 puntos] ¿Cuál es la hipótesis nula de la prueba \(F\) que realizó en la parte d.?

  6. [2 puntos] ¿Qué concluye a partir de la prueba \(F\) de la parte d.?

  7. [2 puntos] ¿Qué concluye sobre el balance en la asignación del tratamiento en este experimento? ¿Qué características tendría una diferencia de medias de \(y_i\) después del tratamiento como estimador del impacto de este?

Pregunta 2

Considere nuevamente los datos en data-salud-csv.

  1. [2 puntos] Estime el efecto del tratamiento sobre el índice de salud usando una regresión corta (sin controles).

  2. [3 puntos] Interprete el coeficiente y la significancia estadística del efecto de tratamiento estimado.

  3. [2 puntos] Estime ahora el efecto del tratamiento sobre el índice de salud usando una regresión larga (incluyendo controles).

  4. [3 puntos] Expliqué qué pasa y por qué con el error estándar estimado del efecto de tratamiento con respecto al estimado en la parte a.

Pregunta 3

Un grupo de investigadores está interesado en conocer el impacto de la adopción de herramientas de inteligencia artificial en el empleo en pequeñas y medianas empresas del sector industrial, \(y_i\).

Para responder esta pregunta, los investigadores levantan una encuesta representativa de empresas pequeñas y medianas del sector industrial donde se pregunta sobre el uso de inteligencia artificial en los distintos procesos. Los investigadores construyen un indicador del uso de inteligencia artificial, \(T_i\),además de recolectar información sobre el uso de insumos, ingresos, costos y número de empleados.

  1. [5 puntos] Se propone que, para estimar el efecto causal del uso de inteligencia artificial sobre el empleo, se compare el número de empleados en las empresas que usan dicha tecnología con las que no la utilizan Argumente en términos del sesgo de selección sobre la conveniencia de esta estrategia para estimar el efecto causal de la adopción de herramientas de inteligencia artificial.

  2. [5 puntos] Para implementar la propuesta del punto a., se propone estimar la siguiente regresión: \[ y_i = \alpha + \beta T_i + \varepsilon_i \]

    Muestre si el estimador de MCO de \(\beta\) es consistente o no para el efecto de tratamiento.

Pregunta 4

Replique el ejercicio en MHE que ejemplifica el teorema de la regresión de la FEC. Para esto se recomienda usar la información de la ENIGH o la ENOE, pero cualquier otra fuente de información representativa que incluya los años de educación y el ingreso será útil.

  1. [5 puntos] Describa la fuente de información que emplea y la muestra con la que realiza las estimaciones.

  2. [5 puntos] Estime una regresión del logaritmo del ingreso en función de la escolaridad usando los microdatos. Luego, obtenga la media del logaritmo del ingreso para cada nivel de educación y estime una regresión de las medias en función del nivel de educación, usando como pesos en la regresión el número de observaciones usadas para construir cada media. Compare los coeficientes estimados.

  3. [5 puntos] Realice una figura análoga a la figura 3.1.1 en MHE, usando los datos que construyó para esta pregunta.

Pregunta 5

Use los datos del archivo merged_all_surveys.dta para este problema. En este problema replicará la fila correspondiente a la variable Sales in past month (ventas del mes anterior) de la Tabla 1 en Davies et al. (2023).1

  1. [5 puntos] Obtenga la media y la desviación estándar de las ventas del mes anterior al momento de la línea base, sales_4w_base en los datos, para replicar lo que se reporta en las columnas (1) y (2).

  2. [5 puntos] Obtenga la media de las ventas del mes anterior al momento de la línea base, sales_4w_base en los datos, para los grupos de control y tratamiento, para replicar lo que se reporta en las columnas (3) y (4).

  3. [5 puntos] Usando una regresión lineal, realice una prueba de balance para comprobar que las ventas del mes anterior al momento de la línea base no difieren entre el grupo de control y el de tratamiento. Reporte el valor \(p\) correspondiente a dicha prueba (columna 5). Preste atención a los controles que se usan para realizar dicha prueba.

  4. [5 puntos] En la parte superior de la Tabla 1 los autores reportan un valor \(p\) que dice (Joint = .5). Este es el valor \(p\) de una prueba de significancia conjunta en la que la hipótesis nula es que los covariables reportados en la tabla no predicen conjuntamente el tratamiento, controlando por los efectos fijos de estrato. Obtenga dicho valor \(p\) usando los datos. Los covariables que se reportan en la tabla son:

Pregunta 6

Nuevamente, use los datos del archivo merged_all_surveys.dta. En este problema, replicará las columnas del efecto de tratamiento después de 2 meses de la intervención, reportados en la Tabla 2.

  1. [5 puntos] ¿Cuál es el valor de las ventas reportadas en la encuesta de seguimiento dos meses después de la intervención, sales_4w_end, para el grupo de control? Con esto debería replicar la columna (2) de la Tabla 2.

  2. [5 puntos] Estime el efecto del tratamiento sobre sales_4w_end controlando por efectos fijos de estrato y con errores estándar robustos a la heterocedasticidad. Interprete sus resultados y compárelos con los que los autores presentan en la columna (3) de la Tabla 2.

  3. [5 puntos] Explique por qué difieren los resultados que obtuvo en la parte b. con los que los autores reportan en la Tabla 2.

Notas

  1. Davies, E., Deffebach, P., Iacovone, L., & Mckenzie, D. (2024). Training Microentrepreneurs Over Zoom: Experimental Evidence from Mexico. Journal of Development Economics, 167, 103244.↩︎