Repaso de Estadística y Programación Python

Domina Estadística y Programación Python con ejemplos de la EPH. Aprende análisis de datos, visualización y depuración de código. ¡Prepárate para tu examen!

¡Bienvenido a tu guía de repaso de Estadística y Programación Python! Este artículo te preparará para comprender y aplicar conceptos clave utilizando ejemplos prácticos de la Encuesta Permanente de Hogares (EPH) de Argentina. Ya sea que estés repasando para un examen o buscando fortalecer tus habilidades, aquí encontrarás una revisión completa y clara.

Repaso de Estadística y Programación Python: Conceptos Clave con la EPH

La Encuesta Permanente de Hogares (EPH), elaborada por el INDEC, es un relevamiento continuo que proporciona información esencial sobre las características socioeconómicas de hogares y personas en centros urbanos de Argentina. Utilizaremos datos simulados de la EPH para explorar conceptos estadísticos y aplicar la programación en Python.

Entendiendo los Datos de la EPH

Para empezar nuestro repaso, es fundamental clasificar y comprender los tipos de datos que la EPH recolecta. Esto nos permite elegir las herramientas estadísticas y de programación adecuadas.

  • Unidades Experimentales: En un análisis de ingresos, las unidades son las personas mayores de 18 años que trabajan.
  • Tipo de Muestra: Generalmente, se trabaja con una muestra de la población total.
  • Datos de Ingresos: Son cuantitativos continuos, lo que significa que pueden tomar cualquier valor dentro de un rango determinado.
  • Condición de Actividad (Ocupado, Desocupado, Inactivo): Son cualitativos nominales, es decir, categorías sin un orden intrínseco.

Análisis de Datos Cuantitativos: Ingresos Individuales

El análisis de ingresos es un pilar en la estadística. Nos ayuda a entender la distribución y las características de una variable clave. Consideremos una muestra de 4000 personas empleadas mayores de 18 años, con sus ingresos en miles de pesos.

Visualización de Datos de Ingresos: Boxplots e Histogramas

Los gráficos son herramientas poderosas para visualizar la distribución de los datos.

  • Boxplot (Diagrama de Caja): Muestra la mediana, los cuartiles (Q1, Q3) y posibles valores atípicos. Un boxplot puede indicar asimetría o la presencia de datos extremos.
  • Histograma: Representa la distribución de frecuencias de los datos cuantitativos, agrupándolos en intervalos. Permite observar la forma, el centro y la dispersión de los datos.

Al analizar el boxplot y los histogramas, buscamos la concordancia entre ellos. Por ejemplo, un boxplot asimétrico hacia la derecha (con la mediana más cerca del Q1) debería corresponder a un histograma con una cola derecha más larga.

Resúmenes Numéricos: Media, Desviación Estándar y Cuartiles

Los resúmenes numéricos complementan los gráficos, proporcionando medidas precisas:

  • Media (mean): El promedio de los ingresos.
  • Desviación Estándar (std): Mide la dispersión o variabilidad de los ingresos alrededor de la media.
  • Cuartiles (25%, 50%, 75%): Dividen los datos ordenados en cuatro partes iguales.
  • El 25% de las personas que menos ganan, ganan como máximo el valor del cuartil 25% (Q1).
  • El 25% de las personas con mayor salario, ganan como mínimo el valor del cuartil 75% (Q3).
  • El 50% de las personas que ganan más que el valor del cuartil 50% (Q2), que es la mediana.
  • El 50% central de las personas tienen ingresos entre el Q1 y el Q3.

Análisis de Datos Cualitativos: Condición de Actividad

Los datos cualitativos, como la condición de actividad, se analizan mediante tablas de frecuencia y gráficos de barras o torta.

Tablas de Frecuencias Absolutas y Relativas

Una tabla de frecuencias absolutas muestra cuántas veces aparece cada categoría. Las frecuencias relativas (generalmente en porcentaje) indican la proporción de cada categoría respecto al total.

Gráficos para Datos Cualitativos: Barras y Torta

  • Diagrama de Barras: Ideal para comparar las frecuencias de diferentes categorías. Cada barra representa una categoría y su altura la frecuencia.
  • Gráfico de Torta (Circular): Muestra la proporción de cada categoría respecto al total, donde el círculo completo representa el 100%. Por ejemplo, podemos afirmar si menos de un tercio de las personas se encuentran inactivas observando la porción del gráfico.

Programación Python para el Análisis de Datos de la EPH

Python es una herramienta esencial para procesar, analizar y visualizar grandes volúmenes de datos como los de la EPH. Abordaremos la manipulación de datos, la detección de errores y la creación de visualizaciones.

Cálculo de Tasas de Actividad por Sexo y General

La tasa de actividad es un indicador clave que mide la proporción de personas activas (ocupados + desocupados) respecto a la población total de referencia. Para calcularla en Python, necesitamos procesar los datos de ESTADO y sexo.

  • ESTADO: 0 (no respuesta), 1 (ocupado), 2 (desocupado), 3 (inactivo), 4 (menor de 10 años).
  • sexo: 1 (varón), 2 (mujer).

Para el cálculo, es crucial identificar correctamente a los activos (ocupados y desocupados) y la población total por sexo. La función calcular_tasa debe devolver un float y se define como return (activos / total) * 100.

Errores Comunes en Programación Python (Bugs y Sintaxis)

En el desarrollo de código, es común encontrar errores. Diferenciar entre bugs y errores de sintaxis es fundamental para una depuración eficiente.

  • Errores de Sintaxis: Son fallas en la estructura del código que impiden que el programa se ejecute (ej. : faltantes en if/elif o for, ) faltantes en llamadas a funciones, operadores mal definidos).
  • Bugs: Son errores lógicos en el código que permiten que el programa se ejecute, pero producen resultados incorrectos (ej. índice incorrecto en un bucle como len(ESTADO)-1 que omite el último elemento, lógica de acumulación errónea, cálculo de tasas usando variables incorrectas como activos_mujeres en lugar de activos_varones).

Variables Locales y Mutables

  • Variables Locales: Declaradas dentro de una función, solo son accesibles dentro de ella. La función calcular_tasa tiene dos variables locales: activos y total.
  • Variables Mutables: Son objetos cuyo estado puede ser modificado después de su creación (ej. listas, diccionarios). Las variables que almacenan estas estructuras en el programa son ESTADO, sexo, regiones e ingresos, así como los diccionarios activos_por_region y total_por_region.

Visualización de Datos con Matplotlib: Gráfico de Barras por Región

matplotlib.pyplot es una biblioteca fundamental para crear visualizaciones en Python. Para mostrar la tasa de actividad general por región, podemos crear un gráfico de barras.

Para ello, necesitamos:

  1. Mapear regiones: Asignar nombres (NOA, NEA, Pampeana, etc.) a los códigos numéricos de las regiones.
  2. Acumular activos y totales: Utilizar diccionarios (activos_por_region, total_por_region) para sumar los activos y la población total para cada región.
  3. Calcular TAG por región: Dividir activos_por_region[r] entre total_por_region[r] para obtener la tasa de actividad de cada región.
  4. Preparar datos para el gráfico: Convertir las claves (nombres de regiones) y valores (TAGs) del diccionario a listas.
  5. Crear el gráfico: Usar plt.bar(regiones_grafico, valores) para dibujar las barras y plt.title(), plt.xlabel(), plt.ylabel() para añadir etiquetas.

Análisis de Datos Cuantitativos Bivariados: Ingreso vs. Horas Trabajadas

Cuando analizamos dos variables cuantitativas, como el ingreso y la cantidad de horas trabajadas, buscamos relaciones entre ellas.

Diagrama de Dispersión y Coeficiente de Correlación

  • Diagrama de Dispersión (Scatter Plot): Grafica pares de puntos (x, y) para visualizar la relación entre dos variables cuantitativas. Permite identificar si existe una tendencia, la dirección (positiva o negativa) y la fuerza de la relación.
  • Coeficiente de Correlación: Es un resumen numérico que mide la fuerza y dirección de la asociación lineal entre dos conjuntos de datos cuantitativos. Valores cercanos a 1 o -1 indican una fuerte correlación lineal. Un coeficiente de 0.73, por ejemplo, sugiere una fuerte correlación lineal positiva.

Al analizar estos gráficos, podemos afirmar si