Revisão de Estatística e Programação Python

Domine Estatística e Programação Python com exemplos da EPH. Aprenda análise de dados, visualização e depuração de código. Prepare-se para o seu exame!

Bem-vindo ao seu guia de revisão de Estatística e Programação Python! Este artigo irá prepará-lo para compreender e aplicar conceitos-chave utilizando exemplos práticos da Pesquisa Permanente de Domicílios (EPH) da Argentina. Quer esteja revisando para uma prova ou buscando fortalecer suas habilidades, aqui encontrará uma revisão completa e clara.

Revisão de Estatística e Programação Python: Conceitos-Chave com a EPH

A Pesquisa Permanente de Domicílios (EPH), elaborada pelo INDEC, é um levantamento contínuo que fornece informações essenciais sobre as características socioeconômicas de domicílios e pessoas em centros urbanos da Argentina. Utilizaremos dados simulados da EPH para explorar conceitos estatísticos e aplicar a programação em Python.

Compreendendo os Dados da EPH

Para começar nossa revisão, é fundamental classificar e compreender os tipos de dados que a EPH coleta. Isso nos permite escolher as ferramentas estatísticas e de programação adequadas.

  • Unidades Experimentais: Em uma análise de renda, as unidades são as pessoas maiores de 18 anos que trabalham.
  • Tipo de Amostra: Geralmente, trabalha-se com uma amostra da população total.
  • Dados de Renda: São quantitativos contínuos, o que significa que podem assumir qualquer valor dentro de um determinado intervalo.
  • Condição de Atividade (Ocupado, Desocupado, Inativo): São qualitativos nominais, ou seja, categorias sem uma ordem intrínseca.

Análise de Dados Quantitativos: Rendas Individuais

A análise de rendas é um pilar na estatística. Ela nos ajuda a entender a distribuição e as características de uma variável-chave. Consideremos uma amostra de 4000 pessoas empregadas maiores de 18 anos, com suas rendas em milhares de pesos.

Visualização de Dados de Renda: Boxplots e Histogramas

Os gráficos são ferramentas poderosas para visualizar a distribuição dos dados.

  • Boxplot (Diagrama de Caixa): Mostra a mediana, os quartis (Q1, Q3) e possíveis valores atípicos. Um boxplot pode indicar assimetria ou a presença de dados extremos.
  • Histograma: Representa a distribuição de frequências dos dados quantitativos, agrupando-os em intervalos. Permite observar a forma, o centro e a dispersão dos dados.

Ao analisar o boxplot e os histogramas, buscamos a concordância entre eles. Por exemplo, um boxplot assimétrico à direita (com a mediana mais próxima do Q1) deveria corresponder a um histograma com uma cauda direita mais longa.

Resumos Numéricos: Média, Desvio Padrão e Quartis

Os resumos numéricos complementam os gráficos, fornecendo medidas precisas:

  • Média (mean): A média das rendas.
  • Desvio Padrão (std): Mede a dispersão ou variabilidade das rendas em torno da média.
  • Quartis (25%, 50%, 75%): Dividem os dados ordenados em quatro partes iguais.
    • Os 25% das pessoas que menos ganham, ganham no máximo o valor do quartil 25% (Q1).
    • Os 25% das pessoas com maior salário, ganham no mínimo o valor do quartil 75% (Q3).
    • Os 50% das pessoas que ganham mais que o valor do quartil 50% (Q2), que é a mediana.
    • Os 50% central das pessoas têm rendas entre o Q1 e o Q3.

Análise de Dados Qualitativos: Condição de Atividade

Os dados qualitativos, como a condição de atividade, são analisados por meio de tabelas de frequência e gráficos de barras ou pizza.

Tabelas de Frequências Absolutas e Relativas

Uma tabela de frequências absolutas mostra quantas vezes cada categoria aparece. As frequências relativas (geralmente em porcentagem) indicam a proporção de cada categoria em relação ao total.

Gráficos para Dados Qualitativos: Barras e Pizza

  • Diagrama de Barras: Ideal para comparar as frequências de diferentes categorias. Cada barra representa uma categoria e sua altura a frequência.
  • Gráfico de Pizza (Circular): Mostra a proporção de cada categoria em relação ao total, onde o círculo completo representa 100%. Por exemplo, podemos afirmar se menos de um terço das pessoas se encontram inativas observando a porção do gráfico.

Programação Python para a Análise de Dados da EPH

Python é uma ferramenta essencial para processar, analisar e visualizar grandes volumes de dados como os da EPH. Abordaremos a manipulação de dados, a detecção de erros e a criação de visualizações.

Cálculo de Taxas de Atividade por Sexo e Geral

A taxa de atividade é um indicador-chave que mede a proporção de pessoas ativas (ocupados + desocupados) em relação à população total de referência. Para calculá-la em Python, precisamos processar os dados de ESTADO e sexo.

  • ESTADO: 0 (não resposta), 1 (ocupado), 2 (desocupado), 3 (inativo), 4 (menor de 10 anos).
  • sexo: 1 (varón), 2 (mujer).

Para o cálculo, é crucial identificar corretamente os ativos (ocupados e desocupados) e a população total por sexo. A função calcular_tasa deve retornar um float e é definida como return (activos / total) * 100.

Erros Comuns em Programação Python (Bugs e Sintaxe)

No desenvolvimento de código, é comum encontrar erros. Diferenciar entre bugs e erros de sintaxe é fundamental para uma depuração eficiente.

  • Erros de Sintaxe: São falhas na estrutura do código que impedem que o programa seja executado (ex. : ausentes em if/elif ou for, ) ausentes em chamadas de funções, operadores mal definidos).
  • Bugs: São erros lógicos no código que permitem que o programa seja executado, mas produzem resultados incorretos (ex. índice incorreto em um loop como len(ESTADO)-1 que omite o último elemento, lógica de acumulação errônea, cálculo de taxas usando variáveis incorretas como activos_mujeres em vez de activos_varones).

Variáveis Locais e Mutáveis

  • Variáveis Locais: Declaradas dentro de uma função, só são acessíveis dentro dela. A função calcular_tasa tem duas variáveis locais: activos e total.
  • Variáveis Mutáveis: São objetos cujo estado pode ser modificado após sua criação (ex. listas, dicionários). As variáveis que armazenam essas estruturas no programa são ESTADO, sexo, regiones e ingresos, assim como os dicionários activos_por_region e total_por_region.

Visualização de Dados com Matplotlib: Gráfico de Barras por Região

matplotlib.pyplot é uma biblioteca fundamental para criar visualizações em Python. Para mostrar a taxa de atividade geral por região, podemos criar um gráfico de barras.

Para isso, precisamos:

  1. Mapear regiões: Atribuir nomes (NOA, NEA, Pampeana, etc.) aos códigos numéricos das regiões.
  2. Acumular ativos e totais: Utilizar dicionários (activos_por_region, total_por_region) para somar os ativos e a população total para cada região.
  3. Calcular TAG por região: Dividir activos_por_region[r] por total_por_region[r] para obter a taxa de atividade de cada região.
  4. Preparar dados para o gráfico: Converter as chaves (nomes de regiões) e valores (TAGs) do dicionário em listas.
  5. Criar o gráfico: Usar plt.bar(regiones_grafico, valores) para desenhar as barras e plt.title(), plt.xlabel(), plt.ylabel() para adicionar rótulos.

Análise de Dados Quantitativos Bivariados: Renda vs. Horas Trabalhadas

Quando analisamos duas variáveis quantitativas, como a renda e a quantidade de horas trabalhadas, buscamos relações entre elas.

Diagrama de Dispersão e Coeficiente de Correlação

  • Diagrama de Dispersão (Scatter Plot): Plota pares de pontos (x, y) para visualizar a relação entre duas variáveis quantitativas. Permite identificar se existe uma tendência, a direção (positiva ou negativa) e a força da relação.
  • Coeficiente de Correlação: É um resumo numérico que mede a força e a direção da associação linear entre dois conjuntos de dados quantitativos. Valores próximos a 1 ou -1 indicam uma forte correlação linear. Um coeficiente de 0.73, por exemplo, sugere uma forte correlação linear positiva.

Ao analisar esses gráficos, podemos afirmar se