Bem-vindo ao seu guia de revisão de Estatística e Programação Python! Este artigo irá prepará-lo para compreender e aplicar conceitos-chave utilizando exemplos práticos da Pesquisa Permanente de Domicílios (EPH) da Argentina. Quer esteja revisando para uma prova ou buscando fortalecer suas habilidades, aqui encontrará uma revisão completa e clara.
Revisão de Estatística e Programação Python: Conceitos-Chave com a EPH
A Pesquisa Permanente de Domicílios (EPH), elaborada pelo INDEC, é um levantamento contínuo que fornece informações essenciais sobre as características socioeconômicas de domicílios e pessoas em centros urbanos da Argentina. Utilizaremos dados simulados da EPH para explorar conceitos estatísticos e aplicar a programação em Python.
Compreendendo os Dados da EPH
Para começar nossa revisão, é fundamental classificar e compreender os tipos de dados que a EPH coleta. Isso nos permite escolher as ferramentas estatísticas e de programação adequadas.
- Unidades Experimentais: Em uma análise de renda, as unidades são as pessoas maiores de 18 anos que trabalham.
- Tipo de Amostra: Geralmente, trabalha-se com uma amostra da população total.
- Dados de Renda: São quantitativos contínuos, o que significa que podem assumir qualquer valor dentro de um determinado intervalo.
- Condição de Atividade (Ocupado, Desocupado, Inativo): São qualitativos nominais, ou seja, categorias sem uma ordem intrínseca.
Análise de Dados Quantitativos: Rendas Individuais
A análise de rendas é um pilar na estatística. Ela nos ajuda a entender a distribuição e as características de uma variável-chave. Consideremos uma amostra de 4000 pessoas empregadas maiores de 18 anos, com suas rendas em milhares de pesos.
Visualização de Dados de Renda: Boxplots e Histogramas
Os gráficos são ferramentas poderosas para visualizar a distribuição dos dados.
- Boxplot (Diagrama de Caixa): Mostra a mediana, os quartis (Q1, Q3) e possíveis valores atípicos. Um boxplot pode indicar assimetria ou a presença de dados extremos.
- Histograma: Representa a distribuição de frequências dos dados quantitativos, agrupando-os em intervalos. Permite observar a forma, o centro e a dispersão dos dados.
Ao analisar o boxplot e os histogramas, buscamos a concordância entre eles. Por exemplo, um boxplot assimétrico à direita (com a mediana mais próxima do Q1) deveria corresponder a um histograma com uma cauda direita mais longa.
Resumos Numéricos: Média, Desvio Padrão e Quartis
Os resumos numéricos complementam os gráficos, fornecendo medidas precisas:
- Média (mean): A média das rendas.
- Desvio Padrão (std): Mede a dispersão ou variabilidade das rendas em torno da média.
- Quartis (25%, 50%, 75%): Dividem os dados ordenados em quatro partes iguais.
- Os 25% das pessoas que menos ganham, ganham no máximo o valor do quartil 25% (Q1).
- Os 25% das pessoas com maior salário, ganham no mínimo o valor do quartil 75% (Q3).
- Os 50% das pessoas que ganham mais que o valor do quartil 50% (Q2), que é a mediana.
- Os 50% central das pessoas têm rendas entre o Q1 e o Q3.
Análise de Dados Qualitativos: Condição de Atividade
Os dados qualitativos, como a condição de atividade, são analisados por meio de tabelas de frequência e gráficos de barras ou pizza.
Tabelas de Frequências Absolutas e Relativas
Uma tabela de frequências absolutas mostra quantas vezes cada categoria aparece. As frequências relativas (geralmente em porcentagem) indicam a proporção de cada categoria em relação ao total.
Gráficos para Dados Qualitativos: Barras e Pizza
- Diagrama de Barras: Ideal para comparar as frequências de diferentes categorias. Cada barra representa uma categoria e sua altura a frequência.
- Gráfico de Pizza (Circular): Mostra a proporção de cada categoria em relação ao total, onde o círculo completo representa 100%. Por exemplo, podemos afirmar se menos de um terço das pessoas se encontram inativas observando a porção do gráfico.
Programação Python para a Análise de Dados da EPH
Python é uma ferramenta essencial para processar, analisar e visualizar grandes volumes de dados como os da EPH. Abordaremos a manipulação de dados, a detecção de erros e a criação de visualizações.
Cálculo de Taxas de Atividade por Sexo e Geral
A taxa de atividade é um indicador-chave que mede a proporção de pessoas ativas (ocupados + desocupados) em relação à população total de referência. Para calculá-la em Python, precisamos processar os dados de ESTADO e sexo.
ESTADO: 0 (não resposta), 1 (ocupado), 2 (desocupado), 3 (inativo), 4 (menor de 10 anos).sexo: 1 (varón), 2 (mujer).
Para o cálculo, é crucial identificar corretamente os ativos (ocupados e desocupados) e a população total por sexo. A função calcular_tasa deve retornar um float e é definida como return (activos / total) * 100.
Erros Comuns em Programação Python (Bugs e Sintaxe)
No desenvolvimento de código, é comum encontrar erros. Diferenciar entre bugs e erros de sintaxe é fundamental para uma depuração eficiente.
- Erros de Sintaxe: São falhas na estrutura do código que impedem que o programa seja executado (ex.
:ausentes emif/elifoufor,)ausentes em chamadas de funções, operadores mal definidos). - Bugs: São erros lógicos no código que permitem que o programa seja executado, mas produzem resultados incorretos (ex. índice incorreto em um loop como
len(ESTADO)-1que omite o último elemento, lógica de acumulação errônea, cálculo de taxas usando variáveis incorretas comoactivos_mujeresem vez deactivos_varones).
Variáveis Locais e Mutáveis
- Variáveis Locais: Declaradas dentro de uma função, só são acessíveis dentro dela. A função
calcular_tasatem duas variáveis locais:activosetotal. - Variáveis Mutáveis: São objetos cujo estado pode ser modificado após sua criação (ex. listas, dicionários). As variáveis que armazenam essas estruturas no programa são
ESTADO,sexo,regioneseingresos, assim como os dicionáriosactivos_por_regionetotal_por_region.
Visualização de Dados com Matplotlib: Gráfico de Barras por Região
matplotlib.pyplot é uma biblioteca fundamental para criar visualizações em Python. Para mostrar a taxa de atividade geral por região, podemos criar um gráfico de barras.
Para isso, precisamos:
- Mapear regiões: Atribuir nomes (NOA, NEA, Pampeana, etc.) aos códigos numéricos das regiões.
- Acumular ativos e totais: Utilizar dicionários (
activos_por_region,total_por_region) para somar os ativos e a população total para cada região. - Calcular TAG por região: Dividir
activos_por_region[r]portotal_por_region[r]para obter a taxa de atividade de cada região. - Preparar dados para o gráfico: Converter as chaves (nomes de regiões) e valores (TAGs) do dicionário em listas.
- Criar o gráfico: Usar
plt.bar(regiones_grafico, valores)para desenhar as barras eplt.title(),plt.xlabel(),plt.ylabel()para adicionar rótulos.
Análise de Dados Quantitativos Bivariados: Renda vs. Horas Trabalhadas
Quando analisamos duas variáveis quantitativas, como a renda e a quantidade de horas trabalhadas, buscamos relações entre elas.
Diagrama de Dispersão e Coeficiente de Correlação
- Diagrama de Dispersão (Scatter Plot): Plota pares de pontos (x, y) para visualizar a relação entre duas variáveis quantitativas. Permite identificar se existe uma tendência, a direção (positiva ou negativa) e a força da relação.
- Coeficiente de Correlação: É um resumo numérico que mede a força e a direção da associação linear entre dois conjuntos de dados quantitativos. Valores próximos a 1 ou -1 indicam uma forte correlação linear. Um coeficiente de 0.73, por exemplo, sugere uma forte correlação linear positiva.
Ao analisar esses gráficos, podemos afirmar se