← voltar aos projetos

Big data · Lakehouse

Pipeline de Dados de Arboviroses

Pipeline para análise de arboviroses no Brasil, integrando dados epidemiológicos e climáticos em uma arquitetura de camadas no Databricks.

Status
Em desenvolvimento
Stack
PySpark · Databricks · Delta Lake
Código

Contexto

Projeto pessoal para explorar cruzamento de fontes públicas — dados epidemiológicos de arboviroses (dengue, zika, chikungunya) e dados climáticos — sob a hipótese de que variáveis como temperatura e precipitação ajudam a explicar picos de notificação. Foi também uma forma de aprofundar Databricks e Delta Lake em um cenário de dados heterogêneos, fora do contexto de trabalho.

Fluxo da arquitetura

Estrutura em camadas Bronze / Silver / Gold, com as duas fontes (epidemiológica e climática) entrando separadamente na camada bruta e sendo cruzadas apenas na camada Silver, já normalizadas por município e data — evita que inconsistências de uma fonte contaminem a outra antes da hora.

Dados epidemiológicos Dados climáticos Bronze raw, separado Silver normalização cruzamento Gold Delta Lake Análise (planejado)

O que foi desenvolvido

  • Estrutura de pipeline em camadas (Bronze, Silver, Gold) sobre Delta Lake
  • Integração de múltiplas fontes de dados — epidemiológicas e climáticas — normalizadas por município e data
Evolução limitada no momento por restrição de infraestrutura (Databricks em ambiente pessoal tem custo, diferente de um projeto rodando em produção). A camada Gold e a etapa de análise cruzada ainda estão planejadas — deixei isso marcado no diagrama para não passar a impressão de algo pronto.