Engenharia de dados · Desenvolvedora Python

Rafaella
Duarte

Construo pipelines de dados observáveis, resilientes e escaláveis - da ingestão à disponibilização, combinando cloud, infraestrutura, processamento de dados e IA aplicada.

Rafaella Duarte

Sobre

Curiosa por natureza.

Comecei como estagiária em 2021, escrevendo meus primeiros scrapers e pipelines, e hoje atuo com engenharia de dados, utilizando diferentes tecnologias de processamento, armazenamento e cloud, com certificações em Airflow e Databricks.

Sou formada em Ciências Econômicas - o que me ajuda a estruturar problemas antes de propor soluções técnicas, e não o contrário.

Fora do trabalho, desenvolvo um projeto pessoal de catalogação de aves brasileiras, com um assistente de identificação de espécies usando RAG e LLMs. Também ensino matemática para crianças e restauro livros como hobby.

Perfil técnico

Engenharia de dados na prática.

Atuo na ingestão, processamento, modelagem e disponibilização de dados, com diferentes arquiteturas e tecnologias conforme o problema e a escala.

Arquitetura

Engenharia de Dados

  • ETL · ELT · Data Pipelines
  • Data Lake · Data Warehouse · Lakehouse
  • Data Modeling · Medallion · Delta Lake

Linguagens & Processamento

Escala

  • Python · SQL · Bash
  • PySpark · Spark SQL
  • Processamento Distribuído

Dados

Armazenamento

  • PostgreSQL · SQL Server
  • MongoDB · Elasticsearch · Redis
  • BigQuery

Orquestração

Pipelines

  • Apache Airflow · dbt
  • Apache Kafka · RabbitMQ
  • REST APIs · FastAPI · Web Scraping

Cloud & DevOps

Infraestrutura

  • GCP · AWS · Databricks
  • Docker · Git · CI/CD
  • Linux · Grafana

IA Aplicada

Dados não estruturados

  • RAG · Embeddings · LLMs
  • OCR · Classificação Semântica
  • MCP

Trajetória

Experiência

Jan 2025 - Atual

Engenheira de Dados

E-xyon

Dados jurídicos: ingestão via APIs públicas e web scraping, modelagem em SQL Server (300M+ processos), Data Warehouse no BigQuery e classificação semântica com LLMs e RAG.

PythonSQL ServerBigQueryFastAPILLMs/RAG
Jan - Dez 2024

Desenvolvedora Python ETL · Freelancer

Flow2Go

Scrapers com bypass de captcha para portais jurídicos, enriquecimento e padronização em MongoDB, disponibilização via API REST. Migração de workload on-premise para arquitetura serverless no GCP.

PythonMongoDBFastAPIGCP
Nov 2022 - Out 2023

Engenheira de Dados

Linx

Pipelines de coleta para 10+ marketplaces, catálogo de 60M+ produtos, arquitetura orientada a filas via RabbitMQ.

RabbitMQElasticsearchBigQueryS3Web Scraping
Jan 2021 - Nov 2022

Analista de Dados · Estágio

Nodis (Grupo StoneCo)

Pipelines ETL e scrapers para marketplaces, integração com VTEX via API, dashboards de KPIs em Data Studio.

PostgreSQLMongoDBWeb ScrapingPower BI

Formação & Certificações

Formação acadêmica
2026 - 2028

Especialização em Engenharia de Dados

PUC Minas - Pontifícia Universidade Católica de Minas Gerais
Pós-graduação
2019 - 2025

Bacharelado em Ciências Econômicas

UFU - Universidade Federal de Uberlândia
Graduação
Cursos complementares
Building RAG Apps Using MongoDB MongoDB University Ver →
Replicando Informações em Realtime para o DataLake utilizando CDC Labdata-FIA Ver →

Portfólio

Projetos selecionados

Pipeline de Dados de Tráfego Aéreo em Tempo Real

Captura e replicação de dados de tráfego aéreo em tempo real utilizando Change Data Capture (CDC), com ingestão, processamento e armazenamento em um Data Lake para análise e histórico dos dados.

Pipeline de Dados Epidemiológicos e Climáticos

Integração de dados epidemiológicos e climáticos em uma arquitetura Medallion, utilizando AWS, Spark e Databricks para processamento e análise de arboviroses no Brasil.

Pipeline de Dados de Empresas (CNPJ)

2º lugar no Hackathon A3Data Challenge Women, com pipeline de ingestão e transformação de dados públicos de CNPJ no GCP, utilizando processamento assíncrono, persistência e visualização dos dados.

Assistente de identificação de Aves

Aplicação de RAG para identificação de espécies, utilizando embeddings, recuperação semântica e LLMs a partir de descrições textuais.

Plataforma de Gestão de Acervo e Leitura Pessoal

Plataforma de gestão de acervo pessoal, com API em FastAPI, modelagem Star Schema e frontend em Django.

Pipeline de Dados de Vendas com Medallion

Pipeline ETL com arquitetura Medallion, ingestão via CSV e API, transformações com dbt, testes de qualidade e modelagem dimensional em Star Schema.

Ver todos os projetos

Contato

Vamos conversar sobre dados e tecnologia?

Aberta a conversas sobre projetos, tecnologia e oportunidades em engenharia de dados.