Analista de Dados & Analytics Engineer

Da matéria‑prima
ao dado que sustenta decisão.

Recebo um pedido em palavras e entrego um dashboard pronto pra apoiar a decisão. Faço isso estruturando dado bruto em camadas, do jeito que uma mina refina minério até virar algo com valor.

Bronze · matéria‑prima

Quem sou

Atuo há 2 anos como Analista de Dados na Vale Base Metals (Planta Salobo), unindo Engenharia de Dados e Business Intelligence pra transformar necessidade de RH em decisão. Traduzo o pedido em dado estruturado, entendo o problema por trás da demanda, e construo o caminho completo até a resposta.

2 anos estruturando dados em produção
14+ dashboards sustentados em Power BI
300+ usuários ativos nos dashboards oficiais
80% redução de esforço operacional

O que entrego

  • Automação de ingestão com Power Automate e SharePoint/Dataverse
  • Dados organizados em camadas (Bronze, Silver, Gold) via Power BI Dataflow, com histórico e rastreabilidade
  • Dashboards em Power BI prototipados no Figma antes da primeira medida em DAX, hoje referência oficial da liderança da área
  • Piloto de migração de um fluxo de ETL pra SAS Viya, replicando as camadas em Python

Não segui um framework formal de engenharia: aprendi construindo, resolvendo problema real de RH, e refinando a estrutura com o tempo. Sou bacharel em Engenharia de Software pela Estácio, com formação contínua em análise de dados.

Silver · estruturação

Ferramentas

Dados & BI

  • Power BI
  • DAX
  • Power Query
  • ETL
  • dbt
  • Modelagem de Dados
  • Arquitetura de Dados
  • Big Data (Spark, Hadoop)

Automação & Plataforma

  • Power Automate
  • Power Apps
  • Microsoft Dataverse
  • SharePoint
  • Computação em Nuvem (AWS)

Linguagens

  • Python
  • Python (Pandas)
  • SQL
  • HTML
  • CSS

Idiomas

  • Português (Nativo)
  • Inglês (Avançado)

Certificações

  • SQL (Alura)
  • Python para Análise de Dados (Alura)
  • Modelagem de Dados (Alura)
  • Power BI (MLF Soluções Tecnológicas)
  • AWS Data Lake: Pipeline de Ingestão
  • Metodologias Ágeis (Conquer In Company)

Gold · entregas

Projetos

Ferramenta de linha de comando que perfila arquivos de dados antes da análise começar de verdade.

  • Infere o que cada coluna representa, mesmo com nome abreviado
  • Roda estatística avançada: Shapiro-Wilk, qui-quadrado com V de Cramér, correlação de Pearson/Spearman, seleção de distribuição por AIC, ADF e Ljung-Box
  • Cruza tabelas pra descobrir quem é fato e quem é dimensão, e monta o diagrama ER
  • Valida regra de negócio entre colunas (ordem de datas, derivação aritmética, nulidade condicional)
  • Detecta CPF e CNPJ com validação de dígito verificador, mascara antes de expor
  • Sugere as análises certas já com código pandas e SQL prontos pra rodar
  • Python
  • Perfilamento de Dados
  • Estatística Avançada
  • Modelagem de Dados
  • LGPD
  • 306 testes
  • Sem IA
  • Regras determinísticas

Pipeline de dados e dashboard analítico sobre a mineração brasileira, com dados 100% reais e públicos da ANM (Agência Nacional de Mineração).

  • Cobre 2010 a 2025 em duas bases (Produção Bruta e Produção Beneficiada), cerca de 10.300 registros combinados
  • Bronze em Python/Polars, só o trecho que decodifica o CSV cp1252 do governo; Silver, Gold e o cruzamento inteiramente em dbt sobre DuckDB
  • Cruza as duas bases por SQL pra quantificar o valor que o beneficiamento agrega ao minério bruto
  • 58 testes dbt (schema e singular), validando toda UF contra um seed de região, com documentação e linhagem geradas automaticamente
  • Dashboard executivo interativo: um único arquivo HTML autocontido, sem backend nem dependência externa
  • Bateia Ops: o mesmo ETL rodando como grafo de assets no Dagster, via Docker Compose, com retry automático e um asset check que barra o pipeline se o cruzamento degenerar
  • Python
  • Polars
  • dbt (dbt-duckdb)
  • DuckDB (SQL)
  • Pipeline Bronze/Silver/Gold
  • Dagster
  • Docker
  • GitHub Actions (CI)
  • 58 testes dbt
  • Dashboard sem backend

Biblioteca Python publicada no PyPI que infere o papel e o domínio de uma coluna a partir do nome, abreviação e conteúdo, sem dicionário fechado nem modelo de IA.

  • Cascata de 6 detectores independentes (padrão de conteúdo, dicionário com abreviação expandida, fuzzy Jaro-Winkler, gazetteer de conteúdo, assinatura estrutural, contexto da tabela), combinados por noisy-OR
  • Reconstrói abreviação corporativa (cd_dpto_lot vira "código" + "departamento" + "lotação") mesmo sem estar em nenhum dicionário
  • Desambigua nome opaco pelo conteúdo da coluna e pelas colunas vizinhas já resolvidas na mesma tabela
  • Devolve confiança, a evidência que decidiu, e hipóteses alternativas ranqueadas quando não é conclusivo
  • Extraída do motor de inferência semântica do Recon, agora um pacote standalone: pip install colsemantics
  • Python
  • Publicado no PyPI
  • Inferência Semântica
  • Noisy-OR
  • Jaro-Winkler
  • Tipado (py.typed)
  • Testado