Engenheiro
de Dados Pleno – Databricks
Sobre a oportunidade
Estamos em busca de um(a) Engenheiro(a) de Dados
Pleno com experiência em Databricks para atuar no desenvolvimento e evolução de
pipelines de dados em ambientes distribuídos, participando desde a ingestão até
a disponibilização de dados para consumo analítico e operacional.
O profissional atuará com grandes volumes de dados,
múltiplas fontes de informação e diferentes formatos de arquivos, contribuindo
para a construção de soluções escaláveis e de alta performance em ambiente
cloud.
Principais Responsabilidades
- Desenvolver
pipelines de ingestão, transformação e processamento de dados utilizando
Databricks e Spark
- Implementar
rotinas de leitura e gravação de dados em diferentes origens e destinos
- Trabalhar
com dados estruturados e não estruturados
- Construir
consultas SQL para transformação e análise de dados
- Desenvolver
e otimizar cargas de dados em ambientes distribuídos
- Aplicar
boas práticas de performance em Spark e Databricks
- Trabalhar
com Delta Lake para armazenamento e versionamento de dados
- Participar
da solução de problemas relacionados a performance, particionamento e
processamento distribuído
- Integrar
pipelines de dados com ferramentas de orquestração, como Azure Data
Factory
- Colaborar
com arquitetos, analistas e demais engenheiros na definição de soluções de
dados
Requisitos Obrigatórios
- Experiência
com Databricks
- Conhecimento
de Apache Spark
- Sólidos
conhecimentos de SQL
- Conhecimento de Window Functions (ROW_NUMBER,
RANK, DENSE_RANK, LAG, LEAD, LAST_VALUE, etc.)
- Conhecimento
de modelagem e manipulação de dados
- Conhecimento
de tipos de dados e conversões
- Experiência
com leitura e gravação de arquivos em diferentes formatos
- Conhecimento
de processamento distribuído
- Entendimento
dos conceitos de Cluster Computing
- Conhecimento
dos conceitos de Narrow e Wide Transformations
- Conhecimento
sobre Shuffle e impactos de performance
- Conhecimento
de Projection (Column Pruning)
- Conhecimento
de Predicate Pushdown
- Experiência
com Delta Lake
- Conhecimento
sobre versionamento e recuperação de dados (Time Travel)
- Experiência
com formatos Parquet e Avro
Diferenciais
- Experiência
com Azure Data Factory
- Experiência
em ambientes Lakehouse
- Experiência
com Data Lake em Azure
- Conhecimento
de otimização de workloads Spark
- Experiência
em projetos com grandes volumes de dados
- Conhecimento
de streaming de dados
- Experiência
com CI/CD para pipelines de dados
Competências Esperadas
- Boa
capacidade analítica
- Autonomia
para desenvolvimento de soluções
- Facilidade
para troubleshooting
- Organização
e atenção à qualidade dos dados
- Boa
comunicação com equipes multidisciplinares
- Capacidade
de atuar em ambientes dinâmicos e colaborativos
Período:
6 meses
Local: Híbrido 2 a 3x em
Santo Amaro.
Modelo de contratação:
PJ