Desenvolver, otimizar e manter pipelines de processamento de dados usando Apache Spark.
Implementar soluções de ingestão e transformação de dados em grande escala.
Trabalhar com equipes de engenharia de dados para integrar novas fontes de dados e aprimorar as existentes.
Garantir a qualidade, consistência e disponibilidade dos dados processados.
Realizar monitoramento e troubleshooting de jobs Spark, otimizando o desempenho e a utilização de recursos.
Participar da definição de arquiteturas de dados e estratégias de processamento distribuído.
Documentar processos, modelos de dados e fluxos de trabalho para garantir a manutenibilidade e escalabilidade.
Experiência comprovada (mínimo de 3 anos) com desenvolvimento e otimização de aplicações Apache Spark.
Proficiência em linguagens de programação como Scala ou Python para desenvolvimento Spark.
Conhecimento sólido em ecossistemas Hadoop (HDFS, YARN, Hive) e/ou ambientes de nuvem (AWS EMR, Databricks, GCP Dataproc).
Experiência com processamento de dados em batch e streaming (Spark Streaming, Kafka).
Familiaridade com bancos de dados NoSQL (Cassandra, MongoDB) e/ou SQL para integração de dados.
Entendimento de conceitos de data warehousing e data lakes.
Experiência com ferramentas de controle de versão (Git) e metodologias ágeis.
Apache Spark
Scala / Python
Hadoop Ecosystem
Spark Streaming
SQL / NoSQL
AWS EMR / Databricks
Data Lake Design
Kafka
Otimização de Performance
QUIMASSA
https://quimassa.com/
R$3623
CLT
Publicada há 55 minutos