Na Confederação da Agricultura e Pecuária do Brasil - CNA contamos com um time de tecnologia com profissionais experientes.
Profissional responsável por projetar, construir e manter pipelines de dados que alimentam tanto sistemas analíticos tradicionais (BI, relatórios) quanto soluções de Inteligência Artificial (busca semântica, RAG, treinamento e avaliação de modelos).
Requisitos Obrigatórios
Nível superior completo em Engenharia de Dados, com especialização na área de TI.
Experiência robusta em Linguagens: SQL avançado; Python (pandas, PySpark); shell scripting.
Orquestração: Airflow ou similar; versionamento de pipelines.
Processamento: Batch (Spark) e streaming (Kafka, Logstash); processamento distribuído.
Armazenamento: Data warehouses (SQL Server, ClickHouse, Fabric); data lakes; formatos colunares (Parquet).
Bancos de dados: SQL Server, PostgreSQL, bancos NoSQL/, bancos de busca (Elasticsearch/OpenSearch).
Infraestrutura: Kubernetes, containers, CI/CD para pipelines de dados.
Modelagem: Modelagem dimensional, Arquitetura Medalhão, qualidade e testes de dados.
Observabildade e observabilidade de dados.
Linux.
API Rest.
Conhecimento em banco de dados relacionais (DML, DDL, Postgres, SQL Server, Oracle).
Utilizar ambiente e linguagens para manipulação de dados nos diversos modelos de SGBD.
Principais Atividades e Responsabilidades
Projetar, monitorar e manter pipelines de ingestão, transformação e carga (ETL/ELT) em lote e streaming em ambiente on-premisses e nuvem (AWS).
Garantir qualidade, linhagem e governança de dados.
Modelar dados para consumo analítico e para consumo por sistemas de IA (chunking, embeddings, feature stores).
Construir e operar pipelines específicos de IA: geração e atualização de embeddings, indexação em bancos vetoriais, preparação de datasets de treinamento/avaliação.
Monitorar performance, custo e disponibilidade dos pipelines (observabilidade de dados)
Colaborar com Engenharia de Software e Ciência de Dados na definição de contratos de dados e SLAs.
Garantir segurança, privacidade e conformidade no uso de dados por modelos de IA (mascaramento, anonimização, controle de acesso).
Projetar crescimento do ambiente de dados otimizando os recursos de infraestrutura.
Diferenciais Desejáveis
Conhecimento prático em Apache Airflow para orquestração, monitoramento e automação de alertas de pipelines de ingestão de dados;
Familiaridade com arquiteturas multiagentes de IA e o desenvolvimento de roteadores dinâmicos de agentes especializados;
Práticas consolidadas de DevOps / DevSecOps e automação de alertas operacionais integrados com o Microsoft Teams e abertura automática de incidentes via Jira;
Experiência no ecossistema de dados do agronegócio e alta disponibilidade de sistemas voltados ao produtor rural.
Benefícios:
Assistência Médica e Odontológica, vale-transporte, tíquete alimentação/refeição, plano de previdência privada, seguro de vida corporativa e gratificação por desempenho.
Aplicar-se a Vaga
Instituto CNA
https://cnabrasil.org.br/senar/processo-seletivo
Não Informado
CLT
Publicada há 49 minutos