Engenheiro de Dados
GRUPO H&W PUBLISHINGBarueri - SP
1 posição
Não informado
Elegível para PCD
Integral
Função: Engenheiro(a) de Dados Sênior
Modelo de Trabalho: 100% home office
Regime de Contratação: Prestador de Serviço (PJ)
Pagamento: USD 2,500.00
Sobre a empresa
A H&W Publishing é uma holding sediada nos Estados Unidos, especializada em marketing de resposta direta e afiliados, com forte atuação no mercado de nutracêuticos.
Fundada por profissionais renomados do marketing digital, a H&W se consolidou rapidamente como referência global no setor. Em seu primeiro ano, alcançou a liderança na América Latina e, no primeiro trimestre de 2025, tornou-se líder global no segmento.
Na H&W, capacitamos nossos parceiros a se tornarem empreendedores digitais de sucesso em um ambiente colaborativo, profissional e orientado a resultado, reunindo alguns dos melhores talentos do mercado de marketing direto.
Sobre a posição
Buscamos um Engenheiro de Dados Sênior para projetar, construir e evoluir nossa plataforma de dados, garantindo escalabilidade, qualidade, confiabilidade e disponibilidade das informações usadas por produtos, operações e times de negócio.
Nosso ambiente é composto por microsserviços em AWS, processamento assíncrono com filas, bancos relacionais, Redis e aplicações orientadas a eventos. Hoje a plataforma gera milhões de registros de navegação/tracking, webhooks, pagamentos, afiliados, produtos, pedidos, logs, métricas operacionais e dados financeiros — processados via microsserviços em AWS com PostgreSQL, Redis, Amazon SQS e Lambda.
O objetivo é evoluir essa arquitetura para uma plataforma de dados moderna, capaz de fornecer informações confiáveis em tempo real para dashboards, análises operacionais, inteligência de negócio e futuras iniciativas de Machine Learning.
Principais Atribuições
- Projetar, construir e evoluir a arquitetura da plataforma de dados da empresa.
- Desenvolver e manter pipelines de ETL/ELT, incluindo extração de APIs, transformações, carga incremental e CDC (Change Data Capture).
- Modelar dados para Data Warehouse, Data Lake e Data Marts, aplicando modelagem dimensional (Star Schema, Snowflake Schema).
- Implementar processamento em batch e streaming, com arquitetura orientada a eventos e processamento assíncrono.
- Garantir performance e confiabilidade dos bancos de dados: modelagem relacional, índices, particionamento, otimização de consultas e replicação.
- Estruturar práticas de Data Quality, Data Lineage, Data Catalog e Data Governance.
- Orquestrar pipelines e tratar dados históricos com versionamento e rastreabilidade.
- Implementar observabilidade dos pipelines: logs, métricas, monitoramento e alertas.
- Disponibilizar dados confiáveis e em tempo real para dashboards, análises operacionais e inteligência de negócio.
- Preparar a base de dados para futuras iniciativas de Machine Learning.
- Automatizar processos e deploys com GitHub Actions e Docker.
- Trabalhar em conjunto com times de produto, engenharia e negócio na definição de requisitos e indicadores.
Requisitos
- Linguagens: Python e SQL avançado.
- Banco de Dados: PostgreSQL e MySQL; modelagem relacional, índices, particionamento, otimização de consultas, replicação e performance.
- Modelagem de Dados: Data Warehouse, Data Lake, Star Schema, Snowflake Schema, Data Mart, modelagem dimensional, normalização e desnormalização.
- ETL / ELT: construção de pipelines, extração de APIs, transformação de dados, incremental load e CDC (Change Data Capture).
- Processamento de Dados: batch processing, streaming, processamento assíncrono e Event-Driven Architecture.
- AWS: S3, Lambda, SQS, RDS, CloudWatch e IAM.
- Mensageria: Amazon SQS.
- Versionamento: Git e GitHub.
- Observabilidade: logs, métricas, monitoramento de pipelines e alertas.
- Automação: GitHub Actions.
- Containers: Docker.
- Engenharia de Dados: Data Quality, Data Lineage, Data Catalog, Data Governance, versionamento de dados, orquestração de pipelines e tratamento de dados históricos.
Diferenciais
- Linguagens: TypeScript e Node.js.
- AWS Analytics: Glue, Athena, EMR, Kinesis e Redshift.
- Mensageria: Kafka e RabbitMQ.
- Orquestração/Automação: Apache Airflow e Prefect.
- Visualização de Dados: Metabase, Power BI e Looker Studio.
- Containers: Kubernetes.
- Experiências relevantes: fintechs ou empresas de pagamentos, grandes volumes de eventos, plataformas de analytics em tempo real, Machine Learning Pipelines, Feature Store, Data Lakehouse, Apache Spark e Apache Iceberg ou Delta Lake.
Requisitos
Idioma
- Inglês - Avançado
Benefícios
- Horário flexível
- Plano de carreira