Engenheiro de Dados

GRUPO H&W PUBLISHING

Barueri - SP

1 posição

Não informado

Elegível para PCD

Integral

PJ
Remoto
Sênior
Especialista

Função: Engenheiro(a) de Dados Sênior
Modelo de Trabalho: 100% home office
Regime de Contratação: Prestador de Serviço (PJ)
Pagamento: USD 2,500.00


Sobre a empresa

A H&W Publishing é uma holding sediada nos Estados Unidos, especializada em marketing de resposta direta e afiliados, com forte atuação no mercado de nutracêuticos.

Fundada por profissionais renomados do marketing digital, a H&W se consolidou rapidamente como referência global no setor. Em seu primeiro ano, alcançou a liderança na América Latina e, no primeiro trimestre de 2025, tornou-se líder global no segmento.

Na H&W, capacitamos nossos parceiros a se tornarem empreendedores digitais de sucesso em um ambiente colaborativo, profissional e orientado a resultado, reunindo alguns dos melhores talentos do mercado de marketing direto.


Sobre a posição

Buscamos um Engenheiro de Dados Sênior para projetar, construir e evoluir nossa plataforma de dados, garantindo escalabilidade, qualidade, confiabilidade e disponibilidade das informações usadas por produtos, operações e times de negócio.

Nosso ambiente é composto por microsserviços em AWS, processamento assíncrono com filas, bancos relacionais, Redis e aplicações orientadas a eventos. Hoje a plataforma gera milhões de registros de navegação/tracking, webhooks, pagamentos, afiliados, produtos, pedidos, logs, métricas operacionais e dados financeiros — processados via microsserviços em AWS com PostgreSQL, Redis, Amazon SQS e Lambda.

O objetivo é evoluir essa arquitetura para uma plataforma de dados moderna, capaz de fornecer informações confiáveis em tempo real para dashboards, análises operacionais, inteligência de negócio e futuras iniciativas de Machine Learning.


Principais Atribuições

  • Projetar, construir e evoluir a arquitetura da plataforma de dados da empresa.
  • Desenvolver e manter pipelines de ETL/ELT, incluindo extração de APIs, transformações, carga incremental e CDC (Change Data Capture).
  • Modelar dados para Data Warehouse, Data Lake e Data Marts, aplicando modelagem dimensional (Star Schema, Snowflake Schema).
  • Implementar processamento em batch e streaming, com arquitetura orientada a eventos e processamento assíncrono.
  • Garantir performance e confiabilidade dos bancos de dados: modelagem relacional, índices, particionamento, otimização de consultas e replicação.
  • Estruturar práticas de Data Quality, Data Lineage, Data Catalog e Data Governance.
  • Orquestrar pipelines e tratar dados históricos com versionamento e rastreabilidade.
  • Implementar observabilidade dos pipelines: logs, métricas, monitoramento e alertas.
  • Disponibilizar dados confiáveis e em tempo real para dashboards, análises operacionais e inteligência de negócio.
  • Preparar a base de dados para futuras iniciativas de Machine Learning.
  • Automatizar processos e deploys com GitHub Actions e Docker.
  • Trabalhar em conjunto com times de produto, engenharia e negócio na definição de requisitos e indicadores.

Requisitos

  • Linguagens: Python e SQL avançado.
  • Banco de Dados: PostgreSQL e MySQL; modelagem relacional, índices, particionamento, otimização de consultas, replicação e performance.
  • Modelagem de Dados: Data Warehouse, Data Lake, Star Schema, Snowflake Schema, Data Mart, modelagem dimensional, normalização e desnormalização.
  • ETL / ELT: construção de pipelines, extração de APIs, transformação de dados, incremental load e CDC (Change Data Capture).
  • Processamento de Dados: batch processing, streaming, processamento assíncrono e Event-Driven Architecture.
  • AWS: S3, Lambda, SQS, RDS, CloudWatch e IAM.
  • Mensageria: Amazon SQS.
  • Versionamento: Git e GitHub.
  • Observabilidade: logs, métricas, monitoramento de pipelines e alertas.
  • Automação: GitHub Actions.
  • Containers: Docker.
  • Engenharia de Dados: Data Quality, Data Lineage, Data Catalog, Data Governance, versionamento de dados, orquestração de pipelines e tratamento de dados históricos.

Diferenciais

  • Linguagens: TypeScript e Node.js.
  • AWS Analytics: Glue, Athena, EMR, Kinesis e Redshift.
  • Mensageria: Kafka e RabbitMQ.
  • Orquestração/Automação: Apache Airflow e Prefect.
  • Visualização de Dados: Metabase, Power BI e Looker Studio.
  • Containers: Kubernetes.
  • Experiências relevantes: fintechs ou empresas de pagamentos, grandes volumes de eventos, plataformas de analytics em tempo real, Machine Learning Pipelines, Feature Store, Data Lakehouse, Apache Spark e Apache Iceberg ou Delta Lake.

Requisitos

Idioma

  • Inglês - Avançado

Benefícios

  • Horário flexível
  • Plano de carreira

Localização

Alameda Rio Negro, 500, salas 501 a 508, Torre B, Alphaville Centro Industrial e Empresarial/Alphaville., Barueri - SP, Brasil, 06454-000