← CarreiraAI
OTHER
Remoto
Engenheiro de Dados
GRUPO H&W PUBLISHING · Barueri, São Paulo
Publicada em 21/07/2026
Candidatar-se com o CarreiraAI →
<p><strong>Função:</strong> Engenheiro(a) de Dados Sênior<br /><strong>Modelo de Trabalho:</strong> 100% home office<br /><strong>Regime de Contratação:</strong> Prestador de Serviço (PJ)<br /><strong>Pagamento:</strong> USD 2,500.00</p>
<hr />
<p><strong>Sobre a empresa</strong></p>
<p>A H&W Publishing é uma holding sediada nos Estados Unidos, especializada em marketing de resposta direta e afiliados, com forte atuação no mercado de nutracêuticos.</p>
<p>Fundada por profissionais renomados do marketing digital, a H&W se consolidou rapidamente como referência global no setor. Em seu primeiro ano, alcançou a liderança na América Latina e, no primeiro trimestre de 2025, tornou-se líder global no segmento.</p>
<p>Na H&W, capacitamos nossos parceiros a se tornarem empreendedores digitais de sucesso em um ambiente colaborativo, profissional e orientado a resultado, reunindo alguns dos melhores talentos do mercado de marketing direto.</p>
<hr />
<p><strong>Sobre a posição</strong></p>
<p>Buscamos um Engenheiro de Dados Sênior para projetar, construir e evoluir nossa plataforma de dados, garantindo escalabilidade, qualidade, confiabilidade e disponibilidade das informações usadas por produtos, operações e times de negócio.</p>
<p>Nosso ambiente é composto por microsserviços em AWS, processamento assíncrono com filas, bancos relacionais, Redis e aplicações orientadas a eventos. Hoje a plataforma gera milhões de registros de navegação/tracking, webhooks, pagamentos, afiliados, produtos, pedidos, logs, métricas operacionais e dados financeiros — processados via microsserviços em AWS com PostgreSQL, Redis, Amazon SQS e Lambda.</p>
<p>O objetivo é evoluir essa arquitetura para uma plataforma de dados moderna, capaz de fornecer informações confiáveis em tempo real para dashboards, análises operacionais, inteligência de negócio e futuras iniciativas de Machine Learning.</p>
<hr />
<p><strong>Principais Atribuições</strong></p>
<ul>
<li>Projetar, construir e evoluir a arquitetura da plataforma de dados da empresa.</li>
<li>Desenvolver e manter pipelines de ETL/ELT, incluindo extração de APIs, transformações, carga incremental e CDC (Change Data Capture).</li>
<li>Modelar dados para Data Warehouse, Data Lake e Data Marts, aplicando modelagem dimensional (Star Schema, Snowflake Schema).</li>
<li>Implementar processamento em batch e streaming, com arquitetura orientada a eventos e processamento assíncrono.</li>
<li>Garantir performance e confiabilidade dos bancos de dados: modelagem relacional, índices, particionamento, otimização de consultas e replicação.</li>
<li>Estruturar práticas de Data Quality, Data Lineage, Data Catalog e Data Governance.</li>
<li>Orquestrar pipelines e tratar dados históricos com versionamento e rastreabilidade.</li>
<li>Implementar observabilidade dos pipelines: logs, métricas, monitoramento e alertas.</li>
<li>Disponibilizar dados confiáveis e em tempo real para dashboards, análises operacionais e inteligência de negócio.</li>
<li>Preparar a base de dados para futuras iniciativas de Machine Learning.</li>
<li>Automatizar processos e deploys com GitHub Actions e Docker.</li>
<li>Trabalhar em conjunto com times de produto, engenharia e negócio na definição de requisitos e indicadores.</li>
</ul>
<hr />
<p><strong>Requisitos</strong></p>
<ul>
<li><strong>Linguagens:</strong> Python e SQL avançado.</li>
<li><strong>Banco de Dados:</strong> PostgreSQL e MySQL; modelagem relacional, índices, particionamento, otimização de consultas, replicação e performance.</li>
<li><strong>Modelagem de Dados:</strong> Data Warehouse, Data Lake, Star Schema, Snowflake Schema, Data Mart, modelagem dimensional, normalização e desnormalização.</li>
<li><strong>ETL / ELT:</strong> construção de pipelines, extração de APIs, transformação de dados, incremental load e CDC (Change Data Capture).</li>
<li><strong>Processamento de Dados:</strong> batch processing, streaming, processamento assíncrono e Event-Driven Architecture.</li>
<li><strong>AWS:</strong> S3, Lambda, SQS, RDS, CloudWatch e IAM.</li>
<li><strong>Mensageria:</strong> Amazon SQS.</li>
<li><strong>Versionamento:</strong> Git e GitHub.</li>
<li><strong>Observabilidade:</strong> logs, métricas, monitoramento de pipelines e alertas.</li>
<li><strong>Automação:</strong> GitHub Actions.</li>
<li><strong>Containers:</strong> Docker.</li>
<li><strong>Engenharia de Dados:</strong> Data Quality, Data Lineage, Data Catalog, Data Governance, versionamento de dados, orquestração de pipelines e tratamento de dados históricos.</li>
</ul>
<hr />
<p><strong>Diferenciais</strong></p>
<ul>
<li><strong>Linguagens:</strong> TypeScript e Node.js.</li>
<li><strong>AWS Analytics:</strong> Glue, Athena, EMR, Kinesis e Redshift.</li>
<li><strong>Mensageria:</strong> Kafka e RabbitMQ.</li>
<li><strong>Orquestração/Automação:</strong> Apache Airflow e Prefect.</li>
<li><strong>Visualização de Dados:</strong> Metabase, Power BI e Looker Studio.</li>
<li><strong>Containers:</strong> Kubernetes.</li>
<li><strong>Experiências relevantes:</strong> fintechs ou empresas de pagamentos, grandes volumes de eventos, plataformas de analytics em tempo real, Machine Learning Pipelines, Feature Store, Data Lakehouse, Apache Spark e Apache Iceberg ou Delta Lake.</li>
</ul>
Candidatar-se com o CarreiraAI →