Remote Jobs RockRemote Jobs Rock

Data Platform Engineer

🕒 27 days ago
GCPBigquerySQLPython

📜 Description

  • Architect and maintain the data platform on GCP, defining standards for ingestion, processing, and orchestration.
  • Build and evolve batch and near real-time ingestion pipelines from transactional databases, APIs, and events.
  • Establish data contracts and schema governance to protect consumption layers from upstream failures.
  • Implement end-to-end data observability, including lineage, freshness, volume, and alerts.
  • Treat infrastructure as a product, versioning resources in Terraform and maintaining CI/CD pipelines.
  • Optimize performance and cost in BigQuery, defining strategies for partitioning, clustering, and monitoring.

🛠️ Requirements

  • Technical seniority to make architectural decisions and influence teams beyond your own.
  • Proficiency in SQL: ability to write and debug complex, performant, and readable queries.
  • Solid experience in Python applied to data: building pipelines and integrating with APIs.
  • Practical experience with GCP ecosystem: BigQuery, Cloud Storage, Pub/Sub, and processing services.
  • Experience with orchestration tools like Airflow/Cloud Composer, including idempotency and dependency management.
Full job description

Modelo de trabalho:

📍 Modelo de trabalho 100% remoto

Sobre o time:

O Time de Dados é o alicerce estratégico que transforma dados brutos em inteligência competitiva. Atuamos na fronteira entre tecnologia e negócio, garantindo que a informação seja confiável, acessível e performática e, agora, a fundação de dados para a nossa próxima fronteira: a inteligência artificial generativa aplicada ao negócio. Nosso desafio é construir uma camada de dados robusta que sirva de combustível para que os times de Analytics e Data Science extraiam o máximo valor da nossa plataforma, suportando o crescimento acelerado da companhia com governança e eficiência.



Desafios da posição:

Sua missão será ser a referência técnica em engenharia de dados dentro da GCP, responsável pela espinha dorsal que sustenta todo o consumo analítico da empresa. Você vai arquitetar e implementar pipelines de ingestão e processamento — batch e near real time — sobre BigQuery, definindo os padrões de orquestração, versionamento e infraestrutura como código que o restante do time passa a seguir. Não se trata apenas de entregar pipelines: é desenhar as fundações, os contratos de dados e as ferramentas internas que tornam cada nova fonte e cada novo caso de uso mais barato de construir do que o anterior.

O desafio central é elevar a maturidade da nossa plataforma de dados e preparar o terreno para a nossa estratégia de IA, garantindo confiabilidade, observabilidade e previsibilidade de custo em escala. Você vai construir a camada de base sobre a qual analytics engineers, cientistas de dados e agentes de IA operam com autonomia — com linhagem rastreável, frescor monitorado e acesso governado. Ao final, seja um dashboard, um modelo ou um agente autônomo consumindo os dados, a fonte da informação será única, performática e confiável.


Responsibilities

Seu dia a dia na Conta Simples:

  • Arquitetar e manter a plataforma de dados na GCP, definindo os padrões de ingestão, processamento e orquestração que sustentam todo o consumo analítico da empresa — de dashboards a agentes de IA.
  • Construir e evoluir pipelines de ingestão batch e near real time a partir de bancos transacionais, APIs e eventos, garantindo que novas fontes entrem no BigQuery de forma padronizada e com esforço decrescente.
  • Estabelecer contratos de dados e governança de schema, protegendo as camadas de consumo de quebras em upstream e tornando explícito o acordo entre quem produz e quem consome dados.
  • Implementar observabilidade de dados ponta a ponta — linhagem, frescor, volume e alertas —, para que falhas sejam detectadas pelo time antes de chegarem ao negócio.
  • Tratar infraestrutura como produto, versionando recursos em Terraform, mantendo pipelines de CI/CD e reduzindo o caminho entre uma ideia e um dado disponível em produção.
  • Otimizar performance e custo no BigQuery em escala, definindo estratégias de particionamento, clusterização, reservas e monitoramento de consumo para que o crescimento da empresa não vire crescimento proporcional de custo.
  • Garantir segurança e privacidade dos dados, implementando controles de acesso, mascaramento e políticas de retenção compatíveis com um ambiente financeiro regulado.
  • Atuar como referência técnica e mentor do time, conduzindo decisões de arquitetura, revisões de código e a disseminação de boas práticas de engenharia aplicadas a dados.
  • Colaborar diretamente com Analytics Engineering e Data Science, oferecendo a base e as ferramentas para que essas pessoas trabalhem com autonomia, sem depender de você para cada nova entrega.

Requirements

O que esperamos de você:

  • Senioridade técnica para tomar decisões de arquitetura com trade-offs explícitos e influenciar times além do seu próprio.
  • Domínio em SQL: capacidade de escrever e depurar queries complexas, performáticas e legíveis.
  • Experiência sólida em Python aplicado a dados: construção de pipelines, integrações com APIs e ferramentas internas — com testes e código de qualidade de produção.
  • Ecossistema GCP: vivência prática com BigQuery, Cloud Storage, Pub/Sub e serviços de processamento (Dataflow, Dataproc ou equivalentes).
  • Orquestração: experiência com Airflow/Cloud Composer, incluindo idempotência, backfills e gestão de dependências.
  • Infraestrutura como código e cultura de engenharia: Terraform, Git/GitHub, CI/CD e Code Review como prática cotidiana.
  • Modelagem de dados: entendimento de Data Warehousing e modelagem dimensional o suficiente para desenhar camadas que sirvam bem a quem consome.
  • Experiência com Dataform ou dbt e com o ciclo de vida de transformações versionadas.
  • Confiabilidade e qualidade: prática em testes automatizados de dados, monitoramento e resposta a incidentes.


Será diferencial se você tiver:

  • Experiência com processamento em streaming (Pub/Sub, Dataflow, Kafka ou Flink) em cenários de baixa latência.
  • Vivência com arquiteturas modernas de plataforma de dados: data mesh, catálogo e discovery, self-service para times de negócio.
  • Conhecimento de arquitetura de dados para RAG (Retrieval-Augmented Generation): estruturação de dados e metadados para otimizar a recuperação e o contexto de informações por LLMs.
  • Experiência com Kubernetes, containers e práticas de SRE aplicadas a pipelines de dados.
  • Vivência no setor financeiro ou fintechs, incluindo requisitos de compliance e auditoria.

Anvilogic

Senior Data Operations Engineer

🕒 2 days ago
Anvilogic👥 51 - 200 employees🏢 Computer & Network Security

As a Senior Data Operations Engineer, you will ensure the health, performance, and cost efficiency of Snowflake accounts for customers, optimizing their data environments and providing expert support.

SnowflakeData OperationsData EngineeringDatabase Administration

Trusted by Remote Workers