Remote Jobs RockRemote Jobs Rock

Analista de Dados

🕒 12 days ago
Data EngineeringPythonPysparkSQL

📜 Description

  • Develop and deploy ingestion pipelines from heterogeneous sources: REST APIs, web scraping, SQL procedures from legacy systems, and files.
  • Support the implementation of read-only replication mechanisms for systems without direct database access, focusing on performance impact.
  • Participate in cost and performance benchmarks, contributing to efficient scaling decisions.
  • Model and maintain Bronze, Silver, and Gold layers following the medallion architecture standard.
  • Implement resilient scraping pipelines with layout change detection and blocking handling.
  • Build dashboards and reports in Power BI from the structured data layer.

🛠️ Requirements

  • Formação superior completa em Ciência da Computação, Engenharia da Computação, Análise de Sistemas, ou equivalente;
  • Experiência sólida em engenharia de dados, domínio de Python/PySpark e SQL;
  • Experiência prática com Databricks (ou Spark em geral) e ferramentas de orquestração como Azure Data Factory;
  • Conhecimento de formatos de dados analíticos (Parquet, Delta Lake);
  • Experiência com dbt é desejável;
  • Conhecimento de práticas de controle de versão (Git) e CI/CD para pipelines de dados;
  • Experiência com integração de dados via API REST;
  • Conhecimento de boas práticas de visualização de dados e storytelling com dados;
  • Experiência com fontes de dados diversas (SQL, APIs, arquivos, Lakehouse/Warehouse);
  • Experiência implementando segurança em nível de linha (Row Level Security);
Full job description

PcDs são sempre bem-vindas.


Buscamos pessoas apaixonadas por tecnologia. Alguém que se motive por desafios e atue com autonomia. Precisa gostar de trabalhar em equipe e possuir espírito colaborativo.

Responsibilities

  • Desenvolver e implantar pipelines de ingestão a partir de fontes heterogêneas: APIs REST, scraping web, procedures SQL de sistemas legados e arquivos;
  • Apoiar a implementação de mecanismos de réplica somente leitura para sistemas que não oferecem acesso direto ao banco (ex.: ERPs legados), com atenção ao impacto de performance nos sistemas de origem.Implementar transformações de dados em Azure Databricks / Fabric Spark usando PySpark e SQL;
  • Participar de benchmarks de custo e performance de processamento, contribuindo para a definição de dimensionamento mais eficiente;
  • Modelar e manter as camadas Bronze, Silver e Gold seguindo o padrão medallion architecture;
  • Implementar pipelines de scraping resilientes, com mecanismos de detecção de mudança de layout e tratamento de bloqueio;
  • Construir as camadas Bronze, Silver e Gold da plataforma, aplicando deduplicação, normalização e testes de qualidade de dados;
  • Desenvolver mecanismos de contrato de dados (data contracts) e alertas de schema drift para integrações de terceiros;
  • Construir dashboards e relatórios em Power BI a partir da camada de dados estruturada;
  • Traduzir requisitos de negócio em modelos de dados e visualizações eficazes;
  • Implementar controle de acesso a dados nos relatórios (Row Level Security), alinhado às políticas de RBAC da empresa;
  • Implementar testes de qualidade de dados e transformações declarativas usando dbt;
  • Apoiar a configuração de recursos de self-service analytics (ex.: Fabric Copilot);
  • Colaborar com o time de governança para garantir lineage e classificação adequada dos dados;
  • Diagnosticar e resolver problemas de performance em pipelines e consultas;
  • Realizar testes de aceitação com usuários finais e ajustar dashboards a partir do feedback.

Requirements

  • Formação superior completa em Ciência da Computação, Engenharia da Computação, Análise de Sistemas, ou equivalente;
  • Experiência sólida em engenharia de dados, domínio de Python/PySpark e SQL;
  • Experiência prática com Databricks (ou Spark em geral) e ferramentas de orquestração como Azure Data Factory;
  • Conhecimento de formatos de dados analíticos (Parquet, Delta Lake);
  • Experiência com dbt é desejável;
  • Conhecimento de práticas de controle de versão (Git) e CI/CD para pipelines de dados;
  • Experiência com integração de dados via API REST;
  • Conhecimento de boas práticas de visualização de dados e storytelling com dados;
  • Experiência com fontes de dados diversas (SQL, APIs, arquivos, Lakehouse/Warehouse);
  • Experiência implementando segurança em nível de linha (Row Level Security);
  • Disponibilidade para viagens para cidade de São Paulo é um diferencial;
  • Inglês avançado é diferencial.
OpenTable

Data Engineer II (Restaurant AI CoPilot)

🕒 11 days ago
OpenTable👥 1001 - 5000 employees🏢 Hospitality

As a Data Engineer on the Data Science team at OpenTable, you will design, build, and maintain robust data solutions that power diner features, partner integrations, and advanced AI initiatives.

Data EngineeringData ArchitectureSoftware DesignPython

Trusted by Remote Workers