Remote Jobs RockRemote Jobs Rock

Cientista de Dados (IA Generativa)

🕒 2 days ago
PythonAPIs RESTLLMsPrompt Engineering

📜 Description

  • Projetar a arquitetura do motor cognitivo, do payload de entrada da API até o JSON de saída.
  • Construir prompts especializados, com raciocínio passo a passo, guardrails anti-alucinação e JSON Schema.
  • Implementar a análise multimodal com Gemini: OCR e visão computacional em diferentes documentos.
  • Estruturar o RAG com chunking semântico, metadados e busca híbrida.
  • Criar o framework de avaliação com suítes de teste automatizadas e benchmarks de acurácia.
  • Monitorar qualidade, custo e latência da inferência.

🛠️ Requirements

  • Python avançado e APIs REST (FastAPI ou similar);
  • Experiência prática com LLMs em produção: prompt engineering, saída estruturada em JSON Schema, function calling e técnicas anti-alucinação;
  • Experiência comprovada com RAG: embeddings, bancos vetoriais (pgvector, Vertex AI Vector Search, Pinecone, Qdrant ou similar), chunking, reranking e avaliação de recuperação;
  • Experiência com modelos multimodais (preferencialmente Gemini) e OCR/visão sobre documentos e imagens;
  • Metodologia de avaliação de LLM: golden sets, métricas de acurácia/precisão/recall e testes de regressão;
  • Noções de Databricks (notebooks, MLflow, Delta Lake) e AWS para colaborar com a engenharia de dados.
  • Git, boas práticas de código e testes automatizados.
  • Google Cloud / Vertex AI (Gemini API);
  • Frameworks de orquestração (LangChain, LlamaIndex, LangGraph) e ferramentas de avaliação (Ragas, DeepEval, LangSmith ou similar);
  • Experiência com seguros, sinistros, regulação ou documentos jurídicos e contratuais;
Full job description

Prazer, somos a ITIX!


Uma fábrica de software com sólida experiência em transformar negócios de ponta a ponta. Com um time de especialistas em diversos setores, construímos um produto adequado às necessidades do negócio do cliente, com a cabeça no futuro, e os pés no presente.


Somos uma empresa de tecnologia preocupada com a diversidade do nosso time - Diferentes pessoas trazem diferentes pensamentos e esse é nosso objetivo por aqui.


Se você é uma pessoa proativa, apaixonada por tecnologia, possui familiaridade com metodologia ágil, gosta de solucionar problemas, buscar melhorias contínuas e bons resultados, se você chegou aqui... temos algo em comum.


Revolucionamos o mercado tradicional de tecnologia, crescemos, evoluímos, e se você deseja fazer parte disso, continue por aqui.


Bora fazer parte do nosso #DreamTeamItix?


Responsibilities

O Cientista de Dados será responsável por:

- Projetar a arquitetura do motor cognitivo, do payload de entrada da API até o JSON de saída;

- Construir prompts especializados, com raciocínio passo a passo, guardrails anti-alucinação e JSON Schema;

- Implementar a análise multimodal com Gemini: OCR e visão computacional em diferentes documentos, com extração estruturada de campos e detecção de inconsistências;

- Estruturar o RAG com chunking semântico, metadados por cobertura/cláusula/limite, embeddings, busca híbrida e reranking;

- Usar casos históricos (deferidos, indeferidos e com exigências) para calibrar o modelo com few-shot, incluindo casos de borda;

- Criar o framework de avaliação: suítes de teste automatizadas, benchmark de acurácia, precisão e recall das decisões, e testes de regressão a cada mudança de prompt ou modelo;

- Monitorar qualidade, custo e latência da inferência (observabilidade de LLM, versionamento de prompts);

- Homologar os resultados com os analistas de negócio.

Requirements

São requisitos obrigatórios:

- Python avançado e APIs REST (FastAPI ou similar);

- Experiência prática com LLMs em produção: prompt engineering, saída estruturada em JSON Schema, function calling e técnicas anti-alucinação;

- Experiência comprovada com RAG: embeddings, bancos vetoriais (pgvector, Vertex AI Vector Search, Pinecone, Qdrant ou similar), chunking, reranking e avaliação de recuperação;

- Experiência com modelos multimodais (preferencialmente Gemini) e OCR/visão sobre documentos e imagens;

- Metodologia de avaliação de LLM: golden sets, métricas de acurácia/precisão/recall e testes de regressão;

- Noções de Databricks (notebooks, MLflow, Delta Lake) e AWS para colaborar com a engenharia de dados.

- Git, boas práticas de código e testes automatizados.


São requisitos desejáveis/diferenciais:

- Google Cloud / Vertex AI (Gemini API);

- Frameworks de orquestração (LangChain, LlamaIndex, LangGraph) e ferramentas de avaliação (Ragas, DeepEval, LangSmith ou similar);

- Experiência com seguros, sinistros, regulação ou documentos jurídicos e contratuais;

- MLflow para versionar prompts e experimentos;

- LGPD e anonimização de dados (mascaramento de PII);

- Guardrails e red teaming de LLM;

- Certificações em Databricks, Google Cloud ou IA.

Doximity

Commercial Data Scientist

🕒 3 days ago
Doximity👥 501 - 1000 employees🏢 Healthcare

As a Commercial Data Scientist, you'll leverage machine learning and AI to deliver impactful insights, collaborate with cross-functional teams, and create data products that enhance healthcare outcomes.

Machine LearningAI TechnologiesData AnalysisStatistical Concepts

Trusted by Remote Workers