As a Product Data Scientist, you'll leverage quantitative analysis and data mining to enhance user engagement and inform product strategy at Monzo.
Cientista de Dados (IA Generativa)
📜 Description
- Projetar a arquitetura do motor cognitivo, do payload de entrada da API até o JSON de saída.
- Construir prompts especializados, com raciocínio passo a passo, guardrails anti-alucinação e JSON Schema.
- Implementar a análise multimodal com Gemini: OCR e visão computacional em diferentes documentos.
- Estruturar o RAG com chunking semântico, metadados e busca híbrida.
- Criar o framework de avaliação com suítes de teste automatizadas e benchmarks de acurácia.
- Monitorar qualidade, custo e latência da inferência.
🛠️ Requirements
- Python avançado e APIs REST (FastAPI ou similar);
- Experiência prática com LLMs em produção: prompt engineering, saída estruturada em JSON Schema, function calling e técnicas anti-alucinação;
- Experiência comprovada com RAG: embeddings, bancos vetoriais (pgvector, Vertex AI Vector Search, Pinecone, Qdrant ou similar), chunking, reranking e avaliação de recuperação;
- Experiência com modelos multimodais (preferencialmente Gemini) e OCR/visão sobre documentos e imagens;
- Metodologia de avaliação de LLM: golden sets, métricas de acurácia/precisão/recall e testes de regressão;
- Noções de Databricks (notebooks, MLflow, Delta Lake) e AWS para colaborar com a engenharia de dados.
- Git, boas práticas de código e testes automatizados.
- Google Cloud / Vertex AI (Gemini API);
- Frameworks de orquestração (LangChain, LlamaIndex, LangGraph) e ferramentas de avaliação (Ragas, DeepEval, LangSmith ou similar);
- Experiência com seguros, sinistros, regulação ou documentos jurídicos e contratuais;
Full job description
Prazer, somos a ITIX!
Uma fábrica de software com sólida experiência em transformar negócios de ponta a ponta. Com um time de especialistas em diversos setores, construímos um produto adequado às necessidades do negócio do cliente, com a cabeça no futuro, e os pés no presente.
Somos uma empresa de tecnologia preocupada com a diversidade do nosso time - Diferentes pessoas trazem diferentes pensamentos e esse é nosso objetivo por aqui.
Se você é uma pessoa proativa, apaixonada por tecnologia, possui familiaridade com metodologia ágil, gosta de solucionar problemas, buscar melhorias contínuas e bons resultados, se você chegou aqui... temos algo em comum.
Revolucionamos o mercado tradicional de tecnologia, crescemos, evoluímos, e se você deseja fazer parte disso, continue por aqui.
Bora fazer parte do nosso #DreamTeamItix?
Responsibilities
O Cientista de Dados será responsável por:
- Projetar a arquitetura do motor cognitivo, do payload de entrada da API até o JSON de saída;
- Construir prompts especializados, com raciocínio passo a passo, guardrails anti-alucinação e JSON Schema;
- Implementar a análise multimodal com Gemini: OCR e visão computacional em diferentes documentos, com extração estruturada de campos e detecção de inconsistências;
- Estruturar o RAG com chunking semântico, metadados por cobertura/cláusula/limite, embeddings, busca híbrida e reranking;
- Usar casos históricos (deferidos, indeferidos e com exigências) para calibrar o modelo com few-shot, incluindo casos de borda;
- Criar o framework de avaliação: suítes de teste automatizadas, benchmark de acurácia, precisão e recall das decisões, e testes de regressão a cada mudança de prompt ou modelo;
- Monitorar qualidade, custo e latência da inferência (observabilidade de LLM, versionamento de prompts);
- Homologar os resultados com os analistas de negócio.
Requirements
São requisitos obrigatórios:
- Python avançado e APIs REST (FastAPI ou similar);
- Experiência prática com LLMs em produção: prompt engineering, saída estruturada em JSON Schema, function calling e técnicas anti-alucinação;
- Experiência comprovada com RAG: embeddings, bancos vetoriais (pgvector, Vertex AI Vector Search, Pinecone, Qdrant ou similar), chunking, reranking e avaliação de recuperação;
- Experiência com modelos multimodais (preferencialmente Gemini) e OCR/visão sobre documentos e imagens;
- Metodologia de avaliação de LLM: golden sets, métricas de acurácia/precisão/recall e testes de regressão;
- Noções de Databricks (notebooks, MLflow, Delta Lake) e AWS para colaborar com a engenharia de dados.
- Git, boas práticas de código e testes automatizados.
São requisitos desejáveis/diferenciais:
- Google Cloud / Vertex AI (Gemini API);
- Frameworks de orquestração (LangChain, LlamaIndex, LangGraph) e ferramentas de avaliação (Ragas, DeepEval, LangSmith ou similar);
- Experiência com seguros, sinistros, regulação ou documentos jurídicos e contratuais;
- MLflow para versionar prompts e experimentos;
- LGPD e anonimização de dados (mascaramento de PII);
- Guardrails e red teaming de LLM;
- Certificações em Databricks, Google Cloud ou IA.
Similar jobs
Search more Data Scientist jobsAs a Commercial Data Scientist, you'll leverage machine learning and AI to deliver impactful insights, collaborate with cross-functional teams, and create data products that enhance healthcare outcomes.
As a Data Scientist, you'll develop and enhance machine-learning models that process vast amounts of data to improve product performance and drive business outcomes.
As a Data Scientist, you'll develop and enhance machine-learning models to process vast amounts of data, driving improvements in product performance and business outcomes.
As a Data Scientist, you will leverage machine learning and AI to analyze data, enhance user experiences, and lead diverse data projects to inform data-driven decisions.
