Now hiring

Tech lead Expert Data Retrieval RAG - Freelance (H/F) @ Collective.work

FR101, FROnsiteFull-time
Apply with ResuMinder

Opens on the employer's site

About this role

LE CONTEXTE Rejoignez une aventure data au cœur de la Legaltech : notre client construit le moteur de recherche et d'indexation qui donnera accès, demain, à un patrimoine juridique massif et hétérogène pour plusieurs équipes à travers l'Europe. Votre mission n'est pas d'écrire un simple script : c'est de concevoir des pipelines de données robustes, capables d'ingérer, nettoyer et indexer d'énormes corpus juridiques, puis d'exposer une recherche rapide, pertinente et hybride (sémantique + lexicale) à grande échelle. VOS MISSIONS AU QUOTIDIEN 1. Collecte, ingestion & indexation * Concevoir des pipelines d'ingestion sur des sources hétérogènes (édition, open data, bases juridiques) : parsing, nettoyage, chunking, normalisation. * Choisir et industrialiser les modèles d'embeddings, alimenter et maintenir les bases vectorielles. * Garantir la fraîcheur des index, la scalabilité sur des volumétries massives et la traçabilité (lignage, versioning). 2. Recherche & pertinence (Retrieval) * Combiner recherche lexicale et sémantique (BM25 + embeddings), reranking et filtrage par métadonnées. * Mettre en place des métriques de pertinence (recall, precision, nDCG, MRR) et les faire vivre dans le temps. * Structurer la phase de retrieval qui alimente les LLM (RAG : contexte, citations, dé-duplication, gestion des fenêtres de contexte). * Instrumenter les pipelines (logs, métriques, traces qualité) et garantir la sécurité/conformité des données (RGPD, cloisonnement par pays). 3. Leadership technique & gouvernance * Promouvoir une culture Clean Code, SOLID et tests automatisés. * Contribuer au rayonnement technique du groupe (articles, meetups, open-source). FORMATION Master, PhD ou équivalent. COMPÉTENCES ATTENDUES * Expérience avérée en data engineering / information retrieval sur des volumes massifs en production. * Expertise Retrieval confirmée : indexation, embeddings, recherche hybride - et capacité à mesurer puis améliorer la pertinence. * Culture Data forte : pipelines reproductibles, qualité et lignage des données, versioning des datasets/index. * Solide culture IA / ML (embeddings, NLP, bonne compréhension des LLM, sans nécessairement en être l'expert serving). * Un plus : appétence pour d'autres langages (notamment Java) pour des sujets transverses. * Anglais fluide (contexte européen quotidien). SOFT SKILLS * Vision produit : vos index et votre moteur de recherche sont gérés comme un produit ; les autres développeurs sont vos clients. * Leadership technique & pédagogie : capacité à évangéliser les bonnes pratiques data/retrieval/IA. * Obsession de la qualité : rigueur absolue sur la sécurité des données (Legaltech oblige) et la fiabilité des services. * Esprit d'innovation : curiosité pour les avancées IA, NLP et data. * Communication : savoir vulgariser des concepts complexes. Python 3.11+ (maîtrise requise), GoIndexationBases vectorielles (pgvector, Weaviate, Qdrant, OpenSearch), recherche hybride / BM25Embeddings & NLPsentence-transformers, modèles d'embeddings, tokenisation, parsing de documentsRAG & LLMLangChain, RAG, reranking, OpenAI, Mistral, BedrockData & infraPostgreSQL, Airflow / Spark, Kafka, Redis, Docker, CI/CD, K8sTests & qualitéPytest, évaluation de pertinence (recall, nDCG, MRR)

Ready to apply?

Install the ResuMinder extension and we'll auto-fill the application in seconds — no rewriting.

See how your CV scores