Relocantly← All jobs

🇫🇷 Courbevoie, France · 23h ago

Tech lead Expert Data Retrieval RAG

Lefebvre Dalloz

LinkedInlead
Apply on LinkedIn →Get jobs like this daily
Lefebvre Dalloz est la marque française du groupe européen Lefebvre, leader européen des services juridiques et fiscaux qui accompagne au quotidien plus de 275 000 clients grâce à une offre globale de contenus, de formation et de logiciels et services.Depuis plus de 100 ans, nos rédacteurs experts de l’édition juridique et fiscale produisent des contenus fiables, actualisés en temps réel et opérationnels au quotidien. Pionnier de l’innovation dans le secteur juridique en Europe, le Groupe Lefebvre a lancé début 2024 son offre GenIA-L (IA juridique) sur l’ensemble de ses marchés accompagnant ainsi ses clients dans la transformation de leurs métiers.Lefebvre Dalloz compte 1 200 collaborateurs en France et a réalisé un chiffre d’affaires de 301 millions d’euros en 2024. Sa raison d’être : activer la connaissance pour une société plus juste, efficace et durable.Aux côtés d’une équipe d’experts passionnés au sein de l’équipe AI Service, vous relèverez les défis techniques les plus ambitieux du Groupe et du marché de l’édition juridique.En tant qu’Expert Data & Retrieval, vous êtes le garant de la matière première de notre IA : la collecte, l’ingestion, l’indexation et la recherche de pertinence sur des volumes juridiques massifs. Votre travail constitue le socle qui alimente nos modèles de langage, nos moteurs de recherche et nos produits d’IA générative.Votre terrain de jeu : transformer la manière dont tout un secteur, le droit, travaille au quotidien.Votre mission n’est pas d’écrire un simple script, mais de concevoir des pipelines de données robustes capables d’ingérer, nettoyer et indexer d’immenses corpus juridiques, puis d’exposer une recherche rapide et pertinente, à la fois sémantique et hybride, au service de plusieurs équipes à travers l’Europe.Vous garantirez la fraîcheur des index, la qualité du retrieval et la pertinence des résultats tout en relevant des défis techniques complexes liés à la volumétrie, à l’hétérogénéité des sources, à la scalabilité et à l’évaluation continue des performances.Vos missions principales : bâtir, outiller, transmettre Collecte, ingestion & indexationPipelines d’ingestionConcevoir et industrialiser la collecte de données issues de sources variées : contenus éditoriaux, open data, bases juridiques et référentiels internes.Concevoir les chaînes de parsing, nettoyage, normalisation et structuration des documents.Définir les meilleures stratégies de chunking adaptées aux usages IA et RAG.Indexation & EmbeddingsSélectionner et industrialiser les modèles d’embeddings adaptés aux contenus juridiques.Alimenter, optimiser et maintenir les bases vectorielles.Gérer les reconstructions d’index et garantir leur fraîcheur.Participer à l’amélioration continue des mécanismes de recherche documentaire.Qualité & VolumétrieGarantir la scalabilité des pipelines sur des corpus documentaires massifs.Mettre en œuvre les mécanismes de traçabilité et de lignage des données.Assurer le versioning des datasets et des index. Recherche & Pertinence (Retrieval)Stratégie de RetrievalConcevoir les mécanismes de recherche hybride combinant recherche lexicale et recherche sémantique.Combiner efficacement BM25, embeddings, filtrage par métadonnées et reranking.Optimiser la pertinence des résultats pour les utilisateurs finaux et les systèmes d’IA.Évaluation ContinueConstruire des jeux de tests représentatifs des cas d’usage métier.Définir et suivre les métriques de pertinence :RecallPrecisionnDCGMRRPiloter une démarche continue d’amélioration de la qualité du retrieval.RAG & IA GénérativeConcevoir la couche de récupération de contexte alimentant les LLM.Gérer les problématiques de déduplication, citations, gestion du contexte et pertinence documentaire.Participer à l’évolution des architectures RAG du Groupe.Observability & SecurityInstrumenter les pipelines avec des logs, métriques et traces de qualité.Garantir la conformité des traitements de données aux exigences réglementaires (RGPD notamment).Assurer le cloisonnement des données dans un contexte multi-pays. Leadership Technique & GouvernanceExcellence EngineeringPromouvoir les bonnes pratiques de développement :Clean CodeSOLIDrevue de codeautomatisation des testsAccompagnement & TransmissionÊtre référent sur les sujets Data Engineering, Search et Retrieval.Accompagner les équipes produits et IA sur les problématiques de recherche documentaire.Rayonnement TechniqueAssurer une veille technologique constante.Contribuer au rayonnement technique du Groupe :articles techniques,conférences,meetups,open source.Profil recherchéFormationMaster, diplôme d’Ingénieur, PhD ou équivalent.ExpérienceExpérience avérée en Data Engineering et/ou Information Retrieval sur des environnements de production à forte volumétrie.Expérience significative dans la conception et l’exploitation de moteurs de recherche, plateformes documentaires ou systèmes RAG.Anglais courant indispensable dans un contexte de collaboration européenne.Compétences requisesStack cible (à challenger)LangagesPython 3.11+ (maîtrise indispensable)GoIndexation & SearchPgVectorWeaviateQdrantOpenSearchRecherche hybrideBM25Embeddings & NLPSentence TransformersModèles d’embeddingsTokenisationParsing documentaireNLPRAG & LLMLangChainArchitectures RAGRerankingOpenAIMistral AIAWS BedrockData & InfrastructurePostgreSQLAirflowSpark ou équivalentKafkaRedisDockerKubernetesCI/CDTests & ÉvaluationPytestRecallnDCGMRRÉvaluation de la pertinenceCompétences attenduesExpertise Data Engineering & RetrievalVous maîtrisez l’ensemble de la chaîne de valeur de la recherche documentaire moderne :ingestion de données,indexation,embeddings,recherche hybride,vector search,reranking.Vous savez mesurer objectivement la qualité des résultats et mettre en œuvre les actions nécessaires pour améliorer la pertinence.Culture DataVous appliquez les meilleures pratiques de gestion des données :pipelines reproductibles,qualité et gouvernance des données,lignage,métadonnées,versioning des datasets,versioning des index.Solide culture IA / MLVous possédez une bonne compréhension des technologies IA modernes :NLP,embeddings,architectures RAG,fonctionnement des LLM.Sans être nécessairement spécialiste du serving ou du fine-tuning, vous comprenez parfaitement le rôle du Retrieval dans la performance des systèmes d’IA générative.Polyvalence appréciéeUne expérience complémentaire sur d’autres langages, notamment Java, constitue un atout pour contribuer à des sujets transverses.LanguesFrançais courantAnglais courantSoft SkillsVision ProduitVous comprenez les enjeux métiers des professionnels du droit pour prioriser les fonctionnalités.Vous considérez vos index, vos pipelines et votre moteur de recherche comme un véritable produit.Les développeurs qui consomment vos services sont vos premiers clients.Leadership Technique & PédagogieVous aimez partager vos connaissances et accompagner la montée en compétence des équipes.Vous êtes capable d’évangéliser les bonnes pratiques Data, Retrieval et IA à travers l’ensemble de l’organisation.Obsession de la QualitéVous Faites Preuve D’une Exigence Absolue Concernantla qualité des données,la pertinence des résultats,la sécurité,la conformité,la fiabilité des services.Esprit d’InnovationVous êtes curieux des évolutions de l’écosystème :IA générative,NLP,Search,Vector Databases,RAG,Retrieval.CommunicationVous savez vulgariser des concepts complexes et collaborer efficacement avec des interlocuteurs techniques comme métiers.Pourquoi ce poste est unique ?Un rôle stratégique avec un fort pouvoir d’influenceVous intervenez au moment où les décisions structurantes sont prises.Vous disposez d’un réel pouvoir d’influence sur les choix technologiques et l’évolution de la plateforme IA du Groupe.Une complexité métier stimulanteIndexer, structurer et rendre pertinent un patrimoine juridique massif, riche et hétérogène constitue un défi data particulièrement rare.Votre impact sera direct sur la qualité des services d’IA générative utilisés quotidiennement par des mill

Sourced from LinkedIn. Relocantly aggregates public job postings; apply on the original site.