Data Scientist — Traitement et normalisation de corpus juridiques français (H/F)

Abylys Télétravail - Déplacements ponctuels possibles
Nouveau TanitJobs.com
Contrat
Temps plein, Freelance / Indépendant
Salaire
Non communiqué
Secteur
Non spécifié
Date
26/08/2026

Offre externe provenant de TanitJobs.com

Cette offre a été publiée sur TanitJobs.com. Cliquez sur le bouton pour postuler directement sur leur site.

Postuler

Description du poste

Contexte

Nous recherchons un(e) Data Scientist ayant une double compétence en science des données et en droit français pour rejoindre une équipe technique en pleine croissance (déjà composée de trois développeurs, dont deux spécialisés en intelligence artificielle).

Vous interviendrez sur un projet stratégique de structuration, de nettoyage et de valorisation d'un corpus documentaire juridique volumineux et hétérogène, dans une logique de haute qualité de données au service d'applications d'IA avancées (traitement du langage naturel, recherche sémantique, extraction d'information).

Vous serez le/la référent(e) « qualité de la donnée juridique » au sein de l'équipe.

Missions principales

1. Préparation et nettoyage des données juridiques

  • Analyser des corpus documentaires hétérogènes (contrats, courriers, actes, conclusions, décisions, notes internes, correspondances, pièces annexes…) en formats variés (PDF natif, PDF scanné, DOCX, e-mails, exports applicatifs).
  • Concevoir et industrialiser des pipelines d'extraction et de nettoyage (OCR, dé-bruitage, dédoublonnage, détection de doublons quasi-identiques, gestion des versions).
  • Identifier et corriger les anomalies : encodages, artefacts d'OCR, en-têtes/pieds de page, tableaux, signatures, annotations manuscrites.

2. Normalisation et structuration

  • Définir et appliquer des schémas de normalisation adaptés aux typologies documentaires juridiques (métadonnées, hiérarchie, versions, dates de vigueur, parties, références croisées).
  • Mettre en place des taxonomies et référentiels métier (matières du droit, types d'actes, juridictions, statuts procéduraux).
  • Assurer l'anonymisation / pseudonymisation conforme au RGPD des données à caractère personnel.

3. Extraction d'information et annotation

  • Concevoir des modèles / règles d'extraction d'entités juridiques (parties, dates clés, montants, articles cités, juridictions, références légales et jurisprudentielles).
  • Piloter les campagnes d'annotation (guidelines, contrôle qualité inter-annotateurs) et constituer des jeux de données d'évaluation.

4. Qualité et évaluation

  • Définir les KPIs de qualité de la donnée (couverture, précision d'extraction, taux d'erreurs OCR, cohérence des métadonnées).
  • Produire des tableaux de bord de suivi et des rapports d'audit qualité.
  • Concevoir des jeux de tests représentatifs pour évaluer la pertinence des traitements en aval.

5. Collaboration avec l'équipe technique

  • Travailler main dans la main avec les développeurs IA sur les besoins amont : format des chunks, granularité, enrichissement des métadonnées, stratégies d'indexation.
  • Documenter les traitements, les schémas de données et les choix méthodologiques.
  • Contribuer à la veille scientifique (NLP juridique, LegalTech, standards documentaires).

Compétences techniques requises

Data & Python (indispensable)

  • Python confirmé : pandas, numpy, scikit-learn, spaCy, regex avancé.
  • Manipulation de gros volumes de données non structurées.
  • Bonnes pratiques d'ingénierie : Git, tests, environnements Docker (au moins en utilisation).

Traitement de documents

  • OCR (Tesseract, EasyOCR, ou équivalents) et parsing PDF (pdfplumber, PyMuPDF, pypdf).
  • Traitement DOCX, XML, HTML, e-mails (MSG/EML).
  • Extraction de tableaux et de structures hiérarchiques.

NLP appliqué au français

  • Modèles de langue français (CamemBERT, FlauBERT, ou LLM plus récents).
  • Embeddings, similarité sémantique, classification de textes, NER.
  • Notions sur les architectures modernes de recherche d'information (recherche vectorielle, bases vectorielles type Qdrant / FAISS / Weaviate) — *appréciées*.

Données juridiques françaises (indispensable)

  • Bonne connaissance des sources ouvertes du droit français (Légifrance, JORF, jurisprudence judiciaire et administrative, conventions collectives, circulaires).
  • Compréhension de la structure d'un texte juridique (codes, articles, alinéas, sections, versions et dates de vigueur, liens de citation).
  • Familiarité avec les typologies de documents produits par les professionnels du droit (actes, conclusions, courriers, contrats, pièces).

Compétences appréciées

  • Expérience en LegalTech, cabinet d'avocats, direction juridique ou éditeur juridique.
  • Connaissance des formats et référentiels du droit (IDCC, NOR, identifiants Légifrance).
  • Notions de MLOps / DataOps (Airflow, DVC, MLflow).
  • Expérience en anonymisation de documents juridiques (Presidio ou solutions équivalentes).
  • Sensibilité UX / restitution aux utilisateurs métier (avocats, juristes).

Profil recherché

  • Formation : Bac+5 en data science, statistiques, informatique ou NLP, complétée par une formation en droit (Master 1 minimum) — OU — formation initiale en droit avec spécialisation forte en data / IA.
  • Qualités personnelles : rigueur, sens du détail, esprit d'analyse, capacité à dialoguer avec des profils techniques ET des experts métier, autonomie, curiosité pour la matière juridique.
  • Une appétence pour la qualité de la donnée comme fondement de tout projet IA sérieux est essentielle.

Ce que nous offrons

  • Un projet technique de haut niveau avec une équipe pluridisciplinaire (data + dev IA + expertise métier).
  • Un rôle central : vous êtes le/la garant(e) de la qualité du socle documentaire.
  • Environnement technique moderne (Python, Docker, GPU, LLM open source, bases vectorielles).

Candidature Merci d'adresser CV + quelques lignes de motivation + éventuels travaux (repo GitHub, publications, projets NLP juridique)

25/09/2026

Informations complémentaires

Entreprise
Abylys
Localisation
Télétravail - Déplacements ponctuels possibles
Type de contrat
Temps plein, Freelance / Indépendant
Salaire
Non communiqué
Postes vacants
1 poste ouvert
Expérience
1 à 3 ans
Niveau d'études
DESS, DEA, Master, Bac + 5, Grandes Ecoles
Langues
Français

Pour postuler à cette offre, visitez le site de TanitJobs.com

Voir l'offre sur TanitJobs.com