Ingénieur senior en IA et données France
Full-time, Contractor
France
Intitulé du poste : Ingénieur(e) Senior en IA et Données — IA pour la Santé
Lieu : France uniquement | Télétravail, temps plein
Rattachement hiérarchique : Directeur de l'Ingénierie
Clients existants : Entreprises du Top 100 des sciences de la vie, des technologies médicales et de l'industrie pharmaceutique
Type de poste : Freelance/CDD, temps plein
Langues : anglais niveau professionnel
Principales responsabilités et objectifs
- Concevoir, développer et maintenir des pipelines de données par lots (batch) et en flux continu (streaming) : ingestion, nettoyage, normalisation, enrichissement et déduplication.
- Concevoir et gérer de bout en bout des pipelines ML/LLM : extraction et parsing de documents, segmentation, génération d'embeddings, indexation vectorielle, appels d'outils, workflows multi-étapes, gestion des nouvelles tentatives, mécanismes de repli (fallback) et gestion de l'état.
- Développer du code Python robuste et testé, capable de traiter de grands volumes de données et de documents de manière fiable.
- Garantir la qualité des pipelines : la détection et la correction des données obsolètes, corrompues ou erronées relèvent de votre responsabilité.
- Travailler en autonomie et respecter les délais des projets avec un minimum d'encadrement..
Qualifications et compétences clés (non négociables)
- Plus de 7 ans d'expérience en développement backend ou en ingénierie des données
- Expérience préalable en startup
- Excellente maîtrise de Python, React et Node
- Expérience pratique des grands ensembles de données et des flux de données à haute vélocité (Kafka, Flink, Spark)
- Maîtrise des outils d'orchestration de pipelines (Airflow, MLflow ou équivalent)
- Solides compétences en SQL (PostgreSQL, BigQuery ou Snowflake) et expérience NoSQL (DynamoDB, OpenSearch, Elastic)
- Expérience concrète des workflows LLM : architectures RAG, embeddings et bases de données vectorielles, ingénierie des prompts, appels de fonctions/outils (function calling), observabilité
- Compréhension approfondie des modèles ETL/ELT et du traitement des données à grande échelle
Profil souhaité (fortement pertinent)
- Expérience de la pile de données AWS à grande échelle
- Connaissance des secteurs de la santé, des sciences de la vie ou des industries réglementées
- Expérience de la conception et de la mise en production de pipelines de données, de ML et de LLM
- A déjà débogué un pipeline et comprend l'importance de l'observabilité
- A travaillé dans une startup dynamique où l'expression « ce n'est pas mon travail » n'a pas sa place