DATA SCIENTIST – NLP & IA EN SANTÉ

CDIJour
Nouveau

Description du poste

Au sein de l'équipe Data Science, vous aurez pour mission de développer, valider et maintenir des algorithmes et bibliothèques logicielles facilitant l'exploitation des données issues du système d'information clinique à des fins de recherche et de pilotage. 

Vous vous concentrerez en particulier sur le traitement automatique du langage permettant de transformer les données textuelles de l'EDS en données structurées directement exploitables. Vous serez également impliqué dans le développement et l'adaptation de modèles de langage (LLM) pour des cas d'usage cliniques concrets. 

Les développements que vous réaliserez seront diffusés au sein de la communauté de recherche et vous serez amené(e) à contribuer à des articles scientifiques valorisant ces travaux d'un point de vue académique. 

Missions principales 

  • Consolidation de l'expression de besoin « traitement automatique du langage » avec les équipes de recherche et de pilotage de l'EDS 

  • Développement, validation et maintenance de bibliothèques logicielles scientifiques écrites en Python 

  • Développement et déploiement de modèles de machine learning et deep learning pour le pré-traitement des données 

  • Implication dans le développement de LLM médicaux et leur adaptation à des cas d'usage cliniques 

  • Rédaction de la documentation technique et utilisateur 

  • Développement de partenariats académiques 

  • Contribution à l'écriture d'articles scientifiques 

Missions ponctuelles 

  • Support utilisateur et formation au traitement automatique du langage 

  • Conseil interne et accompagnement des projets de recherche 

  • Promotion des outils et des pratiques de l’équipe Data Science aux équipes cliniques 

  • Participation aux Data Challenges et initiatives d'innovation 


Formation et expérience 

  • Diplôme d'ingénieur ou équivalent (Bac+5, Master 2) en data science 

  • 3 ans d'expérience démontrant une maîtrise de Python et des bonnes pratiques de revue de code et d'intégration continue 

Compétences techniques 

Vous avez un savoir-faire dans plusieurs de ces domaines : 

  • Expertise en traitement automatique des langues (NLP), utilisation et entraînement de modèles de langue (LLM) 

  • Expertise en statistiques 

  • Expertise en analyse de bases de données (SQL) 

  • Expertise en développement de modèles de machine learning (Huggingface, PyTorch, etc.) 

  • Expertise en calcul distribué et data management 

  • Expertise en développement Python 

  • Expertise en déploiement de modèles statistiques/machine learning 

  • Maîtrise de Linux et Git 

  • Anglais courant (interactions avec des partenaires internationaux) 

Qualités humaines 

  • Autonomie, flexibilité et sens des responsabilités 

  • Curiosité, dynamisme et créativité, avec une réelle envie d'innover 

  • Esprit d'équipe et volonté de prendre part à une aventure collective 

  • Capacité de vulgarisation des enjeux techniques à un public non-spécialiste 

  • Sens de l'écoute, du résultat et de la qualité 

Processus de recrutement 

  • QCM en ligne éliminatoire (15 minutes) 

  • Entretien avec des membres de l'Unité Data (visio), incluant une revue du parcours professionnel du candidat et une évaluation technique en Python et Machine Learning, sans assistance d'IA pour le code, sur un notebook Collab de 30 minutes. Durée estimée : 2 heures maximum 

  • Étape 3 : Entretien managérial. Durée estimée : 45 minutes 

  • Informations pratiques 

Lieu : Hôpital Foch – 40 rue Worth, 92150 Suresnes 

Accès : Transilien L et U (Gare de Suresnes-Mont-Valérien), Tramway T2 (Station Suresnes-Longchamp) 

Type de contrat : CDI 

Statut : Établissement de Santé Privé d'Intérêt Collectif (ESPIC) 

Candidatures à l'adresse suivante : m.stefanon@hopital-foch.com


L'Hôpital Foch est un établissement de santé privé d'intérêt collectif (ESPIC) situé à Suresnes, dans les Hauts-de-Seine. Fondé en 1936, il est géré par l'association Hôpital Foch et appartient à la Fondation Foch. Avec ses 2 000 collaborateurs dont 300 médecins, ses 600 lits et plus de 260 000 consultations annuelles, l'Hôpital Foch figure parmi les plus importants établissements hospitaliers d'Île-de-France. 

L'établissement est reconnu pour son excellence dans plusieurs domaines de spécialité : pathologies pulmonaires et respiratoires, urologie et néphrologie, neurosciences, ainsi que son pôle mère-enfant. Pionnier dans le domaine de la transplantation depuis les premières greffes rénales entre patients non jumeaux en 1960, l'Hôpital Foch dispose aujourd'hui d'une Chaire universitaire de transplantation en partenariat avec l'Université de Versailles Saint-Quentin-en-Yvelines. 

Plus d'informations : www.hopital-foch.com 

La transformation numérique et l'Intelligence Artificielle 

L'Hôpital Foch a été le premier établissement du réseau RESPIC à se doter d'un Entrepôt de Données de Santé (EDS) en 2020. Chef de file du consortium EDGAR, l'hôpital impulse une dynamique d'implémentation d'entrepôts de données de santé pour faciliter la recherche clinique. 

L'établissement déploie une stratégie ambitieuse d'intégration de l'intelligence artificielle au service des soignants et des patients. En partenariat avec des acteurs majeurs du secteur (Microsoft, Owkin, Incepto, Siemens Healthineers, Botdesign, Lifen...), l'Hôpital Foch développe des solutions innovantes dans de nombreux domaines : 

  • Aide au diagnostic en imagerie médicale (radiologie, médecine nucléaire) 

  • Transcription automatique des comptes rendus médicaux (DAX Copilot) 

  • Optimisation des plannings et de l'organisation des soins 

  • Enrichissement des cohortes d'essais cliniques par données augmentées 

  • Projets multicentriques de recherche (LUCC en oncologie, CUB en pneumologie) 

  • Organisation de Data Challenges internationaux (DigiLut sur la greffe pulmonaire) 

L'équipe Data Science 

L'équipe Data Science a pour mission de faciliter l'analyse de l'Entrepôt de Données de Santé, qui contient les données médicales de plusieurs millions de patients. Elle développe des bibliothèques scientifiques et des algorithmes permettant de transformer les données brutes en informations exploitables par les chercheurs et les cliniciens. L'équipe travaille en étroite collaboration avec les services cliniques et de nombreux partenaires académiques et industriels sur des cas d’usage divers. 

Vos missions 

Au sein de l'équipe Data Science, vous aurez pour mission de développer, valider et maintenir des algorithmes et bibliothèques logicielles facilitant l'exploitation des données issues du système d'information clinique à des fins de recherche et de pilotage. 

Vous vous concentrerez en particulier sur le traitement automatique du langage permettant de transformer les données textuelles de l'EDS en données structurées directement exploitables. Vous serez également impliqué dans le développement et l'adaptation de modèles de langage (LLM) pour des cas d'usage cliniques concrets. 

Les développements que vous réaliserez seront diffusés au sein de la communauté de recherche et vous serez amené(e) à contribuer à des articles scientifiques valorisant ces travaux d'un point de vue académique.