118.436 ofertas · 58.434 formaciones

Alternant Ingénieur NLP / Data Science (F/H)

Centre Léon Bérard · Lyon (69)
Apprentissage / Professionnalisation
Lieu
Lyon
69001
Publiée
Il y a 33 j
27 juillet 2026
Début
À convenir
Postes
1

💡 Cómo presentar una buena candidatura

  • Personaliza tu candidatura: adapta tu CV y carta de motivación a las funciones y al perfil descritos.
  • Destaca tus primeros logros y tu motivación por el sector, incluso sin gran experiencia — la formación dual forma al candidato, no al revés.
  • Cuida la forma: CV en PDF llamado Nombre-Apellido-CV.pdf, y haz un seguimiento cordial por teléfono o email pasados 8–10 días sin respuesta.

Misiones

L’équipe Data Factory est dédiée à la mise en œuvre et au pilotage de projets de réutilisation de données massives (Big Data). Elle permet l’extraction et le traitement de données des données de santé à destination des projets de recherche clinique ou des industriels. Intégré à une équipe pluridisciplinaire (ingénieurs ML/NLP, data managers, médecins, bio-informaticiens), vous contribuerez à la chaîne de structuration automatique des documents médicaux : de la numérisation et l’extraction de texte (OCR) jusqu’à l’extraction d’information par modèles de langage (NLP, LLM). Cette alternance, encadrée par un tuteur dédié, est une opportunité de monter en compétence sur des cas d’usage réels tout en poursuivant votre formation.MissionsSous la responsabilité de votre tuteur, et en montant progressivement en autonomie, vous participerez à :•      Extraction et prétraitement des documents (OCR) : mise en place et évaluation de pipelines de numérisation et de reconnaissance de caractères pour :–     Vérifier la bonne correspondance des documents du patient dans son dossier (identitovigilance),–     convertir des comptes-rendus en texte exploitable.•      Structuration par NLP : développement de composants de traitement automatique du langage (nettoyage, segmentation, extraction d’entités, classification) adaptés aux documents médicaux.•      Expérimentations avec des LLM : tests et adaptation de grands modèles de langage pour l’extraction et la structuration d’informations cliniques (prompting, évaluation, supervision faible).•      Développement Python : écriture de scripts et de modules réutilisables, contribution à des outils internes, avec de bonnes pratiques de versionnage et de tests.•      Gestion des données : interrogation et manipulation de bases de données (SQL), construction et alimentation de jeux de données structurés.•      Évaluation et documentation : mesure des performances des modèles, analyse des résultats et rédaction d’une documentation claire.

L'entreprise

Le Centre Léon Bérard (#CLB), membre de la fédération Unicancer, est LE pôle de référence régional en cancérologie. Regroupant 2.300 collaborateurs sur un site unique à Lyon 8ème, nous sommes à la fois un hôpital et un centre de recherche.Nous assurons 3 missions essentielles :Le soin : nos équipes soignantes prennent en charge plus de 42.000 patients par an, avec des soins personnalisés et innovantsLa recherche : nos chercheurs et médecins travaillent main dans la main, couvrant les domaines de la recherche fondamentale, translationnelle et cliniqueL’enseignement : chaque année, nous assurons la diffusion des savoirs et formons nos collaborateurs et des professionnels extérieursLe CLB est impliqué dans des projets d’intelligence artificielle depuis plusieurs années avec des partenariats académiques et industriels. Ces projets bénéficient de notre importante base de données de plus de 340 000 patients dans un dossier patient développé en interne et qui a été progressivement informatisé depuis 1993. Depuis quelques années le CLB s’est engagé dans des projets intégrant l’Intelligence Artificielle (IA) et les Big Data en santé. Les prérequis à l’utilisation des données de santé et l’intégration de l’IA en routine est la disponibilité de données structurées et de qualité. C’est devant cette nécessité que la Data Factory a été créée en 2021, dont les objectifs sont de structurer et fiabiliser les données, ce qui implique notamment : (i) Rendre exploitable (extraire l’information utile) une grande quantité de données disponible (ii) Élargir le périmètre des données interconnectées, structurées et requêtables (iii) À plus long terme, la création d’un gisement de données multi-sources, réparti et accessible pour les cliniciens et les chercheurs, basé sur le modèle de données OSIRIS. 
Ce que nous offrons : •      Une alternance sur un projet concret à fort impact pour la recherche en oncologie.•      Un encadrement par des ingénieurs spécialisés en NLP clinique et un tutorat individualisé.•      La montée en compétence sur des technologies de pointe (OCR, NLP, LLM) et des données réelles.•      Un environnement de travail stimulant au sein d’un centre de lutte contre le cancer.

Métier

Codes ROME : H1226

🎓 Encuentra la formación adecuada

Descubre las formaciones que conducen a este oficio (mismo código ROME) y empieza tu trayectoria en alternancia.

Ver formaciones

Localisation

69001 Lyon

📍 Voir sur Google Maps🔍 Rechercher cette offre sur Google