Les missions du poste


Établissement : École normale supérieure - PSL (ENS-PSL) École doctorale : Physique en Ile de France Laboratoire de recherche : Laboratoire de Physique de l'École normale supérieure Direction de la thèse : Marylou GABRIÉ ORCID 0000000259891018 Début de la thèse : 2026-10-01 Date limite de candidature : 2026-07-31T23:59:59 La modélisation générative vise l'apprentissage non supervisé d'un modèle probabiliste capable de générer des données correspondant à des réalisations typiques fournies comme données d'entraînement. Diverses approches ont désormais démontré que les modèles génératifs profonds peuvent modéliser fidèlement des distributions de données complexes, telles que des distributions sur des images, du son ou du texte. Un exemple bien connu est la génération d'une image avec un contenu spécifique - par exemple un visage - à partir d'une collection d'images de ce type. Récemment, il a été proposé de réutiliser ces puissants modèles génératifs (MG) pour s'attaquer au problème d'échantillonnage, qui se pose lorsqu'on ne dispose pas de données issues de la distribution d'intérêt, mais seulement de la connaissance de sa densité non normalisée [LW18 ; AKS19 ; Noé+19]. L'objectif devient alors d'entraîner un modèle génératif qui approximera cette distribution cible et en facilitera l'échantillonnage, comme requis en mécanique statistique ou en inférence bayésienne. Here, alternative training strategies are necessary as samples from the target distribution are not available in large quantities a priori. Pioneering works in this direction, including those of the supervisor [RV22; Gre+23], have demonstrated that subclasses of GMs - normalizing flows and autoregressive networks - can achieve exact sampling by enabling the computation of reweightings of the generated realizations with respect to the target measure. Proofs of concept have been demonstrated across various areas of physics and chemistry, including lattice quantum field theories [Abb+24], biomolecules [Noé+19], and nano-clusters of heavy atoms [Mol+24]. However, while data-free training and debiasing is straightforward and computationally inexpensive for normalizing flows and autoregressive networks thanks to their tractable likelihood, these classes of GMs are limited by their lack of expressiveness.Project: The goal of this project is to benchmark and develop data-free training methods for the more powerful stochastic interpolants and flow matching models [Lip+23; ABV23].

Le profil recherché

Le projet requiert une solide formation en apprentissage automatique ainsi qu'un intérêt marqué pour la physique statistique. Le ou la candidat(e) idéal(e) devra posséder de bonnes compétences en programmation, notamment en Pythonet dans des frameworks modernes d'apprentissage automatique (par exemple PyTorch ou JAX). Un fort intérêt pour la rechercheinterdisciplinaire est indispensable, de même que la capacité à naviguer entre concepts théoriques et mises en oeuvre pratiques.

Compétences requises

  • Statistiques
  • Python
  • Programmation
  • Machine learning
Postuler sur le site du recruteur

Ces offres pourraient aussi vous correspondre.

Recherches similaires