Premier semestre

Dimension Reduction and Matrix Completion

Objectifs

Dans l’apprentissage automatique moderne, les données sont de plus en plus de grande dimension (images, texte, flux de capteurs) et de moins en moins étiquetées ; deux questions deviennent donc centrales : comment extraire une structure compacte et significative à partir des données brutes, et comment apprendre des représentations utiles sans recourir à une annotation humaine coûteuse. La réduction de dimension répond à la première question, en passant des projections linéaires telles que l’ACP (analyse en composantes principales), qui capturent les directions de variance maximale mais échouent lorsque la structure sous-jacente est non linéaire, à des méthodes d’intégration de voisinage telles que t-SNE et UMAP, qui préservent la structure de similarité locale et constituent les outils standard pour visualiser et explorer des ensembles de données de grande dimension. L’apprentissage de représentations répond à la deuxième question : plutôt que de s’appuyer sur des étiquettes, les méthodes auto-supervisées définissent des tâches prétextes directement à partir des données elles-mêmes. Ce cours se concentre sur les approches contrastives telles que SimCLR, ainsi que sur le cadre d’alignement et d’uniformité qui explique pourquoi ces méthodes évitent les solutions triviales, et sur les auto-encodeurs clairsemés, qui apprennent des caractéristiques compactes et dissociées grâce à un objectif de reconstruction. Ce cours exposera les principes fondamentaux qui sous-tendent ces techniques tout en mettant l’accent sur leurs aspects méthodologiques et algorithmiques.

Plan

– Comprendre le problème de la dimensionnalité et les raisons justifiant la réduction de dimension, tant linéaire que non linéaire.rn- Connaître l’ACP, ses hypothèses et ses limites sur des données non linéaires.rn- Comprendre les méthodes d’immersion de voisinage (t-SNE, UMAP) et leurs principes algorithmiques.rn- Comprendre les principes de l’apprentissage auto-supervisé et contrastif des représentations.rn- Connaître le cadre SimCLR et la perspective théorique de l’alignement et de l’uniformité.rn- Comprendre les auto-encodeurs clairsemés comme une voie non contrastive vers des représentations interprétables.

Prérequis

Statistiques de base, algèbre linéaire et probabilités; notions de base sur les réseaux neuronaux.