Soutenance de thèse de Jean Rubin

Jean RUBIN  soutiendra publiquement ses travaux de thèse intitulés « Quantification des incertitudes en théorie des sondages, avec application dans le domaine de la statistique publique » le vendredi 25 septembre 2026 à 14h, à l’ENSAI.

Ecole Doctorale : Mathématiques, Télécommunications, Informatique, Signal, Systèmes, Electronique (Matisse)

Unité de recherche : IRMAR (UMR 6625)

Directeur de thèse : Guillaume CHAUVET, Enseignant-chercheur, CREST-ENSAI

 

Composition du jury

Rapporteuse : Mme Alina MATEI, Professeur, Université de Neuchâtel

Rapporteur : Monsieur Jae-Kwang KIM, Professeur, Iowa State University

Examinateur : Monsieur Pascal ARDILLY, Inspecteur général, Insee

Examinateur : Monsieur Hervé CARDOT, Professeur des Universités, Université Bourgogne Europe

Examinateur : Monsieur Laurent DAVEZIES, Enseignant-chercheur HDR, CREST-ENSAE

Quantification des incertitudes en théorie des sondages, avec application dans le domaine de la statistique publique

Mots-clés : Théorie des sondages, Estimation de variance, Bootstrap, Équilibrage, Plan produit.

Résumé : La théorie des sondages a pour objectif d’estimer des paramètres d’une population finie à partir d’un sous-ensemble de celle-ci. L’enjeu central réside dans la compréhension du mécanisme d’échantillonnage sous-jacent, qui tient compte à la fois des parties sous contrôle et hors de contrôle du sondeur. La volonté d’étudier des données toujours plus complexes à obtenir, sous contraintes techniques et budgétaires, mène à des enquêtes sophistiquées, tant lors de la construction du plan de sondage que lors de l’estimation, et rend d’autant plus difficile la quantification des incertitudes associées. Cette thèse éclaire cette question pour trois mécanismes particuliers. Un premier travail porte sur les plans produits, dont l’échantillon est le produit cartésien de sous-échantillons tirés indépendamment. Une analyse de leurs propriétés asymptotiques conduisent à des approximations de variance et à une méthode bootstrap à poids asymptotiquement sans biais. Ces résultats sont illustrés par simulation et sur l’étude Elfe. Un deuxième travail construit une méthode bootstrap à poids pour les estimations transversales de l’enquête Histoire de Vie et Patrimoine de l’Insee. Le caractère de panel rotatif de celle-ci implique que ces estimations reposent sur des sélections effectuées les années précédentes. L’algorithme proposé est suffisamment flexible pour intégrer un tel mécanisme, au même titre que le partage des poids et le calage. Enfin, le dernier travail propose trois méthodes d’échantillonnage équilibré avec remise, avec une approximation de leur variance et une application de celles-ci au tirage équilibré de flux.

 

Uncertainty quantification in survey sampling, with application in official statistics

Keywords: Survey sampling theory, Variance estimation, Bootstrap, Balanced sampling, Cross-classified sampling

Abstract: Survey sampling theory aims to estimate parameters of a finite population based on a subset of that population. The central challenge lies in understanding the underlying sampling mechanism, which accounts for aspects both within and outside the survey designer’s control. The drive to analyze data that are increasingly difficult to obtain, subject to technical and budgetary constraints, leads to sophisticated surveys involving complex sampling designs and estimation procedures, thereby complicating the quantification of associated uncertainties. This thesis sheds light on this issue by examining three specific mechanisms. The first study focuses on cross-classified sampling designs, where the sample is the Cartesian product of independently drawn subsamples. An analysis of their asymptotic properties yields variance approximations and an asymptotically unbiased weighted bootstrap method. These results are illustrated through simulations and an application to the Elfe study. The second study develops a weighted bootstrap method for cross-sectional estimates from Insee’s « Histoire de Vie et Patrimoine » survey. The survey’s rotating panel structure means that these estimates rely on selections made in previous years. The proposed algorithm is flexible enough to incorporate this mechanism, as well as weight sharing and calibration. Finally, the third study proposes three methods for balanced sampling with replacement, provides variance approximations for them, and applies them to balanced stream sampling