Soutenance de thèse de LUO Yiyun
Titre de thèse
Reconstruction stéréoscopique multi-vues à partir d'images aériennes à l'aide de modèles fondamentaux de vision
Multi-View Stereo from Aerial Imagery with Vision Foundation Models
Résumé de la thèse
La reconstruction 3D à partir d'images occupe une place centrale en la photogrammétrie, en télédétection et en modélisation urbaine à grande échelle.
Dans les contextes aériens, les variations de points de vue, de capteurs et de conditions d'acquisition rendent la reconstruction fiable particulièrement difficile. Les méthodes classiques de stéréovision multi-vues (MVS), fondées sur la cohérence photométrique, restent sensibles aux régions peu texturées, aux motifs répétitifs et aux changements de domaine. De leur côté, les approches récentes basées sur l'apprentissage profond améliorent l'estimation de profondeur mais présentent souvent une généralisation limitée à des données aériennes inédites.
Afin de surmonter ces limitations, cette thèse explore l'utilisation des modèles de fondation visuels (VFMs) pour la reconstruction 3D aérienne. Elle commence par étudier leur transférabilité à la segmentation sémantique en télédétection, montrant que des représentations pré-entraînées issues de modèles de diffusion peuvent fournir des caractéristiques riches et robustes avec peu d'annotations. Cette analyse confirme le potentiel des VFMs pour comprendre efficacement des scènes aériennes complexes.
Sur cette base, la thèse introduit un cadre de reconstruction aérienne en monde ouvert et propose OP3D-Bench, un benchmark dédié à l'évaluation de la généralisation inter-domaines. Celui-ci unifie plusieurs jeux de données aériens, standardise les paramètres géométriques et établit des protocoles rigoureux d'évaluation zero-shot pour l'estimation de profondeur et la reconstruction 3D.
Enfin, la thèse présente OPMVS, une architecture MVS enrichie par les représentations des VFMs. En intégrant des caractéristiques sémantiques pré-entraînées dans la construction du volume de coût et l'inférence de profondeur, OPMVS combine efficacement compréhension sémantique et contraintes géométriques multi-vues. Les résultats expérimentaux démontrent une amélioration significative de la généralisation zero-shot ainsi qu'une reconstruction plus dense et plus complète dans des environnements inconnus.
Dans son ensemble, cette thèse contribue à l'apprentissage de représentations efficaces, à l'évaluation de la MVS aérienne en monde ouvert et au développement d'un cadre de reconstruction 3D plus généralisable pour les scènes aériennes à grande échelle.
Thesis resume
Image-based 3D reconstruction is a fundamental technology for photogrammetry, remote sensing, and large-scale urban modeling. In aerial scenarios, however, reliable reconstruction remains difficult because images are acquired under heterogeneous viewpoints, diverse sensors, and varying lighting conditions. Classical multi-view stereo (MVS) pipelines provide strong geometric foundations, but their dependence on photometric consistency makes them vulnerable to low-texture surfaces, repetitive patterns, and large cross-domain shifts. Similarly, while previous learning-based MVS methods have improved depth estimation in benchmark settings, they often remain tied to specific datasets and struggle to generalize to unseen aerial environments.
To address these limitations, this dissertation investigates how the robust representations learned by vision foundation models (VFMs) can be adapted to improve aerial 3D reconstruction. Given that MVS and semantic segmentation share a need for dense pixel-level understanding, this research establishes a VFM baseline by evaluating their transferability to remote sensing segmentation. It demonstrates that fine-tuning lightweight heads on pre-trained diffusion models yields highly descriptive features, even under limited-label conditions. This validates that VFMs can successfully untangle complex aerial scenes without heavy reliance on dataset-specific annotations, laying the groundwork for their integration into geometric tasks.
Building on this analysis, the dissertation formalizes an open-world paradigm for aerial MVS and introduces OP3D-Bench, a benchmark designed to evaluate reconstruction models under realistic cross-domain shifts. The benchmark integrates heterogeneous aerial datasets through a unified geometric processing pipeline, standardizes camera data, and defines strict zero-shot evaluation protocols for both intermediate depth prediction and final point-cloud reconstruction. By systematically exposing the overfitting issues inherent in closed-world training, this framework establishes a comprehensive and consistent basis for measuring algorithmic generalization across synthetic, diverse urban, and natural scenes.
Finally, this dissertation proposes OPMVS, a novel foundation-model-enhanced architecture specifically engineered for open-world aerial reconstruction. Rather than relying solely on low-level photometric cues, OPMVS integrates robust, pre-trained semantic features from VFMs directly into the core MVS pipeline. By fusing these high-level representations during cost-volume construction and depth decoding, it effectively marries semantic structural awareness with strict multi-view epipolar constraints. Experiments on the OP3D benchmark demonstrate its exceptional capability in zero-shot depth estimation, delivering high-quality predictions even under sparse-view conditions. Consequently, OPMVS achieves superior open-world generalization and yields denser, structurally complete 3D point clouds in previously unseen environments.
Overall, this dissertation contributes a label-efficient representation-learning study, an open-world benchmark for aerial MVS, and a generalized MVS framework that advances scalable reconstruction from aerial imagery.