Thèse de doctorat (2024)
Résumé
Les modèles génératifs d’images et de texte ont captivé l’attention du public et deviennent de plus en plus importants et pertinents dans nos vies. Alors que les modèles génératifs deviennent encore plus pertinents pour résoudre des problèmes du monde réel, il devient plus important de comprendre comment contrôler ce qu’ils génèrent. Dans cette thèse, nous investiguons différentes méthodes de conditionnement et de contrôle pour les modèles génératifs de vidéo, de langage et de structures de données représentant les designs de plans de sol. Nous sommes particulièrement intéressés par le contrôle fin, où l’information au niveau pixel est utilisée pour la génération de vidéo conditionnelle et où différentes contraintes quantitatives sont fournies à un générateur de designs architecturaux. Cette thèse est organisée en trois axes de recherche. Dans le premier axe de travail, nous nous concentrons sur la génération de vidéo conditionnelle basée sur les CNN. Les modèles de génération de vidéo CNN actuels emploient une approche par blocs, ce qui signifie que les frames sont générées par blocs plutôt que une à la fois. Le bloc généré est ensuite utilisé comme conditionnement pour générer le bloc de frames suivant. Nous proposons une nouvelle façon de faire le conditionnement par bloc en le déplaçant dans l’espace de représentation latente plutôt que dans l’espace pixel pour réduire l’erreur cumulative. En outre, nous introduisons un mécanisme de mémoire ainsi qu’un réseau de mise à jour de mémoire novateur pour améliorer la qualité de la génération de séquences longues.
Statistiques
Total des téléchargements à partir de PolyPublie
Téléchargements par année
Provenance des téléchargements
