elib
DLR-Header
DLR-Logo -> http://www.dlr.de
DLR Portal Home | Imprint | Privacy Policy | Accessibility | Contact | Deutsch
Fontsize: [-] Text [+]

KI-gestützte, akkurate Visualisierung von Szenen aus strukturierten Szenenbeschreibungen in Textform

Schnaubelt, Yannik (2025) KI-gestützte, akkurate Visualisierung von Szenen aus strukturierten Szenenbeschreibungen in Textform. Master's, Carl von Ossietzky Universität Oldenburg.

[img] PDF - Only accessible within DLR
82MB

Abstract

Inspiriert durch die Erfolge von generativer KI ist in dieser Arbeit ein Verfahren entwickelt worden, welches Abbildungen von strukturierten Szenenbeschreibungen in Textform mittels Diffusionsmodellen erzeugt und evaluiert. Das Verfahren besteht aus vier Komponenten: einem Datensatzgenerator, mehreren Trainingsskripten, einer Evaluationsumgebung sowie drei verschiedenen Ansätzen zur Generierung der Abbildungen. Jeder Ansatz verwendet genau ein Diffusionsmodell (Controlnet (CN), Open-Set Grounded Text-to-Image Generation (GLIGEN) oder Stable Diffusion (SD)) und nimmt die strukturierte Szenenbeschreibung in Textform entgegen und übersetzt diese in das erwartete Conditioning für das jeweilige Modell. Daraufhin generiert dieses basierend auf dem Conditioning die Abbildung. Die Evaluationsumgebung erlaubt es, für die drei genannten Modelle eine automatische Evaluation basierend auf den drei im Rahmen dieser Arbeit entwickelten Metriken: "Pixel-Mean Squared Error (MSE)", "Pixel-Kanten-MSE" und "Objekterkennung und Intersection over Union (IoU)" effizient durchzuführen. Anhand von fünf Experimenten werden das Verfahren und die ausgewählten Modelle in Bezug auf die akkurate Abbildung von strukturierten Szenenbeschreibungen in Textform evaluiert. Die Experimente zeigen, dass alle Ansätze in der Lage sind, Bilder zu generieren, die den Referenzbildern ähneln. Trotzdem werden von keinem Ansatz alle Kriterien einer akkuraten Abbildung erfüllt. Erwähnenswert ist, dass der Ansatz mit dem CN in den Experimenten die Form, die Größe, die Rotation und die Position eines Objektes am besten trifft. Das entwickelte Vorgehen ist erweiterbar, sodass in Zukunft weitere Experimente ohne großen Aufwand durchgeführt werden können.

Item URL in elib:https://elib.dlr.de/216597/
Document Type:Thesis (Master's)
Title:KI-gestützte, akkurate Visualisierung von Szenen aus strukturierten Szenenbeschreibungen in Textform
Authors:
AuthorsInstitution or Email of AuthorsAuthor's ORCID iDORCID Put Code
Schnaubelt, Yannikyannik.schnaubelt (at) uni-oldenburg.deUNSPECIFIEDUNSPECIFIED
DLR Supervisors:
ContributionDLR SupervisorInstitution or E-MailDLR Supervisor's ORCID iD
Thesis advisorde Graaff, Thiesthies.degraaff (at) dlr.dehttps://orcid.org/0009-0006-5918-9524
Date:2025
Open Access:No
Number of Pages:186
Status:Published
Keywords:Machine Learning, Generative AI, Text-to-Image, Conditioning
Institution:Carl von Ossietzky Universität Oldenburg
Department:Department für Informatik
HGF - Research field:Aeronautics, Space and Transport
HGF - Program:Transport
HGF - Program Themes:Road Transport
DLR - Research area:Transport
DLR - Program:V ST Straßenverkehr
DLR - Research theme (Project):V - V&V4NGC - Methoden, Prozesse und Werkzeugketten für die Validierung & Verifikation von NGC
Location: Oldenburg
Institutes and Institutions:Institute of Systems Engineering for Future Mobility > Systems Theory and Design
Deposited By: de Graaff, Thies
Deposited On:19 Sep 2025 06:37
Last Modified:19 Sep 2025 06:37

Repository Staff Only: item control page

Browse
Search
Help & Contact
Information
OpenAIRE Validator logo electronic library is running on EPrints
Website and database design: Copyright © German Aerospace Center (DLR). All rights reserved.