Automation of Schema Evolution in a Data Lake and Data Vault Architecture

Autor
A. Mayr
Masterarbeit
MT2606 (September, 2026)
Betreut von
Assoz. Univ.-Prof. Mag. Dr. Christoph Schütz
Angeleitet von
Bashar Ahmad, MSc
Ausgeführt an
Universität Linz, Institut für Wirtschaftsinformatik - Data & Knowledge Engineering
Ressourcen
Kopie

Kurzfassung (Deutsch)

In modernen Datenplattformen verändern sich Quellschemata kontinuierlich. In aufeinander aufbauenden Architekturen, die einen Data Lake (DL) mit einer Data Vault (DV) 2.0 Integrationsschicht kombinieren, können Schemaveränderungen in der Anlieferung Auswirkungen auf Persistenz, Transformation und nachgelagerte analytische Schnittstellen haben. Dadurch entsteht ein schichtübergreifendes Koordinationsproblem.

Diese Arbeit behandelt die Automatisierung von Schema Evolution und Daten-Pipeline-Management in kombinierten DL und DV Umgebungen mit dem Ziel, manuellen Aufwand zu reduzieren, Datenqualität zu sichern und einen verlässlichen Betrieb unter asynchroner Ausführung und partiellen Fehlern zu gewährleisten. Auf Basis von Wieringas Methodologie zur gestaltungsorientierten Forschung wird das Schema Evolution Framework (SEF) als übergeordnete Steuerungsinstanz für sichere Koordination von Schemaveränderungen entworfen, implementiert und evaluiert. Das Framework trennt das Erkennen einer Veränderung von der Vervollständigung und unterstützt die Steuerung, Bewertung der Anpassungen, Migrationsplanung, idempotente Durchführung und evidenzbasierte Verifizierung vor der Veröffentlichung der Ergebnisse.

Die Evaluierung zeigt, dass der vorgeschlagene Ansatz eine kontrollierte und überprüfbare strukturelle Schemaentwicklung innerhalb des definierten Umfangs ermöglicht und die Konvergenz unter der „At-Least-Once“-Semantik unterstützt. Die Governance-Evaluierung zeigt darüber hinaus eine messbare Asymmetrie zwischen blockierten und erlaubten Änderungspfaden sowie backend-abhängige Latenzeffekte bei Wiederholungsversuchen, die sich als Ausreißer im oberen Latenzbereich zeigen können. Detaillierte operative Benchmark-Ergebnisse sind im begleitenden technischen Online-Supplement dokumentiert.

Kurzfassung (Englisch)

Modern data platforms operate in environments where source schemas change continuously. In layered architectures that combine a Data Lake (DL) with a Data Vault (DV) 2.0 integration layer, schema drift at the ingestion boundary can propagate across persistence, transformation and downstream analytical interfaces, creating a cross-layer coordination problem.

This thesis addresses the automation of schema evolution and pipeline management in combined DL and DV environments with the goals of reducing manual intervention, preserving data quality and ensuring reliable operation under asynchronous execution and partial failure. Following Wieringa’s Design Science Methodology, the thesis designs, implements and evaluates the Schema Evolution Framework (SEF) as a control plane mechanism for replay-safe schema evolution coordination. The framework separates schema observation from schema completion and supports admission control, policy evaluation, migration planning, idempotent actuation and evidence-based verification before publishing outcomes.

The evaluation shows that the proposed approach enables controlled and verifiable structural schema evolution within the defined scope and supports convergence under at-least-once delivery semantics. The governance evaluation further demonstrates a measurable asymmetry between blocked and allowed change paths, and that retry-induced latency effects are backend-dependent and may manifest as tail amplification. Detailed operational benchmark findings are reported in the online technical supplement.