RESEARCH. CONNECTED.

Explore the scholarly record.

Discover prefix ownership, publishers, journals and DOI metadata. Understand the data behind every publication.

Multimodale Deepfake-Erkennung in der Praxis: Framework und Prototyp für die digitale Forensik

Louis Jarvers iD, Isabel Bezzaoui iD, Jonas Fegert iD

DOI10.1365/s40702-026-01314-8
PublisherSpringer Fachmedien Wiesbaden GmbH
Journal / SourceHMD Praxis der Wirtschaftsinformatik
Published2026-08-06
Metadata Deposited2026-08-06 (updated: 2026-08-06)
Subject—
Languagede
ISSN1436-3011, 2198-2775
Typejournal-article
Volume / Issue / Pages— / — / —
Citations0
References deposited49
Access / license metadataOpen license identified License 1 ↗A reuse license does not by itself establish whether the full text is freely readable.

Abstract

Zusammenfassung Die Verbreitung generativer KI hat zu einem rasanten Anstieg synthetischer Medieninhalte im Internet geführt. Diese Entwicklung verändert die digitale Öffentlichkeit grundlegend, denn hochqualitative Deepfakes lassen sich selbst von geschulten Personen kaum noch sicher von authentischen Medien unterscheiden. Gleichzeitig sind die Folgen KI-manipulierter Inhalte, wie Betrug, Falschinformation oder Vertrauensverlust, umfassend bekannt. Während regulative oder bildungspolitische Maßnahmen primär die Detektionsfähigkeiten der Allgemeinheit stärken können, benötigen besonders digitalforensische Fachkräfte in Sicherheitsbehörden, Presse oder Privatwirtschaft technische Unterstützung bei der Identifikation von Deepfakes. Das Forschungsprojekt „Multi-Modal Deepfake Detection“ (MuDDi) entwickelt hierfür Werkzeuge zur multimodalen Erkennung von KI-Inhalten und verbindet dabei bisher getrennte Forschungsansätze zu Inhaltsformaten wie Text, Bild, Video und Audio. Dieser Artikel stellt den aktuellen Forschungsstand von MuDDi auf Basis der Design-Science-Research-Methodologie dar. Nach der Problembeschreibung präsentiert der Artikel umsetzungs- und praxisrelevante Anforderungen aus qualitativen Expert:inneninterviews, die das technische Framework und den Prototypen als Forschungsartefakte leiten. Das Framework beschreibt die konkrete Umsetzung der Design-Anforderungen, während der Prototyp die Analyse von Bildern, Videos und Audio mittels KI-basierter End-to-End-Detection-Module, Wasserzeichenerkennung, der Extraktion pulsbasierter Signale aus Gesichtsregionen, kontextsensitivem Reasoning und dem Abgleich von Lippenbewegungen zu Tonspur demonstriert. Abschließend skizziert der Beitrag die geplante Umsetzung als Proof of Concept in der öffentlichen Verwaltung sowie die Evaluation und Kommunikation des Projekts.