Robuste Modelle als Ziel moderner KI-Projekte
Ob selbstfahrende Autos, Erkennung von Malware oder die Generierung von Texten: Neuronale Netze haben sich längst als Schlüsseltechnologie für viele innovative Anwendungen etabliert. Dennoch hat sich gezeigt, dass solche Machine-Learning-Systeme gegenüber böswilligen Akteuren verwundbar sind. Dieser Artikel soll einen kleinen Einblick in mögliche Bedrohungsszenarien und deren Bedeutung für künftige KI-Projekte geben.
Kleine Änderung, große Wirkung
Abbildung 1: Harmlose Eingaben (blau) und adversarial Examples (rot) liegen im Eingabedatenraum von KI-Modellen nah beieinander.
Trotz der durchaus beachtlichen Leistung moderner KI-basierter Systeme sind diese nicht unfehlbar. Sicher hat jeder schon mal einen Fall erlebt, in dem einem ein Large-Language-Model (LLM) falsche Antworten herbeihalluziniert hat. Problematisch wird es dann, wenn Angreifer Schwächen in solchen Systemen gezielt ausnutzen können. Noch schlimmer ist es, wenn dies in sicherheitskritischen Systemen passiert. Schon früh wurde gezeigt, dass Systeme zur Objektklassifikation in Bildern bei bestimmten Eingaben unbeabsichtigtes Verhalten zeigen. So kann schon eine kleine Modifikation einer harmlosen Eingabe – mitunter für das menschliche Auge kaum wahrnehmbar – dazu führen, dass Objekte mit teils beachtlicher Vorhersagesicherheit (dem sogenannten Konfidenz-Wert) fehlklassifiziert werden. Eingaben, bei denen eine solche unbegründete Falschklassifikation auftritt, werden als adversarial Examples bezeichnet.
Adversarial Examples können als Ergebnis natürlicher Störungen auftreten, wie Nebel, Regen oder Sensorrauschen im Falle der Bildklassifikation. Dennoch geht hier die größte Gefahr von gezielten Manipulationen aus. Mittlerweile beschreibt die Literatur ein ganzes Sammelsurium an adversariellen Angriffstechniken, auch Evasion-Attacks genannt. Oft reicht es hier schon aus, relativ wenige Elemente einer Eingabe zu verändern, beispielsweise Bildpixel oder einzelne Wörter in einem Text.
Teilweise braucht es hierfür noch nicht einmal tiefgreifende Kenntnisse über das Zielmodell. Denn neben den sogenannten White-Box-Angriffen, welche vollen Zugriff auf Modellarchitektur, Parameter und Trainingsdaten voraussetzen, gibt es auch noch Black-Box-Angriffe mit wenig bis gar keinem Wissen über das System. Hier darf das System lediglich angefragt und dessen Ausgabe ausgewertet werden. Auch wurde gezeigt, dass adversarial Examples häufig auf Modelle angewendet werden können, die mit gleichen oder ähnlichen Trainingsdaten erstellt wurden – man spricht von Transferierbarkeit.

Abbildung 2: Adversarial Examples in der echten Welt durch gezielte Manipulation eines Verkehrsschilds mit Aufklebern. Bild: Marvin Vogt
Adversarielle Angriffe in der Praxis
Transferierbarkeit von adversarial Examples ist dabei nicht nur als ein rein theoretisches Konstrukt zu verstehen, denn die Folgen dieser Eigenschaft erstrecken sich sogar auf physische Objekte in der echten Welt. Es stellte sich nämlich beispielsweise heraus, dass generierte adversarielle Bilder einen Klassifikator auch dann noch täuschen können, wenn diese dem Modell über eine Kamera zugeführt werden. Eykholt et al. [1] haben demonstriert, wie man nur mit gezielt angebrachten Aufklebern die Erkennung von Verkehrsschildern manipulieren kann. Auch Gesichtserkennungssysteme lassen sich mit speziell erzeugten Mustern auf Brillen hinters Licht führen [2].
Evasion-Attacks stellen dabei nur eine mögliche Bedrohung für KI-Systeme dar. Denn die Art möglicher Angriffe richtet sich durchaus nach dem zugrundeliegenden Modell. So ist es möglich, die Trainingsdaten von Modellen selbst zu manipulieren, das sogenannte Data-Poisoning. Für LLMs sind beispielsweise auch Jailbreak-Angriffe denkbar, die auf die Umgehung eigener Sicherheitsschranken abzielen. Wie ein böswilliger Hacker, der dem LLM vorspielt, er sei ein Sicherheitsforscher und brauche ein wenig Schadcode, um diesen in einem Vortrag zu zeigen. Die Liste an Techniken ist zu lang, um sie hier alle zu behandeln.
Robustheit wird zur Pflicht
Beispiele wie diese demonstrieren relativ deutlich, warum gerade die Robustheit von KI-Modellen in der Entwicklung moderner Systeme besondere Beachtung finden muss. Im August 2026 tritt der neue EU AI Act für KI-Systeme mit hohem Risiko in Kraft. Neben Transparenzpflichten und Risikomanagement schreibt dieser in Artikel 15 auch explizit Maßnahmen gegen die beschriebenen Schwachstellen vor.
Neben Verfahren zur Bewertung der Robustheit von Modellen in Form eines Scores können hier auch etablierte Techniken aus der Forschung helfen, diese zu verbessern. Adversarial Training dient dazu, einem Modell schon beim Training die korrekte Ausgabe zu manipulierten Eingaben anzulernen. Ein Detektor kann als Komponente eines KI-Systems eine mögliche böswillige Veränderung teilweise gezielt erkennen oder als Präprozessor diese automatisiert entfernen.
Sicherheit sollte aber keinesfalls nur nachrangig zur Entwicklung von KI-Systemen betrachtet werden. Vielmehr lohnt es sich, diese als einen kontinuierlichen, adaptiven Prozess anstelle einer einmaligen Validierung am Ende zu sehen. Abhilfe schaffen können hier neben etablierten Arbeitsweisen auch neu entwickelte Tools. Wie das erst kürzlich gestartete EU Innovation Action Projekt SECASSURED, ein Framework, das sich zum Ziel genommen hat, Sicherheit ganzheitlich während des Softwareentwicklungszyklus zu gewährleisten. Hierzu können Stakeholder ihre Systeme in virtuellen Umgebungen modellieren, testen und validieren und dabei gleichzeitig Konformität mit Anforderungen und Standards sicherstellen.
Nur wenn wir Sicherheit und Robustheit ernst nehmen, kann KI ihr Potenzial dauerhaft und verantwortungsvoll entfalten.
Referenzen:
[1] Eykholt, Kevin, et al. “Robust physical-world attacks on deep learning visual classification.” Proceedings of the IEEE conference on computer vision and pattern recognition. 2018.
[2] Sharif, Mahmood, et al. “Accessorize to a crime: Real and stealthy attacks on state-of-the-art face recognition.” Proceedings of the 2016 acm sigsac conference on computer and communications security. 2016.
Über den Autor:
Marvin Vogt hat 2025 sein Masterstudium in Informatik abgeschlossen und forscht seit 2023 beim Fraunhofer-Institut für Offene Kommunikationssysteme an den Themen Adversarial Machine Learning, AI-Testing und Datenqualität.

Recent Comments