Ein aktuelles Whitepaper von Bitkom und dem AI Grid Netzwerk rückt die drei Dimensionen Security, Fairness und Explainability in den Mittelpunkt vertrauenswürdiger KI-Anwendungen. Diese wurden in vielen Unternehmen bislang noch getrennt behandelt. Unsere Kernbotschaft ist unbequem, aber wichtig: Vertrauenswürdige KI lässt sich nicht einmalig zertifizieren. Sie muss über den gesamten Lebenszyklus eines Systems hinweg immer wieder neu erarbeitet werden.
Die Autoren: Teresa Mary Kutzner ist Doktorandin zum Thema „Vertrauen in künstliche Intelligenz“ an der Hochschule der Medien Stuttgart in Kooperation mit Mercedes-Benz. Sönke Erdmann arbeitete als wissenschaftlicher Mitarbeiter an der Universität Potsdam in zwei großen BMBF(SFJ)-geförderten Bildungstechnologie-Projekten. Aktuell ist er Student an der Universität Potsdam im Master Digitale Bildung und an der Universität von Amsterdam im Master Cultural Data & AI.
(Bild: Teresa Mary Kutzner / Kevin Ryl)
Klassisch lassen sich beide Begriffe sauber trennen: Security schützt ein KI-System vor gezielter, böswilliger Manipulation, etwa durch Prompt Injections, Modelldiebstahl oder unautorisierten Zugriff. Safety hingegen adressiert Schäden, die ganz ohne Angreifer entstehen, etwa durch Halluzinationen, fehlerhafte Empfehlungen oder unvorhergesehenes Modellverhalten.
In der Praxis lässt sich diese Trennung aber immer schwerer aufrechterhalten. Der Grund liegt in der Architektur neuerer KI-Systeme: Sie bestehen nicht mehr aus einem isolierten Modell, sondern aus vielen miteinander vernetzten Komponenten. Eine kleine kompromittierte oder schlicht fehlerhafte Komponente kann dadurch zu einem systemweiten Ausfall eskalieren, unabhängig davon, ob am Anfang ein gezielter Angriff, eine fehlerhafte Konfiguration oder ein Bug stand.
Besonders deutlich wird das bei agentischen Systemen, denn sie handeln (teil-)autonom in einem größeren Ökosystem, dem sogenannten Harness. Dadurch wird menschliche Steuerung immer einfacher, zugleich nimmt jedoch die potenzielle Schadenswirkung zu. Security und Safety müssen deshalb vor allem bei agentischen Systemen kontinuierlich gemeinsam gemonitort werden, mit Zero-Trust-Prinzipien, minimalen Zugriffsrechten und verpflichtenden Freigaben durch Verantwortliche bei folgenschweren Entscheidungen. Das zeigt auch ein aktueller Vorfall, bei welchem ein KI-Modell von OpenAI aufgrund unzureichenden Vorkehrungen aus einer Testumgebung „ausgebrochen“ ist und die Plattform Hugging Face angegriffen hat.
Warum formale AI-Act-Compliance keine vertrauenswürdige KI garantiert
Der EU AI Act (2024) definiert diverse Richtlinien für Unternehmen im Einsatz von KI, um vertrauenswürdige Systeme zu schaffen, wie menschliche Aufsicht (Humans in/ on the Loop), technische Sicherheit, Fairness oder Transparenz (Auditfähigkeit). Für Hochrisiko-Systeme drohen bei Verstößen Bußgelder von bis zu 35 Millionen Euro oder sieben Prozent des weltweiten Jahresumsatzes. Trotz allem ist Compliance mit dem AI Act nicht gleich Vertrauenswürdigkeit.
Denn: Regulierung ist statisch, KI-Systeme sind es nicht. Ein Modell verändert sich durch neue Trainingsdaten, Nachtraining, veränderte Integrationen und neue Nutzungskontexte. Ein einmal erfülltes Kriterium kann wenige Wochen später schon nicht mehr zutreffen. Zudem beschreiben Regulierungen vor allem, was erreicht werden muss, sie liefern jedoch wenig konkrete Maßnahmen, wie das in komplexen, vernetzten Organisationen operationalisiert werden soll. Das Erfüllen formaler Anforderungen, wie Dokumentations- oder Klassifizierungspflichten, sagt wenig darüber aus, ob sich ein System unter realen Bedingungen tatsächlich vertrauenswürdig, fair oder sicher verhält.
Deswegen sollte in Unternehmen von punktueller Validierung bestimmter Richtlinien, hin zu kontinuierlichem Monitoring in abgestimmten, organisationsweiten Prozessen gearbeitet werden. In diesen sollte Verantwortung klar zugewiesen und Rechenschaftspflichten übernommen werden. Die Regulierung setzt hier die notwendigen Leitlinien, Monitoring über den gesamten Lebenszyklus bleibt jedoch eine anhaltende Aufgabe, um Qualität und Vertrauenswürdigkeit von KI-Systemen nachhaltig garantieren zu können.
Bias zeigt sich schon bei der Datenerhebung, nicht erst am Ende der Entwicklung von KI-Systemen. Daten sind per Definition aus der Vergangenheit und spiegeln gesellschaftliche Verzerrungen und Stereotype wider. Werden bestimmte Gruppen unterrepräsentiert, übernimmt das trainierte Modell diese Schieflage automatisch. Genau deshalb reicht es nicht, Verzerrungen erst nach dem Training zu berichtigen. Fairness muss von Beginn an mitgedacht werden.
Praktisch bedeutet das: Bereits vor der Datensammlung sollten Unternehmen festlegen, welche sensiblen Attribute im jeweiligen Anwendungsfall überhaupt relevant sind, und Herkunft sowie Zusammensetzung der Daten von Anfang an dokumentieren und nachverfolgbar machen. Wird ein Datensatz nachträglich bereinigt, um ihn ausgewogener zu machen, geschieht das meist auf Kosten der Modell-Performance und sollte deshalb bewusst und dokumentiert erfolgen, nicht als reflexhafte Nachbesserung.
Die Prüfung der Trainingsdaten entlang mehrerer vorher gewählter Merkmale wie Geschlecht, Alter, Sprache und dem sozioökonomischen Status empfiehlt sich hier oder alternativ die Auswahl eines Modells anhand entsprechender Kriterien. Unterstützen können Berichte von unabhängigen NGOs wie AIForensics oder CERTAIN. Auch hier gilt: Fairness ist mit dem Launch nicht abschließend bearbeitet und zertifiziert, sondern muss im Betrieb weiter überwacht werden, da neue Verzerrungen auch im späteren AI-Lifecycle entstehen können.
Stand: 08.12.2025
Es ist für uns eine Selbstverständlichkeit, dass wir verantwortungsvoll mit Ihren personenbezogenen Daten umgehen. Sofern wir personenbezogene Daten von Ihnen erheben, verarbeiten wir diese unter Beachtung der geltenden Datenschutzvorschriften. Detaillierte Informationen finden Sie in unserer Datenschutzerklärung.
Einwilligung in die Verwendung von Daten zu Werbezwecken
Ich bin damit einverstanden, dass die Vogel IT-Medien GmbH, Max-Josef-Metzger-Straße 21, 86157 Augsburg, einschließlich aller mit ihr im Sinne der §§ 15 ff. AktG verbundenen Unternehmen (im weiteren: Vogel Communications Group) meine E-Mail-Adresse für die Zusendung von Newslettern und Werbung nutzt. Auflistungen der jeweils zugehörigen Unternehmen können hier abgerufen werden.
Der Newsletterinhalt erstreckt sich dabei auf Produkte und Dienstleistungen aller zuvor genannten Unternehmen, darunter beispielsweise Fachzeitschriften und Fachbücher, Veranstaltungen und Messen sowie veranstaltungsbezogene Produkte und Dienstleistungen, Print- und Digital-Mediaangebote und Services wie weitere (redaktionelle) Newsletter, Gewinnspiele, Lead-Kampagnen, Marktforschung im Online- und Offline-Bereich, fachspezifische Webportale und E-Learning-Angebote. Wenn auch meine persönliche Telefonnummer erhoben wurde, darf diese für die Unterbreitung von Angeboten der vorgenannten Produkte und Dienstleistungen der vorgenannten Unternehmen und Marktforschung genutzt werden.
Meine Einwilligung umfasst zudem die Verarbeitung meiner E-Mail-Adresse und Telefonnummer für den Datenabgleich zu Marketingzwecken mit ausgewählten Werbepartnern wie z.B. LinkedIN, Google und Meta. Hierfür darf die Vogel Communications Group die genannten Daten gehasht an Werbepartner übermitteln, die diese Daten dann nutzen, um feststellen zu können, ob ich ebenfalls Mitglied auf den besagten Werbepartnerportalen bin. Die Vogel Communications Group nutzt diese Funktion zu Zwecken des Retargeting (Upselling, Crossselling und Kundenbindung), der Generierung von sog. Lookalike Audiences zur Neukundengewinnung und als Ausschlussgrundlage für laufende Werbekampagnen. Weitere Informationen kann ich dem Abschnitt „Datenabgleich zu Marketingzwecken“ in der Datenschutzerklärung entnehmen.
Falls ich im Internet auf Portalen der Vogel Communications Group einschließlich deren mit ihr im Sinne der §§ 15 ff. AktG verbundenen Unternehmen geschützte Inhalte abrufe, muss ich mich mit weiteren Daten für den Zugang zu diesen Inhalten registrieren. Im Gegenzug für diesen gebührenlosen Zugang zu redaktionellen Inhalten dürfen meine Daten im Sinne dieser Einwilligung für die hier genannten Zwecke verwendet werden. Dies gilt nicht für den Datenabgleich zu Marketingzwecken.
Recht auf Widerruf
Mir ist bewusst, dass ich diese Einwilligung jederzeit für die Zukunft widerrufen kann. Durch meinen Widerruf wird die Rechtmäßigkeit der aufgrund meiner Einwilligung bis zum Widerruf erfolgten Verarbeitung nicht berührt. Um meinen Widerruf zu erklären, kann ich als eine Möglichkeit das unter https://contact.vogel.de abrufbare Kontaktformular nutzen. Sofern ich einzelne von mir abonnierte Newsletter nicht mehr erhalten möchte, kann ich darüber hinaus auch den am Ende eines Newsletters eingebundenen Abmeldelink anklicken. Weitere Informationen zu meinem Widerrufsrecht und dessen Ausübung sowie zu den Folgen meines Widerrufs finde ich in der Datenschutzerklärung.
Wo SHAP, LIME & Co. in der Praxis an ihre Grenzen stoßen
„Explainable AI“ (XAI), die Erklärbarkeit von KI-Systemen, ist über das ethische Ideal hinaus inzwischen eine handfeste Compliance-Anforderung geworden. Der AI Act verlangt für Hochrisiko-Systeme unter anderem nachvollziehbare Ausgaben, wirksame menschliche Aufsicht und automatische Protokollierung. Doch gängige Erklärmethoden zeigen Schwächen auf.
XAI-Verfahren wie SHAP oder LIME lassen sich zwar auf nahezu jedes KI-Modell nachträglich anwenden, liefern dabei aber oft plausibel wirkende, in der Sache jedoch unzuverlässige Erklärungen. Dabei treten Probleme wie falsche Dateninterpretation oder mangelnde Reproduzierbarkeit der Erklärungen auf, die dadurch verstärkt werden, dass XAI-Methoden nachweislich gezielt manipuliert werden können.
Verschärft wird das Problem durch den Faktor Mensch. Nutzerinnen und Nutzer überschätzen häufig systematisch, wie gut sie ein System nach dem Erhalt einer Erklärung tatsächlich verstehen. Dabei kann das alleinige Dasein einer Erklärung zu einem übermäßigen Vertrauen führen, sogar wenn die Erklärungen eigentlich inkorrekt sind. Wenn eine Erklärung außerdem falsch interpretiert wird, kann das Vertrauen in die KI verzerrt werden, was zu schwerwiegenden Folgen führen kann. Das Verständnis von Erklärungen ist dabei stark abhängig von der jeweiligen Zielgruppe (den Nutzenden) und deren Expertise.
Die Konsequenz: Der bloße Einbau einer XAI-Schnittstelle ist kein Nachweis für echte Nachvollziehbarkeit oder Erklärbarkeit. Methoden müssen für die jeweilige Zielgruppe empirisch validiert werden, und Governance-Prozesse sollten aktiv prüfen, ob Erklärungen tatsächlich verstanden werden oder in die Irre führen.
Wenn Sprachmodelle falsche Informationen wiedergeben oder Unsicherheiten falsch darstellen, deutet das auf systemische Defizite in zentralen metakognitiven Fähigkeiten hin. Neben gängigen XAI-Methoden können hier andere Ansätze wie Reinforcement Learning mit metakognitivem Feedback zukünftig helfen, um die Vertrauenswürdigkeit und Zuverlässigkeit der Modelle wiederherzustellen.
Unsere Take Home Message
Belastbare Governance hängt nicht zwingend an der Unternehmensgröße, wohl aber an klaren Verantwortungszuweisungen.
Verantwortlichkeiten sollten explizit benannt werden: Eine RACI-Matrix beispielsweise hilft dabei festzulegen, wer für Daten, Modellverhalten, Deployment und Risikoszenarien zuständig ist. Sicherheitslücken entstehen meist durch unklare Zuständigkeiten an den Schnittstellen zwischen Teams.
Auf zentrale, statt verteilte Werkzeuge setzen: Einzelne „Insellösungen“ ohne übergreifendes Sicherheitskonzept erzeugen oft nur ein trügerisches Sicherheitsgefühl. Wenn möglich, sollten Funktionen in einer zentralen General Purpose AI gebündelt werden, statt in Einzellösungen. Sicherheit ist ein schwerwiegender Trade-Off gegenüber geringfügig besserer Performance in einzelnen Tasks.
Dokumentation als kostengünstigen ersten Schritt nutzen: Data Sheets, Model Cards und einfache Herkunftsnachweise für Daten sind vergleichsweise günstig umzusetzen, schaffen aber die Grundlage für spätere Audits, Fehleranalysen und Nachweispflichten.
Abhängigkeit von Drittanbietern bewusst einpreisen: Wer Modelle ausschließlich über externe APIs nutzt, spart Aufwand, hat aber auch keine Einsicht in deren Trainingsdaten, Sicherheitspraktiken oder Update-Zyklen. Für viele Anwendungen reichen kleinere, vollständig offene Modelle wie Apertus oder Soofi aus. Diese erfüllen auch höhere ethische Standards bei der Erhebung der Daten.
Offene (anbieterunabhängige) Tools für die Prüfung nutzen: Für Fairness-Prüfungen beispielsweise das Open-Source-Toolkit AI Fairness 360. Um KI-Systeme anhand der Richtlinien des EU AI Acts auf Compliance und Vertrauenswürdigkeit zu prüfen, gibt es außerdem diverse frei zugängliche Tools wie ALTAI oder Z-Inspection.
Nutzerbezogen und bedarfsorientiert arbeiten: Beim Einsatz von KI, XAI-Methoden oder Ähnlichem ist es essenziell, zuerst zu definieren, welche Menschen mit welcher Expertise und Bedürfnissen mit Ergebnissen interagieren, um Sicherheit und Mehrwert der gewählten Lösungen sicherzustellen. Methoden aus dem Interaktionsdesign (Human Computer Interaction), wie Personas oder Szenarien bieten sich hier an.