Kommentar von Teresa Mary Kutzner und Sönke Erdmann Vertrauenswürdige KI ist mehr als ein Produktmerkmal

Von Teresa Mary Kutzner und Sönke Erdmann 6 min Lesedauer

Anbieter zum Thema

Ein aktuelles Whitepaper von Bitkom und dem AI Grid Netzwerk rückt die drei Dimensionen Security, Fairness und Explainability in den Mittelpunkt vertrauenswürdiger KI-Anwendungen. Diese wurden in vielen Unternehmen bislang noch getrennt behandelt. Unsere Kernbotschaft ist unbequem, aber wichtig: Vertrauenswürdige KI lässt sich nicht einmalig zertifizieren. Sie muss über den gesamten Lebenszyklus eines Systems hinweg immer wieder neu erarbeitet werden.

Die Autoren: Teresa Mary Kutzner ist Doktorandin zum Thema „Vertrauen in künstliche Intelligenz“ an der Hochschule der Medien Stuttgart in Kooperation mit Mercedes-Benz. Sönke Erdmann arbeitete als wissenschaftlicher Mitarbeiter an der Universität Potsdam in zwei großen BMBF(SFJ)-geförderten Bildungstechnologie-Projekten. Aktuell ist er Student  an der Universität Potsdam im Master Digitale Bildung und an der Universität von Amsterdam im Master Cultural Data & AI.(Bild:  Teresa Mary Kutzner / Kevin Ryl)
Die Autoren: Teresa Mary Kutzner ist Doktorandin zum Thema „Vertrauen in künstliche Intelligenz“ an der Hochschule der Medien Stuttgart in Kooperation mit Mercedes-Benz. Sönke Erdmann arbeitete als wissenschaftlicher Mitarbeiter an der Universität Potsdam in zwei großen BMBF(SFJ)-geförderten Bildungstechnologie-Projekten. Aktuell ist er Student an der Universität Potsdam im Master Digitale Bildung und an der Universität von Amsterdam im Master Cultural Data & AI.
(Bild: Teresa Mary Kutzner / Kevin Ryl)

Klassisch lassen sich beide Begriffe sauber trennen: Security schützt ein KI-System vor gezielter, böswilliger Manipulation, etwa durch Prompt Injections, Modelldiebstahl oder unautorisierten Zugriff. Safety hingegen adressiert Schäden, die ganz ohne Angreifer entstehen, etwa durch Halluzinationen, fehlerhafte Empfehlungen oder unvorhergesehenes Modellverhalten.

In der Praxis lässt sich diese Trennung aber immer schwerer aufrechterhalten. Der Grund liegt in der Architektur neuerer KI-Systeme: Sie bestehen nicht mehr aus einem isolierten Modell, sondern aus vielen miteinander vernetzten Komponenten. Eine kleine kompromittierte oder schlicht fehlerhafte Komponente kann dadurch zu einem systemweiten Ausfall eskalieren, unabhängig davon, ob am Anfang ein gezielter Angriff, eine fehlerhafte Konfiguration oder ein Bug stand.

Besonders deutlich wird das bei agentischen Systemen, denn sie handeln (teil-)autonom in einem größeren Ökosystem, dem sogenannten Harness. Dadurch wird menschliche Steuerung immer einfacher, zugleich nimmt jedoch die potenzielle Schadenswirkung zu. Security und Safety müssen deshalb vor allem bei agentischen Systemen kontinuierlich gemeinsam gemonitort werden, mit Zero-Trust-Prinzipien, minimalen Zugriffsrechten und verpflichtenden Freigaben durch Verantwortliche bei folgenschweren Entscheidungen. Das zeigt auch ein aktueller Vorfall, bei welchem ein KI-Modell von OpenAI aufgrund unzureichenden Vorkehrungen aus einer Testumgebung „ausgebrochen“ ist und die Plattform Hugging Face angegriffen hat.

Warum formale AI-Act-Compliance keine vertrauenswürdige KI garantiert

Der EU AI Act (2024) definiert diverse Richtlinien für Unternehmen im Einsatz von KI, um vertrauenswürdige Systeme zu schaffen, wie menschliche Aufsicht (Humans in/ on the Loop), technische Sicherheit, Fairness oder Transparenz (Auditfähigkeit). Für Hochrisiko-Systeme drohen bei Verstößen Bußgelder von bis zu 35 Millionen Euro oder sieben Prozent des weltweiten Jahresumsatzes. Trotz allem ist Compliance mit dem AI Act nicht gleich Vertrauenswürdigkeit.

Denn: Regulierung ist statisch, KI-Systeme sind es nicht. Ein Modell verändert sich durch neue Trainingsdaten, Nachtraining, veränderte Integrationen und neue Nutzungskontexte. Ein einmal erfülltes Kriterium kann wenige Wochen später schon nicht mehr zutreffen. Zudem beschreiben Regulierungen vor allem, was erreicht werden muss, sie liefern jedoch wenig konkrete Maßnahmen, wie das in komplexen, vernetzten Organisationen operationalisiert werden soll. Das Erfüllen formaler Anforderungen, wie Dokumentations- oder Klassifizierungspflichten, sagt wenig darüber aus, ob sich ein System unter realen Bedingungen tatsächlich vertrauenswürdig, fair oder sicher verhält.

Deswegen sollte in Unternehmen von punktueller Validierung bestimmter Richtlinien, hin zu kontinuierlichem Monitoring in abgestimmten, organisationsweiten Prozessen gearbeitet werden. In diesen sollte Verantwortung klar zugewiesen und Rechenschaftspflichten übernommen werden. Die Regulierung setzt hier die notwendigen Leitlinien, Monitoring über den gesamten Lebenszyklus bleibt jedoch eine anhaltende Aufgabe, um Qualität und Vertrauenswürdigkeit von KI-Systemen nachhaltig garantieren zu können.

Besser Fairness „by Design“ statt nachträglicher Korrekturen

Bias zeigt sich schon bei der Datenerhebung, nicht erst am Ende der Entwicklung von KI-Systemen. Daten sind per Definition aus der Vergangenheit und spiegeln gesellschaftliche Verzerrungen und Stereotype wider. Werden bestimmte Gruppen unterrepräsentiert, übernimmt das trainierte Modell diese Schieflage automatisch. Genau deshalb reicht es nicht, Verzerrungen erst nach dem Training zu berichtigen. Fairness muss von Beginn an mitgedacht werden.

Praktisch bedeutet das: Bereits vor der Datensammlung sollten Unternehmen festlegen, welche sensiblen Attribute im jeweiligen Anwendungsfall überhaupt relevant sind, und Herkunft sowie Zusammensetzung der Daten von Anfang an dokumentieren und nachverfolgbar machen. Wird ein Datensatz nachträglich bereinigt, um ihn ausgewogener zu machen, geschieht das meist auf Kosten der Modell-Performance und sollte deshalb bewusst und dokumentiert erfolgen, nicht als reflexhafte Nachbesserung.

Die Prüfung der Trainingsdaten entlang mehrerer vorher gewählter Merkmale wie Geschlecht, Alter, Sprache und dem sozioökonomischen Status empfiehlt sich hier oder alternativ die Auswahl eines Modells anhand entsprechender Kriterien. Unterstützen können Berichte von unabhängigen NGOs wie AIForensics oder CERTAIN. Auch hier gilt: Fairness ist mit dem Launch nicht abschließend bearbeitet und zertifiziert, sondern muss im Betrieb weiter überwacht werden, da neue Verzerrungen auch im späteren AI-Lifecycle entstehen können.

Jetzt Newsletter abonnieren

Täglich die wichtigsten Infos zu Big Data, Analytics & AI

Mit Klick auf „Newsletter abonnieren“ erkläre ich mich mit der Verarbeitung und Nutzung meiner Daten gemäß Einwilligungserklärung (bitte aufklappen für Details) einverstanden und akzeptiere die Nutzungsbedingungen. Weitere Informationen finde ich in unserer Datenschutzerklärung. Die Einwilligungserklärung bezieht sich u. a. auf die Zusendung von redaktionellen Newslettern per E-Mail und auf den Datenabgleich zu Marketingzwecken mit ausgewählten Werbepartnern (z. B. LinkedIn, Google, Meta).

Aufklappen für Details zu Ihrer Einwilligung

Wo SHAP, LIME & Co. in der Praxis an ihre Grenzen stoßen

„Explainable AI“ (XAI), die Erklärbarkeit von KI-Systemen, ist über das ethische Ideal hinaus inzwischen eine handfeste Compliance-Anforderung geworden. Der AI Act verlangt für Hochrisiko-Systeme unter anderem nachvollziehbare Ausgaben, wirksame menschliche Aufsicht und automatische Protokollierung. Doch gängige Erklärmethoden zeigen Schwächen auf.

XAI-Verfahren wie SHAP oder LIME lassen sich zwar auf nahezu jedes KI-Modell nachträglich anwenden, liefern dabei aber oft plausibel wirkende, in der Sache jedoch unzuverlässige Erklärungen. Dabei treten Probleme wie falsche Dateninterpretation oder mangelnde Reproduzierbarkeit der Erklärungen auf, die dadurch verstärkt werden, dass XAI-Methoden nachweislich gezielt manipuliert werden können.

Verschärft wird das Problem durch den Faktor Mensch. Nutzerinnen und Nutzer überschätzen häufig systematisch, wie gut sie ein System nach dem Erhalt einer Erklärung tatsächlich verstehen. Dabei kann das alleinige Dasein einer Erklärung zu einem übermäßigen Vertrauen führen, sogar wenn die Erklärungen eigentlich inkorrekt sind. Wenn eine Erklärung außerdem falsch interpretiert wird, kann das Vertrauen in die KI verzerrt werden, was zu schwerwiegenden Folgen führen kann. Das Verständnis von Erklärungen ist dabei stark abhängig von der jeweiligen Zielgruppe (den Nutzenden) und deren Expertise.

Die Konsequenz: Der bloße Einbau einer XAI-Schnittstelle ist kein Nachweis für echte Nachvollziehbarkeit oder Erklärbarkeit. Methoden müssen für die jeweilige Zielgruppe empirisch validiert werden, und Governance-Prozesse sollten aktiv prüfen, ob Erklärungen tatsächlich verstanden werden oder in die Irre führen.

Wenn Sprachmodelle falsche Informationen wiedergeben oder Unsicherheiten falsch darstellen, deutet das auf systemische Defizite in zentralen metakognitiven Fähigkeiten hin. Neben gängigen XAI-Methoden können hier andere Ansätze wie Reinforcement Learning mit metakognitivem Feedback zukünftig helfen, um die Vertrauenswürdigkeit und Zuverlässigkeit der Modelle wiederherzustellen.

Unsere Take Home Message

Belastbare Governance hängt nicht zwingend an der Unternehmensgröße, wohl aber an klaren Verantwortungszuweisungen.

  • Verantwortlichkeiten sollten explizit benannt werden: Eine RACI-Matrix beispielsweise hilft dabei festzulegen, wer für Daten, Modellverhalten, Deployment und Risikoszenarien zuständig ist. Sicherheitslücken entstehen meist durch unklare Zuständigkeiten an den Schnittstellen zwischen Teams.
  • Auf zentrale, statt verteilte Werkzeuge setzen: Einzelne „Insellösungen“ ohne übergreifendes Sicherheitskonzept erzeugen oft nur ein trügerisches Sicherheitsgefühl. Wenn möglich, sollten Funktionen in einer zentralen General Purpose AI gebündelt werden, statt in Einzellösungen. Sicherheit ist ein schwerwiegender Trade-Off gegenüber geringfügig besserer Performance in einzelnen Tasks.
  • Dokumentation als kostengünstigen ersten Schritt nutzen: Data Sheets, Model Cards und einfache Herkunftsnachweise für Daten sind vergleichsweise günstig umzusetzen, schaffen aber die Grundlage für spätere Audits, Fehleranalysen und Nachweispflichten.
  • Abhängigkeit von Drittanbietern bewusst einpreisen: Wer Modelle ausschließlich über externe APIs nutzt, spart Aufwand, hat aber auch keine Einsicht in deren Trainingsdaten, Sicherheitspraktiken oder Update-Zyklen. Für viele Anwendungen reichen kleinere, vollständig offene Modelle wie Apertus oder Soofi aus. Diese erfüllen auch höhere ethische Standards bei der Erhebung der Daten.
  • Offene (anbieterunabhängige) Tools für die Prüfung nutzen: Für Fairness-Prüfungen beispielsweise das Open-Source-Toolkit AI Fairness 360. Um KI-Systeme anhand der Richtlinien des EU AI Acts auf Compliance und Vertrauenswürdigkeit zu prüfen, gibt es außerdem diverse frei zugängliche Tools wie ALTAI oder Z-Inspection.
  • Nutzerbezogen und bedarfsorientiert arbeiten: Beim Einsatz von KI, XAI-Methoden oder Ähnlichem ist es essenziell, zuerst zu definieren, welche Menschen mit welcher Expertise und Bedürfnissen mit Ergebnissen interagieren, um Sicherheit und Mehrwert der gewählten Lösungen sicherzustellen. Methoden aus dem Interaktionsdesign (Human Computer Interaction), wie Personas oder Szenarien bieten sich hier an.

Artikelfiles und Artikellinks

(ID:50950244)