Datenarchitektur für Coding Agents Wenn KI-Agenten mit Unternehmensdaten arbeiten

Ein Gastbeitrag von Mike Fang 5 min Lesedauer

Anbieter zum Thema

Coding Agents werden zur primären Datenschnittstelle für Business User. Das verändert die Anforderungen an Datenplattformen: Enterprise Context, Semantik und Kontrollen müssen eine sichere und überprüfbare Arbeitsumgebung für Unternehmensdaten schaffen.

Mike Fang, VP Analyst bei Gartner: Ohne belastbare Semantik wird jeder Coding Agent zum Risiko für die Unternehmensdaten.(Bild:  Gartner)
Mike Fang, VP Analyst bei Gartner: Ohne belastbare Semantik wird jeder Coding Agent zum Risiko für die Unternehmensdaten.
(Bild: Gartner)

Bis 2028 werden Coding Agents – KI-gestützte Programmieragenten – nach Gartners Strategic Planning Assumption zur primären Schnittstelle für Business User im Umgang mit Daten und dabei traditionelle Werkzeuge wie Excel und BI-Dashboards übertreffen. Diese Veränderung geht weit über einen bloßen Wechsel der Benutzeroberfläche hinaus. Wenn ein Agent Daten analysieren, Anwendungen entwickeln oder Datenprozesse ausführen soll, muss er nicht nur rein technisch auf die benötigten Daten zugreifen können. Er muss auch verstehen, welche Daten relevant sind, was bestimmte Begriffe bedeuten, welche Regeln gelten und wie sich Ergebnisse überprüfen lassen.

Warum eine Datenplattform keine Codebasis ist

Codebasen bieten Struktur, Dokumentation, Änderungshistorie und Versionskontrolle. Datenmanagement-Umgebungen sind komplexer: Datenmodelle können sehr viele Felder enthalten, deren Relevanz und Bedeutung vom jeweiligen Kontext abhängen. Auch verändern sich der Datenkontext, Geschäftsdefinitionen, Schemas und Semantik fortlaufend.

Auch die Überprüfung ist in Datenmanagement-Umgebungen schwieriger. Bei Code zeigt ein Test häufig eindeutig, ob eine Ausführung funktioniert. Für datenbezogene Aufgaben gibt es dagegen oft keine eindeutig festgelegte richtige Antwort. Dann braucht es Vergleichswerte oder Evaluationsdatensätze. Die Unterschiede lassen sich in drei Dimensionen zusammenfassen: Kontext, Veränderungsdynamik und Überprüfbarkeit.

Agentic Data Coding als Architekturansatz

Agentic Data Coding setzt an dieser Lücke an. Coding Agents interpretieren die Absicht des Nutzers und den Unternehmenskontext einer Datenmanagement-Plattform. Daraus erzeugen sie ausführbaren Code für Daten-, Analytics- und Anwendungsentwicklungsaufgaben. Daten und Semantik werden damit nicht nur abgefragt, sondern in wiederverwendbare und überprüfbare Abläufe überführt.

Dabei entsteht eine kontrollierte Arbeitsumgebung über den vorhandenen Daten. Diese bietet die Werkzeuge, Frameworks und Protokolle, die Agenten benötigen, um sich an Veränderungen anzupassen und zuverlässig zu arbeiten.

Der Prozess läuft als Kreislauf: Kontext erfassen, planen, Code erzeugen, ausführen und bewerten. Der Kontext kann aus Ontologien – also strukturierten Beschreibungen von Begriffen und ihren Beziehungen –, AI-Skills oder dem Model Context Protocol (MCP) kommen. Evaluation und Observability liefern Rückmeldungen, die wieder in Plattform und Semantik einfließen.

Auch der Mensch bleibt Teil dieses Kreislaufs: Er setzt die Ziele, klärt Mehrdeutigkeiten, priorisiert, formuliert Abnahmekriterien und überprüft Ergebnisse.

Drei Fähigkeiten für die Datenplattform

Die technischen Anforderungen lassen sich in drei Bereichen einordnen: Der erste ist die Bereitstellung von Kontext. Coding Agents benötigen eine strukturierte Sicht auf Unternehmensdaten und Geschäftslogik. Dazu gehören Ontologien, Semantik, Metadatenmanagement, Governance und Security. Ergänzend können AI-Skills, MCP, Kommandozeilenschnittstellen und RAG Kontext zur Verfügung stellen.

Der zweite Bereich ist das kontrollierte Nachverfolgen von Veränderungen. Agentic Data Coding überträgt dafür Verfahren aus der Softwareentwicklung auf die Datenumgebung: Versionskontrolle, Git-Integration sowie CI/CD. Branching – parallele Versionszweige – und Sandbox-Umgebungen ermöglichen es, verschiedene Stände zu prüfen und bei Bedarf zu früheren Versionen zurückzukehren. Dabei können Code, Daten und Semantik gemeinsam betrachtet werden. Simulationen erweitern diese Testmöglichkeiten.

Der dritte Bereich betrifft die Überprüfbarkeit: Eine integrierte Evaluation und Observability sollen nachvollziehbar machen, wie Ergebnisse zustande kommen und ob sie den jeweiligen Anforderungen entsprechen. Das notwendige Überprüfungsprozedere sollte dabei „halbautomatisch“ verlaufen, also in einer Kombination aus automatisierten Tests und menschlicher Überprüfung, um Dinge wie Datenverträgen, Analytics-Anforderungen und Geschäftskennzahlen zu validieren.

Jetzt Newsletter abonnieren

Täglich die wichtigsten Infos zu Big Data, Analytics & AI

Mit Klick auf „Newsletter abonnieren“ erkläre ich mich mit der Verarbeitung und Nutzung meiner Daten gemäß Einwilligungserklärung (bitte aufklappen für Details) einverstanden und akzeptiere die Nutzungsbedingungen. Weitere Informationen finde ich in unserer Datenschutzerklärung. Die Einwilligungserklärung bezieht sich u. a. auf die Zusendung von redaktionellen Newslettern per E-Mail und auf den Datenabgleich zu Marketingzwecken mit ausgewählten Werbepartnern (z. B. LinkedIn, Google, Meta).

Aufklappen für Details zu Ihrer Einwilligung

Zusammen verändern diese Fähigkeiten die Rolle der Datenplattform. Aus einem Ort, an dem Daten bereitgehalten werden, wird eine kontrollierte Laufzeit- und Entwicklungsumgebung für Coding Agents.

Die semantische Schicht als gemeinsame Referenz

Eine besondere Rolle spielt die semantische Schicht. Sie hält gemeinsame Definitionen und Zusammenhänge fest, die Agenten über verschiedene Anwendungsfälle hinweg nutzen können. Unternehmen sollten einen belastbaren Semantic Layer als „Single Source of Truth“, also als gemeinsame Referenz, etablieren.

Dieser muss anhand von Evaluationsergebnissen, Feedback und veränderten Anforderungen fortlaufend gepflegt werden. Gartner bezeichnet diese Weiterentwicklung als „Semantic Evolution“. Bleiben dagegen veraltete oder widersprüchliche Definitionen bestehen, entsteht „Semantic Debt“ – semantische Altlast, die zu fehlerhaften Agentenergebnissen führen kann.

Plattformeigen oder herstellerunabhängig?

Für die technische Umsetzung gibt es zwei grundlegende Wege: Beim plattformeigenen Ansatz sind die Themen semantische Schicht, Coding Agent und Anwendungsbereitstellung eng integriert. Das ermöglicht vorgefertigte Funktionen und geringeren Anpassungsaufwand. Dafür wird die Bindung an das jeweilige Ökosystem enger. Eine plattformübergreifende Integration wird damit schwieriger, es droht ein Vendor Lock-in.

Mehr Offenheit und Flexibilität bietet ein herstellerunabhängiger Ansatz. Dieser erfordert aber deutlich mehr Entwicklungsaufwand. Semantische Schichten, Integrationen, Governance, Evaluation und Testumgebungen müssen selbst aufgebaut werden. Zugleich entstehen kombinierte Ansätze, weil die Grenze zwischen beiden Modellen zunehmend verschwimmt.

Risiken gehören in die Architekturentscheidung

Neben semantischen Altlasten und Herstellerbindung gibt es weitere Risiken. Dazu zählen etwa steigende Rechen- und Entwicklungskosten sowie die noch begrenzte Eignung vieler Werkzeuge für den Unternehmenseinsatz. Externe MCP-Server, Plug-ins oder Skills müssen geprüft und in abgeschotteten Testumgebungen erprobt werden. Zu nennen sind hier unter anderem Prompt- und Tool-Poisoning – also manipulierte Anweisungen oder Werkzeuge – sowie Angriffe auf die technische Lieferkette.“

Hinzu kommt, dass Governance-Mechanismen für Agentic Data Coding selbst noch im Entstehen sind. Eine zu starke Automatisierung ohne menschliche Kontrolle kann Fehler verstärken. Und ohne organisatorische Bereitschaft wird bereits die gemeinsame Semantik zum Problem: Unterschiedliche Definitionen und mangelnde Abstimmung erschweren eine unternehmensweit einheitliche Grundlage.

Was Unternehmen jetzt vorbereiten sollten

Es empfiehlt sich ein schrittweiser Einstieg über operative Anwendungsfälle im Datenmanagement. Mit wachsender Erfahrung können Unternehmen den Einsatz ausweiten. AI-Skills, Evaluation, Schutzmechanismen sowie DataOps-Praktiken wie CI/CD und Observability sollten dabei von Anfang an als Anforderungen an den produktiven Betrieb behandelt werden.

Zugleich sollten Data Platform Engineers, AI Engineers und Fachexperten enger zusammenarbeiten. Ihr gemeinsames Ziel ist eine belastbare semantische Schicht, die auch bei veränderten Geschäftsanforderungen vertrauenswürdig bleibt. In den Entwicklungsprozess gehören Versionsmanagement, Tests, Governance und feste Evaluationspunkte. Auch die Kosten müssen sowohl während der Entwicklung als auch im laufenden Betrieb kontrolliert werden.

Über den Autor

Mike Fang ist VP Analyst bei Gartner (Data & Analytics) mit Fokus auf KI und Datenstrategie. Zuvor war er 15 Jahre bei SAP, zuletzt als Head of Data Strategy and Innovation, China.

(ID:50953309)