Datenschulden sind alle Datenprobleme, die ein Unternehmen heute ignoriert, weil ein Mensch sie im Kopf ausgleichen kann, und die an dem Tag fällig werden, an dem eine Maschine die Daten liest. Gartner prognostiziert: 60 Prozent aller KI-Projekte ohne KI-fähige Datenbasis werden bis Ende 2026 abgebrochen. Dieser Artikel definiert den Begriff, beziffert die Kosten und zeigt den Tilgungsplan.
Das Wichtigste in Kürze
Datenschulden bezeichnen alle Lücken, Widersprüche und ungeklärten Zuständigkeiten in Unternehmensdaten, die Mitarbeiter bislang durch Erfahrungswissen ausgleichen und die beim Einsatz von KI fällig werden.
Laut Gartner scheitern 85 Prozent der gescheiterten KI-Projekte an Datenqualität oder Datenverfügbarkeit, nicht am Modell.
Der Anteil der Unternehmen, die die Mehrheit ihrer KI-Initiativen abbrechen, ist von 17 Prozent (2024) auf 42 Prozent (2025) gestiegen (S&P Global Market Intelligence).
Schlechte Datenqualität kostet Unternehmen nach MIT Sloan 15 bis 25 Prozent des Umsatzes.
Der wirksamste Tilgungsweg besteht darin, nicht einzelne KI-Use-Cases zu priorisieren, sondern die Datengrundlage, die die meisten Anwendungsfälle gleichzeitig freischaltet.
Datenschulden sind alles, was ein Unternehmen bei seinen Daten heute ignoriert, weil ein Mensch es im Kopf ausgleichen kann. Fällig gestellt werden sie an dem Tag, an dem eine Maschine die Daten liest.
Der Begriff ist bewusst analog zu technischen Schulden gebaut, dem etablierten Konzept aus der Softwareentwicklung. Technische Schulden entstehen, wenn ein Team heute die schnelle Lösung wählt und die saubere auf später verschiebt. Der Code funktioniert, aber jede weitere Änderung wird teurer, bis irgendwann ein Refactoring unausweichlich ist. Datenschulden funktionieren genauso, nur eine Ebene tiefer: Nicht der Code trägt die Hypothek, sondern die Daten, auf denen alle Systeme aufsetzen.
Konkret setzen sich Datenschulden aus fünf Posten zusammen:
Silos: Dieselben Daten liegen in mehreren Systemen, die nichts voneinander wissen (ERP, Shop, CRM, Excel).
Drei Wahrheiten zur selben Sache: Derselbe Artikel, derselbe Kunde oder derselbe Preis existiert in mehreren Versionen, und niemand hat festgelegt, welche gilt.
Fehlende Attribute: Felder, die für Filter, Angebote oder Texte gebraucht würden, sind schlicht leer.
Keine Pflege-Regeln: Es gibt keinen definierten Prozess, wie neue Daten sauber entstehen und alte aktuell bleiben.
Kein Eigentümer: Niemand ist verantwortlich, wenn Daten falsch, doppelt oder veraltet sind.
Jeder einzelne Posten ist im Tagesgeschäft verkraftbar, solange Menschen die Daten lesen. Ein erfahrener Vertriebsmitarbeiter weiß, welche der drei Preislisten die aktuelle ist. Genau deshalb wurden diese Schulden nie beglichen: Sie haben nie sichtbar wehgetan. Professionelles Data Management beginnt damit, diese Posten überhaupt als Schulden zu bilanzieren.
Woher kommen Datenschulden?
Machen Sie eine kurze Zeitreise. Vor gut fünfzehn Jahren begannen die ersten Shop- und Katalogprojekte im Mittelstand mit riesigen Excel-Dateien: Artikelnummern, Maße, Beschreibungen, vierzig Spalten, und jede Abteilung hatte sie anders benannt, anders gefüllt und anders verstanden. Derselbe Artikel existierte dreimal, im ERP, im Katalog und in der Tabelle des Vertriebs, gern mit zwei verschiedenen Preisen.
Dann kam der Online-Shop. Filter, Beschreibungen und Preise wurden direkt aus diesen Tabellen gespeist. Was vorher ein internes Problem war, stand jetzt öffentlich im Netz.
Dann kam Omnichannel. Dieselben Daten liefen auf fünf Kanäle. Aus einem Fehler an einer Stelle wurden fünf Fehler an fünf Stellen.
Dann kam der Marketing-Stack: Targeting, Personalisierung und Automatisierung, aufgesetzt auf Kundendaten, in denen derselbe Kunde dreimal existiert.
Und heute setzen Unternehmen KI auf diesen gesamten Bestand. Das Muster über all die Jahre: Die Schulden wurden bei keinem Technologiesprung getilgt. Sie wurden umgeschuldet, immer ins nächste, größere System.
Parallel zur Qualitätsfrage ist die Strukturfrage gewachsen. Der Flickenteppich aus Datensilos, den heute fast jedes mittelständische Unternehmen hat, wurde nie beschlossen. Er ist in drei Phasen entstanden, und jeder Schritt war für sich genommen vernünftig:
Die IT zentralisiert: Am Anfang steht das ERP. Gebaut für Finanzen und Logistik, wird es trotzdem zur Single Source of Truth für Produkt- und Kundendaten erklärt. Dafür war es nie gedacht.
Die Fachbereiche ziehen aus: Shop, Marketing, CRM. Das ERP kann es nicht, also kauft jede Abteilung das Werkzeug, das sie heute braucht. Die Lücken dazwischen überbrückt Excel.
Die IT verbindet, besitzt aber nicht: Schnittstellen entstehen, Punkt zu Punkt. Die IT verlegt die Rohre. Die Daten selbst liegen zwischen den Stühlen.
Das Ergebnis lässt sich in einem Satz zusammenfassen: Die Systeme hatten Besitzer, die Prozesse hatten Besitzer, die Daten hatten keinen. Auch ein PIM-System löst dieses Besitzerproblem nicht automatisch, warum Ihr PIM-System allein nicht mehr ausreicht, haben wir an anderer Stelle ausführlich beschrieben.
Warum macht ausgerechnet KI Datenschulden sichtbar?
Der Flickenteppich hat nie allein funktioniert. Er lief auf einer unsichtbaren zweiten Schicht: Den Menschen, die ihn bedienen. Menschen tun zwei Dinge, die kein System kann.
Erstens gleichen sie aus. Die Vertriebsmitarbeiterin weiß, welche der drei Preislisten die aktuelle ist. Der Produktmanager weiß, dass die Spalte „Farbe“ und die Spalte „Color“ dasselbe meinen. Widersprüche, Lücken, drei Wahrheiten: Ein Mensch erkennt, welche gilt, und denkt sich den Rest dazu.
Zweitens reden sie miteinander. „Frag mal die Sabine, die weiß das.“ Der kurze Anruf im Vertrieb wegen des Sonderpreises. Dieses Zusatzwissen in den Köpfen war der eigentliche Kitt zwischen den Silos. Es stand nie in einem System, und es hat den Laden trotzdem zusammengehalten.
Eine KI macht nichts davon. Sie geht nicht zur Sabine. Sie ruft nicht im Vertrieb an. Sie nimmt die Daten so, wie sie dastehen, wörtlich und ohne den Kitt. Jede Version behandelt sie als gleich wahr, jeden Widerspruch skaliert sie in jede Antwort, jeden Text, jedes Segment.
KI ist nicht das Problem. Sie ist der erste ehrliche Kassenprüfer, den Ihre Daten je hatten. Jahrelang konnte man schlechte Daten verstecken, hinter Menschen, die die Fehler stillschweigend ausgebügelt haben. Die KI bügelt nichts aus. Sie nimmt Ihre Daten und macht daraus Ergebnisse. Und wenn die Daten Müll sind, macht sie daraus sehr schnellen, sehr selbstbewussten Müll.
Philipp Foreman
Geschäftsführer, onacy GmbH
Wie das konkret aussieht, zeigen zwei typische Szenarien.
Szenario 1, KI-Produkttexte: Zwanzigtausend Artikel, niemand will sie von Hand betexten, also soll das Sprachmodell ran. Ein guter Plan, genau dafür ist die Technologie da. Dann der Blick in die Daten: Bei 40 Prozent der Artikel fehlen genau die Attribute, aus denen der Text entstehen soll, bei weiteren 20 Prozent widersprechen sie sich. Der gefährliche Teil folgt jetzt: Die KI schreibt trotzdem. Sie füllt die Lücken, sie erfindet, was fehlt, flüssig, überzeugend, falsch. Das Projekt stirbt nicht an der KI, sondern an der Stammdatenpflege von 2019.
Szenario 2, KI-Targeting: Segmentierung, Personalisierung und automatisierte Strecken, alles KI-gestützt auf dem CRM. Nur existiert in diesem CRM derselbe Kunde dreimal, als „Müller GmbH“, „Mueller GmbH“ und „Müller GmbH und Co. KG“. Drei Schreibweisen, drei Historien, drei halbe Wahrheiten. Die KI personalisiert jetzt hochpräzise für Kunden, die es so gar nicht gibt, und bespielt tote Segmente mit sehr lebendigem Budget.
Beide Szenarien enden regelmäßig mit dem Satz „Die KI funktioniert bei uns nicht“. Die ausführliche Analyse, warum KI-Pilotprojekte scheitern, zeigt: Der Pilot lief im Sandkasten mit handverlesenen Daten, die Produktion läuft auf der Wahrheit.
Was kosten Datenschulden?
Datenschulden verhalten sich wie echte Schulden: Sie verzinsen sich. Die wichtigsten belastbaren Zahlen im Überblick:
Kennzahl
Wert
Quelle
KI-Projekte ohne KI-fähige Datenbasis, die abgebrochen werden (Prognose bis Ende 2026)
60 %
Gartner
Gescheiterte KI-Projekte, die an Datenqualität oder Datenverfügbarkeit scheitern
85 %
Gartner
Unternehmen, die die Mehrheit ihrer KI-Initiativen abbrechen (2024 auf 2025)
17 % → 42 %
S&P Global Market Intelligence 2025
GenAI-Piloten ohne messbaren Gewinnbeitrag
95 %
MIT Project NANDA 2025
Umsatzverlust durch schlechte Datenqualität
15 bis 25 %
MIT Sloan / Redman 2017
KI-Einsatz im deutschen Mittelstand, verfünffacht
4 % → 20 %
KfW-Mittelstandspanel
Stand: Juli 2026.
Bemerkenswert an dieser Tabelle ist die Gleichzeitigkeit: Der KI-Einsatz im Mittelstand verfünffacht sich, während sich der Anteil der Unternehmen, die die Mehrheit ihrer KI-Initiativen abbrechen, im selben Zeitraum mehr als verdoppelt. Beide Kurven beschreiben dasselbe Ereignis. Immer mehr Unternehmen ziehen ihre Piloten aus dem Sandkasten in die echten Daten um, und dort werden die Schulden fällig.
Für die Kostendynamik einzelner Datenfehler gibt es eine alte Faustregel, die 1-10-100-Regel (Labovitz/Chang 1992). Sie funktioniert wie ein Zinseszins: Mit jeder Stufe, die ein Fehler weiterwandert, verzehnfachen sich seine Kosten. Einen Datenfehler bei der Erfassung zu verhindern, ist die Basis, Faktor eins. Ihn später zu finden und zu bereinigen, kostet das Zehnfache. Ihn zu ignorieren, während er in Entscheidungen, Prozesse und Systeme einsickert, kostet das Hundertfache des ursprünglichen Aufwands.
Die meisten Unternehmen haben fünfzehn Jahre auf der Faktor-100-Stufe gelebt. Nicht aus Nachlässigkeit, sondern weil der Schaden nie auf einer Rechnung stand. Eine detaillierte Aufschlüsselung finden Sie im Artikel zu den Kosten schlechter Datenqualität.
Wie tilgt man Datenschulden?
Die gute Nachricht vorweg: Kein Schritt des Tilgungsplans braucht ein Zwei-Jahres-Budget. Vier Schritte führen von der Lähmung zur Klarheit.
Schritt 1: Folgen Sie dem Kitt. Fangen Sie nicht bei der Technologie an, nicht bei „Was könnte KI alles“. Fangen Sie dort an, wo heute schon ein Mensch der Kitt ist. Wer pflegt manuell eine Excel? Wer wird ständig „mal kurz gefragt“? Wo liefert jemand regelmäßig Wissen aus dem Kopf nach? Genau dort sitzt der Wert, und der Nutzen ist bereits bewiesen, ein Mensch erbringt ihn ja. Drei Filter trennen den echten Hebel vom Spielzeug: Die Tätigkeit muss wiederkehrend sein, sie muss datengetrieben sein (auf Informationen gebaut, nicht auf Handwerk oder Beziehung), und sie muss hohes Volumen haben, damit sich die Vorarbeit über die Menge lohnt.
Schritt 2: Priorisieren Sie nach Wirkung mal Datenreife. Machbarkeit heißt bei KI-Vorhaben vor allem eines: Wie tief ist die Datenschuld darunter? Hohe Wirkung bei halbwegs reifen Daten ergibt Ihre Quick Wins. Hohe Wirkung bei tiefer Datenschuld ergibt strategische Brocken, die Vorarbeit brauchen. Wer dort startet, produziert den nächsten toten Piloten. Eine ausführliche Methodik dazu beschreibt der Leitfaden KI-Use-Cases priorisieren.
Schritt 3: Priorisieren Sie Grundlagen, nicht Use Cases. Der klügste erste Schritt ist nicht der wertvollste einzelne Anwendungsfall, sondern die Datengrundlage, die den größten Stapel Anwendungsfälle gleichzeitig aufschließt. Ein Beispiel: Sie bringen Ihre Produktattribute in Ordnung, eine Wahrheit, ein Eigentümer, eine Pflege-Regel. Dafür bekommen Sie funktionierende Shop-Filter, KI-Produkttexte aus echten Attributen statt erfundener Lücken, dynamische Produktvergleiche und einen Assistenten, der aus einer Wahrheit antwortet statt aus dreien. Eine Grundlage, vier Anwendungsfälle: Das ist Ihre erste Batch.
In der Praxis liegt das Problem selten an fehlenden Ideen, sondern an zu vielen auf einmal. Am Ende priorisieren wir nicht dreißig Use Cases, sondern zwei, drei Datengrundlagen. Sobald die stehen, wird aus einer offenen Wunschliste ein Plan mit Reihenfolge, Meilensteinen und einem realistischen Termin.
Béla Yannik Hahne
Project Management & Operations, onacy GmbH
Schritt 4: Arbeiten Sie im Lean-Loop, nicht im Wasserfall. Datenschulden tilgen heißt nicht, erst zwei Jahre alle Daten aufzuräumen und dann KI zu machen. Dieser Daten-Wasserfall wird nie fertig und stirbt im Monat sechs beim ersten Budget-Review. Stattdessen kleine Schleifen: Use Case als Ziel definieren, das Datenumfeld analysieren, genau die eine Lücke schließen (vom Use Case gezogen, nicht auf Vorrat, mit Eigentümer und Pflege-Regel), dann bauen, messen, lernen und mit dem Ertrag in die nächste Schleife gehen. So finanziert sich die Tilgung selbst. Wie solche Schleifen in der Praxis aussehen, zeigt unser Hub zur KI-Automation im Mittelstand.
Womit fangen Sie morgen an?
Der Einstieg ist keine Wissenschaft, sondern ein Nachmittag mit einem Whiteboard, in vier Schritten:
Alle KI- und Automatisierungsideen auf den Tisch: Die aus den Fachbereichen, die vom letzten Strategie-Workshop, die aus dem Beirat.
Für jede Idee genau eine Frage stellen: Welche Daten braucht sie? Attribute, Preise, Kundendaten, Dokumente?
Die Ideen nach dieser Antwort gruppieren. Erfahrungsgemäß landen fast alle in zwei bis drei Clustern, typischerweise Produktdaten, Kundendaten und Dokumente.
Die Grundlage hinter dem größten Stapel wird Ihre erste Batch. Der Rest wartet, verfällt aber nicht.
Ob Ihr Unternehmen überhaupt Datenschulden hat, beantwortet ein kurzer Selbstcheck. Je mehr dieser Aussagen zutreffen, desto höher die Schuld:
Es gibt eine Excel-Datei, von der mehr abhängt, als offiziell zugegeben wird.
Zwei Systeme liefern zwei verschiedene Werte für dieselbe Kennzahl.
Wenn eine bestimmte Person kündigt, steht ein Prozess still.
Es ist unklar, wer welche Daten pflegt und wer bei Fehlern verantwortlich ist.
Die KI-Demo hat alle begeistert, im Echtbetrieb blieben die Ergebnisse leer.
Treffen drei oder mehr Aussagen zu, lohnt sich ein strukturierter Blick auf Ihre Datenbasis, bevor das nächste KI-Budget freigegeben wird. Genau dabei unterstützen wir: Buchen Sie ein unverbindliches Erstgespräch, und wir schauen gemeinsam, welche Datenschuld Sie gerade abzahlen, ohne es zu wissen.
Welche Datenschuld zahlt Ihr Unternehmen gerade ab?
Wir schauen uns Ihre Datenbasis, Ihre Systeme und Ihre KI-Vorhaben an und zeigen konkret, welche Datengrundlage die meisten Anwendungsfälle gleichzeitig freischaltet.
Datenschulden sind alle Datenprobleme, die ein Unternehmen heute ignoriert, weil Menschen sie im Kopf ausgleichen können: Silos, widersprüchliche Werte, fehlende Attribute, fehlende Pflege-Regeln und fehlende Verantwortlichkeiten. Fällig werden sie, sobald eine Maschine die Daten liest, etwa eine KI. Der Begriff ist analog zu technischen Schulden in der Softwareentwicklung gebildet.
Was ist der Unterschied zwischen Datenschulden und schlechter Datenqualität?
Schlechte Datenqualität beschreibt einen Zustand: Daten sind unvollständig, inkonsistent, veraltet oder nicht maschinenlesbar. Datenschulden beschreiben die Dynamik dahinter: Der Zustand wurde bewusst oder unbewusst in Kauf genommen, weil Menschen ihn kompensieren, und er verzinst sich mit jedem Technologiesprung. Datenqualität ist die Momentaufnahme, Datenschulden sind die aufgelaufene Hypothek samt Zinsen.
Woran erkenne ich Datenschulden im eigenen Unternehmen?
An fünf typischen Signalen: Eine Excel-Datei, von der mehr abhängt als zugegeben. Zwei Systeme mit zwei Werten für dieselbe Kennzahl. Ein Prozess, der stillsteht, wenn eine bestimmte Person ausfällt. Unklarheit darüber, wer welche Daten pflegt. Und KI-Piloten, die in der Demo begeistern, aber im Echtbetrieb leere Ergebnisse liefern. Schon drei Treffer deuten auf erhebliche Datenschulden hin.
Müssen erst alle Daten bereinigt werden, bevor KI eingesetzt werden kann?
Nein. Ein Zwei-Jahres-Wasserfall zur Datenbereinigung wird nie fertig und stirbt meist beim ersten Budget-Review. Sinnvoller ist ein Lean-Loop: Einen Use Case als Ziel definieren, nur die dafür nötige Datenlücke schließen, mit Eigentümer und Pflege-Regel, dann bauen, messen, lernen. Der Ertrag jeder Schleife finanziert die nächste. Die Tilgung wächst mit dem Nutzen mit.
Was passiert, wenn Datenschulden ignoriert werden?
Die Kosten verzehnfachen sich mit jeder Stufe, die ein Fehler weiterwandert (1-10-100-Regel). Schlechte Datenqualität kostet laut MIT Sloan 15 bis 25 Prozent des Umsatzes. Beim KI-Einsatz eskaliert das Problem: Gartner zufolge scheitern 85 Prozent der gescheiterten KI-Projekte an Datenqualität oder Datenverfügbarkeit, und 60 Prozent aller Projekte ohne KI-fähige Datenbasis werden bis Ende 2026 abgebrochen.
Autor
Philipp Foreman
Geschäftsführer, onacy GmbH
Philipp Foreman ist Geschäftsführer der onacy GmbH in Münster und beschäftigt sich seit über 15 Jahren mit Commerce-, Produkt- und Datenprojekten im Mittelstand. Den Begriff Datenschulden nutzt er, um sichtbar zu machen, warum KI-Projekte selten an der KI scheitern und fast immer an der Datenbasis darunter. Mit onacy begleitet er Hersteller und Händler von der Datenarchitektur bis zur produktiven KI-Automatisierung.