Datenqualität für KI: Die vier Dimensionen, auf die es wirklich ankommt

Vollständig, konsistent, aktuell, maschinenlesbar: die vier Dimensionen der Datenqualität für KI, warum sie über KI-Ergebnisse entscheiden und wie Sie sie prüfen.
Datenqualität für KI

Zuletzt aktualisiert: 31. August 2026

Datenqualität für KI bemisst sich an vier Dimensionen: Vollständig, konsistent, aktuell und maschinenlesbar. Erst wenn alle vier erfüllt sind, liefert KI verlässliche Ergebnisse. Laut Gartner scheitern 85 Prozent der gescheiterten KI-Projekte an Datenqualität oder Datenverfügbarkeit. Dieser Artikel zeigt, was die vier Dimensionen konkret bedeuten und warum Datenqualität am Ende eine Wissensfrage ist.

Das Wichtigste in Kürze

Datenqualität für KI unterscheidet sich grundlegend von menschenlesbarer Datenqualität. Vier Dimensionen sind entscheidend: Vollständigkeit (keine Lücken, die eine KI erfinden muss), Konsistenz (eine Wahrheit pro Fakt über alle Systeme), Aktualität (Stand von heute, Veraltetes als veraltet erkennbar) und Maschinenlesbarkeit (strukturierte Felder statt Fließtext und Kopfwissen).

Laut Gartner scheitern 85 Prozent der gescheiterten KI-Projekte an Datenqualität oder Datenverfügbarkeit, laut MIT Sloan kostet schlechte Datenqualität 15 bis 25 Prozent des Umsatzes. Datenqualität ist letztlich eine Wissensfrage: Sie entscheidet, wie viel vom Wissen des Unternehmens für eine KI überhaupt erreichbar ist. Stand: Juli 2026.

Inhaltsverzeichnis

Warum entscheidet Datenqualität über KI-Ergebnisse?

Werfen Sie einen Blick in den Maschinenraum, in etwas, das inzwischen fast jeder benutzt: Einen Prompt. Ein guter Prompt besteht aus vier Bausteinen. Eine Rolle („Du bist Vertriebsassistent für technische Produkte“), eine Aufgabe („Erstelle ein Angebot für diesen Kunden“), ein Format („als Tabelle, eine Seite“) und die Kontext-Daten (welches Produkt, welcher Preis, welche Kundenhistorie hier konkret gelten).

Rolle, Aufgabe und Format kann jeder kopieren, das steht in jedem Ratgeber, und der Wettbewerber schreibt es genauso. Der Unterschied liegt in den Kontext-Daten. Erst sie machen die Antwort zu einer Antwort über Ihr Unternehmen und nicht über einen Durchschnitt. Und je größer die Aufgabe wird, desto weniger lassen sich diese Daten von Hand eintippen. Bei Automatisierung und KI-Agenten gibt niemand den Kontext mehr manuell mit. Die KI muss ihn selbst aus Ihren Systemen ziehen.

Damit hängt jede ernsthafte KI-Anwendung an einer Zutat, die nur Ihnen gehört. Ein KI-Ergebnis entsteht aus dem Modell (für alle gleich), dem Prompt-Handwerk (kopierbar) und dem zugänglichen Wissen (Ihr Alleinstellungsmerkmal). Und genau dieses zugängliche Wissen ist eine Frage der Datenqualität.

Welche vier Dimensionen machen Daten KI-tauglich?

Menschenlesbare Datenqualität und maschinenlesbare Datenqualität sind nicht dasselbe. Ein Mensch füllt Lücken aus Erfahrung, eine KI nicht.

In meiner Keynote „Data First, AI Second“ habe ich es zuletzt so formuliert: Die KI geht nicht zur Sabine. Sie ruft nicht im Vertrieb an, wenn der Sonderpreis unklar ist, und sie merkt nicht, dass zwei Spalten dasselbe meinen. Sie nimmt die Daten wörtlich, so wie sie dastehen. Genau an dieser Stelle trennen sich die beiden Qualitätsbegriffe, und vier Dimensionen entscheiden darüber, ob Ihre Daten KI-tauglich sind.

Vollständigkeit: Ist jedes benötigte Attribut gefüllt?

Fehlt ein Wert, existiert er für die KI nicht, und im schlimmsten Fall erfindet das Modell einen plausiblen. Für Menschen sind Lücken tolerierbar, weil sie den Kontext kennen. Für eine Maschine sind sie die häufigste Fehlerquelle.

Sind Ihre Daten konsistent?

Wenn derselbe Artikel im ERP, im Shop und in der Vertriebstabelle drei verschiedene Preise trägt, kann die KI nicht wissen, welcher gilt. Sie behandelt alle drei als gleich wahr. Konsistenz meint deshalb: Eine Wahrheit pro Fakt, über alle Systeme hinweg. Es ist die Dimension, an der Silos am sichtbarsten wehtun, und sie hängt eng mit der nächsten zusammen. Oft ist der vermeintliche Widerspruch zwischen zwei Systemen in Wahrheit ein Aktualitätsproblem, weil eines der beiden schlicht den Stand von vorgestern zeigt.

Wie aktuell ist Ihr Datenbestand wirklich?

Ein Beispiel aus dem Alltag: Im Laufwerk liegen drei Preislisten, zwei davon sind überholt, vermerkt ist das nirgends. Ein Mensch fragt kurz nach, der KI-Assistent zitiert mit hoher Wahrscheinlichkeit die falsche. Aktualität verlangt darum zweierlei: Den Stand von heute statt von vor drei Jahren, und dass Veraltetes als veraltet erkennbar ist.

Maschinenlesbarkeit: Kann eine Maschine Ihre Daten überhaupt lesen?

Die vierte Dimension ist die unscheinbarste: Strukturierte Felder statt Fließtext, PDF und Kopfwissen. Ein Attribut in einem eigenen Feld kann jede Maschine verarbeiten. Dieselbe Angabe, versteckt im dritten Absatz eines Datenblatt-PDFs, ist praktisch unsichtbar. Eine Maschine braucht Daten, keine Anekdoten.

DimensionLeitfrageTypischer FehlerSchnelltest
VollständigIst jedes benötigte Attribut gefüllt?Leere Pflichtfelder, aus denen die KI Werte erfindetAnteil leerer Attribute in der umsatzstärksten Warengruppe
KonsistentGibt es eine Wahrheit pro Fakt?Derselbe Artikel oder Kunde mehrfach mit abweichenden WertenZwei Systeme, dieselbe Kennzahl, ein Wert?
AktuellIst der Stand von heute erkennbar?Veraltete Versionen ohne KennzeichnungWie viele überholte Dokumente liegen ungekennzeichnet im Laufwerk?
MaschinenlesbarStehen Daten in Feldern statt in Fließtext?Werte in PDF, E-Mail oder Kopf statt im SystemAnteil strukturierter Felder gegenüber Freitext

Stand: Juli 2026.

Technisch entscheidet nicht, ob Daten irgendwo vorhanden sind, sondern ob sie strukturiert, eindeutig und maschinenlesbar im Datenmodell abgebildet sind. Was nur in Fließtext, E-Mail oder PDF liegt, existiert für ein KI-System schlicht nicht, egal wie wertvoll der Inhalt fachlich ist.

Was hat Datenqualität mit Wissen zu tun?

Wenn Sie die vier Dimensionen zusammennehmen, zeigt sich: Datenqualität ist am Ende gar keine reine Technikfrage. Sie ist eine Wissensfrage. Sie entscheidet, wie viel von dem, was Ihr Unternehmen weiß, für eine KI überhaupt erreichbar ist.

Das Wissen eines Unternehmens lässt sich in Schichten denken. Ganz unten das Allgemeinwissen, auf das jedes große Sprachmodell trainiert ist, seit heute Commodity. Darüber das Branchenwissen, Normen und Standards, das Ihre Wettbewerber ebenfalls haben. Dann das Unternehmenswissen, Ihre Produkte, Preise und Prozesse, das in keinem Modell der Welt steht, aber verstreut in Ihren Silos liegt. Und ganz oben das Erfahrungswissen in den Köpfen Ihrer Leute.

Nach oben steigt der Wert, nach oben sinkt aber die Zugänglichkeit für KI. Genau darin liegt der Hebel der Datenqualität: Sie hebt Unternehmenswissen aus dem Flickenteppich in eine Form, die eine Maschine lesen kann.

In den Projekten entscheidet selten die Technik über die Datenqualität, sondern die tägliche Datenpflege im Team. Wenn niemand klar verantwortet, wer welche Information wie erfasst, verfällt jedes Datenmodell wieder. Gute Datenqualität für KI ist deshalb vor allem eine Frage von Prozessen und Change, nicht nur von Tools.

Warum diese Wissensschichten über Ihren Wettbewerbsvorteil entscheiden, vertieft der Artikel Kopfwissen als unterschätztes KI-Risiko. Auch für die Anforderungen an Produktdaten für KI-Agenten gelten dieselben vier Dimensionen.

Wie prüfen Sie Ihre Datenqualität morgen früh?

Sie brauchen für eine erste Einschätzung kein Audit-Projekt. Ein kurzer Selbstcheck genügt. Je mehr dieser Aussagen zutreffen, desto tiefer sitzt die Datenschuld unter Ihren KI-Plänen:

  • Für dieselbe Kennzahl nennen zwei Systeme unterschiedliche Werte, und welcher stimmt, klärt erst ein Anruf.
  • Niemand kann auf Anhieb sagen, wer welche Datendomäne pflegt und wer einen Fehler ausbessern muss.
  • Irgendwo läuft eine Excel-Tabelle mit, an der deutlich mehr hängt, als das Organigramm vermuten lässt.
  • Der beeindruckende KI-Pilot aus der Demo hat im Echtbetrieb nie wieder dieses Niveau erreicht.
  • Würde eine bestimmte Kollegin oder ein bestimmter Kollege morgen kündigen, stünde mindestens ein Prozess still.

Treffen mehrere Aussagen zu, ist das kein Grund für ein Zwei-Jahres-Aufräumprojekt, sondern für einen fokussierten Blick auf die Daten hinter Ihrem wichtigsten Use Case. Was Datenschulden genau sind und wie man sie tilgt, beschreibt der Pillar-Artikel zu Datenschulden, die Kostenseite der Artikel zu den Kosten schlechter Datenqualität.

Die dauerhafte Sicherung von Datenqualität ist Kern unseres Bereichs Data Management, die produktive Nutzung Thema unseres Hubs zur KI-Automation. Wenn Sie wissen wollen, wie KI-tauglich Ihre Daten heute sind, buchen Sie ein unverbindliches Erstgespräch.

FAQ: Häufige Fragen zur Datenqualität für KI

Welche Dimensionen hat Datenqualität für KI?

Vier Dimensionen sind entscheidend: Vollständigkeit (jedes benötigte Attribut ist gefüllt), Konsistenz (eine Wahrheit pro Fakt über alle Systeme), Aktualität (Stand von heute, Veraltetes erkennbar) und Maschinenlesbarkeit (strukturierte Felder statt Fließtext, PDF und Kopfwissen). Erst wenn alle vier erfüllt sind, liefert eine KI verlässliche Ergebnisse.

Warum reicht menschenlesbare Datenqualität für KI nicht aus?

Menschen füllen Lücken aus Erfahrung, gleichen Widersprüche aus und wissen, welche Version aktuell ist. Eine KI kann das nicht. Sie nimmt die Daten wörtlich, behandelt jede Version als gleich wahr und erfindet fehlende Werte. Daten, die für Menschen ausreichend sind, können für eine Maschine unbrauchbar sein.

Wie messe ich Datenqualität im Unternehmen?

Beginnen Sie mit einfachen Schnelltests je Dimension: Wie hoch ist der Anteil leerer Attribute in der umsatzstärksten Warengruppe? Liefern zwei Systeme denselben Wert für dieselbe Kennzahl? Wie viele Dokumente sind veraltet, ohne gekennzeichnet zu sein? Wie viel Wissen steckt in Freitext statt in strukturierten Feldern? Diese vier Fragen geben eine belastbare erste Einschätzung.

Was bedeutet maschinenlesbar konkret?

Maschinenlesbar bedeutet, dass Daten in strukturierten Feldern mit definierter Bedeutung stehen, nicht in Fließtext, PDF-Dokumenten oder in den Köpfen von Mitarbeitern. Ein Attribut wie „Durchmesser: 250 mm“ in einem eigenen Feld ist maschinenlesbar. Dieselbe Information in einem Prosasatz eines Datenblatts ist es nur eingeschränkt.

Wie hängen Datenqualität und Wissensmanagement zusammen?

Datenqualität entscheidet, wie viel vom Wissen eines Unternehmens für eine KI erreichbar ist. Wertvolles Unternehmens- und Erfahrungswissen liegt oft verstreut in Silos oder ausschließlich in Köpfen und ist damit für Maschinen unsichtbar. Datenqualität hebt dieses Wissen in eine lesbare Form. Insofern ist gute Datenqualität angewandtes Wissensmanagement.

Philipp Foreman

Autor

Philipp Foreman

Geschäftsführer, onacy GmbH

Philipp Foreman ist Geschäftsführer der onacy GmbH und begleitet seit über 15 Jahren Commerce-, Produkt- und Datenprojekte im Mittelstand. Er hilft Herstellern und Händlern dabei, Datenqualität nicht als abstraktes IT-Thema zu behandeln, sondern als konkrete Voraussetzung dafür, dass KI im Unternehmen verlässliche Ergebnisse liefert.

 ·  LinkedIn

Wie KI-tauglich sind Ihre Daten heute?

Wir prüfen Ihre Datenlage entlang der vier Dimensionen, vollständig, konsistent, aktuell und maschinenlesbar, und zeigen konkret, wo der größte Hebel für Ihren wichtigsten KI-Use-Case liegt.

Erstgespräch vereinbaren