Executive Summary
- Uneinheitliche Stammdaten begrenzen das Ergebnis stärker als die Modellwahl.
- Die Bereinigung lässt sich am Anwendungsfall ausrichten und muss nicht vollständig sein.
- Nächster Prüfschritt: die Datenfelder bestimmen, die der geplante Anwendungsfall tatsächlich benötigt.
Was ist passiert?
Forschungseinrichtungen mit Transferauftrag weisen seit Jahren darauf hin, dass Datenqualität die häufigste Ursache für enttäuschte Erwartungen in KI-Projekten ist. Mit der Verbreitung generativer Modelle hat sich daran wenig geändert, weil auch sie auf die vorhandene Datenlage angewiesen bleiben.
Warum ist das relevant?
Die gute Nachricht: eine vollständige Datenbereinigung ist selten nötig. Entscheidend ist, dass die Felder stimmen, die der konkrete Anwendungsfall braucht.
Damit wird aus einem unbegrenzten Vorhaben eine abgrenzbare Aufgabe.
Was bedeutet das für den Mittelstand?
Typisch sind Dubletten in Kundenstammdaten, uneinheitliche Artikelbezeichnungen und historisch gewachsene Freitextfelder. Alle drei lassen sich gezielt und begrenzt angehen.
Passend dazu: KI-Reifegrad-Check
Empfehlung von Future AI Solutions
Leiten Sie den Bereinigungsumfang vom Anwendungsfall ab, nicht vom Datenbestand.
Legen Sie fest, wer künftig für die Pflege der betroffenen Felder verantwortlich ist.