Skip to main content

4.2 Dublettenerkennung

Die importierten Daten werden automatisiert auf mögliche Dubletten untersucht.

Dabei dürfen nicht ausschließlich identische Zeichenketten verglichen werden.

In die Bewertung sollen unter anderem einfließen:

  • Firmenname
  • Firmenname ohne Rechtsform
  • Vorname und Nachname
  • Straße
  • Hausnummer
  • PLZ
  • Ort
  • Land
  • Telefonnummer
  • Mobilnummer
  • E-Mail-Adresse
  • Domain
  • Umsatzsteuer-ID
  • Handelsregisternummer
  • Registergericht
  • Creditreform-Nummer
  • weitere eindeutige Identifikatoren

Das System berechnet einen Ähnlichkeits- bzw. Konfidenzwert.

Beispiel:

Konfidenz Bewertung
100 % sicher identisch
95 % sehr wahrscheinlich identisch
78 % mögliche Dublette
35 % wahrscheinlich unterschiedliche Datensätze

Die Schwellenwerte müssen konfigurierbar sein.