4.2 Dublettenerkennung
Die importierten Daten werden automatisiert auf mögliche Dubletten untersucht.
Dabei dürfen nicht ausschließlich identische Zeichenketten verglichen werden.
In die Bewertung sollen unter anderem einfließen:
- Firmenname
- Firmenname ohne Rechtsform
- Vorname und Nachname
- Straße
- Hausnummer
- PLZ
- Ort
- Land
- Telefonnummer
- Mobilnummer
- E-Mail-Adresse
- Domain
- Umsatzsteuer-ID
- Handelsregisternummer
- Registergericht
- Creditreform-Nummer
- weitere eindeutige Identifikatoren
Das System berechnet einen Ähnlichkeits- bzw. Konfidenzwert.
Beispiel:
| Konfidenz | Bewertung |
| 100 % | sicher identisch |
| 95 % | sehr wahrscheinlich identisch |
| 78 % | mögliche Dublette |
| 35 % | wahrscheinlich unterschiedliche Datensätze |
Die Schwellenwerte müssen konfigurierbar sein.
No Comments