# 4.2 Dublettenerkennung

Die importierten Daten werden automatisiert auf mögliche Dubletten untersucht.

Dabei dürfen nicht ausschließlich identische Zeichenketten verglichen werden.

In die Bewertung sollen unter anderem einfließen:

- Firmenname
- Firmenname ohne Rechtsform
- Vorname und Nachname
- Straße
- Hausnummer
- PLZ
- Ort
- Land
- Telefonnummer
- Mobilnummer
- E-Mail-Adresse
- Domain
- Umsatzsteuer-ID
- Handelsregisternummer
- Registergericht
- Creditreform-Nummer
- weitere eindeutige Identifikatoren

Das System berechnet einen Ähnlichkeits- bzw. Konfidenzwert.

Beispiel:

<table id="bkmrk-konfidenz-bewertung-"><tbody><tr><td>Konfidenz</td><td>Bewertung</td></tr><tr><td>100 %</td><td>sicher identisch</td></tr><tr><td>95 %</td><td>sehr wahrscheinlich identisch</td></tr><tr><td>78 %</td><td>mögliche Dublette</td></tr><tr><td>35 %</td><td>wahrscheinlich unterschiedliche Datensätze</td></tr></tbody></table>

Die Schwellenwerte müssen konfigurierbar sein.