Skip to main content

OCR

OCR steht für Optical Character Recognition, auf Deutsch Optische Zeichenerkennung oder Texterkennung.

OCR ist eine Technologie, mit der Texte aus Bildern oder PDF-Dokumenten erkannt und in maschinenlesbare Daten umgewandelt werden.

Warum wird OCR benötigt?

Ein PDF ist nicht automatisch durchsuchbar.

Es gibt zwei Arten von PDFs:

  1. Text-PDF

    • Der Text ist bereits digital vorhanden.

    • Wörter können markiert und durchsucht werden.

  2. Bild-PDF (Scan)

    • Das Dokument besteht nur aus einem Bild.

    • Der Computer "sieht" zunächst nur Pixel, keinen Text.

Hier kommt OCR zum Einsatz: Die Software erkennt die Buchstaben und Zahlen im Bild und wandelt sie in echten Text um.

Beispiel einer Rechnung

Eine eingescannte Rechnung enthält:

Rechnung Nr.: RE-2026-154
Lieferant: Mustermann GmbH
Rechnungsbetrag: 2.350,00 €

Für den Computer ist das zunächst nur ein Bild.

Die OCR erkennt daraus:

  • Rechnungsnummer → RE-2026-154

  • Lieferant → Mustermann GmbH

  • Betrag → 2.350,00 €

  • Rechnungsdatum

  • Zahlungsziel

  • einzelne Positionen

Diese Informationen können anschließend automatisch weiterverarbeitet werden.

OCR im Rechnungsworkflow

Der Ablauf sieht häufig so aus:

PDF-Rechnung
        │
        ▼
OCR liest den Inhalt
        │
        ▼
Rechnungsdaten werden erkannt
        │
        ▼
Workflow startet
        │
        ▼
Sachliche Prüfung
        │
        ▼
Freigabe
        │
        ▼
Buchung

Ohne OCR müssten viele dieser Daten manuell eingegeben werden.

Vorteile von OCR

  • Automatische Erfassung von Rechnungsdaten

  • Weniger manuelle Eingaben

  • Schnellere Bearbeitung

  • Weniger Tippfehler

  • Volltextsuche in archivierten Dokumenten

  • Grundlage für automatisierte Workflows

OCR vs. KI

OCR und Künstliche Intelligenz werden häufig gemeinsam eingesetzt, erfüllen aber unterschiedliche Aufgaben.

OCR beantwortet die Frage:

„Welcher Text steht auf dem Dokument?“

KI beantwortet beispielsweise:

„Welche Bedeutung haben diese Informationen?“

Beispiel:

OCR erkennt:

Gesamtbetrag: 2.350,00 €

Eine KI kann anschließend daraus ableiten:

  • Das ist der Rechnungsbetrag.

  • Die Rechnung gehört zum Lieferanten "Mustermann GmbH".

  • Sie muss an die Kostenstelle "IT" weitergeleitet werden.

  • Aufgrund des Betrags ist eine Freigabe durch den Abteilungsleiter erforderlich.

Praxisbeispiel

Ein Lieferant schickt eine gescannte PDF-Rechnung per E-Mail.

  1. Das DMS speichert die PDF-Datei.

  2. Die OCR liest den gesamten Text aus.

  3. Das System erkennt:

    • Lieferant

    • Rechnungsnummer

    • Rechnungsdatum

    • Betrag

    • Zahlungsziel

  4. Der Workflow wird automatisch gestartet.

  5. Der zuständige Mitarbeiter erhält die Aufgabe zur sachlichen Prüfung.

Kurz zusammengefasst

OCR (Optical Character Recognition) ist die Technologie, die Text aus eingescannten Dokumenten oder Bild-PDFs erkennt und in maschinenlesbare Informationen umwandelt. Dadurch können Rechnungen durchsucht, automatisch verarbeitet und ohne manuelle Dateneingabe in digitale Workflows integriert werden.