Texterkennung
Zweck
Eine abgelegte Rechnung ist nur so viel wert, wie sie wiederfindbar ist. Dieses Modul macht Dateien über ihren Inhalt durchsuchbar statt nur über den Dateinamen — und wählt dafür je Dateityp den Weg, der wirklich funktioniert.
Funktionsumfang
- PDF über die Textebene (
pdftotext). Die allermeisten PDFs im Dokumentenbestand — Rechnungen,
Angebote, Exporte — tragen eine Textebene. Sie auszulesen dauert Millisekunden, während echte Bilderkennung Minuten braucht und schlechter liest.
- Scans über Bilderkennung (
tesseract), aber erst, wenn aus der Textebene fast nichts
herauskam — dann ist es wirklich ein Scan.
- Bilder direkt über Bilderkennung.
- Office-Dateien im Klartext: docx, xlsx, pptx und die OpenDocument-Pendants sind ZIP-Archive mit
XML; der Text steht dort schon als Klartext. Das ist kein halbes Ergebnis wie geratene Bilderkennung, sondern exaktes Auslesen.
- Die Erkennung läuft im Hintergrund und hält den Upload nicht auf; wird die Datei gelöscht,
verschwindet der erkannte Text mit ihr.
Zusammenspiel
Die Erkennung hängt am Dokumentenbestand und speist die Volltextsuche. Sie ist damit auch die Voraussetzung dafür, dass ein gescanntes Dokument im KI-Zugriff überhaupt vorkommt.
Grenzen
- Keine Composer-Abhängigkeit — die Werkzeuge sind Systemprogramme. Ohne
pdftotextbzw.
tesseract auf dem Server passiert nichts; das Modul erfindet kein Ergebnis.
- Nicht unterstützt: Videos und die alten Binärformate
.docund.xls. Dafür bräuchte es
weitere Programme, und ein halbes Ergebnis wäre schlimmer als ein ehrliches „nicht unterstützt".
- Bilderkennung ist Schätzung. Bei schlechten Scans steht im Text, was das Programm gelesen hat
— nicht zwingend, was auf dem Papier steht.