Dokumente Digitalisieren

Status
Für weitere Antworten geschlossen.

samuelclemens

Lt. Commander
Registriert
Nov. 2017
Beiträge
1.645
Erst einmal würde ich gern die grundsätzliche Frage klären in welchem Format man die Dokumente am besten digitalisiert?
Der Scanner verfügt über ADF und duplex Scan der es mir ermöglicht ganze Stapel auf einmal zu Scannen.
Im moment würde mich aber erstmal nur interessieren ob besser als Bilddateien oder direkt eingebettet als Bild in ein PDF Dokument.
Der Scanner würde mir aber auch gleich OCR PDF ermöglichen. Das funktioniert aber mehr schlecht als recht.
Da wird anscheinend trotzdem ein Bild im Vordergrund in das PDF eingebettet aber der Text unsichtbar im Hintergrund.
Durch Copy und Paste hab ich aber sehr viele Fehler in der Texterkennung gefunden.

Ich gedenke später die Dokumente zwar alle nur Manuell zu archivieren aber per lokaler KI dennoch durchsuchbar.
Was wäre also am besten? PDF, OCR PDF oder doch lieber nur Bilddateien?

Das hier sind alle Scanformate
  • JPEG
  • TIFF
  • PDF (Standard)
  • Komprimiertes PDF (Kompakt-PDF)
  • Durchsuchbares PDF (mit OCR / Texterkennung)
  • Verschlüsseltes PDF
  • PDF mit digitaler Signatur
  • PDF/A-1b
  • PNG (beim Scannen in die Cloud)
 
Warum KI zum Durchsuchen?

Zum Beispiel mit dem Programm Paperwork wird sowohl das eingescannte Bild gespeichert als auch dann durch OCR Geschickt und Im Programm in der Darstellung der Text an den Stellen markierbar und kopierbar gemacht. sowie dadurch auch durchsuchbar mit normaler Suche. Klappt auch ziemlich gut mit dem OCR.

Da hast du dann Beides. Soweit ich weiß gibts da noch mehr Programme mit so nem vorgehen
 
Mit KI sind die Möglichkeiten umfangreicher.
Die kommt sogar mit Handgeschreibsel klar.
OCR hat bei meinen Tests einfach zu viele Fehler gebracht. Die Dokumente sind zb sehr oft gefaltet und das ergibt Fehler im Textbild die OCR schlecht erkennt. Odersie liegen manchmal nicht ganz perfekt ausgerichtet im ADF Schacht weshalb der Text dann leicht diagonal liegt.
Bei PDF mit OCR im Hintergrund hab ich zwar beides aber ich weiss nicht ob das die KI später beim verarbeiten eher durcheinanderbringt wenn sowohl Bild als auch Fehlerhafter Text im PDF enthalten sind.

Erst einmal geht es mir aber um das ausgangsformat was am besten ist um mir alle Möglichkeiten offen zu halten zur späteren Weiterverarbeitung.
Ich tendiere stark zum altbewährten PDF mit eingebettetem Bild. 🤔
 
Zuletzt bearbeitet:
Mir würde da pauschal Paperless einfallen, wenn das eine Option wäre.
 
  • Gefällt mir
Reaktionen: madmax2010
samuelclemens schrieb:
Mit KI sind die Möglichkeiten umfangreicher.
Ok, dann wird dich beruhigen, das beim OCR ein LLM genutzt wird :D
Ergänzung ()

Also mal noch so... Scannen in die Cloud? DEINE Dokumente?

Sowas kommt echt in Frage?
 
@Alexander2 Anscheinend nicht lokal auf meinem Gerät.

Alexander2 schrieb:
Also mal noch so... Scannen in die Cloud? DEINE Dokumente?
Nein, das sind die Möglichkeiten die das Gerät zur verfügung stellt.


Aber kommt. Macht einer den Thread dicht. Das führt hier zu nichts wie ich das sehe.
 
Du hast doch schon 2 Programmvorschläge bekommen.

Wenn es darum geht dir alles Offenzuhalten für später Zählt an erster Stelle die Qualität der Gescannten Dokumente. Also wie gut der Scan wird und die Pixelzahl...
Und das das gewählte Format das nicht runterdummt.

In der Hinsicht halte ich dann doch von PNG oder noch besser wegen quali vs Dateigröße JPEG XL noch am meisten.
Selbst würde ich jedes Dokument minimum 600DPI einscannen.
Bei PDF wird das doch schon eingeschränkt in der ganzen Hinsicht der Qualität? Soweit ich weiß? Teste selbst, mach nen A/B vergleich.
 
  • Gefällt mir
Reaktionen: samuelclemens
Status
Für weitere Antworten geschlossen.
Zurück
Oben