Paperless-ngx: Wie sieht euer 1-Klick-Workflow in der Praxis aus?

Milchkühlung

Lieutenant
Registriert
Juli 2008
Beiträge
529
Hi zusammen,

ich will dieses Jahr endlich auf ein papierloses Setup setzen und meine Aktenordner auflösen (bzw. nur noch behalten, was zwingend im Original da sein muss). Alles andere: digitalisieren und weg damit.

Mein Ziel: minimaler Aufwand. Papier rein, Taste drücken, fertig. Die PDFs sollen automatisch per OCR durchsuchbar sein, getaggt werden und im Archiv landen, ohne dass ich danach jedes Mal am Rechner sitze und manuell umbenennen muss.

  • Schickt ihr die Scans per Scan-to-Folder (SMB/FTP) aufs NAS, an einen Mailordner oder wie löst ihr den 1-Klick-Ablauf?

  • Paperless-ngx scheint ja der Standard zu sein: Wie gut klappt das Auto-Tagging über Workflows bzw. Machine Learning wirklich? Ab wann läuft das zuverlässig im Alleingang?

  • Was sind die typischen Fehler am Anfang, die unnötig Zeit fressen?

Ich will das Setup so aufbauen, dass es sich im Alltag praktisch von selbst trägt. Wenn es am Ende mehr Nerven kostet als „kurz abheften“, wäre der Sinn für mich verfehlt.

Freue mich über eure Tipps!
 
Ich nutze die Android App Genius scan.
Ohne OCR.
Die Scans fliegen in die entsprechenden Ordner wie "Versicherungen", "Auto" etc.
Einfach und billig. Wird dann in der Dropbox gespeichert und entsprechende Datensicherung angelegt.
One click isses nicht. Günstig und einfach.
 
  • Gefällt mir
Reaktionen: PeterSchmidt_80
Milchkühlung schrieb:
Schickt ihr die Scans per Scan-to-Folder (SMB/FTP) aufs NAS, an einen Mailordner oder wie löst ihr den 1-Klick-Ablauf?
Im wesentlichen hängt das vom Scanner ab.
Wenn der auf SMB ablegen kann, dann ist das der Königsweg.
Wenn nicht, dann Email. Wer ein home lab betreibt wird oftmals ohnehin eine eigene Maildomain haben, ob er sie aktiv nutzt oder nicht.
Milchkühlung schrieb:
Was sind die typischen Fehler am Anfang, die unnötig Zeit fressen?
  • den admin account verwenden. Admin ist Admin. Pack deine Dokumente in deinen User.
  • Sich vorher zu viele Kategorien überlegen, für die noch gar keine digital(isiert)en Dokumente da sind. Am Ende des Tages funktioniert die Volltextsuche in Paperless sehr gut. Ob das Dokument getaggt ist oder kategorisiert oder whatever ist eigentlich egal, man findet es trotzdem.

Milchkühlung schrieb:
Wie gut klappt das Auto-Tagging über Workflows bzw. Machine Learning wirklich? Ab wann läuft das zuverlässig im Alleingang?
Bei mir quasi von Anfang an. Wenn ich ein Dokument als Autoversicherung deklariert habe, hat er bisher alles von der Autoversicherung automatisch als Autoversicherung erkannt. Allerdings sind das z.B. bei mir alles keine Scans, ich bekomme eigentlich kein Papier mehr.
 
Paperless ist meiner Meinung nach die richtige Lösung, aber so ganz one-click ist nur machbar, wenn deine Ansprüche weniger komplex sind.
Ich pflege z.B. auch die Korrespondenten, Die musst du einmal manuell anlegen - das kann Paperlees nicht automatisch. Wenn dann das nächste Dokument vom gleichen Absender kommt, wird das jedoch erkannt.
Auch musst du dir einige Gedanken über die Ordnerstruktur, Dokumenttypen und Tags machen.

Insgesamt läuft viel automatisch, aber eben nicht komplett ohne manuelle Eingriffe. Bei mir heißt das ich schiebe ein paar Dokumente in den „consume“ Ordner und schaue alle paar Tage nach, was ich noch vervollständigen muss. Das ist mit recht wenig Aufwand verbunden.
 
Milchkühlung schrieb:
Wenn es am Ende mehr Nerven kostet als „kurz abheften“, wäre der Sinn für mich verfehlt.

Es kostet mehr Nerven. Ganz klar.

Aber dafür gibt es eben auch Vorteile die du beim Abheften nicht hast.
 
Der größte und aufwändigste Fehler tritt auf, wenn OCR einen Fehler macht und der gesuchte Begriff nicht gefunden wird.
Ohne Ordnerstruktur muss man dementsprechend in Hunderten oder Tausenden von Dokumenten manuell suchen.

Ich habe Paperless-ngx parallel zu meiner altmodischen Struktur getestet. Leider war es am Ende ineffizienter als das manuelle Verschieben der Dokumente in einen entsprechend benannten Unterordner.

Daher ist mein Workflow geblieben:
1. Dokument scannen (automatisch mit OCR)
2. Dokument digital selbst lesen und ggf. darauf reagieren
3. Drag & Drop in den entsprechenden Ordner

Schritt 1 und 3 kosten nur einen winzigen, irrelevanten Bruchteil von Schritt 2 und werden zusammen mit Schritt 2 erledigt. Daher ist es keine Zeitverschwendung.

Das Aufrufen der Dokumente dauert über die normale Windows-Suchfunktion genauso wie über paperless-ngx etwa 3 Sekunden, da der entsprechende Ordner mit seinen Unterordnern indiziert ist.

Wenn die Dokumente, wie bei @h00bi, direkt digital vorliegen, ist es egal, ob man eine Software oder die Windows-Suche nutzt, da jedes Zeichen sauber lesbar ist. Bei OCR hängt es jedoch von mehreren Faktoren ab, ob und wie die Zeichen erkannt werden.

Standard-Schriftarten in guter Qualität sind meistens kein Thema. Sonderzeichen wie § sind bereits problematisch und Bilder oder Logos werden ggf. gar nicht erkannt.
 
  • Gefällt mir
Reaktionen: halwe
Mein Workflow sieht so aus, dass ich über den Scanner auf ne SMB-Freigabe einscanne. Der Ordner wird automatisch von Paperless-ngx überwacht. Da mein Drucker/Scanner leider nicht 2-seitig scannen kann hab ich noch einen weiteren Ordner eingerichtet, der automatisch Dokumente zusammenführt (https://docs.paperless-ngx.com/configuration/#collate). Also man scannt erst alle Vorderseiten ein und anschließend alle Rückseiten.

Seit einiger Zeit bietet Paperless selbst eine kleine PDF-Bearbeitung an, bei der man Dokumente zusammenführen, Seiten drehen oder entfernen kann. Daher braucht man das im Zweifel nicht unbedingt mehr.

Am aufwendigsten war und ist natürlich die Erstanlage. Hier habe ich von allen verschiedenen Dokumenten jeweils 1-2 hergenommen und diese initial gescannt und wie oben bereits beschrieben wurde den Korrespondenten sowie die dazugehörigen Tags angelegt.
Man muss beachten, dass das Machine Learning nicht sofort läuft sondern alle X Stunden oder so aktualisiert wird (glaube kann man forcieren indem man einfach komplett neustartet).

Nach der Wartezeit habe ich dann die Dokumente hinzugefügt. In der Regel klappt mit 1-2 Dokumenten die automatische Korrespondentenfindung ganz gut. Dokumenttypen (Rechnung, Kontoauszug, Vertrag, Sonstiges z. B.) klappt bei mir meist auch. Die Tags brauchen am Anfang meist mehr Aufmerksamkeit, aber auch das läuft dann.

Achso, ich vergas, dass neue Dokumente grundsätzlich erst einmal einen Inbox-Tag erhalten. Diesen hab ich als eigenen Suchfilter abgespeichert bzw. werden die Dokumente auf der Startseite angezeigt. Diesen Tag entferne ich immer manuell um eine korrekte Zuordnung zu gewähren.
Wie gesagt, die Zuordnung Korrespondenten, Dokumententyp, Tags klappt meist sehr gut und nur wenige Dokumente müssen nachgearbeitet werden. Am meisten muss ich das Datum der Dokumente anpassen. Zum Glück gibt es hier auch einfache Vorschläge aus dem Dokument, auf die man nur noch klicken muss:
1787317021234.png


Was man bei normalen Scans manuell ändern muss ist der normale Dokumententitel. Bei digitalen Dokumenten ist hier meist im Dokument bereits etwas hinterlegt.
 
Ich halte One Click auch nicht für optimal. Meine elektronische Ablage auf dem NAS muss übersichtlich, schnell erfassbar und produktunabhängig sein. Ein Wiederfinden von Dokumenten per Volltextsuche ist wichtig, aber nicht das wichtigste. Deshalb scanne ich samt OCR (das macht zum Glück die Druckersoftware), mache aber das Benennen und Einsortieren in Ordner konsequent selbst.
So gibt es eben bei der Bank Eröffnungsunterlagen, Geschäftsbedingungen, monatliche Kontoauszüge, Jahresabschlussunterlagen und unterjährige Einzelbelege und alles in jeweils getrennten Ordnern. Ich glaube, es wäre mühsam, einem DMS beizubringen, diese Einordnung genau nach meinen Wünschen vorzunehmen, zumal sich das am Anfang auch noch öfter ändert.
Noch komplizierter ist es bei den Dateinamen. Neben dem Datum enthalten die bei mir immer auch den jeweiligen Sachverhalt (z. B. "2025-11-03 Allianz Haftpflicht Beitragserhöhung auf 85 €.pdf"). Ein Dateiverzeichnis liest sich so wie eine fortlaufende Geschichte.
Ja, und das ist eben auch wichtig: Einfache Dateiverzeichnisse. Windows bietet selbst Volltextindizierung, Vorschau, zig Ansichtsvarianten oder auch dedizierte Benutzerrechte an. Zusätzlich hat man aber den Vorteil, das ein Windows Dateiverzeichnis nativer Teil des BS ist und von allen Softwareprodukten direkt verstanden und gehandhabt werden kann. So kann ich zum Beispiel Teile meines Dokumentarchivs aufs Handy spiegeln. Auch für KI Recherchen muss ich nicht extra etwas exportieren.
 
  • Gefällt mir
Reaktionen: Clanker
Dann mach dir mal noch Gedanken um ein Backup der Instanz. Wenn alles wichtige nur noch digital vorliegt, dann wäre es sehr ungünstig, wenn Paperless nicht mehr funktioniert und alles weg ist. Recovery vom Backup sollte man auch immer wieder testen...
 
1. Backup
2. Backup
3. Backup

4. Ich finde die Automatisierungsmöglichkeiten innerhalb von paperless eher suboptimal. Wenn du da den Willen zu hast, mal überlegen noch eine N8N Instanz daneben zu stellen und die internen Workflows darüber abzubilden. Customfields für Rechnungsbeträge und noch viel mehr.
 
Danke euch für den ganzen Input, da sind echt gute Punkte dabei.

Was die manuelle Windows-Ordnerstruktur angeht... Genau dieses händische Umbenennen nach Datum und Absender ist das, woran ich bisher immer gescheitert bin, bzw wo mir auf Dauer die Motivation gefehlt hat. Daher wäre ich an einem weitestgehend autonomen Setup interessiert.

Der Workflow von @slrzo und @h00bi klingt für mich bisher am besten: Scannen, Paperless vergibt ein "Inbox"-Tag und ich schaue einfach einmal die Woche drüber. Wenn das Machine Learning da nach einer Weile greift, ist das genau der Minimal-Aufwand, den ich suche.

Zum Scanner selbst: Dass SMB hier der Königsweg ist, trifft sich super. Ich habe für das Projekt netterweise einen Dokumentenscanner von Epson als Teststellung hier, der nativ Scan-to-SMB direkt vom Display (nach Einrichtung nur ein Klick) aus kann. Das werde ich dann auch genau so nutzen.

An @floklo4 und @Baalthorun: Das Thema Backup ist absolut angekommen. Wenn mein mini Homeserver stirbt, wäre das tragisch.

Eine Paperless-Instanz habe ich nun testhalber innerhalb meiner HomeAssistant Instanz aufgesetzt.


Dazu noch eine kurze Frage an die Paperless-Nutzer zum Workflow: Wie macht ihr das rein physisch mit gemischten Briefen/Dokumenten?
Haut ihr alles als einen riesigen Stapel in den Scanner und nutzt Trennblätter (mit Barcode oder Blanko-Seiten), damit Paperless die PDFs automatisch splittet, oder scannt ihr jeden Brief ohnehin einzeln ein?
 
Ich habe nach Simplex einseitig, Simplex mehrseitig und Duplex Dokumenten sortiert und diese dann unterschiedlich gehandhabt.

Hab direkt über NAPS2 den Scanner angesteuert. Gerade für mehrere Dokumente kann ich das Tool empfehlen.

Simplex einseitig kannst direkt als Batch verarbeiten. „Lege jede Seite als einzelnes pdf in folgenden Ordner ab“

Simplex mehrseitig kannst dann entweder mit Trennseiten aufsplitten oder per Hand in NAPS.

Mehrere Dokumente Duplex ist ein wenig umständlicher. Erst den Stapel von beiden Seiten scannen. Dann „alternativ interleave“ sortieren und erst danach die leeren Seiten löschen. Auch hier kannst mit trennseiten arbeiten oder manuell.
 
Den Papierkrieg habe ich mir schon lange abgewöhnt, weil es mir zu aufwendig war, ein Dokument in Ordnern heraussuchen zu müssen. Daher habe ich irgendwann damit angefangen, alle meine Dokumente einzuscannen und auf meinem Rechner zu speichern. Aber auch hier sammelt sich mit der Zeit einiges an.

Seit kurzer Zeit nutze ich jetzt auch Paperless und finde es richtig gut. Ich nutze hierzu meinen Scanner, der die Dokumente direkt im Compose-Verzeichnis ablegt. Habe auch eingerichtet, dass aus einem bestimmten Verzeichnis meiner E‑Mail PDF‑Dateien erkannt und automatisch eingescannt werden. Hierzu nutze ich ein eigenes Verzeichnis und verschiebe oder kopiere die E‑Mails dazu, weil ich nicht den ganzen Spam mit dazu haben möchte.

Ich schaue aber mit jedem Dokument rein, ob es korrekt zugeordnet wurde, und bearbeite ggf. noch den Titel etwas nach. Danach wird abgespeichert und das geht recht flott. Mit Paperless lassen sich aber später Dokumente viel schneller suchen und ausgeben und das ist das Hauptziel dabei.

Ich merke aber, dass ich anfangs mehr nachbearbeiten musste und Paperless recht schnell dazu lernt und Dokumente jetzt fast oder gar komplett korrekt erkennt.
 
  • Gefällt mir
Reaktionen: Milchkühlung
Bezüglich scannen mache ich das einzeln für jedes Dokument. Wenn man anfangs viel auf einmal einscannen muss ist das natürlich etwas mühselig, aber wollte mich da nicht mit Trennseiten etc. rumschlagen müssen. Wenn alles erstmal läuft ist der Aufwand finde ich überschaubar.

Ich empfehle, bevor es produktiv eingesetzt werden soll, einfach mal mit einer ersten Testinstanz rumzuspielen und diverse Punkte zu testen. Zur Nutzung gibt es bei den Docs (https://docs.paperless-ngx.com/usage/) viele Punkte. Dort sind auch Best Practices sowie Workflows beschrieben, was wie ich finde einen guten Ausgangspunkt bilden kann.

Achja, neben dem Inbox-Tag habe ich beispielsweise noch einen Tag "bezahlt", den ich bei Rechnungen verwende. Auf meiner Startseite lasse ich dann mir neben den Inbox Dokumenten auch alle Dateien mit Dokumententyp Rechnung anzeigen, die nicht den Tag bezahlt haben:
1788882320150.png
 
Ich nutze NAPS2 und scanne alles mit meinem Duplex Scanner ein.
Die PDF's bearbeite ich manchmal noch. Leere Seiten entfernen, da ich immer Duplex Scanne oder mal eine Seite drehen / zuschneiden.
dann kommt das Dokument in den consume Ordner und wird automatisch hochgeladen.
Hier bekommt auch jedes Dokument automatisch einen Posteingang Tag.
Die Sortierung nehme ich händisch vor, so viel kommt ja nicht rein und vieles wird mittlerweile auch automatisch kategorisiert.

Am Handy nutze ich noch die App "Swift Paperless".
Aber eigentlich nur wenn ich mal eben ein Dokument brauche und gerade der Laptop nicht in der nähe ist.

Für mich sehr praktikabel.
 
Bei mir war genau an der Stelle Schluss, die slrzo beschreibt. Korrespondent und Typ hat paperless irgendwann gut erkannt, aber Titel und Datum hab ich trotzdem jedes Mal selbst angefasst. Nach ein paar Wochen hatte ich ein Archiv und tippte abends immer noch Titel.

Bin dann raus und hab mir das anders gebaut, als Android-App. Ist meine, also nimm das mit Vorsicht. Statt OCR plus Regeln geht die ganze Seite an ein Sprachmodell, und Titel, Absender und Datum kommen ohne Vorlage je Absender zurück. Den Schritt kann man auch an paperless dranhängen, über die Post-Consume-Hooks.

Ehrlich dazu: läuft nicht auf dem NAS, braucht Netz, ungefähr zehn Sekunden pro Blatt. Und beim Ordner rät es auch mal daneben, bei mir zwei Tierarztrechnungen in zwei verschiedenen Ordnern.

Was mich interessiert: fasst ihr den Titel noch an, wenn der Absender längst bekannt ist? Wenn nicht, ist das Ganze nur ein Erstanlage-Problem.
 
Zuletzt bearbeitet:
Zurück
Oben