welcome: please sign in
location: Änderungen von "PaperlessOffice"
Unterschiede zwischen den Revisionen 4 und 5
Revision 4 vom 2017-05-17 12:25:16
Größe: 4121
Kommentar:
Revision 5 vom 2017-05-24 13:20:18
Größe: 4769
Kommentar:
Gelöschter Text ist auf diese Art markiert. Hinzugefügter Text ist auf diese Art markiert.
Zeile 26: Zeile 26:
 * [[https://geizhals.de/fujitsu-scansnap-ix500-pa03656-b301-a1499766.html| Fujitsu ScanSnap iX500]]] - ein gerne verwendeter Scanner - Hier bitte beachten, dass der Drucker nicht TWAIN-Kompatibel ist. Damit ist z.B. eine Weiterleitung/Nutzung in einer Citrix XenApp-Session und auch Grafik-Software die nur auf TWAIN setzt, nicht möglich. Siehe auch [[http://www.scansnapcommunity.net/de/tag/twain/][HIER]].  * [[https://geizhals.de/fujitsu-scansnap-ix500-pa03656-b301-a1499766.html| Fujitsu ScanSnap iX500]]] - ein gerne verwendeter Scanner - Hier bitte beachten, dass der Drucker nicht TWAIN-Kompatibel ist. Damit ist z.B. eine Weiterleitung/Nutzung in einer Citrix !XenApp-Session und auch Grafik-Software, die nur auf TWAIN setzt, nicht möglich. Siehe auch [[http://www.scansnapcommunity.net/de/tag/twain/|HIER]].
Zeile 28: Zeile 28:
 * Herr Breinlinger bietet Support für [[https://www.drbreinlinger.de/Scanserver/Scanserver.htm|seine Lösung]] an. Wenn man den Scanner an einen Ubuntu-PC hängt und nicht an einen Raspberry Pi, läuft die Lösung stabiler.

Zeile 48: Zeile 51:
 * unpaper wird wohl nicht mehr weiterentwickelt, so dass imagemagick eine Alternative wäre, z.B. [[https://www.imagemagick.org/script/command-line-options.php#despeckle|despeckle]]
Zeile 55: Zeile 59:
  * beste Lösung für automatisierten Betrieb
  * wird von [[https://www.heise.de/ct/artikel/Toolbox-Texterkennung-mit-Tesseract-OCR-1674881.html|Google]] genutzt (z.B. für[[https://books.google.de/|Google Books]]) und gepflegt

Papierloses Büro

Gedanken zur Realisierung eines papierlosen Büros

Architektur

  • Scans werden in ownCloud-Ordnern gespeichert. Alles Tools, Server und Nutzer greifen auf diese Ordner zu.
  • Für die einzelnen Verarbeitungsschritte gibt es 3 Ordner: für Rohmaterial, Zwischenschritte und Endablage.
  • Diese 3-er-Gruppe gibt es für jede Nutzergruppe.
  • inotify meldet einen neuen File und stößt nächsten Schritt an.

Scannen

Einscannen mit Raspberry Pi und Scanner

Ablegen

  • in ownCloud-Ordnern
  • Alles Tools, Server und Nutzer greifen auf diese Ordner zu.
  • Es gibt verschiedene Ordner:
    • Scan - für Scans, bleiben dort erhalten bis alles fertig ist bzw. 1 Woche
    • Work - hier spielen sich alle Verarbeitungsschritte bis zum PDF/A ab. Wenn PDF/A entstanden, werden die Vorstufen abgeräumt und das PDF/A in die finalen Ordner verschoben
    • Ordner nach Inhalt oder Nutzergruppe benannt - dorthin wird das PDF/A verschoben und dann indexiert
  • Für jede Nutzergruppe (= ACL-Kombination) gibt es eine eigene Kette.

Konvertieren

Konvertieren, wenn Scanner ungeeignete Formate für das Postprocessing ausspucken.

Nachbearbeitung der Scans

  • unpaper (home) - Kommandozeilenprogramm zur Nachbearbeitung von fotokopierten/gescannten Bild- und Textvorlagen.

  • unpaper wird wohl nicht mehr weiterentwickelt, so dass imagemagick eine Alternative wäre, z.B. despeckle

OCR

Erkanntes in PDF integrieren

  • mit PDF/A-1a – Level A (Accessible) conformance: sowohl eindeutige visuelle Reproduzierbarkeit als auch Abbildbarkeit von Text nach Unicode und inhaltliche Strukturierung des Dokuments, so dass es im Sinne der Barrierefreiheit von einem Screenreader vorgelesen werden kann.

  • OCRmyPDF - Kommandozeilenprogramm, um für eingescannte PDF-Dateien eine durchsuchbare Textebene zu erstellen.

Erkanntes indexieren

Volltextsuche mit Recoll - Dieser Beitrag erläutert die Einrichtung bis zum Ausbau als Dokumentenzentrale im Netz mit Hilfe von Recoll WebUI]

  • recoll verarbeitet im Netzwerk auch Anfragen über den Webbrowser.
  • indexiert (mit geeigneten Filtern): .pdf, .doc, .tar, .zip, .ps, .rtf, .tex, .txt, .html, ...
  • ggfs. 1x/h incrementelle Indexierung anstoßen

offene Fragen:

  • Index über alle finalen Ordner (Problem: Man kann finden, was man nicht lesen darf.) oder für jede Nutzergruppe einzeln (Problem: Man muss mehrmals suchen). Man sollte mit wenigen Nutzergruppen (Direktoren, Fußvolk) arbeiten, so dass diese wissen wo sie suchen müssen bzw. ggfs. muss man nicht oft suchen.

Anmerkungen, Anregungen

Anmerkungen, Anregungen, Verbesserungsvorschläge hinterlasse man bitte auf der Diskussionsseite

PaperlessOffice (zuletzt geändert am 2018-09-12 13:16:17 durch thenmarkus@cbs.mpg.de)