https://wiki.ubuntuusers.de/tesseract-ocr/#xsane2tess xsane OCR -> tesseract als Text speichern, umbenennen in html alle html mit "cat file1 file2 > file-all.html" in word öffnen und korrigieren: — = - del ' einfügen Leerzeichen vor << oder >>