Re: wordcount

"Heiko Oberdiek" (via tex-d-l Mailing List) <[email protected]>
Newsgroups gmane.comp.tex.german
Message-ID <[email protected]>
Hallo,

On 2022-11-28 07:31, Doris Behrendt (via tex-d-l Mailing List) wrote:
> 
> ich stehe vor der Aufgabe, die Wörter eines 700-Seiten PDF zu zählen, welches sehr viel Mathe, Codebeispiele, Bilder etc. enthält.

Frage: Was ist denn ein Wort?

   * https://de.wikipedia.org/wiki/Wort:
     | Eine allgemein akzeptierte Definition existiert nicht und gilt
     | auch als „schwierig“, da der Begriff „Wort“ lexikalisch mehrdeutig
     | bzw. (konkreter) vage ist und sowohl vom
     | Untersuchungsgesichtspunkt und von der jeweils interessierenden
     | sprachlichen Ebene abhängt als auch von den diesbezüglichen
     | Theorien.
   * https://de.wikipedia.org/wiki/Wort_(theoretische_Informatik)
     Hier kann ein Wort präzise definiert werden. Allerdings muss dann
     natürlich auch die mathematische Definition des Wortes/Sprache
     angegeben werden.

Frage: Was soll gezählt werden?

   * Alle Wörter
   * Kein Inhaltsverzeichnis, Footer, Header, ...
   * Mathe?
   * Nummern/Zahlen einerseits im Fließtext, andererseits
     Gliederungsnummern, Seitennummern, ...
   * Wörter in Bildern?
   * ...

Technische Schwierigkeiten:
   * Eine PDF-Datei kann lediglich eingescannte Seiten (Bilder)
     enthalten, so dass man dann nur noch mit OCR-Programmen weiterkommt.
   * Worttrennungen.
   * Font-Encodings. Eine PDF-Datei muss im Allgemeinen kein Mapping
     nach Unicode oder einem anderen bekannten Encoding enthalten.
     Dann hilft nur noch OCR weiter.
   * Mehrdeutigkeiten: Ein o mit Schrägstrich kann ein Durchmessersymbol
     bedeuten, was vielleicht nicht als Wort gezählt wird. Oder aber es
     ist etwa Teil eines skandinavischen Wortes.
   * ...
> Wie würdet ihr das machen? Ich habe ps2ascii datei.pdf | wc -w genommen, aber befürchte, dass der Count sehr ungenau ist.

Die Umwandlung von PDF zu Text hängt sehr von der PDF-Datei ab. Nach 
meiner Erfahrung gibt es kein Tool, das mit allen PDF-Dateien die besten
Ergebnisse liefert. Je nach PDF-Datei ist mal das eine oder andere Tool 
besser geeignet, so dass man verschiedene ausprobieren sollte.

Weitere Alternativen:

* pdftotext (https://en.wikipedia.org/wiki/Pdftotext)
* ExtractText (https://pdfbox.apache.org/2.0/commandline.html#extracttext)

> Mich wundert nur, dass man das mit Acrobat Pro nicht machen kann, den habe ich auch, aber der hat keinen wordcount ... oder doch und ich bin nur zu doof, ihn zu finden?

Eigentlich ziemlich schlau, das nicht anzubieten. Bei nicht-trivialen 
Dokumenten dürfte die berechnete Wortzahl fast immer falsch sein. Zum 
einen gibt es zu viele Vorstellungen, wie man was als Wort zählt. Zum
anderen kommen die technischen Probleme dazu.

Praxis-Vorschlag:

* Zumindest grob erfragen, was als Wort gilt und gezählt werden soll.
* Man probiert eine Reihe von Tools aus, wie gut sie den Text
   erkennen/ausgeben.
* Wenn Seiten mit Inhaltsverzeichnis und ähnlichem nicht gezählt werden
   sollen, sollte man beim Tool die zu untersuchenden Seiten angeben
   können.
* Mit etwas Glück hat man dann ein halbwegs brauchbares Ergebnis mit
   reproduzierbaren Kommandozeilen.
* Im besten Fall einigen sich dann beide Seiten auf eine der Methoden,
   bzw. kombiniert mittels Mittelwert ...
* Anderenfalls kann man mit heuristischen Filtern versuchen, die
   ausgegebene Text-Datei so zu bearbeiten, dass Unerwünschtes entfernt
   und Erwünschtes richtig zum Wortzählen aufbereitet wird.
     Oder man programmiert gleich bei der Extraktion. Zum Beispiel kann
   man mit Apache-PDFBox sich Text und Position ausgeben lassen, so
   kann man etwa leichter positionsabhängige Header und Footer entfernen,
   getrennte Wörter versuchen wieder zusammenzuführen usw.

   Man muss aber aufpassen, dass das nicht mehr Zeit kostet, als die
   Erstellung des 700-Seiten-Dokuments gedauert hat. Je genauer es
   werden soll, desto aufwändiger wird es.

Viele Grüße
   Heiko

-- 
FAQ: http://texfragen.de/
Durchsuchbares Archiv: https://www.listserv.dfn.de/sympa/arc/tex-d-l 
Unsubscribe/Verwaltung: https://www.listserv.dfn.de/sympa/info/tex-d-l
lmpx.com only provides a reader for public news (NNTP) servers. It is not affiliated with the servers or forums shown here and is not responsible for the content of articles, which is written by their respective authors.