Re: wordcount
"Heiko Oberdiek" (via tex-d-l Mailing List) <[email protected]>
| Newsgroups | gmane.comp.tex.german |
|---|---|
| Message-ID | <[email protected]> |
Hallo,
On 2022-11-28 07:31, Doris Behrendt (via tex-d-l Mailing List) wrote:
>
> ich stehe vor der Aufgabe, die Wörter eines 700-Seiten PDF zu zählen, welches sehr viel Mathe, Codebeispiele, Bilder etc. enthält.
Frage: Was ist denn ein Wort?
* https://de.wikipedia.org/wiki/Wort:
| Eine allgemein akzeptierte Definition existiert nicht und gilt
| auch als „schwierig“, da der Begriff „Wort“ lexikalisch mehrdeutig
| bzw. (konkreter) vage ist und sowohl vom
| Untersuchungsgesichtspunkt und von der jeweils interessierenden
| sprachlichen Ebene abhängt als auch von den diesbezüglichen
| Theorien.
* https://de.wikipedia.org/wiki/Wort_(theoretische_Informatik)
Hier kann ein Wort präzise definiert werden. Allerdings muss dann
natürlich auch die mathematische Definition des Wortes/Sprache
angegeben werden.
Frage: Was soll gezählt werden?
* Alle Wörter
* Kein Inhaltsverzeichnis, Footer, Header, ...
* Mathe?
* Nummern/Zahlen einerseits im Fließtext, andererseits
Gliederungsnummern, Seitennummern, ...
* Wörter in Bildern?
* ...
Technische Schwierigkeiten:
* Eine PDF-Datei kann lediglich eingescannte Seiten (Bilder)
enthalten, so dass man dann nur noch mit OCR-Programmen weiterkommt.
* Worttrennungen.
* Font-Encodings. Eine PDF-Datei muss im Allgemeinen kein Mapping
nach Unicode oder einem anderen bekannten Encoding enthalten.
Dann hilft nur noch OCR weiter.
* Mehrdeutigkeiten: Ein o mit Schrägstrich kann ein Durchmessersymbol
bedeuten, was vielleicht nicht als Wort gezählt wird. Oder aber es
ist etwa Teil eines skandinavischen Wortes.
* ...
> Wie würdet ihr das machen? Ich habe ps2ascii datei.pdf | wc -w genommen, aber befürchte, dass der Count sehr ungenau ist.
Die Umwandlung von PDF zu Text hängt sehr von der PDF-Datei ab. Nach
meiner Erfahrung gibt es kein Tool, das mit allen PDF-Dateien die besten
Ergebnisse liefert. Je nach PDF-Datei ist mal das eine oder andere Tool
besser geeignet, so dass man verschiedene ausprobieren sollte.
Weitere Alternativen:
* pdftotext (https://en.wikipedia.org/wiki/Pdftotext)
* ExtractText (https://pdfbox.apache.org/2.0/commandline.html#extracttext)
> Mich wundert nur, dass man das mit Acrobat Pro nicht machen kann, den habe ich auch, aber der hat keinen wordcount ... oder doch und ich bin nur zu doof, ihn zu finden?
Eigentlich ziemlich schlau, das nicht anzubieten. Bei nicht-trivialen
Dokumenten dürfte die berechnete Wortzahl fast immer falsch sein. Zum
einen gibt es zu viele Vorstellungen, wie man was als Wort zählt. Zum
anderen kommen die technischen Probleme dazu.
Praxis-Vorschlag:
* Zumindest grob erfragen, was als Wort gilt und gezählt werden soll.
* Man probiert eine Reihe von Tools aus, wie gut sie den Text
erkennen/ausgeben.
* Wenn Seiten mit Inhaltsverzeichnis und ähnlichem nicht gezählt werden
sollen, sollte man beim Tool die zu untersuchenden Seiten angeben
können.
* Mit etwas Glück hat man dann ein halbwegs brauchbares Ergebnis mit
reproduzierbaren Kommandozeilen.
* Im besten Fall einigen sich dann beide Seiten auf eine der Methoden,
bzw. kombiniert mittels Mittelwert ...
* Anderenfalls kann man mit heuristischen Filtern versuchen, die
ausgegebene Text-Datei so zu bearbeiten, dass Unerwünschtes entfernt
und Erwünschtes richtig zum Wortzählen aufbereitet wird.
Oder man programmiert gleich bei der Extraktion. Zum Beispiel kann
man mit Apache-PDFBox sich Text und Position ausgeben lassen, so
kann man etwa leichter positionsabhängige Header und Footer entfernen,
getrennte Wörter versuchen wieder zusammenzuführen usw.
Man muss aber aufpassen, dass das nicht mehr Zeit kostet, als die
Erstellung des 700-Seiten-Dokuments gedauert hat. Je genauer es
werden soll, desto aufwändiger wird es.
Viele Grüße
Heiko
--
FAQ: http://texfragen.de/
Durchsuchbares Archiv: https://www.listserv.dfn.de/sympa/arc/tex-d-l
Unsubscribe/Verwaltung: https://www.listserv.dfn.de/sympa/info/tex-d-l