indizieren von texten mit umlauten via TextIndexNG3?
Stefan Palme <[email protected]>
| Newsgroups | gmane.comp.web.zope.german |
|---|---|
| Organization | Invisible Brain |
| Message-ID | <[email protected]> |
Hallo Liste,
am Start: Plone-2.5.3 + TextIndexNG-3.1.16
Habe einen eigenen AT-basierten Content-Type, der u.a. ein solches
Feld enthält:
TextField('txt',searchable=True),
Nach dem Indizieren eines Objektes dieses Types steht im Index
"SearchableText" folgendes drin:
{'SearchableText': [u'schweizer', u'spitalverband', u'p', u'unser',
u'unternehmen', u'ist', u'seit', u'l\xe3', u'ngerer', u'zeit',
u'rohstofflieferant', u'f\xe3\u0153r', u'die', u'meisten', u'universit
\xe3', u'ts', u'und', u'kantonsspital-apotheken', u'wir', u'bieten',
u'als', u'lieferpartner', ...
Der dazugehörige Originaltext:
Unser Unternehmen ist seit längerer Zeit Rohstofflieferant für die
meisten Universitäts- und Kantonsspital-Apotheken. Wir bieten als
Lieferpartner ...
Der Index SearchableText ist vom Typ TextIndexNG3 mit folgenden
Eigenschaften:
Languages en
Fields SearchableText
Default encoding utf-8
Splitter separators _-
Splitter txng.splitters.default
Stemming False
Parser txng.parsers.en
Casefolding True
Storage txng.storages.term_frequencies
Dedicated storages False
Ranking True
Normalizer False
Stopwords False
Index unknown languages True.
Was mich wunder/stört: Umlaute werden zum Teil als Wortgrenzen
interpretiert (längerer -> u'l\xe3', u'ngerer') bzw. sehr seltsam
indiziert (über -> u'f\xe3\u0153r'), so dass eine Suche nach
Worten mit Umlauten keine (brauchbaren) Ergebnisse liefert.
Habe ich hier etwas falsch gemacht? Kann ich an irgendeinem Rädchen
drehen, damit TextIndexNG3 arbeitet wie ich das erwarte?
Danke und Grüße
-stefan-
_______________________________________________
zope mailing list
[email protected]
https://mail.dzug.org/mailman/listinfo/zope