Re: Header Filter
"Ernesto Baschny" <[email protected]> Sun, 08 Aug 2004 23:26:40 +0200
| Newsgroups | gmane.mail.spam.spamassassin.devel.de |
|---|---|
| Message-ID | <4116B6B0.27170.A501B9D@localhost> |
On 6 Aug 2004 at 23:37, Rolf Schaufelberger wrote:
> ich habe eine Frage zum Filter in
> check_for_unique_id in EvalTest.pm :
> Dort findet sich ein Test in der Form :
>
> # 9095IPZK7-095wsvp8715rJgY8-286-28 and similar
> || /\b(\w{7,}-\w{7,}(-\w+)*)\s*$/
>
> Mein Problem damit ist ganz einfach, dass dieser Test jede =DCberschrift=
die
> zwei durch Bindestrich getrennte W=F6rter enth=E4lt, matcht.
Eigentlich nur durch Bindestrich getrennte W=F6rter, die mehr als 6
Zeichen enthalten. Das ist im deutschen bestimmt h=E4ufiger der Fall, auch
in anderen Sprachen, wo so "lange" W=F6rter (>6 Buchstaben) =F6fter
vorkommen.
> In meinem Fall bin ich als Sender einer sochen Mail betroffen, der Subje=
ct
> lautet hier "Ihre Letterjames-Bestellung" , hat mit eine Unique ID nun
> wirklich gar nichts zu tun, liefert mir aber 2.7 Punkte. (In der Summe =
lande
> ich bei 5.1, weil es eine HTML Mail ist die auch noch Bilder enth=E4lt).
> Ich halte diese hohe Gewichtung f=FCr eine so "groben" Test f=FCr nicht=
richtig,
> daher meine Frage:
> Ist dieser Test mit einer so hohen Gewichtung "korrekt" bzw. akzeptabel =
?
Die Gewichtungen werden nicht manuell von irgendjemanden ausgesucht,
sondern werden automatisch aus einer Riesen-masse an Spam/Ham Samples
mit einem genetischen Algorithmus "optimiert". Das Problem ist halt, das
die meisten Sample-Mails aus dem englischsprachingen Raum kommen, und
daher kam es bei SA 2.64 zu folgenden Statistiken f=FCr diese Regel:
OVERALL% SPAM% HAM% S/O RANK SCORE NAME
543473 354299 189174 0.652 0.00 0.00 (all messages)
...
3.115 4.7282 0.0930 0.981 0.90 1.39 SUBJ_HAS_UNIQ_ID
Also von den 354.299 Spammails, kam ein solcher ID-Subject halt in etwa
5% vor (also in knapp 17.000 Spams!). Und lediglich in 175 HAM-Emails von
den insgesamt 189.174.
Ein weiteres Problem ist meiner Meinung auch, dass hier viele Checks auf
einmal gemacht werden, und dann nur mit einem Score versehen werden. Ein
Vorschlag, den man dem SA-Team als "Bug" melden k=F6nnte, w=E4re eine
Trennung genau dieser {>6}-{>6} Regel, gerade weil das sehr oft in
anderen Sprachen vorkommen kann. Wenn das separat gescored wird, sehen
die Ergebnisse eventuell anders aus.
Was man auch machen kann/soll ist eventuell selbst zu den "Masses"
beizutragen mit eigenen Spam/Ham-Kollektionen, die dann auch Deutsche
Texte enthalten. Somit kann man die Scores auch f=FCr den deutschsprachige=
n
Raum optimierter bekommen. Dazu mehr im SA-Unterverzeichnis "masses".
Die Statistiken oben findest du =FCbrigens im "rules/" Verzeichnis jeder
SA-distribution.
Als Abhilfe k=F6nnte man ja auch im deutschen DE-wiki Regelwerk ja auch
eine "Gegenregel" einf=FCgen, die den Effekt genau dieser {>6}-{>6}
Komponente entgegenwirkt, aber den restlichen ID-Check so l=E4sst, wie
er ist:
header DE_NOT_SUBJECT_ID Subject =3D~ /\b(\w{7,}-\w{7,}(-\w+)*)\s*$/
lang de describe DE_NOT_SUBJECT_ID Doch kein Subject-ID
core DE_NOT_SUBJECT_ID -1.390 -0.212 -0.882 -2.677
(PS: Not tested!!)
Gruss,
Ernesto
--
Ernesto Baschny <[email protected]>
http://www.baschny.de - PGP: http://www.baschny.de/pgp.txt
Sao Paulo/Brasil - Stuttgart/Germany
Ernst@IRCnet - ICQ# 2955403
---------------------------------------------------------------------
Abmelden, E-Mail an: spamassassin-dev-de-unsubscribe-d1GL8uUpDdXTxqt0kkDzDmD2FQJk+8+b@public.gmane.org
Weitere Befehle, E-Mail an: spamassassin-dev-de-help-d1GL8uUpDdXTxqt0kkDzDmD2FQJk+8+b@public.gmane.org