Re: [SAde] RE-Nachhilfe, HTML-Tags
Ingo Wiarda <[email protected]> Tue, 14 Oct 2003 21:55:57 +0200
| Newsgroups | gmane.mail.spam.spamassassin.devel.de |
|---|---|
| Message-ID | <[email protected]> |
Am Dienstag 14 Oktober 2003 17:25 schrieb [email protected]: > Hi, > > ich versuche gerade, eine Regel für illegale HTML-Tags zu machen, der Form > > </?(irgendwelche Zeichen)?(nicht reguläres Zeichen)(irgendwelche > Zeichen)?> > > um etwa <r%t> oder <kyuz> abfangen zu können. Illegale HTML-Tags in der > Form enthalten also ein oder mehrere illegale Zeichen. Reguläre Tag-Namen > enthalten ausschließlich Zeichen mit der Character-Klasse > > [abcdefhiklmnopqrstuvwx] > Und was ist mit: <acronym> <h1> <img> <style> ? Wobei ich auch schon nach einer Regel für Sachen wie: "Med</aristotelian>ica<exchangeable>tio</adorn>ns li<bowen>ke=" gesucht habe. Im Moment experimentiere ich mit rawbody iw_HTML_GIBBERISH /^.+<[^\s"'=>@]{9}[^>]*>/ score iw_HTML_GIBBERISH 1 describe iw_HTML_GIBBERISH found strange HTML-tags. # note: the ^.+ is used to prevent matching geekish tags like ^<angry_rant> Vielleicht läßt sich dieser Test auf HTML-Mails begrenzen, mal sehen. Ingo -- http://dewarim.de ------------------------------------------------------- This SF.net email is sponsored by: SF.net Giveback Program. SourceForge.net hosts over 70,000 Open Source Projects. See the people who have HELPED US provide better services: Click here: http://sourceforge.net/supporters.php