Re: Слоўнік для праверк і правапісу

Ihar Hrachyshka <[email protected]> Fri, 22 Oct 2010 13:09:44 +0300
Newsgroups gmane.comp.internationalization.belarusian
Message-ID <[email protected]>
2010/10/22 Alex Buloichik <[email protected]>:
> Вітаю !
>
>> P.S. Здаецца, стварэньне модуляў праверкі правапісу для беларускай
>> мовы становіцца папулярным заняткам.
>
>   Так, гэта яшчэ адзін аргумэнт на карысьць агульнай пляцоўцы, бо я ведаю
> яшчэ адзін праект, які можа ў выніку даць слоўнік ;)
>   Трохі тэорыі для тых, хто ня ведае: hunspell/aspell/ispell/myspell
> працуюць аднолькава: спраўджваюць кожнае слова па слоўніку, і калі слова
> невядомае - кажуць што памылка. За межы слова яны не выходзяць(таму ў сказе
> "цёплы лета" - ніякай памылкі не знойдзецца). Здаецца, aspell/ispell -
> найбольш простыя рухавікі, у myspell дадалася падтрымка
> афіксаў(prefix+suffix), у hunspell дадаліся правілы падстаноўкі і яшчэ
> нешта, больш прыдатнае да вугорскай мовы.
>   Такім чынам ёсьць 3 часткі задачы - 1) стварыць сьпіс словаў, 2)
> разгарнуць словаформы, 3) спраўдзіць слова з тэксту па словаформах.
>   Мікалай паспрабаваў разгарнуць словаформы з дапамогай hunspell. Так,
> hunspell для гэтага зроблены, але ягонае разгортваньне словаформаў больш
> прыдатнае для ангельскай мовы. Напрыклад, беглыя зычныя тут не кладуцца.
>   IMHO, разгортваньне словаформаў - найбольш складаная рэч у такім слоўніку.
>   Ёсьць цікавы праект, які робяць Кошчанка з кампаніяй. Яны ствараюць
> граматычную базу беларускай мовы. Так, гэта вялікі праект, яшчэ не
> дароблены, але, у гэтай базе будуць пазначаныя усе граматычныя уласьцівасьці
> і асаблівасьці кожнага слова, націск, будуць разгортвацца словаформы і яшчэ
> шмат цікавага. Такім чынам, калі з гэтай базы ўзяць сьпіс усіх словаформаў,
> гэта і будзе гатовы слоўнік для {i,a,my,hun}spell.
>   Зразумела, база гэтая не у выглядзе афіксаў hunspell, а больш падрабязная,
> і праект значна большы за слоўнік для hunspell. Таму калі мы кажам пра
> адзіны слоўнік, можа трэба падумаць як дапамагчы зрабіць тую агульную базу,
> зь якой ужо проста скрыптом атрымаем слоўнік для hunspell.
>   А самае цікавае - калі ў базе пазначыныя націскі, мы можам зрабіць
> дадатковыя праверкі, як не/ня, без/бяз для клясічнага правапісу. А яшчэ з
> дапамогай такой базы мы можам выйсьці за межы слова - ёсьць такая цікавая
> рэч як "трыграмы". Такім чынам будзе магчыма знайсьці памылкі ў сказе "цёплы
> лета".
> WBR, Alex.
>

Прапанаваная схема прывабная. Ёсць, праўда, колькі мінусаў-заўваг:
1) стварэнне такой базы вымагае многа больш сілаў;
2) у выніку мы атрымоўваем той жа [hun|i|a|my]spell (сваю сістэму з
усімі яе магчымасцямі прычапіць да OOo і/ці ўсяго асяроддзя будзе
няпроста, хаця і магчыма - ёсць бібліятэкі абстракцыі модуляў праверкі
правапісу і граматыкі, як enchant).
_______________________________________________
I18n mailing list
[email protected]
http://mova.org/cgi-bin/mailman/listinfo/i18n