Re: Слоўнік для праверк і правапісу
Ihar Hrachyshka <[email protected]> Fri, 22 Oct 2010 13:09:44 +0300
| Newsgroups | gmane.comp.internationalization.belarusian |
|---|---|
| Message-ID | <[email protected]> |
2010/10/22 Alex Buloichik <[email protected]>: > Вітаю ! > >> P.S. Здаецца, стварэньне модуляў праверкі правапісу для беларускай >> мовы становіцца папулярным заняткам. > > Так, гэта яшчэ адзін аргумэнт на карысьць агульнай пляцоўцы, бо я ведаю > яшчэ адзін праект, які можа ў выніку даць слоўнік ;) > Трохі тэорыі для тых, хто ня ведае: hunspell/aspell/ispell/myspell > працуюць аднолькава: спраўджваюць кожнае слова па слоўніку, і калі слова > невядомае - кажуць што памылка. За межы слова яны не выходзяць(таму ў сказе > "цёплы лета" - ніякай памылкі не знойдзецца). Здаецца, aspell/ispell - > найбольш простыя рухавікі, у myspell дадалася падтрымка > афіксаў(prefix+suffix), у hunspell дадаліся правілы падстаноўкі і яшчэ > нешта, больш прыдатнае да вугорскай мовы. > Такім чынам ёсьць 3 часткі задачы - 1) стварыць сьпіс словаў, 2) > разгарнуць словаформы, 3) спраўдзіць слова з тэксту па словаформах. > Мікалай паспрабаваў разгарнуць словаформы з дапамогай hunspell. Так, > hunspell для гэтага зроблены, але ягонае разгортваньне словаформаў больш > прыдатнае для ангельскай мовы. Напрыклад, беглыя зычныя тут не кладуцца. > IMHO, разгортваньне словаформаў - найбольш складаная рэч у такім слоўніку. > Ёсьць цікавы праект, які робяць Кошчанка з кампаніяй. Яны ствараюць > граматычную базу беларускай мовы. Так, гэта вялікі праект, яшчэ не > дароблены, але, у гэтай базе будуць пазначаныя усе граматычныя уласьцівасьці > і асаблівасьці кожнага слова, націск, будуць разгортвацца словаформы і яшчэ > шмат цікавага. Такім чынам, калі з гэтай базы ўзяць сьпіс усіх словаформаў, > гэта і будзе гатовы слоўнік для {i,a,my,hun}spell. > Зразумела, база гэтая не у выглядзе афіксаў hunspell, а больш падрабязная, > і праект значна большы за слоўнік для hunspell. Таму калі мы кажам пра > адзіны слоўнік, можа трэба падумаць як дапамагчы зрабіць тую агульную базу, > зь якой ужо проста скрыптом атрымаем слоўнік для hunspell. > А самае цікавае - калі ў базе пазначыныя націскі, мы можам зрабіць > дадатковыя праверкі, як не/ня, без/бяз для клясічнага правапісу. А яшчэ з > дапамогай такой базы мы можам выйсьці за межы слова - ёсьць такая цікавая > рэч як "трыграмы". Такім чынам будзе магчыма знайсьці памылкі ў сказе "цёплы > лета". > WBR, Alex. > Прапанаваная схема прывабная. Ёсць, праўда, колькі мінусаў-заўваг: 1) стварэнне такой базы вымагае многа больш сілаў; 2) у выніку мы атрымоўваем той жа [hun|i|a|my]spell (сваю сістэму з усімі яе магчымасцямі прычапіць да OOo і/ці ўсяго асяроддзя будзе няпроста, хаця і магчыма - ёсць бібліятэкі абстракцыі модуляў праверкі правапісу і граматыкі, як enchant). _______________________________________________ I18n mailing list [email protected] http://mova.org/cgi-bin/mailman/listinfo/i18n