Mirosław Koziarski - Cyfrowa edycja Słownika warszawskiego
Instytut Podstaw Informatyki PAN
0:00 / 0:00
Mirosław Koziarski - Cyfrowa edycja Słownika warszawskiego
80 просмотров · 8 дней назад
Instytut Podstaw Informatyki PAN
453 подписчика
80 просмотров · 8 дней назад
Słownik języka polskiego pod redakcją Jana Karłowicza, Adama Kryńskiego i Władysława Niedźwiedzkiego, znany jako Słownik warszawski, należy do najważniejszych i najobszerniejszych dzieł polskiej leksykografii. Osiem tomów, opublikowanych w latach 1900-1927 i liczących łącznie niemal 7800 stron, dokumentuje polszczyznę wielu epok, regionów, rejestrów i dziedzin. Choć skany słownika są dostępne w bibliotekach cyfrowych, jego treść pozostawała dotąd w dużej mierze zamknięta w obrazie drukowanych stron.
Podczas wystąpienia przedstawiam projekt cyfrowej edycji Słownika warszawskiego, rozwijający metodologię i narzędzia opracowane w ramach mojej rozprawy doktorskiej. Omawiam kolejne etapy przetwarzania: wybór i analizę źródła, obróbkę i segmentację obrazów, OCR - obecnie wspomagany także narzędziami opartymi na sztucznej inteligencji - korektę i normalizację tekstu, hierarchiczne parsowanie artykułów hasłowych, walidację, indeksowanie oraz generowanie danych pochodnych. Centralnym elementem procesu jest parser przekształcający liniową transkrypcję w ustrukturyzowaną reprezentację XML. Rozpoznaje on kilkadziesiąt typów segmentów, m.in. wyrazy hasłowe, warianty, informacje gramatyczne, znaczenia i podznaczenia, definicje, kwalifikatory, przykłady użycia, etymologie, odsyłacze i związki frazeologiczne, a także relacje między nimi. Ze względu na złożoność i niekonsekwencje materiału proces ma charakter iteracyjny i łączy metody automatyczne z ręczną kontrolą.
Uruchomiona edycja internetowa stanowi rozwinięcie wcześniejszej makiety badawczej w stopniowo rozbudowywaną platformę. Użytkownik może zestawić sformatowany artykuł z transkrypcją źródłową, surowym XML-em i odpowiednim fragmentem faksymile. Ustrukturyzowanie treści umożliwia ponadto tworzenie nowych ścieżek dostępu do danych: korpusu przykładów, zestawień derywatów, skonsolidowanego indeksu skróceń, statystyk oraz matrycy porównującej siatkę hasłową z innymi słownikami polszczyzny.
Na zakończenie przedstawiam aktualny stan projektu, przyjęte mechanizmy kontroli jakości i ograniczenia automatycznego przetwarzania historycznego materiału leksykograficznego, a także planowane kierunki rozwoju.