„Bambaj”, „andrus”, „drynda”. Tak gadała dawna Warszawka. Wielki słownik trafił do sieci

Somua Six, MPK Warszawa

„Mabdziurny”, „labun”, „kidoń” czy „weredyk”. Słownik Warszawski ma 7700 stron! Pierwsze 86 tys. haseł można już znaleźć w internecie.


Konus, czyli mężczyzna nikczemnego wzrostu był nazywany mabdziurnym, złodziej to labun. Z kolei kidoń to taki niedbalec, ktoś kto łazi w ubraniu z plamami z jedzenia. Takie wyrazy można znaleźć w niezwykłym dziele polskich językoznawców sprzed ponad stu lat.

„Słownik Warszawski”, czyli „Słownik języka polskiego” opracowany pod redakcją Jana Karłowicza, Adama Kryńskiego i Władysława Niedźwiedzkiego, jest największym pod względem objętości słownikiem polszczyzny. Ma prawie 7700 stron i około 265 tys. haseł.

Przez lata korzystanie z tej ogromnej skarbnicy języka wymagało przekopywania się przez kolejne tomy i skany. Teraz zaczyna się to zmieniać. Dr Mirosław Koziarski opowiada Serwisowi Nauka w Polsce jak digitalizuje słownik i zamienia go w nowoczesną bazę danych. W internecie można już przeszukiwać około 86 tys. opracowanych przez niego haseł.


Romuald Broniarek, Obchody święta 1 Maja, kolarze w pochodzie pierwszomajowym. Ośrodek KARTA
Kultura i Sztuka

Wystawa „Bez trzymanki” w Muzeum Woli. Zobacz, jak rower zmienia Warszawę

Słownik ma prawie 100 lat. Zapisano w nim język, którego już nie znamy

„Słownik Warszawski” ukazywał się w latach 1900–1927. Dzieło ma osiem tomów. Początkowo szacowano na oko, że znajduje się w nim około 280 tys. haseł. Dokładniejsze obliczenia wykonane podczas cyfryzacji pokazały jednak, że jest ich około 265 tysięcy.

To jednak nadal gigantyczny zbiór. Znajdziemy w nim nie tylko słowa używane w języku potocznym, lecz także wyrazy gwarowe, dawne zapożyczenia, słownictwo specjalistyczne oraz efemerydy, które pojawiały się w polszczyźnie tylko przez krótki czas.

– To stuletnie już prawie dzieło notuje bardzo wiele form nie tylko z języka ogólnego, ale też gwarowych, zapożyczeń czy okazjonalizmów. Słownik zawiera liczne błędy i niekonsekwencje, ale dla leksykografów to nieocenione źródło wiedzy – tłumaczył w rozmowie z PAP dr Mirosław Koziarski, który zajmuje się digitalizacją dzieła.

Właśnie dlatego można tam znaleźć słowa brzmiące dziś niemal jak wymyślone. „Inamorować się” znaczyło rozkochać się lub zadurzyć, a słowo „imprezista” miało zupełnie inne znaczenie niż obecnie. Nie chodziło o człowieka uwielbiającego zabawy, lecz o projektodawcę lub osobę podejmującą jakieś przedsięwzięcie.


Gramofon Bambino. fot MHP/Małgorzata Kowalczyk
Kultura i Sztuka

„Za czym kolejka ta stoi? PRL w muzycznym zwierciadle”

86 tys. haseł można już przeszukiwać przez internet

Cyfrowa wersja słownika nie jest zwykłym zbiorem zeskanowanych stron. Mirosław Koziarski rozpoczął pracę nad nim podczas doktoratu na Uniwersytecie im. Adama Mickiewicza w Poznaniu, a później kontynuował projekt już samodzielnie.

We wrześniu 2026 roku udostępnił efekty swojej pracy w internecie. Gotowa jest mniej więcej jedna czwarta całego słownika, czyli około 86 tys. haseł.

– Udostępniona przeze mnie platforma pozwala na wygodne przeszukiwanie dotychczas opracowanych haseł, analizę statystyczną i porównywanie haseł ze współczesnymi słownikami. Planuję sukcesywnie opracowywać kolejne tomy i rozwijać to narzędzie z myślą o badaczach oraz wszystkich pasjonatach języka – powiedział dr Koziarski.

Projekt rozwija po godzinach. Na co dzień badacz pracuje w prywatnej firmie i zdecydował, że nie będzie starał się o grant na dalszą digitalizację.

Jak wyjaśnił, wcześniejsze doświadczenia z projektami naukowymi skutecznie zniechęciły go do związanej z nimi biurokracji. Koszt prac oraz utrzymania serwerów pokrywa więc sam, a osoby korzystające ze słownika mogą dobrowolnie wesprzeć projekt.


dwa autobusy obok siebie jeden z początków XX wieku, drugi współczesny
News / Podróże / Społeczeństwo

To już 105 lat autobusów w Warszawie – pierwsze linie ruszyły 17 lipca 1920 roku

Sztuczna inteligencja przyspieszyła pracę nad słownikiem

Jeszcze kilka lat temu ogromnym problemem było automatyczne rozpoznawanie tekstu. Tradycyjny OCR, czyli technologia zamieniająca obraz tekstu na zapis komputerowy, słabo radził sobie z dawnym drukiem i nietypową strukturą słownika.

Dr Koziarski wspomina, że początkowo na jednej stronie pojawiało się nawet 100–150 błędów.

Sytuację zmieniły nowe narzędzia wykorzystujące sztuczną inteligencję. Liczbę pomyłek udało się zmniejszyć do kilku na stronę. Różnica w tempie pracy jest ogromna. Podczas doktoratu badacz cyfrowo opracował około 80 stron. Teraz w niespełna trzy miesiące udało się przetworzyć około 2000 stron i stworzyć całą platformę internetową.

AI robi jednak błędy. W słowniku znajdują się tysiące dawnych wyrazów, nazw i nietypowych form, z którymi współczesne modele mają spory problem.

Dlatego przy każdym cyfrowym haśle znajduje się również skan oryginalnej strony. Użytkownik może sam sprawdzić, czy komputer prawidłowo odczytał zapis, a zauważony błąd można zgłosić.

Skan notatek prof. Wacława Borowego. Źródło: Biblioteka Uniwersytecka w Warszawie. Gabinet Rękopisów
Społeczeństwo

AI poległo w bibliotece. Uniwersytet Warszawski szuka ludzi do odczytywania rękopisów


Słownik pokazuje Polskę, która właśnie odzyskała niepodległość

„Słownik Warszawski” jest szczególnie ciekawy również ze względu na czas, w którym powstawał. Prace nad nim rozpoczęły się jeszcze w okresie zaborów, natomiast ostatnie tomy wydano już w II Rzeczypospolitej.

Po odzyskaniu niepodległości trzeba było połączyć nie tylko państwo, administrację czy kolej, ale również język używany przez ludzi wychowanych przez dziesięciolecia w trzech różnych zaborach.

– Okres międzywojenny to czas scalania ziem z trzech zaborów. Wiele słowników z tamtego okresu, zwłaszcza specjalistycznych, powstawało po to, by wypierać spolszczone wyrazy niemieckie, rosyjskie czy francuskie rodzimymi odpowiednikami. Bardzo dużo słownictwa wymyślano z miesiąca na miesiąc na potrzeby budowy państwowości – wyjaśnia dr Mirosław Koziarski.

W „Słowniku Warszawskim” znalazły się również słowa regionalne, propozycje nowych określeń, terminy fachowe i formy, które szybko wyszły z użycia.

To raczej ogromna fotografia polszczyzny z przełomu XIX i XX wieku, z całym jej bałaganem, regionalnymi różnicami i próbami stworzenia wspólnego języka nowoczesnego państwa.


Jak działają kieszonkowcy. Zdjęcie Tomasz Oleszczuk/Policja
Społeczeństwo

Bolesław Prus obrobiony przez doliniarzy. Jak współczesna policja z nimi walczy

Zaginione 60 tys. haseł

Co ciekawe, po wydaniu słownika wydawania rozpoczęto przygotowywanie suplementu.

Miało się w nim znaleźć około 60 tys. dodatkowych haseł, których zabrakło w podstawowej wersji.

Suplement nigdy jednak nie został wydany. Istniał tylko jeden egzemplarz przygotowanych materiałów, który niestety zaginął podczas II wojny światowej.

Pozostało osiem tomów pierwotnego słownika. Teraz ich zawartość po raz pierwszy można naprawdę rozłożyć na części i badać komputerowo.

– Tradycyjne słowniki są nietypowym gatunkiem literackim. Ich się nie czyta od deski do deski, one w sobie mają wbudowany system wyszukiwania informacji, czyli są takim bardzo starodawnym sposobem budowania bazy danych – zauważa dr Koziarski.

Cyfryzacja usuwa ograniczenia formy kodeksu – czyli książki ze stronami o okładką. Zamiast przewracać tysiące stron, można wyszukać konkretne słowo, sprawdzić jego pochodzenie, porównać je z innymi hasłami albo przeanalizować całe grupy wyrazów.

A przy okazji przekonać się, jak niewielką część własnego języka znamy.

– Język jest w głowach ludzi, ale nie ma całego języka w żadnej jednej głowie. Nikt nie zna całego języka, chyba że byłby ostatnią osobą, która tym językiem mówi – podsumowuje dr Mirosław Koziarski.

Natalia Zagrzebska avatar
Natalia Zagrzebska

Zostaw odpowiedź

Twój adres e-mail nie zostanie opublikowany. Wymagane pola są oznaczone *