Projekt Lexikálně-sémantické databáze češtiny (LSD-Czech): uživatelský pojmový slovník a online databáze
Abstract
86
Full text
Projekt Lexikálně-sémantické databáze češtiny (LSD-Czech): uživatelský pojmový slovník aonline databáze Zora Obstová — Ondřej Tichý — Aleš Klégr ABSTRACT: The LSD Project: ACzech Online Onomasiological Dictionary and Database The paper introduces the upcoming outputs of the Lexico-Semantic Database Project (LSD-Czech) supported by The Technology Agency of the Czech Republic (TA CR) [TL02000041]: aCzech online conceptual dictionary and alexico-semantic database. It reviews the phases of the implementation of the project and its results to be made available by the end of 2022. It describes both the dictionary and the database (from which the dictionary is generated). While the dictionary is intended for the general user, the database will serve linguists and experts in natural language processing and language data application. The paper briefly discusses the field of onomasiological lexicography, focusing on what is an onomasiological dictionary, what dictionaries of this type exist for Czech, and introduces the two dictionaries on which the database is founded, Haller’s Český slovník věcný asynonymický (1969–86) and Klégr’s Tezaurus jazyka českého (2007). The focus of the paper is on the description of the functions and features of the dictionary, the steps whereby to search in it and the envisaged future improvements. Finally, it gives the specifications of the database and the next steps planned in its development. KLÍČOVÁ SLOVA / KEY WORDS: onomaziologická lexikografie, tezaurus, lexikálně-sémantická databáze, digitalizace, čeština onomasiological lexicography, thesaurus, lexico-semantic database, digitization, Czech 1 ÚVODEM Cílem článku je seznámit čtenáře shlavními připravovanými výstupy projektu Lexikálně-sémantické databáze češtiny (LSD-Czech), podpořeného Technologickou agenturou České republiky [TL02000041]. Představíme zde tedy jednak digitální pojmový slovník určený běžnému uživateli, jednak digitální lexikálně-sémantickou databázi (zníž je slovník generován), která bude sloužit lingvistům aodborníkům voblasti zpracovávání přirozeného jazyka aaplikace jazykových dat. Než však přejdeme kpopisu obou výstupů, považujeme za důležité uvést zejména čtenáře zřad budoucích „laických“ uživatelů databáze do— obvykle poněkud opomíjené— problematiky onomaziologické lexikografie. Voddílu 2 se tedy nejprve zaměříme na to, co je to pojmový slovník, jaké slovníky tohoto typu pro češtinu existují, ze kterých slovníků aplikace Lexikálně-sémantické databáze vznikla aco vní uživatel najde. Voddílu 3 popíšeme průběh realizace projektu, jehož výsledkem oba výstupy jsou, avčástech následujících potom nastíníme konkrétní podobu digitálního slovníku apostup OPEN ACCESS
ZOrA OBSTOVá — ONDřEJ TIcHÝ — ALEŠ KLÉGr 87 vyhledávání vněm. Zmíníme také parametry lexikálně-sémantické databáze idalší kroky, které jsou vsouvislosti soběma výstupy plánovány. 2 POJMOVÉ SLOVNÍKY AČEŠTINA 2.1 ONOMAZIOLOGIcKÉ SLOVNíKY AJEJIcH TYPY Pojmový slovník (někdy označovaný také jako tematický, věcný či ideologický) spadá pod tzv.onomaziologické slovníky. Ztypologického hlediska jde oslovníky, které třídí lexikální jednotky (slova, fráze, idiomy) nikoli podle jejich formy (jak to činí slovníky abecední), nýbrž podle jejich významu, pojmového obsahu. Zatímco abecedně uspořádané výkladové slovníky (patřící mezi slovníky sémaziologické) mají za cíl přiřadit slovům (formám) odpovídající význam, smyslem onomaziologických slovníků je ukázat, jakými slovy lze ten který význam, pojem vyjádřit, pojmenovat. Onomaziologická lexikografie (srov.Svensén, 1993; Hartmann &James, 1998; van Sterkenburg, 2003) rozlišuje několik druhů těchto slovníků. Unás neznámější jsou slovníky synonym, které předkládají synonymní řady či hnízda řazená podle nejobecnějšího nebo nejčastějšího výrazu vdaném hnízdě (pro snadné vyhledávání tvoří tyto reprezentativní výrazy záhlaví slovníku ajsou řazeny abecedně). Historicky existovaly slovníky synonym výkladové (vysvětlující rozdíly mezi synonymy), dnes převládají slovníky čistě výčtové. Variantou toho slovníku je slovník antonym, který často bývá součástí synonymních slovníků (antonymie je vlastně druh podobnosti, při níž má pouze klíčový sémantický rys opačnou hodnotu). Dalším typem onomaziologického slovníku jsou slovníky obrazové. Pojmy (většinou označující konkréta) jsou prezentovány formou obrázků (popř. fotografií), typicky uspořádaných do širších okruhů, tematických panelů (např.kuchyň, její součásti akuchyňské náčiní, nemocnice, přístav, automobil, lidské tělo apod.). Mezi nejznámější moderní obrazové slovníky (vmnoha vydáních) patří Bildwörterbuch německého nakladatelství Duden. Odlišným typem je tzv.opačný slovník (angl. reverse or word-finding dictionary). Nejde však oslovník se slovy řazenými podle abecedy od posledního písmena, rovněž označovaný jako reverzní (či slovník atergo), ani ostarší typ slovníků kolokací uváděných pod názvem word finders. Opačný slovník, jehož nejznámějším představitelem je Reader’s Digest Reverse Dictionary (Kahn, 1989), je vlastně výkladový slovník naruby. Heslo začíná definicí (popř. definicí synonymem) akončí záhlavím (např.„about to happen imminent, impending“; „go along with someone’s wishes or ideas humour, indulge“). Navíc slovník obsahuje prvky obrazového slovníku (např.obrázek spopisem full-rigged sailing ship) apojmového slovníku (výčty příbuzných slov, např.fencing terms, scientific instruments). Konečně vlastní pojmový slovník vužším smyslu je slovník, který předkládá systém pojmů ake každému pojmu je připojen výčet slov, jimiž je vdaném jazyce označován, ať už formou substantiva, adjektiva, nebo slovesa. Pojmová hesla obsahují vlastně lexikální pole různého typu— hierarchická (zahrnující (ko)hyponyma, např.les, bor, dubina, bučina, ameronyma, např.strom, větev, kořen), lineární (bipolární, např.samec–samice, škály, např.začátek, střed, konec, nebo cykly, např.barvy, OPEN ACCESS
88 STUDIE ZAPLIKOVANÉ LINGVISTIKY 2/2022 roční období) anestrukturované klastry (synonyma, případně iantonyma). Nejbohatší tradici mají pojmové slovníky anglické aněmecké. 2.2 ČESKÉ ONOMAZIOLOGIcKÉ SLOVNíKY Pro češtinu vznikly všechny uvedené druhy onomaziologických slovníků svýjimkou slovníku reverzního (opačného). Patrně nejstarším specializovaným slovníkem synonym včeštině je Stručný slovník českých synonym J.Mašína aJ.V.Bečky (1947), který následně Bečka vydal vrozšířené podobě jako Slovník synonym afrazeologismů (1977/1982). Později se kněmu přidal Slovník českých synonym K.Paly aJ.Všianského (1994/2008). Zatím posledním tištěným slovníkem tohoto typu je Slovník českých synonym aantonym (Lingea, 2007/2012). Nakladatelství Lingea zpřístupnilo ijeho online verzi (2.0) vrámci aplikace nechybujte.cz (obsahující ivýkladový slovník, pravidla pravopisu agramatiku). Existují idalší méně propracované online aplikace (ABZ slovník českých synonym). Za předchůdce obrazových slovníků lze považovat Komenského učebnici Orbis pictus (1658/1896). Vcizojazyčné výuce se unás tyto slovníky uplatňují idnes. Po válce vyšel drobný, Dudenem inspirovaný Gallerův aMrázkův English in Pictures— Anglický obrazový slovník (1947). Další se objevují od 90.let, např.Obrázkový anglicko-český slovník (Davies &Bezděková, 1993), Velký obrazový tematický slovník česko-slovensko- -anglicko-německý (Archambaultová &Corbeil, 1999) azněj odvozené menší slovníky. Vedle nich byla publikována celá řada takovýchto slovníků určených pro děti scílem rozšiřovat jejich slovní zásobu (např.Velký dětský obrázkový slovník, Brauerová, 2018). Pojmové slovníky vyšly včeštině dva, což je u„malého“ jazyka, jakým je čeština, poměrně výjimečný jev astaví nás to na roveň nevelkému počtu jazyků, které mají své vlastní tezaury. Prvním znich je Hallerův Český slovník věcný asynonymický (1969–86), který vychází zněmeckého vzoru, adruhým je Tezaurus jazyka českého (Klégr, 2007), založený na Rogetově anglickém Thesauru (1852). Ani jeden znich není vsoučasnosti běžně ke koupi, dostupné jsou pouze vknihovnách adotisky nelze očekávat. Jejich digitalizace vrámci zde představovaného projektu je tedy vedena mimo jiné isnahou prodloužit jejich život do 21.století asjejich pomocí uchovat adále rozvíjet bohatství českého lexika. 2.3 ČESKÝ SLOVNÍK VĚCNÝ ASYNONYMICKÝ (ČSVS) Práce na Českém slovníku věcném asynonymickém (Haller, 1969–1986) byly započaty zpodnětu překladatelské sekce Svazu československých spisovatelů abyly svěřeny Jiřímu Hallerovi. Předsedou redakční rady byl Vladimír Šmilauer. Slovník, pojatý především jako „jazyková pomůcka pro překladatele, spisovatele anovináře“, ale také pro školu aširší veřejnost, si kladl za cíl „poskytnout ve věcném uspořádání co největší výběr synonymických výrazů jako možný repertoár vyjadřování ijako východisko kobjevování nových vyjadřovacích možností českého jazyka“ (Haller, 1969–1977, I. díl, Úvodní poznámky, s. V). Kromě toho však sledoval icíl jazykovědný, totiž shromáždit avěcně utřídit českou slovní zásobu. Jako základní osnova díla posloužil Halligův avon Wartburgův Begriffssystem als Grundlage für die Lexikographie (2.vydání zroku 1963), teoreticky důkladně propracované OPEN ACCESS
ZOrA OBSTOVá — ONDřEJ TIcHÝ — ALEŠ KLÉGr 89 klasifikační schéma, vněmž nejsou uspořádána slova, nýbrž na jazykovém materiálu nezávislé pojmy, akteré tedy může být dle názoru jeho autorů aplikováno na kterýkoli konkrétní jazyk (tamtéž, s. XXII).1 Třebaže někteří badatelé považují takový záměr za utopický (srov.např.Wiegand, 2004, s.68) aobjevují se itvrzení, že Begriffssystem nebyl nikdy prakticky realizován (Fischer, 2004, s.46), je třeba připomenout, že na jeho základě vznikla řada specializovaných slovníků, zejména zrománské oblasti.2 Jediným pokusem uspořádat podle tohoto schématu veškerou slovní zásobu nějakého konkrétního jazyka však byl, alespoň pokud je nám známo, právě Český slovník věcný asynonymický. Obrovský rozsah připravovaného slovníku, jeho složitá hierarchická struktura (až 5 úrovní) aencyklopedický charakter však způsobily, že po předčasné smrti Jiřího Hallera zůstalo dílo nedokončeno. Tři svazky, publikované vletech 1969, 1974 a1977, obsahují tyto oddíly nejvyšší úrovně hierarchie: A.Vesmír, svět kolem nás; B.I.Člověk, bytost tělesná aB.II. Duševní stránka člověka; vroce 1986 byly doplněny abecedním rejstříkem. Nevydány (azvelké části nezpracovány) zůstaly oddíly B.III. Člověk, bytost společenská aC.Člověk auniverzum. Přesto však ČSVS, který čerpá lexikální materiál především zPříručního slovníku jazyka českého (1935–1957) aSlovníku spisovného jazyka českého (Havránek et al., 1960–71), obsahuje úctyhodné množství lexémů: na 1594 stranách je do 3193 hesel rozřazeno přes 400 000 jednoslovných ivíceslovných lexikálních jednotek. Obsažené výrazy jsou doplněny kolokacemi, příkladovými větami, někdy idefinicemi astylisticky charakterizovány pomocí široké palety zkratek aznaček. Zatímco makrostruktura až na výjimky respektuje Halligovo avon Wartburgovo schéma, mikrostruktura, pro niž abstraktní ana jazyce nezávislý Begriffssystem žádné vodítko nenabízí, je značně proměnlivá, nekonzistentní apřizpůsobuje se konkrétnímu slovnímu materiálu.3 Tato proměnlivost je vzhledem kpovaze arozsahu materiálu jistě pochopitelná aospravedlnitelná, výrazně však ztěžuje digitální zpracování hesel vrámci zde popisovaného projektu avyžádala si užití speciálního programu (viz níže) izvýšeného úsilí při korekci naskenovaného textu.4 1 Aby byla nezávislost pojmů na konkrétním jazykovém materiálu garantována, vycházeli autoři při tvorbě své klasifikační struktury nikoli zrodné němčiny, nýbrž zfrancouzštiny (Hallig ivon Wartburg byli romanisté). 2 Např.některé díly von Wartburgova Francouzského etymologického slovníku (von Wartburg, 1922–2003). Další slovníky ipodrobnější informace oHalligově avon Wartburgově klasifikačním schématu uvádí Obstová (2020, s.101–102). 3 To ostatně vÚvodních poznámkách deklaruje isám Haller: „Ani ve zpracování hesel jsme neusilovali onějakou uniformitu; každé heslo je uspořádáno podle svého vlastního rázu, daného příslušným slovním materiálem, jeho povahou ijeho rozsahem“ (Haller, 1969–77, I. díl, s. VII). 4 ČSVS vznikal v70.letech minulého století, aje proto zřejmé, že ne všechny informace vněm obsažené jsou dnes zcela aktuální; to se týká nejen vlastního lexika, ale také např.stylových charakteristik. Aktualizace takto rozsáhlého díla by si vyžádala dlouhé roky práce, aje tudíž mimo možnosti realizovaného projektu. Jistě oní však lze uvažovat do budoucna vrámci případného rozšiřování databáze (viz níže 4.1.3). OPEN ACCESS
90 STUDIE ZAPLIKOVANÉ LINGVISTIKY 2/2022 2.4 TEZAURUS JAZYKA ČESKÉHO (TJČ) Východiskem pro Tezaurus jazyka českého. Slovník českých slov afrází souznačných, blízkých apříbuzných (Klégr, 2007) bylo dílo publikované před 170 lety vAnglii. Šlo oThesaurus of English Words and Phrases (Roget, 1852), jehož autorem byl lékař aprofesor fyziologie Peter Mark Roget (1779–1869), věnující se iřadě přírodovědných oborů. V26 letech si pro svou potřebu vytvořil malý katalog slov, který používal při psaní. Vdůchodu se ktéto myšlence vrátil, rozpracoval ji apo čtyřech letech dílo dokončil. Za jeho života vyšel Thesaurus 28krát. Rodina Rogetů si podržela copyright aobsah Thesauru úspěšně tříbila adoplňovala až do roku 1952. Historie Thesauru prokázala jeho užitečnost anesmírnou oblibu. Do současnosti se prodalo přes 32 milionů výtisků azbritské linie se později oddělily vnejrůznějších podobách americká anásledně iaustralská verze. Na tomto slovníku lze ukázat, že podobné dílo nevzniká najednou (zatímco vydání zroku 1852 mělo kolem 15 000 slov, současná vydání obsahují přes 300 000 slov) ataké že klíčem je nosná, časem prověřená koncepce. Ta uThesauru zůstává po 170 letech bez podstatnějších modifikací navzdory změnám historicko-společenským, vědecko-technickým ijiným. Podstatou Thesauru je klasifikační schéma, které Roget odvodil zpřírodovědných taxonomií. Makrostrukturu tvoří několik hierarchicky uspořádaných rovin. Na nejobecnější rovině je obsah rozdělen do šesti tříd: abstraktní vztahy, prostor, hmota, intelekt— užívání mysli (soddíly tvoření asdílení myšlenek), volní oblast— uplatnění vůle (soddíly volní jednání individuální avsociálních skupinách) aemoce. Třídy jsou rozčleněny na 39 sekcí (například třída hmota na sekce hmota obecně, anorganická aorganická hmota) asekce na hlavy (vlastní hesla). Vedle tohoto vertikálního členění je makrostruktura uspořádána ještě horizontálně na úrovni hesel (pojmů). To znamená, že hesla jsou vrámci sekcí řazena za sebou do kontrastních (opozitních) dvojic (shoda, neshoda), případně trojic (touha, lhostejnost, averze), škál (začátek, střed, konec) či cyklů (barvy). Mikrostruktura (vnitřní uspořádání) hesel spočívá vrozdělení slov spojených sdaným pojmem podle slovního druhu na část substantivní, adjektivní, verbální aadverbiální. Jednotlivé slovní druhy jsou dále členěny na významové podskupiny (vlastnost, činnost, nositel vlastnosti, agens, patiens apod.), tedy podhesla. Tyto významové podskupiny představují lexikální pole ((ko)hyponym, meronym asynonym) spojená příslušným pojmem. Hesla jsou rovněž opatřena odkazy na hesla jiná. Součástí tištěného Thesauru je abecední rejstřík usnadňující vyhledávání. Nehledě na klasifikační schéma jsou hesla vtomto slovníku jednoduchá ajejich výhodou je jednotné akonzistentní zpracování, které značně ulehčilo digitalizaci. Český Tezaurus implicitně převzal Rogetovu makrostrukturu, reflektovanou ve výběru apořadí hesel, která vycházejí ze zkráceného vydání (Carney &Waite, 1985), apřevzal ijejich mikrostrukturu. Včeském Tezauru jsou explicitně vyznačeny pouze nejvyšší anejnižší rovina této hierarchie: třídy (I–VI) ahesla (1–885) avrámci nich jsou pak kurzívou odlišena podhesla. Ostatní hierarchické roviny, (pod)sekce, jsou zachovány vpořadí hesel, tj.sled hesel odpovídající příslušné sekci je dodržen ivčeském Tezauru (bylo by tedy možné zde sekce bez potíží zpětně doplnit). Ikdyž jsou sekce důležité pro logickou výstavbu slovníku apořadí hesel, pro vyhledávání slov aorientaci ve slovníku zásadní nejsou. Oproti klasickému anglickému Thesauru se ten OPEN ACCESS
ZOrA OBSTOVá — ONDřEJ TIcHÝ — ALEŠ KLÉGr 91 český liší imenším počtem hesel, obsahuje 885 záhlaví (původní slovník měl přesně 1000 hesel, vmoderní redakci 990). Neznamená to ovšem, že by se snížil počet pojmů včeském slovníku zachycených; došlo ktomu tak, že některá hesla byla sloučena (anaopak se zvýšil počet podhesel). Stejně je tomu ive zkrácené britské verzi Thesauru (pojmová struktura jazyka je obtížně uchopitelná oblast, nejde oexaktní záležitost). Obsah českých hesel přitom nevznikal překladem anglického originálu, nýbrž vychází zvýznamu (pod)záhlaví apříslušná lexikální pole byla sestavována podle situace včeštině. Také proto byla zvolena zkrácená verze, která poskytuje prostor pro tvorbu hesel nezávisle na angličtině. Účel Rogetova Thesauru vysvětluje jeho podtitul: to facilitate the expression of ideas and assist in literary composition. Tezaurus je tedy míněn jako praktická stylistická příručka rozvíjející přesné abohaté vyjadřování, nikoli jako encyklopedie našich znalostí osvětě, jak je tomu uČSVS. Ztoho také vyplývá, že oba slovníky se překrývají jen částečně. 3 PROJEKT LSD 3.1 cHArAKTErISTIKA AcíLE PrOJEKTU Cílem projektu Lexikálně-sémantické databáze češtiny (LSD-Czech), podpořeného Technologickou agenturou České republiky [TL02000041], je vytvoření rozsáhlé elektronické databáze založené na vytěžení lexika astruktur dvou českých tištěných onomaziologických slovníků, popsaných výše: Tezauru jazyka českého (Klégr, 2007) aČeského slovníku věcného asynonymického (Haller, 1969–86). Projekt reaguje na potřeby dvou skupin uživatelů. Tou první je široká obec nelingvistů vytvářejících komunikáty včeštině, především spisovatelů, překladatelů, pracovníků médií, marketingu či státní správy, ale iučitelů, studentů5 aveřejnosti. Současná slovní zásoba češtiny— na rozdíl od většiny velkých evropských jazyků— totiž dosud není souhrnně zpracována pro účely jazykové produkce, aškolní výuka iběžná jazyková praxe postrádají konzistentnější oporu, která by umožnila rozvoj komunikačních dovedností atvorbu významově precizních avýrazově bohatých textů. Onomaziologické slovníky napomáhají tvorbě kvalitních textů tím, že vedou uživatele od významu kformě. Vyhledávání ve věcně uspořádaných tištěných slovnících je však poměrně náročné; to je pravděpodobně jedním zdůvodů, proč bývají— navzdory tomu, že jsou obvykle vybaveny abecedním rejstříkem— využívány méně často než slovníky sémaziologické. Zpřístupnění dvou českých tezaurů vdigitální podobě bylo chápáno jako příležitost optimálně využít jejich obrovský potenciál: otevře uživatelům nové cesty klexikálnímu bohatství češtiny anabídne nové pohledy na české lexikum jako celek, jeho strukturu, členitost aprovázanost. Druhou skupinu uživatelů tvoří lingvisté adalší odborníci zabývající se výzkumem češtiny, korpusovou lingvistikou, zpracováním přirozeného jazyka, strojovým zpracováním textů astrojovým učením. Smyslem databáze je poskytnout datovou 5 Databázi nepochybně využijí icizinci osvojující si češtinu (víme například, že Tezaurus jazyka českého se uplatnil při univerzitní výuce češtiny pro cizince ve Finsku). OPEN ACCESS
92 STUDIE ZAPLIKOVANÉ LINGVISTIKY 2/2022 astrukturní základnu pro projekty sémantického značkování či strojového porozumění textu; zároveň bude možné porovnávat data vytěžená zobou onomaziologických slovníků sdaty Českého národního korpusu. Do budoucna počítáme isprůběžnou aktualizací databáze, která tak umožní uchovat azhodnotit výsledky desítek let práce českých lexikografů. 3.2 rEALIZAcE PrOJEKTU Projekt, na jehož realizaci se pod vedením Aleše Klégra podílejí dvě pracoviště, Filozofická fakulta Univerzity Karlovy aÚstav pro jazyk český AVČR, byl původně plánován na tři roky (únor 2019— únor 2022); vzhledem ktechnickým problémům vzniklým zejména vdůsledku koronavirové pandemie byl však prodloužen do konce roku 2022. Zpětnou vazbu kjednotlivým fázím projektu, které popíšeme níže, poskytuje pět aplikačních garantů zastupujících významné skupiny budoucích uživatelů databáze (uvedeno vabecedním pořadí): Česká asociace pro digitální humanitní vědy, z. s., Jednota tlumočníků apřekladatelů, Obec překladatelů, Sjednocená organizace nevidomých aslabozrakých České republiky, z. s.6 aÚstav formální aaplikované lingvistiky MFF UK. Realizace projektu byla rozčleněna do několika kroků, které se zčásti prolínají azčásti na sebe navazují (tyto kroky byly detailněji popsány již jinde, viz Tichý et al., 2021). 1. Vprvní fázi proběhla detailní analýza struktur zdrojových slovníků. Je třeba připomenout, že oba slovníky se— vzhledem krůzné době svého vzniku (dělí je téměř čtyřicet let), rozdílně koncipované makrostruktuře amikrostruktuře itomu, že ČSVS zůstal nedokončen— překrývají jen částečně, anaopak se významně doplňují. Aby bylo možno propojit dva takto odlišné zdroje do jednoho vyššího celku avytvořit software, který by umožnil vyhledávání vobou dílech zároveň asmysluplnou korelaci jejich kategorií ihesel, bylo třeba zmapovat sémantickou strukturu slovníků, porovnat zpracování jednotlivých hesel avneposlední řadě také rozhodnout, které zinformací— zejména zvelmi obsažného ČSVS— zůstanou zachovány ivelektronické verzi, akteré budou vypuštěny. 2. Zároveň sanalýzou struktur probíhalo skenování obou papírových slovníků, automatické rozpoznání znaků (OCR) apoloautomatická desambiguace rozpoznaných typografických prvků. 3. Třetím krokem byla poloautomatická transformace digitalizovaných struktur adat zdrojových slovníků do výsledné struktury ve formátu TEI-XML, navržené vprvním kroku, stím, že původní struktury zdrojových slovníků zůstanou paralelně zachovány. Vtéto fázi se ovšem ukázalo, že data ČSVS jsou natolik komplexní anekonzistentní, že by zpracování pomocí původně plánovaných tradičnějších nástrojů (skriptování na základě pravidel) vedlo knejistým výsledkům, apředevším by si vyžádalo velmi rozsáhlé manuální opravy. Rozhodli jsme se proto značkování slovníkových dat ČSVS zpřesnit aurychlit využitím technologie strojového učení: našim potřebám nejlépe vyhovoval projekt GROBID-Dictionaries (více informací viz 6 Webové rozhraní bude přizpůsobeno tak, aby odpovídalo ipotřebám nevidomých aslabozrakých. OPEN ACCESS
ZOrA OBSTOVá — ONDřEJ TIcHÝ — ALEŠ KLÉGr 93 Khemakhem et al., 2017; Khemakhem et al., 2018). Tento nástroj ovšem nebyl navržen specificky pro onomaziologické slovníky, aproto musel být pro účely naší databáze ve spolupráci sautorem upraven. Po úpravách byl nástroj natrénován na několika desítkách ručně opravených stran. Díky této technologii jsme získali mnohem preciznější soubor dat, iten však musel být podroben systematické manuální kontrole,7 do níž byli zapojeni studenti adoktorandi FFUK. 4. Souběžně sčinnostmi popsanými vbodech 2 a3 probíhalo programování anávrh softwarových nástrojů. Tento souběh byl vsouladu sharmonogramem projektu, značné problémy však způsobila data ČSVS, jejichž zpracování si vyžádalo delší čas ajejichž struktura se proměňovala ještě ve fázi manuálních oprav. Vzhledem knekonzistenci slovníku jsme totiž opakovaně objevovali neočekávané strukturní prvky (ojedinělé typy podhesel, graficky odlišené doplňující specifické informace včetně např.taxonomických seznamů atabulek ap.), snimiž jsme se museli vplánované struktuře vyrovnávat. Takovéto proměnlivé datové schéma pochopitelně komplikovalo programování samotné online aplikace. Technické řešení (podrobně popsáno vTichý et al., 2021) bylo realizováno vprogramovacím jazyce JavaScript, ato jak na straně serveru, tak na straně klienta. Data jsou vzhledem kformátu TEI-XML uložena vdatabázi baseX, na kterou je pomocí API (Application Programming Interface, tj.rozhraní pro vzájemnou komunikaci aplikací) axQuery napojena modulární struktura online aplikace. Přímo sdatabází komunikuje především modul Thesaurus, který provádí potřebné transformace dat atvoří tak základní část aplikace. Díky API je přes něj možné čerpat data do aplikací třetích stran, zejména ale komunikuje smodulem zajišťujícím standardní uživatelské rozhraní. Modul uživatelského rozhraní je naprogramován tak, aby umožnil kompilaci na straně serveru. To zajistí dostatečnou flexibilitu arychlost uživatelského rozhraní, ale idobrou dostupnost například ze strany nástrojů pro indexaci. 5. Poslední krok představuje testování online aplikace, jehož se účastní řešitelé projektu, spolupracující studenti, zástupci aplikačních garantů ataké veřejnost. 4 VÝSTUPY PROJEKTU Základní výstup projektu Lexikálně-sémantická databáze češtiny má dvě konkrétní formy: digitální pojmový slovník pro veřejnost aonline databázi určenou pro teoretický iaplikovaný lexikálně-sémantický výzkum prostřednictvím API pro lingvisty, specialisty voblasti počítačového zpracování přirozeného jazyka (NLP) adalší odborníky na aplikaci jazykových dat. Každá ztěchto forem využití představuje odlišnou problematiku, která vyžaduje odlišný přístup ařešení, aproto budou popsány zvlášť. 7 Jak už bylo zmíněno výše vodd. 2.4, pozn.4, data získaná zČSVS nebyla nijak aktualizována; zachována je ipůvodní ortografická podoba slov, která tak mnohdy neodpovídá současné ortografické normě. Aktualizace či doplňování slovníkových dat však může být zajímavou výzvou do budoucna, viz níže 4.1.3. OPEN ACCESS
94 STUDIE ZAPLIKOVANÉ LINGVISTIKY 2/2022 4.1 DIGITáLNí SLOVNíK PrO VEřEJNOST Tato aplikace bude volně přístupná na webové stránce www.najdislovo.cz (hostované na serverové infrastruktuře FF UK) aodkaz na ni bude ina webových stránkách Ústavu pro jazyk český, Českého národního korpusu ina stránkách všech výše zmíněných aplikačních garantů. 4.1.1 POPIS VYHLEDáVáNí VDIGITáLNíM SLOVNíKU Oba digitalizované slovníky (TJČ aČSVS) zpracované vaplikaci LSD mají hodně společného, ale poněkud se liší nejen svou strukturou, ale zčásti isvým pojetím (viz výše 2.3 a2.4). Oba nicméně slouží stejnému praktickému účelu. Jde oslovníky produkční, referenční příručky určené kpsaní textů, jemuž napomáhají třemi způsoby. Vprvní řadě uživateli poskytují výběr synonym ke zvýšení stylistické úrovně textu. Druhou funkci lze popsat jako mnemotechnickou: slovník může pomoci ve chvíli, kdy máme to správné slovo „na jazyku“, ale nemůžeme si ho vybavit. Aprotože slovník obsahuje širší okruh slov, než jsou jen synonyma (např.pojmy hyperonymní, kohyponymní, hyponymní, kauzálně spojené atd.), stačí začít od prvního slova, které nás napadne, adříve nebo později nás aplikace dovede ktomu, co hledáme. Tento slovník může být konečně inástrojem tzv.„laterálního myšlení“: díky tomu, že nás zavádí mezi slova spojená různými vztahy, dává nám možnost— na rozdíl od sekvenčního logického myšlení— kreativně vyjádřit daný obsah ijinak, zjiného úhlu, než jsme původně zamýšleli. Na úvodní stránce aplikace najdeme především základní vyhledávací okno (input box, viz níže). Stránka ovšem umožňuje zobrazit iobecné informace odatabázi ajejím fungování ioobou digitalizovaných slovnících. Ve spodní části úvodní strany jsou také zobrazeny hierarchické struktury, podle nichž jsou oba slovníky uspořádány. Vpřípadě českého Tezauru, jak již bylo zmíněno, je hierarchie zredukována (je implicitní) avyhledávat podle ní nelze. Naopak uHallerova slovníku může tato hierarchie uživateli vyhledávání konkrétních slov usnadnit: jednak je díky ní možné vyhledávání snadno omezit, resp.vybrat si zvýsledků jen ty výrazy, které se týkají příslušné sémantické oblasti dané částí hierarchie (např.koruna včásti hierarchie peníze vs. rostlina), jednak lze hierarchií přímo procházet ahledat slovo podobně, jako když hrajeme hru na hádání pojmů („Je to abstraktní, nebo konkrétní?“, „Je to rostlina, nebo živočich?“ atp.). Vyhledávací okno je na úvodní straně jediné aje společné pro oba slovníky. Umožňuje fulltextové vyhledávání vobou slovnících zvlášť, případně izároveň. Po zadání hledaného slova se zobrazí názvy ačísla hesel vobou slovnících, které dané slovo obsahují, seřazené podle relevance. Vtéto fázi se uživatel může rozhodnout, zda bude dále pracovat pouze sjedním ze slovníků, anebo soběma současně. Ukažme si na konkrétním příkladě, jakým způsobem probíhá hledání například vTezauru. Základním nástrojem aplikace je celotextové vyhledávání citlivé na tvar slova (vyhledávána jsou celá slova, aby seznam nebyl neúměrně dlouhý, uživatel má ale možnost vyhledávat jen části slov). Hledané slovo zapíšeme do vyhledávacího okna aaplikace najde všechny jeho výskyty vTezauru. Jak již bylo řečeno, na rozdíl od prostých synonymických slovníků ovšem Lexikálně-sémantická databáze nenabídne jen synonyma daného slova, nýbrž všechna lexikální pole slov spodobným či OPEN ACCESS