Workshop Lexical Data Masterclass 2018
Abstract
241
Full text
issn 0008-7386 © filozofická fakulta, univerzita karlova vpraze ČASOPIS PRO MODERNÍ FILOLOGII 101, 2019, Č.2, S. 241–248 WORKSHOP LEXICAL DATA MASTERCLASS 2018 Ve dnech 3.–7.12.2018 proběhl vBerlíně druhý ročník workshopu Lexical Data Masterclass (https://lexmc18.sciencesconf.org), který podpořilo francouzské Ministerstvo vysokého školství, výzkumu ainovací, infrastruktury DARIAH-EU, CLARIN, ELEXIS— European Lexicographic Infrastructure, BCDH (Belgrade Center for Digital Humanities), Berlínsko-braniborská akademie věd (Berlin-Brandenburgische Akademie der Wissenschaften) aspolečnost SyncRO Soft. Díky posledně jmenované firmě získali účastníci bezplatnou půlroční licenci softwaru oXygen XML Editor (https://www.oxygenxml.com/xml_editor.html), který umožňuje pohodlnou práci sdokumenty ve formátu XML ase souvisejícími technologiemi. Dalším benefitem byla úhrada nákladů na dopravu aubytování na základě žádosti oproplacení účetních dokladů uDARIAH-EU. Hlavními organizátory workshopu byli zejména Laurent Romary aToma Tasovac, kteří stojí za přípravou nového standardu pro značkování digitálních slovníků, jež nese označení TEI-Lex0 (https://github.com/LingSIG/Dictionaries). Významnou měrou se na akci podílel také Mohamed Khemaken, který vyvíjí aplikaci GROBID- -Dictionaries (viz níže). Pětidenní akce je rámovaná prezentací účastníků. První den představují své projekty, na nichž budou vrámci workshopu pracovat. Tato část má pevná pravidla: do tříminutové prezentace (12 snímků po 15 sekundách) je potřeba vtěsnat gros lexikografického problému. Závěrečná vystoupení, která už nebyla tak striktně limitovaná časem, slouží ke shrnutí pokroku vpráci akprezentaci dosažených výsledků. Vroce 2018 bylo pro účast na workshopu vybráno 16 projektů. Od úterý se program rozdělil do tří skupin. Jedna se zaměřila na práci saplikací GROBID-Dictionaries (https://github.com/MedKhem/grobid-dictionaries), která pomocí strojového učení dokáže vnaskenovaném materiálu rozpoznat aoznačit jednotlivé části slovníkové heslové stati (ve formátu XML TEI P5); na tuto sekci bylo potřeba se přihlásit pomocí samostatného formuláře. Ve zbývajících dvou sekcích se na začátku dne probírala dílčí témata apoté následovala asistovaná práce nad konkrétním materiálem jednotlivých účastníků. Asistovali nejen organizátoři, ale isamotní účastníci, pokud se vprobíraných technologiích dostatečně vyznali. Mezi prezentovaná témata patřil úvod do kódování slovníků pomocí doporučení TEI (Introduction to encoding dictionaries with the TEI guidelines), pokročilé techniky sprogramem oXygen XML Editor (Advanced Oxygen techniques), využití XPath pro hledání ve slovnících (Advanced Path for searching dictionary content), transformace pomocí XSLT do jiných formátů (XSLT), představení projektu Standardization Survival Kit (Data management; http://ssk.parthenos-project.eu), který nabízí doporučené postupy vrůzných oblastech digitálních humanitních věd avýzkumu kulturního dědictví. Obecně lze říci, že jsou tyto prezentace určeny zejména pro začátečníky, ale pokročilejší aspecializovaná témata mohou účastníci probrat se školiteli během zbytku dne, kdy se věnují svým vlastním projektům. Vplenární přednášce The VICAV Dictionaries: Working on aVirtual Research Environment představil Karlheinz Moerth zRakouského centra pro digitální huBoris Lehečka OPEN ACCESSOPEN ACCESS
242 ČASOPIS PRO MODERNÍ FILOLOGII 101, 2019, Č.2 manitní vědy (ACDH, https://www.oeaw.ac.at/de/acdh/) infrastrukturu pro vídeňský korpus variet arabštiny. Lexikografická témata, snimiž se workshopu účastnili jednotliví badatelé, byla značně různorodá. Část se věnovala retrodigitalizaci slovníků spomocí aplikace GROBID-Dictionaries, ato jak historických tištěných (německo-srbský hornický slovník) astrojopisných (terminologický slovník makedonštiny), tak imoderních (výkladové slovníky turečtiny). Ke specializovaným slovníkům bychom mohli zařadit slovníky italštiny z19.století, právní slovníky španělštiny nebo slovník slovanské korpusové terminologie. Některé projekty se týkaly nejen zachycení slovní zásoby, ale idalších jazykových ametajazykových rovin, např.dialektů Àbèsàbèsì (vNigérii) nebo dokumentace lingvistické terminologie vcitátech zKoránu. Část účastníků řešila vylepšení dosavadního způsobu značkování (Elektronický slovník staré češtiny, Historický tezaurus angličtiny, akademický slovník portugalštiny), analýzu dostupných slovníkových dat (Deutsches Wörterbuch bratří Grimmů) nebo transformaci údajů do formátu TEI (WordNet bulharštiny). Podrobnější přehled všech témat je kvidění na adrese https://digilex.hypotheses.org/551. Jak prezentace, tak studijní materiály zdosavadních ročníků jsou dostupné na úložišti GitHub (https://github.com/DARIAH-ERIC/lexicalresources/tree/master/ Events/). Videálním případě je zde kdispozici ipracovní materiál jednotlivých účastníků, pokud kjeho publikaci mají svolení, takže může posloužit jako inspirace pro zájemce ospecifickou problematiku. Další možností, jak informovat vědeckou komunitu odílčích problémech ajejich řešeních, jsou blogové příspěvky na stránkách https://digilex.hypotheses.org; přístupové údaje ktomuto médiu zasílají pořadatelé během workshopu jeho účastníkům. Podobná setkání jsou důležitá pro zájemce oprezentované standardy atechnologie, kteří se onich můžou dozvědět nejen základní informace, ale vpřípadě potřeby idetaily, které pomohou vyřešit jejich problémy. Zároveň je tento druh akcí přínosný ipro organizátory, kteří získají zpětnou vazbu amohou ovlivňovat další směřování standardů avývoj softwarových aplikací. Boris Lehečka | Ústav pro jazyk český AV ČR, v. v. i. | Valentinská 1, 116 46 Praha 1 ORCID ID: 0000-0003-4893-5537 [email protected] OPEN ACCESS