Databáze překladových ekvivalentů Treq
Abstract
245
Full text
ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 2, S. 245–260 Databáze překladových ekvivalentů Treq1 Michal Škrabal (Praha)— Martin vavřín (Praha) THE TRANSLATION EQUIVALENTS DATABASE (TREQ) The aim of the paper is to introduce atool that has recently been developed at the Institute of the Czech National Corpus, the Treq Translation Equivalents Database, and to explore its possible uses. These range from simple, one-shot probes while searching for an equivalent expression for atarget language to more sophisticated and elaborate corpus-assisted translations. Asignificant advantage of Treq is the possibility of clicking on any equivalent and immediately verifying its individual occurrences in context— and thus being able to more easily distinguish relevant translation candidates from misleading ones. This utility, which is based on data stored in the InterCorp parallel corpus, is continually being upgraded and enriched with new functions (the recent integration of multi-word units, adding English as the primary language of the dictionaries, an improved interface, etc.), and the accuracy of results is growing as the volume of data continually increases. KEYWORDS InterCorp, Treq, translation equivalents, alignment KLÍČOVÁ SLOVA InterCorp, Treq, překladové ekvivalenty, zarovnání 1. KORPUS INTERCORP Korpus InterCorp (IC) je rozsáhlý paralelní synchronní korpus budovaný vÚstavu Českého národního korpusu již od roku 2005. Vposledních letech dochází ksystematickému rozšiřování korpusu každý rok aod roku 2013 (verze 6) jsou předchozí verze korpusu dostupné vrozhraní KonText. IC je složen zněkolika částí: ručně korigovaných beletristických textů skontrolovaným zarovnáním (tzv. jádro) atzv. kolekcí, jež obsahují texty zpracovávané nikoliv manuálně, ale automaticky. Jde otyto typy textů: 1 Tento článek vznikl při realizaci projektu Český národní korpus (LM2015044) financovaného Ministerstvem školství, mládeže atělovýchovy vrámci aktivity Projekty velkých infrastruktur pro VaVaI. Za cenné připomínky kčlánku chceme poděkovat svým kolegům Michalu Křenovi aAlexandru Rosenovi, jenž se zároveň podílel na návrhu arealizaci celého projektu Treq. Dále za podněty kvývoji tohoto nástroje vděčíme Elżbietě Kaczmarské, za technickou pomoc děkujeme Ondřeji Bojarovi aDavidu Marečkovi aza výpomoc sgrafickým zpracováním kolegovi Janu Kockovi. Vneposlední řadě patří naše poděkování též dvojici anonymních recenzentů tohoto článku. Michal Škrabal— Martin vavřín OPEN ACCESS
246 ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 2 — právní texty Evropské unie zkorpusu Acquis Communautaire, — publicistické články azpravodajství zwebových stránek Project Syndicate aVoxEurop (dříve PressEurop), — záznamy jednání zEvropského parlamentu zlet 2007–2011 zkorpusu Europarl, — filmové titulky ze serveru Open Subtitles. Aktuální IC v9 obsahuje kromě tzv. pivotního jazyka2— češtiny— dalších 39 jazyků, které jsou ovšem co do velikosti isložení zastoupeny nerovnoměrně: největším částí korpusu je anglická složka (necelých 120 milionů slovních tvarů, ztoho přes 21 milionů slov tvoří jádro), největším jádrem disponuje němčina (přes 31 milionů slov), ale některé jazyky ručně zpracované jádro vůbec nemají aobsahují pouze balíčky (např.vietnamština ocelkové velikosti necelých 1,5 milionu slov, tvořených výhradně filmovými titulky, aj.). Texty uvíce než poloviny jazyků jsou opatřeny morfologickou anotací (23 z39) alemmatizovány (20 z39). Celková velikost IC v9 činí více než 1,2 miliardy slovních tvarů, resp. přes půldruhé miliardy tokenů.3 2. DATABÁZE TREQ AMOŽNOSTI JEJÍHO VYUŽITÍ Nástroj Treq je poměrně nový, vodborném tisku dosud nepopsaný (sdílčí výjimkou Kaczmarska— Rosen, 2015); jeho prvotní verze (0.1 alpha) pochází ze září 2014,4 rychle si však získává oblibu mezi uživateli,5 zejména pro svou jednoduchost apřímočarost. Čerpá zdat IC, která se zpracovávají pomocí automatických nástrojů, popsaných vnásledující kapitole; výsledkem je databáze překladových ekvivalentů, která je uživatelům volně přístupná6 na webové stránce https://treq.korpus.cz. Kromě nejrozšířenějšího způsobu užití, kdy hledáme nějaký ekvivalent pro výraz ve výchozím jazyce (možná extenze tohoto základní použití je popsána dále, voddílu5), lze na protějšky nabízené Treqem pohlížet ijako na potenciální slovníkové ekvivalenty. Lexikografům se tak dostává do rukou nástroj, jenž jim vjediném okamžiku nabídne soupis kandidátů na protějšky vcílovém jazyce isfrekvencí těchto ekvivalencí (absolutní ivyjádřenou procentuálně); často přitom platí, že čím je tato frekvence vyšší, tím pravděpodobněji je daný kandidát funkčním ekvivalentem. Podstatnou výhodou je 2 Pivotním jazykem se rozumí centrální jazyk vdaném paralelním korpusu, vůči němuž jsou všechny texty vkorpusu zarovnávány. 3 Přesné složení korpusu najdete na stránkách: http://wiki.korpus.cz/doku.php/cnk:intercorp:verze9. Obecně oInterCorpu viz Čermák— Rosen, 2012, či Rosen, 2016. 4 Kverzím podrobněji viz Info overzi na stránce https://treq.korpus.cz/. 5 Za rok 2016 bylo na portálu www.korpus.cz evidováno přes 719 tisíc dotazů; nejhojněji využívaným nástrojem je KonText (svíce než 85 %), následovaný právě databází Treq (více než 70 tisíc dotazů, tj.bezmála 200 denně, což představuje necelých 10 % zcelkového počtu zadaných dotazů). 6 Samotné výsledky hledání jsou přístupné ibez registrace, stejně tak lze přejít do rozhraní KonText avidět nabízené ekvivalenty vjejich přirozeném prostředí. Pro plnohodnotnou práci stěmito daty vKonTextu je však nezbytné být přihlášen ke svému uživatelskému účtu. OPEN ACCESS
MIChAL ŠkRABAL— MARTIN vAvŘÍN 247 možnost ověřit si jednotlivé realizace kteréhokoliv znich přímo vkontextu pomocí hypertextového odkazu— asnáze tak odlišit relevantní kandidáty od těch zavádějících.7 3. ZPRACOVÁNÍ DAT8 Při přípravě dat pro databázi Treq nejprve vybereme zcelého korpusu dané jazykové verze IC pouze věty, které jsou kčeštině zarovnány vpoměru 1 : 1. Výhradně jednoduchá zarovnání používáme proto, že obvykle bývají spolehlivější; zvláště vpřípadě automaticky zarovnaných textů tak můžeme předejít zanesení potenciálních chyb. Následuje automatické zarovnání po slovech vrámci těchto vět pomocí programu GIZA++ (Och— Ney, 2003).9 Dosavadní verze Trequ (0.1–1.1) využívaly zarovnání pomocí metody intersection; vznikají tak pouze dvojice, vnichž jedno slovo odpovídá jednomu ekvivalentu, např.: 7 Vytěžování dat zparalelních korpusů pro lexikografické účely je logickým postupem, tkvícím vsamotné povaze těchto dat. Přehled omožnostech extrakce dvoujazyčných slovníků zparalelních asrovnatelných korpusů podává Sharoff et al. (2013), srov.též diplomovou práci J. Tiedemanna (2000). Dílčí pokusy vtomto ohledu byly podniknuty také včeském prostředí, ato vpřípadě angličtiny (Čmejrek— Cuřín, 2001; srov.též Čmejrek, 1998, aCuřín, 1998), litevštiny (Skoumalová, 2008) či chorvatštiny (Jirásek, 2011). Kupř. poslední dva jmenovaní autoři se shodují na tom, že slovníky takto automaticky extrahované jsou pouhým východiskem pro následnou slovníkářskou práci, mohou ji však lexikografovi nemálo ulehčit. To ostatně potvrzuje inaše vlastní zkušenost: Treq je využíván při vytváření lotyšsko-českého slovníku (Škrabal, 2016b). — Potenciál databáze Treq pro lexikografické účely by si bezesporu zasloužil samostatnou studii, vtomto článku jej zmiňujeme pouze okrajově. 8 Srov. proces vzniku „statistických překladových slovníků“ (Kovář — Baisa — Jakubíček, 2016, s. 343n.). 9 Konkrétní instalace viz https://github.com/moses-smt/mgiza/tree/master/mgizapp. Využit byl též pomocný skript od Ondřeje Bojara. OPEN ACCESS
248 ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 2 Tzn. že vprvní větě první slovo ve zdrojovém jazyku (0) odpovídá prvnímu slovu vjazyku cílovém (0), druhé slovo (1) odpovídá třetímu slovu (2) atd. (srov.Rosen— Adamová— Vavřín, 2014; Kaczmarska— Rosen, 2015, s.164–165). Pro novou verzi (2.0) jsme se rozhodli kromě těchto jednoduchých zarovnání navíc využít metodu grow-diag-final-and, která umožňuje vytvářet ikomplikovanější zarovnání více slov na obou stranách překladu.10 Takové zarovnání pak může vypadat třeba takto: Oproti případu výše tu druhé slovo ve zdrojovém jazyku (1) neodpovídá pouze třetímu (2), ale též druhému ačtvrtému (1, 3) slovu vjazyku cílovém atd. Ztakovéhoto zarovnání následně vybíráme pomocí jednoduchého skriptu co největší množství kombinací slov, které toto zarovnání umožňuje (viz též příklad extrahovaných ekvivalentů níže). Vobou případech jsou zarovnané dvojice slov setříděny asečteny, výsledky automatické extrakce však už nejsou nijak revidovány auživateli jsou poskytnuty formou seznamu nalezených ekvivalentů zadaného výrazu, doplněných oabsolutní arelativní frekvenci. Vjakém poměru jsou frekvence nalezené vKonTextu stěmi zobrazovanými Treqem, ukazuje Tabulka 1. Ta vyčísluje různé typy dat vjednotlivých fázích jejich zpracování pro Treq zčesko-anglické složky IC v9 (víceslovná varianta). 10 Jednotlivé metody zarovnávání slov popisují asrovnávají např.Mareček, 2009, či Girgzdis et al., 2014. OPEN ACCESS
MIChAL ŠkRABAL— MARTIN vAvŘÍN 249 Fáze zpracování Výsledná data Počet (vtisících) Core Subtitles Acquis Europarl VoxEurop Syndicate Celkem 0. Vstup Pozice v angličtině 25 149 66 790 29 626 17 384 3 123 4 387 146 458 Věty v angličtině 1 510 9 211 1 426 681 152 190 13 171 1. Zarovnání vět 1:1 Zarovnané věty lemmata 1 267 6 955 1 251 656 127 180 10 437 tvary 1 267 6 955 1 254 656 127 180 10 440 2. Zarovnání slov Nalezené ekvivalenty lemmata 15 785 41 189 19 344 12 812 1 670 3 352 94 153 tvary 15 538 41 445 19 656 12 899 1 598 3 344 94 479 3. Vytvoření slovníku Položky slovníku lemmata 3 235 6 697 1 441 1 213 547 550 13 682 tvary 4 639 9 276 2 056 1 946 670 873 19 460 4. Vyčištění slovníku Položky slovníku lemmata 2 775 5 375 1 133 1 061 461 458 11 263 tvary 3 966 7 146 1 722 1 760 566 750 15 909 tabulka 1.Zpracování dat pro česko-anglický slovník Po dílčích krocích lze sledovat postupný úbytek dat, která jsou ve výsledném slovníku použita. Vprvním kroku použijeme pouze zarovnání vět 1 : 1— tím přijdeme o20,7 % vět.11 Následně se vyberou na základě zarovnání zprogramu Giza++ jednoavíceslovné ekvivalenty. Vztah mezi velikostí původního korpusu apočtem vyextrahovaných ekvivalentů však nelze jasně předvídat, zvláště pak uvíceslovných ekvivalentů, kde vznikají nejrůznější kombinace stejných slov (viz tučně vysázené dvojice níže). Takto by např.vypadal abecedně řazený soupis česko-anglických párů extrahovaných zdruhé příkladové věty: a– and chybný— bad krok— move lidí— people naštvalo— angry považovalo— been widely regarded as považovalo za— been widely regarded as považovalo za— regarded a se— made Spoustu— lot of to— This to— very za— regarded a .— . 11 Vbudoucnu lze experimentovat rovněž sneparitním zarovnáváním. Další možné plány jsou naznačeny vsamotném závěru této studie. OPEN ACCESS
250 ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 2 Ve třetím kroku se vrámci celého textu sečtou řádky, které jsou stejné na obou stranách zarovnání. Tak získáme seznam afrekvenci ekvivalentů. Nakonec, vzávěrečném kroku, vyřadíme všechny protějšky obsahující interpunkci, čímž obdržíme finální verzi slovníku. Uvšech jazykových párů, kde je kdispozici lemmatizace na obou stranách zarovnání, aplikujeme stejný postup ina lemmatizovanou podobu dat (na počátek být stvořit vesmír .— in the beginning the universe be create .). 4. ROZHRANÍ Přístup ktakto extrahovaným datům pak zprostředkovává rozhraní Treq. Ve výchozím nastavení jsou protějšky hledaného výrazu řazeny sestupně podle četnosti; jejich relativní frekvence je uživatelovým primárním vodítkem: čím častěji se ekvivalent hledaného výrazu vyskytl ve srovnání sostatními ekvivalenty, tím vyšší je pravděpodobnost, že je funkční. Udostatečně velkých ažánrově pestrých korpusů má zajisté smysl uvádět frekvenci ekvivalentních párů zvlášť pro různé typy textů (beletrie, publicistika, právnické texty, filmové titulky suplující mluvený jazyk), tuto možnost Treq rovněž nabízí (pole Omezit na). Počínaje verzí 2 je možné do dotazovacího okénka zadávat víceslovné jednotky— ato vobou směrech— aočekávat výsledky jak jednoslovné, tak víceslovné, přičemž uživatelé mají na výběr mezi oběma možnostmi (spolu sjinými eventualitami, např.nerozlišováním mezi velkými amalými písmeny). Možnosti Trequ se tím podstatně rozšiřují: např.pro kombinaci angličtina-čeština lze nyní vyhledávat mnohé třídy slov: frázová slovesa, diskursní částice (discourse markers), fráze vobecném smyslu aj., vopačném směru např.reflexivní slovesa. Mimoto nynější výsledky více odpovídají reálnému jazykovému stavu: ekvivalenci lexémů ve zdrojovém acílovém jazyce nelze pochopitelně omezovat na „ideální“ poměr 1:1. Svíceslovnými výrazy získala na naléhavosti potřeba zakomponovat také dotazovací jazyk, který by umožňoval dotazy pomocí zástupných výrazů;12 dosud Treq vyhledával pouze přesné řetězce znaků. Kromě toho byl pro verzi 2 rozšířen primární jazyk slovníků zdosavadní češtiny na angličtinu: vedle oboustranných česko-cizojazyčných slovníků byly zdat vIC automaticky vygenerovány oboustranné slovníky anglicko-cizojazyčné. Možnost využívat Treq se tak otevírá mnohem širšímu publiku než dosud, uživatelé už nejsou limitováni nutností ovládat češtinu. Teoreticky lze vbudoucnu rozšířit primární jazyk na kterýkoliv jazyk vIC zastoupený; vtomto ohledu je nutno řídit se především zájmem apotřebami uživatelů. 12 Treq je postaven na databázovém systému MySQL, který využívá knihovnu regulárních výrazů vytvořenou Henrym Spencerem avyhovující standardu POSIX a(viz např.https:// garyhouston.github.io/regex/). Detailnější popis dotazovacího jazyka najdete vmanuálu knástroji Treq: http://wiki.korpus.cz/doku.php/manualy:treq. OPEN ACCESS
MIChAL ŠkRABAL— MARTIN vAvŘÍN 251 5. DATABÁZE TREQ VPRAXI Další možné využití, jež mělo zároveň posloužit jako jakási „zatěžkávací zkouška“ nové verze Trequ (vté době dosud jen interně dostupného prototypu), bylo prezentováno vrámci kolokvia KOLT 2016, konaného loni vlistopadu (Škrabal, 2016a). Mottem daného kolokvia byl citát S. Johanssona (2007, s.1): (0) It has often been said that, through corpora, we can observe patterns in language which we were unaware of before […]. My claim is that this applies particularly to multilingual corpora. We can see how languages differ, what they share and— perhaps eventually— what characterises language in general. Protože neexistuje překlad Johanssonovy monografie do češtiny, požádali jsme své čtyři kolegy, vesměs anglisty nebo překladatele z/do angličtiny, oad hoc převod těchto tří vět. (1) Často se říká, že skrz korpusy je možné vjazyce nahlédnout pravidelnosti, které nám doposud zůstávaly skryty. Podle mě toto tvrzení platí dvojnásob vpřípadě korpusů vícejazyčných. Vyčteme znich, včem se jazyky liší, co sdílejí, aněkdy třeba iobecné vlastnosti jazyka jako takového. (2) Již bylo mnohokrát řečeno, že prostřednictvím korpusů můžeme vjazyce objevit vzorce, kterých jsme si do té doby nebyli vědomi. Domnívám se, že toto tvrzení platí dvojnásob ovícejazyčných korpusech. Můžeme vnich pozorovat, jak se jazyky liší, co sdílejí amožná nakonec iodhalit to, co charakterizuje jazyk jako takový. (3) Často se říká, že prostřednictvím korpusů můžeme vjazyce sledovat trendy, kterých jsme si dříve nebyli vědomi. Já tvrdím, že to platí zejména pro vícejazyčné korpusy. Vidíme, jak se jazyky od sebe liší, co mají společného, anakonec snad také to, co charakterizuje jazyk obecně. (4) Často se tvrdí, že pomocí korpusu lze vysledovat jazykové vzorce, kterých si jinak nejsme vědomi. Já tvrdím, že toto platí zejména na korpusy vícejazykové. Vidíme na nich, jak se jazyky vzájemně liší, včem jsou si podobné, asnad jejich pomocí nakonec zjistíme, co je pro jazyky charakteristické obecně. Variabilita je tu zjevná apochopitelná, asrostoucím počtem překladatelů by jistě nadále rostla, ale stejně tak bychom našli iopakující se překladatelská řešení; už na tomto vzorku jsou vedle odlišností patrné určité paralely, např.všichni čtyři zvolili sloveso platit, zato už každý sjinou předložkovou vazbou. Podobně bychom mohli srovnat ipřeklady strojové, generované automatickými překladači. Vybrali jsme tři, budované na statistických základech: Google Translator (GT),13 13 https://translate.google.cz/. OPEN ACCESS
252 ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 2 Microsoft Translator (MT), integrovaný do textového editoru Word,14 apřekladač Moses, vyvíjený Ústavem formální aaplikované lingvistiky MFF UK.15 (5) To často bylo říkal, že prostřednictvím korpusů, můžeme pozorovat vzory vjazyce, kterému jsme byli vědomi dříve. Můj požadavek je, že to platí zejména pro vícejazyčného korpusy. Můžeme vidět, jak jazyky se liší, co sdílejí a— možná nakonec— co charakterizuje jazykem obecně. (6) Často bylo řečeno, že prostřednictvím korpusy, můžeme sledovat vzorce vjazyce, který jsme nevěděli před. Moje tvrzení je, že to platí zejména pro vícejazyčné korpusů. Můžeme vidět, jak jazyků liší, co sdílejí a— možná nakonec— co je charakteristické pro jazyk obecně. (7) To často zaznělo, že prostřednictvím korpusů, můžeme pozorovat vzory vjazyce, kterému jsme byli vědomi. Žaloby je, že to platí zejména pro vícejazyčné corpora. Můžeme vidět, jak se liší jazyky, co sdílejí a— možná nakonec— co charakterizuje jazyk obecně. Vzásadě lze tvrdit, že jde oobstojné výsledky, které pro rámcovou představu osmyslu daného textu víceméně postačí. Náš zájem však netkví vpasivním porozumění cizímu textu, ale vaktivním, tvůrčím procesu převodu textu zjazyka zdrojového do cílového; zajímá nás, nakolik vtakovémto procesu mohou napomoci data zparalelního korpusu IC, ať už přes rozhraní KonText, či Treq. Na základě těchto dat jsme se pokusili vytvořit ad hoc překlad, který by se dal označit za corpus-assisted. Důležitá byla post-editační fáze překladu, kterou umožňují rovněž některé překladače (známi uvedených GT): uživatel si na úrovni jednotlivých slov či kolokací vybírá alternativní překladatelská řešení, vpřípadě anglicko-českého překladu jsou nabízeny kromě synonymních ekvivalentů ijiné pádové formy. Původní podobu si tak uživatel upravuje vsouladu se svou představou oideálním výsledku. Společným prvkem je tu jeho aktivní role: nezůstává jen pasivním příjemcem daného produktu, ale stává se činným post-editorem. Daný citát jsme si pro své potřeby rozčlenili do menších ucelených jednotek.16 Je nutno přiznat, že tato parcelace je do značné míry intuitivní azdaleka ne jediná možná. Neskrýváme tu ani předběžnou znalost zdrojového jazyka, nejde nám operspektivu badatelskou, ale spíše uživatelskou, osituaci, kdy se uživatel snaží tyto víceslovné jednotky, volněji či pevněji spojené, přeložit pomocí korpusových nástrojů. 14 Používáme verzi editoru Word 2007. Mimoto je MT kdispozici online na adrese https:// www.bing.com/translator. 15 Dostupný online na http://lindat.mff.cuni.cz/services/moses/. Všechny tři strojové překlady jsou citovány k3.12.2016. 16 Záměrně se tu vyhýbáme jakémukoliv bližšímu označení, byť se vanglickojazyčné odborné literatuře nabízejí mnohé, více či méně přesně definované, pojmy jako např.lexical bundles, lexical chunks, lexical clusters, patterns, N-grams aj. Srov.též přístup tzv. Linear Unit Gram mar, který nabízejí J. Sinclair aA. Mauranenová (2006). OPEN ACCESS
MIChAL ŠkRABAL— MARTIN vAvŘÍN 253 Nezbytná je přitom jeho obeznámenost (byť jen elementární) sdaným zdrojovým jazykem, tak aby si znabízených kandidátů na ekvivalenty překládaného výrazu mohl správně vybrat. Vtomto ohledu je databáze Treq nástrojem sloužícím často kaktivaci pasivních znalostí či kpotvrzení uživatelových domněnek— ajako takovou je třeba ji brát cum grano salis. Vžádném případě ji nelze zaměňovat za regulérní slovník, měla by sloužit spíše jako jeho doplněk, který kýžené překladatelské řešení nenabízí automaticky, může však uživatele alespoň navést správným směrem. Oproti klasickým slovníkům odráží ve větší míře specifičnost některých případů mezijazykové ekvivalence, kromě frazeologičnosti např. též odlišnou slovnědruhovou platnost výrazu ajeho cizojazyčného ekvivalentu či jejich neparitní zarovnání (tj. v poměru 1 : n / n : 1). Zároveň nabízí nesrovnatelně bohatší exemplifikaci, všechny příklady nadto pocházejí z autentických, dále neupravovaných zdrojů. Námi rozparcelované věty vypadají takto: (0/1) It has often been said that, | through corpora, | we can observe | patterns in language | which we were unaware of before. (0/2) My claim is that | this applies particularly to | multilingual corpora. (0/3) We can see | how languages differ, | what they share | and— perhaps eventually— | what characterises language | in general. Jak vidno, jednotlivé úseky se od sebe dosti liší: kromě své délky též sémanticky, strukturně, mírou ustálenosti aj. Netučně jsou vysázeny jednak spojovací výrazy, jednak lexikální proměnné, které mohou variovat (ovšem ne libovolně abez jakýchkoliv omezení); zvýrazněno je pomyslné jádro daného sousloví, jež budeme hledat v(celém) korpusu InterCorp v9— English (Klégr et al., 2016): vrozhraní KonText nejčastěji pomocí typu dotazu Fráze (jednotlivé výrazy též pomocí Slovního tvaru; lze pochopitelně vždy využít také nejobecnější typ dotazu, tj.CQL), vrozhraní Treq prostým vepsáním dané fráze či slova (vzhledem kflektivnosti češtiny volíme zarovnání po slovních tvarech, tj.nevybíráme volbu Lemmata17; zaškrtnutu máme naopak volbu nerozlišovat velikost písmen), smožností využití výše zmíněných zástupných výrazů. Obecně platí, že se vždy snažíme najít co největší část tohoto sousloví; alze předpokládat, že počet dokladů bude klesat úměrně sdélkou daného dotazu— většinou půjde omalé počty výskytů: jednotky či pár desítek.18 Potvrzuje se to hned vúvodním případě: vstupní frázi, resp. její část has often been said najdeme vKonTextu pouze 9krát, přičemž všechny překlady (včetně toho posledního, nejvolnějšího) se zdají být relevantní: často se říká (2), často zaznělo (2), po 17 Dlužno podotknout, že zarovnání po lemmatech může přinést výsledky odlišné, nikoliv však zásadně. Snadná změna vnastavení dotazu umožňuje uživateli experimentovat sjednotlivými mody arozhodnout se, který mu vyhovuje více. 18 Považujeme za důležité znovu zopakovat, že to nemusí být apriori na škodu: naším cílem není žádná lingvistická či translatologická analýza, snažíme se vcítit do řadového uživatele překládajícího anglický text. OPEN ACCESS
260 ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 2 Rosen, A. (2016): InterCorp— alook behind the façade of aparallel corpus. In: E.Gruszczyńska— A. Leńko-Szymańska (eds.), Polskojęzyczne korpusy równoległe. Polishlanguage Parallel Corpora. Warszawa: Instytut Lingwistyki Stosowanej, s.21–40. Rosen, A.— Adamová, M.— Vavřín, M. (2014): Extrakce lexikálních ekvivalentů zparalelního korpusu. In: Korpusová lingvistika Praha 2014. 20 let mapování češtiny. Abstrakty. Praha: Ústav Českého národního korpusu, s.177–179. Sharoff, S.— Rapp, R.— Zweigenbaum,P.— Fung, P. (eds.) (2013): Building and Using Comparable Corpora. Springer-Verlag: Berlin. Sinclair, J. M.— Mauranen, A. (2006): Linear Unit Grammar. Amsterdam— Philadelphia: John Benjamins Publishing Company. Skoumalová, H. (2008): Extracting dictionaries from parallel corpora. In: F.Čermák— R. Marcinkevičienė— E.Rimkutė— J.Zabarskaitė (eds.), Proceedings of The Third Baltic Conference on Human Language Technologies. Kaunas: Vytauto Didžiojo Universitetas, s.297–301. Škrabal, M. (2016a): Paralelně— víceslovně— lépe? Kmožnostem nové verze databáze překladových ekvivalentů Treq. In: Kolt 2016. Korpusy vkontrastivní lingvistice atranslatologii. Abstrakty. Praha: Ústav Českého národního korpusu. Cit.1. 2. 2017, dostupné z<http:// ucnk.ff.cuni.cz/kolt2016/KOLT2016_ abstrakty.pdf>. Škrabal, M. (2016b): Srovnávací aspekty lotyšského ačeského lexikonu: Materiály ksestavení lotyšsko-českého slovníku. Disertační práce. Praha: Filozofická fakulta Univerzity Karlovy. Tiedemann, J. (2000): Automatical Lexicon Extraction from Aligned Bilingual Corpora. Master’sthesis. Magdeburg: Otto-vonGuericke-Universität. Michal Škrabal | Ústav Českého národního korpusu, Filozofická fakulta Univerzity Karlovy | nám. Jana Palacha 2, 116 38 Praha 1 [email protected] Martin Vavřín | Ústav Českého národního korpusu, Filozofická fakulta Univerzity Karlovy | nám. Jana Palacha 2, 116 38 Praha 1 [email protected] OPEN ACCESS