Improving Compatibility of Terminological Collections with a Bridging Classification of Data Categories
Full text
Poprawa kompatybilności zbiorów terminologicznych za pomocą pomostowej klasyfikacji kategorii danych WPROWADZENIE Pomimo IGOR KUDASHEV University of Helsinki istnienia standaryzowanego zestawu kategorii danych (ISO 12620:1999) oraz standaryzowanych metod pracy terminologicznej (ISO 704:2000), nadal trudno znaleźć dwie bazy terminologiczne utworzone w dwóch różnych organizacjach, które można by łatwo połączyć bez utraty danych lub zniekształcenia pierwotnych zasad opracowania każdej z baz danych. Najbardziej oczywiste przyczyny są następujące: języki i tradycje narodowe różnią się; -dziedziny JOS różnią się; wykształcenie i podejście osób opracowujących dane różnią się; rozwiązania techniczne różnią się. Jednocześnie jednym z kierunków rozwoju zarządzania zasobami terminologicznymi i innymi rodzajami danych stała się agregacja rozproszonych zasobów w większe portale lub usługi, zwykle bez ich fizycznego łączenia. Jednym z przykładów jest portal EuroTermBank (http:// www.eurotermbank.com), który umożliwia wyszukiwanie w wielu wewnętrznych i zewnętrznych bazach terminologicznych oraz może sporządzać zestawienie wyników. W miarę wzrostu wymagań użytkowników i objętości danych konieczne staje się zapewnienie zaawansowanego wyszukiwania obejmującego wszystkie pola hasła, a nie tylko hasła główne, oraz dostosowywanie haseł do preferencji użytkowników. W niniejszym artykule proponujemy klasyfikację kategorii danych, która może służyć jako pomost między zbiorami terminologicznymi. Klasyfikacja ta dotyczy następujących problemów związanych z zarządzaniem zbiorami terminologicznymi o różnych zestawach kategorii danych: agregacji i scalania zasobów terminologicznych; organizacji wyszukiwania obejmującego wszystkie pola haseł; dostosowywania haseł z wielu zbiorów zgodnie z preferencjami użytkowników. 36 Igor Kudashev | Improving Compatibility of Terminological.
Terminologiczna baza danych może zawierać różne rodzaje danych oprócz właściwych danych terminologicznych, takie jak informacje o źródłach, użytkownikach i transakcjach związanych z zarządzaniem terminologią. W niniejszym artykule skupiamy się na klasyfikacji kategorii danych związanych z opisem wyrażeń języka specjalistycznego. CZYM JEST KATEGORIA DANYCH? Różne typy danych umieszcza się w różnych polach w bazach danych terminologicznych. Kategoria danych jest wynikiem specyfikacji danego pola danych (ISO 1087-2:2000: 13). Terminolodzy używają różnych metafor, aby wyjaśnić pojęcie kategorii danych. Jedną z metafor jest szafa, w której różne szuflady służą do przechowywania różnych rodzajów odzieży. Inną metaforą jest koszyk zakupowy, w którym każdy rodzaj towaru jest zapakowany we własne opakowanie, tak aby towary się nie mieszały. TYPOWE NIEZGODNOŚCI MIĘDZY KATEGORIAMI DANYCH Kategorie danych są wynikiem klasyfikacji danych. Dane można klasyfikować na wiele różnych sposobów, zależnie od poglądów klasyfikatora i potrzeb użytkowników. Korzystając z metafory szafy, można powiedzieć, że różne szafy mają różną liczbę szuflad, które mogą mieć różny kształt. rozmiar itp. W bazach danych terminologicznych możliwych jest co najmniej sześć rodzajów niezgodności między kategoriami danych: niezgodność nazw kategorii danych; niezgodność „rozmiarów” kategorii danych, tj. różna „granulacja- ”; niezgodność „miejsc” kategorii danych, tj. ich położenia w schemacie klasyfikacyjnym; niezgodność zasad klasyfikacji (nakładanie się); niezgodność zawartości kategorii danych; przypadki mieszane. Poniżej przedstawiono kilka przykładów ilustrujących niektóre powszechnie występujące niezgodności. Przypadek 1: kategorie danych są nazywane inaczej. Przykład: kategoria danych jest nazywana note w jednej bazie danych, comment w innej, remark w trzeciej, a NB w czwartej. Terminologija | 2009 | 16 37
Przypadek 2: nazwa kategorii danych jest używana w różnych znaczeniach. . s“ ss Przykład: synonim kategorii danych może odpowiadać „pełnemu synonimowi”, „bliskoznacznikowi” lub „pełnemu synonimowi albo bliskoznacznikowi”. Przypadek 3: nazwy kategorii danych są „fałszywymi przyjaciółmi”. Przykład: angielskie abbreviation i acronym w rozumieniu normy ISO (ISO 12620:1999: 6-7) oraz rosyjskie ab66pesuamypa i akpornum odpowiadają sobie wzajemnie na krzyż (Kudashev 4 Hajutin 2003: 104-105). Przypadek 4: granulacja kategorii danych jest różna. Przykład: kategoria danych skrócona forma terminu jest podzielona na pięć podklas (skrót, krótka forma terminu, inicjalizm, akronim i termin ucięty) w normie ISO 12620:1999, ale w normie ISO 12616:2002 („Terminografia ukierunkowana na tłumaczenieTM”) nie ma takiego podziału. Przypadek 5: nakładanie się kategorii danych. Przykład: kategorie danych przykład i kontekst nakładają się na siebie. Niektóre przykłady są kontekstami, a niektóre konteksty mogą służyć jako przykłady, ale obie kategorie nie są identyczne. Przypadek 6: ta sama kategoria danych jest umieszczana pod różnymi kategoriami nadrzędnymi. Przykład: kategoria danych kontekst jest uznawana za dane związane z pojęciem w normie ISO 12620:1999, najwyraźniej dlatego, że konteksty mogą dostarczać dodatkowych informacji o pojęciu. Jednak częstszą funkcją kontekstów jest dostarczanie informacji o użyciu terminów i kolokacjach, dlatego „wiele baz danych klasyfikuje kontekst jako kategorię związaną z terminem” (ISO 12620:1999: 25). Przypadek 7: język, system znaków lub notacja danych różnią się. inny, rzecz. w trzecim oraz jako symbol graficzny w czwartym. Przypadek 8: identyczne lub podobne wartości kategorii danych są używane w różnych znaczeniach i różnych powiązaniach. Przykład: wartość neologism w kategorii danych dotyczącej pochodzenia terminu ISO 12620:1999 brzmi jak etykieta chronologiczna, podczas gdy w rzeczywistości odnosi się do metodologii zastosowanej przy tworzeniu terminu. 38 Igor Kudashev | Improving Compatibility of Terminological... Example: a part of speech may be coded as noun in one database, n. in
Przypadek 9: wartości klas częściowo zamkniętych różnią się z powodu odmiennej klasyfikacji. Przykład: w ISO 12620:1999 of linguistic phenomena in different languages and different traditions. etykiety opisujące wyrażenia LSP należące do „niższego stylu” obejmują rejestr slangowy i rejestr wulgarny. W przybliżeniu odpowiadają one etykietom npogdeccuonajronbiū xeapzonusm (slang zawodowy) i npogeccuonarvnoe npocmopeuue (zawodowy kolokwializm) w języku rosyjskim. W języku fińskim istnieje jednak tylko jedna kategoria, ammattislangi (slang zawodowy; zob. Sanastotyon kūsikirja 1989: 12). Należy również zauważyć, że niektóre dane mogą być wyrażane implicite w zbiorach terminologicznych. Przykład I: obecność etykiety obsolete w niektórych przypadkach i jej brak w innych w zbiorze terminologicznym oznacza, że terminy, które nie są opatrzone tą etykietą, należą do aktywnego zasobu LSP. Przykład 2: jeśli dwa lub więcej terminów umieszczono w tym samym wpisie, zwykle oznacza to, że są one synonimami lub ekwiwalentami. Wymiana lub agregacja zasobów terminologicznych może wymagać, aby takie dane niejawne zostały ujawnione. Na przykład, jeśli dane są przechowywane w postaci ontologii, a nie statycznych wpisów, wówczas informacje niejawne są zapisywane podczas „rozbierania” wpisów. INWENTARZE I KLASYFIKACJE DANYCH W NORMIE ISO ISO 12620:1999 określa zestaw kategorii danych służących do rejestrowania about synonyms and equivalents mentioned above has to be made explicit informacji terminologicznych. Nie nakazuje, jakie kategorie danych powinny być używane, lecz służy raczej jako inwentarz. Ten zestaw kategorii danych jest poszerzany w projekcie ISOcat (www.isocat.org), który dokumentuje szeroko akceptowane lingwistyczne kategorie danych. Chociaż projekt ISOcat jest niewątpliwie użyteczny dla lingwistów, którzy zyskują możliwość lepszego kategoryzowania i definiowania pojęć lingwistycznych, oraz dla projektantów banków terminologicznych, którzy mogą wybierać gotowe kategorie danych z obszernego inwentarza, jest mało prawdopodobne, aby przyniósł rozwiązanie problemu wymiany i agregacji danych oraz wyszukiwania pełnych wpisów w wielu bazach danych. Po pierwsze, nie może to powstrzymać twórców produktów terminologicznych przed klasyfikowaniem danych w odmienny sposób ani przed stosowaniem własnych kategorii danych w Terminologija | 2009 | 16 39. Po drugie, im więcej kategorii danych stosuje się w zbiorach terminologicznych, tym bardziej się one różnicują, co jeszcze bardziej utrudnia wymianę danych. Lista kategorii danych jest teoretycznie nieskończona, a w praktyce dość obszerna. Na przykład lista kategorii danych związanych z terminologią w inwentarzu ISOcat obejmuje już ponad 500 pozycji. Jedna z praktyk stosowanych w projekcie ISOcat może
zwiększyć tę liczbę wielokrotnie. Mamy na myśli przedstawianie wartości klas zamkniętych i półzamkniętych jako odrębnych kategorii danych. Na przykład wartości kategorii danych register, takie jak vulgarRegister. slangRegister itd., są obecnie przedstawiane jako kategorie danych same w sobie. Podobnie kategoria danych reliabilityCode jest dzielona na reliabilityCodel, reliabilityCode2 itd. Można mieć różne opinie na temat tego, czy jest to uzasadnione z praktycznego punktu widzenia, ale dane można organizować na wiele różnych sposobów, dlatego nie ma formalnych ograniczeń dotyczących dzielenia kategorii danych aż do klas prymitywnych, które mogą przyjmować wyłącznie wartości yes i no. Tymczasem klasyfikacja kategorii danych zaproponowana w ISO 12620:1999 jest problematyczna pod kilkoma względami. Po pierwsze, występują pewne niespójności dotyczące głównego podziału danych. Zgodnie z sekcją 6.2 (Typologia kategorii danych). kategorie danych dzielą się na trzy główne grupy: informacje terminologiczne i związane z terminami, dane opisowe oraz dane administracyjne. Jednakże w Załączniku D (Systematyczny wykaz kategorii danych) druga grupa nosi nazwę Kategorie danych związane z opisem pojęć. Jednocześnie grupa ta zawiera podgrupę Note, która „pozostaje odrębna, ponieważ może być powiązana z dowolną z pozostałych kategorii i dlatego nie może zostać podporządkowana żadnej innej konkretnej podgrupie” (ISO 12620:1999: 4). Jeśli założymy, że zamierzony podział obejmował cztery grupy: termin i informacje związane z terminem, informacje związane z pojęciem, dane administracyjne oraz Note, klasyfikacja ta nadal rodzi wiele pytań. Wymieńmy kilka z nich: -Dlaczego przykłady i konteksty są danymi związanymi z pojęciem, a nie danymi clear, however, that this realm of data categories needs proper structuring and classification in order to remain manageable and well-organized. związanymi z terminem? Por. opis kategorii danych context: „Tekst lub część tekstu, w którym występuje termin” (ISO 12620:1999: 25). -Dlaczego synonym i equivalence są danymi związanymi z terminem, podczas gdy wszystko inne, co odnosi się do znaczenia, jest danymi związanymi z pojęciem? Por. opis kategorii danych degree of equivalence: „Zakres, w jakim intencje dwóch lub większej liczby pojęć pokrywają się” (ISO 12620:1990: 21). 40 Igor Kudashev | Improving Compatibiiity of Terminological...
-Dlaczego antonim i homograf są danymi administracyjnymi, a nie danymi związanymi z terminem lub pojęciem? -Dlaczego dane audio, wideo itp. są (tylko) danymi związanymi z pojęciem? Podział danych terminologicznych na - What is the exact definition of administrative data? Why this class includes such heterogeneous categories? dane związane z pojęciem i dane związane z terminem może być użyteczny z technicznego punktu widzenia, ponieważ wspiera podejście zorientowane na pojęcia, które zmniejsza liczbę relacji między terminami poprzez powiązanie terminów synonimicznych z tym samym pojęciem. Jednakże taki podział ogólnie, a w szczególności jego implementacja w normie ISO 12620:1999, może stanowić wyzwanie dla zwykłych użytkowników baz danych terminologicznych — tłumaczy i ekspertów dziedzinowych. Rzeczywiście, nie jest łatwo zrozumieć, dlaczego synonimów należy szukać w danych związanych z terminem, antonimów w danych administracyjnych, a przykładów w danych związanych z pojęciem. Zwykli użytkownicy pracują z terminami — słowami i połączeniami wyrazowymi, dlatego naturalniej jest im mówić o znaczeniu terminu, synonimach terminu, przykładach użycia terminu itp. Oznacza to, że klasyfikacja kategorii danych mająca na celu zapewnienie wyszukiwania pełnych wpisów w wielu kolekcjach powinna być zorientowana na terminy, intuicyjnie zrozumiała i oparta na powszechnie stosowanych kategoriach językowych. NIWELOWANIE NIEZGODNOŚCI MIĘDZY KATEGORIAMI DANYCH Problem niezgodności między kategoriami danych można rozwiązać za pomocą mapowania. Jeśli rozbieżności mają charakter nominalny, na przykład gdy nazwy kategorii danych różnią się lub ta sama zawartość jest przedstawiana w odmienny sposób, można zastosować bezpośrednie mapowanie między kategoriami danych. Po zastosowaniu bezpośredniego mapowania dane w zagregowanym zasobie można przeszukiwać z taką samą precyzją jak w oryginalnych bazach danych. Bardziej znaczące różnice między kategoriami danych wymagają znalezienia wspólnego mianownika poprzez mapowanie między klasyfikacjami zbiorów kategorii danych. Zastosowanie wspólnego mianownika nieco zmniejsza precyzję wyszukiwania, ale jest to jedyny sposób na zapewnienie wspólnego wyszukiwania zasobów terminologicznych o różnej strukturze. Jeśli użytkownik nie jest gotowy poświęcić precyzji wyszukiwania, musi przeprowadzić oddzielne wyszukiwanie w każdym indywidualnym zbiorze. Podobnie jak w przypadku wymiany danych w ogólności, stosowanie formatu pośredniego, tj. pewnej klasyfikacji kategorii danych pełniącej funkcję pomostu, jest w dłuższej perspektywie bardziej skuteczne niż wielokrotne mapowanie między różnymi klasyfikacjami. Terminologija | 2009 | 16 41 Ogólne zasady klasyfikacji kategorii danych przeznaczonej do pełnienia funkcji wspólnego interfejsu między innymi klasyfikacjami są następujące: 1. Ponieważ zakłada się, że klasy klasyfikacji będą służyć jako wspólne mianowniki, muszą znajdować się na wyższym poziomie abstrakcji niż większość „prymitywnych” kategorii danych, które nie są dalej dzielone. Jednocześnie poziom abstrakcji nie może być zbyt wysoki, ponieważ użytkowni-
cy nie byliby zainteresowani klasyfikacją, która jest zbyt ogólna. W praktyce klasyfikacja o dwóch poziomach abstrakcji jest wystarczająca. 2. Klasyfikacja powinna obejmować wszystkie typy wyrażeń LSP, które są zazwyczaj opisywane w bazach danych terminologicznych, w tym elementy terminów, nazwy własne, nomenklaturę, frazeologizmy itp. 3. Klasyfikacja powinna zawierać wyłącznie te kategorie danych, które są bezpośrednio związane z opisem wyrażeń LSP. Opis aspektów technicznych i administracyjnych (np. nośnika, kodowania, źródeł, wiarygodności itp.) jest innym zadaniem. 4. Klasyfikacja powinna być hierarchiczna, ale na tym samym poziomie abstrakcji należy dopuścić kilka podstaw podziału. 5. Klasyfikacja powinna być rozszerzalna, tj. powinna zawierać kategorię „inne” na każdym poziomie hierarchii. Zasady te należy połączyć ze wspomnianym powyżej wymogiem przyjazności dla użytkownika. Naszym zdaniem klasyfikacja oparta na funkcjach językowych danych jest pod tym względem szczególnie silnym kandydatem. W klasyfikacji pomostowej opartej na funkcjach językowych uwaga zostaje przeniesiona z nazw kategorii danych na funkcję lub funkcje zawartych w nich danych. Można tu dokonać porównania z biblioteką posiadającą katalog alfabetyczny i rzeczowy. Wyszukiwanie według nazw kategorii danych przypomina wyszukiwanie za pomocą katalogu alfabetycznego. Tytuł daje pewne wskazówki co do zawartości książki, ale czasami może wprowadzać w błąd. Ponadto użytkownicy nie są w stanie odgadnąć wszystkich możliwych tytułów obejmujących określony temat. Katalog alfabetyczny jest przydatny w przypadkach, gdy użytkownicy dokładnie wiedzą, jaki element lub jakie elementy chcą zlokalizować. Większość użytkowników bibliotek rozpoczyna jednak wyszukiwanie od katalogu rzeczowego, ponieważ z góry nie wiedzą, jakie elementy dotyczą interesującego ich tematu. Portal terminologiczny, który agreguje wiele kolekcji terminologicznych42 Igor Kudashev | Improving Compatibility of Terminological...
z różnymi zestawami kategorii danych stawia przed użytkownikami ten sam problem co księgozbiór książek na półkach biblioteki. Użytkownicy wiedzą, jakiego rodzaju informacjami są zainteresowani (gramatyką, znaczeniem, użyciem itd.), ale niekoniecznie wiedzą, w jakich kategoriach danych można znaleźć te informacje. W różnych kolekcjach terminologicznych podobne typy danych mogą znajdować się w różnych polach danych. Na przykład informacje o zasięgu geograficznym wyrażenia LSP można znaleźć w takich polach jak użycie, etykieta regionalna, symbol języka itd. Jeśli wyszukiwanie opiera się na funkcjach językowych danych, użytkownicy nie muszą przejmować się dokładnymi nazwami kategorii danych. Wystarczy, że określą, iż szukają informacji o zasięgu geograficznym, znaczeniu lub synonimach, a system zarządzania terminologią zlokalizuje i wyświetli pełne lub skrócone hasła w różnych bazach danych zawierających określony typ informacji. Wyszukiwanie według funkcji może i powinno być uzupełniane wyszukiwaniem według nazw pól przez tych użytkowników, którzy dokładnie wiedzą, w jakich polach chcą szukać. informacja. Na przykład, przykład jest typowym polem wielofunkcyjnym, które może zawierać informacje o formie, znaczeniu i użyciu terminu, w różnych proporcjach. Każdą Data fields, like library items, may contain different kinds of linguistic kategorię danych można opisać jako pełniącą jedną lub kilka funkcji. Powinna również istnieć możliwość określenia stopnia, w jakim dana kategoria danych odzwierciedla określone funkcje. Cecha ta może być wyrażona słownie (np. funkcja podstawowa i drugorzędna) lub liczbowo (np. 0—-100%). Najprostszym sposobem odwzorowania konkretnego zbioru kategorii danych na konkretny typ jest ujednolicenie go i utworzenie prostej tabeli odpowiedniości. Bardziej precyzyjne, ale także bardziej skomplikowane odwzorowanie pozwalałoby kompilatorom określać odchylenia poszczególnych pól danych the intermediate classification is to consider the contents of data fields of od wartości zastosowanych w globalnej tabeli odpowiedniości. Na przykład konteksty zwykle dostarczają informacji o użyciu i znaczeniu terminu. Rozsądne jest uwzględnienie tych rodzajów informacji w globalnej tabeli korespondencji, ponieważ odnoszą się one do każdego pola kontekstu. Jednakże niektóre konteksty mogą również zawierać informacje encyklopedyczne. To sporadyczne wykorzystanie informacji encyklopedycznych może być oznaczane lokalnie, na poziomie pola. Terminologija | 2009 | 16 43
KLASYFIKACJA KATEGORII DANYCH NA PODSTAWIE FUNKCJI JĘZYKOWYCH DANYCH Ponieważ wyrażenia LSP są znakami językowymi, informacje na ich temat można podzielić na informacje dotyczące ich formy, znaczenia, użycia, relacji z innymi jednostkami, pochodzenia i rozwoju. Poniżej każda z tych klas została szczegółowo opisana, a także podano przykłady należących do nich danychDane dotyczące formy Wyrażenia LSP mają dwie formy —pisemną i ustną. Ponadto dane dotyczące formy wyrażenia LSP można podzielić na trzy klasy: dane dotyczące formy kanonicznej; dane dotyczące tworzenia jednostki; dane dotyczące vided. Please see Appendix 1 for the compact version of the classification. odmiany jednostki. DANE DOTYCZĄCE FORMY KANONICZNEJ Forma kanoniczna jest formą, w której hasło podawane jest w bazie danych. Służy jako „reprezentant” innych form. Na przykład w większości języków europejskich formą kanoniczną rzeczowników jest mianownik liczby pojedynczej, a czasowników bezokolicznik czasu teraźniejszego. Jednak zasady wyboru formy kanonicznej różnią się w poszczególnych językach i tradycjach leksykograficznych. Oto kilka przykładów danych dotyczących zapisu formy kanonicznej: rodzaj wyrażenia na podstawie jego zapisu (np. forma pełna, forma skrócona, symbol, wzór itp.); pisownia formy; warianty pisowni formy; dzielenie wyrazów, Przykłady danych związanych z ustaloną formą ustną: typ wyrażenia ze względu na jego formę ustną (np. inicjalizm, akronim); wymowa; warianty wymowy danej formy; sylabizacja. Jak można zauważyć, niektóre kategorie danych mogą odnosić się zarówno do form pisemnych, jak i ustnych. Na przykład wskazanie, że dane wyrażenie jest inicjalizmem, tj. formą skróconą utworzoną z pierwszych liter pełnego terminu, w której litery te wymawia się osobno (np. United Nations —UN), dostarcza informacji zarówno o formie pisemnej, jak i ustnej. Ponadto może ono 44 [gor Kudashev | Improving Compatibility of Terminological- ... -
4.1.8. Data related to register restrictions. <termUsage: restrictions: register > 4.1.9. Data related to professional group restrictions. <termUsage: restriccje: Grupa zawodowa > 4.1.10. Dane dotyczące ograniczeń kombinatorycznych. <termUsage: restrictions: combinatory> 4.1.11. Dane dotyczące ograniczeń zgodności. <termUsage: restrictions: compliance> 4.2. Dane dotyczące częstotliwości użycia. <termUsage: frequency> 5. Dane dotyczące relacji systematycznych. <termRelations> 5.1. Dane dotyczące relacji synonimicznych. <termRelations: synonymousRelation> 5.2. Dane dotyczące relacji antonimicznych. <termRelations: antonymousRelation> 5.3. Dane dotyczące relacji homonimicznych. <termRelations: homonymousRelation> 5.4. Dane dotyczące relacji paronimicznych. <termRelations: paronymousRelation> 5.5. Dane dotyczące relacji rodzajowych. <termRelations: genericRelation> 5.6. Dane dotyczące relacji partytywnych. <termRelations: partitiveRelation> 5.7. Dane dotyczące niehierarchicznych relacji ontologicznych. <termRelations: non-hierarchicalOntologicalR elation> 5.8. Dane dotyczące relacji równoważności. <termRelations: equivalenceRelation> 6. Dane dotyczące pochodzenia i rozwoju. <termOriginAndDevelopment > 7. Inne rodzaje danych związanych z opisem wyrażenia LSP <termOtherRelated Data > ZAŁĄCZNIK 2. PRZYKŁAD MAPOWANIA NIEKTÓRYCH KATEGORII DANYCH NORMY ISO 12620:1999 NA KLASYFIKACJĘ FUNKCJONALNĄ DANYCH TERMINOLOGICZNYCH Zob. Załącznik I, gdzie wyjaśniono formalną reprezentację kategorii użytych dla zwięzłości. Znak zapytania po kategorii danych oznacza, że obecność określonego rodzaju danych zależy od interpretacji kategorii danych. Jeśli podkategorie można mapować dokładnie w taki sam sposób jak ich kategorię nadrzędną, opisuje się wyłącznie kategorię nadrzędną. Terminologija | 2009 | 16 51
Ze względu na ograniczenia miejsca omówiono tylko pierwszą podgrupę kategorii danych z normy ISO 12620:1999. A.1 termin Note: term (headword) lies outside the scope of classification which covers data categories related to the description of LSP expressions. However, Technicznie kategoria danych „termin” jest identyczna z pisemną formą terminu. Klasyfikacja funkcjonalna: nie dotyczy lub <termForm: writtenForm> A.2.1 typ terminu Uwaga:w normie ISO 12620:1999 ta kategoria obejmuje różne rodzaje wyrażeń LSP i może zawierać różne typy danych. Więcej informacji zawierają podkategorie. A.2.1.1 termin główny Uwaga: informacje o strukturze hasła nie są danymi związanymi z opisem wyrażeń LSP. Jednakże ta kategoria pośrednio odzwierciedla preferencję. Klasyfikacja funkcjonalna: nie dotyczy lub <termUsage: restrictions: compliance> A.2.1.2 synonim Uwaga: w opozycji do terminu głównego hasła ta kategoria odzwierciedla preferencję. Jej podstawową funkcją jest jednak odzwierciedlanie relacji synonimicznych. Klasyfikacja funkcjonalna: <termRelations: synonymousRelation>; <termUsage: restrictions: compliance>? A.2.1.3 quasi-synonim Uwaga: takie as samo jak poprzednie. Klasyfikacja funkcjonalna: <termRelations: synonymousRelation>; <termUsage: restrictions: compliance>? A.2.1.4 międzynarodowy termin naukowy Uwaga: w zależności od interpretacji tej kategorii i jej zawartości ta kategoria danych może dostarczać informacji o zgodności, ograniczeniach językowych. pochodzenie i rozwój. Klasyfikacja funkcjonalna: <termUsage: restrictions: compliance>; <termUsage: restrictions: language>? ; <termQOriginAndDevelopment>? A.2.1.5 nazwa zwyczajowa Uwaga: nazwa zwyczajowa jest synonimem międzynarodowego terminu naukowego używaneis go w in dyskursie ogólnym. Ta kategoria danych może dostarczać informacji o ograniczeniach związanych z rejestrem, zgodnością i grupą zawodową. 52 Igor Kudashev | Ulepszanie Kompatybilność of Terminologiczne...
Klasyfikacja funkcjonalna: <termUsage: restrictions: register>; <termUsage: restrictions: compliance- >; <termUsage: restrictions: professional Group>? A.2.1.6 internacjonalizm Uwaga: w zależności od zawartości ta kategoria danych może dostarczać informacji związanych z ograniczeniami językowymi, tworzeniem terminów, ich pochodzeniem i rozwojem. Klasyfikacja funkcjonalna: <termUsage: restrictions: language>; <termForm: termFormation>7; <termQriginAndDevelopment>? A.2.1.7 forma pełna Uwaga: ta kategoria danych dostarcza informacji o typie terminu na podstawie jego formy. Klasyfikacja funkcjonalna: <termForm: term Type> A.2.1.8 skrócona forma terminu Uwaga: w zależności od zawartości ta kategoria danych i wszystkie jej podkategorie (A.2.1.8.1 skrót. A.2.1.8.2 krótka forma terminu, A.2.1.8.3 inicjalizm, A.2.1.8.4 akronim i A.2.1.8.5 termin ucięty) mogą dostarczać informacji związanych z typem terminu na podstawie jego formy, formą ustną: tworzeniem terminu, pochodzeniem i rozwojem. Klasyfikacja funkcjonalna: <termForm: termType>; <termForm: oralForm>7, <termForm: termFormation>? : <termOriginAndDevelopment> A.2.1.9 wariant Uwaga: w zależności od zawartości ta kategoria danych może dostarczać informacji o preferencji, tworzeniu terminu, pochodzeniu i rozwoju. Klasyfikacja funkcjonalna: <termUsage: restrictions: compliance>; <termForm: termFormation>? ; <termQriginAndDevelopment>? A.2.1.10-A.2.1.14 (forma transliterowana, forma transkrybowana, forma zromanizowana, symbol i wzór) Uwaga: te kategorie danych dostarczają informacji o typie terminu na podstawie jego formy. Klasyfikacja funkcjonalna: <termForm: termType> A.2.1.15-A.2.1.- 17 (równanie, wyrażenie logiczne, kategorie zarządzania materiałami) Uwaga: te jednostki nie mogą być hasłami w bazach danych terminologicznycFunctional classification: not applicable. h. A.2.1.18 jednostka frazeologiczna Uwaga: w normie ISO 12620:1999 ta kategoria jest podzielona na trzy podkategorie: kolokacja, wyrażenie utarte i wyrażenie synonimiczne. Kolokacji nie można zaliczyć Terminologija |
2009 | 16 53 do jednostek frazeologicznych, ponieważ nie odpowiada ona definicji jednostki frazeologicznej podanej w normie. Kategoria frazy synonimicznej wydaje się zbędna. Tę samą informację można wyrazić za pomocą dwóch innych kategorii danych: fraza stała i synonim. Functional classification: not applicable. A.2.1.18.1 kolokacja Uwaga: ta kategoria danych dostarcza informacji o ograniczeniach kombinatorycznych. Klasyfikacja funkcjonalna: <termUsage: restrictions: combinatory> A.2.1.18.2 fraza stała Uwaga: ta kategoria danych dostarcza informacji o typie terminu poprzez odpowiedniość jego znaczenia względem jego formy. Klasyfikacja funkcjonalna: <termMeaning: termType> A.2.18.3 fraza synonimiczna Uwaga: jak stwierdzono powyżej, ta kategoria jest prawdopodobnie zbędna. Jeśli jest używana, dostarcza informacji o typie terminu poprzez odpowiedniość jego znaczenia do jego formy, a także o relacjach synonimicznych. Klasyfikacja funkcjonalna: <termMeaning: termType>; <termRelations: synonymousRelation> A.2.1.19 tekst standardowy Uwaga: teksty standardowe nie mogą być hasłami w bazach danych terminologicznych. Functional classification: not applicable. POPRAWA KOMPATYBILNOŚCI ZBIORÓW TERMINOLOGICZNYCH POPRZEZ ZASTOSOWANIE KLASYFIKACJI KATEGORII DANYCH Jedną z tendencji rozwoju zasobów informacyjnych, a zwłaszcza terminologicznych, jest łączenie odrębnych baz danych w duże portale oraz tworzenie interfejsów między takimi portalami. Przykładem może być EuroTermBank (http://www.curotermbank.com- ). Wraz ze wzrostem ilości informacji i wymagań użytkowników stawianych takim produktom rośnie potrzeba zapewnienia rozszerzonego wyszukiwania, obejmującego wszystkie pola artykułów słownikowych, oraz możliwości prezentowania tylko tych kategorii informacji, które w danym momencie interesują użytkownika. Do rozwiązania tych zadań potrzebna jest klasyfikacja kategorii danych, którą można byłoby stosować jako „wspólny mianownik” baz terminologicznych o różnej strukturze. Ważnym wymaganiem wobec takiej klasyfikacji jest jej prostota i przejrzystość dla zwykłych użytkowników produktów terminologicznych. Omawiana w artykule klasyfikacja oparta na funkcjach danych lingwistycznych mogłaby stać się takim „wspólnym mianownikiem® >4 Igor Kudashev | Improving Compatibility of Terminological...
Bazy danych wieloklasowych jako środek poprawy kompatybilności kolekcji terminologicznych. Jednym z głównych trendów rozwoju zasobów informacyjnych w ogóle, a zasobów terminologicznych w szczególności, jest łączenie rozproszonych baz danych w duże portale i tworzenie między nimi interfejsów. Przykładem może być EuroTermBank (http://www.eurotermbank.com). W miarę wzrostu ilości informacji i wymagań użytkowników wobec podobnych produktów rośnie potrzeba zapewnienia rozszerzonego wyszukiwania, obejmującego wszystkie pola słownikowych artykułów, a także możliwości wyświetlania tych kategorii informacji, które w danym momencie interesują użytkownika. Te zadania wymagają wieloklasowej klasyfikacji informacyjnych kategorii, która mogłaby służyć jako podstawa do oznaczania terminologicznych baz w ramach wspólnej struktury. Niemniej jednak wymaganiem wobec podobnej klasyfikacji pozostaje jej prostota i zrozumiałość dla prostych użytkowników produktów terminologicznych. W artykule opisano jednego z możliwych kandydatów do roli „ogólnego oznacznika” — klasyfikację opartą na lingwistycznych funkcjach danych. Nadesłano 2009-10-14 Igor Kudashev University of Helsinki Centrum Kształcenia Ustawicznego Palmenia PO. Skr. poczt. 239 (Paraatikentti 6) FIN-45100 Kouvola, Finlandia E-mail: igor. [email protected] Terminologija | 2009 | 16 55
