scieee AI-readable full text Open interactive document viewer

Automatinis švietimo ir mokslo terminų nustatymas lingvistiniais metodais

Erika Rimkutė

Full text

54 Erika Rimkutė | Automatischerschaltungirmoksloterminen | nustatymaslingvistiniaismetodais Automatische Feststellung Bildung und Wissenschaft Terminen linguistischlichen Methoden ERIKA RIMKUTė VytautoDidžiojouniversität ESMINIaI WORŽIaI: tekstyns, Bildung und Wissenschaft Termine, lingvistische Methoden, titraštliche Form, gramatische Form ĮVADAS Tekstynų lingvistika und computerinė lingvistika in Lituanien schon rechniert die zweiten Jahrzehntį dieses Wissens Zweigs Anfangs kann man mit Vytautas Großjoegos Universitäts Komputerinės lingvistikos centro (žr. http://tekstynas.vdu.lt) Einrichtungim 1994 m. Parengta ein paar tekstynų, automatischen Sprachanalyse und Synthese-Programms1. Dennoch textyner Linguistiken Prinzipien noch spärlich angewendet Terminologie und Terminografie. 2010 m. im Artikel Lietuviųkalbosterminųautomatischennetzymogalimybės (Rimkutė 2010) überblicktet, wie viele Texyne verwendet werden beim Zusammenstellen verschiedener Terminologijas darbus in Lituanien. litauischen Sprache Terminen kann man in einigen internationalen Datenbanken, Terminenbanken finden; ziemlich bereitta elektronischer Terminynen oder Datenbasien2, aber alle litawiški elektronischen Terminynai im Wesentlichen sind zu Terminen Wortynen Grundlage. Viele litauischischer Wortynen hergestellt basierend ziemlich kleineren Texten Mengen, kalbine intuicija, taigi kann man behaupten, dass Lituanien immer noch vorherrscht preskriptivusis Terminen Gewinnungs und Beschreibungs Methode. Straipsnyje will präsentieren Bildung und Wissenschaft Terminen fest und beschreiben der Entwurf3 des Projekts, die im Zusammenhang mit automatischem terminen nu1 Aussamų lituanistinių Ressourcen, bereitten bis 2011 m., einverwadet können Sie finden http://sruoga.vdu.lt/lituanistiniaiskaitmeniai-istekliai-lituanistiniu-istekliu-sarasas. 2 Hinweise angegeben im erwähnten Artikel. 3 Dies ist der vom litauischen Wissenschaftsausschuss finanzierte Projekt Švietimoirmoksloterminųautomatischeridentifikation (ŠIMTAI 2) (sutarties nr. LIT-2-44). Dieses Projekt wichtigste Ziele: 1) zu erstellen und auszuprobieren automatischen Terminenerkennung litauischer Sprache tekstyne Methodologie als neues Terminijeverhandlungs Instrument zu, 2) zu erstellen specialen Bildung und Wissenschaft tekstyny, 3) spezialioho Texynogrundgrundgrundum zu erarbeiten erkläramątiges Bildung und Wissenschaft terminyn Wörzny und dieser Reihen ontologiją. 55Terminology | 2012 | 19 statymu, ihren Beschreibung. Automatischem Begriffsfestlegungsschwerpunkt entstand die Idee, bemerkend, dass die bestehenden Normandamieji Quellen4 sind ziemlich neišvollständig, wie viel orientuoti į pačius bendriausius švietimo politikos terminus ir beveik nė nicht umfassen wissenschaftlichen Politikbereichen, in ihnen nespėjama zu geben neuen, aus dem praktischen Arbeitskylantigen Terminen; Terminen normintojai nespėja ihre sunorminti. Traditioneller Norminimation ist dennoch ziemlich subjektivus, daher vartoseną und Normen braucht begründet textyner Linguistiken Methoden. Tad in diesem Artikel wird geschrieben werden über Lithuanien noch ziemlich neues Terminen auswahl und Analyses Verfahren, der könnten gerokai erleichternde Terminologäu Arbeit, bieten mehr Objektivität. AUTOMATIS TERMIN NUSTATYMAS Um automatisch festzustellen und definieren zu können, die Terminologie eines bestimmten Bereichs, wählte man einen sektor wissenschaft und erziehung. Gesammelt 4 Mio. Wortes umfangs Bildung und Wissenschaft (Schemisch ŠM) Textynos, das beim Zusammenstellen orientiotet sich in zwei Hauptthemen: 1) wissenschaftliche Forschungen und 2) ugdymą. Aus wissenschaftlichen Forschungsrahmen konzentriert sich die Forschungspolitik und der Hochschulpolitik. Aus dem ugdymo Bereich genommen ist povidurischer Erziehung, und die größte Aufmerksamkeit steht dem hoßstem Schluße und dem Weiterbildungs(si). Wie zusätzlicher sektor eingeschlossen und professioneller Training. Sudarnd tekstyn gesucht zu umfägen verschiedener Genrs und Typen Texte, z. Gesetze, andere höchsten Regierungseinrichtungen politinen Dokumente (Lietuvos Republikas Seimo, Lietuvos Respublikos Vyriausybės, Lietuvos Respublikos Prezidento nutarimus, pareiškimus, Konstitucinio Teismo Entscheidungen und kt.); Strategieunterlagen; Gesetzesumsetzungsakte; wissenschaft und bildungsmittelpolitik Umsetzung Institutionen und Projekt-Dokumenten; wissenschaft und Studieninstitutionen Dokumente; Informationspublikationen, Zustandsstudien des Bereichs, Bewertungen, Möglichkeitenstudien; pressudusmeldungen, Diskussionsmaterial. Turint repräsentativer, gut subalansiertes Untersuchamoses Flächentextyn5, kann automatisch festgelegt werden. Zu diesem Zweck verwendet häufig4 Man kann erwähnen die Republik Lithuaniens terminen bank, L. Jovaišos Encyclopedinįedukologijosterminųžodyną (2007), TESE tezaurą [žiūrėta 2012-05-20], zugängig per internet: http://eacea.ec.europa.eu/education eurydice/documents/tese/pdf_teselt_005_alphabetic.pdf. 5 Texstyns Representativität, Größe eine von schwierigsten Texstyns linguistischen Fragen. Meint, dass ŠM tekstyns ziemlich gut repräsentiert gewählte Bereich. Mehr umstritten wegen seiner Größe, z. Englischitalischer Sprachen Rechtstextyn BononiaLegalCorpus (BOLC) ist etwa 18 Mio. Wortes Größe (Rossini Favretti et al. 2001). 56 Erika Rimkutė | Automatischerschaltungirmoksloterminen mi drejopi | nustatymaslingvistiniaismetodais Methoden: statistische, lingvistische und hybridische statistischen und lingvistischen Methoden Modelle. Erfolgen ein paar Experimentei, denen gefolgt wurde, zu bestimmen die geeignetsten Termins feststellungs Methoden. Geprüft wurden folgende statistische Methoden: 1) WordSmithTools Funktion KeywordClusters; 2. die automatische Lernmethode KEA; 3) die Kolokationen-Aufnahme-Methode mit Verwendung des Werkzeugs LICE (plačiau siehe Grigonytė et al. 2011). Nach Erledigung dieser Untersuchungen, gemachtet die Schluss, dass angenehmsten litauischen Sprachen sind lingvistische Methoden. Weiterum kurz erklärt die Besonderheiten dieser Methoden. Der Hauptvorteil statistischer Begriffsfindungssysteme ist das, dass jenen keine großen Datenbanken mit Menschen angegebenen Begriffsbeispielen brauchen. Außerdem, sie sind unabhängig von Sprache. Statistischen Systemen wichtiges Betriebsprinzip beruht darauf, dass oft zusammen verwendete Wörter sind verbunden und trakttuotini als mögliche Termine. Lingvistische Methoden basieren meistens auf morfologischen Zeichen, Wortschaffen. Damit es möglich sei angewiesen linguistische Methoden, erforderlichen morfologisch anotuotieren Texyne. Benutzend linguistische Terminäbestimmungsmethoden, wird meistens festgestellt, welche grammatischer Formen der können sein Termine. Nimmt man grammatikalische Formen, muss berücksichtigt werden in den Sprachen besonderheiten. Beispielsweise, für analytische Sprachen ist wichtig zu bestimmen Terminä Sprachanteil. litauischer Sprache terminen Sprache Teil ist auch sehr wichtig, aber braucht wissen, und welche anderer grammatischen Kategorien Informationen notwendig automatisch feststellend Terms. Es ist bemerkt worden, dass litauischen Sprachen noch wichtigen zahlens, humornier Kategorien, und gimines Kategorie, automatisch bei der Festlegung der Termine, nicht besonders bedeutend ist6. Tyrinėtojų (pvz., Bowker 2002) festgestellt, dass fast unmöglich anzupassen anderen Sprachen geschaffener Terminus stellenden Instrumenten, besonders jener, die linguistische Methoden verwendet. Beispielsweise, tipiška englische Sprache terminen Struktur ist bdv. + dkt., dkt. + dkt., und franzūzischer Sprachen eigentliche Modelle ist dkt. + bdv., dkt. + prl. + dkt. Daher um linguistische Begriffserkenntnismethoden anzuwenden, braucht man eine Programm zu erstellen, in der berücksichtigt würde an das gewisse Sprachgrammatische System. Weiterhin in diesem Artikel wird präsentiert Versuche automatisch festzustellen litauischer Sprache Terminen indem man linguistische Methoden. Atkreiptinas 6 Giminė wird aktuall in solchen Fällen, wo entsteht linksnių synkretism, beispielsweise., wissenschaftdarbuτών: automatische morfologische analysis program form der Arbeitnehmer atpažieht und als människös, und als weeriškosios gimimokslodarbuotoja. Wie Termin sollte werden gegeben werden mänriškosios giminės forma, t. y. wissenschaftdarbuτής. nės daiktavardžio daugiskaitos kilmininką, todėl kaip antraštinę formą nurodo ir mokslodarbuotojas, ir 57Terminologija | 2012 | 19 Aufmerksamkeit, dass den möglichen Terminen (toliau GT)7 zu bestimmen verwendete Programm entwickelt das VDU Kompuuterinės lingvistikos centre. In diesem Programm verwendet wurden linguistische Regeln, in denen angegeben, welche Sprachenteilverbindungen oder Wortformen analuotini. Wie erwähnt, unter Verwendung linguistischer Methoden, erforderlichen morphologisch annotieren Texte, daher zunächst gesammelt ŠM Texyns wurde morphologisch annotiert unter Verwendung VDU Kompuuterischer Linguistikos Centre entwickeltes morfologisches anotatoriů8. Hier gibt es ein Beispiel automatisch morphologisch annotierten Textes: <word=PROJEKT lemma=projektas type=dktv vyr.gim dgsk K>9 <space> <word>FINANSAVIMO lemma=finansierung type=dktv vyr.gim vnsk K> <space> <word>SLYG lemma=sąlyga type=dktv mot.gim dgsk K> <space> <word=APRAŠAS lemma=aprašas type=dktv vyr.gim vnsk V> <p> <word=I lemma=I type=rom skaič> <sep=.> <space> <word=BENDROSIOS lemma=bendras type=bdvr teig nelygin.l įvardž mot.gim vnsk K> <space> <word=NUOSTATOS lemma=nuostata type=dktv mot.gim vnsk K>10 <p> <number=1> <sep=.> <space> <number=2007> <sep=> 7Verschiedeus Methoden verwendende automatisch Terminus feststellende Programme erkennen meistens mögliche Termine, terminus kandidatus (zr. Zeller 2005), obwohl zwischen automatisch bestimmten Wörtern oder Verbindungen oftmals passt es völlig neprasminger Wörter samplaiken oder sinnvoller neterminier Wörterverbindungen, z. Kolokationen. Aus diesen Wörtern und Verbindungen tikruosius Terminus legt normalerweise ein gewissres Flächenexpert. 8 Ausführlicher siehe http://tekstynas.vdu.lt/page.xhtml?id=morphological-annotator-how-to-use. 9 Word weist die spezifische im Text pavurtete Wortform zu, lemma heiratliche Form (lemą), type umfangreiche morfologische Informationen. 10 Atkreiptene Aufmerksamkeit, dass morphologisch anotuert wird automatisch, deshalb passt es und Fehlern, z. In diesem Beiszdy je wegen linksnių synkretismus angegeben falsche Form: stattin moteriškosios giminės mehriskaitos namenszeichners angegeben moteriškosios giminės vienaskaitos kilmininkas. Ausführlicher über Untecksslum, entstandenusieuse wegen morfologischen anotatoriaus specifikas, siehe. kapitel AutomatischenTerminnetztymoproblemos. 58 Erika Rimkutė | Automatischerschaltungirmoksloterminen | nustatymaslingvistiniaismetodais <number=2013> <space> <word=m lemma=m type=sntrmp> <sep=.> <space> Automatisch GT stellenden Programms Funktionsprinzip kurz und normalerweise wäre es möglich unsagten so: analysiert wird morfologisch sužymėtas Text, sucht man verbunden Wörzer chaininėlių. Ermasis Kriterium nach sužymėtas Text, sakinių skirtis atrückti nepertrauktus Wortzusammnungen. Teil der Text skisschen sind markiert als Schistzeichen, andere können sein markiert als HTML Markierungen, z. B. Absatzes Markierung <p>, Spaces zwischen Worten Markierung <space> und so. Folglich muss taisykles, kurios būtų pritaikytos programoje. Nustatant švietimo ir mokshergestellt werden einiger linguistischer lo terminus, hergestellt und angepasst die folgenden Grundregel11: 1. Analysiert nur die Verbindung, in denen gibt es wenigstens einen Daiktavardis. Wenn GT ist zweijährig oder ilgeser, ist es andere Sprachenteile, die sich in solcher Verbindung befinden, können sein Eigenschaften und Teilhabe. 2. Analysieren nur jene Verbindungen, deren letztes Wort unbedingt sein muss Dikttavordis12. 3. Bviżodžích GT neanalyzieren überprüfe daiktavardžiai, da sie meisteneinfügen in Personen, Unternehmen, Institutionen und kt. Namen, welche nicht likytini terminen der Reihen (nimmtend ilgesnius terminus enthalten in GT terminen Listen und überprüfe daiktavardžiai). 4. Aus Verbindungen werfen Ziffern aufzuschreiben Zahlen. 5. Neanalysiert jene Wörter oder Verbindungen, die bilden mindestens ein morphologischen Notatoriaus nichterkanntes Wort. Das sind häufig Fremdsprachen intarphi, mit Falsch geschriebenen Wörter, sutterėjuse Wortformen13. Anwendend solcher Regeln, wurden festgestellt GT, aus denen Experten14 auswählte ŠM terminus. Diese Begriffe analysieren ausführlicher, ihre Struktur beschrieben in Kapitel Schaltungirmoksloterminenstruktura. 11 Taisyklä sind universalios und im Wesentlichen gut für jeden Bereichs Terminen automatisch festzustellen. 12 Möglich und andokia Terminų Struktur, beispielsweise., daiktavardis mit prišlieta bendratimi, daiktavardis mit prielinksnine konstruktion. Dieses Typ Terminen gibt es kaum, daher sie neanalyzieren. Zukunfts fortsetzend Untersuchung sollte paanalysiert und in diesem Artikel nicht eingeschlossen Terminų struktūras. 13 Beim Anwenden gewisser GT-Auswahlbeschränkungen kann man wertvolle Informationen verlieren. In dieser Studie nicht gezählt, wie viel nichterkannt tatsächlicher Termin. Bei der Verwendung automatischen Begriffserkenntnisprogrammen, braucht sich zu versetzen mit dem, dass Teil Informationen wird verloren werden, aber automatisch bestimmte Informationen werden leichter verarbeitet, erhalten Verbindungen werden gramatisch regelinglicher. 14 Dieser Projektexpert ist lituanistas Giedrius Viliūnas, der mit großer pedagogischer, administrativer, managerialer Erfahrung im Bereich Bildung und Wissenschaft. 59Terminologie | 2012 | 19 TERMINŲ ATRANKA Anwendend im früheren Kapitel beschriebene Methode, Programm und darin verwendete Regeln, wurde festgestellt etwa 11 taus. GT, zusammytų von einem iki penkiolikos žodžių15. Susidūrus su tokiu dideliu duomenų kiekiu, wurde angewiesen mehrere Selektionskriterien. Ermas Ternengröße: berücksichtigt man in den allgemeinen Terminenstruktur-Tendenzien, beschwörte zu analysieren ne ilgesnius noch septyniazodžius Terus. Zweit Kriterium Terminen pauchtojungshäufigkeit. Es gewählt wurde weiter ausführlicher zu analysieren Einwörzungen GT, die ŠM tekstyne pauerten nicht weniger als 20 Mal; zweijodžius GT, die gewickelt nicht weniger als 10 Mal; trižodžius GT, pavewoten nicht weniger als 8 Mal; keturžodžius GT, gefahren mindestens 6 Mal; penkiažodžius GT, deren Häufigkeit mindestens 4 mal; sechšiažodžius GT, pavartoten mindestens 3 Mal, und septyniažodžius GT, deren Häufigkeit nicht geringer als 2 Mal. Automatisch rechnierend GT erscheinungsfrequenz, beruhtasi Wörtern titraustigen (žodynischen) Formen, t. y. lemmi. Bei Anwendung dieser Auswahlkriterien festgelegt Termine untersuchen ausführlicher (ihre Struktur wird in einem anderen Kapitel vorgestellt). Expertui überprühend nach zuvor gesprochenen Kriterien festgelegten GT, ausgesucht echte ŠM Termine. Ißer Verteilung nach Länge angegíd 1 in Tabelle. Tabelle 1. Bildungs und Wissenschaftstermin-Ausbreitung nach Längeį Terminus bildenden Terminen % Wortzahl Menge, Anzahl Terminen Menge, 1155 19,87 2474 60,77 3125 16,03 422 2,82 5 4 0,51 Von insgesamt 780 100,00 15 Hier finden sich einige längste Termine: BeschreibungspunkteangeführtenatveienfunddirektorengesammeltenKommissionsEntscheidungstaatlich-gestütztepaskolosgründungpaskolosgewäuju (15 Wörter; hier überschieße zahlen, d. h. der gestellte Punkt); Kreditinstitutionenvortragenteiltestattlicheunterstütztepaskolossammensetzungder"paskolos"empfängerwohnsitzesadresse (13 Wörter); der universitaterstudents studiesübergakungsunterrichtstrieb für jahrs wissenslog festlegt wirddem Rektors Befehl (11 Wörzer). Offsichtigwicht gesehen, dass diese Textfragmente nicht als möglichen Terminen betrachtet werden können. 60 Erika Rimkutė | Automatischerschaltungirmoksloterminen | nustatymaslingvistiniaismetodais Aus der Datentabelle sieht man, dass etwa 97 % aller ŠM-Terminen bestehen aus 13 Wörtern zusammengenommen Termen. Zwischen sechšiažodžių und septyniažodžių GT Bildung und Wissenschaft terminen nicht findet, daher sie weiter neanalyzieren. ŠVIETIMO IR MOKSLO TERMIN STRUKTŪRA In diesem Kapitel wird ausführlich beschrieben die automatisch bestimmten und vom Experten ausgewählten ŠM-Termin-Struktur, angegeben ihre gramatischen Modelle. Termininai beschrieben von kürzlichsten, t. y. einežodžių, bis längestens, t. y. penkiažodžių. 1.Einwoodžiai terminai. Aus insgesamt fest 7635 Einwörzlich GT, von ihnen 1311 tekstyne pavartota mehr als 20 Male. Weiterhin näher analysiert nur diese Wörter. Von 1311 Wörtern 155 können als ŠM-Terminen angesehen werden, d.h. etwa 20 %. Am häufigsten tekstyne pauerte diese ŠM Begriffe: Student (420816), Universität (3959), Studien (1562), wissenschaft(1508), sritis(1403). 2. Dvižodžiai terminai. 4 Mio. Wortes tekstyne finden 145 468 dvižodžiai GT. Wie geschrieben zuvor, weiter zu analysieren nur die Zweijörder GT, deren Häufigkeit nicht minder als 10 Mal solcher Termin rasta 4889. Peržiūrėjus GT, im endgültigen ŠM terminen Listesche blieb nur 474 dvižodžiai Termine und sie bilden den größten Teil aller analysierbenden Terminen mehr als zwei Drittdalius (žr. 1 Tabelę.). Dvižodžius terminus kann unterteilt werden in drei tipus, entsprechend an ihren grammatikalen Formen. 1) dkt.K.+dkt. type ŠM terminen sind 250, i. i. 52,7 % aller dvižodžių terminen. Die häufigsten dieser Struktur SchM Begriffe, pavartoti tekstyne, sind Studienprogramm (1432), Studienpakopa (306), Studienkryptis (303), wissenschaftdarbuτής (289), Studienkokybė (253). 2) bdv.+dkt.17 junginiai bilden 200 ŠM-Terminen (davon 42,2 % zweijodzych Terminen). Die häufigsten ŠM-Termine sind hoherjischule(2160), wissenschaftlicherissimai(918), höherasmuthlas (730), ferngelehrungs (453), berufsbildung (403). Bdv.+dkt. Verbindungen des Typs GT gelten dem Fall, wenn būdwardis mit daiktavardžiu abgestimmt gimine, zahlenum und humorniu. Gegenteiligem Fall gau16 Skliaustuen angegeben die Häufigkeit des Begriffs 4 mln. Wortes umfanges ŠM tekstyne. 17 Bei zweijudigen Terminen Modellen linksniai nichturodigen, weil Adjektive und Teilhaber kombiniert mit daiktavordzungen, und daiktavordzungen normalerweise sind einaskaitos Namenaars linksnio. 61Terminologija | 2012 | 19 nami gramatiškai netaisyklingi18 junginiai, pvz., glaudesnisuniversitetų, wichtigstesrechtses,svarbiausiųlernens,gertigstemet,arba Verbindinys ist regelig, obwohl oft incomplete, und es ist nicht ŠM Termini, z. B. größtepasaulyje,dinamiškiausiapasaulyje,palankustudenten. 3) dlv.+dkt. Verbindungen als ŠM Terä sind nur 24, i. e. 5 %. Die häufigsten ŠM Begriffe: beendamasisdarbas(162), passelkamasisdalykas(109), erwachsene19schulung (65), zurücktamasisryšys (63), angewomiejityrimai (45). 3. Trižodžiai terminai. Von dem ganzen wurden 119 881 trižodis GT. Detaillier analysieren 2438 Verbindungen, deren Häufigkeit tekstyne nicht geringer als 8 Mal. ŠM terminen rasta 125, i. e. 16,03 % aller Terminen. Die häufigsten ŠM Begriffe: höherenwissenschaftloinstitution(251), beruflichenLehringsįstaiga (205), staatsausgestütztepaskola (149), allgemeinlehrungsSchule (147), beruflichenLehrungsinstitution (77). Trižodžiai ŠM terminai sind septynių gramatischen Modellen. Unter den trižodžių ŠM terminen häufigste bdv.K.+dkt.K.+dkt.20 Typverbindnisse (sie bilden 48 % aller trižodžių terminen), z. H. des Hochschul-moksloinstitution (251), des allgemeinen Berufsausbildungs (205), deslaufingsschul (205). Andri unter trižodžių ŠM Terminen nach Häufigkeit ist dkt.K.+dkt.K.+ dkt. typ junginiai (24,8 %, beispielsweise: studienkryptiesreglementas (66), studienkrypčiųaprašas (60), staatmoksloinstitutas(50). Der dritte nach Häufigkeit struktureller trižodžių ŠM terminů modelis ist bdv.V.+bdv.V.+dkt. (12 %, z.B.: nationalischekompleksischeProgramm (69), grundlegenderwissenschaftlicherTherapie (61), primarisberuflicherLehrung (52). Im Folgenden nach Häufigkeit. kann gegeben werden nur nach einigen Beispielen, die enthalten strukturische trižodžių ŠM terminen Modelle: dkt.K.+dlv.V.+ dkt. (4%), z.B.: staatlich unterstützte paskola (149), staatlich anerkannte Qualifikation (33), staatlich finanzierter Student (21); dkt. K. + bdv.V.+dkt. (4 %, z. Ausländische Hochschule (41), Kollegiums-akademische Rat (32), Doktoranden-Wissenschaftlicher Leiter (20); vv. V. dl K. + dkt. K. + dkt. / (3,2 %, z.B.: abschließende Qualifikationsbewertung (36), kostenloseStudi ""plätze"" (13), angewandte Art der Untersuchungen(13); bdv.V.+ 18 Gramatiisch regeligigigem Verbindnissen in diesem Werk gelten solche Verbindungen, in denen abhängomiege Wörter abgestimmt mit hauptsächlichem, klarus syntaksiniai Verbindungen zwischen Wörteren Verbindungs dėmen. 19 Bei Teilnehmerinnen enthalten und sudaiktavardėjete Teilnehmern. 20 Letztiges Dichttavwisch humornis wird nicht angurodet, denn er ist meist der Naminier. 62 Erika Rimkutė | Automatischerschaltungirmoksloterminen dlv.V. (Ob K., wenn | nustatymaslingvistiniaismetodais Teilnehmer sudaiktavardėjęs) +dkt. (2,4 %, z. Wettbewerbs-Lehrung"sache" (15), nichtformales Erwachsenen-Lernen (13), wissenschaftlicheforschungsarbeit (12); dlv.V. + bdv. V.+ dkt. (1,6 %, z.B.: angewandtesochslinėwegla(20), auftragsmäßigesochsliniaiResearchen (8). 4. Keturžodžiai terminai. Von insgesamt gefunden 77,961 keturžodis GT, mehr als 7 Mal pavartoter Verbindungen 760. Davon stellte der Experte 22 ŠM-Terminen fest (sie bilden 2,82 % aller Terminen). Die am häufigsten in dieser Terminengruppe zusammengesetzten sind wissenschaftirstudijųinstitucija(568), wissenschaftirtechnologijųparkas (62), gemeinsamenationalekompleksinėprogramma (40), arbeitsmarktprofesionallerbung (40). ŠM tekstyne pavartoti keturžodžiai terminai sind devynių verschiedener gramatischen Modellen. Weil keturžodžių Terminen pavartota wenig, deshalb und jedes Modelį illustrierte nur po einigen oder nur po einem Beispiel. Hier nach angegebenen Häufigkeit gruppieren alle keturžodžių ŠM terminů strukturellen Modelle und angegeben wird nach einem jenes Modell illustrierendendes Beispiel: bdv.V.+dkt.K.+dkt.K.+dkt. (22,7 % aller keturžodžių terminen): internationale wissenschaftduomenbazė(13); bdv.V.+bdv.K.+dkt.K.+dkt. (18,2 %): allgemeinuniversitäreAusbildungsachen (8); bdv.K.+dkt.K.+dlv.V.+dkt. (13,6 %): speziálníchnöidhaltigerLokin(8); dkt.K.+jng.+dkt.K.+dkt. (13,6 %): Wissenschaftirstudijųinstitucija(568); bdv.K.+dkt.K.+bdv.V.+dkt. (9,1 %): HoherLevelsForschls-licheResearch(18); dlv.V.+bdv.V.+dkt.K.+dkt. (9,1 %): anerkannteter InternationaleDatenBase(11); bdv.V.+bdv.V.+bdv.V.+dkt. (4,5 %): gemeinsamenationalekompleksischeProgramm (40); dkt.K.+bdv.K.+dkt.K.+dkt. (4,5 %): Staatlichen[…]Fokslinien[…]tyrimų[…]įstaiga (31); dkt.K.+dkt.K.+dkt.K.+dkt. (4,5 %): TechnologiewissenschaftlicherstudiyjBereich(28); 5. Penkiawodžiai terminai. Nimmt zu 49 768 penkiažodžiai GT, mehr als 5 mal pavartoten verbindlichen rasta 601, von ihnen ŠM terminen - 4, t. y. 0,51 % aller Terminen. Aus solch geringer Anzahl Terminen schwierig zu machen Beschwenderungen über ihre Struktur, daher Termini struktūriisch neskirstyti. Alle ŠM Texyne pauroten fikauswodige Begriffe: wissenschaftlichetyrimaiirexperimentinėplėtra(124), wissenschaftliche Untersuchungenirtechnologinėplėtra (67), wissenschaftliche Untersuchungenirtechnologijųplėtra (13), Hochschul-liegischentyrimų centras (7). 69Terminologija | 2012 | 19 aAutomatic IDENTIFICatION OF SCIENCE aND EDUCatION TERMS USING LINGUISTIC MEtHODS The paper deals with possibilities and problems of automatic Lithuanian term extraction. Specifically, linguistic methods are discussed in the domain of Education and Science. Other researchers have shown that it is almost impossible to have language-independent term extraction tools; this is especially true for tools which are based on linguistic rules. Therefore a linguistic term extraction tool should incorporate methods that would deal with a languages grammatical system. This paper presents a tool developed at the Centre of Computational Linguistics of Vytautas Magnus that employs linguistic rules for extracting domain-specific terminology. University In order to extract domain-specific terms automatically, some preparatory work should be completed: compilation of domain-specific corpus (a corpus of four million words has been compiled for this research), morphological annotation of the corpus, formulation of appropriate linguistic rules, and creation of methodology for filtering out irrelevant word combinations. The paper präsentiert the linguistic rules that have been used for the extraction of Education and Science terms and the results of the extraction procedure. The identified terms are contrasted with approved terms in the Term Bank of the Republic of Lithuania. Some specific problems of automatic term extraction are discussed in the paper, e.g. number and case agreement of terms in a multi word term. Empfangen 2012-05-17 Erika Rimkutė Vytautas Großosjes Universität K. Donelaičio g. 52, LT-44248 Kaunas E. Paštas [email protected]