Improving Compatibility of Terminological Collections with a Bridging Classification of Data Categories
Full text
INTRODUCTION Malgré l'existence d'un ensemble normalisé de catégories de données (ISO 12620:1999) et de méthodes normalisées de travail terminologiqIGOR KUDASHEV University of Helsinki ue (ISO 704:2000), il est encore difficile de trouver deux bases de données terminologiques créées dans deux organisations différentes qui pourraient être facilement fusionnées sans perte de données ni distorsion des principes originaux de compilation de chacune des bases de données. Les raisons les plus évidentes en sont les suivantes: les langues et les traditions nationales diffèrent; -Les domaines LSP diffèrent; les antécédents et les approches des compilateurs diffèrent; Les solutions techniques diffèrent. Parallèlement, l ' une des tendances en matière de gestion des ressources terminologiques et d ' autres types de données a été l ' agrégation de ressources dispersées en portails ou services plus vastes, généralement sans les fusionner physiquement. Un exemple en est le portail EuroTermBank (http://www.eurotermbank.com) qui permet de rechercher dans de multiples bases de données terminologiques internes et externes et de compiler les résultats. À mesure que les demandes des utilisateurs et les volumes de données augmentent, il devient nécessaire de fournir une recherche avancée qui couvre tous les champs de l'entrée et pas seulement les mots clés et d'adapter les entrées en fonction des préférences des utilisateurs. Dans cet article, nous proposons une classification des catégories de données pouvant servir de passerelle entre les collections terminologiques. La classification répond aux problèmes suivants liés à la gestion des collections terminologiques avec différents ensembles de catégories de données : agrégation et fusion des ressources terminologiques; Organisation de la recherche qui couvre tous les champs des entrées; Adapter les entrées de plusieurs collections en fonction des préférences des utilisateurs. 36 Igor Kudashev | Amélioration de la compatibilité terminologique.
La base de données terminologique peut contenir différents types de données en plus des données terminologiques proprement dites, telles que des informations sur les sources, les utilisateurs et les transactions de gestion terminologique. Dans cet article, nous nous concentrons sur la classification des catégories de données liées à la description des expressions LSP. QU’EST-CE QU’UNE CATÉGORIE DE DONNÉES? Différents types de données sont placés dans différents champs dans les bases de données terminologiques. La catégorie de données est le résultat de la spécification d'un champ de données donné (ISO 1087-2:2000: 13). Les terminologistes utilisent différentes métaphores pour expliquer le concept de catégorie de données. Une métaphore est celle d'une armoire où différents tiroirs sont utilisés pour stocker différents types de vêtements. Une autre métaphore est un panier d’achat où chaque type de marchandise est emballé dans son propre emballage afin qu’ils ne se mélangent pas. Les catégories de données sont le résultat de la classification des données. Les données peuvent être classées de plusieurs manières différentes selon les vues du classificateur et les besoins des utilisateurs. En utilisant la métaphore de la garde-robe, on peut dire que différentes armoires viennent avec un nombre différent de tiroirs qui peuvent être de forme différente. Taille, etc. Il existe au moins six types de décalages possibles entre les catégories de données dans les bases de données terminologiques: décalage entre les noms des catégories de données; l’inadéquation des « tailles » des catégories de données, c’est-à-dire une « granularisation » différente; l’incohérence des « lieux » des catégories de données, c’est-à-dire leur emplacement dans le système de classification; l ' incohérence des principes de classification (chevauchement); l'incohérence du contenu des catégories de données; Cas mixtes. Voici quelques exemples qui illustrent quelques incohérences courantes. Cas 1: les catégories de données sont nommées différemment. Exemple: la catégorie de données est appelée note dans une base de données, commentaire dans une autre, remarque dans la troisième et NB dans la quatrième. Terminologie | 2009 | 16 37
Cas 2: le nom d'une catégorie de données est utilisé dans différents sens. . s“ ss Exemple : le synonyme de la catégorie de données peut correspondre à « synonyme complet », « quasi-synonyme » ou « synonyme complet ou quasi-synonyme ». Cas 3: les noms des catégories de données sont des « faux amis » Exemple: l’abréviation et l’acronyme anglais tels que définis dans la norme ISO (ISO 12620:1999: 6-7) et les mots russes ab66pesuamypa et akpornum correspondent l’un à l’autre de manière croisée (Kudashev 4 Hajutin 2003: 104-105). Cas 4: la granularisation des catégories de données est différente. Exemple: la catégorie de données forme abrégée du terme est divisée en cinq sous-classes (abréviation, forme courte du terme, initialisme, acronyme et terme coupé) dans l’ISO 12620:1999, mais il n’y a pas de telle division dans l’ISO 12616:2002 (« Terminologie orientée vers la traductionTM »). Cas 5: chevauchement des catégories de données. Exemple: exemple de catégories de données et chevauchement de contexte. Certains exemples sont des contextes et certains contextes peuvent servir d'exemples, mais les deux catégories ne sont pas identiques. Cas 6: la même catégorie de données est placée sous différentes catégories plus larges. Exemple: le contexte de la catégorie de données est considéré comme une donnée liée au concept dans la norme ISO 12620:1999, apparemment parce que les contextes peuvent fournir des informations supplémentaires sur le concept. Cependant, une fonction plus courante des contextes est de fournir des informations sur l’utilisation des termes et les collocations, de sorte que « de nombreuses bases de données classent le contexte comme une catégorie liée aux termes » (ISO 12620:1999: 25). Cas 7: la langue, le système de signes ou la notation des données diffèrent. Dans le troisième, il apparaît comme un symbole graphique, et dans le quatrième, comme un symbole graphique. Cas 8: des valeurs identiques ou similaires de catégories de données sont utilisées dans des sens différents et des connexions différentes. Exemple: le néologisme de valeur dans la catégorie de données de provenance de terme ISO 12620:1999 ressemble à une étiquette chronologique alors qu'en fait il se réfère à la méthodologie employée pour créer le terme. 38 Igor Kudashev | Amélioration de la compatibilité des... Example: a part of speech may be coded as noun in one database, n. in
Cas 9: les valeurs des classes semi-fermées diffèrent en raison de la classification différente Exemple: of linguistic phenomena in different languages and different traditions. dans la norme ISO 12620:1999, les étiquettes pour décrire les expressions LSP appartenant au “style inférieur” incluent le registre argot et le registre vulgaire. Ils correspondent à peu près aux étiquettes npogdeccuonajronbiū xeapzonusm (argot professionnel) et npogeccuonarvnoe npocmopeuue (coloquialisme professionnel) en russe. En finnois, cependant, il n'y a qu'une seule catégorie, le ammattislangi (argot professionnel; voir Sanastotyon kūsikirja 1989: 12). Il convient également de noter que certaines données peuvent être exprimées implicitement dans les collections terminologiques. Exemple I: la présence de l'étiquette obsolète dans certains cas et son absence dans d'autres dans une collection terminologique implique que les termes qui ne sont pas marqués avec l'étiquette, appartiennent au stock LSP actif. Exemple 2: si deux ou plusieurs termes sont mis dans la même entrée, cela implique généralement qu'ils sont synonymes ou équivalents. L'échange de données ou l'agrégation de ressources terminologiques peut nécessiter que ces données implicites soient explicitées. Par exemple, si les données sont stockées sous forme d’ontologie plutôt que d’entrées statiques, alors les informations implicites sont sauvegardées lors du « démontage » des entrées. L'ISO 12620:1999 spécifie un ensemble de catégories de données pour l'enregistrement de l'information terminologique. Il ne about synonyms and equivalents mentioned above has to be made explicit prescrit pas les catégories de données à utiliser, mais sert plutôt d'inventaire. Cet ensemble de catégories de données est élargi dans le cadre du projet ISOcat (www.isocat.org) qui documente les catégories de données linguistiques largement acceptées. Bien que le projet ISOcat soit sans aucun doute utile pour les linguistes qui ont la possibilité de mieux catégoriser et définir les concepts linguistiques et pour les concepteurs de banques de termes qui peuvent choisir des catégories de données prêtes à l ' emploi parmi un vaste inventaire, il est peu probable qu ' il soulage le problème de l ' échange de données, de l ' agrégation et de la recherche d ' entrées complètes dans de multiples bases de données. Premièrement, elle ne peut empêcher les compilateurs de produits terminologiques de Terminologija | 2009 | 16 39 de classer les données d'une manière différente et d'utiliser leurs propres catégories de données. Deuxièmement, plus les catégories de données utilisées dans les collections terminologiques sont nombreuses, plus elles deviennent diverses, ce qui rend l ' échange de données encore plus difficile. La liste des catégories de données est infinie en théorie et assez vaste en pratique. Par exemple, la liste des catégories de données relatives à la terminologie dans l ' inventaire ISOcat dépasse déjà 500 éléments. Une des pratiques utilisées dans le
projet ISOcat peut multiplier ce nombre par plusieurs. Nous nous référons à la présentation des valeurs des classes fermées et semi-fermées comme des catégories de données individuelles. Par exemple, les valeurs de la catégorie de données register, comme vulgarRegister. slangRegister, etc. sont maintenant présentés comme des catégories de données à part entière. De même, la catégorie de données reliabilityCode est divisée en reliabilityCodel, reliabilityCode2, etc. Il peut y avoir différentes opinions sur la raison pour laquelle cela est raisonnable d'un point de vue pratique, mais les données peuvent être organisées de différentes manières, donc il n'y a pas de restrictions formelles pour diviser les catégories de données jusqu'aux classes primitives qui ne peuvent accepter que les valeurs yes et no. Cependant, la classification des catégories de données proposée dans la norme ISO 12620:1999 pose problème à plusieurs égards. Pour commencer, il y a quelques incohérences concernant la division principale des données. Selon la section 6.2 (Typologie des catégories de données). Les catégories de données sont divisées en trois grands groupes: les termes et les informations liées aux termes, les données descriptives et les données administratives. Toutefois, à l'annexe D (Liste systématique des catégories de données), le deuxième groupe est intitulé Catégories de données liées à la description des concepts. Dans le même temps, ce groupe contient le sous-groupe Note qui "est autonome car il peut être associé à l'une quelconque des autres catégories et ne peut donc être subordonné à aucun autre sous-groupe spécifique" (ISO 12620:1999: 4). Si l’on suppose que la division envisagée comprenait quatre groupes : les informations relatives aux termes et aux termes, les informations relatives aux clear, however, that this realm of data categories needs proper structuring and classification in order to remain manageable and well-organized. concepts, les données administratives et Note, cette classification soulève encore de nombreuses questions. Pour n’en citer que quelques-uns: -Pourquoi les exemples et les contextes sont-ils des données liées aux concepts et non aux termes? Cf. la description de la catégorie de données de contexte : « Un texte ou une partie d’un texte dans lequel un terme apparaît » (ISO 12620:1999: 25). -Pourquoi le synonyme et l'équivalence sont des données liées au terme alors que tout ce qui est lié au sens est une donnée liée au concept? Cf. description de la catégorie de données degré d’équivalence : « La mesure dans laquelle les intentions de deux ou plusieurs concepts se chevauchent » (ISO 14001:2015). 12620:1990: 21). 40 Igor Kudashev | Amélioration de la compatibilité des...
-Pourquoi l'antonimée et l'homographe sont des données administratives et non des données liées au concept de termor? -Pourquoi l'audio, la vidéo, etc. sont-ils (juste) des données liées au concept? La division des - What is the exact definition of administrative data? Why this class includes such heterogeneous categories? données terminologiques en données liées aux concepts et données liées aux termes peut être utile du point de vue technique car elle soutient l ' approche axée sur les concepts qui réduit le nombre de relations entre les termes en reliant des termes synonymes au même concept. Toutefois, cette division en général et sa mise en œuvre dans la norme ISO 12620:1999 en particulier peuvent présenter un défi pour les utilisateurs ordinaires des bases de données terminologiques, à savoir les traducteurs et les experts du domaine. En effet, il n’est pas facile de comprendre pourquoi il faudrait rechercher des synonymes dans les données relatives aux termes, mais des antonymes dans les données administratives et des exemples dans les données relatives aux concepts. Les utilisateurs ordinaires travaillent avec des termes — des mots et des combinaisons de mots, donc pour eux il est plus naturel de parler de la signification d'un terme, des synonymes d'un terme, des exemples d'utilisation d'un terme, etc. Cela implique que la classification des catégories de données visant à fournir une recherche complète dans de multiples collections devrait être orientée vers les termes, intuitivement claire et basée sur des catégories linguistiques communes. Le problème des incohérences entre les catégories de données peut être résolu à l’aide de la cartographie. Si les incohérences sont nominales, par exemple si les noms des catégories de données diffèrent ou si le même contenu est présenté différemment, on peut utiliser un mappage direct entre les catégories de données. Une fois le mappage direct appliqué, les données de la ressource agrégée peuvent être recherchées avec la même précision que dans les bases de données originales. Les différences plus substantielles entre les catégories de données exigent de trouver un dénominateur commun par la correspondance entre les classifications des ensembles de catégories de données. L'utilisation d'un dénominateur commun diminue quelque peu la précision de la recherche, mais c'est le seul moyen de fournir une recherche commune pour les ressources terminologiques ayant une structure différente. Si l'utilisateur n'est pas prêt à sacrifier la précision de la recherche, il doit effectuer une recherche séparée dans chaque collection individuelle. Comme pour l'échange de données en général, l'utilisation d'un format intermédiaire, c'est-à-dire une classification de catégories de données, est plus efficace à long terme que de multiples correspondances entre différentes classifications. Les principes généraux de la classification des catégories de données destinées à servir d'interface commune entre d'autres classifications sont les suivants: 1. Puisque les classes de la classification sont censées servir de dénominateurs communs, elles doivent être à un niveau d’abstraction plus élevé que la plupart des catégories de données « primitives » qui ne sont pas subdivisées
davantage. Dans le même temps, le niveau d ' abstraction peut ne pas être trop élevé car les utilisateurs ne seraient pas intéressés par une classification trop générale. Dans la pratique, une classification à deux niveaux d'abstraction est suffisante. 2. La classification devrait couvrir tous les types d ' expressions LSP qui sont généralement décrites dans les bases de données terminologiques, y compris les éléments de termes, les noms propres, la nomenclature, les expressions définies, etc. 3. La classification ne devrait contenir que les catégories de données qui sont directement liées à la description des expressions de PSL. La description des aspects techniques et administratifs (par exemple, support, encodage, sources, fiabilité, etc.) est une autre tâche. 4. La classification devrait être hiérarchique, mais plusieurs bases de division devraient être autorisées au même niveau d ' abstraction. 5. La classification devrait être extensible, c ' est—à—dire qu ' elle devrait comporter une catégorie " autres " à chaque niveau de la hiérarchie. Ces principes doivent être combinés avec l'exigence de convivialité mentionnée ci-dessus. À notre avis, la classification basée sur les fonctions linguistiques des données est un candidat particulièrement fort à cet égard. Dans la classification de contournement basée sur les fonctions linguistiques, l'accent est déplacé des noms des catégories de données vers la fonction ou les fonctions des données qu'elles contiennent. Une comparaison qui peut être faite ici est une bibliothèque avec ses répertoires alphabétique et thématique. La recherche par les noms des catégories de données est similaire à la recherche à l'aide d'un répertoire alphabétique. Le titre donne un indice sur le contenu du livre, mais il peut parfois être trompeur. En outre, les utilisateurs ne peuvent pas deviner tous les titres possibles qui couvrent un certain sujet. Le répertoire alphabétique est utile dans les cas où les utilisateurs savent avec certitude quel(s) élément(- s) ils veulent localiser. Cependant, la plupart des usagers de la bibliothèque commencent leur recherche par le répertoire thématique, car ils ne savent pas à l'avance quels documents couvrent le sujet qui les intéresse. Portail terminologique qui regroupe plusieurs collections terminologiques Igor Kudashev | Amélioration de la compatibilité des...
L'interconnexion de données de différentes catégories pose le même problème aux utilisateurs que le domaine des livres sur les étagères d'une bibliothèque. Les utilisateurs savent quel type d'informations les intéressent (grammaire, signification, usage, etc.), mais ils ne savent pas nécessairement dans quelles catégories de données ces informations peuvent être trouvées. Dans différentes collections terminologiques, des types de données similaires peuvent résider dans des champs de données différents. Par exemple, des informations sur le statut spatial d'une expression LSP peuvent être trouvées dans des champs tels que l'utilisation, l'étiquette régionale, le symbole de langue, etc. Si la recherche est basée sur les fonctions linguistiques des données, les utilisateurs n'ont pas besoin de se soucier des noms exacts des catégories de données. Ils précisent simplement qu'ils recherchent des informations sur l'état de l'aire, la signification ou les synonymes, et le système de gestion terminologique localise et affiche les entrées complètes ou abrégées dans différentes bases de données qui contiennent le type d'information spécifié. La recherche par la fonction peut et doit être complétée par la recherche par le nom des champs pour les utilisateurs qui savent exactement dans quels champs ils veulent effectuer une rechercData fields, like library items, may contain different kinds of linguistic he. information. Par exemple, example est un champ multifonctionnel typique qui peut contenir des informations sur la forme, la signification et l'utilisation d'un terme, dans des proportions différentes. Chaque catégorie de données peut être décrite comme ayant une ou plusieurs fonctions. Il devrait également être possible de préciser dans quelle mesure une catégorie particulière de données reflète certaines fonctions. Cette caractéristique peut être verbale (p. ex. fonction primaire et secondaire) ou numérique (p. ex. 0-100 %). La façon la plus simple de faire le mappage d'une catégorie de données the intermediate classification is to consider the contents of data fields of particulière définie à un type particulier uniforme et faire un tableau de correspondance simple. Une cartographie plus précise mais aussi plus compliquée permettrait aux compilateurs de spécifier les écarts des champs de données individuels par rapport aux valeurs utilisées dans le tableau de correspondance global. Par exemple, les contextes fournissent généralement des informations sur l'utilisation et la signification des termes. Il est raisonnable d'inclure ces types d'information dans le tableau de correspondance global, car ils se rapportent à chaque champ de contexte. Cependant, certains contextes peuvent également contenir des informations encyclopédiques. Cette utilisation occasionnelle de l'information encyclopédique peut être marquée localement, au niveau du terrain. Terminologie | 2009 | 16 43
CLASSIFICATION DES CATÉGORIES DE DONNÉES EN FONCTION DES FONCTIONS LINGUISTIQUES DES DONNÉES Les expressions LSP étant des signes linguistiques, les informations les concernant peuvent être divisées en informations sur leur forme, leur signification, leur utilisation, leurs relations avec d’autres unités, leur origine et leur développement. Ci-dessous chacune de ces classes est décrite en détail et quelques exemples des données qui leur appartiennent sont proData liés à la forme LSP expressions ont deux formes — écrite et orale. En outre, les données relatives à la forme d'une expression LSP peuvent être subdivisées en trois classes: données vided. Please see Appendix 1 for the compact version of the classification. relatives à la forme canonique; les données relatives à la formation de l'unité; Données relatives à l'inflexion de l'unité. DONNÉES RELATIVES À LA FORME CANONIQUE La forme canonique est la forme sous laquelle le mot-clé est donné dans la base de données. Il sert de « représentant » pour d’autres formes. Par exemple, dans la plupart des langues européennes, la forme canonique pour les noms est le nominatif singulier et pour les verbes la présence de l'infinitif. Cependant, les règles pour choisir la forme canonique varient selon les langues et les traditions lexicographiques. Voici quelques exemples de données relatives à la forme canonique écrite: type d'expression par sa forme écrite (par exemple, forme complète, forme abrégée, symbole, formule, etc.); l'orthographe du formulaire; les variantes orthographiques du formulaire; Exemples de données relatives à la forme canonique orale: type d'expression par sa forme orale (par exemple initialisme, acronyme); la prononciation; Variantes de prononciation de la forme; La syllabification. Comme on peut le voir, certaines catégories de données peuvent concerner à la fois les formes écrites et orales. Par exemple, en indiquant qu’une expression particulière est un initialisme, c’est-à-dire une forme abrégée composée des premières lettres du terme complet, dans laquelle ces lettres sont prononcées individuellement (par exemple, Nations Unies — UN), on fournit des renseignements sur les formes écrites et orales. En outre, il peut 44 [gor Kudashev | Amélioration de la compatibilité des... -
4.1.8. Data related to register restrictions. <termUsage: restrictions: register > 4.1.9. Data related to professional group restrictions. <termUsage: restrictions: groupe professionnel > 4.1.10. Données relatives aux restrictions combinatoires. <termUsage: restrictions: combinatoire> 4.1.11. Données relatives aux restrictions de conformité. <termUsage: restrictions: conformité> 4.2. Données relatives à la fréquence d ' utilisation. <termUsage: fréquence> 5. Données relatives aux relations systématiques. <termRelations> 5.1. Données relatives aux relations synonymiques. <termRelations: synonymousRelation> 5.2. Données relatives aux relations antonymes. <termRelations: antonymousRelation> 5.3. Données relatives aux relations homonymes. <termRelations: homonymousRelation> 5.4 Données relatives aux relations paronymiques. <termRelations: paronymousRelation> 5.5 Données relatives aux relations génériques. <termRelations: genericRelation> 5.6 Données relatives aux relations partitives. <termRelations: partitiveRelation> 5.7. Données relatives aux relations ontologiques non hiérarchiques. <termRelations: non-hierarchicalOntologicalR elation> 5.8 Données relatives aux relations d ' équivalence. <termRelations: equivalenceRelation> 6. Données relatives à l'origine et au développement. <termOriginAndDevelopment> 7. Autres types de données liées à la description d'une expression LSP <termOtherRelated Data > APPENDICE 2. EXEMPLE DE MAPPING DE CERTAINS ISO 12620:1999 CATÉGORIES DE DONNÉES DANS LA CLASSIFICATION FONCTIONNELLE DES DONNÉES TERMINOLOGIQUES Voir l'Annexe I pour le décryptage de la représentation formelle des catégories qui sont utilisées par souci de concision. Un point d'interrogation après une catégorie de données signifie que la présence du type de données spécifié est soumise à l'interprétation de la catégorie de données. Si les sous-catégories peuvent être mappées exactement de la même manière que leur catégorie parent, seule la catégorie parent est décrite. Terminologie | 2009 | 16 51
En raison des contraintes d'espace, seul le premier sous-groupe de catégories de données de la norme ISO 12620:1999 est couvert. A.1 Terme Note: term (headword) lies outside the scope of classification which covers data categories related to the description of LSP expressions. However, Le terme technique de catégorie de données est identique à la forme écrite du terme. Classification fonctionnelle: sans objet ou <termForm: writtenForm> A.2.1 Type de terme Note:dans la norme ISO 12620:1999, cette catégorie comprend divers types d'expressions LSP et peut contenir différents types de données. Voir les sous-catégories pour plus d'informations. A.2.1.1 Terme principal d ' entrée Remarque: les informations sur la structure de l'entrée ne sont pas des données liées à la description des expressions LSP. Toutefois, cette catégorie reflète indirectement la préférence. Classification fonctionnelle: sans objet ou <termUsage: restrictions: conformité> A.2.1.2 Synonymes Remarque : Lorsque cette catégorie est opposée au terme d'entrée principal, elle reflète la préférence. Sa fonction première est, cependant, de refléter les relations synonymiques. Classification fonctionnelle: <termRelations: synonymousRelation>; <termUsage: restrictions: compliance>? A.2.1.3 Quasi-synonyme Note: même as que précédemment. Classification fonctionnelle: <termRelations: synonymousRelation>; <termUsage: restrictions: compliance>? A.2.1.4 terme scientifique international Note: selon l'interprétation de cette catégorie et de son contenu, cette catégorie de données peut fournir des informations sur la conformité, les restrictions linguistiques. Origination et développement. Classification fonctionnelle: <termUsage: restrictions: compliance>; <termUsage: restrictions: language>? ; <termQOriginAndDevelopment>? A.2.1.5 Nom commun Remarque: le nom commun est un synonyme d'un terme scientifique international utilisé dans le is discours in général. Cette catégorie de données peut fournir des renseignements sur les restrictions liées au registre, à la conformité et au groupe professionnel. 52 Igor Kudashev | Amélioration Compatibilité of La terminologie...
Classification fonctionnelle: <termUsage: restrictions: register>; <termUsage: restrictions: compliance- >; <termUsage: restrictions: professional Group>? Note: selon le contenu, cette catégorie de données peut fournir des informations relatives aux restrictions linguistiques, à la formation, à l'origine et au développement des termes. Classification fonctionnelle: <termUsage: restrictions: language>; <termForm: termFormation>7; <termQriginAndDevelopment>? A.2.1.7 Formulaire complet Remarque: cette catégorie de données fournit des informations sur le type de terme par sa forme. Classification fonctionnelle: <termForm: term Type> A.2.1.8 forme abrégée du terme Note: selon le contenu, cette catégorie de données et toutes ses sous-catégories (A.2.1.8.1 abréviation, A.2.1.8.2 forme abrégée du terme, A.2.1.8.3 initialisme, A.2.1.8.4 acronyme et A.2.1.8.5 terme coupé) peuvent fournir des informations relatives au type de terme par sa forme, sa forme orale: formation du terme, origine et développement. Classification fonctionnelle: <termForm: termType>; <termForm: oralForm>7, <termForm: termFormation>? : <termOriginAndDevelopment> A.2.1.9 variante Remarque: selon le contenu, cette catégorie de données peut fournir des informations sur la préférence, la formation du terme, l'origine et le développement. Classification fonctionnelle: <termUsage: restrictions: compliance>; <termForm: termFormation>? ; <termQriginAndDevelopment>? A.2.1.10 à A.2.1.14 (forme translittérée, forme transcrite, forme romanisée, symbole et formule) Note: ces catégories de données fournissent des informations sur le type de terme par sa forme. Classification fonctionnelle: <termForm: termType> A.2.1.15-A.2.1.- 17 (équation, expression logique, catégories de gestion des matériaux) Note: ces unités ne peuvent pas être des mots-clés dans les bases terminologiques. Functional classification: not applicable. A.2.1.18 Unité phraséologique Note: Dans la norme ISO 12620:1999, cette catégorie est divisée en trois sous-catégories: collocation, expression définie et expression synonyme. La collocation ne peut pas être considérée comme
une unité phraséologique car elle ne correspond pas à la définition d'une unité phraséologique donnée dans la norme. L'expression synonyme semble être une catégorie inutile. Les mêmes informations peuvent être exprimées avec deux autres catégories de données : la phrase définie et le synonyme. Functional classification: not applicable. A.2.1.18.1 Collocation Remarque : Cette catégorie de données fournit des renseignements sur les contraintes combinatoires. Classification fonctionnelle: <termUsage: restrictions: combinatoire> A.2.1.18.2 ensemble de phrases Note: cette catégorie de données fournit des informations sur le type de terme par correspondance de son sens à sa forme. Classification fonctionnelle: <termMeaning: termType> A.2.18.3 synonyme Note : Comme indiqué ci-dessus, cette catégorie est probablement inutile. S'il est utilisé, il fournit des informations sur le type de terme par correspondance de son sens à sa forme et aussi sur les relations synonymiques. Classification fonctionnelle: <termMeaning: termType>; <termRelations: synonymousRelation> A.2.1.19 Texte normalisé Note: les textes standards ne peuvent pas être des mots-clés dans les bases terminologFunctional classification: not applicable. iques. L’une des tendances en matière de développement des ressources d’information, et en particulier des ressources terminologiques, est la fusion de bases de données individuelles en grands portails et la création d’interfaces entre ces portails. EuroTermBank (http://www.curotermbank.com) en est un exemple. Avec l'augmentation du volume d'informations et des exigences des utilisateurs à l'égard de ces produits, il est de plus en plus nécessaire de garantir une recherche complète couvrant tous les champs des articles du dictionnaire et la possibilité de n'afficher que les catégories d'informations qui intéressent actuellement l'utilisateur. Ces défis nécessitent une classification des catégories de données qui puisse être utilisée comme un « dénominateur commun » entre les bases terminologiques ayant des structures différentes. La classification basée sur les caractéristiques linguistiques des données discutée dans cet article pourrait devenir un tel « dénominateur commun® ». >4 Igor Kudashev | Amélioration de la compatibilité des...
KCNONb30BAKHHE METAKNACCOB JAHHBIX KAK CPENCTBO YJIYVUIEHMA COBMECTHMOCTU TEPMUHOJIOTHUECKHX KOJINEKŪMA Ojnnoli H3 TEKJEKHHOKŪ pa3BHTHAS HHPOPMALUMOHHBIX PECYPCOB B HE/IOM H TEDMHHOHAOTHUUECKHX B YACTHOCTH CTO 00be/TMHCHNEe pa3po3HeHHbIX Das fAHHBIX B KPYIIHBIE mOpTA/IbI H CO3]faHHe obmux HHTEpĒOečCcoR K Hum. IlpuMepoM MOXET CAvxHTbh EspoTepmbank (http://www.eurotermbank.com). [To mepe pocra 065eMos nudopmarnuu H Tpe6osBaHHH M10Ab30BaATENeH K HOJ00HBIM MPOTYKTaM paCTeT TOTPeOHOCTH B OGucCIIeUEHHH PacIIMPEHHOrO HOHCKA, OXBATbIBAIOIIHETO BCE IIO/IH CIOBAPIBIX ClaTel, a Takxe BO3MOXKHOCTH OTOOPAXKEeHHS IHL TeX KaTETODHĖ HHOOpMAaLHH, KOTOPBIE B TAHHbIH MOMEHT UHTEPECYIOT MOMb30BaTeNs. ITH 3aaun TPpeObyIoT namrans Kiaccundanganmnn HHOOpMAHOHONHbIX KaTETODHH, KOTOPAs MOI1a OBI CIIYXKATH 4OŠIO2HM 3HAMEHATCIE M» JA TEPMHUHOMOTHYECKHX Bas ¢ pasandHO CTpyKTypon. HeManorax usm rpebonannem K ITo00HON K]aCCHĖOKKALHH SBAAETCs Ce IIPOCTOTa H MOHATHOCTh IIS IIPOCTHIX IHOJIb30BAaTe/1EK TEDMKHOIOTHUECKHX NpoOjyKTOB. B cTaThe OTMCEIBaCTCSA O/IMH H3 BO3MOXHBIX KaHJUIATOB Ha PO/b «ODUIEro 3HAMEHATe Is» —KIACCHPUKALUsI, OCHOBAHHAS Ha JIMHTBUCTHYECKUX HYHKITHAX JAHHBIX. Reçu le 14 octobre 2009 Igor Kudashev University of Helsinki Centre de formation continue Palmenia - Oui. Box 239 (Paraatikentti 6) FIN-45100 Kouvola, Finlande E-mail: igor. [email protected] Terminologie | 2009 | 16 55