„Dabartinės rašomosios lietuvių kalbos dažninis žodynas“ ir jo bazė
Full text
ACTA LINGUISTICA LITHUANICA XLVI (2002), 19 - 37 Diccionario de la lengua española moderna y su base de datos LAIMAGRUMADIENE Lietuviy kalbos institutas Existen pocas bases de datos electrónicas para el lituano. Los más importantes son el Diccionario de frecuencias del lituano escrito moderno, compilado por V. Zilinskiene y L. Grumadiene, y el corpus de lengua lituana de la Universidad de Kaunas. El primero se presenta en detalle aquí: se discuten los principios de su compilación y sus posibles usos, y se caracterizan brevemente los trabajos publicados hasta ahora en lingüística estadística basados en él. Los principales problemas en relación con las bases de datos para el lituano moderno son: (1) su diferenciación insuficiente (reflejan solo la lengua escrita, no la hablada), (2) su uso no óptimo, ya que la comunidad académica lituana carece de la preparación necesaria para trabajar con tales herramientas, y (3) el hecho de que los esfuerzos de los académicos que las compilan reciben muy poco reconocimiento público y no se valoran como logros académicos originales. 1. ENVEJECIMIENTO DE LAS BASES DE DATOS ELECTRÓNICAS En este momento, la lingüística lituana está como estancada en el Banco del Tigre: los trabajos destacados que surgieron después del impulso recibido principalmente del estructuralismo ya están escritos, pero en el aire se respira la expectativa de nuevos trabajos, no menos importantes. Esto requiere no solo un enfoque diferente de los fenómenos lingüísticos, sino también nuevos métodos y herramientas de trabajo que aún no se han probado. En la era de las tecnologías de la información, las nuevas herramientas de trabajo de los lingüistas están a menudo relacionadas con las bases de datos electrónicas, y éstas con las publicaciones lingüísticas estadísticas. Parece evidente que existen diferencias entre ellas, ya que las bases de datos electrónicas son dinámicas y pueden ser consultadas de forma autónoma, mientras que las publicaciones son estáticas y no son más que un conjunto de datos facilitados a petición de los autores. En la actualidad, y en algunos casos, en la actualidad, estas bases y publicaciones han sido o son identificadas. Esto es lo que se conoce como la "revolución inversa" (inverse revolution). El primer diccionario retrospectivo lituano, elaborado por el estadounidense David F. Robinson (1976) sobre la base de la edición de 1954 de DLKZ, abarcaba alrededor de 45.000 palabras, quizás ni siquiera tenía su propia base electrónica, al menos el autor no se refiere a ella. Además, en ese momento, una base de datos electrónica de este tipo no habría sido accesible en Lituania, ya que el diccionario en sí solo había sido leído por pocos, ya que se había publicado en pequeña tirada en Estados Unidos. 1991: La lengua de los sueños (The Language of Dreams) de J. K. Rowling.
El diccionario de Laima Grumadienė, que abarca casi 22.000 palabras, también se basó en el DLKŽ, pero ya en la edición de 1972. El trabajo se realizó utilizando una base de datos electrónica creada por el autor, pero esta última no es de uso público (probablemente por razones técnicas), por lo que solo está disponible en forma de libro impreso. El Diccionario de la lengua española actual (1995) no es una reescritura del DLKZ, ya que las palabras se presentan en orden inverso por partes del lenguaje, añadiendo un análisis estadístico. Actualmente se publica en formato impreso, aunque también se puede encontrar en formato electrónico. Ha publicado numerosos artículos en revistas especializadas en la temática de la lengua y la literatura españolas, entre ellos en el Diccionario de la Lengua Española (1998, 2000, 2001, 2002, 2003, 2004, 2005, 2006, 2007, 2008, 2009, 2010, 2011, 2012). Por otra parte, este último diccionario y análisis se han preparado utilizando la versión computarizada del DLKŽ (1993) y su análisis estadístico, y no, como señala Rūta Marcinkevičienė (2000a: 16) en su revisión, la base del Diccionario frecuente de la lengua lituana escrita actual (Grumadienė, Žilinskienė 1997; 1998). La versión de 1993 de DLKŽ (edición de 1993) fue editada en forma electrónica por el Instituto de Matemáticas e Informática y el Instituto de Lengua Lituana, pero no tuvo una gran difusión (1995), simplemente porque no se tenía derecho a distribuir las publicaciones en forma electrónica. En 2000, el Instituto de Lengua Lituana volvió a ocuparse de la DLKŽ, pero la edición de 2000, computarizada (dirigida por Stasys Keinys), ha recibido apoyo financiero de la Fundación de Ciencia de Lituania. Como es sabido, las ediciones de 1993 y 2000 de la LMC difieren poco entre sí, por lo que es sorprendente que se haya decidido no utilizar la versión electrónica anterior simplemente porque está preparada en un entorno DOS ya moralmente obsoleto y en la base de datos FOXPRO: se ha vuelto a empezar a escanear con un lector de computadora el texto electrónico ya existente, que solo requiere pequeñas correcciones, aumentando así los costos de trabajo y los costos. ¿Se volverá a realizar incluso el análisis estadístico? Sin embargo, al igual que la versión computarizada de la edición de 1993 de la DLKZ, muchas bases de datos electrónicas están quedando obsoletas, por lo que es evidente que hay que preocuparse por su mantenimiento. Al igual que en el caso de la versión electrónica de los LMR (1993), ¿no se producirá también en el conjunto de los institutos mencionados una valoración superior a la de las costosas bases de datos electrónicas que ofrecen muchas posibilidades de trabajo innovador? Los lituanos deberían ponerse de acuerdo sobre las bases de datos electrónicas que utilizan caracteres específicos, como las escrituras antiguas y los textos transcritos de dialectos, ya que los artículos que contienen ejemplos de este tipo ya tienen que ser seleccionados de nuevo si, por una razón u otra, se decide no enviarlos, por ejemplo, a las publicaciones del Instituto de la Lengua Lituana, sino a una de las editoriales de la Universidad de Vilna. Los diccionarios dialectales y los textos dialectales que se publican actualmente, aunque en formato electrónico, son solo un signo de la modernización de la imprenta, ya que no es posible utilizar sus textos como base de datos electrónica. Por lo tanto, la falta de acuerdo entre los lituanos sobre un sistema común de codificación (por ejemplo, UNICODE u otro) dificulta enormemente el acceso público a los bancos de datos electrónicos, por no hablar de la utilización muy limitada, y a veces imposible, de tecnologías y programas electrónicos para su análisis. ¿Tenemos tantos que no podemos abarcar? El problema es que ni los lingüistas ni los informáticos que los ayudan han comprendido todavía que las bases de datos deben ser dinámicas, que deben ser capaces de adaptarse a la gran cantidad de nuevas aplicaciones y tecnologías que están surgiendo y que deben ser capaces de actualizarse. Hasta la fecha, la mayoría de las bases de datos electrónicas creadas en Lituania se crean como si fueran las mismas hojas con
DICCIONARIO DE LENGUAS CONTEMPORÁNEAS Y SU BASE DE DATOS |21 idiomas, solo recopilados por el teclado de la computadora. Pronto, estos datos podrían ser comparables a la escritura dentaria grabada en piedra: en las pantallas de las computadoras de la nueva generación solo se verán "marcas" y "cuadrados", que los lingüistas del futuro podrán descifrar sin comparar la lectura de las runas. Hasta ahora, los debates sobre este tema han sido infructuosos, pero, por supuesto, no hay que perder la esperanza y vale la pena volver a convocar a debates y negociaciones. Por cierto, hay que prestar atención a los términos: BASE, BANCO, TEXTO (CORPO), ARCHIVO de la forma electrónica. El más moderno de ellos es el TEXTIL (CARCASA). El término se refiere a la forma en la que los datos se almacenan en una base de datos, pero también se refiere a la forma en la que los datos son almacenados en un sistema de archivos (por ejemplo, una base de datos puede contener una gran cantidad de archivos- ). El término banco de términos suele asociarse a la terminología: los bancos de términos no suelen denominarse libros de texto. En la actualidad, el término ARCHYVO está cada vez más asociado con la dimensión temporal: la acumulación electrónica de datos antiguos se puede llamar archivo o base de datos. Por lo tanto, el término más neutro sigue siendo BASE DE DATOS ELECTRÓNICA, por lo que aquí se usa con mayor frecuencia. (cf. Kennedy 1998: 3 pp. ) 2. LECTURAS ELECTRÓNICAS CONTEMPORÁNEAS EN ESPAÑOL En la actualidad, no existe un exceso de bases de datos en lituano en formato electrónico. Por lo tanto, no hay publicaciones lingüísticas estadísticas, y solo se utilizan métodos lingüísticos estadísticos. Se trata de una aproximación a la fonología y a la fonología fonológica. Tal vez esto se debió a la naturaleza misma de la fonética, es decir, a que la repetición frecuente de las mismas unidades —sonidos— simplemente lleva a conclusiones basadas en estadísticas, o a factores subjetivos, es decir, a la aparición de investigadores de pensamiento innovador: en primer lugar, Aleksas Girdenis y sus alumnos, así como Antanas Pakerys. Estos dos factores, sin embargo, llevaron a un salto en la fonética y la fonología lituanas, e incluso a una especie de separación de otras ramas de la lingüística. Es cierto que la fonética en sí es un campo intermedio entre las ciencias exactas y la lingüística. La morfología es el estudio de la frecuencia de las unidades lingüísticas. Por lo tanto, es lógico suponer que, en este ámbito en particular, ya debería existir la necesidad de utilizar tanto datos estadísticos lingüísticos como bases de datos electrónicas. Hasta ahora, esto no ha sucedido, aunque ya existen trabajos y instrumentos de trabajo. El primer trabajo de lingüística estadística sobre léxico y morfología en Lituania fue realizado por Vida Žilinskienė (1990). Su diccionario de uso frecuente de la lengua lituana se basa en los datos de uno de los estilos funcionales, la publicística, y contiene un análisis de los usos de 300.000 palabras (es decir, tanto de los mismos lexemas como de los diferentes, que fueron 18.776, después de que las reglas generalmente aceptadas para la elaboración de diccionarios de uso frecuente rechazaron el estudio de 11.956 palabras verificadas). Todos los textos continuos, que consisten en fragmentos (muestras) de 1000 palabras cada uno, fueron analizados morfológicamente, intercalados, luego perforados e inyectados en los ahora moralmente obsoletos y no utilizados ESM Minsk-22. Existe un banco de datos electrónico, pero sería muy difícil acceder a él. Lamentablemente, ni el análisis lexicológico, ni el morfológico, ni el acentológico de una de las variantes actuales del lituano —la publicística— ni el análisis texto-lingüístico estadístico han sido utilizados hasta ahora adecuadamente, ni para fines científicos ni prácticos, especialmente para la redacción de libros de texto y diccionarios educativos. Uno de los medios electrónicos de preparación (participación inter-
22 | LAIMA El estudio de la morfología de la lengua materna y la morfología de la lengua materna de los niños es un tema de investigación en el ámbito de la morfología del lenguaje infantil. Por cierto, hay que mencionar que otros trabajos sobre las consonantes, la estilística y, en parte, la sintaxis, cuyas unidades tienen una frecuencia mucho menor, basados en datos lingüísticos estadísticos, en particular los de Audronė Bitinienė (1983, 1997, 1998, etc.), aparecieron ya hace una decena de años. También se ha hecho un intento de estudiar el vocabulario actual a partir de datos lingüísticos estadísticos. En los últimos años, se han realizado trabajos en la base de datos de la Universidad de Vytautas el Grande (aproximadamente 60.000.000 de palabras) (por ejemplo, estudios de colocación realizados por Rūta Marcinkevičienė (2000a; 2000b), Jurgitos Mikelionienė (2000) en su tesis doctoral sobre neologismos, etc.). En la actualidad, la mayoría de los programas de computación en la nube están basados en la tecnología de la nube, pero existen algunos programas de computación en la nube que utilizan la tecnología de la nube, como por ejemplo el programa de computación en la nube de la Universidad de California en Berkeley, que es un programa de computación en la nube de alto rendimiento, pero que no es tan eficiente como el programa de computación en la nube de la Universidad de California en Berkeley. La base electrónica para el estudio del léxico está siendo preparada por un grupo dirigido por Antanas Pakeri en la Universidad Pedagógica de Vilna, entonces quizás también aquí aumente el número de trabajos de este tipo de estudiantes. Este artículo se limita a la descripción de los instrumentos de trabajo necesarios para el estudio del lituano escrito actual, por lo que no trata la ya extensa serie de estudios de las escrituras antiguas basados en la propia base de datos electrónica del Instituto de la Lengua Lituana. La aparición de sus propias bases de datos electrónicas, sin duda, dará un nuevo impulso a la dialectología lituana: en el Instituto de la Lengua Lituana ya se está preparando la creación de un Centro de Dialectos, en el que se prepararían en forma electrónica los registros de dialectos y se descifrarían los textos transcritos de ellos. En el mismo edificio se encuentran las oficinas del Instituto Nacional de Estadística y Geografía. La base de datos electrónica del gran diccionario de la lengua lituana, que ya se está preparando, debería ser un verdadero punto de inflexión en la lexicografía lituana, y se espera mucho de la base de datos electrónica del diccionario general de la lengua lituana. Los profesores de la Universidad de Vilna, dirigidos por Evaldas Jakaitienė, están involucrados en uno de los proyectos de la Unión Europea y están preparando la llamada lista electrónica universal de palabras de la lengua lituana, sobre cuya base debería surgir una nueva serie de diccionarios bilingües. En este sentido, es un diccionario comparativo de la lengua española. La Comisión Nacional de la Lengua Lituana, a instancias de la Unión Europea, ha comenzado a elaborar los llamados Portafolios de Términos o Palabras Extranjeras, una especie de listas de muestras de los términos y palabras más recientes y de uso muy frecuente en diversos campos, que la Unión Europea distribuye a todos sus miembros y candidatos para que los idiomas puedan adaptarse y prepararse para la creciente ola de traducciones, así como para la traducción automática. La base de datos electrónica de la lengua hablada actual, al igual que el polaco, se prepara sobre la base de grabaciones de radio y televisión, ha sido iniciada por un grupo de científicos de la Universidad de Vilna (dirigida por Meilutė Ramonienė). En la misma universidad se está preparando una base de datos electrónica de eslavismos (dirigida por Vytautas Kardelis), que debería contener tanto grabaciones de audio como ejemplos seleccionados y transcritos de ellos. La experiencia demuestra que solo se podrán obtener resultados si se aprende a trabajar con este tipo de datos y a aprovechar las nuevas oportunidades. Para ello se necesitan laboratorios donde se pueda aprender esto, preferiblemente desde la juventud. La naturaleza misma de las bases de datos electrónicas supone la publicidad, y una vez organizadas deben estar disponibles para todos los interesados. La mayor colección de datos de lengua lituana es el Instituto de Lengua Lituana.
El Diccionario de la Lengua Moderna y su Base de Datos |23 por lo que, al modernizarse, debería convertirse en el mayor centro de preparación de bases de datos electrónicas de la lengua lituana, fuente de su uso público, centro de atracción e irradiación de este tipo de trabajos e ideas —quizás el Centro de Lituanística, que se establece en la base del Instituto de la Lengua Lituana, desempeñará este papel? Las bases de datos electrónicas que se publiquen en Internet serán aún más abiertas. Por cierto, el lugar en el que se utiliza el ordenador deja de ser importante cuando se tiene acceso a Internet, solo importa lo que está conectado a Internet. Pero estos son planes para el futuro. Hasta la fecha, en Lituania no se ha legalizado la publicación de trabajos lingüístico-estadísticos en formato electrónico, no se ha armonizado la cuestión de los derechos de autor, por lo que siguen siendo relevantes los trabajos impresos en papel. Sin embargo, las bases de datos electrónicas y las publicaciones estadísticas lingüísticas son muy diferentes, y estas últimas son solo la punta del iceberg. A continuación se trata un tema específico: la relación entre las bases de datos electrónicas de la lengua lituana escrita actual y los diccionarios lingüísticos estadísticos. Estos últimos no pueden existir sin una base de datos, pero las posibilidades de la base de datos van mucho más allá de la publicación de diccionarios. 3. ELECTRÓNICA CONTEMPORÁNEA ESCRITAS LITUANOS BASES DE DATOS LINGÜÍSTICAS Y DICCIONARIOS DE FRECUENCIAS Las bases de datos lingüísticas electrónicas se distinguen de otras colecciones de datos lingüísticos por su forma electrónica y por la especificidad del uso de las tecnologías informáticas asociadas. La aparición de las bases de datos electrónicas ha abierto nuevas posibilidades para el estudio del lenguaje, pero no se limitan a la aparición de los medios electrónicos modernos. El hecho de que los diferentes medios produzcan resultados esencialmente similares, en particular en lo que respecta a las formas gramaticales frecuentes y a las características de los léxicos, demuestra que existen numerosas similitudes entre las bases de datos electrónicas modernas y sus análogos mucho más antiguos. En Francia, Larousse ha utilizado desde 1956 una colección masiva de diccionarios (Rozencvejg) para la elaboración de sus diccionarios. 1986: 82). La cuestión de cómo crear una base de datos moderna de lenguaje electrónico surgió, por un lado, porque con la aparición de nuevas tecnologías ya era posible manejar grandes cantidades de información, y por otro lado, el volumen de texto para ilustrar una sola palabra (es decir, su contexto) comenzó a aumentar. Esto ha llevado a la aparición de nuevas posibilidades para el estudio de las premisas de la palabra y, posteriormente, de las unidades lingüísticas más grandes, y, por lo tanto, de la sintaxis y la semántica. La admiración por los pasajes de texto cada vez más largos llegó incluso a los textos completos, hasta que el precio de los derechos de autor de los creadores lo frenó. Por otra parte, el impacto de la invención de Gutenberg fue probablemente igualado por la aparición de los ordenadores y, sobre todo, por su proliferación a una velocidad sin precedentes, por lo que el crecimiento geométrico de las relaciones humanas a distancia, tanto con hablantes de la misma lengua como con hablantes de lenguas diferentes, creó una demanda social urgente de obtener información estadística lingüística de todo tipo para automatizar el mayor número posible de procesos de comunicación: aprendizaje de idiomas, traducción, reconocimiento, compresión de información, transmisión, etc. La lingüística lituana no se ha quedado al margen de este proceso general, pero, por supuesto, está muy rezagada en relación con el tiempo. Durante el siglo XX, especialmente en la segunda mitad, el mundo se preparó para un nuevo salto. En primer lugar, se trataba de diccionarios de idiomas comunes. Los primeros aparecieron en el siglo XIX.
24 | LAIMA A finales del siglo XIX y principios del XX. El primer diccionario de la lengua alemana, preparado por el taquígrafo E. Kaeding en 1898 a partir de la cartografía de hojas, contenía 11.000.000 de palabras. En 1929, Vander Beke publicó un diccionario de la lengua francesa. Eaton (1934) preparó un diccionario comparativo de las primeras mil palabras más comunes en cuatro idiomas: inglés, francés, alemán y español. El primer diccionario común de inglés fue elaborado por E. Thorndike y L. Lorge (1944), y el de español por V. García Hozas (1953). El primer diccionario común del ruso en América fue elaborado por H. Josselson (1953), y N. P. Vachar (1966), también en América, publicó un diccionario común del ruso hablado de la época soviética, pero en esencia está elaborado solo sobre la base del lenguaje de las obras dramáticas. En 1963, Steinfeldt publicó en Tallin un diccionario común de la lengua de Pushkin. El diccionario de ruso común de Uppsala fue elaborado por L. Lonngren (1993) sobre la base de un corpus de 1.000.000 de palabras, compuesto por más de la mitad de literatura de ficción y la llamada prosa informativa (periodismo, papelería y literatura científica). Los primeros diccionarios de uso común no solo del ruso, sino también del rumano y del italiano, también fueron elaborados en América — por A. Juillard, P. M. Edwards, I. Juillard (1965), A. Juillard, V. Traversa (1973) (por cierto, A. Juillard, E. Ch. En 1964 se publicó el Diccionario de la Lengua Española, de J. R. Alameda y E. Cuetos. Toda una serie de diccionarios de uso común se basaron en el concepto de estilos funcionales del lenguaje del Club Lingüístico de Praga, así como en el concepto de lenguaje común de Boris Larin: el primero, como corresponde, fue el del checo, primero estilos funcionales individuales, y luego el general, escrito por un colectivo de autores dirigido por Marie Těšitelová (J. Jelinek, J. V. Bečka y otros, véase Těšitelova 1983). Los letones, al igual que los checos, se apresuraron a preparar primero estilos funcionales separados y luego un diccionario general de dos partes —T. Jakubaite, D. y Kristovska, D. 1966-1976 Gulevska, V. Ozola, R. Prūse, A. Rubine, N. Sika. En 1977, V. A. Agrayev, V. V. Borodin, V. M. Muratova y E. V. Tisenko, bajo la dirección de L. N. Zasorina, elaboraron un diccionario común del ruso moderno basado en 1.000.000 de usos de cuatro estilos funcionales. Solo un estilo funcional —la literatura de ficción— es el diccionario común del idioma bielorruso, elaborado por N. S. Mazeika y A. J. Suprun (Mažejka, Suprun 1976). En la actualidad, la lengua búlgara es la única lengua oficial de Bulgaria (2001). El primer diccionario de uso frecuente de la lengua lituana preparado por V. Žilinskienė (1990) también era de un solo estilo funcional: publicística, en el trabajo se utilizó la misma metodología checa y se cooperó mucho con los letones. Con el paso del tiempo, aunque el lituano no puede presumir de ello, en el mundo han aparecido una gran variedad de diccionarios de uso común: lenguaje de autores individuales, estilos funcionales, variantes de idiomas regionales, lenguaje escrito y hablado, etc. El término "diccionario" se refiere a un conjunto de palabras que se usan en un contexto específico, y no a un conjunto de palabras que se usan en un contexto más amplio. Por otra parte, el problema de la creación de diccionarios frecuentes "pasó a otra dimensión" cuando los conductistas y positivistas estadounidenses, en busca de ejemplos de uso, encontraron libros electrónicos: el rápido desarrollo de la tecnología electrónica permitió no solo almacenar sino también procesar enormes cantidades de textos. La lingüística de libros de texto se remonta a 1961, cuando Nelson Francis y Henry Kučera anunciaron y comenzaron a desarrollar el famoso libro de texto electrónico de la lengua escrita Brown (Brown University), John Sinclair —en el mismo formato LOB (Lancaster-Oslo/Birmingham)— y el profesor de la Universidad de Harvard, John C.
Diccionario de la Lengua Española y sus variantes. pp. 25. En 1959, Randolph Ouirk anunció el Survey of English Usage (SEU), que fue seguido por Jan Svartvik en la Universidad de Lund con el London-Lund Corpus of Spoken English (LLC). El volumen total de los textos mencionados en ese momento era de aproximadamente 1-1,15 millones de usos de palabras, y más textos similares aparecieron después (véase Aijmer, Altenberg 1991: 1tt.). El volumen de los libros de texto de la segunda generación se calcula en decenas de millones, de la tercera — ya en cientos y miles. En el mundo sigue siendo actual el problema de la compatibilidad de los programas informáticos y los programas de trabajo individuales: se han acumulado ya enormes volúmenes de libros de texto —cientos de millones de palabras (es básicamente la forma electrónica de la biblioteca), pero ¿cómo usarlos cómodamente, cómo contar las frecuencias más elementales, cómo no perderse en el océano de palabras? Después de todo, ¿la cantidad siempre determina la calidad? En los diccionarios de frecuencias se ha comprobado que la mitad de las palabras estudiadas se usan solo una vez. Por lo tanto, cada vez que empiece a trabajar, debe considerar cuidadosamente si las tareas planteadas realmente requieren trabajar con una gran cantidad de material, buscando las palabras más raras. A veces, cuando se estudian ciertas leyes gramaticales o de construcción de palabras, es realmente irracional aumentar el tamaño de la población estudiada, y se deben evaluar todos los criterios estadísticos, ya que mostrarán la probabilidad de que la muestra sea suficiente para sacar conclusiones representativas. En particular, se debe prestar atención a los textos que componen la población de estudio, es decir, cómo se construye el modelo del objeto de estudio. En la actualidad, la mayoría de los estudiosos de la lingüística lituana se preguntan qué es lo que debería considerarse como lengua lituana común, qué estilos lingüísticos funcionales deberían estar representados en ella, o qué capas lingüísticas deberían distinguirse según otros criterios. Por ejemplo, el mencionado texto de la Universidad Vytautas Didysis se ha elaborado según unos principios de selección, mientras que el Diccionario común de la lengua lituana escrita actual se ha elaborado según otros, por lo que los resultados obtenidos son diferentes. Los datos estadísticos sobre, por ejemplo, las partes individuales del lenguaje extraídas de diferentes libros de texto deben evaluarse con mucho cuidado y objetividad. Se ha observado que en los trabajos ya escritos o en curso de este tipo no se presta suficiente atención a los textos que se han estudiado y se hacen generalizaciones sobre el "lenguaje lituano actual". El trabajo con números requiere precisión, de lo contrario se obtienen conclusiones engañosas. El texto electrónico del Diccionario de uso frecuente de la lengua lituana escrita actual (1,2 millones de usos de palabras) que se discute en el artículo está dedicado a los textos de primera generación (tipo Brown, LOB) —con un volumen de más de un millón de palabras. En este caso, el texto tiene un significado más amplio que el de los textos anteriores, y es más fácil de comprender. Las tecnologías informáticas han proporcionado a los lenguajes analíticos condiciones excepcionales: programas especiales, pero bastante difundidos (en particular el conocido de la Universidad de Oxford — Oxford Concordance Program, así como KWIC, KAYE, CLAN, OCE, WordCruncher, etc.) permiten elaborar listas de las palabras más comunes, presentar sus concordancias con relativa facilidad (Leech 1991: 10; Utka 2000). Estos programas suelen ser utilizados por los investigadores de la Universidad Vytautas Magnus de la colección de textos de la lengua lituana actual, pero solo se pueden analizar las palabras, es decir, el léxico, ya que se presenta el conocimiento sobre el final de la palabra, que, como se sabe, es especialmente importante para el lituano. Por lo tanto, los lenguajes sintéticos son más complicados: los programas descritos producen listas de formas de palabras, no de palabras de título. Se requiere un trabajo adicional considerable antes de que las formas de las palabras se subconjuguen y se conviertan en palabras de título. Tales listas de palabras, que también tienen un examen gramatical, ya se llaman anotadas, no son muchas en el mundo, son muy apreciadas, ya que requieren un costo de trabajo considerable, por lo que son
26 | LAIMA El proceso de selección de los textos, su compilación en el teclado de la computadora, su análisis morfológico semiautomatizado (llamado LEMAVIMAS), su corrección y la introducción de los datos en la computadora requieren seis años de trabajo de una sola persona. Los cálculos y las revisiones posteriores requieren varios años de nuevo, ya que cualquier imprecisión en la realización de operaciones matemáticas puede convertirse en absurdo. En general, los diccionarios de uso común, especialmente con la llegada de los libros de texto electrónicos, ahora pueden ser creados de muchas maneras diferentes, dependiendo de lo que se esté buscando. La razón principal por la que se están creando nuevos diccionarios de uso común, especialmente aquellos que pretenden ser diccionarios de la lengua actual n, es que la condición básica de la estadística lingüística, al igual que de las estadísticas específicas, es que la muestra debe ser representativa de la población estudiada. En resumen, se cuestiona constantemente si la muestra examinada refleja realmente la totalidad prevista. Por ejemplo, el diccionario de uso frecuente de la lengua lituana actual preparado por la Universidad Vytautas Didysis, que contiene hasta 60 millones de usos de palabras, sería diferente de los diccionarios ya publicados por L. Grumadienė y V. Žilinskienė (1997, 1998), ya que sus resultados reflejarían la totalidad de los textos, que se basan en el 70% de publicaciones periódicas, 2.696 publicaciones no periódicas y el 4% de publicaciones traducidas (Marcinkevičienė 2000a: 16). La selección de los textos de los diccionarios publicados se basa en una base completamente diferente: se trata de textos originales, no traducciones, de cuatro estilos funcionales del lenguaje: periodístico, de oficina, de ficción y científico. Esto se debe a que la lengua común lituana, especialmente la lengua escrita, todavía se está formando, normalizando y codificando en el espíritu de las ideas del Club Lingüístico de Praga (por cierto, cabe señalar que ahora el término ESTILO se define de manera bastante diferente en las diferentes escuelas de lingüística). Se siguieron los principios de otros compiladores de diccionarios comunes, en particular los checos, rusos, letones, que también se adhirieron a la definición de la lengua común —la suma de los estilos lingüísticos funcionales— expuesta aquí anteriormente, se aplicaron sus experiencias y, por lo tanto, como ellos, se eligió una selección de 300 000 palabras de uso de cuatro estilos funcionales, ya que se consideró que para el lituano escrito los principios de la compilación del texto de la Universidad Vytautas Didysis (que, por cierto, apareció más tarde que el nuestro), más cercanos a la concepción de la lengua común (o estándar, como es habitual allí) de los americanos, eran todavía demasiado tempranos. El diccionario común del lituano escrito actual a veces carece de vocabulario cotidiano, ya que se olvida que se formó solo sobre la base del lenguaje escrito público: no contiene cartas privadas, diarios, notas en la pared, etc. Sin embargo, en el diccionario también se han incluido palabras del habla cotidiana, entre las que no solo se encuentran expresiones extrañas, dialectos, sino también ejemplos de léxico pejorativo que no se tolera en el lenguaje común, por lo que las autoras del diccionario reciben constantemente reproches. La cuestión es qué se considera literatura de ficción: esas palabras estaban en textos de ficción (en textos originales editados en Lituania con una tirada de más de 100 ejemplares), y el postulado de la elaboración de un diccionario común es no descartar ninguna palabra significativa, a menos que sea un número, una abreviatura o un error de corrección. Por cierto, los datos muestran que al seleccionar muestras de 300.000 palabras de uso para cada uno de los cuatro estilos funcionales, en el estilo periodístico se encontraron 284.687 palabras significativas (15.313 llamadas «basura»), en el estilo material —279.505 (por las razones mencionadas no ingresadas en el diccionario —20.495), en el científico —278.311 (21.689), en el ficcional —290.561 (9.439). El corazón no permitió que la palabra verdadera Lituania fuera eliminada, por lo que como excepción fue la única palabra verdadera que entró en el diccionario (resulta que es la 16ª palabra por frecuencia, la primera de los sustantivos, su frecuencia es de 5151 incluso 614 muestras: aquí determinó los documentos oficiales,
El nombre de la ciudad y de sus alrededores se refiere a la presencia de numerosas fuentes históricas y arqueológicas, muchas de las cuales se encuentran actualmente en ruinas. Los nombres de los países del mundo, como Oriente, Occidente, Sur, Norte, etc., pueden ser considerados también como nombres de fiestas religiosas y otras celebraciones (a menudo utilizados como nombres genéricos). En el caso de los libros de texto, se trata de un conjunto de textos escritos en un lenguaje sencillo, que no requieren ningún tipo de preparación previa, como por ejemplo: textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar, textos de texto escolar. El 19 de octubre de 1994, el Consejo de Ministros aprobó la Ley 19/1994, de 19 de noviembre, de Ordenación de los Servicios Públicos de la Comunidad Autónoma de Canarias, por la que se establecen los siguientes servicios: 1) Servicios de información, comunicación y difusión; 2) Servicios de información, comunicación y difusión; 3) Servicios de información, comunicación y difusión; 4) Servicios de información, comunicación y difusión. Los textos de estilo temático fueron seleccionados por Pranas Kniūkšta y Danutė Vainauskienė de publicaciones y documentos de 1990-1995 en siete grupos temáticos: 1) leyes y documentos que las acompañan, comentarios, 2) documentos jurídicos, 3) guías y documentos de economía y negocios, 4) publicaciones de ciencia política, documentos de partidos, 5) publicaciones de estándares y estadísticas, 6) fuentes de información (bibliografías, catálogos, diccionarios), 7) publicaciones de ámbitos sociales individuales. (documentos de defensa nacional, seguridad social, educación, cultura, etc.). El Instituto de Ciencias Sociales y Humanas (ICSH) es un centro de investigación de la Universidad Autónoma de México (UAM) que se encuentra ubicado en la ciudad de México y que se divide en ocho áreas temáticas: 1) Ciencias Sociales, 2) Ciencias Naturales, 3) Ciencias Humanas, 4) Ciencias Sociales y Humanas, 5) Ciencias Sociales y Humanas, 6) Ciencias Sociales y Humanas, 7) Ciencias Sociales y Humanas, 8) Ciencias Sociales y Humanas, 9) Ciencias Sociales y Humanas, 10) Ciencias Sociales y Humanas, 11) Ciencias Sociales y Humanas, 12) Ciencias Sociales y Humanas, 13) Ciencias Sociales y Humanas, 14) Ciencias Sociales y Humanas, 15) Ciencias Sociales y Humanas, 16) Ciencias Sociales y Humanas, 17) Ciencias Sociales y Humanas, 18) Ciencias Sociales y Humanas, 19) Ciencias Sociales y Humanas. La lista de los 100 mejores libros de 2008 de la revista Time, que se publicó el 15 de octubre de 2008, se divide en cinco categorías: 1) libros de ciencia ficción, 2) libros de ciencia ficción de fantasía, 3) libros de ciencia ficción de fantasía de fantasía, 4) libros de ciencia ficción de fantasía de fantasía, 5) libros de ciencia ficción de fantasía de fantasía, 6) libros de ciencia ficción de fantasía de fantasía. Estos textos son los que se consideran como la lengua escrita actual de Lituania. De ellos, se seleccionaba al azar (las páginas y líneas se seleccionaban de acuerdo con una tabla de números aleatorios) una muestra de 1000 palabras, y se montaba el teclado de la computadora (aproximadamente dos horas de trabajo). En este caso, el análisis se realiza a través de un programa de análisis morfológico y de normalización (MAN). En 2000, la Universidad de Vytautas el Grande de Lituania aš le encargó una versión mejorada y la llamó lemuoklis (lemuoklis es una palabra lituana que significa "lemuo" en lituano). El trabajo se veía más o menos así: se recibe una hoja de cálculo de la que hay que “barrillar” las líneas innecesarias (subrayado por mí). Por ejemplo, el texto de un hombre, no solo el texto procesado por una máquina (...) me parece que toda esta comedia (...) es como esta: 1 PAV. EJEMPLOS DE DETERMINACIÓN DE TEXTO pensarme envr vns K pensarme vks dlv veik bk no pensarme vyr vns V
Página 34 de 34 Rango Frecuencia dkt vks bdv prv ívr 301-350 460-374 19646 10424 2420 2073 393 54,28% 28,80% 6,69% 5,73% 1,09% 351-400 373-313 18504 7550 3381 1347 654 53,04% 21,64% 9,69% 3,86% 1,87% 401-450 312-260 19156 7865 3976 522 304 57,20% 23,49% 11,87% 1,56% 0,91% 451-500 259-205 21718 9987 4806 2486 471 53,17% 24,45% 11,76% 6,08% 1,15% Diccionario de la Lengua Española, Volumen 1, página 800. Frecuencia de las partes de la lengua y de las palabras generales Clasificación Frecuencia dkt vks bdv prv jvr 501-550 204-155 22494 13153 7023 2481 525 46,97% 27,46% 14,66% 5,18% 1,10% 551-600 154-106 30834 17197 6221 4419 151 50,91% 28,39% 10,27% 7,29% 0,25% Diccionario de la Lengua Española, Volumen 2, página 1200. Frecuencia de las partes del lenguaje y de las palabras generales Clasificación Frecuencia dkt vks bdv prv pvr 601-650 105-56 45751 20328 12145 5822 433 52,31% 23,25% 13,88% 6,66% 0,50% Diccionario mínimo de la lengua lituana oficial de la categoría de calificación III (aproximadamente 2500 palabras)
Diccionario de la Lengua Española IR JO BASE | 35 skt prl jng dll ist; jst Suma 426 - & 812 — 36194 1,1796 2,2496 3,02% - — 1407 2043 — 34886 4,03% 5,87% 291% 276 — 272 1118 — 33489 0,82% 0,81% 3,34% 2,79% 255 224 210 700 3 40857 0,6296 0,55% 0,51% 1,71% 3,40% palabras) sobre el 56,66% texto (muestra) iš 1,2 min. Usos de la palabra). 56,66% CATEGORÍAS MÍNIMO ZODYNO Estadísticas lingüísticas ANÁLISIS: skt prl jng dll ist; jst Suma 530 342 177 795 371 47891 1,11% 0,71% 0,37% 1,66% 0,78% 3,99% 520 275 132 713 109 60571 0,86% 0,45% 0,22% 1,18% 0,18% 5,05% palabras) sobre el 65,70% texto (muestra) iš 1,2 millones de dólares Usos de la palabra). 9,0496 Iš cara: (=65,7096) ANÁLISIS LINGÜÍSTICO-ESTADÍSTICO DEL VOCABULARIO MÍNIMO DE LAS CATEGORÍAS: skt prl jng dll ist; jst Suma 460 341 372 1697 102 87446 0,52% 0,40% 0,42% 1,94% 0,12% 7,29% palabras) sobre el 78,04% texto (muestra) iš 1,2 millones de dólares Usos de la palabra). 7,2996 Iš cara: (=78,04%)
AUMER, K., ALTENBERG, B. 1991: Introducción a la teoría de la comunicación. Aijmer, K., Altenberg, B., eds., Lingüística del Corpus Inglés. Estudios en honor de Jan Svartvik, Londres-Nueva York: Longman. ALAMEDA, J. R., CuEros, E 1995: Diccionario de frecuencias de las unidades lingiiisticas del castellano, Universidad de Oviedo. 1983: El arte de la ciencia, Madrid: Ediciones del Centro de Estudios Avanzados. 1997: El arte y la vida: una reflexión sobre el arte y la vida, Universidad de Granada. 1998: El estilo y la duración de la frase. 47 (1), 17-28. EATON, H. 1934: Lista comparativa de frecuencias de las primeras mil palabras en inglés, francés, alemán y español. Coleman, A., ed., Experimentos y estudios en la enseñanza de idiomas modernos, Chicago. Garcia Hoz, V. 1953: Vocabulario usual, comun y fundamental. Madrid: Consejo Superior de Investigaciones Cientificas —Instituto „San José de Calasanz- ®. GRUMADIENE, L., ZILINSKIENE, V. 1997: Dažninis Zodynas dabartinés rasomosios lietuviy kalbos (decreasing frequency order), Vilnius: Instituto de Matemáticas e Informática, Instituto de Lengua Lituana. 1998: Diccionario de la Lengua Española, 1999: Diccionario de la Lengua Española, 2000: Diccionario de la Lengua Española, 2001: Diccionario de la Lengua Española, 2002: Diccionario de la Lengua Española, 2003: Diccionario de la Lengua Española, 2004: Diccionario de la Lengua Española, 2005: Diccionario de la Lengua Española, 2006: Diccionario de la Lengua Española, 2008. HiLLERICH, R., www: eduplace. com: Palabras y vocabulario de alta frecuencia. JAKUBAITE, T. e.a. 1966-1976: Diccionario de la lengua letona, 1.4. séjumi, Riga: Zinatne. JosseLsoN, H. 1953: El conteo de palabras rusas y el análisis de frecuencia de las categorías gramaticales del ruso literario estándar, Detroit: Periodical Service Co. JuiLLAND, A., RODRIGUES, E. Ch. 1964: Diccionario de frecuencia de palabras españolas, La Haya: Mouton. JUILLAND, A., EDWARDS, P. M., JUILLAND, I. 1965: Diccionario de frecuencia de palabras rumanas, La Haya: Mouton. JUILLAND, A., TRAVERSA, V. 1973: Diccionario de frecuencia de palabras italianas, La Haya: Mouton. 1898: Haufigkeitswörterbuch der deutschen Sprache (Diccionario de frecuencias de la lengua alemana), Steigliz, cerca de Berlín. 1993: Diccionario de la Lengua Española, Madrid: Editorial de la Enciclopedia de la Ciencia y la Tecnología. 2000: Diccionario de la Lengua Española, Madrid: Editorial de la Enciclopedia de la Ciencia y la Tecnología. KENNEDY, G. 1998: Introducción a la Lingüística de Corpus, Londres-- Nueva York: Longman. 1991: Diccionario invertido de la lengua lituana, Kaunas: Šviesa. 1954: La lengua de los hombres, en: Diccionario de la Lengua Española, Ed. 1972: Diccionario de la lengua española actual, Madrid, Ed. LEECH, G. 1991: El estado de la técnica en la lingüística de corpus, Aijmer, K., Altenberg, B., eds., Lingüística del Corpus Inglés. Estudios en honor de Jan Svartvik, Londres-- Nueva York: Longman. LONNGREN, L. 1993: Yacmomnoiū crosape cospemennozo pycckozo aswika. Uppsala. (Acta Universitatis Upsaliensis, Studia Slavica Upsaliensia 32) MARCINKEVICIENE, R. 2000a: Textyny Linguistika (Teoría y práctica). Obras y días 24, 7-64. MARCINKEVICIENE, R. 2000b: Patrones de uso de palabras en la lingüística de corpus. 49 (3): 71-80. MAZEJKA, N. S. (Max3iika, H. C.), SUPRUN, A. Ja. 1976: Yacmomnoi: cnoynix Genapyckaii Moet (macmaykas nposza), Minck: Beinasenrsa BJ1V ims V. Jlenina. 1991-1992: El nuevo lenguaje de programación Java (en inglés Java New Language) 1992-1996: El nuevo lenguaje de programación Java (en inglés Java New Language) 1996-1997: El nuevo lenguaje de programación Java (en inglés Java New Language) 1997-1998: El nuevo lenguaje de programación Java (en inglés Java New Language) 1998-1999: El nuevo lenguaje de programación Java (en inglés Java New Language) 1999-2000: El nuevo lenguaje de programación Java (en inglés Java New Language) 2000-2001: El nuevo lenguaje de programación Java (en inglés Java New Language) 2001-2002: El nuevo lenguaje de programación Java (en inglés Java New Language) 2002-2003: El nuevo lenguaje de programación Java (en inglés Java New Language) 2003-2004: El nuevo lenguaje de programación Java (en inglés Java New Language) 2004-2005: El nuevo lenguaje de programación Java (en inglés Java New Language) 2005-2006: El nuevo lenguaje de programación Java (en inglés Java New Language) 2005-2007: Doctor en Derecho por la Universidad Complutense de Madrid. 1998: "Las palabras de la vida" (traducción de la traducción al español de "Las palabras de la vida"). Ensayos de Lingüística General, 39, 240-247. 1999. «Diccionario de la Lengua Española». Lituanistica 2 (38), 92-98. 2000: La comunicación en la red: hablando por escrito. 1994, pp. 99-107.
Diccionario de la Lengua Española, 1976, pp. 127. Diccionario de la Lengua Española, 1976, pp. 127. Diccionario de la Lengua Española, 1976, pp. 127. Diccionario de la Lengua Española, 1976, pp. 127. 1986: Onsir co3nanus HaUHOHANBLHBIX JIEKCHKOTpaOHUeCKHX CJIyxO 3a pybexom. Capitán IO. H., pea., Mauunnor pono pycckozo asvika: udeu u cymcoenus, Mocksa: Hayka, 75-83. 1999. «El niño de la calle». Doctor en Derecho por la Universidad Complutense de Madrid. 1994: La lengua de los sueños (The Language of Dreams, 1994), en inglés. 1963: Yacmomnbtū crosaps COBPEMEHHO20 PYCCKO20 iumepamypno2o A3bIKA, Tannun. TESITELOVA, M. e.a. 1983: Frekvenéni slovník češtiny věcného stylu, Praga: Academia- -Nakladatelstvi Československé akademie věd. THORNDIKE, E., LORGE, L. 1944: Un Libro de Palabras del Maestro de las Veinte Mil Palabras Más Frecuentes y Amplias en la Lectura General para Niños y Jóvenes, Nueva York: Appleton— Century Crofts. TopoRova, E., PANCOVSKA, R. 2001: Yecmomen peunux na 6wrzapckama nybauyucmuxa (1944— 1989), Codus: Ilencodr. 2000: El lenguaje y sus posibilidades. 24, 275-285. VACAR, N. P. 1966: Un recuento de palabras del ruso hablado. El uso soviético, Ohio: Universidad Estatal de Ohio Prensa. VANDER BEKE, G. 1929: Diccionario de la lengua francesa, Nueva York: Macmillan. ZASORINA, L. N., red., 1977: Yacmomuwiit caoeape pycckozo aswika, Mocksa: UsnatensctBo «PycckHH A3BIKY. 2000: La vida de los animales: Análisis morfológico. Historia y Sociedad, 24, 267-273. 1990: Diccionario de la Lengua Española, Madrid: Editorial Planeta. 1995: Diccionario de la Lengua Española, Madrid: Instituto de Lengua y Literatura Españolas. 1998: El primer diccionario de la lengua española moderna (1998). Ensayos de Lingüística General, 39, 219-227. ŽILINSKIENĖ, V., GRUMADIENĖ, L. 1998: Valstybinės kalbos mokėjimo kvalifikacinių kategorijų lietuvių-rusų kalbų minimalusis žodynas (pirmoji kvalifikacinė kategorija), Kaunas: Šviesa. ŽILINSKIENĖ, V., GRUMADIENĖ, L. 1999a: Valstybinės kalbos mokėjimo kvalifikacinių kategorijų lietuvių-rusų kalbų minimalusis žodynas (antroji kvalifikacinė kategorija), Vilnius: UAB „Nacionalinių tyrimų centro“ leidykla. ŽILINSKIENĖ, V., GRUMADIENĖ, L. 1999b: Valstybinės kalbos mokėjimo kvalifikacinių kategorijų lietuviy-rusy kalbų minimalusis žodynas (trečioji kvalifikacinė kategorija), Vilnius: UAB „Nacionalinių tyrimų centro“ leidykla. 2001: La lengua y la literatura en el siglo XIX: un estudio de la evolución lingüística y literaria de la lengua española. Linguistica Lettica 9, 155-168. Zilinskiene, V. spausd. : Características estadísticas de la morfología del estilo sustantivo de la lengua lituana y su comparación con las características correspondientes de la publicística. Lituanística. Consultado el 19 de abril de 2010. Instituto de Lenguas de la UNAM P. Vileišio g. 5, LT-2055 Vilna, Lituania laigruma(dtakas.lt
