scieee AI-readable full text Open interactive document viewer

„Dabartinės rašomosios lietuvių kalbos dažninis žodynas“ ir jo bazė

Laima Grumadienė

Full text

ACTA LINGUISTICA LITHUANICA XLVI (2002), 19 -37 Dicionário da Língua Portuguesa e suas variantes LAIMAGRUMADIENE Lietuviy kalbos institutas Existem poucas bases de dados eletrônicas para o lituano. Os maiores são o Dicionário de Frequência da Lituânia Escrita Moderna, compilado por V. Zilinskiené e L. Grumadiené, e o Corpus da Língua Lituana da Universidade de Kaunas. O primeiro é apresentado em detalhe aqui: os princípios de sua compilação e seus possíveis usos são discutidos, e o trabalho publicado até agora em linguística estatística com base nele é brevemente caracterizado. Os principais problemas em relação às bases de dados para o lituano moderno são: (1) sua diferenciação insuficiente (refletem apenas a língua escrita, não a falada), (2) seu uso inadequado, já que a comunidade acadêmica lituana não tem a preparação necessária para trabalhar com tais ferramentas, e (3) o fato de que os esforços dos acadêmicos que as compilam recebem pouco reconhecimento público e não são valorizados como realizações acadêmicas originais. 1. ENVELHECIMENTO ELETRÓNICO DAS BASES DE DADOS Atualmente, a linguística lituana está como que congelada no banco do tigre: os trabalhos mais destacados que surgiram após o impulso recebido principalmente do estruturalismo já foram escritos, mas a expectativa de novos trabalhos, não inferiores, ainda está no ar. Isso requer não apenas uma abordagem diferente dos fenômenos linguísticos, mas também novos métodos e ferramentas de trabalho ainda não testados. Na era da tecnologia da informação, as novas ferramentas de trabalho dos linguistas estão frequentemente ligadas a bases de dados eletrónicas, que por sua vez estão ligadas a publicações linguísticas estatísticas. A diferença entre os dois parece evidente, uma vez que as bases de dados eletrónicas são dinâmicas e podem ser consultadas de forma autónoma, ao passo que as publicações são estáticas e não passam de um conjunto de dados fornecidos a pedido dos autores. No entanto, no passado, e às vezes até hoje, essas bases e publicações foram ou são identificadas. A história dos dicionários reversos (também chamados de inversos) mostra isso. O primeiro dicionário retroativo lituano, elaborado pelo americano David F. Robinson em 1954, compreendeu cerca de 45.000 palavras, embora ele não tenha uma base de dados eletrônica, pelo menos o autor não menciona isso. Além disso, naquela época, uma base de dados eletrônica não estaria disponível na Lituânia, pois o dicionário em si só foi lido por poucos, já que foi publicado em pequenas tiragens nos Estados Unidos. 1991 - O alfabeto latino é substituído pelo alfabeto cirílico. A versão de 1972 do dicionário, com quase 22.000 palavras, também foi baseada no DLKŽ, mas já na edição de 1972. O trabalho foi feito através de uma base de dados eletrônica criada por ele, mas esta não é de uso público (provavelmente por razões técnicas), portanto, está disponível apenas em formato de livro impresso. O dicionário de 1995 de Vidas Žilinskienės Atgalinis lietuvių kalbos dabartinis žodynas (Dicionário Reverso da Língua Lituana Atual) não é apenas uma transcrição do DLKZ, pois as palavras são apresentadas em ordem inversa, divididas por partes da língua, com análise estatística adicionada. Atualmente está disponível apenas em versão impressa, embora também exista uma versão eletrônica. Além disso, ele foi o autor de vários livros, incluindo o Dicionário da Língua Portuguesa (1998) e o Dicionário da Língua Portuguesa (1999). Além disso, o último dicionário e análise foram preparados usando a versão computadorizada do DLKŽ (1993) e sua análise estatística, e não, como indicado em sua revisão por Rūta Marcinkevičienė (2000a: 16), a base do Frežninis dabartinės rašytinės lietuvių kalbos žodynas (Grumadienė, Žilinskienė 1997; 1998). A edição de 1993 do Dicionário de Matemática e Informática (em inglês: Dictionary of Mathematics and Computer Science) foi publicada em 1995, mas não foi distribuída devido à falta de recursos financeiros. Atualmente, o Instituto da Língua Lituana voltou a trabalhar no DLKŽ, mas a edição de 2000, com a computação (dirigida por Stasys Keinys), recebeu apoio financeiro da Fundação da Ciência da Lituânia. Como é sabido, as edições de 1993 e 2000 do LMC diferem pouco entre si, pelo que é surpreendente que se tenha decidido não utilizar a versão electrónica anterior, simplesmente porque foi preparada num ambiente DOS e numa base FOXPRO já moralmente obsoletos: voltou-se a digitalizar com um leitor de computador o texto electrónico já existente, que só necessita de pequenas correcções, aumentando assim os custos de trabalho e os custos. Será que até a análise estatística será refeita? No entanto, tal como a versão electrónica da edição de 1993 do CLP, muitas bases de dados electrónicas estão a tornar-se obsoletas, pelo que é óbvio que a sua manutenção deve ser objecto de preocupação. Tal como aconteceu com a versão electrónica dos LMR (1993), não será que as bases de dados electrónicas, que oferecem muitas oportunidades de trabalho inovador e são dispendiosas, serão mais valorizadas pelos institutos em geral? Os lituanos devem chegar a acordo sobre as bases de dados electrónicas que utilizam caracteres específicos, como, por exemplo, escritas antigas e textos transcritos de dialetos, uma vez que já temos de refazer a selecção de artigos com exemplos deste tipo se, por uma razão ou outra, decidirmos submetê-- los a publicações da Universidade de Vilnius e não, por exemplo, às publicações do Instituto da Língua Lituana. Os dicionários de dialetos e os textos de dialetos publicados atualmente, embora em formato eletrônico, são apenas um sinal da modernização da tipografia, uma vez que não é possível utilizar seus textos como base de dados eletrônica. Assim, sem um acordo entre os lituanos sobre um sistema comum de codificação (por exemplo, o Unicode ou outro), o acesso público a bancos de dados electrónicos torna-se muito difícil, para não falar da utilização muito limitada, e por vezes impossível, de tecnologias electrónicas e programas para a sua análise. Será que temos tantas que não conseguimos abranger? O problema reside no facto de nem os linguistas nem os informáticos que os apoiam terem ainda compreendido devidamente que as bases de dados devem ser dinâmicas, capazes de lidar com a multiplicidade de novas aplicações e tecnologias que estão a surgir, e que devem poder ser actualizadas. Até agora, a maioria dos bancos de dados eletrônicos criados na Lituânia são feitos como se fossem as mesmas folhas com LINGUAGEM CONTEMPORÂNEA DICIONÁRIO FREQUENTE E SUA BASE |21 dados de idiomas, apenas compilados pelo teclado do computador. Em breve, esses dados poderão ser comparados a uma escritura dentária esculpida em pedra: a nova geração de telas de computador mostrará apenas "marcas" e "quadrados", que poderão ser decifrados por futuros linguistas sem comparação com a leitura das runas. Até agora, os debates sobre esta questão têm sido infrutíferos, mas, aparentemente, não devemos perder a esperança e vale a pena voltar a apelar ao debate e à concertação. A propósito, deve-se prestar atenção aos termos: BASE, BANCO, TEXTO (CORPO), ARQUIVO em formato eletrônico. O mais moderno deles é o TEXTIL (CORPO). O termo é usado para se referir a um conjunto de textos em formato eletrônico, e é frequentemente usado para se referir a quase tudo o que antes era chamado de banco de dados. O termo BANCO é geralmente associado à terminologia: bancos de termos geralmente não são chamados de livros de texto. Atualmente, o termo ARCHYVO está cada vez mais associado à dimensão do tempo: o armazenamento eletrônico de dados antigos pode ser chamado de arquivo ou banco de dados. Assim, o termo mais neutro é BASE DE DADOS ELECTRÔNICA, que é o mais usado aqui. (cf. Kennedy 1998: 3 pp. ) 2. LÍNGUAS CONTEMPORÂNEAS ELETRÔNICAS Não existe uma sobrecarga de bases de dados em formato eletrônico para a língua lituana. Além disso, a linguagem é mais simples, com pouca utilização de linguagens de programação. A fonologia é a ciência que estuda a fonologia e os fonemas de uma língua. Talvez isso tenha acontecido devido à própria natureza da fonética, ou seja, devido ao fato de que a repetição frequente das mesmas unidades — sons — simplesmente traz conclusões baseadas em estatísticas, ou talvez devido a fatores subjetivos, ou seja, devido ao surgimento de pesquisadores de pensamento inovador: em primeiro lugar, Alex Girdenis e seus alunos, bem como Antanas Pakerys. Além disso, ambos os grupos de línguas eram influenciados por línguas eslavas e, portanto, tinham uma grande variedade de fonemas. É verdade que a própria fonética é uma área intermediária entre as ciências exatas e a linguística. Outro campo da linguística que estuda a frequência de unidades repetitivas é a morfologia. Assim, seria lógico supor que, em primeiro lugar, neste domínio, já deveria haver necessidade de operar com dados estatísticos linguísticos e bases de dados eletrônicas. Até agora, isso não aconteceu, embora já existam trabalhos e instrumentos de trabalho. O primeiro trabalho de linguística estatística sobre léxico e morfologia na Lituânia foi feito por Vida Žilinskienė (1990). O seu dicionário de uso comum da língua lituana baseia-se em dados de um dos estilos funcionais, a publicística, e contém uma análise do uso de 300 000 palavras (isto é, tanto os mesmos lexemas como os diferentes, que foram 18 776, tendo sido recusadas 11 956 palavras verificadas devido às regras geralmente aceites para a elaboração de dicionários de uso comum). Todos os textos contínuos, compostos por trechos (amostras) de 1000 palavras cada, foram analisados morfologicamente, intercalados, perfurados e inseridos nos agora moralmente obsoletos e não utilizados ESM Minsk-22. Existe um banco de dados electrónico, mas seria muito difícil de utilizar. Infelizmente, nem a análise lexicológica, nem a morfológica, nem a acentuológica de uma das variantes atuais da língua lituana — a publicística — nem a análise textual e linguística estatística, até agora, foram utilizadas adequadamente, nem para fins científicos nem práticos, especialmente para a escrita de livros didáticos e dicionários educacionais. Um dos meios eletrónicos (participação inter- 22 | LAIMA O estudo da morfologia e da morfologia da linguagem infantil é um dos temas da tese de doutorado de Ineta Savickienė (1999), sobre a morfologia da linguagem infantil. Além disso, é importante mencionar que outros trabalhos sobre consoantes, estilística e, em parte, sintaxe, cujas unidades são muito menos frequentes, baseados em dados linguístico-- estatísticos, em particular de Audronė Bitinienė (1983, 1997, 1998, etc.), surgiram já há dezenas de anos. Atualmente, existem vários estudos que tentam explicar a origem da língua. Atualmente, a maior parte dos estudos sobre a língua são realizados por pesquisadores da Universidade de São Paulo (USP) e da Universidade Federal de Minas Gerais (UFMG), com a participação de aproximadamente 2000 pesquisadores, entre eles, o professor de línguas e literaturas estrangeiras da UFMG, José Carlos de Souza (1999). Apesar de ser um dos poucos programas de computação em nuvem que oferecem a possibilidade de se trabalhar em tempo real, a maioria dos programas de computação em nuvem (embora não todos) utilizam um sistema de computação em nuvem (ou seja, um sistema de computação em nuvem) para executar suas tarefas. Atualmente, a Universidade de São Paulo está realizando o curso de pós-graduação em Pedagogia, com a participação de professores da Universidade de São Paulo, e também com a participação de alunos de outras instituições. Atualmente, o estudo da língua portuguesa é feito por meio de estudos de línguas, e não por estudos linguísticos, como é o caso do estudo da língua portuguesa. O surgimento de bases de dados eletrônicas próprias, sem dúvida, dará um novo impulso à dialectologia lituana: o Instituto da Língua Lituana já está preparando a criação de um Centro de Dialetos, no qual os registros de dialetos serão preparados em formato eletrônico e os textos transcritos serão decifrados. Além disso, a instituição também possui um banco de dados de nomes e topônimos. A base de dados eletrônica do Grande Dicionário da Língua Lituana, que já está em preparação, deverá ser um verdadeiro ponto de viragem na lexicografia lituana, e muito se espera da base de dados eletrônica do Dicionário Geral da Língua Lituana. Os professores da Universidade de Vilnius, liderados por Evaldas Jakaitienė, estão envolvidos em um dos projetos da União Europeia e estão preparando uma lista eletrônica de palavras lituanas, que deverá servir de base para uma nova série de dicionários bilíngues. Além disso, é uma das línguas oficiais da União Europeia, com a língua lituana como língua oficial. Além disso, a União Europeia, através da Comissão Nacional da Língua Lituana, começou a elaborar os chamados Portfólios de Termos ou Palavras Estrangeiras, uma espécie de lista de exemplos de termos e palavras mais recentes e muito usados em vários campos, distribuídos pela União Europeia a todos os seus membros e candidatos, para que as línguas possam se adaptar e se preparar para a crescente onda de traduções, bem como para a tradução automática. Atualmente, o Instituto de Estudos Políticos e Sociais (IEPS) é uma instituição de ensino superior pública brasileira, fundada em 2001, com sede em São Paulo, sob a coordenação do professor e pesquisador de ciências políticas e sociais Luiz Carlos de Souza. Além disso, o site também possui uma seção dedicada a vídeos, chamada de "Videos do Blog", onde os usuários podem ver e comentar os vídeos. A experiência mostra que só se obterão resultados se aprendermos a lidar com este tipo de dados e a explorar as novas oportunidades. Para isso, são necessários laboratórios onde isso seja ensinado, de preferência desde tenra idade. A própria natureza das bases de dados electrónicas pressupõe a publicidade e, uma vez organizadas, devem estar acessíveis a todos os interessados. O maior conjunto de dados sobre a língua lituana é o Instituto da Língua Lituana. O Dicionário Freqüente da Língua Contemporânea e sua Base de Dados |23 LT, portanto, com a modernização, ele deve se tornar o maior centro de preparação de bases de dados eletrônicas da língua lituana, uma fonte para o seu uso público, um centro de atração e irradiação de trabalhos e ideias desse tipo — talvez esse papel seja desempenhado pelo Centro de Lituanística que está sendo criado na base do Instituto da Língua Lituana? As bases de dados electrónicas que entrarem na Internet tornar-se-ão ainda mais abertas. A propósito, quando se tem acesso à Internet, o local onde se está a utilizar o computador deixa de ser importante; o que importa é o que está ligado à Internet. Mas esses são planos para o futuro. Até hoje, não existe uma legislação que regulamente a publicação de obras linguísticas estatísticas em formato eletrônico, nem uma que harmonize os direitos autorais, pelo que as obras impressas em papel continuam a ser relevantes. No entanto, as bases de dados eletrónicas e as publicações linguísticas diferem substancialmente, sendo estas últimas apenas a ponta do icebergue. A seguir, é discutida uma questão específica: a relação entre a base de dados eletrônica da língua lituana escrita atual e os dicionários linguístico-estatísticos. Além disso, a base de dados não pode ser usada sem uma base de dados, mas as possibilidades da base de dados estão longe de se limitar à publicação de dicionários. 3. ELETRÔNICA ESCRITURA CONTEMPORÂNEA LITUANIAN As bases de dados linguísticas eletrónicas distinguem-se, naturalmente, de outros conjuntos de dados linguísticos, em particular pela sua forma eletrónica e pela especificidade da utilização das tecnologias informáticas associadas. O surgimento de bancos de dados eletrônicos abriu novas possibilidades para o estudo da linguagem, mas não se limita ao surgimento de mídias eletrônicas modernas. O facto de os diferentes meios produzirem resultados essencialmente semelhantes, nomeadamente no que respeita às formas gramaticais frequentes e às características dos lexemas, demonstra que existem muitas semelhanças entre as bases de dados eletrónicas modernas e as suas análogas muito mais antigas. Em 1956, a Larousse, em França, começou a usar a antiga geração de máquinas de cálculo eletrônico (ECM) para produzir dicionários. 1986: 82). A questão de como construir uma base de dados de linguagem eletrônica moderna surgiu, por um lado, porque com o surgimento de novas tecnologias, já era possível lidar com grandes quantidades de informação, então o tamanho do texto para ilustrar uma palavra (ou seja, seu contexto) começou a aumentar. A partir daí, a linguagem passou a ser estudada em termos de semântica, sintaxe e, mais tarde, de sintaxe e semântica. Além disso, o número de edições de livros foi aumentando, até que, em 1996, o número total de livros publicados não ultrapassou os 100.000 exemplares, o que fez com que a editora tivesse de fechar as portas. Por outro lado, talvez o impacto da invenção de Gutenberg tenha sido igualado pelo aparecimento dos computadores e, sobretudo, pela sua proliferação a uma velocidade sem precedentes, de modo que, com a progressão geométrica da diversidade das comunicações humanas à distância, tanto com falantes da mesma língua como com falantes de línguas diferentes, surgiu uma necessidade social urgente de obter informação estatística sobre a língua em todos os seus aspectos, a fim de automatizar o maior número possível de processos de comunicação: ensino de línguas, tradução, reconhecimento, compressão, transmissão, etc. A linguística lituana não ficou à margem deste processo geral, embora, naturalmente, tenha ficado muito atrasada em relação ao tempo. No século XX, especialmente na segunda metade do século, o mundo estava se preparando para um novo salto. Em primeiro lugar, eram dicionários de línguas comuns. O primeiro apareceu no século XIX. 24 | LAIMA 2000 - Início do século XXI. O primeiro dicionário de alemão foi o de E. Kaeding (1898), com 11.000.000 de palavras. Em 1929, Vander Beke publicou um dicionário da língua francesa. Em 1934, H. Eaton produziu um dicionário comparativo das primeiras mil palavras mais comuns em quatro línguas: inglês, francês, alemão e espanhol. O primeiro dicionário geral de inglês foi elaborado por E. Thorndike e L. Lorge (1944), e o de espanhol por V. A. Jorge Garcia (1953). O primeiro dicionário de russo comum nos Estados Unidos foi preparado por H. Josselson (1953), e N. P. Vachar (1966), também nos Estados Unidos, publicou um dicionário comum de russo falado do período soviético, mas ele é essencialmente baseado apenas na linguagem de obras dramáticas. Em 1963, o professor E. Steinfeldt publicou em Tallinn um dicionário comum da língua de Pushkin. O dicionário de russo comum de Uppsala foi compilado por L. Lonngren (1993) com base em um corpus de 1.000.000 de palavras, composto por mais da metade de literatura de ficção e a chamada prosa informativa (jornalismo, cartas de escritório e literatura científica). Os primeiros dicionários de uso comum, não só do russo, mas também do romeno e do italiano, também foram elaborados na América — por A. Juillard, P. M. Edwards, I. Juillard (1965), A. Juillard, V. Traversa (1973) (aliás, A. Juillard, E. Ch. O termo foi introduzido em 1964 por J.R. Alameda e E. Cuetos, e mais tarde por J.R. Rodrigues (1964). Toda uma série de dicionários de uso comum foi baseada no conceito de estilos funcionais da linguagem do Clube Linguístico de Praga, bem como no conceito de linguagem geral de Boris Larin: o primeiro, como era de se esperar, foi o dicionário de estilos funcionais individuais da língua checa, e depois o dicionário geral, escritos por um grupo de autores liderados por Marie Těšitelová (J. Jelinek, J. V. Bečka e outros, ver Těšitelova 1983). Os letões, assim como os checos, foram rápidos em preparar estilos funcionais separados e, mais tarde, um dicionário geral de duas partes — T. Jakubaite, D. e Kristovska, D. 1966-1976: Gulevska, V. Ozola, R. Prūse, A. Rubine, N. Sika. A mesma metodologia foi usada por V. A. Agrayev, V. V. Borodin, V. M. Muratova, E. V. Tisenko, sob a direção de L. N. Zasorina (1977), para produzir um dicionário comum da língua russa moderna com base em 1.000.000 de palavras de quatro estilos funcionais. Apenas um estilo funcional — a literatura de ficção — é o dicionário frequente da língua bielorrussa, compilado por N. S. Mazeika e A. J. Suprun (Mažejka, Suprun 1976). Além disso, o dicionário da língua búlgara (Todorova, Pančovska 2001) é apenas de estilo publicístico. O primeiro dicionário de uso comum da língua lituana, elaborado por V. Žilinskienė em 1990, também era de um estilo funcional, publicístico, utilizando a mesma metodologia da língua checa, com grande cooperação com a língua letã. Ao longo do tempo, embora a língua lituana não possa se orgulhar disso, surgiram no mundo uma variedade de dicionários comuns: línguas de autores individuais, estilos funcionais, variantes de línguas regionais, línguas escritas e faladas, etc. O termo "linguagem de programação" é usado para se referir a qualquer linguagem de programação, embora a definição de "linguagem de programação" tenha sido usada para se referir a todas as linguagens de programação, e não apenas a algumas delas. Além disso, o problema de compilar dicionários de uso comum passou para outra dimensão quando os comportamentalistas e positivistas americanos começaram a procurar exemplos de uso em livros eletrônicos: o rápido desenvolvimento da tecnologia eletrônica permitiu não apenas armazenar, mas também processar enormes quantidades de textos. A linguística de livros de texto começou em 1961, quando Nelson Francis e Henry Kučera anunciaram e começaram a desenvolver o famoso livro de texto eletrônico da Brown University, o LOB (Lancaster-Oslo/- Birmingham) de John Sinclair. O dicionário da língua portuguesa moderna e sua base |25 tyną; Em 1959, Randolph Ouirk anunciou o SEU (Survey of English Usage), que foi seguido pelo LLC (London-- Lund Corpus of Spoken English) de Jan Svartvik na Universidade de Lund. O volume total dos textos mencionados na época era de aproximadamente 1-1,15 milhões de palavras, e mais textos semelhantes surgiram depois (ver Aijmer, Altenberg 1991: 1tt.). O volume dos livros de texto da segunda geração é calculado em dezenas de milhões, da terceira – já em centenas e milhares. O mundo continua a enfrentar o problema da compatibilidade do software de computador e dos programas de trabalho individuais: já se acumularam livros de texto de um volume extremamente grande — centenas de milhões de palavras (isto é, basicamente, a forma eletrônica da biblioteca), mas como usá-los convenientemente, como contar as frequências mais elementares, como não se perder no oceano de palavras? Afinal, será que a quantidade determina sempre a qualidade? Ao fazer dicionários de frequência, verifica-- se muitas vezes que metade das palavras estudadas são usadas apenas uma vez. Portanto, cada vez que você começar a trabalhar, você deve considerar cuidadosamente se as tarefas colocadas realmente exigem que você trabalhe com uma abundância de material, procurando as palavras mais raras. Por exemplo, quando se trata de um estudo de probabilidade, a probabilidade de um dado resultado ser verdadeiro ou falso depende da probabilidade de que o resultado seja verdadeiro ou falso, e a probabilidade de que o resultado seja verdadeiro depende da probabilidade de que o resultado seja falso ou verdadeiro. Além disso, é importante saber qual é o tipo de objeto que está sendo estudado, ou seja, qual é o tipo de objeto que está sendo estudado. A língua lituana é a língua oficial da Lituânia, embora a maioria dos falantes da língua lituana sejam falantes nativos da língua lituana, que é a língua oficial da Lituânia. Além disso, a língua portuguesa tem uma grande variedade de formas de escrita, sendo que algumas delas são escritas com o alfabeto latino, outras com o alfabeto latino, e outras com o alfabeto latino. Os dados estatísticos sobre, por exemplo, partes individuais de uma linguagem extraídas de diferentes livros de texto devem ser analisados com muito cuidado e objectividade. Ainda assim, apesar de não ter sido publicado, o livro foi amplamente citado em estudos e estudos sobre a língua e a literatura portuguesas contemporâneas. Trabalhar com números requer precisão, caso contrário, conclusões enganosas são obtidas. O dicionário eletrônico do Dicionário Inglês-Português (1,2 milhões de palavras) é dedicado aos dicionários de primeira geração (tipo Brown, LOB) — com um volume de mais de um milhão de palavras. Além disso, ele tem uma característica comum com esses famosos textos: como poucos outros no mundo, ele é anotado. A tecnologia de computador tem proporcionado condições excepcionais para as línguas analíticas: programas especiais, mas bastante difundidos (especialmente conhecido da Universidade de Oxford — Oxford Concordance Program, bem como KWIC, KAYE, CLAN, OCE, WordCruncher, etc.) permitem relativamente facilmente a elaboração de listas das palavras mais comuns, apresentando suas concordâncias (Leech 1991: 10; Utka 2000). Além disso, a maioria dos estudos sobre a língua portuguesa moderna são feitos com base em estudos sobre a língua portuguesa antiga, embora alguns estudos sobre a língua portuguesa contemporânea sejam feitos com base em estudos sobre a língua portuguesa contemporânea. Além disso, a linguagem é mais complexa para linguagens sintéticas: os programas descritos produzem listas de formas de palavras, e não de palavras-- chave. É necessário muito trabalho adicional até que as formas de palavras sejam subconjugadas e se tornem apenas palavras de título. Tais listas de palavras, que também têm um exame gramatical, já são chamadas de anotadas, no mundo não há muitos deles, eles são muito apreciados, pois exigem custos consideráveis de trabalho e, portanto, são 26 | LAIMA Além disso, os dados devem ser muito caros (nós e V. Žilinskienė calculamos que, no nosso caso, apenas a seleção dos textos, a compilação no teclado do computador, o seu exame morfológico semi-automatizado (o chamado LEMAVIMAS), a correção e a inserção dos dados no computador exigiriam seis anos de trabalho de uma pessoa). Os cálculos e as correções subsequentes novamente levam vários anos, porque qualquer imprecisão na execução de operações matemáticas pode se transformar em absurdo. Em geral, dicionários de uso comum, especialmente com o advento de livros de texto eletrônicos, podem ser criados de várias maneiras, dependendo do que você está procurando. A principal razão para a criação de novos dicionários de uso comum, especialmente aqueles que pretendem ser dicionários da língua n, é que a condição básica da estatística linguística, assim como da estatística discreta, é que a amostra seja representativa da população. Em resumo, existem dúvidas constantes sobre se a amostra analisada representa realmente a população pretendida. O dicionário da língua lituana contemporânea da Universidade Vytautas Didysis, por exemplo, que contém 60 milhões de palavras, seria diferente dos dicionários já publicados por L. Grumadienė e V. Žilinskienė (1997, 1998), porque seus resultados refletiriam a totalidade dos textos, que são baseados em 70% de publicações periódicas, 2696 não periódicas e 4% de publicações traduzidas (Marcinkevičienė 2000a: 16). Os textos dos dicionários publicados foram selecionados de acordo com uma base completamente diferente: são textos originais, não traduções, de quatro estilos linguísticos funcionais: jornalístico, de escritório, de ficção e científico. Apesar de ser uma língua comum, a língua lituana, especialmente a língua escrita, ainda é moldada, normatizada e codificada pelo espírito das ideias do Clube Linguístico de Praga (a propósito, deve-se notar que o próprio termo ESTILO é definido de forma bastante diferente pelas várias escolas de linguística). Laikytasi kitų dažninių žodynų sudarytojų principų, visų pirma čekų, rusų, latvių, kurie irgi laikėsi anksčiau čia išdėstytos bendrinės kalbos —funkcinių kalbos stilių sumos —sampratos, nuostatų, taikyta jų patirtis, todėl, kaip ir jų, pasirinktos 300 000 žodžių pavartojimų atrankos iš keturių funkcinių stilių, nes manyta, kad rašomajai lietuvių kalbai dar per ankstyvi Vytauto Didžiojo universiteto tekstyno (jis, beje, atsirado vėliau nei mūsiškis) sudarymo principai, artimesni amerikiečių bendrinės (ar standartinės, kaip ten įprasta) kalbos sampratai. O dicionário geral da língua lituana escrita atual às vezes não contém o vocabulário doméstico, porque se esquece que ele foi formado apenas a partir da língua escrita pública: ele não contém cartas privadas, diários, anotações em paredes, etc. No entanto, o dicionário contém também palavras de uso corrente, incluindo não apenas pronomes estranhos, pronúncias, mas também exemplos de vocabulário pejorativo intolerável na linguagem comum, o que tem sido frequentemente criticado pelas autoras do dicionário. O termo é usado para se referir a um conjunto de palavras que são usadas em textos de ficção (em textos originais editados em mais de 100 cópias impressas na Lituânia), e o postulado de um dicionário comum é não descartar nenhuma palavra significativa, a menos que seja um número, uma abreviatura ou um erro de correção. Além disso, os dados mostram que, selecionando amostras de 300.000 palavras de uso para cada um dos quatro estilos funcionais, no estilo jornalístico foram encontradas 284.687 palavras significativas (15.313 chamadas de "lixo"), no estilo profissional — 279.505 (não incluídas no dicionário por essas razões — 20.495), no científico — 278.311 (21.689), no ficcional — 290.561 (9.439). O coração não permitiu jogar fora a palavra verdadeira Lituânia, então ele, como uma exceção, o único verdadeiro entrou no dicionário (ele, ao que parece, a 16ª palavra em frequência, o primeiro dos substantivos, sua frequência de 5151 até 614 amostras: aqui determinou documentos oficiais, O nome da cidade é uma combinação de palavras de origem germânica, que significam "cidade" e "capital", e que são frequentemente usadas para se referir a uma cidade-estado. Sąlygiškai tikriniais gali būti laikomi ir patekę religinių bei kitų švenčių pavadinimai (dažnai vartojami ir kaip bendriniai), pvz., Joninės, Kūčios, Žolinė, arba pasaulio šalių pavadinimai Rytai, Vakarai, Pietūs, Šiaurė. Ao contrário do que se pensava, o livro não é uma obra de ficção científica, mas sim uma obra de ficção científica que se baseia em fatos reais, como histórias, contos, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas, contos de fadas. Atualmente, a Associação de Escritores e Artistas de São Paulo (AEAP) é composta por 15 membros, que se reúnem anualmente para discutir e debater temas relacionados à arte, à cultura, à política, à educação, ao esporte, à agricultura, ao meio ambiente, à educação e à saúde. Dalykinio stiliaus tekstus parinko Pranas Kniūkšta ir Danutė Vainauskienė iš 1990-1995 m. leidinių ir dokumentų pagal septynias temines grupes: 1) įstatymai ir juos lydintys dokumentai, komentarai, 2) teisės dokumentai, 3) ekonomikos ir verslo žinynai bei dokumentai, 4) politologijos leidiniai, partijų dokumentai, 5) standartai ir statistikos leidiniai, 6) informacijos šaltiniai (bibliografijos, katalogai, žodynai), 7) atskirų socialinių sričių (documentos de defesa nacional, segurança social, educação, cultura, etc.). Atualmente, a Universidade de São Paulo (USP) possui oito cursos de graduação em Ciências Humanas, sendo eles: 1) Ciências Sociais, 2) Ciências Naturais, 3) Ciências Humanas, 4) Ciências Biológicas, 5) Ciências Humanas, 6) Ciências Sociais, 7) Ciências Humanas, 8) Ciências Biológicas, 9) Ciências Humanas, 10) Ciências Sociais, 11) Ciências Humanas, 12) Ciências Humanas, 13) Ciências Sociais, 14) Ciências Humanas, 15) Ciências Humanas, 16) Ciências Sociais, 17) Ciências Humanas, 18) Ciências Humanas, 19) Ciências Sociais, 20) Ciências Humanas, 21) Ciências Humanas, 22) Ciências Humanas, 23) Ciências Sociais, 24) Ciências Humanas, 25) Ciências Humanas, 26) Ciências Humanas, 27) Ciências Sociais, 28) Ciências Humanas. Atualmente, a Associação Brasileira de Educação Física (ABEF) tem 180 membros, distribuídos em 15 estados brasileiros (1) através de seus órgãos federais, 2) através de seus órgãos estaduais, 3) através de seus órgãos municipais, 4) através de seus órgãos regionais, 5) através de seus órgãos federais, 6) através de seus órgãos estaduais, 7) através de seus órgãos municipais, 8) através de seus órgãos estaduais, 9) através de seus órgãos federais, 10) através de seus órgãos estaduais, 11) através de seus órgãos federais, 12) através de seus órgãos estaduais, 13) através de seus órgãos federais, 14) através de seus órgãos estaduais. Estes textos são considerados como sendo a língua literária da Lituânia moderna. A partir deles, uma amostra de 1000 palavras era selecionada aleatoriamente (páginas e linhas foram selecionadas de acordo com uma tabela de números aleatórios) e o teclado do computador era montado (um trabalho de cerca de duas horas). A partir daí, o aš projeto foi encerrado, com a criação do Centro de Pesquisas e Desenvolvimento Tecnológico (CPT). Ainda em 2000, o grupo lançou o álbum de estreia, intitulado de "A Vida é Bela", que foi lançado em 2001, com a versão remasterizada e remasterizada do álbum, intitulada de "A Vida é Bela". O trabalho parecia mais ou menos assim: você recebe uma folha de cálculo, da qual você precisa "varrer" as linhas desnecessárias (meu sublinhado). Ao contrário do que acontece com a maioria dos filmes de ação, o filme não é uma comédia, mas sim uma comédia de ação (ao contrário do que acontece com o primeiro filme). 2011 «Ainda não sei o que fazer com a minha vida, mas vou fazer o que eu quiser». iG. Página 34 de 34 Classificação Frequência dkt vks bdv prv ívr 301-350 460-374 19646 10424 2420 2073 393 54,28% 28,80% 6,69% 5,73% 1,09% 351-400 373-313 18504 7550 3381 1347 654 53,04% 21,64% 9,69% 3,86% 1,87% 401-450 312-260 19156 7865 3976 522 304 57,20% 23,49% 11,87% 1,56% 0,91% 451-500 259-205 21718 9987 4806 2486 471 53,17% 24,45% 11,76% 6,08% 1,15% O dicionário da língua portuguesa de 1800 (2ª ed.). Frequência de palavras e partes da língua de qualificação Classificação Frequência dkt vks bdv prv jvr 501-550 204-155 22494 13153 7023 2481 525 46,97% 27,46% 14,66% 5,18% 1,10% 551-600 154-106 30834 17197 6221 4419 151 50,91% 28,39% 10,27% 7,29% 0,25% O dicionário de língua portuguesa de 2ª edição (2000) contém cerca de 1200 palavras. Frequência de palavras e partes da linguagem de qualificação III Classificação Frequência dkt vks bdv prv pvr 601-650 105-56 45751 20328 12145 5822 433 52,31% 23,25% 13,88% 6,66% 0,50% Dicionário da Língua Portuguesa (2ª ed.). Dicionário da Língua Portuguesa IR JO BASE | 35 skt prl jng dll ist; jst Total 426 - & 812 — 36194 1,1796 2,2496 3,02% - — 1407 2043 — 34886 4,03% 5,87% 291% 276 — 272 1118 — 33489 0,82% 0,81% 3,34% 2,79% 255 224 210 700 3 40857 0,6296 0,55% 0,51% 1,71% 3,40% palavras) sobrepõ56,66% e-se ao texto (amostra) iš 1,2 min. 1000 palavras). 56,66% CATEGORIAS NÍVEL MÍNIMO ZODYNO ESTATISTICAS LINGUÍSTICAS ANÁLISE: skt prl jng dll ist; jst Total 530 342 177 795 371 47891 1,11% 0,71% 0,37% 1,66% 0,78% 3,99% 520 275 132 713 109 60571 0,86% 0,45% 0,22% 1,18% 0,18% 5,05% palavras) sobrepõ65,70% e-se ao texto (amostra) iš 1,2 milhões de euros 1000 palavras). 9,0496 Iš face: (=65,7096) ANÁLISE LINGUÍSTICA ESTATISTICA DO VOCÁBULO MÍNIMO DA CATEGORIA: skt prl jng dll ist; jst Total 460 341 372 1697 102 87446 0,52% 0,40% 0,42% 1,94% 0,12% 7,29% palavras) sobrepõ78,04% e-se ao texto (amostra) iš 1,2 milhões de euros 1000 palavras). 7,2996 Iš face: (=78,04%) 36 | LAIMA GRUMADIENĖ LITERATŪRA AUMER, K., ALTENBERG, B. 1991: Introdução. Aijmer, K., Altenberg, B., eds., Linguística do Corpus Inglês. Studies in Honour of Jan Svartvik (em inglês). : Longman. ALAMEDA, J. R., CuEros, E 1995: Diccionario de frecuencias de las unidades lingiiisticas del castellano, Universidade de Oviedo. 1983 - "A Ciência da Educação" - Universidade Federal do Rio Grande do Sul, 1983. 1997 - A. A., A. A., A. A.: A História da Filosofia, São Paulo: Editora da Universidade de São Paulo, 1997. 1998 - A. A., A. A.: A História do Direito e da Administração Pública. 47 (1): 17–28. (em inglês) EATON, H. 1934: Lista comparativa de frequência sobre as primeiras mil palavras em inglês, francês, alemão e espanhol. Coleman, A., ed., Experiências e Estudos no Ensino de Línguas Modernas, Chicago. Garcia Hoz, V. 1953: Vocabulario usual, comun y fundamental. Madrid: Consejo Superior de Investigaciones Científicas —Instituto "San José de Calasanz- ®". 1997 - 1998: Curso de Pós-Graduação em Ciências da Computação e da Informação, Universidade Federal do Rio Grande do Sul (UFRJ), Faculdade de Ciências da Computação e da Informação, Universidade Federal do Rio Grande do Sul (UFRS). 1998 - Dicionário da Língua Portuguesa, 1999 - Dicionário da Língua Portuguesa, 2000 - Dicionário da Língua Portuguesa, 2001 - Dicionário da Língua Portuguesa, 2002 - Dicionário da Língua Portuguesa, 2003 - Dicionário da Língua Portuguesa, 2004 - Dicionário da Língua Portuguesa, 2005 - Dicionário da Língua Portuguesa, 2006 - Dicionário da Língua Portuguesa, 2008. HiLLERICH, R., www: eduplace. com: Palavras e vocabulário de alta frequência. JAKUBAITE, T. e.a. 1966-1976: Dicionário da espessura da língua letã, 1.4. sējumi, Riga: Zinatne. JosseLsoN, H. 1953: A contagem de palavras russas e análise de frequência de categorias gramaticais do russo literário padrão, Detroit: Serviço periódico Co. JuiLLAND, A., RODRIGUES, E. Ch. 1964: Dicionário de frequência de palavras espanholas, Haia: Mouton. JUILLAND, A., EDWARDS, P. M., JUILLAND, I. 1965: Dicionário de Frequência de Palavras em Romeno, Haia: Mouton. JUILLAND, A., TRAVERSA, V. 1973: Dicionário de frequência de palavras italianas, Haia: Mouton. 1898: Haufigkeitswörterbuch der deutschen Sprache (Dicionário de frequência da língua alemã), Steigliz, Berlim. 1993 - Dicionário da Língua Portuguesa, 1ª edição, Lisboa: Editora da Universidade de Lisboa. 2000 - Dicionário da Língua Portuguesa, 2ª ed. Lisboa: Editora da Universidade de Lisboa. KENNEDY, G. 1998: Uma Introdução à Linguística de Corpus, Londres-- Nova Iorque: Longman. 1991 - Dicionário de História da Língua Portuguesa, 1ª edição, Lisboa: Ed. 1954 - A língua portuguesa: um dicionário histórico, linguístico e literário. : Editora Nacional. 1972 - Dicionário da Língua Portuguesa, 2ª edição, Rio de Janeiro: Ed. LEECH, G. 1991: O estado da arte em linguística de corpus, Aijmer, K., Altenberg, B., eds., Linguística de Corpus em Português. Studies in Honour of Jan Svartvik (em inglês). : Longman. LONNGREN, L. 1993: Yacmomnoiū crosape cospemennozo pycckozo aswika. Upsala. (2ª edição, 2000) (em inglês) SILVA, M. A. (2000) A Teoria da Linguagem e da Comunicação. 24, 7-64. (em inglês). MARCINKEVICIENE, R. 2000b: Padrões de uso de palavras em linguística de corpus. 3 (3): 71–80 (em inglês). MAZEJKA, N. S. (Max3iika, H. C.), SUPRUN, A. Ja. 1976: Yacmomnoi: cnoynix Genapyckaii Moet (macmaykas nposza), Minck: Beinasenrsa BJ1V ims V. Jlenina. 2000 - 2001 - 2002 - 2003 - 2004 - 2005 - 2006 - 2007 - 2008 - 2009 - 2010 - 2011 - 2012 - 2013 - 2014 - 2015 - 2016 - 2017 - 2018 - 2019 - 2020 - 2021 - 2022 - 2023 - 2024 - 2025 - 2026 - 2027 - 2028 - 2029 - 2030 - 2031 - 2032 - 2033 - 2034 - 2035 - 2036 - 2037 - 2038 - 2039 - 2040 - 2041 - 2042 - 2043 - 2044 - 2045 - 2046 - 2047 - 2048 - 2049 - 2050 - 2051 - 2052 - 2053 - 2053 - 2054 - 2055 - 2056 - 2057 - 2058 - 2059 - 2059 Universidade de Coimbra: Dissertação de Mestrado. 1998: "O Dicionário da Língua Portuguesa" (em colaboração com o Dicionário da Língua Portuguesa). Língua Portuguesa, 240-242. 1999: "Dicionário de História da Língua Portuguesa". Lituanistica 2 (38), 92-98. 2000 - A.C.A.: Agência de Comunicação e Artes. 1994, pp. 99-107. Dicionário de História da Língua Portuguesa, 1976, pp. 127. (em inglês) SILVA, M. A.; SILVA, M. A.; SILVA, M. A.; SILVA, M. A.; SILVA, M. A.; SILVA, M. A.; SILVA, M. A.; SILVA, M. A.; SILVA, M. A. 1986: Onsir co3nanus HaUHOHANBLHBIX JIEKCHKOTpaOHUeCKHX CJIyxO 3a pybexom. O Capitão. H., pea., Mauunnor pono pycckozo asvika: udeu u cymcoenus, Mocksa: Hayka, 75-83. 1999 - A Morte de uma Criança. Universidade de Coimbra: Dissertação de Mestrado. 1994 - "O que é a língua portuguesa?", em: Dicionário de Língua Portuguesa, Ed. 1963 - 1964: 2ª Divisão - 2º lugar 1964 - 1965: 2ª Divisão - 3º lugar 1965 - 1966: 2ª Divisão - 4º lugar 1966 - 1967: 2ª Divisão - 3º lugar 1967 - 1968: 2ª Divisão - 4º lugar TESITELOVA, M. e.a. 1983: Dicionário de História da Arte, Editora da Academia Brasileira de Ciências. THORNDIKE, E., LORGE, L. 1944: Um Livro de Palavras do Professor das Vinte Mil Palavras Encontradas Mais Frequentemente e Amplamente na Leitura Geral para Crianças e Jovens, Nova York: Appleton— Century Crofts. TopoRova, E., PANCOVSKA, R. 2001: Yecmomen peunux na 6wrzapckama nybauyucmuxa (1944—2001) (em inglês). 1989 - O Coração de Cristo. 2000: A linguagem e a sua formação. 275–285 páginas. VACAR, N. P. 1966: Uma contagem de palavras do russo falado. O uso soviético, Ohio: Ohio State University Imprensa. VANDER BEKE, G. 1929: Livro de palavras em francês, Nova Iorque: Macmillan. ZASORINA, L. N., red., 1977: Yacmomuwiit caoeape pycckozo aswika, Mocksa: UsnatensctBo «PycckHH A3Biky. 2000 - "A Morte de Cristo" - Anagrama. História e Sociedade, 26, 246-247. 1990 - Dicionário de História da Língua Portuguesa, Lisboa, Ed. 1995 - Dicionário da Língua Portuguesa, Lisboa: Instituto de Língua e Literatura Portuguesas. 1998: O primeiro dicionário da língua portuguesa atual (Dicionário da Língua Portuguesa, 1998). Língua Portuguesa, 219-221. ŽILINSKIENĖ, V., GRUMADIENĖ, L. 1998: Valstybinės kalbos mokėjimo kvalifikacinių kategorijų lietuvių-rusų kalbų minimalusis žodynas (pirmoji kvalifikacinė kategorija), Kaunas: Šviesa. ŽILINSKIENĖ, V., GRUMADIENĖ, L. 1999a: Valstybinės kalbos mokėjimo kvalifikacinių kategorijų lietuvių-rusų kalbų minimalusis žodynas (antroji kvalifikacinė kategorija), Vilnius: UAB „Nacionalinių tyrimų centro“ leidykla. ŽILINSKIENĖ, V., GRUMADIENĖ, L. 1999b: Valstybinės kalbos mokėjimo kvalifikacinių kategorijų lietuviy-rusy kalbų minimalusis žodynas (trečioji kvalifikacinė kategorija), Vilnius: UAB „Nacionalinių tyrimų centro“ leidykla. 2001 - A língua e a literatura portuguesas: um estudo de caso. Linguistica Lettica 9, 155-168. SILVESTRE, V. A. A.. : Características estatísticas da morfologia do estilo substantivo da língua lituana e sua comparação com as características correspondentes da publicística. Lituânia. Consultado em 19 de julho de 2013 Instituto Nacional de Estatística P. Vileišio g. 5, LT-2055 Vilnius, Lituânia laigruma(dtakas.lt