scieee AI-readable full text Open interactive document viewer

Multi-word patterns in the corpus of Information and Communication Technology. Terminological bundles in the genre – ‘Textbooks in ICT’

Marek Weber

Full text

39Terminologia | 2012 | 19 Multi-word patterns in the corpus of Information and Communication La tecnologia. Pacchetti terminologici del genere […] […]Libri di testo sulle TIC[…] Marek Weber è un'artista statunitense. Università di Tecnologia di Bialystok KEYWORDS: corpus linguistica, Tecnologia dell'informazione e della comunicazione, fasci lessicali, classificazione funzionale di fasci lessicali, fasci terminologici, controllo lessicale DATI PER STUDIO, IL FASSICO DELLA TECNOLOGIA INFORMATIVA E COMMUNICATIVA I dati per lo studio sono costituiti da un corpus elettronico del vasto dominio delle tecnologie dell'informazione e della comunicazione (ICT) un termine generale che comprende tutte le tecnologie sviluppate per l'elaborazione e il trasferimento di dati. I testi sono stati selezionati in modo da rappresentare una sezione trasversale del campo delle TIC. I testi sono stati suddivisi in sette categorie che possono essere considerate come generi all'interno del dominio delle TIC: genere 1: articoli professionali nelle TIC; Genero 2: Articoli accademici sulle TIC; genere 3: documentazione tecnica delle applicazioni software nelle TIC; genere 4: documentazione tecnica dell'hardware delle TIC; Genero 5: libri di testo sulle TIC; Genero 6: Documentazione tecnica dei linguaggi di programmazione e degli ambienti di programmazione; Genero 7: Documentazione tecnica delle tecnologie di rete. Il corpus contiene una raccolta di 973 testi per un totale di quasi 24 milioni di parole. La scelta dei dati per un corpus è una delle preoccupazioni più importanti per il ricercatore in quanto il corpus dovrebbe essere rappresentativo del dominio di uso analizzato. Come suggerisce Douglas Biber, la quantità di testi è cruciale per la ricerca in cui lo studioso si concentra sul testo come unità primaria di controllo. Un numero sufficiente di testi dovrebbe essere incluso in ogni genere per tenere conto delle variazioni tra categorie e autori (Biber, 2006). 40 Marek Weber Modelli di più parole nel corpus di informazioni tabella 1.  andCommunicationTechnology.Terminological  bundlesinthegenre–‘TextbooksinICT’ Composizione del genere del corpus delle tecnologie dell'informazione e della comunicazione Numero Numero di token di testi (parole correnti) Articoli professionali 391 225551 Articoli accademici 95 1272001 Documentazione tecnica delle 2472839 in ict applicazioni software 92 Documentazione tecnica dell'hardware delle TIC 100 2471772 Libri di testo 99 15315237 Documentazione tecnica della programmazione 90 1282175 delle tecnologie di rete 106 725418 Lingue e ambienti di programmazione Documentazione tecnica Totale 973 23764993 BUNDELLO LESSICO: Il termine Le sequenze ricorrenti di parole che appaiono insieme più frequentemente del previsto per caso sono una parte importante della produzione linguistica. Il termine "bundle lessicale" è stato usato per la prima volta da Douglas Biber, Stig Johansson, Geoffrey Leech, Susan Conrad e Edward Finegan nella ormai classica grammatica Longman dell'inglese parlato e scritto per riferirsi a combinazioni di più parole identificate sulla base del solo criterio di frequenza (Biber et al. 1999), mentre Mike Scott li chiama gruppi di parole nel manuale dell'applicazione software Word Tools versione 46 e Word Tools versione 5 (2010). L'unica considerazione nell'identificazione dei fasci lessicali è la loro frequenza. "I cluster sono parole che si trovano ripetutamente insieme in compagnia degli altri, in sequenza" (Scott 2010: 337). Scott sottolinea che la parola ha effetti negativi come incidente, problemi, clusters may involve semantic prosody i.e. the tendency for certain lexemes to co-occur with certain other lexemes (e.g. the tendency for cause to come ecc.) (Scott 2010: 337). Biber, Johansson, Leech, Conrad e Finegan definiscono i fasci lessicali come espressioni ricorrenti indipendentemente dalle loro proprietà strutturali, cioè sono sequenze di forme vocali che si verificano frequentemente nel discorso e sottolineano che i fasci più brevi sono spesso incorporati in più di un fascio lessicale più lungo (Biber et al. 1999). Essi osservano inoltre che nella maggior parte dei casi i fasci lessicali non formano unità strutturali e che la maggior parte di essi sono 41Terminologija | 2012 | 19 non espressioni che gli utenti della lingua riconoscerebbero come idiomi o altre espressioni lessicali fisse. Biber, Johansson, Leech, Conrad e Finegan stabiliscono le seguenti soglie per le sequenze multi-parola per qualificarsi come fasci lessicali: devono verificarsi almeno 10 volte per milione di parole e almeno in cinque testi (Biber et al. 1999). Biber osserva che un risultato sorprendente di un approccio basato sulla frequenza è che i fasci lessicali hanno due caratteristiche inaspettate (Biber 2006: 134). In primo luogo, la maggior parte di essi non sono idiomatici nel significato, ma i significati sono di solito trasparenti dalle singole forme di parola. Ken Hyland sottolinea anche il fatto che la maggior parte dei fasci sono semanticamente trasparenti e "formalmente regolari, fornendo i blocchi di costruzione di un discorso coerente" (Hyland 2008: 6). In secondo luogo, la maggior parte dei fasci non sono strutture grammaticali complete. Biber, Johansson, Leech, Conrad e Finegan hanno osservato che circa il 15 % dei fasci lessicali in conversazione formavano unità strutturali complete, mentre solo circa il 5 % dei fasci lessicali nella prosa accademica potevano essere considerati frasi o clausole complete (Biber et al. 1999: 1000). Una scoperta preziosa sulla natura sintastica dei fasci lessicali di Biber è che sono unità lessicali che spesso attraversano strutture grammaticali, ad esempio possono collegare due frasi o clausole in modo tale che le ultime parole di un fascio sono le parti iniziali di una seconda struttura sintastica (Biber 2006: 135). Hyland sottolinea anche che i fasci lessicali identificati esclusivamente in base alla loro frequenza di solito coprono unità strutturali (Hyland 2008: 6). Una serie di studi di corpus sono stati dedicati all'analisi di stringhe ricorrenti di forme di parole ininterrotte e dimostrano quanto siano importanti in vari tipi di discorso, oltre a mostrare una notevole variazione dei fasci lessicali in diversi generi e registri (ad esempio: Biber 2006; Biber, Conrad, Cortes 2004; Hyland 2008; Scott, Tribble 2006; Gozdz-Roszkowski 2011). La decisione è stata presa di concentrarsi sull'analisi dei fasci di quattro parole perché, da un lato, le frequenze dei fasci di quattro parole sono sostanzialmente più elevate delle sequenze di cinque parole e, dall'altro, contengono spesso stringhe di tre parole e consentono di identificare modelli e strutture più evidenti delle espressioni di tre parole. Elenchi di fasci di 4 parole in ciascuno dei 42 Marek Weber I modelli multi-parola nel corpus di informazioni sette  andCommunicationTechnology.Terminological  bundlesinthegenre–‘TextbooksinICT’ generi ICT sono stati generati utilizzando i WordSmith Tools v. il pacchetto software 5.0 per la ricerca di modelli nei corpus. In questo studio sono stati fissati i seguenti due limiti: una frequenza minima di occorrenza di 20 volte per milione di parole e un altro criterio secondo il quale un fascio dovrebbe apparire in almeno cinque testi. Il processo di applicazione dei criteri di scadenza ha richiesto calcoli appropriati in ciascuno dei sette file contenenti l'elenco dei fasci di un dato genere. I calcoli sono descritti nelle seguenti fasi: 1. Creazione di una colonna aggiuntiva denominata "Frequenza per milione" nel foglio di calcolo ottenuto dal software WordSmith Tools. 2. Inserire il valore delle parole in esecuzione in una cella di foglio di calcolo Excel libero all'interno di una data categoria. 3. Riempire la prima cella della colonna "frequenza per milione" con la seguente formula: 4. Copia la formula in altre celle cliccando sull'angolo inferiore destro della cella compilata e trascinandola verso il basso in altre celle. 5. Evidenziare la colonna "Numero di testi". 6. Scegliere il menu "Dati" e selezionare il campo "Sortare e filtrare" nello strumento di ordinamento. 7. Scelta dell'ordine di ordinamento discendente. 8. Cancellazione di tutte le righe della tabella per le quali i valori del campo "Numero di testi" sono inferiori a 5. 9. Evidenziare la colonna "Frequenza per milione". 10. Scegliere il menu "Dati" e selezionare il campo "Sortare e filtrare" nello strumento di ordinamento. 11. Scelta dell'ordine di ordinamento discendente. 12. Cancellazione di tutte le righe della tabella per le quali i valori nel campo "frequenza per milione" sono inferiori a 20. 1886 fasci diversi sono stati trovati nel corpus dopo l'applicazione dei criteri di cut-off di cui sopra. Il numero totale di fasci identificati in tutti i dati è stato di 197 553. 43Terminologija | 2012 | 19 tabella 2. Distribuzione dei fasci lessicali in genere di ICt Il numero totale Numero di differenze-% di esecuzione dei fasci dopo ent fasci dopo parole in fasci applicando cut-off applicando criteri di cut-off criteri Articoli professionali 1057 131 1,8 Articoli accademici 5548 120 1,7 Applicazioni software 44669 403 7,2 Hardware 55296 672 8,9 Libri di testo 72483 119 1,9 Programmazione strumenti e ambienti di programmazione lan-10984 180 3,4 tecnologie di rete 7516 261 4,1 Totale 197553 1886 La percentuale di parole correnti in fasce è stata ottenuta moltiplicando il numero di casi totali per un dato genere per 4 (si analizzano fasce di 4 parole) e dividendo per il numero di parole correnti in un dato genere e poi moltiplicando per 100 % secondo la formula: a nostro avviso due parametri: la gamma di diverse fasce e la percentuale di parole correnti in fasce possono essere considerati come indicatori del grado in cui un dato genere è formulaico e ripetitivo rispetto ad altri generi. In altre parole, il grado di formula e ripetitività di un genere può essere misurato dalla gamma di diversi bundle impiegati in un genere e dalla percentuale di parole correnti nei bundle. I generi delle TIC possono essere suddivisi in tre gruppi in base al criterio della formulazione e della ripetitività. Il genere 3 […] […] documentazione tecnica delle applicazioni software nelle TIC[…] e il genere 4 […] […] documentazione tecnica dell'hardware delle TIC[…] sono caratterizzati da un alto grado di formulazione e ripetitività in quanto mostrano modelli comparabili utilizzando il più ampio ambito di diversi fasci (403 e 672 rispettivamente) e la più alta percentuale di parole correnti nei fasci (7,2 % e 8,9 % rispettivamente). 44 Marek Weber Modelli di più parole nel corpus di informazioni Figura 1: Generi  andCommunicationTechnology.Terminological  bundlesinthegenre–‘TextbooksinICT’ con alti gradi di formalità e ripetitività Al contrario, il genere 1 […] […] articoli professionali nelle TIC[…], il genere 2 […] […] articoli accademici nelle TIC[…] e il genere 5 […] libri di testo nelle TIC[…] sono caratterizzati da gradi relativamente bassi di formalità e ripetitività in quanto utilizzano la portata più bassa di diversi pacchetti (11, 120 e 119 rispettivamente) e la percentuale più bassa di parole correnti nei pacchetti (1,8 1,7%) 1,9 % rispettivamente). I restanti due generi: genere 6 […] […] documentazione tecnica dei linguaggi di programmazione e degli ambienti di programmazione […] e genere 7 […] […] documentazione tecnica delle tecnologie di rete […] formano il terzo gruppo con i valori di entrambi i parametri al centro dell'intervallo (numeri di diversi fasci: 180 e 261 rispettivamente; percentuale di parole correnti nei fasci rispettivamente 3,4 % e 4,1 %). Tuttavia, vale la pena tenere presente che, come Stanislaw Gozdz-Roszkowski sottolinea giustamente, i confronti diretti possono essere effettuati in modo sicuro solo tra generi con un numero di parole simile. Al fine di tenere conto di tale considerazione, la percentuale di parametri di parole correnti in fasci viene calcolata per ogni genere in modo da riflettere il numero di parole di ciascuno dei subcorpora che rappresentano i rispettivi generi (Gozdz-Roszkowski 2011: 111). Classificazione funzionale dei fasci Un quadro per l'analisi funzionale dei fasci ottenuti in questo corpus è stato stabilito dalle tassonomie di Biber (Biber 2006; Biber et al. 2004), Hyland (2008) e Gozdz-Roszkowski (2011). La classificazione di Biber è risultata dall'esame di un ampio corpus di registri parlati e scritti che coprivano tra l'altro tipi di discorsi come: conversazioni casuali, nastri di sessioni di classe, insegnamento in classe, orari di ufficio, gruppi di studio, incontri di servizio nel campus, libri di testo, pacchetti di corsi, testi istituzionali (ad esempio (2006)). 45Terminologia | 2012 | 19 Il corpus dello studio di Hyland (2008) (dimensione 3,5 milioni di parole) comprende articoli di ricerca, tesi di dottorato e tesi di laurea o laurea disciplines: electrical engineering and microbiology from the applied and pure sciences, and business studies and applied linguistics from the social magistrale di quattro scienze. Gozdz-Roszkowski (2011) ha analizzato un corpus di diritto americano contenente oltre 5,5 milioni di parole e che rappresenta sette generi all'interno della cultura e dell'istruzione giuridica americana: articoli accademici, briefs, contratti, legislazione, opinioni, articoli professionali e libri di testo. Sulla base delle suddette tassonomie, i fasci lessicali nelle TIC sono stati suddivisi funzionalmente in tre ampie categorie in relazione al loro significato nei testi: incentrato sulla ricerca, incentrato sul testo e incentrato sul partecipante. I pacchetti raggruppati nella prima categoria aiutano gli scrittori a organizzare le loro attività e esperienze nel campo delle TIC. I fasci incentrati sul testo sono utilizzati per indicare l'organizzazione del testo e il suo significato. Infine, i pacchetti incentrati sui partecipanti sono utilizzati per segnalare diversi atteggiamenti o valutazioni e sono focalizzati sullo scrittore o sul lettore del testo. Figura 2: Tassonomia funzionale dei fasci lessicali Ciascuna delle tre principali categorie funzionali dei fasci lessicali è stata ulteriormente suddivisa in un certo numero di sottocategorie. I fasci incentrati sulla ricerca includono le seguenti sottocategorie: fasci quantitativi (ad esempio uno dei più grandi; un gran numero di; uno dei seguenti; il numero di elementi); fasci di riferimento temporali (ad esempio al momento di; fine anno; le prossime settimane; nelle prossime settimane); Posizionare i fasci di riferimento della direzione (ad esempio negli Stati Uniti; della finestra principale; in fondo alla finestra; nella barra di stato); 46 Marek Weber Modelli a più parole nel corpus dei pacchetti di procedure di informazione  andCommunicationTechnology.Terminological  bundlesinthegenre–‘TextbooksinICT’ […] utilizzati per descrivere diverse funzioni relative alle TIC (ad esempio l'uso di; l'uso di un); Bundle di indicatori tematici […] relativi all'area di ricerca (ad esempio, procedimenti dell'IEEE; linguaggi e sistemi di programmazione; menu a caduta; le seguenti opzioni di configurazione); Bundle di riferimento multifunzionali […] bundle che possono essere utilizzati come riferimento testuale di luogo e tempo (ad esempio, la fine del; l'inizio del; la sinistra del; all'inizio del); I fasci di descrizione […] specificano le caratteristiche del sostantivo seguente (ad esempio la complessità del; la superficie del; la portata del; l'altezza del). I pacchetti incentrati sul testo includono le seguenti sottocategorie: Pacchetti di elaborazione […] elaborano ulteriormente l'argomento analizzato e lo chiariscono (ad esempio, allo stesso tempo, così come il, questo significa che il, in questo caso il); I fasci di transizione […] forniscono connessioni additive o contrastive tra parti di testi (ad esempio, d'altra parte, in opposizione al, in aggiunta al, in contrasto al); Framing attribute bundles […] […] situate argomenti specificando condizioni limitanti […] (Hyland 2008: 14) per fare affermazioni o argomenti (ad esempio in termini di, nel contesto di, in presenza di, il contenuto del); Bundle di condizioni […] esprimono condizioni (ad esempio se si vuole, se non si vuole, se si ha un, se si ha un); I pacchetti di risultati […] indicano i collegamenti logici tra gli elementi in termini di relazioni di causa e risultato (ad esempio in modo da poter, come risultato di, come risultato di, come funzione di); I fasci di marcatori di struttura […] sono utilizzati per indicare altre parti del testo (ad esempio, come mostrato nella figura, come discusso nella sezione, è mostrato in esempio, più avanti in questo capitolo). I pacchetti incentrati sui partecipanti includono le seguenti sottocategorie: pacchetti di coinvolgimento […] si rivolgono direttamente ai lettori; […]indirizzare attivamente i lettori come partecipanti al discorso in corso[…] (Hyland 2008: 18) (ad esempio fare uno dei, selezionare il tipo di, si raccomanda che tu, selezionare uno dei); I pacchetti di posizioni […] trasmettono emozioni, atteggiamenti, giudizi di valore e valutazioni; […]fornire un quadro per l'interpretazione della seguente proposizione[…] (Biber, 2006: 139) (ad esempio, è necessario, non è una garanzia che, è importante, non è possibile, è possibile); tabella 3: Distribuzione dei fasci lessicali tra le categorie funzionali 47Terminologia | 2012 | 19 Bundle di modalità […] esprimono che qualcosa è probabile, ammissibile o necessario (ad esempio, deve essere soddisfatto un, può essere usato per, come si può vedere, in cui si può, non può essere visualizzato, può essere riprodotto o, deve accettare qualsiasi interferenza, interferenza che può causare, che può causare indesiderati); I pacchetti di previsioni esprimono la previsione dello scrittore di qualche azione futura (ad esempio, si prevede che sia, ti verrà richiesto, verrà visualizzato in, questo aprirà il, sarà chiesto di). Table 3 shows the numbers of bundles belonging to the three major functional categories in each genre. Ricerca-- centrato Testo-Pacentrato rticipantcentrato e-Altri Articoli professionali 45 23 13 45 Articoli accademici 48 35 928 Applicazioni software 123 55 122 83 Hardware 207 51 138 187 Libri di testo 32 35 18 20 Linguaggi di di programmazione 39 39 26 62 programmazione e ambienti tecnologie di rete 91 24 11 91 Figura 3: Classificazione dei fasci incentrati sulla ricerca