scieee AI-readable full text Open interactive document viewer

Exploring Scaled AIC within English closed compounds

Chariton Charitonidis

Abstract

The Akaike Information Criterion (AIC) is an established goodness-of-fit measure for selecting models in the analysis of empirical data. However, AIC is sensitive to sample size. Author’s previous research has shown that Scaled AIC, i.e. AIC divided by sample size, is an effective tool for assessing model fit and hierarchizing regression models. The present study explores further properties of this variable. The object of investigation are 66 multiple regression models referring to the processing of closed (concatenated) English compounds taken from Gagné et al.’s (2019) Large Database of English Compounds (LADEC). In particular, Scaled AIC is juxtaposed to the English Lexicon Project (ELP) and British Lexicon Project (BLP) as sources of response times, the lexical decision and naming tasks, compound length, and transparency norms. One-way ANOVA, main effects analysis, and non-parametric tests are used as methods. The findings suggest that Scaled AIC is responsive to experimental design, the source of response times, and the lexical decision and naming tasks. At the same time, the results of this study offer empirical support for the validation of methods employed by Gagné et al. (2019).

Full text

CHARITON CHARITONIDIS Onafhankelijk onderzoeker ORCID-id: orcid.org/0000-0003-0298-2629 Onderzoeksgebieden: woordvorming, meerwoorduitdrukkingen, lexicale semantiek, woordherkenning, emotie. DOI: doi.org/10.35321/all90-11 VERKENNING VAN GESCHAALDE AIC BINNEN ENGELSE GESLOTEN SAMENSTELLINGEN Onderzoek naar geschaalde AIC van Engelse gesloten samenstellingen (composita) ANNOTATIE Het Akaike-informatiecriterium (AIC) is een gevestigde maatstaf voor goodness-of-fit voor het selecteren van modellen bij de analyse van empirische gegevens. AIC is echter gevoelig voor de steekproefomvang. Eerder onderzoek van de auteur heeft aangetoond dat geschaalde AIC, d.w.z. AIC gedeeld door de steekproefomvang, een doeltreffend instrument is om de modelpassing te beoordelen en regressiemodellen te hiërarchiseren. De huidige studie onderzoekt verdere eigenschappen van deze variabele. Het onderzoeksobject bestaat uit 66 meervoudige regressiemodellen met betrekking tot de verwerking van gesloten (aaneengeschreven) Engelse samenstellingen, ontleend aan Gagné et al.’s (2019) Large Database of English Compounds (LADEC). In het bijzonder wordt geschaalde AIC afgezet tegen de English Lexicon Project (ELP) en het British Lexicon Project (BLP) als bronnen van responstijden, de lexicale-beslissingstaak en benoemingstaak, de lengte van samenstellingen en transparantienormen. Eenweg-ANOVA, analyse van hoofdeffecten en niet-parametrische toetsen worden als methoden gebruikt. De bevindingen suggereren dat geschaalde AIC reageert op het experimentele ontwerp, de bron van de responstijden en de lexicale-beslissings- en benoemingstaken. Tegelijkertijd leveren de resultaten van deze studie empirische steun voor de validatie van de door Gagné et al. (2019) toegepaste methoden. TREFWOORDEN: Engelse samenstellingen, geschaalde AIC, lexicale beslissing, benoeming. ANNOTATIE Het Akaike-informatiecriterium (Eng. AIC) is een vaste maatstaf voor modelpassing, toegepast op de analyse van empirische gegevens. AIC is echter gevoelig voor de steekproefomvang. Eerdere Straipsniai / Articles 273 CHARITON CHARITONIDIS onderzoeken van de auteur hebben aangetoond dat geschaalde AIC, gedeeld door de steekproefomvang, een doeltreffend instrument is om de modelpassing te beoordelen en regressiemodellen te hiërarchiseren. In deze studie worden verdere eigenschappen van deze variabele onderzocht. Het onderzoeksobject bestaat uit 66 meervoudige regressiemodellen die verband houden met de verwerking van gesloten (samengestelde) Engelse samenstellingen, ontleend aan Gagné et al.’s (2019) Large Database of English Compounds (Eng. LADEC). In het bijzonder wordt AIC afgezet tegen het English Lexicon Project (Eng. ELP) en het British Lexicon Project (Eng. BLP), als bronnen van responstijden, lexicale-beslissings- en benoemingstaken, samenstellingslengte en transparantienormen. De gebruikte methoden zijn eenweg-ANOVA (Eng. Analysis of variance), analyse van hoofdeffecten en niet-parametrische toetsen. De conclusies tonen aan dat geschaalde AIC reageert op het experimentele ontwerp, de bron van de responstijden en de lexicale-beslissings- en benoemingstaken. Tegelijkertijd bieden de resultaten van deze studie een empirische basis voor de bevestiging van de door Gagné et al. (2019) toegepaste methoden. KERNWOORDEN: Engelse samenstellingen (composita), geschaalde AIC, lexicale beslissing, benoeming. 1. DE GROTE DATABASE VAN ENGELSE SAMENSTELLINGEN (LADEC: GAGNÉ ET AL. 2019)¹ De Large Database of English Compounds (LADEC: Gagné et al. 2019) is de grootste bestaande database van samenstellingswoorden. Zij bevat meer dan 8000 niet-gespatieerde (“gesloten” of “aaneengeschreven”) samenstellingen (=zelfstandige naamwoorden), geselecteerd uit verschillende bronnen, waaronder de CELEX-database (Baayen et al. 1995), het English Lexicon Project (ELP; Balota et al. 2007), het British Lexicon Project (BLP; Keuleers et al. 2012), het British National Corpus (BNC) en Wordnet. Uit de volledige verzameling LADEC-vermeldingen kunnen 7.804 samenstellingen uniek worden geparseerd in twee vrije morfeemconstituenten.² Er wordt een zeer grote verscheidenheid aan samenstellingen beschouwd, bijvoorbeeld zelfstandig naamwoord-zelfstandig naamwoord-samenstellingen, bijv. buttercup, shipyard, samenstellingen met een tweede constituent die is afgeleid van een werkwoordstam, bijv. pacemaker, painkiller, enz. (voor definities van samenstellingsklassen zie Lieber 2004: 46). De eerste niet-hoofdconstituent verwijst naar een breed scala aan grammaticale categorieën. Figuur 1 bevat een kort overzicht van LADEC-vermeldingen. De meervoudige-regressiemodellen van Gagné et al. (2019) omvatten een breed scala aan voorspeller- (=onafhankelijke) variabelen, zoals samenstellingslengte, bigramfrequentie ¹ Deze sectie is met geringe wijzigingen overgenomen uit Chariton Charitonidis (2022). ² LADEC bevat meervoudsvormen van reeds opgenomen samenstellingen als afzonderlijke vermeldingen. 274 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds op de morfeemgrens, familiegrootte, woordfrequentie, waarschijnlijkheids- en associatiematen (op vectoren gebaseerd), emotionele/sentimentsnormen berekend op basis van beoordelingen door deelnemers, enz. De logaritmische responstijden voor de samenstellingen uit ELP (lexicale beslissing, benoeming) en BLP (lexicale beslissing) worden als afhankelijke variabelen gebruikt. Overwegend worden samenstellingslengte (aantal tekens) en logaritmische samenstellings- (=woord-)frequentie uit het SUBTLEX-US-corpus (Brysbaert, New 2009)³ en BNC (BLP) als controlevariabelen gebruikt. In de modellen van Gagné et al. (2019) hadden de hierboven genoemde voorspellervariabelen significante effecten op lexicale-beslissings- en benoemingstijden. FIGUUR 1. LADEC-vermeldingen: voorbeeld De primaire focus in de studie van Gagné et al. (2019) lag op verschillende maten van semantische transparantie. Gagné et al. (2019) vroegen deelnemers om samenstellingen te beoordelen met betrekking tot de voorspelbaarheid van de betekenis van de samenstelling op basis van haar delen (betekenisvoorspelbaarheid-beoordelingen, gebaseerd op de samenstelling) en de mate waarin de betekenis van elk van de constituenten in de samenstelling behouden blijft (betekenisbehoud-beoordelingen, gebaseerd op de constituent). De auteurs vonden dat de verdeling van de transparantie voor de tweede constituent veel sterker gepiekt en hoger was dan de verdeling van de transparantie voor de eerste constituent (MC1: 64.80 [SD: 19.59] versus MC2: 71.00 [SD: 16.46]. N = 8115). De beoordeling voor de ³ Het SUBTLEX–US-corpus is een corpus van 51 miljoen tokens, gebaseerd op ondertitels van Amerikaanse films en televisieprogramma’s. Verschillende recente studies hebben bewijs geleverd dat frequentienormen die zijn verkregen uit ondertitels van films en televisieprogramma’s doorgaans doeltreffender zijn dan normen die zijn afgeleid uit gedrukte teksten wanneer het gaat om het verklaren van verschillen in lexicale verwerkingstijd en in sommige gevallen nauwkeurigheid onder moedertaalsprekers van verschillende talen (zie Chen et al. 2018: 2 en de daarin genoemde referenties). Straipsniai / Articles 275 CHARITON CHARITONIDIS eerste constituent correleerde sterker met de beoordeling voor de gehele samenstelling dan de beoordeling voor de tweede constituent (c1~cmp: r = 0.75, p <.001 versus c2~cmp: r = 0.66, p <.001. N = 429).⁴ Opvallend is dat de beoordeling van het betekenisbehoud voor de eerste constituent en de beoordeling van de betekenisvoorspelbaarheid voor de samenstelling alle drie typen responstijden voorspelden, namelijk ELP-lexicale-beslissingstijden, BLP-lexicale-beslissingstijden en ELP-benoemingstijden. Concluderend lijken de sterk gepiekte en hogere transparantieverdeling voor de tweede constituent en de sterkere associatie van de eerste constituent met de betekenisvoorspelbaarheid van de samenstelling direct te worden weerspiegeld in de hoofdoperaties van Engelse samenstellingen. De tweede constituent, d.w.z. het hoofd, is een eenheid waarvan de transparantie categorisch en semantisch wordt versterkt (wat het semantische aspect betreft, zie de relaties van entailment en hyponymie). De eerste constituent, d.w.z. de bepaler, is de meest kritieke factor bij het vaststellen van de referentie van de samenstelling. Daardoor covarieert haar transparantie het sterkst met de transparantie van de samenstelling.⁵ 2. AKAIKE-INFORMATIECRITERIUM (AIC) In 1973 ontwikkelde Hirotugu Akaike een methode om de relatieve verwachting van de Kullback–Leibler-afstand (Kullback 1959) te schatten met behulp van Fisher’s gemaximaliseerde log-likelihood (Fisher 1922; zie ook Aldrich 1997). Deze maat, gewoonlijk aangeduid als het Akaike-informatiecriterium (AIC; Akaike 1973), introduceerde een nieuw kader voor het selecteren van modellen bij de analyse van empirische gegevens en betekende een belangrijke paradigmaverschuiving (Burnham, Anderson 2002). AIC wordt doorgaans als volgt berekend: −2lnL + 2k, waarbij ‘lnL’ verwijst naar de gemaximaliseerde/volledige log-likelihood van het model en ‘k’ naar het aantal parameters, inclusief de constante. Een kleinere verzameling voorspellers wordt doorgaans geassocieerd met efficiëntere modellen (modellen met een kleiner informatieverlies). Hoe lager (=negatiever) de AIC-waarde, hoe beter de passing van het model. In deze context bestraft AIC, als goodness-of-fit-maat, het gebruik van een groot aantal voorspellers die mogelijk tot hogere AIC-waarden leiden (zie het deel ‘+2k’ van de AIC-vergelijking). ⁴ Steiger’s (1980) z-toets toonde aan dat dit verschil significant was, z = 27.71, p <.0001 (Gagné et al. 2019). ⁵ Onder verwijzing naar eerder onderzoek melden Gagné et al. (2019) dat “de modifier (de eerste constituent in het Engels) doorgaans een grotere rol speelt bij de selectie van het gemak van de relatie tijdens de verwerking van samenstellingen en naamwoordgroepen.” 276 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds AIC is gevoelig voor de steekproefomvang. AICc, een gecorrigeerde versie van AIC, verwerkt de steekproefomvang via de formule 2k (k + 1)/ (n − k − 1). Het is echter specifiek gericht op kleine steekproefomvang en wordt niet aanbevolen voor modellen die zijn gebaseerd op grote steekproefomvang, zoals dat van Gagné et al. (2019).⁶ Er dient te worden opgemerkt dat onderzoekers zoals Kenneth P. Burnham & David R. Anderson (2002) geen definitieve oplossing bieden voor het vergelijken van AIC-waarden van modellen die op zowel verschillende als grote steekproefomvang zijn aangepast.⁷ In het bijzonder geven Burnham & Anderson (2002: 80–85, 334–335) een uitvoerige bespreking van de implicaties van ongelijke steekproefomvang voor modelvergelijking. Zij betogen dat het gebruik van informatiecriteria om modellen met verschillende steekproefomvang te vergelijken tot misleidende resultaten kan leiden. Evenzo, zoals Svetunkov opmerkte in een online discussie in 2016 (zie de referentie na de bibliografie), zijn alle informatiecriteria gebaseerd op de likelihoodfunctie, die op haar beurt afhankelijk is van de steekproefomvang. Naarmate de steekproefomvang toeneemt, neemt de likelihood af. Bijgevolg zullen ook de informatiecriteria in dergelijke gevallen toenemen.⁸ 3. EERDER ONDERZOEK In Charitonidis (2022) werden de AIC-waarden voor 44 meervoudige regressiemodellen met verschillende combinaties van emotievariabelen (valentie, arousal en concreetheid voor (a) woorden en (b) woordcontexten) gedeeld door de steekproefomvang (N), wat waarden voor geschaalde AIC (AIC/N) opleverde. Vervolgens werden deze waarden gebruikt om te beoordelen ⁶ Voor meer informatie over AICc wordt de lezer verwezen naar Burnham & Anderson (2002: 374–380). ⁷ Een van de oplossingen die Burnham & Anderson (2002) voorstellen, betreft de omzetting van de AIC-waarden in “Akaike-gewichten”, die worden gedefinieerd als “de relatieve waarschijnlijkheid van het model, gegeven de gegevens” (Burnham, Anderson 2002: xiii; zie ook Wagenmakers, Farrell 2004). ⁸ Beschikbaar op: https://stats.stackexchange.com/questions/94718/model-comparison-with-aic-based-on-different-sample-size [geraadpleegd op 16.06.2023]. De lezer kan Svetunkovs uitspraak begrijpen door verschillende waarden te substitueren voor de component ‘lnL’ in de AIC-vergelijking, terwijl de component ‘2k’ constant blijft. Een afname van de lnL-waarde resulteert in een hogere, d.w.z. inferieure, AIC-waarde. ⁹ In de literatuur wordt geschaalde AIC ook aangeduid als “gemiddelde AIC”. Volgens Svetunkov (persoonlijke mededeling) is het delen van het Akaike-informatiecriterium door de steekproefomvang geen nieuwe praktijk. Zo definiëren Hastie et al. (2009: 230–231) AIC op niet-canonieke wijze, waarbij N als noemer in de formule wordt gebruikt. Hoewel deze afwijking van de conventionele AIC-formule niet zonder critici is, blijft zij een gangbare benadering, zoals blijkt uit de opname ervan in het statistische softwarepakket Stata. Stata rapporteert bijvoorbeeld “AIC gedeeld door N” in zijn modeluitvoer, zoals blijkt uit verschillende online beschikbare voorbeelden (Dank aan I. Svetunkov voor het verstrekken van deze informatie). Straipsniai / Articles 277 CHARITON CHARITONIDIS en de goodness-of-fit van de modellen te vergelijken. Het invoegen van belangrijke voorspellers in globale, d.w.z. algemene, modellen liet zien dat de BLP-lexicale-beslissingstijden een betere modelpassing vereisten dan de ELP-lexicale-beslissingstijden. De passing van de ELP-benoemingsmodellen viel binnen het bereik van die van de ELP- en BLP-lexicale-beslissingsmodellen. Het meest opvallend was dat contextuele concreetheid voor de tweede constituent in alle modellen met SUBTLEX-US-frequentie als significante voorspeller naar voren kwam, zowel voor lexicale beslissing als voor benoeming. In Charitonidis (2024) werden alle significante coëfficiënten uit de globale modellen met SUBTLEX-US-frequentie afgezet tegen de variabele hyponymie (Gagné et al. 2020). Er werd vastgesteld dat modellen die zowel hyponymie als contextuele concreetheid voor de tweede constituent bevatten, altijd geassocieerd waren met de laagste (=beste) waarde voor geschaalde AIC, vergeleken met geneste, d.w.z. gereduceerde, modellen waarin een van deze twee variabelen ontbrak. De vervolgens toegepaste Wald-toetsen toonden aan dat geneste modellen steeds verwezen naar een significante vermindering (=verslechtering) van de determinatiecoëfficiënt (R2). Tabellen 1 en 2 tonen respectievelijk de waarden voor geschaalde AIC en de resultaten van de overeenkomstige Wald-toetsen. TABEL 1. Waarden voor geschaalde AIC voor geneste modellen waarin hyponymie (‘Model 2’) of contextuele concreetheid voor de tweede constituent (‘Model 3’) is weggelaten uit volledige modellen (‘Model 1’) om de lexicale-beslissingstijden van het English Lexicon Project (ELP), de lexicale-beslissingstijden van het British Lexicon Project (BLP) en de benoemingstijden van ELP te voorspellen Model | Geschaalde AIC | AIC | N ELP LD 1 | −3.36281ᵃ | −3557.85 | 1058 2 | −3.30375 | −4169.334 | 1262 3 | −3.34845 | −3700.038 | 1105 BLP LD 1 | −3.79552ᵃ | −2903.574 | 765 2 | −3.76618 | −3920.592 | 1041 3 | −3.76718 | −2987.37 | 793 ELP-benoeming 1 | −3.58686ᵇ | −7396.108 | 2062 2 | −3.54304 | −8418.27 | 2376 3 | −3.58379 | −7389.784 | 2062 278 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds a. Voorspellers: (Constante), hyponymiebeoordeling, samenstellingslengte, SUBTLEX–US-frequentie, representatievalentie (cmp), contextuele concreetheid (c2) b. Voorspellers: (Constante), hyponymiebeoordeling, samenstellingslengte, SUBTLEX–US-frequentie, contextuele valentie (cmp), contextuele arousal (c1), contextuele arousal (c2), contextuele concreetheid (c2) TABEL 2. Wald-toetsen voor geneste modellen waarin hyponymie (‘Model 2’) of contextuele concreetheid voor de tweede constituent (‘Model 3’) is weggelaten uit volledige modellen (‘Model 1’) om de lexicale-beslissingstijden van het English Lexicon Project (ELP), de lexicale-beslissingstijden van het British Lexicon Project (BLP) en de benoemingstijden van ELP te voorspellen Model | R2 square | F change | df1 | df2 | p ELP LD 1 |.184a | 47.506 | 5 | 1052 |.000 2 | −.004 | 4.562 | 1 | 1052 |.033 3 | −.010 | 13.175 | 1 | 1052 |.000 BLP LD 1 |.211a | 40.479 | 5 | 759 |.000 2 | −.013 | 12.091 | 1 | 759 |.001 3 | −.015 | 14.007 | 1 | 759 |.000 ELP-benoeming 1 |.288b | 118.711 | 7 | 2054 |.000 2 | −.003 | 8.286 | 1 | 2054 |.004 3 | −.003 | 8.309 | 1 | 2054 |.004 a. Voorspellers: (Constante), hyponymiebeoordeling, samenstellingslengte, SUBTLEX–US-frequentie, representatievalentie (cmp), contextuele concreetheid (c2) b. Voorspellers: (Constante), hyponymiebeoordeling, samenstellingslengte, SUBTLEX–US-frequentie, contextuele valentie (cmp), contextuele arousal (c1), contextuele arousal (c2), contextuele concreetheid (c2) Concluderend hebben twee verschillende effectgroottematen, namelijk geschaalde AIC en R2, dezelfde regressiemodellen op identieke wijze gehiërarchiseerd en daarbij dezelfde voorkeur voor het beste model getoond. Er zijn dus sterke aanwijzingen dat de maat geschaalde AIC een kwalitatief instrument is om de modelpassing te beoordelen. Straipsniai / Articles 279 CHARITON CHARITONIDIS 4. DE HUIDIGE STUDIE De huidige studie bouwt voort op het eerdere onderzoek van de auteur dat in sectie 3 is gepresenteerd. De onderzoeksobjecten zijn 66 modellen voor lexicale beslissing en benoeming van Engelse gesloten (aaneengeschreven) samenstellingen, opgesteld door Gagné et al. (2019). Alle modellen bevatten SUBTLEX-US-frequentie als controlevariabele. Onze doelstellingen zijn tweeledig en lopen parallel. Ten eerste beoordelen wij de kenmerken van de modellen van Gagné et al. (ibid.). Ten tweede onderzoeken wij essentiële eigenschappen van de maat geschaalde AIC. De onderzoeksvragen zijn: 1. Is geschaalde AIC gevoelig voor het modelontwerp in Gagné et al. (2019)? Aan welke modelgroepen wordt de voorkeur gegeven? 2. Wat is de invloed van de controlevariabelen ‘samenstellingsfrequentie’ en ‘samenstellingslengte’ op geschaalde AIC? 3. Hoe verhoudt morfologische transparantie zich tot geschaalde AIC? Onze studie is als volgt opgebouwd: Sectie 5 geeft een overzicht van onze methoden. Sectie 6.1 geeft beschrijvende statistieken voor geschaalde AIC met betrekking tot de onderzochte modellen. De nadruk ligt op de parametrische versus niet-parametrische kenmerken van modelcategorieën. Sectie 6.2 onderzoekt de relatie tussen de bron van de responstijden en de lexicale verwerkingstaken. Sectie 6.3 zet geschaalde AIC af tegen de controlevariabelen ‘samenstellingsfrequentie’ en ‘samenstellingslengte’. In sectie 6.4 worden de significantieniveaus van de transparantiecoëfficiënten uit de modellen van Gagné et al. (2019) gekoppeld aan de waarden voor geschaalde AIC. De belangrijkste bevindingen worden samengevat in sectie 7, gevolgd door een bespreking van de resultaten in sectie 8. 5. METHODEN Onze algemene methode bestond uit een vergelijkende analyse van de belangrijkste parameters en kenmerken van de modellen van Gagné et al. (2019), waarbij geschaalde AIC als afhankelijke variabele werd gebruikt. Onafhankelijke variabelen omvatten steekproefkenmerken (bijv. bron van de responstijden en de lexicale verwerkingstaken), onderzoeksontwerp (bijv. controlevariabelen) en het significantieniveau van transparantiecoëfficiënten, naast andere factoren. De toegepaste specifieke statistische methoden waren als volgt: (a) beschrijvende statistieken met betrekking tot gemiddelden en medianen, samen met de toepassing van de Shapiro–Wilk-toets om de centrale tendentie, variabiliteit en verdeling van geschaalde AIC over verschillende modelcategorieën en -groepen te beoordelen (secties 6.1 en 6.2), (b) analyses van hoofdeffecten uitgevoerd voor de bron van de responstijden (ELP/BLP) en de lexicale verwerkingstaken (lexicale beslissing/benoeming) (sectie 280 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds 6.2), (c) afzonderlijke ANOVA’s uitgevoerd voor de bron van de responstijden en de lexicale verwerkingstaken, met samenstellingslengte als covariaat (sectie 6.3), en (d) toepassing van de Kruskal–Wallis- en Jonckheere–Terpstra-toetsen om verschillen tussen de rangen van ordinaal gecodeerde coëfficiënten voor semantische transparantie te onderzoeken (sectie 6.4). Voor meer informatie over de methoden wordt de lezer verwezen naar de analyses in secties 6.1–6.4. 6. ANALYSES 6.1. Geschaalde AIC versus modelcategorieën De 66 AIC-waarden uit de meervoudige-regressiemodellen van Gagné et al. (2019), met SUBTLEX–US-frequentie als controlevariabele, werden gedeeld door de steekproefomvang van elk model, wat een verzameling van 66 waarden voor geschaalde AIC opleverde. Tabel 3 hieronder geeft de beschrijvende statistieken voor geschaalde AIC en Figuur 2 toont de bijbehorende boxplot met betrekking tot de geordende verzameling waarden.10 Er waren geen uitschieters in de steekproef. De scheefheid (Sk) en kurtosis (Ku) waren aanvaardbaar.11 De gemiddelde waarde voor geschaalde AIC was −3.50030. De standaardafwijking was 0.19052, dat wil zeggen dat de waarnemingen relatief dicht rond het gemiddelde gegroepeerd waren. De minimum- en maximumwaarden waren respectievelijk −3.85502 en −3.15754. De mediaan was −3.55732, d.w.z. iets lager dan het gemiddelde.12 De middelste 50% van de gegevens lag tussen −3.66575 (eerste kwartiel, Q1) en −3.30959 (derde kwartiel, Q3). Dienovereenkomstig bedroeg het interkwartielbereik (IQR) 0.35616. 10 De onderste of eerste kwartiel-lijn van de box (Q1) markeert de grens waaronder de onderste 25% van de gegevens valt. Evenzo markeert de bovenste of derde kwartiel-lijn van de box (Q3) de grens waarboven de bovenste 25% van de gegevens valt. Het gearceerde gebied toont de grenzen van de middelste 50% van de gegevens, oftewel het interkwartielbereik (IQR), dat kan worden berekend door het eerste kwartiel van het derde kwartiel af te trekken (Q3−Q1). De horizontale lijn binnen de box toont de mediaan of het middelste kwartiel (Q2), d.w.z. de waarde die in het midden van de dataset valt. 11 Met verwijzing naar de SPSS-omgeving worden waarden tussen −1 en +1 voor scheefheid en tussen −2 en +2 voor kurtosis doorgaans als aanvaardbaar beschouwd voor de beoordeling van een normale verdeling. Er dient echter te worden opgemerkt dat scheefheid en kurtosis op zichzelf geen sluitend bewijs van normaliteit leveren (zie ook de bespreking van https://www.researchgate.net/post/What_is_the_acceptable_range_of_skewness_and_kurtosis_for_normal_distribution_of_data). 12 In overeenstemming met dit patroon was er een geringe positieve scheefheid in de gegevens (0.494). Straipsniai / Articles 281 CHARITON CHARITONIDIS TABEL 3. Beschrijvende statistieken voor geschaalde AIC (volledige verzameling) Gemiddelde SD Min Max −3.50030 0.19052 −3.85502 −3.15754 Mediaan IQR Q1 Q3 −3.55732 0.35616 −3.66575 −3.30959 N=66. Sk=0.494, Ku=−1.101 FIGUUR 2. Verdeling van geschaalde AIC (volledige verzameling): boxplot Verwacht werd dat de volledige verzameling waarden voor geschaalde AIC geen normale verdeling zou vertonen, omdat zij verschillende taken (lexicale beslissing, benoeming) omvatte en was afgeleid van verschillende bronnen van responstijden (ELP, BLP). De Shapiro–Wilk-toets en de Kolmogorov–Smirnov-toets bevestigden onze aannamen.13 In het bijzonder bedroegen de statistieken voor de Shapiro–Wilk-toets W (66) = 0.90, p <.001, en de statistieken voor de Kolmogorov–Smirnov-toets D (66) = 0.17, p <.001. Er dient te worden opgemerkt dat dezelfde volledige verzameling geen normale verdeling vertoonde, zelfs niet na toepassing van de natuurlijke logaritme- en vierkantsworteltransformaties op de absolute waarden. Tabel 4 hieronder geeft de beschrijvende statistieken voor geschaalde AIC met betrekking tot de belangrijkste modelcategorieën in Gagné et al. (2019), d.w.z. ELP-lexicale beslissing, BLP-lexicale beslissing en ELP-benoeming (elke groep bevat 22 modellen). Figuur 3 toont de overeenkomstige boxplots. Zoals te zien is, de gemiddelden en medianen 13 De Kolmogorov–Smirnov-toets paste de Lilliefors-significantiewcorrectie toe. 282 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds voor BLP-lexicale beslissing en ELP-benoeming verwezen naar vergelijkbare waarden voor geschaalde AIC. ELP-lexicale beslissing verwees naar hogere (=inferieure) waarden die bovendien disjunct waren van de BLP-lexicale-beslissingswaarden.14 Samengevat vereisten BLP-lexicale beslissing en ELP-benoeming altijd betere modellen dan ELP-lexicale beslissing. TABEL 4. Beschrijvende statistieken voor geschaalde AIC per belangrijkste modelcategorie Verwacht werd dat het niet-parametrische profiel van de volledige verzameling waarden voor geschaalde AIC minder waarschijnlijk binnen de belangrijkste modelcategorieën zou voorkomen, d.w.z. de belangrijkste combinaties van responstijden en taken. Zoals duidelijk zal worden, werd deze verwachting bevestigd. De Shapiro-Wilk-toets toonde aan dat de ELP-lexicale-beslissingsgegevens significant afweken van normaliteit. In het bijzonder berekenden we een toetsingsstatistiek van W (22) = 0.90, p <.05.15 De BLP-lexicale-beslissingsgegevens waren normaal verdeeld. De desbetreffende statistieken waren W (22) = 0.92, p >.05 (Shapiro-Wilk). 14 Een t-toets op de samenvattingsgegevens voor ELP-lexicale beslissing en BLP-lexicale beslissing (Tabel 4) wees op een zeer significant verschil tussen de steekproefgemiddelden, t = 18.296, p <.0001. 15 Er dient te worden opgemerkt dat een reeks van zes ELP-modellen voor lexicale beslissing verwees naar Scaled AIC-waarden nabij de maximale waarde van −3.15754, wat de slechtste fit in de gehele dataset aangeeft. Deze modellen droegen bij aan een prominente piek aan het hogere uiteinde van de verdeling (variërend van −3.17304 tot −3.15754), wat resulteerde in een vrijwel bimodaal verdelingspatroon. Deze observatie wordt ondersteund door een relatief hoge negatieve kurtosiswaarde van −1.444. Straipsniai / Articles 283 CHARITON CHARITONIDIS FIGUUR 3. Boxplotweergaven van Scaled AIC per hoofdcategorie van het model Evenzo waren de ELP-naamgegevens normaal verdeeld. De betreffende statistieken waren W (22) = 0.93, p >.05 (Shapiro–Wilk). Samenvattend werden zowel de volledige modellenverzameling als de ELP-modellen voor lexicale beslissing geassocieerd met een niet-parametrische verdeling van Scaled AIC. Daarentegen waren de BLP-gegevens voor lexicale beslissing en de ELP-naamgegevens normaal verdeeld. Laten we nu proberen de invloed van afzonderlijke factoren op Scaled AIC bloot te leggen. 6.2. Scaled AIC versus bron van responstijden en taken Tabel 5 hieronder bevat de beschrijvende statistieken voor de Scaled AIC-waarden van de groepen die zijn gecategoriseerd onder de hoofdfactoren ‘responstijden’ en ‘taken’, d.w.z. (a) ELP-responstijden, (b) BLP-responstijden, (c) benoemingstaak en (d) taak voor lexicale beslissing. De ELP-responstijden en de taak voor lexicale beslissing 284 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds zijn overkoepelende groepen die respectievelijk verwijzen naar ‘lexicale beslissing & benoeming’ en ‘ELP & BLP’. De groepen ‘BLP’ en ‘Benoeming’ zijn identiek aan de modelcategorieën ‘BLP lexicale beslissing’ en ‘ELP benoeming’, die al in Tabel 4 (sectie 6.1) werden gepresenteerd. Figuur 4 toont de overeenkomstige boxplotweergaven. Zoals in Tabel 5 te zien is, verwezen zowel ‘BLP’ als ‘Benoeming’ naar (a) lagere (= betere) gemiddelde en mediane waarden voor Scaled AIC, en (b) kleinere waarden voor standaarddeviatie (SD) en interkwartielafstand (IQR), in tegenstelling tot de overkoepelende groepen ‘ELP-responstijden’ en ‘lexicale beslissing’.16 Dezelfde overkoepelende groepen hebben relatief hoge kurtosiswaarden, namelijk respectievelijk −1.403 en −1.616 (in de histogrammen voor deze groepen – hier niet weergegeven – kwamen twee duidelijke pieken naar voren, vergelijkbaar met die van een bimodale verdeling van waarden). Deze patronen suggereren dat de Scaled AIC-maat uniek geassocieerd was met de duidelijk gedefinieerde experimentele categorieën BLP lexicale beslissing (zie de groep ‘BLP’) en ELP benoeming (zie de groep ‘Benoeming’). TABEL 5. Beschrijvende statistieken voor Scaled AIC met betrekking tot de groepen die zijn gecategoriseerd onder ‘responstijden’ en ‘taken’ Responstijden Taken ELP BLP Benoeming Lexicale beslissing Gemiddelde −3.43917 −3.62255 −3.62495 −3.43797 SD 0.20286 0.06778 0.08710 0.19808 Min −3.85502 −3.75547 −3.85502 −3.75547 Max −3.15754 −3.52945 −3.50150 −3.15754 Mediaan −3.42626 −3.62174 −3.61886 −3.44024 IQR 0.35152 0.13704 0.13758 0.36196 Q1 −3.62127 −3.68840 −3.69419 −3.63171 Q3 −3.26975 −3.55136 −3.55662 −3.26975 Sk −0.126 −0.097 −0.559 −0.006 Ku −1.403 −1.244 0.725 −1.616 44 22 22 44 16 Lagere gemiddelden en medianen, samen met kleinere waarden voor standaarddeviatie en interkwartielafstand, wijzen op een grotere betrouwbaarheid en een geringere gevoeligheid voor uitschieters of extreme waarden. Straipsniai / Articles 285 CHARITON CHARITONIDIS FIGUUR 4. Boxplotweergaven voor Scaled AIC met betrekking tot de groepen die zijn gecategoriseerd onder ‘responstijden’ en ‘taken’ Net als bij de volledige reeks Scaled AIC-waarden die in sectie 6.1 werd besproken, werd verwacht dat een niet-parametrisch profiel zichtbaar zou zijn voor de overkoepelende groepen ‘ELP’ en ‘lexicale beslissing’, die niet door specifieke experimenten werden beperkt. De normaliteitstoetsen bevestigden onze verwachtingen. Wat betreft de Shapiro–Wilk-toets weken de Scaled AIC-gegevens voor de ELP-groep significant af van normaliteit. We berekenden een toetsingsstatistiek van W (44) = 0.91, p <.01. Evenzo weken de Scaled AIC-gegevens voor de groep lexicale beslissing significant af van normaliteit. We berekenden een toetsingsstatistiek van W (44) = 0.89, p <.001. Laten we nu overgaan tot de analyse van hoofdeffecten. Het primaire doel was vast te stellen of de groepen BLP lexicale beslissing en ELP benoeming betere modellen blijven voorspellen wanneer voor de effecten van een van beide groepen wordt gecontroleerd. In de hiernavolgende statistische toetsen kregen de groepen die onder de hoofdfactoren ‘responstijden’ en ‘taken’ waren gecategoriseerd nominale waarden toegewezen. Het Scaled AIC-gemiddelde voor de BLP-groep, d.w.z. −3.623, werd gebruikt als referentiecategorie of intercept. De resultaten toonden aan dat zowel responstijden als taken een hoofdeffect op Scaled AIC hadden, maar dat er geen interactie was. In het bijzonder was er een significant hoofdeffect van responstijden, F (1, 63) = 271.87, p <.001. In regressietermen voorspelde de coëfficiënt voor ELP een hogere, d.w.z. inferieure, Scaled AIC-waarde, b = 0.37, SE = 0.02, t = 16.49, p <.001. Daarnaast was er een significant hoofdeffect van taken, F (1, 63) = 275.42, p <.001. In regressietermen voorspelde de coëfficiënt voor benoeming een lagere, d.w.z. betere, Scaled AIC-waarde, b = −0.37, SE = 0.02, t = −16.60, p <.001. Figuur 5 geeft een overzicht van de hoofdeffecten door middel van een punten- en lijndiagram. De intercept- of referentiecategorie verwijst zowel naar de laagste ELP-benoemingswaarde als naar de hoogste BLP-waarde voor lexicale beslissing, d.w.z. −3.623. De lijnen zijn gestapeld 286 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds verticaal, omdat de bereiken van Scaled AIC-waarden voor ELP lexicale beslissing en BLP lexicale beslissing disjunct waren (zie Tabel 4). Bovendien zijn de lijnen parallel, omdat de afwezigheid van een groep ‘BLP benoeming’ binnen de taken alle interactie-effecten uitsloot. Samenvattend voorspelden de BLP-responstijden en de benoemingstaak aanhoudend betere Scaled AIC-waarden, zelfs na wederzijdse controle voor relevante factoren. Deze bevindingen vergroten de nauwkeurigheid en doeltreffendheid van de betreffende modellen. FIGUUR 5. Diagram van hoofdeffecten voor Scaled AIC Er dient te worden opgemerkt dat de in deze sectie gepresenteerde analyse van hoofdeffecten meer van toepassing is op de bron van responstijden dan op taakprestaties, omdat, zoals reeds vermeld, de combinatie ‘BLP benoeming’ niet beschikbaar was. Dit feit kan de generaliseerbaarheid van de resultaten buiten de specifieke steekproeven beperken. 6.3. Scaled AIC versus controlevariabelen In deze sectie ligt de nadruk op de controlevariabelen lengte van de samenstelling (in tekens) en SUBTLEX-US-frequentie, d.w.z. de logaritmische samenstellingsfrequentie afgeleid uit het SUBTLEX-US-corpus (Brysbaert, New 2009). Beide variabelen werden uitvoerig gebruikt in de regressiemodellen van Gagné et al. (2019). Straipsniai / Articles 287 CHARITON CHARITONIDIS Om de invloed van samenstellingslengte en samenstellingsfrequentie op Scaled AIC vast te stellen, werden de betreffende regressiecoëfficiënten hergecodeerd in ordinale waarden volgens hun positiviteit en significantieniveau, zie Tabel 6. De significantieniveaus werden op ordinale schalen afgebeeld, omdat zij conventionele afkappunten vertegenwoordigden die op de exacte significantiewaarden waren gebaseerd. TABEL 6. Schema voor ordinale hercodering van regressiecoëfficiënten Significantie Positiviteit Ordinale waarden Beschrijving p <.001 negatief −3 groot negatief effect p <.01 negatief −2 matig negatief effect p <.05 negatief −1 klein negatief effect p >.05 negatief/positief 0 niet-significant effect p <.05 positief 1 klein positief effect p <.01 positief 2 matig positief effect p <.001 positief 3 groot positief effect In de modellen van Gagné et al. (2019) werd SUBTLEX-US frequency altijd geassocieerd met negatieve (=latentieverkortende) coëfficiënten met een groot effect, p <.001. Dienovereenkomstig werden alle coëfficiënten hergecodeerd als −3, een waarde die perfect collineair was met de uitkomstvariabele, Scaled AIC. Om deze reden werd SUBTLEX-US frequency uitgesloten van de huidige analyse. Wat compound length betreft, hadden alle significante regressiecoëfficiënten uit de modellen van Gagné et al. (2019) een groot positief (=latentie-inducerend) effect, p <.001. In tegenstelling tot de SUBTLEX-US-variabele kwamen verschillende niet-significante coëfficiënten voor. Op basis van deze patronen werd een categorische variabele gecreëerd met de waarden ‘1’ voor positief effect (=interferentie van samenstellingslengte) en ‘0’ voor geen effect (=geen interferentie van samenstellingslengte). De resulterende steekproef bevatte 39 Scaled AIC-waarden. De Pearson-correlatietoets tussen samenstellingslengte en Scaled AIC leverde een zeer significante correlatiecoëfficiënt van 0.51, p =.001, op, wat wijst op een matige tot sterke correlatie tussen de twee variabelen. Samenstellingslengte werd als één onafhankelijke variabele opgenomen in een lineair regressiemodel. Er werd vastgesteld dat het voorspelde Scaled AIC-gemiddelde voor geen interferentie van samenstellingslengte 3.611 (=het intercept) bedroeg. De interferentie van samenstellingslengte resulteerde in een hogere (=inferieure) waarde van −3.407 (b = 0.204, p =.001). Figuur 6 hieronder illustreert deze patronen. Kortom, Scaled AIC verslechtert wanneer samenstellingslengte relevant wordt binnen modellen. 288 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds FIGUUR 6. Samenstellingslengte en Scaled AIC We voerden afzonderlijke ANOVA’s uit voor de bron van responstijden (ELP/BLP) en taakprestatie (lexicale beslissing/benoeming), waarbij samenstellingslengte als covariaat in aanmerking werd genomen. Het primaire doel was verschillen vast te stellen in gemiddelden die eerder waren aangepast om rekening te houden met de controlerende effecten van samenstellingslengte. (a) ANOVA voor de bron van responstijden. Aan BLP werd de waarde ‘0’ toegekend en aan ELP de waarde ‘1’. De Pearson-correlatietoets bracht een sterke collineariteit aan het licht tussen de bron van responstijden en samenstellingslengte, r = 1 (N = 39). Het volgende bewijs ondersteunt onze bevinding: Ten eerste vertoonde de ELP-groep consequent significante positieve correlaties met samenstellingslengte, wat wijst op een groot effect. Ten tweede vertoonde de BLP-groep consequent niet-significante correlaties met samenstellingslengte. Bijgevolg was het voorspelde Scaled AIC-gemiddelde voor de bron van responstijden hetzelfde met of zonder samenstellingslengte in de analyse (M = 3.407 in beide gevallen). Samenvattend had samenstellingslengte geen significant effect op Scaled AIC wanneer de bron van responstijden werd opgenomen. (b) ANOVA voor taakprestatie. Aan benoeming werd de waarde ‘0’ toegekend en aan lexicale beslissing de waarde ‘1’. De Pearson-correlatietoets bracht een negatieve correlatie tussen taak en samenstellingslengte aan het licht, wat wijst op een matig effect, r = −.5, p =.001 (N = 39). Dit resultaat suggereert dat samenstellingslengte relevanter is voor benoeming dan voor lexicale beslissing. 17 Er dient te worden opgemerkt dat 11 van de 13 BLP-coëfficiënten negatief waren. Straipsniai / Articles 289 CHARITON CHARITONIDIS Wanneer taak als primaire variabele werd beschouwd, was samenstellingslengte een significante voorspeller van Scaled AIC, F (1, 145.030), p =.000. Evenzo was taak, wanneer samenstellingslengte als primaire variabele werd beschouwd, een significante voorspeller van Scaled AIC, F (1, 125.30), p =.000. Het voorspelde Scaled AIC-gemiddelde voor alleen taak verschilde significant van het voorspelde Scaled AIC-gemiddelde wanneer samenstellingslengte in aanmerking werd genomen (respectievelijk 3.584 versus 3.203). Evenzo verschilde het voorspelde Scaled AIC-gemiddelde voor alleen samenstellingslengte (3.584) significant van het voorspelde Scaled AIC-gemiddelde wanneer taak in aanmerking werd genomen (−3.23). Samenvattend voorspelden zowel de taak voor lexicale beslissing als samenstellingslengte, in termen van covariaataanpassing, inferieure modellen. 6.4. Scaled AIC versus transparantienormen Deze sectie onderzoekt het effect van regressiecoëfficiënten voor semantische transparantie in de modellen van Gagné et al. (2019) op Scaled AIC. Deze regressiecoëfficiënten werden gecodeerd op drie ordinale schalen, die elk overeenkwamen met een van de drie morfologische niveaus, d.w.z. samenstelling, eerste constituent en tweede constituent. Het schema voor ordinale hercodering is te vinden in Tabel 6. Tabel 7 hieronder toont de medianen en bereiken van de ordinaal getransformeerde transparantiecoëfficiënten voor alle drie morfologische niveaus. De medianen verschaffen nuttige informatie over de centrale tendens en spreiding van ordinale waarden en kunnen analyses op basis van ordinale variabelen helpen informeren. TABEL 7. Ordinaal getransformeerde transparantiecoëfficiënten: medianen en bereiken Mediaan Minimum Maximum Samenstelling −3 −3 −1 Eerste constituent 2 −3 3 Tweede constituent 0 −2 3 N = 18 Zoals te zien is, was de mediaan voor de samenstelling ‘−3’, de mediaan voor de eerste constituent ‘2’ en de mediaan voor de tweede constituent ‘0’. Deze bevindingen suggereren dat in de modellen van Gagné et al. (2019) met SUBTLEX–US-frequentie transparantie voor de samenstelling geassocieerd was met een groot negatief effect (kortere responstijden), transparantie voor de eerste constituent geassocieerd was met een matig positief effect (langere responstijden), en transparantie voor de tweede constituent geen significant effect had of 290 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds een onzekere rol had. De hogere transparantiescores voor de tweede constituent, gerapporteerd door Gagné et al. (ibid.), wijzen op een inherente voorkeur voor deze constituent, waardoor de algehele transparantie van de samenstelling afhankelijk wordt van de transparantie van de eerste constituent. In deze context wijst de positieve, latentie-inducerende mediaan voor de eerste constituent op diens bemiddelende, wellicht referentievestigende rol in deze relatie (zie ook sectie 1). Het moet nog worden aangetoond welke semantische functies de inherente voorkeur voor de tweede constituent in verwerkingstermen voldoende representeren.18 De onderzoeksvraag die nu aan de orde komt, is of de positiviteit en het significantieniveau van transparantiecoëfficiënten Scaled AIC beïnvloeden. Onze methode is primair gericht op het vaststellen van overfitting-effecten. Zoals Daniel J. Navarro & Jay I. Myung (2005) betogen, “a complex model with many parameters and highly nonlinear form can often fit data better than a simple model with few parameters even if the latter generated the data” (Navarro, Myung 2005: 1240). Dienovereenkomstig kunnen grote aantallen parameters ruis of unieke kenmerken van de beschikbare gegevens vastleggen, maar zij kunnen het vermogen van het model om te generaliseren naar nieuwe gegevens belemmeren. AIC beperkt het probleem van overfitting door een strafterm in te voeren voor het opnemen van talrijke parameters in een model, zie het gedeelte ‘+2k’ van de AIC-vergelijking in sectie 2. Wat de hiernavolgende analyse betreft, wordt gepostuleerd dat modellen met hogere (=inferieure) Scaled AIC-waarden significante, systematisch afgeleide coëfficiënten kunnen bezitten, d.w.z. coëfficiënten die uitsluitend volgens de LADEC-dataset relevant zijn. In deze context suggereert onze conjectuur dat er een tegengestelde trend kan ontstaan in de relatie tussen transparantie en Scaled AIC, vergeleken met de aanwijzing die de medianen in Tabel 7 bieden. In het bijzonder kunnen lagere (=betere) Scaled AIC-waarden geassocieerd zijn met (a) positieve coëfficiënten (langere responstijden) met betrekking tot de gehele samenstelling, (b) negatieve coëfficiënten (kortere responstijden) met betrekking tot de eerste constituent, en (c) positieve of negatieve coëfficiënten (respectievelijk langere of kortere responstijden) met betrekking tot de tweede constituent. Er dient te worden opgemerkt dat de mediaan in Tabel 7 met betrekking tot de tweede constituent geen effect suggereert. Om de onderzoeksvraag te beantwoorden, zullen twee niet-parametrische maten worden gebruikt, namelijk de Kruskal–Wallis-toets en de Jonckheere–Terpstra-toets. De Kruskal–Wallis-toets, ook bekend als de ‘H-toets’, is een niet-parametrische toets gebaseerd op 18 In Charitonidis (2024) wordt betoogd dat zowel hyponymie als contextconcreetheid voor de tweede constituent significante semantische voorspellers zijn bij lexicale beslissing en benoeming. De daarin gepresenteerde analyse toont aan dat het opnemen van beide voorspellers resulteert in een verbetering van Scaled AIC en R2 in vergelijking met modellen waarin een van deze variabelen ontbreekt. Straipsniai / Articles 291 CHARITON CHARITONIDIS de chi-kwadraatverdeling. De toets vereist dat de afhankelijke variabele ordinaal of continu is. Deze toets is ontworpen om vast te stellen of er significante verschillen bestaan tussen de medianen van twee of meer groepen en wordt gebruikt als alternatief voor een eenweg-ANOVA. Wat de procedure betreft, werden de waarden van de continue afhankelijke variabele, d.w.z. Scaled AIC, van laag naar hoog geordend en kregen de scores rangnummers toegewezen. De resulterende rangnummers werden teruggeplaatst in de groepen van significantieniveau (de onafhankelijke variabele) en de rangnummers voor elke groep werden opgeteld. De formule voor het berekenen van ‘H’ omvatte onder meer het kwadrateren van de som van de rangnummers voor elke groep en vervolgens het delen van deze waarde door de steekproefomvang. Tabellen 8–10 bevatten de in aanmerking genomen invoergegevens en de som van de rangnummers voor elke groep. 19 20 som van de rangnummers voor elke groep. TABEL 8. Samenstelling Significantieniveaus | N | Som van rangen Scaled AIC | 1 – klein negatief effect | 1 | 2 | 2 – matig negatief effect | 5 | 46 | 3 – groot negatief effect | 12 | 123 | Totaal | 18 | TABEL 9. Eerste constituent Significantieniveaus | N | Som van rangen Scaled AIC | 1 – groot positief effect | 6 | 59 | 2 – matig positief effect | 4 | 34 | 3 – klein positief effect | 1 | 3 | 4 – geen effect | 1 | 2 | 5 – klein negatief effect | 1 | 10 | 6 – matig negatief effect | 1 | 11 | 7 – groot negatief effect | 4 | 52 | Totaal | 18 | 19 Zie voor de overige berekeningen Field (2009: 561–562). 20 In alle drie tabellen bedraagt de totale som van de rangen ongeveer 171. Dit is gelijk aan de som van de gehele getallen van 1 tot en met 18, zie steekproefomvang (N). 292 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds TABEL 10. Tweede constituent Scaled AIC | Significantieniveaus | N | Som van rangen Scaled AIC | 1 – groot positief effect | 6 | 59 Scaled AIC | 2 – klein positief effect | 1 | 14 Scaled AIC | 3 – geen effect | 8 | 59 Scaled AIC | 4 – klein negatief effect | 1 | 18 Scaled AIC | 5 – matig negatief effect | 2 | 21 | Totaal | 18 | Voordat we ingaan op de resultaten van de Kruskal-Wallis-toets (H), is het belangrijk op te merken dat deze toets geen informatie verschaft over de specifieke verschillen tussen afzonderlijke groepen. Om dit probleem aan te pakken, werd aanvullend de Jonckheere-Terpstra-toets (JT) toegepast. Deze toets verschafte informatie over de vraag of de medianen van de groepen toenamen of afnamen in de door de codering gespecificeerde volgorde (=groeperings)variabele, namelijk van een groot positief effect naar een groot negatief effect. Wat de methoden betreft, werd de JT-statistiek omgezet in een z-score. Een positieve z-waarde wees op een trend van stijgende medianen, dat wil zeggen dat de medianen toenamen (=hoger/inferieur Scaled AIC) naarmate de waarden van de coderingsvariabele toenamen. Een negatieve z-waarde wees op een trend van dalende medianen, dat wil zeggen dat de medianen afnamen (=lager/beter Scaled AIC) naarmate de waarden van de coderingsvariabele toenamen. Hieronder worden de resultaten van de Kruskal-Wallis-toets (H) en de Jonckheere-Terpstra-toets (JT) gezamenlijk gepresenteerd. (a) Scaled AIC voor de samenstelling werd niet significant beïnvloed door het significantieniveau, zoals vastgesteld met de Kruskal-Wallis-toets (H (2) = 2.226, p >.05). Er werd een stijgende trend van de medianen gevonden, wat onze overfittinghypothese bevestigde; zie de negatieve mediaan voor de samenstelling in Tabel 7. Deze trend was volgens de Jonckheere-Terpstra-toets echter niet statistisch significant (JT = 50, z = 1.064, p >.05). (b) Scaled AIC voor de eerste constituent werd niet significant beïnvloed door het significantieniveau, zoals vastgesteld met de Kruskal-Wallis-toets (H (6) = 5.427, p >.05). Er werd een stijgende trend van de medianen gevonden, die onze overfittinghypothese verwierp; zie de positieve mediaan voor de eerste constituent in Tabel 7. Deze trend was volgens de Jonckheere-Terpstra-toets echter niet statistisch significant (JT = 70, z = 0.549, p >.05). (c) Scaled AIC voor de tweede constituent werd niet significant beïnvloed door het significantieniveau, zoals vastgesteld met de Kruskal-Wallis-toets (H (4) = 4.607, p >.05). Er werd geen stijgende of dalende trend van de medianen waargenomen, wat Straipsniai / Articles 293 CHARITON CHARITONIDIS onze overfittinghypothese verwierp. In het bijzonder was de z-statistiek van de Jonckheere–Terpstra-toets nagenoeg nul, in overeenstemming met de nulmediaan voor de tweede constituent in Tabel 7 (JT = 54, z = 0.041, p >.05). Samenvattend kan worden afgeleid dat het significantieniveau van de transparantiecoëfficiënten in de modellen van Gagné et al. (2019) met SUBTLEX-US-frequency de omvang van Scaled AIC niet beïnvloedt. Deze bevinding ondersteunt indirect de kwaliteit van de modellen van Gagné et al. (2019) met transparantievoorspellers, en geeft specifiek aan dat de overfittinghypothese voor deze modellen niet houdbaar is. Een beperking van de huidige studie is de kleine gebruikte steekproefomvang, met N = 18. Om onze bevindingen te bevestigen, is meer onderzoek nodig met een breder bereik aan Scaled AIC-waarden. Om duidelijkheid en volledigheid bij de presentatie van onze onderzoeksresultaten te waarborgen, hebben we een afzonderlijke sectie opgenomen die gericht is op het samenvatten van de belangrijkste bevindingen van onze studie. Ga voor dit uitgebreide overzicht verder naar sectie 7. 7. BELANGRIJKSTE BEVINDINGEN Tabel 11 hieronder presenteert een uitgebreide analyse van modelprestaties en relevante variabelen in de context van taken voor lexicale beslissing en benoeming, gebaseerd op de bevindingen van Gagné et al. (2019). Elk onderdeel van de tabel gaat in op specifieke onderwerpen en onthult welke modellen het meest effectief zijn. De ANOVA- en de Kruskal–Wallis/Jonckheere–Terpstra-toetsen (secties 6.3 en 6.4) werden toegepast nadat nominale (ordinale of categorische) waarden waren toegekend aan de regressiecoëfficiënten uit de modellen van Gagné et al. (2019). Raadpleeg voor bijzonderheden over de toegepaste speciale toetsen de betreffende secties. TABEL 11. Scaled AIC binnen Engelse gesloten samenstellingen: uitgebreide analyse van modelprestaties bij taken voor lexicale beslissing en benoeming (Gagné et al. 2019) 294 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds Onderwerpen | Statistieken | Evaluatie | Sectie Controlevariabelen | ANOVA | Samenstellingsfrequentie ✓; Samenstellingslengte ~ | 6.3 Semantische transparantie | Kruskal–Wallis Jonckheere–Terpstra | Eerste constituent NOF/ns; Tweede constituent NOF/ns; Samenstelling NOF/ns | 6.4 PAR: parametrische gegevens | NPAR: niet-parametrische gegevens | ✓: betere modellen (lagere AIC) ~: inferieure modellen (hogere AIC) | NOF/ns: geen overfitting/niet-significante toets 8. DISCUSSIE Eerder onderzoek van Charitonidis (2022, 2024) heeft aangetoond dat Scaled AIC een betrouwbare goodness-of-fitmaat is die kan worden gebruikt bij modelselectie, wellicht in combinatie met andere maten zoals de Wald-toets (zie sectie 3). Met verwijzing naar de meervoudige regressiemodellen van Gagné et al. (2019) met SUBTLEX-US-frequency introduceerde de huidige analyse aanvullende eigenschappen van de Scaled AIC-maat. Hoewel er gegronde bedenkingen zijn geuit over het vergelijken van modellen die op verschillende steekproefomvang zijn gefit met behulp van informatiecriteria (zie sectie 2), suggereren de bevindingen van deze studie dat Scaled AIC in bepaalde contexten inderdaad een waardevol instrument kan zijn voor het beoordelen van model fit en het hiërarchiseren van regressiemodellen. Ons onderzoek heeft aangetoond dat Scaled AIC reageert op experimenteel ontwerp, bronnen van responstijden en specifieke taken. Het is echter essentieel te erkennen dat de toepasbaarheid van Scaled AIC contextafhankelijk kan zijn en dat de bruikbaarheid ervan van geval tot geval moet worden geëvalueerd. Alvorens over te gaan tot de belangrijkste bevindingen van dit artikel, is het belangrijk de onderzoeksvragen te behandelen die in sectie 4 zijn geformuleerd. 1. De verdelingen van Scaled AIC-waarden, samen met combinaties van verschillende bronnen van responstijden en verwerkingstaken, suggereren dat Scaled AIC de aanwezigheid of afwezigheid van duidelijk gedefinieerde onderliggende factoren in experimenteel ontwerp en statistische modellering effectief identificeert. In deze context vertoonden lexicale beslissingstaken uit de BLP en benoemingstaken uit de ELP zelfs onder gecontroleerde omstandigheden een sterkere voorspellende kracht voor Scaled AIC. 2. De frequentie van het compound was zonder uitzondering een negatieve voorspeller van Scaled AIC, waarbij deze steeds een groot effect aangaf. De lexicale beslissingstaak uit de ELP vertoonde consistent Straipsniai / Articles 295 CHARITON CHARITONIDIS significante positieve correlaties met de lengte van het compound, die hogere (= inferieure) Scaled AIC-waarden voorspelden. De lexicale beslissingstaak uit de BLP vertoonde consistent niet-significante correlaties met de lengte van het compound. Zowel de lexicale beslissingstaak als de lengte van het compound voorspelden inferieure modellen bij covariaataanpassing. 3. De positiviteit en het significantieniveau van transparantiecoëfficiënten in de modellen van Gagné et al. (2019) hadden geen invloed op de omvang van Scaled AIC. Deze bevinding impliceert dat de modellen van Gagné et al. (2019) met transparantievoorspellers geen overfittingbias introduceren. Door te verwijzen naar specifieke secties van de analyses kunnen de belangrijkste bevindingen van deze studie als volgt worden samengevat: In Sectie 6.1 richtte onze analyse zich op de vergelijking van Scaled AIC-waarden tussen verschillende modelcategorieën. Zelfs na pogingen om de transformaties ‘natuurlijke logaritme’ en ‘vierkantswortel’ toe te passen op de absolute waarden, voldeed de totale Scaled AIC-steekproef niet aan een normale verdeling. Evenzo vertoonden de modellen voor lexicale beslissing uit de ELP een niet-parametrische verdeling van hun Scaled AIC-waarden. Daarentegen volgden de gegevens met betrekking tot lexicale beslissing uit de BLP en benoeming uit de ELP een normaal verdelingspatroon. In Sectie 6.2 verschoof onze aandacht naar het onderzoeken van de relatie tussen Scaled AIC en (a) de bronnen van responstijden en (b) taakprestatie. Interessant genoeg overlapten de bereiken van Scaled AIC-waarden voor de modellen voor lexicale beslissing uit de ELP en BLP niet, wat hun onderscheidendheid aanduidt. De testresultaten brachten significante hoofdeffecten aan het licht van zowel de bron van de responstijd als de taakprestatie op Scaled AIC. Opmerkelijk was dat het voorspellend vermogen van Scaled AIC beter was voor modellen die verband hielden met de lexicale-beslissingstijden uit de BLP en de benoemingstaak. Deze bevindingen dragen in belangrijke mate bij aan de precisie en effectiviteit van de betreffende modellen. In Sectie 6.3 richtte onze verkenning zich op de relatie tussen Scaled AIC en de controlevariabelen ‘frequentie van het compound’ en ‘lengte van het compound’. De frequentie van het compound werd uit de analyse verwijderd omdat deze perfect collineair was met Scaled AIC. Daarentegen werd een daling van de Scaled AIC-waarden waargenomen wanneer de lengte van het compound een relevante factor binnen de modellen werd. Tegelijkertijd was de lengte van het compound het meest relevant voor de benoemingstaak. Wat covariaataanpassing betreft, voorspelden zowel de lexicale beslissingstaak als de lengte van het compound inferieure modellen. In Sectie 6.4 lag onze aandacht bij de relatie tussen Scaled AIC en semantische transparantie. De onderzoeksvraag was of de positiviteit en het significantieniveau van transparantiecoëfficiënten in de modellen van Gagné et al. (2019) invloed hadden op Scaled AIC. Het hoofddoel van onze methode was het detecteren van mogelijke overfittingseffecten. We veronderstelden dat modellen met inferieure Scaled AIC-waarden significante coëfficiënten konden bevatten die relevant waren 296 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds volgens uitsluitend de LADEC-dataset. Hoewel we een trend waarnamen van toenemende (= inferieure) Scaled AIC-waarden voor een cluster van significante negatieve coëfficiënten op compoundniveau — in overeenstemming met onze overfittinghypothese — liet de Jonckheere–Terpstra-test zien dat deze trend geen statistische significantie bereikte. Concluderend heeft de verkenning van verschillende parameters met Scaled AIC als afhankelijke variabele de diverse manieren belicht waarop modelcategorieën, bron van responstijd, verwerkingstaken, controlevariabelen en semantische transparantie de goodness-of-fit van modellen beïnvloeden. Door de genuanceerde relaties tussen deze elementen te erkennen, zijn onderzoekers beter toegerust om geïnformeerde beslissingen te nemen over modelselectie, aanpassingen en interpretatie. REFERENCES Akaike Hirotugu 1973: Information Theory and an Extension of the Maximum Likelihood Principle. – Second International Symposium on Information Theory, eds. B. F. Csaki, B. N. Petrov, Budapest: Academiai Kiado, 267–281. Aldrich John R. 1997: R. A. Fisher and the Making of Maximum Likelihood 1912–1922. – Statistical Science 12(3), 162–176. Baayen Harald R., Piepenbrock Richard, Gulikers Leon 1995: The CELEX Lexical Database (Data set, Release 2, CD-ROM), Linguistic Data Consortium, University of Pennsylvania. Available at: https://catalog.ldc.upenn.edu. Balota David A., Yap Melvin J., Cortese Michael J., Hutchison Keith I., Kessler Brett, Loftis Bjorn, Neely James H., Nelson Douglas L., Simpson Greg B., Treiman Rebecca 2007: The English Lexicon Project. – Behavior Research Methods 39, 445–459. Brysbaert Marc, New Boris 2009: Moving Beyond Kučera and Francis: A Critical Evaluation of Current Word Frequency Norms and the Introduction of a New and Improved Word Frequency Measure for American English. – Behavior Research Methods 41, 977–990. DOI: doi.org/10.3758/BRM.41.4.977. Burnham Kenneth P., Anderson David R. 2002: Model Selection and Multimodal Inference: A Practical Information-Theoretic Approach, 2ⁿᵈ edition, New York: Springer. DOI: dx.doi.org/10.1007/b97636. Charitonidis Chariton 2022: Context Concreteness for the Second Constituent Slows Down Compound-Word Processing. – Lexis 20. DOI: doi.org/10.4000/lexis.6769. Straipsniai / Articles 297 CHARITON CHARITONIDIS Charitonidis Chariton 2024: The Role of Hyponymy and Context Concreteness in Compound Word Processing. – Studia Neophilologica. DOI: doi.org/10.1080/00393274.2024.2336851. Chen Xiaocong, Dong Yanping, Yu Xiufen 2018: On the Predictive Validity of Various Corpus-Based Frequency Norms in L2 English Lexical Processing. – Behavior Research Methods 50, 1–25. DOI: doi.org/10.3758/s13428-017-1001-8. Field Andy 2009: Discovering statistics using SPSS, 3rd edition, London: Sage Publications. Fisher Ronald A. 1922: On the Mathematical Foundations of Theoretical Statistics. – Philosophical Transactions of the Royal Society of London, Series A 222, 309–368. Gagné Christina L., Spalding Thomas L., Schmidtke Daniel 2019: LADEC: The Large Database of English Compounds. – Behavior Research Methods 51, 2152–2179. DOI: doi.org/10.3758/s13428-019-01282-6. Gagné Christina L., Spalding Thomas L., Spicer Patricia, Wong Dixie, Rubio Beatriz, Perez-Cruz Karen 2020: Is Buttercup a Kind of Cup? Hyponymy and Semantic Transparency in Compound Words. – Journal of Memory and Language 113. DOI: doi.org/10.1016/j.jml.2020.104110. Hastie Trevor, Tibshirani Robert, Friedman Jerome 2009: The Elements of Statistical Learning: Data Mining, Inference, and Prediction. 2nd edition, New York: Springer. Keuleers Emmanuel, Lacey Paula, Rastle Kathleen, Brysbaert Marc 2012: The British Lexicon Project: Lexical Decision Data for 28,730 Monosyllabic and Disyllabic English Words. – Behavior Research Methods 44, 287–304. DOI: doi.org/10.3758/s13428-011-0118-4. Kullback Solomon 1959: Information Theory and Statistics. New York: Wiley. Navarro Daniel J., Myung Jay I. 2005: Model Evaluation. – Encyclopedia of Statistics in Behavioral Science, vol. 3, eds. B. S. Everitt, D. C. Howell, Chichester: Wiley, 1239–1242. Steiger James H. 1980: Tests for Comparing Elements of a Correlation Matrix. – Psychological Bulletin 87(2), 245–251. DOI: doi.org/10.1037/0033-2909.87.2.245. Wagenmakers Eric-Jan, Farrell Simon 2004: AIC Model Selection Using Akaike Weights. – Psychonomic Bulletin & Review 11(1), 192–196. 298 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds I N T E R N E T D I S C U S S I O N S Model comparison with AIC based on different sample size. Available at: https://stats.stackexchange.com/questions/94718/model-comparison-with-aic-based-on-different-sample-size [accessed 15.5.2024]. What is the acceptable range of skewness and kurtosis for normal distribution of data? Available at: https://www.researchgate.net/post/What_is_the_acceptable_range_of_skewness_and_kurtosis_for_normal_distribution_of_data [accessed 15.5.2024]. L A R G E L A N G U A G E M O D E L S GPT-3.5 (available at: https://chat.openai.com/) and Google Gemini (available at: https://gemini.google.com [accessed 11.10.2023]) were selectively used as auxiliary proofreading and editing tools. The responses from both AI tools were further proofread and edited by the author. Anglų kalbos uždarųjų junginių (sudurtinių žodžių) skalės AIC tyrimas S A N T R A U K A Šiame tyrime nagrinėjamos modifikuotos Akaikės informacijos kriterijaus, pavadinto skalės kriterijumi, t. y. AIC, kaip tinkamumo rodiklio, padalinto iš imties dydžio, varianto ypatybės. Tyrimo objektas – 66 daugialypės regresijos modeliai, susiję su uždarųjų (sudurtinių) anglų kalbos žodžių junginių, paimtų iš Gagné'es ir kitų (2019) Anglų kalbos sudurtinių žodžių (junginių) didžiosios duomenų bazės (angl. LADEC), apdorojimu. Toliau pateikiami išsamios analizės rezultatai: 1. Modelių kategorijų modeliai pasižymi nevienareikšmiais rezultatais. Britų kalbos žodyno projekto (angl. BLP) leksinių sprendimų modeliai ir Anglų kalbos žodyno projekto (angl. ELP) įvardijimo modeliai veikia geriau (tai rodo mažesnis AIC), palyginus su Anglų kalbos žodyno projekto (angl. ELP) leksinių sprendimų modeliais. Straipsniai / Articles 299 CHARITON CHARITONIDIS 2. Laiko šaltinio ir leksikos apdorojimo užduočių atsakymais atskleidžia reikšmingus pagrindinius skalės AIC rezultatus. Britų kalbos žodyno projekto leksinių sprendimų modeliai ir Anglų kalbos žodyno projekto įvardijimo modeliai veikia gerai, o pastarojo projekto leksinių sprendimų modeliai yra mažiau veiksmingi. 3. Įvertinus kontrolinius kintamuosius, tokius kaip junginių dažnumas ir junginių ilgis, matyti, kad modelių rezultatyvumas skiriasi. Junginių dažnumas yra stiprus veiksnys (parodo didesnis produktyvumas), o sudėtinio ilgio modelių prognozės blogesnės. 4. Kalbant apie pirmosios ir antrosios žodžių junginių sudedamųjų dalių, taip pat ir apie junginių semantinį skaidrumą, modeliai nerodo per didelio suderinamumo. Tai parodo, kad semantinis skaidrumas nesumažina modelių galėjimo apibendrinti naujus duomenis. Įteikta 2024 m. sausio 11 d. CHARITON CHARITONIDIS [email protected] 300 Acta Linguistica Lithuanica XC