scieee.
EN original LT DE FR IT ES PT PL HU RO UK TR RU NL CS SV EL AR
Machine-translated document

This is a machine-generated translation of the original document and may contain errors, omissions, or changes in meaning. Do not rely on this translation for quotations, citations, or authoritative references. Please consult and cite the original document.

Preparing document pages…

CHARITON CHARITONIDIS Незалежний дослідник ORCID id: orcid.org/0000-0003-0298-2629 Напрями досліджень: словотвір, багатослівні вирази, лексична семантика, розпізнавання слів, емоції. DOI: doi.org/10.35321/all90-11

ДОСЛІДЖЕННЯ МАСШТАБОВАНОГО AIC У МЕЖАХ АНГЛІЙСЬКИХ ЗАКРИТИХ СКЛАДНИХ СЛІВ

Дослідження масштабованого AIC у межах англійських закритих складних слів

АНОТАЦІЯ

Інформаційний критерій Акаіке (AIC) є усталеним показником відповідності моделі даним для вибору моделей під час аналізу емпіричних даних. Однак AIC чутливий до розміру вибірки. Попередні дослідження автора показали, що масштабований AIC, тобто AIC, поділений на розмір вибірки, є ефективним інструментом оцінювання відповідності моделі даним і впорядкування регресійних моделей за ієрархією. У цьому дослідженні подальше вивчаються властивості цієї змінної. Об’єктом дослідження є 66 моделей множинної регресії, що стосуються опрацювання англійських закритих (конкатенованих) складних слів, узятих із Великої бази даних англійських складних слів (LADEC) Gagné та ін. (2019). Зокрема, масштабований AIC зіставляється з Англійським лексиконним проєктом (ELP) і Британським лексиконним проєктом (BLP) як джерелами часу реакції, завданнями лексичного рішення та називання, довжиною складних слів і нормами прозорості. Як методи використовуються однофакторний ANOVA, аналіз головних ефектів і непараметричні тести. Результати свідчать, що масштабований AIC реагує на експериментальний дизайн, джерело часу реакції, а також завдання лексичного рішення та називання. Водночас результати цього дослідження надають емпіричну підтримку валідизації методів, застосованих Gagné та ін. (2019).

КЛЮЧОВІ СЛОВА: англійські складні слова, масштабований AIC, лексичне рішення, називання.

АНОТАЦІЯ

Інформаційний критерій Акаіке (англ. AIC) є усталеним показником відповідності моделей даним, що застосовується до аналізу емпіричних даних. Однак AIC чутливий до розміру вибірки. Попередні

Straipsniai / Articles

273

CHARITON CHARITONIDIS

автора показали, що масштабований AIC, поділений на розмір вибірки, є ефективним засобом оцінювання відповідності моделі даним і впорядкування регресійних моделей за ієрархією. У цьому дослідженні розглядаються подальші властивості цієї змінної. Об’єкт дослідження — 66 моделей множинної регресії, пов’язаних з опрацюванням англійських закритих (складених) складних слів, узятих із Великої бази даних англійських складних слів (англ. LADEC) Gagné та ін. (2019). Передусім AIC зіставляється з Англійським лексиконним проєктом (англ. ELP) і Британським лексиконним проєктом (англ. BLP) як джерелами часу реакції, завдань лексичного рішення та називання, довжини складних слів і норм прозорості. Застосовано такі методи: однофакторний ANOVA (англ. Analysis of variance), аналіз головних результатів і непараметричні тести. Висновки показують, що масштабований AIC реагує на експериментальний дизайн, джерело часу реакції, а також завдання лексичного рішення та називання. Водночас результати цього дослідження надають емпіричне підґрунтя для підтвердження методів, застосованих Gagné та ін. (2019).

КЛЮЧОВІ СЛОВА: англійські складні слова, масштабований AIC, лексичне рішення, називання.

1. ВЕЛИКА БАЗА ДАНИХ АНГЛІЙСЬКИХ СКЛАДНИХ СЛІВ (LADEC: GAGNÉ ET AL. 2019)¹

Велика база даних англійських складних слів (LADEC: Gagné та ін. 2019) є найбільшою з наявних баз даних складних слів. Вона містить понад 8000 безпробільних («закритих» або «конкатенованих») складних слів (=іменників), відібраних із різних джерел, зокрема з бази даних CELEX (Baayen та ін. 1995), Англійського лексиконного проєкту (ELP; Balota та ін. 2007), Британського лексиконного проєкту (BLP; Keuleers та ін. 2012), Британського національного корпусу (BNC) і Wordnet. Із повного набору записів LADEC 7,804 складних слів можна однозначно розкласти на два вільні морфемні компоненти.² Розглянуто надзвичайно різноманітні складні слова, наприклад складні слова іменник-іменник, напр. buttercup, shipyard, складні слова з другим компонентом, утвореним від дієслівної основи, напр. pacemaker, painkiller тощо (визначення класів складних слів див. Lieber 2004: 46). Перший неядерний компонент охоплює широкий спектр граматичних категорій. На рисунку 1 наведено коротку вибірку записів LADEC.

Моделі множинної регресії Gagné та ін. (2019) містять широкий спектр предикторних (= незалежних) змінних, таких як довжина складного слова, частота біграм

¹ Цей розділ адаптовано з Chariton Charitonidis (2022) із незначними змінами.

² LADEC містить множинні форми вже наведених складних слів як окремі записи.

274

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

на межі морфем, розмір словотвірної сім’ї, частоту слів, показники ймовірності та асоціації (на основі векторів), емоційні/тональні норми, обчислені за оцінками учасників, тощо. Логарифмовані часи реакції для складних слів з ELP (лексичне рішення, називання) і BLP (лексичне рішення) використовуються як залежні змінні. Переважно довжина складного слова (кількість символів) і логарифмована частота складного слова (= слова) з корпусу SUBTLEX-US (Brysbaert, New 2009)³ та BNC (BLP) використовуються як контрольні змінні. У моделях Gagné та ін. (2019) зазначені вище предикторні змінні мали значущі ефекти на час лексичного рішення та називання.

РИСУНОК 1. Записи LADEC: вибірка

Основна увага в дослідженні Gagné та ін. (2019) була приділена різним показникам семантичної прозорості. Gagné та ін. (2019) просили учасників оцінити складні слова з огляду на те, наскільки передбачуваним є значення складного слова за його частинами (оцінки передбачуваності значення, на основі складного слова) і наскільки значення кожного з компонентів зберігається у складному слові (оцінки збереження значення, на основі компонента). Автори виявили, що розподіл прозорості другого компонента був значно гостровершиннішим і вищим, ніж розподіл прозорості першого компонента (MC1: 64.80 [SD: 19.59] проти MC2: 71.00 [SD: 16.46]. N = 8115). Однак оцінка для

³ Корпус SUBTLEX–US є корпусом із 51 мільйона токенів, сформованим на основі субтитрів до американських фільмів і телевізійних програм. Кілька нещодавніх досліджень надали докази того, що норми частотності, отримані із субтитрів до фільмів і телевізійних програм, зазвичай ефективніші за норми, виведені з друкованих текстів, коли йдеться про пояснення відмінностей у часі лексичного опрацювання і, у деяких випадках, точності серед носіїв різних мов (див. Chen та ін. 2018: 2 і наведені там посилання).

Straipsniai / Articles

275

CHARITON CHARITONIDIS

перший компонент сильніше корелював з оцінкою всього складного слова, ніж оцінка другого компонента (c1~cmp: r = 0.75, p <.001 проти c2~cmp: r = 0.66, p <.001. N = 429).⁴ Найприкметніше, оцінка збереження значення першого компонента та оцінка передбачуваності значення складного слова передбачали всі три типи часу реакції, тобто час лексичного рішення ELP, час лексичного рішення BLP і час називання ELP.

Підсумовуючи, гостровершинніший і вищий розподіл прозорості другого компонента та тісніший зв’язок прозорості першого компонента з передбачуваністю значення складного слова, очевидно, безпосередньо відображаються в операціях над головним компонентом англійських складних слів. Другий компонент, тобто голова, є одиницею, прозорість якої категоріально й семантично посилюється (щодо семантичного аспекту див. відношення логічного випливання та гіпонімії). Перший компонент, тобто модифікатор, є найважливішим чинником у встановленні референції складного слова. Унаслідок цього його прозорість найсильніше коваріює з прозорістю складного слова.⁵

2. ІНФОРМАЦІЙНИЙ КРИТЕРІЙ АКАІКЕ (AIC)

У 1973 році Hirotugu Akaike розробив метод оцінювання відносного сподівання відстані Кульбака—Лейблера (Kullback 1959), використовуючи максимізовану логарифмічну правдоподібність Fisher (Fisher 1922; див. також Aldrich 1997). Цей показник, який зазвичай називають інформаційним критерієм Акаіке (AIC; Akaike 1973), запровадив нову концепцію вибору моделей під час аналізу емпіричних даних, ознаменувавши значний зсув парадигми (Burnham, Anderson 2002).

Зазвичай AIC обчислюють так: −2lnL + 2k, де «lnL» означає максимізовану/повну логарифмічну правдоподібність моделі, а «k» — кількість параметрів, включно з константою. Менший набір предикторів зазвичай пов’язаний із ефективнішими моделями (моделями з меншими інформаційними втратами). Що нижче (= негативніше) значення AIC, то краще відповідність моделі даним. У цьому контексті AIC як показник відповідності моделі даним штрафує використання великої кількості предикторів, що потенційно призводить до вищих значень AIC (див. частину «+2k» рівняння AIC).

⁴ z-тест Steiger (1980) показав, що ця різниця була значущою: z = 27.71, p <.0001 (Gagné та ін. 2019).

⁵ Посилаючись на попередні дослідження, Gagné та ін. (2019) зазначають, що «модифікатор (перший компонент в англійській мові) зазвичай відіграє більшу роль у виборі легкості встановлення зв’язку під час опрацювання складних слів і іменникових словосполучень».

276

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

AIC чутливий до розміру вибірки. AICc, скоригована версія AIC, враховує розмір вибірки за формулою 2k (k + 1)/ (n − k − 1). Однак він спеціально призначений для малих обсягів вибірки, і його не рекомендують для моделей, заснованих на великих вибірках, як-от у Gagné та ін. (2019).⁶ Слід зазначити, що такі дослідники, як Kenneth P. Burnham & David R. Anderson (2002), не пропонують остаточного розв’язання для порівняння значень AIC моделей, підігнаних як на різних, так і на великих вибірках.⁷

Зокрема, Burnham & Anderson (2002: 80–85, 334–335) вичерпно обговорюють наслідки нерівних обсягів вибірок для порівняння моделей. Вони стверджують, що застосування інформаційних критеріїв для порівняння моделей із різними обсягами вибірок може призвести до оманливих результатів. Так само, як зазначив Svetunkov в онлайн-обговоренні 2016 року (див. посилання після бібліографії), усі інформаційні критерії ґрунтуються на функції правдоподібності, яка, своєю чергою, залежить від розміру вибірки. Зокрема, зі збільшенням розміру вибірки правдоподібність зменшується. Отже, у таких випадках інформаційні критерії також зростатимуть.⁸

3. ПОПЕРЕДНІ ДОСЛІДЖЕННЯ

У Charitonidis (2022) значення AIC для 44 моделей множинної регресії з різними комбінаціями емоційних змінних (валентність, активація та конкретність для (a) слів і (b) контекстів слів) було поділено на розмір вибірки (N), щоб отримати значення масштабованого AIC (AIC/N). Надалі ці значення використовували для оцінювання

⁶ Для додаткової інформації про AICc читачеві рекомендовано звернутися до Burnham & Anderson (2002: 374–380).

⁷ Одне з рішень, запропонованих Burnham & Anderson (2002), стосується перетворення значень AIC на «ваги Акаіке», які визначаються як «відносна правдоподібність моделі за наявності даних» (Burnham, Anderson 2002: xiii; див. також Wagenmakers, Farrell 2004).

⁸ Доступно за адресою: https://stats.stackexchange.com/questions/94718/model-comparison-with-aic-based-on-different-sample-size [дата доступу: 16.06.2023]. Твердження Svetunkov можна зрозуміти, підставивши різні значення компонента «lnL» у рівняння AIC, водночас залишаючи компонент «2k» сталим. Зменшення значення lnL призведе до вищого, тобто гіршого, значення AIC.

⁹ У літературі масштабований AIC також називають «середнім AIC». За словами Svetunkov (особисте спілкування), практика ділення інформаційного критерію Акаіке на розмір вибірки не є новою. Наприклад, Hastie та ін. (2009: 230–231) визначають AIC неканонічним способом, використовуючи N як знаменник у формулі. Хоча це відхилення від традиційної формули AIC не позбавлене критики, такий підхід залишається поширеним, про що свідчить його включення до статистичного програмного пакета Stata. Наприклад, Stata подає «AIC, поділений на N» у вихідних даних моделі, як показують різні приклади, доступні онлайн (висловлюю подяку I. Svetunkov за надання цієї інформації).

Straipsniai / Articles

277

CHARITON CHARITONIDIS

і порівняння відповідності моделей даним. Введення ключових предикторів у глобальні, тобто загальні, моделі показало, що час лексичного рішення BLP вимагав кращої відповідності моделі даним, ніж час лексичного рішення ELP. Відповідність моделей називання ELP даним перебувала в діапазоні значень, спостережуваних для моделей лексичного рішення ELP і BLP. Найпомітніше, конкретність контексту для другого компонента виявилася значущим предиктором у всіх моделях із частотністю SUBTLEX-US, як для лексичного рішення, так і для називання.

У Charitonidis (2024) усі значущі коефіцієнти з глобальних моделей із частотністю SUBTLEX-US було зіставлено зі змінною гіпонімії (Gagné та ін. 2020). Було виявлено, що моделі, які містять і гіпонімію, і конкретність контексту для другого компонента, завжди були пов’язані з найнижчим (=найкращим) значенням масштабованого AIC порівняно з вкладеними, тобто скороченими, моделями, у яких одну з цих двох змінних вилучено. Застосовані надалі тести Wald показали, що вкладені моделі завжди були пов’язані зі значущим зменшенням (=погіршенням) коефіцієнта детермінації (R2). У таблицях 1 і 2 відповідно наведено значення масштабованого AIC і результати відповідних тестів Wald.

ТАБЛИЦЯ 1.

Значення масштабованого AIC для вкладених моделей, у яких із повних моделей («Модель 1») для прогнозування часу лексичного рішення Англійського лексиконного проєкту (ELP), часу лексичного рішення Британського лексиконного проєкту (BLP) і часу називання ELP вилучено гіпонімію («Модель 2») або конкретність контексту для другого компонента («Модель 3»)

Модель | Масштабований AIC | AIC | N ELP LD 1 | −3.36281ᵃ | −3557.85 | 1058 2 | −3.30375 | −4169.334 | 1262 3 | −3.34845 | −3700.038 | 1105 BLP LD 1 | −3.79552ᵃ | −2903.574 | 765 2 | −3.76618 | −3920.592 | 1041 3 | −3.76718 | −2987.37 | 793 ELP називання 1 | −3.58686ᵇ | −7396.108 | 2062 2 | −3.54304 | −8418.27 | 2376 3 | −3.58379 | −7389.784 | 2062

278

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

a. Предиктори: (Константа), оцінка гіпонімії, довжина складного слова, частотність SUBTLEX–US, валентність репрезентації (cmp), конкретність контексту (c2)

b. Предиктори: (Константа), оцінка гіпонімії, довжина складного слова, частотність SUBTLEX–US, валентність контексту (cmp), активація контексту (c1), активація контексту (c2), конкретність контексту (c2)

ТАБЛИЦЯ 2.

Тести Wald для вкладених моделей, у яких із повних моделей («Модель 1») для прогнозування часу лексичного рішення Англійського лексиконного проєкту (ELP), часу лексичного рішення Британського лексиконного проєкту (BLP) і часу називання ELP вилучено гіпонімію («Модель 2») або конкретність контексту для другого компонента («Модель 3»)

Модель | R2 square | F change | df1 | df2 | p ELP LD 1 |.184a | 47.506 | 5 | 1052 |.000 2 | −.004 | 4.562 | 1 | 1052 |.033 3 | −.010 | 13.175 | 1 | 1052 |.000 BLP LD 1 |.211a | 40.479 | 5 | 759 |.000 2 | −.013 | 12.091 | 1 | 759 |.001 3 | −.015 | 14.007 | 1 | 759 |.000 ELP називання 1 |.288b | 118.711 | 7 | 2054 |.000 2 | −.003 | 8.286 | 1 | 2054 |.004 3 | −.003 | 8.309 | 1 | 2054 |.004

a. Предиктори: (Константа), оцінка гіпонімії, довжина складного слова, частотність SUBTLEX–US, валентність репрезентації (cmp), конкретність контексту (c2)

b. Предиктори: (Константа), оцінка гіпонімії, довжина складного слова, частотність SUBTLEX–US, валентність контексту (cmp), активація контексту (c1), активація контексту (c2), конкретність контексту (c2)

Отже, два різні показники розміру ефекту, а саме масштабований AIC і R2, однаково впорядкували ті самі регресійні моделі за ієрархією, продемонструвавши однакову перевагу найкращої моделі. Таким чином, є вагомі докази того, що показник масштабованого AIC є якісним інструментом оцінювання відповідності моделі даним.

Straipsniai / Articles

279

CHARITON CHARITONIDIS

4. ЦЕ ДОСЛІДЖЕННЯ

Це дослідження розвиває попередні дослідження автора, представлені в розділі 3. Об’єктом дослідження є 66 моделей лексичного рішення та називання англійських закритих (конкатенованих) складних слів, побудованих Gagné та ін. (2019). Усі моделі містять частотність SUBTLEX-US як контрольну змінну. Наші цілі є подвійними й реалізуються паралельно. По-перше, ми оцінюємо характеристики моделей Gagné та ін. (там само). По-друге, ми досліджуємо основні властивості показника масштабованого AIC.

Дослідницькі питання такі: 1. Чи чутливий масштабований AIC до дизайну моделі в Gagné та ін. (2019)? Які групи моделей мають перевагу? 2. Який вплив контрольних змінних «частотність складного слова» та «довжина складного слова» на масштабований AIC? 3. Як морфологічна прозорість пов’язана з масштабованим AIC?

Наше дослідження структуровано так: у розділі 5 наведено огляд наших методів. У розділі 6.1 подано описову статистику масштабованого AIC для моделей, що розглядаються. Особливу увагу приділено параметричним і непараметричним характеристикам категорій моделей. У розділі 6.2 досліджено зв’язок між джерелом часу реакції та завданнями лексичного опрацювання. У розділі 6.3 масштабований AIC зіставлено з контрольними змінними «частотність складного слова» та «довжина складного слова». У розділі 6.4 рівні значущості коефіцієнтів прозорості з моделей Gagné та ін. (2019) зіставлено зі значеннями масштабованого AIC. Основні результати узагальнено в розділі 7, після чого в розділі 8 обговорено результати.

5. МЕТОДИ

Нашим загальним методом був порівняльний аналіз основних параметрів і характеристик моделей Gagné та ін. (2019), у якому масштабований AIC використовувався як залежна змінна. Незалежні змінні охоплювали характеристики вибірки (наприклад, джерело часу реакції та завдання лексичного опрацювання), дизайн дослідження (наприклад, контрольні змінні) і рівень значущості коефіцієнтів прозорості, серед інших чинників.

Застосовані конкретні статистичні методи були такими: (a) описова статистика щодо середніх значень і медіан разом із застосуванням тесту Shapiro–Wilk для оцінювання центральної тенденції, варіативності та розподілу масштабованого AIC у різних категоріях і групах моделей (розділи 6.1 і 6.2), (b) аналізи головних ефектів, проведені для джерела часу реакції (ELP/BLP) і завдань лексичного опрацювання (лексичне рішення/називання) (розділ

280

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

6.2), (c) окремі ANOVA, проведені для джерела часу реакції та завдань лексичного опрацювання з урахуванням довжини складного слова як коваріати (розділ 6.3), і (d) використання тестів Kruskal–Wallis та Jonckheere–Terpstra для дослідження відмінностей між рангами порядково перекодованих коефіцієнтів семантичної прозорості (розділ 6.4). Докладнішу інформацію про методи читач знайде в аналізах у розділах 6.1–6.4.

6. АНАЛІЗИ

6.1. Масштабований AIC і категорії моделей

Значення AIC для 66 моделей множинної регресії Gagné та ін. (2019), у яких частотність SUBTLEX–US використовувалася як контрольна змінна, було поділено на розмір вибірки кожної моделі, щоб отримати набір із 66 значень масштабованого AIC.

У таблиці 3 нижче наведено описову статистику масштабованого AIC, а на рисунку 2 показано відповідний діаграмний графік для впорядкованого набору значень.10 У вибірці не було викидів. Значення асиметрії (Sk) і ексцесу (Ku) були прийнятними.11

Середнє значення масштабованого AIC становило −3.50030. Стандартне відхилення становило 0.19052, тобто спостереження були відносно щільно згруповані навколо середнього значення. Мінімальне й максимальне значення становили відповідно −3.85502 і −3.15754. Медіанне значення становило −3.55732, тобто було дещо нижчим за середнє значення.12 Середні 50% даних перебували в діапазоні від −3.66575 (перший квартиль, Q1) до −3.30959 (третій квартиль, Q3). Відповідно, міжквартильний діапазон (IQR) становив 0.35616.

10 Нижня, або перша квартильна, лінія прямокутника (Q1) позначає межу, нижче якої розташовані нижні 25% даних. Так само верхня, або третя квартильна, лінія прямокутника (Q3) позначає межу, вище якої розташовані верхні 25% даних. Заштрихована область показує межі середніх 50% даних, або міжквартильного діапазону (IQR), який можна обчислити, віднявши перший квартиль від третього квартиля (Q3−Q1). Горизонтальна лінія всередині прямокутника показує медіану, або середній квартиль (Q2), тобто значення, що припадає на середину набору даних.

11 У середовищі SPSS значення асиметрії між −1 і +1 та значення ексцесу між −2 і +2 зазвичай вважаються прийнятними для оцінювання нормального розподілу. Однак варто зазначити, що самі лише асиметрія й ексцес не дають остаточного доказу нормальності (див. також обговорення https://www.researchgate.net/post/What_is_the_acceptable_range_of_skewness_and_kurtosis_for_normal_distribution_of_data).

12 Відповідно до цієї закономірності в даних спостерігалася невелика позитивна асиметрія (0.494).

Straipsniai / Articles

281

CHARITON CHARITONIDIS

ТАБЛИЦЯ 3. Описова статистика масштабованого AIC (повний набір)

Середнє SD Мін. Макс. −3.50030 0.19052 −3.85502 −3.15754 Медіана IQR Q1 Q3 −3.55732 0.35616 −3.66575 −3.30959

N=66. Sk=0.494, Ku=−1.101

РИСУНОК 2. Розподіл масштабованого AIC (повний набір): діаграмний графік

Очікувалося, що повний набір значень масштабованого AIC не матиме нормального розподілу, оскільки охоплював різні завдання (лексичне рішення, називання) і був отриманий із різних джерел часу реакції (ELP, BLP). Тест Shapiro–Wilk і тест Kolmogorov–Smirnov підтвердили наші припущення.13 Зокрема, статистика тесту Shapiro–Wilk становила W (66) = 0.90, p <.001, а статистика тесту Kolmogorov–Smirnov — D (66) = 0.17, p <.001. Слід зазначити, що той самий повний набір не мав нормального розподілу навіть після застосування натурального логарифма та перетворень квадратного кореня до абсолютних значень.

У таблиці 4 нижче наведено описову статистику масштабованого AIC щодо основних категорій моделей у Gagné та ін. (2019), тобто лексичного рішення ELP, лексичного рішення BLP і називання ELP (кожна група містить 22 моделі). На рисунку 3 показано відповідні діаграмні графіки. Як видно, середні значення та медіани

13 У тесті Kolmogorov–Smirnov застосовано поправку Lilliefors на значущість.

282

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

для лексичного рішення BLP і називання ELP стосувалися подібних значень масштабованого AIC. Лексичне рішення ELP стосувалося вищих (=гірших) значень, які, крім того, були неперетинними зі значеннями лексичного рішення BLP.14 Підсумовуючи, лексичне рішення BLP і називання ELP завжди вимагали кращих моделей, ніж лексичне рішення ELP.

ТАБЛИЦЯ 4. Описова статистика масштабованого AIC за основними категоріями моделей

Очікувалося, що непараметричний профіль повного набору значень масштабованого AIC із меншою ймовірністю спостерігатиметься в основних категоріях моделей, тобто в основних комбінаціях часу реакції та завдань. Як стане очевидно, це очікування підтвердилося.

Тест Shapiro-Wilk показав, що дані лексичного рішення ELP істотно відхилялися від нормальності. Зокрема, ми розрахували статистику тесту W (22) = 0.90, p <.05.15

Дані лексичного рішення BLP мали нормальний розподіл. Відповідні статистичні показники становили W (22) = 0.92, p >.05 (Shapiro-Wilk).

14 t-тест узагальнених даних лексичного рішення ELP і лексичного рішення BLP (таблиця 4) засвідчив високозначущу різницю між середніми значеннями вибірок: t = 18.296, p <.0001.

15 Слід зазначити, що набір із шести моделей ELP лексичного рішення стосувався значень Scaled AIC, близьких до максимального значення −3.15754, що вказує на найгірше припасування в усьому наборі даних. Ці моделі зумовили виразний пік у бік верхнього краю розподілу (від −3.17304 до −3.15754), унаслідок чого сформувався майже бімодальний характер розподілу. Це спостереження підтверджується відносно високим від’ємним значенням ексцесу −1.444.

Straipsniai / Articles

283

CHARITON CHARITONIDIS

РИСУНОК 3. Відображення Scaled AIC у вигляді коробкових діаграм за основними категоріями моделей

Так само дані ELP щодо називання мали нормальний розподіл. Відповідні статистичні показники становили W (22) = 0.93, p >.05 (Shapiro–Wilk).

Підсумовуючи, як повний набір моделей, так і моделі ELP лексичного рішення були пов’язані з непараметричним розподілом Scaled AIC. Натомість дані BLP лексичного рішення та ELP називання мали нормальний розподіл. Тепер спробуймо виявити вплив окремих чинників на Scaled AIC.

6.2. Scaled AIC проти джерела часу реакції та завдань

У таблиці 5 нижче наведено описову статистику значень Scaled AIC для груп, класифікованих за основними чинниками «часи реакції» та «завдання», тобто (a) часи реакції ELP, (b) часи реакції BLP, (c) завдання називання та (d) завдання лексичного рішення. Часи реакції ELP і завдання лексичного рішення

284

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

є узагальнювальними групами, що стосуються відповідно «лексичного рішення й називання» та «ELP і BLP». Групи «BLP» і «Naming» ідентичні категоріям моделей «BLP lexical decision» та «ELP naming» відповідно, які вже були представлені в таблиці 4 (розділ 6.1). На рисунку 4 наведено відповідні коробкові діаграми.

Як видно з таблиці 5, і «BLP», і «Naming» характеризувалися (a) нижчими (=кращими) середніми та медіанними значеннями Scaled AIC і (b) меншими значеннями стандартного відхилення (SD) та міжквартильного розмаху (IQR), на відміну від узагальнювальних груп «ELP response times» і «lexical decision».16 Ці самі узагальнювальні групи мають відносно високі значення ексцесу, а саме −1.403 і −1.616 відповідно (на гістограмах для цих груп — тут не наведені — виникли два чіткі піки, подібні до тих, що характерні для бімодального розподілу значень). Ці закономірності свідчать, що показник Scaled AIC був унікально пов’язаний із чітко визначеними експериментальними категоріями BLP lexical decision (див. групу «BLP») та ELP naming (див. групу «Naming»).

ТАБЛИЦЯ 5.

Описова статистика Scaled AIC для груп, класифікованих за «часами реакції» та «завданнями»

Часи реакції Завдання ELP BLP Називання Лексичне рішення Середнє −3.43917 −3.62255 −3.62495 −3.43797 SD 0.20286 0.06778 0.08710 0.19808 Мін. −3.85502 −3.75547 −3.85502 −3.75547 Макс. −3.15754 −3.52945 −3.50150 −3.15754 Медіана −3.42626 −3.62174 −3.61886 −3.44024 IQR 0.35152 0.13704 0.13758 0.36196 Q1 −3.62127 −3.68840 −3.69419 −3.63171 Q3 −3.26975 −3.55136 −3.55662 −3.26975 Sk −0.126 −0.097 −0.559 −0.006 Ku −1.403 −1.244 0.725 −1.616 44 22 22 44

16 Нижчі середні та медіани разом із меншими значеннями стандартного відхилення та міжквартильного розмаху вказують на більшу надійність і меншу схильність до впливу викидів або екстремальних значень.

Straipsniai / Articles

285

CHARITON CHARITONIDIS

РИСУНОК 4. Відображення Scaled AIC у вигляді коробкових діаграм для груп, класифікованих за «часами реакції» та «завданнями»

Як і для всього набору значень Scaled AIC, розглянутого в розділі 6.1, очікувалося, що для узагальнювальних груп «ELP» і «lexical decision», не обмежених конкретними експериментами, буде очевидним непараметричний профіль. Тести на нормальність підтвердили наші очікування.

За результатами тесту Shapiro–Wilk дані Scaled AIC для групи ELP істотно відхилялися від нормальності. Розраховане значення статистики тесту становило W (44) = 0.91, p <.01. Так само дані Scaled AIC для групи лексичного рішення істотно відхилялися від нормальності. Розраховане значення статистики тесту становило W (44) = 0.89, p <.001.

Тепер перейдемо до аналізу основних ефектів. Головною метою було з’ясувати, чи продовжують групи BLP lexical decision та ELP naming прогнозувати кращі моделі після контролю ефектів кожної з груп.

У наступних статистичних тестах групам, класифікованим за основними чинниками «часи реакції» та «завдання», було присвоєно номінальні значення. Середнє значення Scaled AIC для групи BLP, тобто −3.623, було використано як референтну клітинку або вільний член.

Результати показали, що і часи реакції, і завдання мали основний ефект на Scaled AIC, але взаємодії не було. Зокрема, спостерігався значущий основний ефект часів реакції, F (1, 63) = 271.87, p <.001. У термінах регресії коефіцієнт для ELP прогнозував вище, тобто гірше, значення Scaled AIC, b = 0.37, SE = 0.02, t = 16.49, p <.001. Крім того, спостерігався значущий основний ефект завдань, F (1, 63) = 275.42, p <.001. У термінах регресії коефіцієнт для називання прогнозував нижче, тобто краще, значення Scaled AIC, b = −0.37, SE = 0.02, t = −16.60, p <.001.

На рисунку 5 подано огляд основних ефектів за допомогою точково-лінійного графіка. Вільний член або референтна клітинка стосується водночас найнижчого значення ELP naming і найвищого значення BLP lexical decision, тобто −3.623. Лінії розташовані одна над одною

286

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

вертикально, оскільки діапазони значень Scaled AIC для ELP lexical decision і BLP lexical decision не перетиналися (див. таблицю 4). Крім того, лінії паралельні, оскільки відсутність групи «BLP naming» у межах завдань усунула будь-які ефекти взаємодії.

Підсумовуючи, часи реакції BLP і завдання називання стабільно прогнозували кращі значення Scaled AIC навіть після взаємного контролю відповідних чинників. Ці результати підвищують точність та ефективність відповідних моделей.

РИСУНОК 5. Графік основних ефектів для Scaled AIC

Слід зазначити, що аналіз основних ефектів, представлений у цьому розділі, більше стосується джерела часів реакції, ніж виконання завдань, оскільки, як уже згадувалося, комбінація «BLP naming» була недоступною. Цей факт може обмежувати узагальнюваність результатів за межами конкретних вибірок.

6.3. Scaled AIC проти контрольних змінних

У цьому розділі увагу буде зосереджено на контрольних змінних довжині складного слова (у символах) і частотності SUBTLEX-US, тобто логарифмічній частотності складних слів, отриманій із корпусу SUBTLEX-US (Brysbaert, New 2009). Обидві змінні широко використовувалися в регресійних моделях Gagné et al. (2019).

Straipsniai / Articles

287

CHARITON CHARITONIDIS

Щоб виявити вплив довжини складного слова та частотності складного слова на Scaled AIC, відповідні регресійні коефіцієнти було перекодовано в порядкові значення відповідно до їхньої додатності та рівня значущості; див. таблицю 6. Рівні значущості було відображено на порядкові шкали, оскільки вони представляли традиційні точки відсікання, засновані на точних значеннях значущості.

ТАБЛИЦЯ 6. Таблиця порядкового перекодування регресійних коефіцієнтів

Значущість Додатність Порядкові значення Опис p <.001 від’ємний −3 великий від’ємний ефект p <.01 від’ємний −2 помірний від’ємний ефект p <.05 від’ємний −1 малий від’ємний ефект p >.05 від’ємний/додатний 0 незначущий ефект p <.05 додатний 1 малий додатний ефект p <.01 додатний 2 помірний додатний ефект p <.001 додатний 3 великий додатний ефект

У моделях Gagné et al. (2019) частотність SUBTLEX-US завжди була пов’язана з від’ємними (=такими, що скорочують латентність) коефіцієнтами з великим ефектом, p <.001. Відповідно, усі коефіцієнти було перекодовано як −3 — значення, яке було повністю колінеарним із залежною змінною, Scaled AIC. З цієї причини частотність SUBTLEX-US було вилучено з поточного аналізу.

Що стосується довжини складного слова, усі значущі регресійні коефіцієнти з моделей Gagné et al. (2019) мали великий додатний (=такий, що спричиняє латентність) ефект, p <.001. На відміну від змінної SUBTLEX-US, було виявлено кілька незначущих коефіцієнтів. З огляду на ці закономірності було створено категоріальну змінну зі значеннями «1» для додатного ефекту (=інтерференція довжини складного слова) і «0» для відсутності ефекту (=відсутність інтерференції довжини складного слова). Отримана вибірка містила 39 значень Scaled AIC. Тест кореляції Пірсона між довжиною складного слова та Scaled AIC дав високозначущий коефіцієнт кореляції 0.51, p =.001, що вказує на кореляцію від помірної до сильної між двома змінними.

Довжину складного слова було включено як єдину незалежну змінну до лінійної регресійної моделі. Було встановлено, що прогнозоване середнє Scaled AIC для відсутності інтерференції довжини складного слова становило 3.611 (=вільний член). Інтерференція довжини складного слова призвела до вищого (=гіршого) значення −3.407 (b = 0.204, p =.001). На рисунку 6 нижче проілюстровано ці закономірності. Коротко кажучи, Scaled AIC погіршується, коли довжина складного слова стає релевантною в межах моделей.

288

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

РИСУНОК 6. Довжина складного слова та Scaled AIC

Ми провели окремі ANOVA для джерела часу реакції (ELP/BLP) і виконання завдання (лексичне рішення/називання), беручи до уваги довжину складного слова як коваріату. Головною метою було виявити відмінності між середніми значеннями, які раніше було скориговано з урахуванням контрольних ефектів довжини складного слова.

(a) ANOVA для джерела часу реакції. BLP було присвоєно значення «0», а ELP — значення «1». Тест кореляції Пірсона виявив сильну колінеарність між джерелом часу реакції та довжиною складного слова, r = 1 (N = 39). Наш висновок підтверджують такі дані: по-перше, група ELP стабільно демонструвала значущі додатні кореляції з довжиною складного слова, що вказує на великий ефект. По-друге, група BLP стабільно демонструвала незначущі кореляції з довжиною складного слова. Отже, прогнозоване середнє Scaled AIC для джерела часу реакції було однаковим за наявності та відсутності довжини складного слова в аналізі (M = 3.407 в обох випадках). Підсумовуючи, довжина складного слова не мала значущого ефекту на Scaled AIC, коли до аналізу було включено джерело часу реакції.

(b) ANOVA для виконання завдання. Називанню було присвоєно значення «0», а лексичному рішенню — значення «1». Тест кореляції Пірсона виявив від’ємну кореляцію між завданням і довжиною складного слова, що вказує на помірний ефект, r = −.5, p =.001 (N = 39). Цей результат свідчить, що довжина складного слова є релевантнішою для називання, ніж для лексичного рішення.

17 Слід зазначити, що 11 із 13 коефіцієнтів BLP були від’ємними.

Straipsniai / Articles

289

CHARITON CHARITONIDIS

Якщо розглядати завдання як основну змінну, довжина складного слова була значущим предиктором Scaled AIC, F (1, 145.030), p =.000. Так само, якщо розглядати довжину складного слова як основну змінну, завдання було значущим предиктором Scaled AIC, F (1, 125.30), p =.000. Прогнозоване середнє Scaled AIC лише для завдання істотно відрізнялося від прогнозованого середнього Scaled AIC, коли було враховано довжину складного слова (відповідно 3.584 проти 3.203). Аналогічно, прогнозоване середнє Scaled AIC лише для довжини складного слова (3.584) істотно відрізнялося від прогнозованого середнього Scaled AIC, коли було враховано завдання (−3.23). Підсумовуючи, з погляду коригування за коваріатою і завдання лексичного рішення, і довжина складного слова прогнозували гірші моделі.

6.4. Scaled AIC проти норм прозорості

У цьому розділі досліджується вплив регресійних коефіцієнтів семантичної прозорості в моделях Gagné et al. (2019) на Scaled AIC. Ці регресійні коефіцієнти було закодовано за трьома порядковими шкалами, кожна з яких відповідала одному з трьох морфологічних рівнів, тобто складному слову, першому конституенту та другому конституенту. Таблицю порядкового перекодування можна знайти в таблиці 6.

У таблиці 7 нижче наведено медіани та діапазони порядково трансформованих коефіцієнтів прозорості для всіх трьох морфологічних рівнів. Медіани надають корисну інформацію про центральну тенденцію та розсіювання порядкових значень і можуть допомогти в аналізах, що ґрунтуються на порядкових змінних.

ТАБЛИЦЯ 7. Порядково трансформовані коефіцієнти прозорості: медіани та діапазони

Медіана Мінімум Максимум Складне слово −3 −3 −1 Перший конституент 2 −3 3 Другий конституент 0 −2 3

N = 18

Як видно, медіана для складного слова становила «−3», медіана для першого конституента — «2», а медіана для другого конституента — «0». Ці результати свідчать, що в моделях Gagné et al. (2019) із частотністю SUBTLEX–US прозорість складного слова була пов’язана з великим від’ємним ефектом (коротшими часами реакції), прозорість першого конституента — з помірним додатним ефектом (довшими часами реакції), а прозорість другого конституента не мала значущого ефекту або

290

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

відігравала невизначену роль. Вищі оцінки прозорості другого конституента, наведені Gagné et al. (ibid.), свідчать про властиву йому упередженість, що надає йому перевагу, унаслідок чого загальна прозорість складного слова залежить від прозорості першого конституента. У цьому контексті додатна, така, що спричиняє латентність, медіана для першого конституента вказує на його опосередковувальну, можливо, таку, що встановлює референт, роль у цьому зв’язку (див. також розділ 1). Ще належить продемонструвати, які саме семантичні функції достатньо репрезентують, у термінах обробки, властиву упередженість другого конституента.18

Дослідницьке питання, яке тепер розглядатиметься, полягає в тому, чи впливають додатність і рівень значущості коефіцієнтів прозорості на Scaled AIC. Наш метод передусім спрямований на виявлення ефектів перенавчання. Як зазначають Daniel J. Navarro & Jay I. Myung (2005), «складна модель із багатьма параметрами та високо нелінійною формою часто може краще припасувати дані, ніж проста модель із небагатьма параметрами, навіть якщо саме остання породила ці дані» (Navarro, Myung 2005: 1240). Відповідно, велика кількість параметрів може фіксувати шум або унікальні характеристики доступних даних, але може перешкоджати здатності моделі узагальнюватися на нові дані. AIC пом’якшує проблему перенавчання, запроваджуючи штраф за включення численних параметрів до моделі; див. частину «+2k» рівняння AIC у розділі 2.

Щодо подальшого аналізу висувається припущення, що моделі з вищими (=гіршими) значеннями Scaled AIC можуть містити значущі, систематично виведені коефіцієнти, тобто коефіцієнти, релевантні лише відповідно до набору даних LADEC. У цьому контексті наша гіпотеза припускає, що у зв’язку між прозорістю та Scaled AIC може виникнути протилежна тенденція порівняно з тією, на яку вказують медіани в таблиці 7.

Зокрема, нижчі (=кращі) значення Scaled AIC можуть бути пов’язані з (a) додатними коефіцієнтами (довшими часами реакції) для всього складного слова, (b) від’ємними коефіцієнтами (коротшими часами реакції) для першого конституента та (c) додатними або від’ємними коефіцієнтами (відповідно довшими або коротшими часами реакції) для другого конституента. Слід зазначити, що щодо другого конституента медіана в таблиці 7 вказує на відсутність ефекту.

Щоб відповісти на дослідницьке питання, буде застосовано два непараметричні показники, а саме тест Kruskal–Wallis і тест Jonckheere–Terpstra. Тест Kruskal–Wallis, також відомий як «H-тест», є непараметричним тестом, заснованим на

18 У Charitonidis (2024) стверджується, що і гіпонімія, і конкретність контексту для другого конституента є значущими семантичними предикторами в лексичному рішенні та називанні. Представлений там аналіз показує, що включення обох цих предикторів призводить до покращення Scaled AIC і R2 порівняно з моделями, у яких одну з цих змінних вилучено.

Straipsniai / Articles

291

CHARITON CHARITONIDIS

розподілі хі-квадрат. Він вимагає, щоб залежна змінна була порядковою або неперервною. Цей тест призначений для визначення того, чи існують значущі відмінності між медіанами двох або більше груп, і використовується як альтернатива односторонньому ANOVA. Щодо процедури: значення неперервної залежної змінної, тобто Scaled AIC, було впорядковано від найнижчого до найвищого, а оцінкам було присвоєно ранги. Отримані ранги було повернуто до груп рівня значущості (незалежної змінної), а ранги для кожної групи було підсумовано. Формула обчислення «H» передбачала, серед іншого, піднесення до квадрата суми рангів для кожної групи, а потім ділення цього значення на обсяг вибірки.

У таблицях 8–10 наведено розглянуті вхідні дані та суму рангів для кожної групи.

19

20

сума рангів для кожної групи.

ТАБЛИЦЯ 8. Складне слово

Рівні значущості | N | Сума рангів Scaled AIC | 1 – малий від’ємний ефект | 1 | 2 | 2 – помірний від’ємний ефект | 5 | 46 | 3 – великий від’ємний ефект | 12 | 123 | Разом | 18 |

ТАБЛИЦЯ 9. Перший конституент

Рівні значущості | N | Сума рангів Scaled AIC | 1 – великий додатний ефект | 6 | 59 | 2 – помірний додатний ефект | 4 | 34 | 3 – малий додатний ефект | 1 | 3 | 4 – відсутність ефекту | 1 | 2 | 5 – малий від’ємний ефект | 1 | 10 | 6 – помірний від’ємний ефект | 1 | 11 | 7 – великий від’ємний ефект | 4 | 52 | Разом | 18 |

19 Решту обчислень див. у Field (2009: 561–562).

20 У всіх трьох таблицях загальна сума рангів приблизно дорівнює 171. Вона дорівнює сумі цілих чисел від 1 до 18; див. обсяг вибірки (N).

292

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

ТАБЛИЦЯ 10. Другий конституент

Scaled AIC | Рівні значущості | N | Сума рангів Scaled AIC | 1 – великий додатний ефект | 6 | 59 Scaled AIC | 2 – малий додатний ефект | 1 | 14 Scaled AIC | 3 – відсутність ефекту | 8 | 59 Scaled AIC | 4 – малий від’ємний ефект | 1 | 18 Scaled AIC | 5 – помірний від’ємний ефект | 2 | 21 | Разом | 18 |

Перш ніж перейти до результатів тесту Kruskal-Wallis (H), важливо зазначити, що цей тест не надає інформації про конкретні відмінності між окремими групами. Щоб розв’язати цю проблему, додатково було застосовано тест Jonckheere-Terpstra (JT). Цей тест надав інформацію про те, чи зростали або зменшувалися медіани груп у порядку, визначеному змінною кодування (=групування), а саме від великого додатного ефекту до великого від’ємного ефекту. Щодо методів, статистику JT було перетворено на z-показник. Додатне значення z вказувало на тенденцію до зростання медіан, тобто медіани збільшувалися (=вищий/гірший Scaled AIC) зі зростанням значень змінної кодування. Від’ємне значення z вказувало на тенденцію до зменшення медіан, тобто медіани зменшувалися (=нижчий/кращий Scaled AIC) зі зростанням значень змінної кодування. Нижче результати тестів Kruskal-Wallis (H) і Jonckheere-Terpstra (JT) наведено разом.

(a) На Scaled AIC для складного слова рівень значущості не мав значущого впливу, що було встановлено за допомогою тесту Kruskal-Wallis (H (2) = 2.226, p >.05). Було виявлено тенденцію до зростання медіан, що підтверджує нашу гіпотезу перенавчання; див. від’ємну медіану для складного слова в таблиці 7. Однак ця тенденція не була статистично значущою відповідно до тесту Jonckheere-Terpstra (JT = 50, z = 1.064, p >.05).

(b) На Scaled AIC для першого конституента рівень значущості не мав значущого впливу, що було встановлено за допомогою тесту Kruskal-Wallis (H (6) = 5.427, p >.05). Було виявлено тенденцію до зростання медіан, що спростовує нашу гіпотезу перенавчання; див. додатну медіану для першого конституента в таблиці 7. Однак ця тенденція не була статистично значущою відповідно до тесту Jonckheere-Terpstra (JT = 70, z = 0.549, p >.05).

(c) На Scaled AIC для другого конституента рівень значущості не мав значущого впливу, що було встановлено за допомогою тесту Kruskal-Wallis (H (4) = 4.607, p >.05). Тенденції до зростання або зменшення медіан не спостерігалося, що спростовує

Straipsniai / Articles

293

CHARITON CHARITONIDIS

нашу гіпотезу перенавчання. Зокрема, z-статистика тесту Jonckheere–Terpstra була практично нульовою, що узгоджується з нульовою медіаною для другого конституента в таблиці 7 (JT = 54, z = 0.041, p >.05).

Підсумовуючи, можна зробити висновок, що рівень значущості коефіцієнтів прозорості в моделях Gagné et al. (2019) із частотністю SUBTLEX-US не впливає на величину Scaled AIC. Цей результат опосередковано підтверджує якість моделей Gagné et al. (2019) із предикторами прозорості, зокрема вказуючи, що гіпотеза перенавчання для цих моделей є неспроможною. Обмеженням цього дослідження є малий обсяг вибірки, N = 18. Для підтвердження наших результатів потрібні подальші дослідження з використанням ширшого діапазону значень Scaled AIC.

Щоб забезпечити ясність і повноту представлення результатів нашого дослідження, ми додали окремий розділ, присвячений узагальненню основних результатів дослідження. Для цього всебічного огляду перейдіть, будь ласка, до розділу 7.

7. ОСНОВНІ РЕЗУЛЬТАТИ

У таблиці 11 нижче подано всебічний аналіз ефективності моделей і відповідних змінних у контексті завдань лексичного рішення та називання, заснований на результатах Gagné et al. (2019). Кожен розділ таблиці присвячений окремим питанням і показує, які моделі є найефективнішими. Тести ANOVA і Kruskal–Wallis/Jonckheere–Terpstra (розділи 6.3 та 6.4) було застосовано після присвоєння номінальних (порядкових або категоріальних) значень регресійним коефіцієнтам моделей Gagné et al. (2019). Докладніше про застосовані спеціальні тести див. у відповідних розділах.

ТАБЛИЦЯ 11.

Scaled AIC у межах англійських складних слів із замкненою структурою: комплексний аналіз ефективності моделей у завданнях лексичного рішення та називання (Gagné et al. 2019)

294

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

Питання | Статистика | Оцінювання | Розділ Контрольні змінні | ANOVA | Частотність складного слова ✓; Довжина складного слова ~ | 6.3 Семантична прозорість | Kruskal–Wallis Jonckheere–Terpstra | Перший конституент NOF/ns; Другий конституент NOF/ns; Складне слово NOF/ns | 6.4

PAR: параметричні дані | NPAR: непараметричні дані | ✓: кращі моделі (нижчий AIC) ~: гірші моделі (вищий AIC) | NOF/ns: відсутність перенавчання/незначущий тест

8. ОБГОВОРЕННЯ

Попередні дослідження Charitonidis (2022, 2024) продемонстрували, що Scaled AIC є надійним показником якості припасування, який можна використовувати під час вибору моделей, можливо, у поєднанні з іншими показниками, такими як тест Wald (див. розділ 3). У контексті множинних регресійних моделей Gagné et al. (2019) із частотністю SUBTLEX-US поточний аналіз виявив додаткові властивості показника Scaled AIC. Хоча було висловлено обґрунтовані застереження щодо порівняння моделей, припасованих на вибірках різного обсягу, за допомогою інформаційних критеріїв (див. розділ 2), результати цього дослідження свідчать, що в певних контекстах Scaled AIC справді може бути цінним інструментом для оцінювання припасування моделі та ієрархізації регресійних моделей. Наше дослідження продемонструвало, що Scaled AIC реагує на експериментальний дизайн, джерела часів реакції та конкретні завдання. Однак важливо визнати, що застосовність Scaled AIC може залежати від контексту, а його корисність слід оцінювати в кожному конкретному випадку.

Перш ніж перейти до основних результатів цієї статті, важливо розглянути дослідницькі питання, сформульовані в розділі 4.

1. Розподіли значень Scaled AIC разом із комбінаціями різних джерел часу реакції та завдань обробки свідчать, що Scaled AIC ефективно виявляє наявність або відсутність чітко визначених базових факторів в експериментальному дизайні та статистичному моделюванні. У цьому контексті лексичне рішення BLP і називання ELP демонстрували вищу прогностичну силу для Scaled AIC навіть за контрольованих умов.

2. Частотність складного слова незмінно була негативним предиктором Scaled AIC, завжди вказуючи на великий ефект. Лексичне рішення ELP стабільно демонструвало

Straipsniai / Articles

295

CHARITON CHARITONIDIS

значущі позитивні кореляції з довжиною складного слова, передбачаючи вищі (=нижчі⟧) значення Scaled AIC. Лексичне рішення BLP стабільно демонструвало незначущі кореляції з довжиною складного слова. І лексичне рішення, і довжина складного слова передбачали гірші моделі при коригуванні коваріат.

3. Позитивність і рівень значущості коефіцієнтів прозорості в моделях Gagné et al. (2019) не впливали на величину Scaled AIC. Цей результат означає, що моделі Gagné et al. (2019) із предикторами прозорості не створюють упередження перенавчання.

Якщо посилатися на конкретні розділи аналізу, основні результати цього дослідження можна узагальнити так:

У розділі 6.1 наш аналіз зосереджувався на порівнянні значень Scaled AIC у різних категоріях моделей. Навіть після спроб застосувати перетворення «натуральний логарифм» і «квадратний корінь» до абсолютних значень загальна вибірка Scaled AIC не відповідала нормальному розподілу. Аналогічно, моделі лексичного рішення ELP демонстрували непараметричний розподіл своїх значень Scaled AIC. Натомість дані, пов’язані з лексичним рішенням BLP і називанням ELP, відповідали моделі нормального розподілу.

У розділі 6.2 увагу було перенесено на вивчення зв’язку між Scaled AIC і (a) джерелами часу реакції та (b) виконанням завдання. Цікаво, що діапазони значень Scaled AIC для моделей лексичного рішення ELP і BLP не перекривалися, що засвідчує їхню відмінність. Результати тестів виявили значущі головні ефекти як джерела часу реакції, так і виконання завдання щодо Scaled AIC. Примітно, що прогностична здатність Scaled AIC була кращою для моделей, пов’язаних із часом лексичного рішення BLP і завданням називання. Ці результати істотно підвищують точність та ефективність відповідних моделей.

У розділі 6.3 наше дослідження було присвячене зв’язку між Scaled AIC і контрольними змінними «частотність складного слова» та «довжина складного слова». Частотність складного слова було вилучено з аналізу, оскільки вона була ідеально колінеарною зі Scaled AIC. Натомість спостерігалося зниження значень Scaled AIC, коли довжина складного слова ставала релевантним фактором у моделях. Водночас довжина складного слова була найрелевантнішою для завдання називання.

Щодо коригування коваріат, і завдання лексичного рішення, і довжина складного слова були предикторами гірших моделей.

У розділі 6.4 увагу було зосереджено на зв’язку між Scaled AIC і семантичною прозорістю. Дослідницьке питання полягало в тому, чи впливали позитивність і рівень значущості коефіцієнтів прозорості в моделях Gagné et al. (2019) на Scaled AIC. Основною метою нашого методу було виявлення потенційних ефектів перенавчання. Ми припустили, що моделі з нижчими значеннями Scaled AIC можуть містити значущі коефіцієнти, які мають релевантність

296

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

лише відповідно до набору даних LADEC. Хоча ми спостерігали тенденцію до зростання (=нижчих) значень Scaled AIC для кластера значущих від’ємних коефіцієнтів на рівні складених слів, що узгоджується з нашою гіпотезою перенавчання, тест Jonckheere–Terpstra показав, що ця тенденція не досягла статистичної значущості.

Підсумовуючи, дослідження різних параметрів із використанням Scaled AIC як залежної змінної висвітлило різноманітні способи, у які категорії моделей, джерело часу реакції, завдання обробки, контрольні змінні та семантична прозорість впливають на якість підгонки моделей. Усвідомлення нюансованих взаємозв’язків між цими елементами дає дослідникам змогу краще обґрунтовувати рішення щодо вибору моделей, їх коригування та інтерпретації.

REFERENCES

Akaike Hirotugu 1973: Information Theory and an Extension of the Maximum Likelihood Principle. – Second International Symposium on Information Theory, eds. B. F. Csaki, B. N. Petrov, Budapest: Academiai Kiado, 267–281.

Aldrich John R. 1997: R. A. Fisher and the Making of Maximum Likelihood 1912–1922. – Statistical Science 12(3), 162–176.

Baayen Harald R., Piepenbrock Richard, Gulikers Leon 1995: The CELEX Lexical Database (Data set, Release 2, CD-ROM), Linguistic Data Consortium, University of Pennsylvania. Available at: https://catalog.ldc.upenn.edu.

Balota David A., Yap Melvin J., Cortese Michael J., Hutchison Keith I., Kessler Brett, Loftis Bjorn, Neely James H., Nelson Douglas L., Simpson Greg B., Treiman Rebecca 2007: The English Lexicon Project. – Behavior Research Methods 39, 445–459.

Brysbaert Marc, New Boris 2009: Moving Beyond Kučera and Francis: A Critical Evaluation of Current Word Frequency Norms and the Introduction of a New and Improved Word Frequency Measure for American English. – Behavior Research Methods 41, 977–990. DOI: doi.org/10.3758/BRM.41.4.977.

Burnham Kenneth P., Anderson David R. 2002: Model Selection and Multimodal Inference: A Practical Information-Theoretic Approach, 2ⁿᵈ edition, New York: Springer. DOI: dx.doi.org/10.1007/b97636.

Charitonidis Chariton 2022: Context Concreteness for the Second Constituent Slows Down Compound-Word Processing. – Lexis 20. DOI: doi.org/10.4000/lexis.6769.

Straipsniai / Articles

297

CHARITON CHARITONIDIS

Charitonidis Chariton 2024: The Role of Hyponymy and Context Concreteness in Compound Word Processing. – Studia Neophilologica. DOI: doi.org/10.1080/00393274.2024.2336851.

Chen Xiaocong, Dong Yanping, Yu Xiufen 2018: On the Predictive Validity of Various Corpus-Based Frequency Norms in L2 English Lexical Processing. – Behavior Research Methods 50, 1–25. DOI: doi.org/10.3758/s13428-017-1001-8.

Field Andy 2009: Discovering statistics using SPSS, 3rd edition, London: Sage Publications.

Fisher Ronald A. 1922: On the Mathematical Foundations of Theoretical Statistics. – Philosophical Transactions of the Royal Society of London, Series A 222, 309–368.

Gagné Christina L., Spalding Thomas L., Schmidtke Daniel 2019: LADEC: The Large Database of English Compounds. – Behavior Research Methods 51, 2152–2179. DOI: doi.org/10.3758/s13428-019-01282-6.

Gagné Christina L., Spalding Thomas L., Spicer Patricia, Wong Dixie, Rubio Beatriz, Perez-Cruz Karen 2020: Is Buttercup a Kind of Cup? Hyponymy and Semantic Transparency in Compound Words. – Journal of Memory and Language 113. DOI: doi.org/10.1016/j.jml.2020.104110.

Hastie Trevor, Tibshirani Robert, Friedman Jerome 2009: The Elements of Statistical Learning: Data Mining, Inference, and Prediction. 2nd edition, New York: Springer.

Keuleers Emmanuel, Lacey Paula, Rastle Kathleen, Brysbaert Marc 2012: The British Lexicon Project: Lexical Decision Data for 28,730 Monosyllabic and Disyllabic English Words. – Behavior Research Methods 44, 287–304. DOI: doi.org/10.3758/s13428-011-0118-4.

Kullback Solomon 1959: Information Theory and Statistics. New York: Wiley.

Navarro Daniel J., Myung Jay I. 2005: Model Evaluation. – Encyclopedia of Statistics in Behavioral Science, vol. 3, eds. B. S. Everitt, D. C. Howell, Chichester: Wiley, 1239–1242.

Steiger James H. 1980: Tests for Comparing Elements of a Correlation Matrix. – Psychological Bulletin 87(2), 245–251. DOI: doi.org/10.1037/0033-2909.87.2.245.

Wagenmakers Eric-Jan, Farrell Simon 2004: AIC Model Selection Using Akaike Weights. – Psychonomic Bulletin & Review 11(1), 192–196.

298

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

I N T E R N E T D I S C U S S I O N S

Model comparison with AIC based on different sample size. Available at: https://stats.stackexchange.com/questions/94718/model-comparison-with-aic-based-on-different-sample-size [accessed 15.5.2024].

What is the acceptable range of skewness and kurtosis for normal distribution of data? Available at: https://www.researchgate.net/post/What_is_the_acceptable_range_of_skewness_and_kurtosis_for_normal_distribution_of_data [accessed 15.5.2024].

L A R G E L A N G U A G E M O D E L S

GPT-3.5 (available at: https://chat.openai.com/) and Google Gemini (available at: https://gemini.google.com [accessed 11.10.2023]) were selectively used as auxiliary proofreading and editing tools. The responses from both AI tools were further proofread and edited by the author.

Anglų kalbos uždarųjų junginių (sudurtinių žodžių) skalės AIC tyrimas

S A N T R A U K A

Šiame tyrime nagrinėjamos modifikuotos Akaikės informacijos kriterijaus, pavadinto skalės kriterijumi, t. y. AIC, kaip tinkamumo rodiklio, padalinto iš imties dydžio, varianto ypatybės. Tyrimo objektas – 66 daugialypės regresijos modeliai, susiję su uždarųjų (sudurtinių) anglų kalbos žodžių junginių, paimtų iš Gagné'es ir kitų (2019) Anglų kalbos sudurtinių žodžių (junginių) didžiosios duomenų bazės (angl. LADEC), apdorojimu. Toliau pateikiami išsamios analizės rezultatai:

1. Modelių kategorijų modeliai pasižymi nevienareikšmiais rezultatais. Britų kalbos žodyno projekto (angl. BLP) leksinių sprendimų modeliai ir Anglų kalbos žodyno projekto (angl. ELP) įvardijimo modeliai veikia geriau (tai rodo mažesnis AIC), palyginus su Anglų kalbos žodyno projekto (angl. ELP) leksinių sprendimų modeliais.

Straipsniai / Articles

299

CHARITON CHARITONIDIS

2. Laiko šaltinio ir leksikos apdorojimo užduočių atsakymais atskleidžia reikšmingus pagrindinius skalės AIC rezultatus. Britų kalbos žodyno projekto leksinių sprendimų modeliai ir Anglų kalbos žodyno projekto įvardijimo modeliai veikia gerai, o pastarojo projekto leksinių sprendimų modeliai yra mažiau veiksmingi.

3. Įvertinus kontrolinius kintamuosius, tokius kaip junginių dažnumas ir junginių ilgis, matyti, kad modelių rezultatyvumas skiriasi. Junginių dažnumas yra stiprus veiksnys (parodo didesnis produktyvumas), o sudėtinio ilgio modelių prognozės blogesnės.

4. Kalbant apie pirmosios ir antrosios žodžių junginių sudedamųjų dalių, taip pat ir apie junginių semantinį skaidrumą, modeliai nerodo per didelio suderinamumo. Tai parodo, kad semantinis skaidrumas nesumažina modelių galėjimo apibendrinti naujus duomenis.

Įteikta 2024 m. sausio 11 d.

CHARITON CHARITONIDIS

[email protected]

300

Acta Linguistica Lithuanica XC