ETKİ BÜYÜKLÜĞÜ, AVANTAJLARI VE YORUMLANMASI
Abstract
Tanımsal istatistik ve hipotez testlerinin kullanımı oldukça eskiye dayanmaktadır. İstatistiğin ilk öncülerinden birisi İngiliz bir tüccar ve istatistikçi olan John Graunt’tur. 1662 yılında yayınladığı “Natural and Political Observations Made upon the Bills of Mortality” isimli kitabında doğum ve ölüm oranlarını analiz ederek nüfus artışına dair öngörülerde bulunmuştur. Graunt tarafından yapılan çalışmalar nüfus bilimi (demografi) ve halk sağlığı için temel oluşturmuştur.
Full text
47 | SAĞLIK BİLİMLERİ ALANINDA ULUSLARARASI AKADEMİK ÇALIŞMALAR VE TEORİK BİLGİLER-IV BÖLÜM 3 ETKİ BÜYÜKLÜĞÜ, AVANTAJLARI VE YORUMLANMASI Dr. Öğr. Üyesi Erman GÜLENDAĞ1 DOI: https://dx.doi.org/10.5281/zenodo.10408058 1 Siirt Üniversitesi, Veterineriner Fakültesi, Biyoistatistik Ana Bilim Dalı, Siirt, Türkiye, [email protected], Orcid ID: 0000-0002-3335-7247
SAĞLIK BİLİMLERİ ALANINDA ULUSLARARASI AKADEMİK ÇALIŞMALAR VE TEORİK BİLGİLER-IV | 48
49 | SAĞLIK BİLİMLERİ ALANINDA ULUSLARARASI AKADEMİK ÇALIŞMALAR VE TEORİK BİLGİLER-IV GİRİŞ Tanımsal istatistik ve hipotez testlerinin kullanımı oldukça eskiye dayanmaktadır. İstatistiğin ilk öncülerinden birisi İngiliz bir tüccar ve istatistikçi olan John Graunt’tur. 1662 yılında yayınladığı “Natural and Political Observations Made upon the Bills of Mortality” isimli kitabında doğum ve ölüm oranlarını analiz ederek nüfus artışına dair öngörülerde bulunmuştur. Graunt tarafından yapılan çalışmalar nüfus bilimi (demografi) ve halk sağlığı için temel oluşturmuştur. İstatistiksel anlamlılık testlerinin yaygınlaşması ise 20. yy.da gerçekleşmiştir. Bu bağlamda, Karl Pearson tarafından geliştirilen Ki-Kare metodu bilim dünyasına kazandırılmıştır (Pearson, 1900). William Sealy Gosset’in 1908 yılında Student’s t Testi ve 1918 yılında Ronald A. Fisher’ın Varyans Analizini (ANOVA) bulmasıyla hipotez testlerinin günümüzde kullanımına dair önemli katkı sağlamıştır. Fisher, 1925 yılında yayınlanan Araştırmacılar İçin İstatistiksel Yöntemler (Statistical Methods for Research Workers) kitabında; ortalamalar farkı, varyans analizi, korelasyon ve regresyon katsayıları, sınıflar arası korelasyon gibi pek çok yöntemi ortaya koymuştur. (Fisher, 1925). Gene Fisher 1935 yılında yayınlanan Deney Tasarımları (The Design of Experiments) kitabında yayınladığı “The Lady Tasting Tea” deneyiyle, günümüzde kullanılan hipotez testlerindeki eşitlik veya yokluk hipotezi (null hypothesis) kavramını, yani H0 ifadesini kazandırmıştır (Fisher, 1935). Hipotez testlerinde geliştirilen bu determinist yaklaşımlar, gözlem ve deneylerden elde edilen verilere dayanan ve oldukça karmaşık bir süreç haline dönebilen karar verme mekanizmalarını kabul veya ret etme sonuçlu mekanik bir süreç haline getirmiştir. Bu sayede hipotezlerin kabul/ret olarak sonuçlandırılması kolay kullanılıp yorumlanabilen bir yöntem olmuştur ve kullanımı da hızla yaygınlaşmıştır. Ancak sadece bu metoda dayanan çıkarımlar günümüzde oldukça eleştiri almaya başlamıştır. Bu eleştirilerin ana noktasında ise araştırmacıların bu kabul/ret mekanizmasını, istatistiksel anlamlılığa ulaşma gayesiyle kullanması yatmaktadır. Bu nedenle kümülatif bilginin gelişiminin sekteye uğradığı düşünülmektedir (Schmidt, 1996). Etki büyüklüğü kavramı ilk olarak Jacob Cohen tarafından geliştirilmiştir (Cohen, 1988). Elde edilen verilerin, eşitlik hipotezinde beklenilen sonuçlara göre sapma değerini gösteren bir değerdir. Bahsi edilen eleştiriler genel olarak hipotez testi yaklaşımlarının yanlış olduğu yönünde olmayıp, etki büyüklüğünün de hesaplanarak paylaşılmasının ve yorumlanabilmesini savunmaktadır. Bu sayede istatistiksel değerlendirmelere ek olarak özellikle pratik ve klinik anlamda değişimlerin yansıtılmasını mümkün hale gelebilecektir.
SAĞLIK BİLİMLERİ ALANINDA ULUSLARARASI AKADEMİK ÇALIŞMALAR VE TEORİK BİLGİLER-IV | 50 Yokluk hipotezi istatistiksel anlamlılık testi (NHSST), örneklem büyüklüğünden etkilenebilmektedir. Öyle ki, küçük veya önemsiz farklılıklar bile yeterince büyük bir örneklem sayesinde istatistiksel olarak anlamlı olarak ifade edilebilmektedir (Fan, 2001). NHSST’lerde sadece dikkat edilen bölüm olan P değerlerinin etki büyüklüğü hakkında fikir vermediği ve sadece bu değerlere güvenilmemesi gerekliliği görüşü de rapor edilmiştir (Lang ve Altman, 2013). Hatta Amerika Eğitim Araştırmaları Derneği (AERA) ve Amerika Psikoloji Derneği (APA) gibi pek çok kurum yazım kılavuzlarında, etki büyüklüğü ve güven aralıklarının raporlanmamasını kritik bir hata olarak belirtmişlerdir (AERA, 2006; APA, 2008). Bununla birlikte sağlık ve davranış bilimleri alanında yayınlanmış literatürlerde etki büyüklüğünün raporlanması yoksunluğu oldukça önemli bir sorundur. Yapılan çalışma göstermiştir ki, Amerika Birleşik Devletlerinde 6 farklı SCI ve SCIE dergide yayınlanan, toplamda 1245 makalenin sadece 597’sinde (47,9%) etki büyüklükleri raporlanmıştır (Barry ve ark., 2016). Kitabın bu bölümünde, etki büyüklüğü kavramı ve gerekliliğinden bahsedilecek ve farklı çalışma dizaynlarında nasıl yorumlanması gerektiği hakkında bilgi verilecektir. 1. ETKİ BÜYÜKLÜĞÜ 1.1. Hipotez Testleri P değeri, neredeyse bütün tıbbi araştırma makalelerinde yer alan bir istatistiksel kanıt ölçüsü olarak kabul edilmektedir ve yaygın olarak kullanılan haliyle, anlamlılık kriteri olarak P < 0,05 ile ifade edilmektedir. NHSST’ye ait çıkarımsal istatistiklerde kullanılan bu yöntem ile yokluk hipotezini (H0), ilgilenen değişkenler arasında ilişki olmadığını ya da grup faktörünü yaratan bağımsız değişkenin, oluşturmuş olduğu alt gruplarda sonuç faktörü, başka deyişle bağımlı değişken üzerinde farklılık yaratmadığını iddaa etmektedir. H0‘a alternatif olarak sunulan hipotezde (H1) ise anlamlı bir ilişki veya farklılığın olduğu yönündedir. Bu tarz bir modelde hipotezlerden bir tanesi reddedilmektedir ve bu aşamada oluşabilecek hata düzeyleri, araştırma sonuçlarını yorumlarken verilen kararları etkileyebilmektedir. Bu hatalar temel olarak iki kısımda incelenmektedir. H0 doğru iken reddedilmesi Tip I Hata (α), H0 yanlış iken reddedilmemesi ise Tip II Hata (β) olarak ifade edilir.
51 | SAĞLIK BİLİMLERİ ALANINDA ULUSLARARASI AKADEMİK ÇALIŞMALAR VE TEORİK BİLGİLER-IV Şekil 1. Tip I ve Tip II Hata görselleri (Ellis, 2010). Tip I ve Tip II hata oranları birbirleri ile ters orantılıdır, biri arttıkça diğerinin azalması söz konusudur. Tip I Hata oranı, genellikle araştırma öncesinde belirlenir ve bilimsel araştırmalarda kaçınılmak istenilen hata tipi genellikle Tip I olmaktadır. Tip I Hata sıklıkla 0,05 olarak kabul görmektedir. Tip II’den kaçınma durumu, başka bir ifadeyle hipotez testinin var olan pozitifliğin yakalayabilmesi testin gücü (1-β) olarak ifade edilir. Tip II Hata’nın %20 düzeyinde olması veya testin gücünün %80 olması kabul edilebilir seviye olarak değerlendirilmiştir (Cohen, 1988). Cohen Tip I ve Tip II hata için belirlenen 0,05 ve 0,2 düzeylerindeki 1’e 4 oranının makul bir denge sağlayacağını düşünmüştür (Ellis, 2010). Cohen 1’e 4 oranı izah ederken, “Mevcut bilimsel düşüncede, bulamama fikri olmayan bir şeyi bulmaktan daha az ciddi bir sorundur.” şeklinde ifade etmiştir. Araştırmaya ait hipotezlerin değerlendirilmesindeki karar süreci Tablo 1 üzerinde gösterilmiştir. Tablo 1. NHSST’lerde karar mekanizması. H0 Doğru H0 Yanlış H0 hipotezinin reddi Tip I Hata (α) Doğru Karar (1β) H0 hipotezinin reddedilememesi Doğru Karar (1-α) Tip II Hata (β) Tip I ve Tip II hata oranlarının tayin edilmesi araştırmanın amacı ve türü ile de yakından ilişkilidir. Örneğin, Covid-19 teşhisi için kullanılan serolojik testlerin sonuçları, tespit edilen antikor miktarı ile ilişkilidir. Testin pozitif sonuç vermesi için gereken antikor miktarının azaltılması, kesin
SAĞLIK BİLİMLERİ ALANINDA ULUSLARARASI AKADEMİK ÇALIŞMALAR VE TEORİK BİLGİLER-IV | 52 pozitiflik (kişinin enfekte olması ve testin bunu tespit etmesi) oranını arttıracaktır. Kısacası Tip II Hata ihtimali azalacak, hastalığın olmadığı kişilerde yanlış negatif görülme oranı düşecektir. Testin gücü artacaktır. Bu durumun tersi olarak, enfekte olanları teşhis edebilme gücünü arttırmak için belirlenen antikor miktarı azaltılırsa, Tip I Hata ihtimali azalacaktır ancak enfekte olmayan kişilerde de testin pozitif görülme oranında artış olacaktır. Anlaşılacağı üzere, NHSST iki farklı hipotez arasında seçim yapma üzerine kuruludur ve bu hipotezlerden birisi reddedilmek zorundadır. Araştırmacı ise bu hipotezler arasında seçim yaparken ortaya çıkması olası olan iki hata tipinden mümkün olduğu ölçüde kaçınmak zorundadır (Işık, 2014). NHSST’lerde oluşabilecek bu senaryoların kavranması, etki büyüklüğü kavramının önemini anlamak için önemlidir. Daha önce de belirtildiği gibi, yeterli genişlikte bir örneklem büyüklüğüne sahip olunması durumunda küçük bir etki büyüklüğü bile istatistiksel anlamlılık düzeyini etkilemektedir. Çok büyük örneklemler üzerinde yapılan çalışmalarda en küçük değişimler bile anlamlı sonuç olarak yer bulmaktadır. Buna karşın küçük örneklem ile çalışılan araştırmaların istatistiksel gücü de düşük olmakta; var olan bir etkinin var olmadığı sonucu çıkmaktadır. Bu durum ise etkinin pratik ve klinik açıdan önemliliğinin göz ardı edilmesine neden olabilmektedir. Bunlara ek olarak, yapılan çalışmaların sadece istatistiksel açıdan anlamlı/anlamsız olması algısı araştırmacıları olumsuz etkileyebilmektedir. Bilim camiasının da eğilimleri sonucunda oluşan, anlamlılık ifade etmeyen çalışmaların bilimsel katkısının düşük olacağı yönündeki algı ve bu algı ile birlikte şekillenen yayın yanlılığı, bilimsel çıkarımların yapılmasında problem teşkil etmektedir. Hipotez testleri, sadece gözlenen verinin sıfır hipotezi doğrulama olasılığı hakkında bilgi verir ki p değeri olarak kullanılan bu bilgi araştırıcıyı sıfır hipotezini reddetme ya da reddedememe şeklinde dikotom bir karar vermeye zorlar. Bu problemin önüne geçilmesi, daha kapsamlı ve isabetli kararlar verilebilmesi adına istatistiksel güç, etki büyüklüğü ve güven aralığı gibi sonuçların da değerlendirilmesine ihtiyaç duyulmaktadır. 1.2. Hipotez Testlerinde Anlamlılık ve İkili Karar Hipotez testleri, doğası gereği dikotom karar mekanizmasına sahiptir. Bu kararın verilmesinde etkili olan p değeri, H0 hipotezinin doğruluğunu kabul eder ve aynı araştırmanın tekrarlanması halinde, gözlenen test değerinin ortaya çıkmasının olasılığını ifade eder. NHSST sürecinde, p değerinin alfa değerinden düşük olması beklenir. Sonuçta, p<0.05 ise istatistiksel anlamlılıktan söz edilebilir. Bu ifade; benzer bir araştırmanın gene benzer
53 | SAĞLIK BİLİMLERİ ALANINDA ULUSLARARASI AKADEMİK ÇALIŞMALAR VE TEORİK BİLGİLER-IV örneklem özelliklerinde tekrarları halinde, test istatistiklerinin %5’inden daha azı oranında gözlenen sonuçlardan daha farklı sonuç vereceği anlamına gelmektedir. Böyle bir durumda ise, H0 reddedilir ve dolayısıyla H1 desteklenmiş olur. Bu mantık çerçevesinde istatistiksel anlamlılık yorumlandığı takdirde farkın ne düzeyde olduğuna dair bir bilgilendirmeye ihtiyaç bulunmamaktadır. Oysa araştırmaların esas amacı, ilgilenilen konu üzerinde mevcut bağlantıların ya da farklılıkların ne düzeyde olduğunu ortaya çıkarmak ve açıklamaktır. Ancak p değeri etki büyüklüğünün küçüklüğü ya da büyüklüğü hakkında bilgi vermemektedir. Gene istatistiksel analiz sonuçlarının olası sonuçlarından birisi p değerinin 0.051 benzeri değerler bulunmasıdır. Bu açıdan aynı etki büyüklüğüne sahip durumda, 0.049 istatistikte anlamlı kabul edilirken 0.051 istatistiksel olarak anlamlı bulunmayacaktır. Araştırmacılar benzer sonuçları yorumlamaya çalışırken p değerinin marjinal olarak anlamlılığı gibi muğlak ifadeler kullanmak yerin etki büyüklüğü üzerinden yorumlayabilmelidirler. 1.3. Klinik Anlamlılık Klinik anlamlılık, müdahale sonucunda elde edilen etkinin öneminin ya da değerinin pratik veya uygulamada değerli olabilecek somut, ayırt edilebilir ve hissedilebilir bir fark yaratıp yaratmadığı şeklinde ifade edilmiştir (Kazdin, 1999). Bu bağlamda düşünecek olursak NHSSC sonuçlarına göre anlamlılık ifade eden her durum klinik açıdan anlamlılık göstermezken, tam tersi senaryoların da oluşması ihtimal dahilindedir. Az sayıda hasta ile yürütülen klinik bir çalışmada, vakaların bir kısmında gözlemlenen değişiklik istatistiksel olarak anlamlılık göstermese de, vakaların veya araştırıcıların bu değişimi önemsemesi, araştırmaya veya tedaviye devam edilmesi kararı alınması yönünden önemlidir (Peterson, 2008). Sadece p değeri olarak ele alındığında bu değişim anlamsız olarak gözükmekteyken, etki büyüklüğünün yorumlanmasıyla daha doğru bir şekilde anlaşılabilmektedir. 1.4. Pratik Anlamlılık Örneğin, hayvancılık sektöründe faaliyet göstermekte olan büyükbaş işletmesi için canlı ağırlık miktarındaki artışların çok büyük oranda ekonomik getirisi olabililir ancak uzun süreli yürütülmesi gereken bu tarz çalışmalarda örneklemin küçük olması sebebiyle istatistiksel anlamlılık bulunmayabilir veya farklı olabilecek sonuçlar sadece istatistiksel anlamlılık ifade ettiği için benzer şekilde yorumlanabilir veya belirli bir güzergaha ait trafik düzenlemesinde yapılabilecek bir değişiklik sonrasında araçların trafikte
SAĞLIK BİLİMLERİ ALANINDA ULUSLARARASI AKADEMİK ÇALIŞMALAR VE TEORİK BİLGİLER-IV | 54 kalma süresinde görülebilecek minimal değişiklikler, trafiği kolaylaştırma açısından daha büyük etkileri olabilir. Bu gibi durumlarda da, klinik anlamlılık benzeri bir yorumlama mekanizmasına ihtiyaç duyulmaktadır ve NHSST metodları bu açıdan yeterli olmamaktadır. Verilen örneğin daha rahat anlaşılabilmesi adına, farklı iki çalışma kurgusu düşünelim. 20 adet büyükbaş besi hayvanında, bir haftalık besleme dönemi öncesi ve sonrasında elde edilmiş veriler incelendiğinde, her iki kurguda da 200 kg. olan canlı ağırlık 206 kg.a çıkmıtır. Ancak besleme dönemi öncesi ve sonrasında elde edilen dağılımları arasında farklılık; ilkinde 200±3 ve 206±3, ikincisinde ise 200±7 ve 206±7 şeklinde oluştuğu düşünüldüğünde, Grafik 1’deki gibi bir yağmur bulutu (raincloud) grafiği oluşmaktadır. Grafik 1: İki farklı besleme dönemine ait grafikler. Grafikte yeşil renkle besleme öncesi, turuncu renkle besleme sonrası canlı ağırlıkları ifade edilmiştir. Sol kısımda (A), dağılım besleme öncesi 200±3 kg., sonrası ise 206±3 kg. iken sağ kısımda (B), 200±7 kg. ve 206±7 kg.dır. Kısacası standart olarak verilen tablolarda her iki yöntem de benzer istatistiksel ölçütler ile ifade edilecektir. Bağımlı Örneklem t Testi (Paired Sample t Test) olarak incelendiğinde A ve B yöntemlerinin her ikisi de p<0,05 düzeyinde istatistiksel anlamlılık ifade etmektedir, yani beslenme öncesi ve sonrasındaki canlı ağırlık artışları arasındaki fark her iki yöntemde de önemlidir. Ancak grafikten de anlaşılacağı üzere A yönteminde görülen artışlar, besleme öncesine göre daha fazla ayrışmaktadır, B yönteminde ise ortak alan miktarı oldukça fazladır. Etki büyüklüğüne (Cohen’s d) bakıldığında, A yönteminde d=2, B yönteminde d=0.6 olduğu görülmüştür ve bu oldukça yüksek bir farklılıktır. Bu doğrultuda, gerek klinik gerek de pratik anlamlılıkları açıklamada, pek çok çalışma dizaynında NHSST yöntemleri yeterli olmamaktadır.
55 | SAĞLIK BİLİMLERİ ALANINDA ULUSLARARASI AKADEMİK ÇALIŞMALAR VE TEORİK BİLGİLER-IV 1.5. Etki Büyüklüğünün Avantajları P değeri, H0’a karşı kanıtın gücünü belirlemeye yarayan bir ölçüttür ve NHSST’lerde H1 lehine yokluk hipotezinin reddedilip reddedilmeyeceğine karar vermek için kullanılır. P değerinin tek başına bir etkinin büyüklüğü veya önemi hakkında bilgi vermediğini, yalnızca sıfır hipotezine karşı kanıtın gücünü değerlendirdiğini unutmamak önemlidir. Gruplar arasındaki ilişkinin veya farkın boyutunu veya büyüklüğünü ölçülebilir, standartlaştırılmış bir şekilde belirtir. Sonuçların klinik ve pratik açıdan öneminin daha net anlaşılmasını sağlar. Örneğin, iki tedavinin karşılaştırıldığı bir çalışmada etki büyüklüğü, bu tedavilerin ortalama olarak ne kadar farklı olduğunu gösterir. Etki büyüklükleri örneklem büyüklüğünden p değerleri gibi etkilenmez. Küçük örneklem büyüklükleri, testte yarattığı güç eksikliği nedeniyle istatistiksel olarak anlamlı olmayan sonuçlara yol açabilir, ancak etki büyüklükleri nispeten sabit kalır ve popülasyona genellenebilen gruplar arasındaki ilişkinin veya farkın gücü hakkında bilgi sağlar. Etki büyüklükleri, farklı örneklem büyüklüklerine veya metodolojide farklılıklara sahip olsalar bile, farklı çalışmalar ve deneyler arasında karşılaştırma yapılmasına olanak tanır. Bu, bulguların pratik sonuçlarını yorumlamayı ve çalışmalar arasında sonuçları karşılaştırmayı kolaylaştırarak sonuçların önemini anlamak için daha geniş bir bağlam sağlar. Meta-analiz çalışmaları bu avantajının yaygın kullanılan bir sonucudur. Etki büyüklükleri, yalnızca sonuçların istatistiksel olarak anlamlı olup olmadığından ziyade incelenen gerçek ilişki veya farka odaklanır. Bu, araştırmacıların keyfi eşiklere dayalı "anlamlı" veya "anlamlı değil" sınıflandırmasında kaybolmak yerine bulgularının esas anlamına odaklanmalarını sağlar. Yalnızca p değerlerine güvenmek sonuçların yanlış yorumlanmasına yol açabilir.Bununla birlikte, sağladıkları ek bilgiler sayesinde p değerlerini tamamlayabilir.Anlamlı bir p değeri güçlü bir etki büyüklüğü anlamına gelmez ve tersine, anlamlı olmayan bir p değeri de bir etkinin olmadığı anlamına gelmez. Etki büyüklüklerinin p değerleri ile birlikte kullanılması, incelenen gerçek etki veya ilişkinin daha net bir resmini vererek olası hataların önlenmesine katkıda bulunur. Bu bağlamda, etki büyüklüğünün kullanılması p değerinin bir alternatifinden ziyade tamamlayıcısı olarak görülmelidir. Etki büyüklükleri gözlemlenen etki veya ilişkinin büyüklüğü ve pratik önemi hakkında değerli bilgiler sağlar. İstatistiksel analizde her ikisi de önemlidir, ancak etki
SAĞLIK BİLİMLERİ ALANINDA ULUSLARARASI AKADEMİK ÇALIŞMALAR VE TEORİK BİLGİLER-IV | 62