İki hasta grubuna aynı belirti ölçeğini uygulayan bir ekip, gruplardan birinde ortalama puanı daha yüksek bulunca bunu hastalık yükündeki bir fark olarak yorumlamak isteyebilir. Ancak aynı madde iki grupta farklı anlaşılıyorsa, puan farkının tek açıklaması ölçülen özelliğin düzeyi olmayabilir. Ölçüm değişmezliği değerlendirmesi, ölçeğin iki grupta aynı özelliği aynı biçimde ölçüp ölçmediğini sınar; grupların bu özellikte ne kadar farklı olduğu ise ayrı bir araştırma sorusudur [3,4].
Eylül 2026'da yayımlanan iki çalışma bu sıralamayı somut biçimde gösteriyor. Schäffler ve arkadaşları, birinci basamakta yürütülen bir depresyon tarama çalışmasının 431 katılımcısının verisiyle DESY-PC anketini cinsiyete göre inceledi. Yazarlar tanısal doğruluğu ve ölçüm yapısının gruplar arasında karşılaştırılabilirliğini iki ayrı analizde değerlendirdi. Ana çalışma genel tanısal doğruluğu incelemek için planlandığından, cinsiyete göre yapılan analizleri keşif amaçlı saydılar [1].
Türkiye'den Özalp ve arkadaşlarının 16 Eylül'de yayımlanan ölçek uyarlama çalışması da gruplar karşılaştırılmadan önce ölçümün karşılaştırılabilirliğini sınadı. Örneklem tek bir hastanedeki 411 hemşireden oluşuyordu [5]; bu nedenle sonuçlar doğrudan hasta gruplarına genellenemez. Yine de çalışma, soruların hangi sırayla sorulacağını iyi gösteriyor. Gruplar arasındaki puan farkını yorumlamadan önce, o puanı oluşturan yapının iki grupta karşılaştırılabilir olup olmadığına bakmak gerekir.
Toplam puan farkının arkasındaki soru
Kurmaca bir araştırmada genç ve ileri yaştaki hastalara aynı yorgunluk ölçeği uygulanıyor. “Günlük işlerimi tamamlamakta zorlanıyorum” maddesi, çalışan genç bir hasta ile emekli bir hasta için farklı günlük işleri çağrıştırabilir. Bu örnek, belirli bir ölçeğin ya da yaş grubunun gerçekten böyle davrandığını iddia etmiyor; yalnızca puan farkı için akla gelmesi gereken açıklamaları genişletiyor.
Puanın temsil etmesini istediğimiz özellik, doğrudan gözlenemeyen yorgunluk düzeyidir; madde yanıtları bu özelliğin göstergeleridir. Yorgunluk düzeyi aynı olan iki kişi, ait oldukları gruba göre bir maddeyi farklı yanıtlama eğilimindeyse toplam puanın yorumu da etkilenir. Bu nedenle grup farkını yorumlarken karşılaştırma testinin sonucuyla birlikte ölçeğin iki grupta nasıl çalıştığı da değerlendirilir [3].
Amaçları araştırmanın başında ayırmak bu nedenle önemlidir. Ekip ölçeğin yapısını kendi hasta grubunda doğrulamak, iki grubun ortalama düzeylerini karşılaştırmak ya da ölçek puanının başka bir sonuçla ilişkisini incelemek isteyebilir. Bu hedefler aynı veri setinde bir arada bulunsa da her biri farklı bir kanıt gerektirir.
Araştırma notunda grubun adıyla birlikte nasıl tanımlandığı da yazılabilir; yaş grubu için kullanılan sınırın klinik gerekçesi, hastalık grubu için tanı ölçütü, dil grubu için uygulamanın yapıldığı dil bu notun parçalarıdır. Böylece “iki grup” ifadesi analiz sırasında yeniden şekillenen belirsiz bir sınıflama olmaktan çıkar. Ekip de raporda hangi karşılaştırmayı baştan hedeflediğini, hangisini veriyi gördükten sonra eklediğini ayırt edebilir.
Faktör modeli hangi yapıyı sınar?
Doğrulayıcı faktör analizi, önceden tanımlanmış bir yapının madde yanıtlarıyla ne ölçüde uyuştuğunu inceler. Hangi maddenin hangi faktöre bağlandığı, modelin başlangıç varsayımıdır. Araştırma sorusunu tek bir toplam puanın mı yoksa alt boyut puanlarının mı temsil ettiği de bu yapıya göre değerlendirilir. COSMIN raporlama kılavuzu da ölçeğin sürümünün, hedef hasta grubunun ve incelenen ölçüm özelliğinin açıkça tanımlanmasını öne çıkarıyor [2,3].
Ölçeğin daha önce geçerliliği gösterilmiş olsa da mevcut araştırmadaki uygulamanın ayrıca tanımlanması gerekir. Madde metni değiştiyse, yanıt seçenekleri farklıysa ya da ölçek başka bir hasta grubunda kullanılıyorsa, önceki kanıtın bu uygulamaya ne ölçüde taşınabileceği ayrıca değerlendirilir. Öte yandan her küçük farkın yeni bir ölçek yarattığını varsaymak da doğru olmaz. Hangi değişikliğin neyi etkileyebileceği açıkça yazıldığında kanıtın sınırı da belli olur.
Örneğin model bazı maddeleri ayrı bir alt boyuta bağlarken araştırma sorusu yalnız toplam puanla ilgilenebilir. Bu durumda tek bir uyum indeksine bakmak soruyu çözmez; puanlama kararı ölçeğin kuramsal yapısı ve modelin bulgularıyla birlikte verilir. Modelin neden o biçimde kurulduğu da sonuç raporunda yer alır.
Gruplarda aynı yapı yeterli mi?
Çok gruplu faktör modeli, her grupta aynı yapının bulunup bulunmadığını sınar. Konfigüral düzeyde aynı maddeler her grupta aynı faktörlere bağlanır. Metrik düzeyde buna ek olarak faktör yüklerinin gruplar arasında eşit olduğu varsayılır. Sürekli maddelerle kurulan modelde skaler düzey, bunlara madde sabitlerinin eşitliğini de ekler. Her adım farklı bir karşılaştırmaya zemin hazırlar [4].
Faktör örüntüsünün gruplarda benzer olması, ölçeğin her grupta benzer bir düzenle çalıştığını gösterir. Faktör yüklerinin eşitliğine ilişkin kanıt, faktörün başka değişkenlerle ilişkisini gruplar arasında karşılaştırmayı destekler. Gizil ortalamaları karşılaştırmak ise daha güçlü bir koşul ister. Sürekli maddeli, tek faktörlü bir modelde tam skaler değişmezlik sağlanmışsa ve puanlama modelle uyumluysa, toplam puan ortalamaları arasındaki farkın da gizil ortalamalar arasındaki farkı yansıttığı kabul edilebilir. Kısmi değişmezlikte serbest bırakılan maddeler toplam puana girmeye devam ettiği için bu iki karşılaştırma farklı sonuç verebilir [4]. Bu nedenle değişmezlik düzeyleri, madde türünden ve puanlama kuralından bağımsız olarak karşılaştırmaya izin veren etiketler gibi okunmamalıdır.
Araştırmanın sorusu iki grubun ortalama belirti yüküyse, yalnız konfigüral modelin desteklenmesi yetmeyebilir. Öte yandan bir düzeyde değişmezliğin sağlanamaması, ölçeğin bütünüyle kullanışsız olduğunu göstermez. Hangi maddelerin, hangi kısıtların ve hangi karşılaştırmanın etkilendiğine bakmak daha somut bir değerlendirme sağlar [4].
Konfigüral düzey benzer faktör örüntüsüne, metrik düzey eşit faktör yüklerine, skaler düzey ise bunlara ek olarak eşit madde sabitlerine dayanır. Bu üç düzey sırasıyla yapının, ilişkilerin ve gizil ortalamaların karşılaştırılmasına zemin hazırlar. Sürekli maddeli, tek faktörlü bir modelde tam skaler değişmezlik ve modelle uyumlu puanlama, toplam puan ortalamalarının karşılaştırılmasını da destekler; kısmi değişmezlik bu desteği kendiliğinden sağlamaz.
Bu sıranın araştırma başlamadan istatistiksel analiz planına yazılması, puan farkı görüldükten sonra uygun model arama eğilimini azaltır. Grup tanımı, hedeflenen karşılaştırma ve sınanacak modeller baştan aynı soruya bağlanır; sonradan eklenen seçenekler de planlı analizlerle karıştırılmaz.
Yanıt kategorileri modelin parçası
Likert tipi maddeler sıralı yanıtlardan oluşur. “Hiç”, “bazen” ve “sık” seçenekleri arasındaki geçişleri modellemek, yanıtları eşit aralıklı sürekli değerler gibi ele almaktan farklıdır. Sıralı madde modellerinde eşikler, gözlenen yanıt kategorileri ile altta yatan özellik arasındaki bağı tanımlar. Wu ve Estabrook, bu modellerde tanımlama için konan kısıtların değişmezlik değerlendirmesini etkileyebildiğini gösteriyor [6].
Bu nedenle sürekli maddeler için anlatılan basamakları her sıralı ya da ikili maddeye olduğu gibi uygulamak doğru bir genel kural değildir. Kategori sayısı, modelin nasıl tanımlandığı ve eşiklere konan kısıtlar yöntemin parçasıdır. DESY-PC çalışmasında maddeler evet ya da hayır biçiminde yanıtlanıyordu; yazarlar, modelin tanımlanma koşulları nedeniyle metrik ve skaler değişmezliği ayrı ayrı sınayamadıklarını belirtti [1].
Az kullanılan kategorileri birleştirmek de yalnızca dosyayı sadeleştiren teknik bir karar değildir. Seyrek kullanılan iki yanıtı birleştirmek, farklı deneyimleri aynı kategoride toplamak anlamına gelir. Sıralı modelin eşik parametrelerinin gruplar arasında karşılaştırılabilmesi için, seyreklik yalnız bir grupta görülse bile aynı kategoriler bütün gruplarda birleştirilir; birleştirmenin gerekçesi ve hangi kategorilerin birleştirildiği analiz kaydına yazılır.
Bu değerlendirmeleri yapabilmek için ham madde yanıtlarının, ölçek sürümünün ve grup bilgisinin saklanması gerekir; yalnız toplam puanı içeren bir dosyayla madde düzeyinde model kurulamaz. Anket verisi kodlama ve puanlama yazımız kayıt yapısını ele alıyor; bu yazıda ise o yapının hangi karşılaştırma sorusunu desteklediğine bakıyoruz.
Uygulanan forma ait kısa bir kayıt da veri dosyasını tamamlar. Bu kayıtta hangi yanıtın hangi kategoriye karşılık geldiği, ölçeğin hangi zaman dilimini sorduğu ve puanın hangi kuralla hesaplandığı birlikte bulunabilir. Araştırmacı böylece bir toplam puanın hangi madde yanıtlarından oluştuğuna geri dönebilir; analiz sırasında yapılan bir kodlama değişikliği de ilk kayıtla karşılaştırılabilir. Bu düzen, farklı gruplarda gerçekten aynı uygulamanın değerlendirilip değerlendirilmediğini tartışmayı kolaylaştırır.
Model karşılaştırmasının sınırı
Uyum indeksleri modelin veriye ne kadar uyduğunu özetler; araştırmanın klinik gerekçesinin yerini tutmaz. Putnick ve Bornstein'ın derlemesi, iç içe modeller karşılaştırılırken uyum indekslerindeki değişimi yorumlamak için her koşula uyan tek bir eşik üzerinde uzlaşı bulunmadığını vurguluyor [4]. Bu nedenle tek bir indeksteki küçük değişimi, ölçümün bütün gruplarda eşit olduğunun kanıtı saymak fazla geniş bir sonuç olur.
Grup büyüklükleri, bazı yanıt kategorilerinin seyrekliği ve eksik yanıtların dağılımı analiz dosyası incelenirken birlikte görülür. Bu durumlarda hangi değerlendirmelerin yapılacağını sonuçları görmeden yazmak, sonradan verilen kararları planlı olanlardan ayırmayı sağlar. Örneklemin yeterliliği için evrensel bir sayı vermek yerine, kurulacak modelin gereksinimleri ve her grubun veri yapısı birlikte değerlendirilir.
Bazı maddelerin eşitlik kısıtları serbest bırakıldığında kısmi değişmezlik modeli veriye uyabilir. Bu sonuç, hangi kısıtların serbest bırakıldığı ve bunun kuramsal gerekçesiyle birlikte raporlandığında yorumlanabilir. Kısmi değişmezlik, her toplam puan karşılaştırmasının koşulsuz geçerli olduğunu göstermez [4]. Farklı bir model seçildiğinde yorumun değişip değişmediğine bakmak da araştırmanın sınırlarını gösterir.
Ham madde yanıtları, kategori ve eşik modellerinin kurulabilmesini sağlar. Grup tanımı hangi hasta gruplarının karşılaştırıldığını açıklar. Ölçek sürümü aynı uygulamanın değerlendirilip değerlendirilmediğini gösterir. Hedef yorum ise yapı, ilişki ya da ortalama sorusunu analiz planına bağlar.
Araştırma kararlarını raporda açıkça göstermek
COSMIN'in 2025 tarihli raporlama kılavuzu ve ona eşlik eden açıklama makalesi, ölçüm özelliklerini inceleyen araştırmaların yöntemlerini ve sonuçlarını anlaşılır biçimde raporlamak için bir çerçeve sunuyor; mevzuat düzeyinde bir zorunluluk getirmiyor [2,3]. Araştırmanın amacı yalnız bir ilişkiyi incelemekse, raporun grup ortalamalarını karşılaştırma iddiasına genişlemesi de gerekmez.
İki grupta aynı puan kendiliğinden aynı anlamı taşımaz. Model İstatistik CRO, ölçek validasyonu çalışmalarında kuramsal yapıya uygun faktör modelini, hasta grupları arasındaki karşılaştırma planını ve madde düzeyindeki veri hazırlığını birlikte ele alıyor; analiz birimi ve veri sözlüğü yazımızda anlattığımız kayıt düzeni de bu hazırlığın parçası. Böylece araştırma ekibi gözlenen puan farkını, ölçüm modelinin desteklediği karşılaştırma düzeyiyle birlikte görebiliyor. Bilimsel yorum araştırma ekibinin sorumluluğunda kalıyor.
Kaynaklar
- Schäffler L, Hapfelmeier A, Sterner P, et al. Evaluating gender differences in depression screening: diagnostic accuracy and measurement invariance of the DESY-PC questionnaire in primary care. European Archives of Psychiatry and Clinical Neuroscience. 2026. doi:10.1007/s00406-026-02383-y.
- Gagnier JJ, de Arruda GT, Terwee CB, Mokkink LB; Consensus group. COSMIN reporting guideline for studies on measurement properties of patient-reported outcome measures: version 2.0. Quality of Life Research. 2025;34(7):1901–1911. doi:10.1007/s11136-025-03950-x.
- de Arruda GT, Terwee CB, Elsman EBM, et al. Explanation & Elaboration document of the COSMIN Reporting Guideline 2.0 for studies on measurement properties of patient-reported outcome measures. Quality of Life Research. 2025;34(7):1891–1899. doi:10.1007/s11136-025-03949-4.
- Putnick DL, Bornstein MH. Measurement Invariance Conventions and Reporting: The State of the Art and Future Directions for Psychological Research. Developmental Review. 2016;41:71–90. doi:10.1016/j.dr.2016.06.004.
- Özalp C, Tuncer M, Gerçek A. Turkish Adaptation, Psychometric Validity and Measurement Invariance of the Reasons for Implicit Rationing of the Nursing Care Scale. International Journal of Nursing Practice. 2026. doi:10.1111/ijn.70186.
- Wu H, Estabrook R. Identification of Confirmatory Factor Analysis Models of Different Levels of Invariance for Ordered Categorical Outcomes. Psychometrika. 2016;81(4):1014–1045. doi:10.1007/s11336-016-9506-0.