Aynı hastanın kan örneği iki cihazda çalışıldığında sonuçlar birbirine yakın görünebilir. Araştırma ekibi de bu yakınlığa bakarak farklı merkezlerde, farklı cihazlarla ölçülmüş değerleri tek sütunda birleştirmeyi düşünebilir. Oysa iki yöntemin birbirinin yerine kullanılıp kullanılamayacağı, sonuçların birlikte artıp azalmasına bakılarak verilecek bir karar değil. Bir yöntemin diğerinden ne kadar sapabildiği, bu sapmanın hangi ölçüm düzeylerinde belirginleştiği ve hastanın değerlendirmesini değiştirip değiştirmediği ayrı ayrı yanıtlanması gereken sorulardır [2,3].
Beal ve arkadaşlarının 22 Eylül 2026'da yayımlanan araştırması, üst koldan kapiller kan alan bir cihazı venöz örnekleme ve parmak ucundan örneklemeyle karşılaştırdı. Araştırmacılar 43 sağlıklı gönüllüden alınan örneklerde 16 rutin biyokimya ve lipid ölçümünü inceledi. Venöz örneklemeyle yapılan karşılaştırmada 13 ölçüm araştırmacıların önceden belirlediği kabul ölçütlerini karşıladı, üçü karşılamadı. Korelasyon katsayılarının yüksek olması, her analitin bu ölçütleri karşıladığı anlamına gelmedi [1].
Çalışma sağlıklı gönüllülerle sınırlı kaldığı için hastalarda görülen daha geniş ölçüm aralığında uyumun ayrıca gösterilmesi gerekiyor. Ayrıca bütün yazarlar cihazı geliştiren şirketin çalışanlarıydı. Bu sınırlılıklar nedeniyle yayın, tek bir cihaz için genel bir kullanım önerisinden çok, karşılaştırma sorusunun nasıl kurulacağına dair güncel bir örnek olarak okunabilir [1]. Yazının ilerleyen bölümlerindeki sayısal örnek ise yalnızca açıklama amacıyla kuruldu; herhangi bir hastanın ya da çalışmanın verisini temsil etmiyor.
Ölçümün klinik kullanım amacını tanımlamak
İki yöntemin birbirinin yerine geçip geçemeyeceği, ölçümün araştırmada hangi amaçla kullanılacağına bağlı. Amaç farklı merkezlerden gelen başlangıç değerlerini karşılaştırmak, aynı hastada tedavi öncesi ve sonrası değişimi izlemek ya da karar eşiğine yakın tek bir sonucu sınıflandırmak olabilir. Aynı büyüklükteki bir fark, bu üç kullanımda farklı anlam taşır.
Örneğin araştırmacının izlemek istediği değişim küçükse, yöntem değişikliğinden kaynaklanan kayma bu değişimle aynı büyüklüğe ulaşabilir. Hastaları geniş bir değer aralığında kabaca sıralamayı amaçlayan bir araştırmada ise aynı kayma sorun yaratmayabilir. Hedeflenen kullanım baştan yazıldığında, analizin sonunda “uyum iyi” denirken neyin kastedildiği de belli olur. Hangi farkın kabul edilebilir olduğuna istatistiksel analiz tek başına karar vermez; bu sınır klinik gerekçeyle çizilir [3].
Bu hazırlık, istatistiksel analiz planı yazımızda anlattığımız yöntem seçiminin bir parçası. Planda yalnız uygulanacak testin değil, ölçümün araştırmada ne için kullanılacağının da yer alması gerekir. Sonuçlar görüldükten sonra genişletilen bir kabul aralığı, baştaki soruya aynı güvenilirlikle cevap vermez.
Bu karar, ekibin elindeki yazılı bir karşılaştırma notuyla somut hâle gelir. Notta hangi ölçümün hangi sonlanımı oluşturduğu, hangi yöntem değişikliğinin planlandığı ve hangi büyüklükteki farkın yorumu bozacağı yer alabilir. Böylece laboratuvar uzmanı ile klinik araştırmacı aynı kullanım senaryosu üzerinde konuşur ve seçilen kabul aralığının gerekçesi yalnız sonuç tablosunun dipnotunda kalmaz. Ölçüm birden fazla klinik amaçla kullanılacaksa her amacın gerekçesi ayrı yazılır; tek bir sınırın hepsine yeteceği baştan varsayılmaz.
Korelasyon hangi soruyu yanıtlıyor?
Korelasyon, bir yöntemde yüksek çıkan değerlerin diğerinde de yüksek çıkıp çıkmadığını gösterir. Örneklemdeki değerlerin aralığı genişledikçe katsayı yükselme eğilimi gösterir; buna karşın yöntemler arasındaki fark klinik açıdan yine önemli olabilir. Bland ve Altman 1986 tarihli makalelerinde, ilişkiyi ölçen bu katsayının uyumu değerlendirmeye yetmediğini gösterdi [2].
Yöntemlerden birinin bütün sonuçları aşağı yukarı aynı miktarda yüksek ölçtüğü kurmaca bir durumda hastaların sıralaması değişmeyebilir ve korelasyon çok yüksek çıkabilir; yine de yüksek korelasyon, iki yöntemin birbirinin yerine kullanılabileceğini göstermez. İki yöntemin ortalamalarının birbirine yakın çıkması da tek tek ölçümlerin yakın olduğunu göstermez, çünkü pozitif ve negatif farklar ortalamada birbirini götürebilir.
Regresyon, yöntemler arasındaki ilişkiyi ve farkın ölçüm düzeyiyle nasıl değiştiğini incelemek için kullanılır. Uyum değerlendirmesi eşleştirilmiş ölçümlerin farkına bakar. Klinik kabul ise bu farkların araştırma için ne anlama geldiğini sorar. Raporda bu üç değerlendirmenin sonucu tek bir cümleye sıkıştırılmadan ayrı ayrı verildiğinde, okuyucu neyin gösterildiğini daha kolay izler.
Korelasyon birlikte değişimi anlatır. Uyum değerlendirmesi eşleştirilmiş farkın büyüklüğünü ve yayılımını inceler. Klinik kabul, bu farkı araştırmada hedeflenen kullanımla karşılaştırır.
Ortalama fark ile tek ölçümün farkı
Örnekte her eşleştirilmiş ölçüm çifti için B yönteminin sonucundan A yönteminin sonucu çıkarılıyor. Farkların ortalaması, B'nin A'ya göre genel olarak hangi yönde ve ne kadar kaydığını gösterir; İngilizce yazında bu sayı “bias” olarak da geçer. Ortalama fark küçük olsa bile tek bir hastadaki fark çok daha büyük olabilir. Bland–Altman grafiği her farkı iki yöntemin ortalamasına karşı çizer; böylece hem genel kayma hem de farkın ölçüm düzeyiyle değişip değişmediği aynı grafikte görülür [2].
Kurmaca örneğimizde ortalama fark 2 birim, farkların standart sapması 3 birim. Farkların yaklaşık normal dağıldığı, ölçüm çiftlerinin birbirinden bağımsız olduğu, farkların ortalamasının ve yayılımının ölçüm düzeyine göre belirgin biçimde değişmediği basit modelde yüzde 95 uyum sınırları şöyle hesaplanır [2,4].
2 ± 1,96 × 3 = [−3,88; 7,88]
Bu modelde farkların yaklaşık yüzde 95'inin bu aralığa düşmesi beklenir. Normal dağılım varsayımı ham laboratuvar sonuçları için değil, iki yöntem arasındaki farklar için geçerlidir. Yüzde 95, tek bir hastanın farkının bu aralıkta kalacağına dair bir güvence de vermez.
Açıklama amacıyla kabul aralığı eksi 5 ile artı 5 birim seçildiğinde ortalama fark aralığın içinde, üst uyum sınırı ise dışında kalıyor. Bu durumda ortalama kaymanın kabul edilebilir bulunması, tek tek ölçümlerin farkı için yeterli bir güvence sayılmaz. Bu sayılar gerçek bir analitin klinik kabul eşiğini tarif etmiyor.
Kurmaca örnekte ortalama fark 2, farkların standart sapması 3 birimdir. İki artı eksi 1,96 çarpı 3 hesabı eksi 3,88 ile artı 7,88 sınırlarını verir. Kurmaca kabul aralığı eksi 5 ile artı 5 olduğunda ortalama fark aralığın içinde, üst uyum sınırı dışında kalır. Örneklem büyüklüğü verilmediği için sınırların güven aralıkları hesaplanmadı.
Uyum sınırlarının da belirsizliği var
Uyum sınırları örneklemden hesaplanan tahminlerdir; her sınırın güven aralığı, bu tahminin ne kadar kesin olduğunu gösterir. Farkların büyük bölümünü kapsaması beklenen aralık başka, bu aralığın uçlarına ilişkin belirsizlik başkadır. Bland ve Altman 1999 tarihli makalelerinde bu ayrımı ayrıntılı biçimde ele alır [3].
Uyum sınırlarından biri kabul çizgisine yakınsa bu belirsizlik karara katılır. Sınırın güven aralığı kabul çizgisinin iki yanına uzanıyorsa, başka bir örneklemde sonuç değişebilir. Kurmaca örneğimizde örneklem büyüklüğü tanımlamadığımız için güven aralığı hesaplamadık; yalnız nokta tahmininin gösterilmesi belirsizlik olmadığı anlamına gelmez.
Kabul ölçütünü ve istatistiksel belirsizliği ayrı ayrı raporlamak yorumu da sadeleştirir. İstatistiksel ve klinik anlamlılık yazımızda tartıştığımız ayrım burada da geçerli. Araştırmacı kabul edilebilir farkı klinik gerekçesiyle tanımlar; analiz ise gözlenen farkların bu kabul aralığında kalıp kalmadığını değerlendirir.
Ölçüm aralığı ve tekrarlı örnekler
Sağlıklı gönüllülerin dar değer aralığında gözlenen uyum, çok yüksek ya da çok düşük sonuçlarda da aynı uyumun bulunacağını göstermez. Beal ve arkadaşları da bazı analitlerde sağlıklı kişilerdeki dar aralığı bir sınırlılık olarak tartışıyor [1]. Karşılaştırmada hangi ölçüm düzeylerinin gerçekten temsil edildiğine bakmak, sonuçların hangi hastalara genellenebileceğini değerlendirmenin bir parçasıdır.
Farklar ölçüm düzeyi yükseldikçe büyüyorsa tek ve sabit bir uyum aralığı bütün düzeyler için doğru bir özet vermeyebilir. Bu durumda logaritmik dönüşüm ya da farkı ölçüm düzeyine bağlayan bir regresyon modeli daha uygun olabilir; seçim, grafikteki örüntüye ve klinik yoruma göre yapılır [3]. Bu nedenle analizden önce bütün örnekleri kapsayan tek bir katsayı aramak yerine, klinik karar açısından önemli ölçüm düzeylerini tanımlamak daha yararlıdır.
Bir hastadan birden fazla eşleştirilmiş örnek alınıyorsa tasarım da değişir. Aynı kişinin tekrarları yeni ve bağımsız hastalar gibi sayılırsa basit hesap belirsizliği yanlış gösterebilir. Hastanın gerçek değerinin ölçümler arasında değiştiği durum ile aynı değerin yinelenerek ölçüldüğü durum farklı modellerle ele alınır. Bland ve Altman'ın tekrarlı ölçümler üzerine 2007 tarihli makalesi bu iki durumu ayrı ayrı inceliyor [4].
Veri formunda hastanın araştırma kodu, örneğin alındığı zaman, kullanılan yöntem ve tekrar sırası ayrı alanlarda tutulursa bu ayrım veride de korunur. Aynı gün iki cihazda çalışılan tek bir örnek ile farklı günlerde alınmış iki örnek aynı türden bir eşleşme değildir. Analiz birimi ve veri sözlüğü yazımız, her satırın neyi temsil ettiğini araştırmanın başında tanımlamanın yararını ele alıyor.
Veri dosyasında her satırın tek bir eşleştirilmiş örneği göstermesi ekibin kontrolünü kolaylaştırır. Yöntemlerden birinin sonucu eksikse o satırda fark hesaplanamaz; eksik eşleşmelerin analizde nasıl ele alındığı ayrıca açıklanır. Teknik nedenle çalışılamayan örneğin ve ölçüm aralığı dışında kalan sonucun ayrı kodlanması, eşleşmenin neden eksik kaldığını gösterir. Ekip böylece karşılaştırmanın hangi örnekleri gerçekten kapsadığını da açıkça görür. Raporda katılımcı sayısının ve eşleştirilmiş örnek sayısının ayrı ayrı verilmesi, tekrarlı kayıtların analizdeki yerini de anlatır.
Birleştirilecek verinin sınırları
İki merkezde aynı ölçüm biriminin kullanılması, analitik sonuçların karşılaştırılabilir olduğunu tek başına göstermez. Ölçülen büyüklüğün tanımı, yöntemin seçiciliği ve kalibrasyonun izlenebilirliği de belirleyicidir. Badrick ve arkadaşları 2026 tarihli harmonizasyon derlemelerinin özetinde bu laboratuvar bileşenlerini birlikte ele alıyor [5]. Dolayısıyla istatistiksel model, laboratuvarın analitik değerlendirmesinin yerini tutmaz.
Verileri birleştirmeden önce eldeki kanıtı kullanım amacıyla karşılaştırmak, raporun sınırlarını da belli eder. Bu karşılaştırmanın başlangıç noktası, laboratuvar uzmanı ile klinik ekibin hangi farkı hangi kullanım için kabul edilebilir saydığıdır. Model İstatistik CRO, yöntem karşılaştırmasında analiz planının kurulmasına, eşleştirilmiş veri yapısının düzenlenmesine ve tekrarlı ölçümlere uygun istatistiksel analize destek veriyor.
Kaynaklar
- Beal SG, Naranjo A, Torres C, et al. Evaluation of an Upper Arm Capillary Blood Collection Device Compared with Venous and Fingerstick Sampling. The Journal of Applied Laboratory Medicine. 2026;jfag145. doi:10.1093/jalm/jfag145.
- Bland JM, Altman DG. Statistical methods for assessing agreement between two methods of clinical measurement. Lancet. 1986;1(8476):307–310. doi:10.1016/S0140-6736(86)90837-8.
- Bland JM, Altman DG. Measuring agreement in method comparison studies. Statistical Methods in Medical Research. 1999;8(2):135–160. doi:10.1177/096228029900800204.
- Bland JM, Altman DG. Agreement between methods of measurement with multiple observations per individual. Journal of Biopharmaceutical Statistics. 2007;17(4):571–582. doi:10.1080/10543400701329422.
- Badrick T, Beasley-Green A, Cobbaert CM, et al. Result harmonization in medical laboratories: accomplishments and challenges. Clinical Chemistry and Laboratory Medicine. 2026;64(6):1201–1209. doi:10.1515/cclm-2026-0323.