Bir biyobelirteç, hastalarla sağlıklı gönüllüleri iyi ayırabilir; buna rağmen tanıda kullanılacağı poliklinikte aynı başarımı göstermeyebilir. Araştırmanın değeri, testin hangi hastada ve hangi kararı desteklemek için kullanılacağının açık olmasına bağlıdır. Hasta seçimi, referans yöntem, eşik ve doğrulama planı bu amaçtan türetilir.
Biyobelirteç testi hangi klinik karara yardımcı olacak?
STARD 2015, tanısal doğruluk çalışmalarının raporunda bulunması gereken 30 maddelik bir listedir. Listenin 2003'teki ilk sürümünde maddeler, okurun çalışmadaki yanlılık olasılığını ve bulguların uygulanabilirliğini değerlendirebilmesine yardım edecek biçimde seçilmişti; 2015 güncellemesi yanlılık ve değişkenlik kaynaklarına ilişkin yeni kanıtları katıyor. Liste protokol hazırlarken de yararlı olabilir. Maddelerinden biri, testin amaçlanan kullanımının ve klinik rolünün açıklanmasıdır. Amaçlanan kullanım testin hangi amaçla, örneğin tanı, tarama, evreleme, izlem, gözetim ya da prognoz için kullanılacağını anlatır. Klinik rol ise aynı hedef durum için kullanılan öbür testlere göre yeridir; test örneğin bir triyaj basamağı olabilir, mevcut testin yerine geçebilir, ona eklenebilir ya da yeni bir test olarak kullanılabilir.
STARD açıklama belgesine göre bu tanımlar çalışmanın tasarımını ve hedeflenen duyarlılık ile özgüllüğü yönlendirir; uygunluk ölçütleri, katılımcıların nerede aranacağı ve sonuçların nasıl yorumlanacağı da buradan çıkar. Örneğin hastalığı dışlamaya yönelik bir triyaj testinin duyarlılığı, esas olarak tanıyı koymayı amaçlayan bir testin ise özgüllüğü çok yüksek olmalıdır. Pepe ve arkadaşları da genel toplum taramasında yanlış pozitif oranının çok düşük olması gerektiğini yazıyor; aksi hâlde çok sayıda kişi gereksiz ve maliyetli işlemlere yönlendirilir. Califf de yeni tanının ruhsal açıdan yıkıcı olacağı ya da girişimsel bir değerlendirme gerektireceği, yaygınlığı düşük hastalıklarda, örneğin pankreas ya da over kanserinde, biyobelirtecin yanlış pozitif oranının çok düşük olması gerektiğini vurguluyor.
Testin hangi yaklaşımın yerine ya da yanında kullanılacağı, karşılaştırılacak yaklaşımı ve birincil başarım ölçütünü de belirler. Aşağıdaki tablo bunu dört temsili kullanım için gösteriyor.
| Amaçlanan kullanım | Uygun hasta grubu | Karşılaştırılacak mevcut yaklaşım | Birincil başarım ölçütü | İzlenecek sonuç |
|---|---|---|---|---|
| Hastalığı dışlayan triyaj | Belirti nedeniyle değerlendirilen hastalar | Herkesin ileri tetkike yönlendirilmesi | Duyarlılık, negatif prediktif değer | Gözden kaçan tanı, ileri tetkikten kaçınılan hasta |
| Tanıyı koyma | Ön değerlendirmede şüphesi yükselen hastalar | Mevcut tanı koydurucu tetkik | Özgüllük, pozitif prediktif değer | Gereksiz girişim, tedaviye başlama süresi |
| Yüksek riskli kişilerde gözetim | Belirtisi olmayan yüksek riskli kişiler | Düzenli görüntüleme ya da gözetim yapılmaması | Çok düşük yanlış pozitif oranıyla erken evrede duyarlılık | Erken evrede saptama, gereksiz işlem, hastalığa bağlı ölüm |
| Mevcut teste ek | Mevcut test sonucu belirsiz kalan hastalar | Yalnız mevcut test | Yalnız mevcut teste göre doğru sınıflanan hasta oranındaki net değişim | Değişen klinik karar |
Tablo temsili bir örnektir; belirli bir testi anlatmaz ve gerçek bir testin sonucunu göstermez. Duyarlılığı ve özgüllüğü aynı kalsa bile bir test, hastalığın sık görüldüğü bir grupta ve seyrek görüldüğü bir grupta farklı test sonrası olasılıklar verir; bu farkı Fagan nomogramıyla görmek mümkün.
Hasta ve kontrol grupları klinik kullanımı temsil ediyor mu?
STARD açıklama belgesi tanısal doğruluk çalışmalarını iki türe ayırıyor. Tek kapılı çalışmalarda bütün katılımcılar aynı uygunluk ölçütleriyle alınır; çok kapılı ya da olgu-kontrol çalışmalarında hedef durumu olanlar ve olmayanlar için ayrı ölçütler vardır. Belgeye göre ağır olgularla sağlıklı kontroller arasındaki uç karşıtlık, doğruluk tahminlerini şişirebilir. Test ileri evre olguları çoğu zaman daha kolay tanır; hastalığı olmayanlar ne kadar sağlıklıysa yanlış pozitif sonuç da genellikle o kadar seyrek görülür.
Rutjes ve arkadaşlarının 31 meta-analizdeki 487 tanı çalışmasını kapsayan araştırması, tasarım özellikleriyle doğruluk tahminleri arasındaki ilişkiyi inceliyor. Yazarlara göre hastaları ardışık olmayan biçimde alan çalışmalar (göreli tanısal odds oranı [RDOR] 1,5; %95 güven aralığı [GA] 1,0–2,1) ve verileri geriye dönük toplayan çalışmalar (RDOR 1,6; %95 GA 1,1–2,2) anlamlı olarak daha yüksek doğruluk tahmini vermiş. En yüksek nokta tahmini ağır olgularla sağlıklı kontrolleri karşılaştıran çalışmalardan çıkmış (RDOR 4,9; %95 GA 0,6–37,3); yazarlar aralığın genişliğini bu tasarımı kullanan çalışmaların azlığına (2 meta-analizde 5 çalışma) bağlıyor ve meta-analizler arasındaki etki heterojenliğinin büyük olduğunu da belirtiyor. Aralık 1'i kapsadığı için fark istatistiksel olarak anlamlı değil.
Kontrollerin özellikleri olgulardan başka bakımlardan da farklıysa sonuç yalnız hastalığı yansıtmayabilir. Pepe ve arkadaşları, biyobelirteç yaşla değişiyorsa ve olgular kontrollerden yaşlıysa iki grup arasındaki farkın bir kısmının yaş farkından kaynaklanabileceğini; tedavi merkezinde alınan olgu örnekleriyle kan bağış merkezinde sağlıklı kişilerden alınan kontrol örneklerinin de işleme, stres ve ilaç kullanımı bakımından farklı olacağını yazıyor.
Sağlıklı kontrol her aşamada yanlış değildir. Sackett ve Haynes'e göre normal kişilerden oluşan uç bir grubu ağır hastalığı olan bir grupla karşılaştıran erken aşama çalışmalar, testin ideal koşullarda umut verip vermediğini gösterir; bu sonuçtan rutin klinik kullanım iddiası çıkarılmadıkça zarar doğmaz. Yazarların sol ventrikül işlev bozukluğunda B tipi natriüretik peptit (BNP) örneğinde bu iki uç grupta duyarlılık %98, özgüllük %92 bulunmuş; testin rutin klinik uygulamada, hastalıktan şüphelenilen hastalarda sınandığı ayrı bir çalışmada ise duyarlılık %88, özgüllük %34 bulunmuş.
Hastalığı olmayan grup testin kullanılacağı ortamdan seçildiğinde, ayırt edilmesi gereken durumlara sağlıklı gönüllülerden daha çok yaklaşır. Tanı amaçlı kullanımda bu grup benzer bulgulara rağmen başka tanı alan hastalardan, gözetimde ise belirtisi olmayan yüksek riskli kişilerden oluşur.
Referans yöntem ve kör değerlendirme
Araştırmacılar incelenen testin doğruluğunu bir referans yönteme göre ölçer. STARD, referans yöntemi hedef durumun varlığını ya da yokluğunu belirlemek için eldeki en güvenilir yöntem diye tanımlıyor ve hatasız bir referansı altın standart diye ayırıyor. Hedef durum da baştan tanımlanır; örneğin öncül lezyonların hedefe girip girmeyeceği protokolde yazılır. Sackett ve Haynes bağımsız karşılaştırmayı, referans yöntemin test sonucuna bakılmaksızın bütün hastalara uygulanması; kör karşılaştırmayı ise referans yöntemin test sonucunu bilmeden uygulanıp yorumlanması ve bunun tersi diye tanımlıyor. STARD açıklama belgesi, son sınıflama incelenen testin sonucundan etkilenebiliyorsa doğruluk tahminlerinin olduğundan yüksek çıkacağını belirtiyor. Belgeye göre bu raporlama maddesinin vurgusu körlemenin istenir ya da istenmez olması değil; okurların incelenen test ve referans yöntem için körleme bilgisine ihtiyaç duymasıdır.
Referans yöntemin bazı katılımcılara hiç uygulanmaması ya da bazılarına farklı bir referans yöntemin uygulanması da sorun doğurur. Açıklama belgesine göre referans yöntemle eksik doğrulama tanı çalışmalarının %26'sına kadarında görülüyor ve referans yöntem girişimsel olduğunda özellikle yaygın. Rutjes ve arkadaşlarının çalışmasında iki ya da daha fazla referans yöntem kullanan çalışmalar, tek referans kullananlara göre ortalama %60 daha yüksek tanısal odds oranı bildirmiş; yazarlar bu çalışmalarda güven aralıklarının daha geniş olduğunu da belirtiyor. Kısmi doğrulamanın (partial verification) ise tutarlı bir etkisi gösterilememiş; yazarlara göre bunun nedeni etkinin yönünün ve büyüklüğünün öngörülmesinin zor olması olabilir. Negatif sonuçların bir kısmı referans yöntemle değerlendirilmezse duyarlılık yükselme, özgüllük ise düşme eğilimi gösterir ve odds oranı değişmeyebilir.
Eşik değer ne zaman belirlenecek?
Sürekli bir ölçüm için eşik, başarımı en yüksek gösterecek biçimde aynı veriden seçilirse doğruluk tahmini iyimser çıkma eğilimindedir. Önceden tanımlı eşik ile keşifsel eşik ayrımını ROC analizi ve eşik seçimini anlattığımız yazıda ayrıntılı ele aldık; STARD de eşiğin önceden mi belirlendiğinin, keşif amacıyla mı seçildiğinin raporda yazılmasını istiyor. Leeflang ve arkadaşlarının simülasyon çalışmasının özetine göre, gerçek duyarlılık ve özgüllüğün %84 olduğu bir durumda Youden indeksiyle veriden seçilen eşikte 40 kişilik çalışmalarda tahmin yaklaşık %90, 200 kişilik çalışmalarda %86 çıkıyor; yanlılık örneklem büyüdükçe azalıyor.
Sackett ve Haynes aynı mekanizmayı daha önce anlatmıştı. Eşiği serbestçe seçebilen araştırmacının onu eğitim grubunda başarımı en yüksek gösteren yere koyması doğaldır; çalışma aynı eşikle ikinci ve bağımsız bir test grubunda yinelendiğinde testin biraz ya da çok daha kötü çalıştığı görülür. Yazarlara göre umut veren bir testin gerçek doğruluğu, bir ya da daha fazla bağımsız çalışmada değerlendirilene kadar bilinmez.
Eşik, eğitim verisinde önceden seçilen bir özgüllük ya da duyarlılık düzeyini tutturacak biçimde belirlendiğinde, o veride hesaplanan aynı ölçüt yapısı gereği bu düzeye yakın çıkar ve başarımın bağımsız kanıtı sayılmaz. Başarım, eşiğin değiştirilmediği ayrı veride ölçülür.
Pepe ve arkadaşlarına göre birden çok biyobelirteci tek skorda birleştiren çalışmalarda birleştirme kuralı belirleyici (pivotal) değerlendirmeden önce tanımlanmalıdır; skoru geliştirildiği veriyle değerlendirmek aşırı uyum (overfitting) yanlılığına yol açar. Yazarlara göre çapraz doğrulama ya da bootstrap bazen kullanılabilir, ancak bu, skoru geliştirmedeki bütün adımların önceden eksiksiz tanımlanmasını gerektirir ve uygulamada zordur; sınıflama başarımını değerlendirmek için ayrı ve bağımsız bir veri setini gerekli görüyorlar. Biyobelirteçleri öbür değişkenlerle çok değişkenli bir tahmin modelinde birleştiren çalışmalar için STARD, TRIPOD raporlama rehberini gösteriyor; bu modelleri TRIPOD+AI yazımızda anlattık.
Bağımsız hasta grubunda doğrulama
Umut veren bir sonuç, testin kullanılacağı türden hastalarla ikinci bir ortamda yinelendiğinde güç kazanır. Sackett ve Haynes, aynı testin birinci, ikinci ve üçüncü basamakta farklı duyarlılık ve özgüllük gösterebileceğini yazıyor; örneklerinden birinde yanlış pozitif sonuçlu hastaların üst basamağa yönlendirilmesiyle özgüllük %89'dan %16'ya düşmüş.
Araştırmacılar doğrulama çalışmasının büyüklüğünü de amaca göre planlar. STARD açıklama belgesindeki örnekte bir tarama kohortunda 6 mm ve üzeri adenomların yaygınlığının %12, bu lezyonlar için duyarlılığın %80 olması beklenmiş ve duyarlılığı yaklaşık 8 puanlık örnekleme hatası payıyla tahmin etmek için yaklaşık 600 katılımcı planlanmış; örnek güven düzeyini belirtmiyor. Bu durumda 600 kişide beklenen hedef lezyonlu kişi sayısı yaklaşık 72'dir ve duyarlılığın kesinliğini 600 değil, bu yaklaşık 72 kişi belirler. Katılımcılar hedef gruptan ardışık alınıyorsa yaygınlık düştükçe duyarlılığı aynı kesinlikle tahmin etmek için gereken toplam katılımcı sayısı artar. Pepe ve arkadaşları en düşük kabul edilebilir başarımın tasarım aşamasında belirlenmesi gerektiğini yazıyor. Hesabın ayrıntılarını tanı doğruluğu çalışmalarında örneklem büyüklüğünü anlattığımız yazıda ele aldık.
Çalışma tamamlandığında duyarlılık, özgüllük ve prediktif değerler 2×2 tablodan tanısal doğruluk hesaplayıcısıyla hesaplanabilir. Prediktif değerler örneklemdeki yaygınlığa bağlıdır; olgu ve kontrollerin ayrı ölçütlerle alındığı çalışmalarda tablodan okunan değerler testin kullanılacağı gruptakileri göstermez. O gruptaki yaygınlıkla yeniden hesaplanabilirler; ancak bu hesap, olgu-kontrol düzeninde zayıf olabilecek bir varsayıma, duyarlılık ve özgüllüğün o grupta da aynı kaldığı varsayımına dayanır.
Doğru tanı koymak ile hastaya yarar sağlamak
Doğru sınıflama, testin hastaya yarar sağladığını göstermez. Sackett ve Haynes tanı araştırmasındaki son soruyu, testi yapılan hastaların test yapılmayan benzer hastalardan daha iyi sonuç alıp almadığı diye kuruyor; bir testin asıl değeri, sonucunun tetiklediği tanı ve tedavi işlemlerinin ardından gelen sağlık sonuçlarında ölçülür. Belirtisiz hastalığın erken saptanmasında bu soru çoğu zaman ancak incelenen teste, başka bir teste ya da hiç test yapılmamasına rastgele atanan hastaların izlenmesiyle yanıtlanabiliyor.
FDA'nın aktardığına göre FDA ile NIH'in ortak çalışma grubunun hazırladığı BEST (Biomarkers, EndpointS, and other Tools) sözlüğü biyobelirteci normal biyolojik süreçlerin, hastalık süreçlerinin ya da bir maruziyete veya tedavi dâhil bir girişime yanıtın göstergesi olarak ölçülen tanımlı bir özellik diye tanımlıyor. FDA'nın ilaç geliştirmede biyobelirteç nitelendirmesi için 2018'de yayımladığı taslak kılavuz, testin teknik başarımını gösteren analitik doğrulamayı, biyobelirteç ile ilgilenilen sonuç arasındaki ilişkiyi gösteren klinik doğrulamadan ayırıyor; buradaki klinik doğrulama Şekil 2'deki klinik yarar aşamasıyla aynı şey değildir. Kılavuza göre nitelendirme, bir tanı cihazının ya da eşlik eden veya tamamlayıcı bir tanı cihazının klinik kullanım için onayı ya da izni anlamına gelmez; biyobelirteci klinik kullanım için de nitelendirmez. Califf'e göre de gelecekte asıl soru, biyobelirtecin eklediği bilginin klinik kararı değiştirecek kadar büyük olup olmadığı olacak.
16 Eylül 2026'da Nature Medicine'de yayımlanan PANXEON çalışmasında Xu ve arkadaşları, kanda ölçülen bir mikroRNA (miRNA) imzasını ve bu imzayı karbonhidrat antijen 19-9 (CA19-9) ile birleştiren PANXEON skorunu erken evre pankreas duktal adenokarsinomunu (PDAC) saptamak için geliştirdiklerini, doğruladıklarını ve sınadıklarını yazıyor. Makalenin ana metnine erişemediğimiz için aktarımlarımız özet, tablolar ve şekil açıklamalarıyla sınırlı. Makaledeki sağkalım, ölüm ve evre kayması çıktıları da doğru sınıflama ile hasta yararı arasındaki bu ayrım içinde okunur. Şekil 4h açıklaması bu paneli SEER (Surveillance, Epidemiology, and End Results) programından modelleme tahminleri diye tanımlıyor ve sağkalımdaki iyileşmeyi bir öngörü olarak veriyor. Ek Şekil 7, ailesinde PDAC öyküsü olan ya da PDAC'ye kalıtsal yatkınlığı bulunan kişilerin gözetiminde yıllık PANXEON ölçümünü, yıllık görüntülemeyi ve gözetim yapılmamasını bir Markov modeliyle karşılaştırıyor. Ek Şekil 6'daki Monte Carlo simülasyonu ise makalenin deyişiyle varsayımsal bir yüksek riskli tarama kohortunda PANXEON ve CA19-9'un duyarlılık ve özgüllük belirsizlik dağılımlarını girdi olarak kullanıyor ve sınıflama ölçütleri üretiyor. Şekil 4h ile Ek Şekil 7'deki sağkalım, ölüm ve evre kayması çıktıları model tahminleridir ve gözlenmiş hasta sonuçları değildir; Ek Şekil 6'nın sınıflama ölçütleri de varsayımsal bir kohort için üretilmiştir. Yazarlar özetlerinde birleşik biyobelirtecin erken evre PDAC'nin saptanmasında mevcut yaklaşımları tamamlayabileceğini ve büyük ölçekli yeni ileriye dönük çalışmalarla incelenmeye değer olduğunu yazıyor.
Hasta grubunu, referans yöntemi ve birincil ölçütü belirlemek için klinik araştırma tasarımı ve örneklem planlaması birlikte ele alınabilir.
Kullanılan kaynaklar
- Xu C, Mannucci A, Han H, ve ark. Liquid biopsy for early detection of pancreatic ductal adenocarcinoma. Nat Med. 2026. PMID 42749887 · DOI
- Bossuyt PM, Reitsma JB, Bruns DE, ve ark. STARD 2015: an updated list of essential items for reporting diagnostic accuracy studies. BMJ. 2015;351:h5527. PMID 26511519 · DOI
- Cohen JF, Korevaar DA, Altman DG, ve ark. STARD 2015 guidelines for reporting diagnostic accuracy studies: explanation and elaboration. BMJ Open. 2016;6(11):e012799. PMID 28137831 · DOI
- Rutjes AWS, Reitsma JB, Di Nisio M, ve ark. Evidence of bias and variation in diagnostic accuracy studies. CMAJ. 2006;174(4):469-476. PMID 16477057 · DOI
- Leeflang MMG, Moons KGM, Reitsma JB, Zwinderman AH. Bias in sensitivity and specificity caused by data-driven selection of optimal cutoff values: mechanisms, magnitude, and solutions. Clin Chem. 2008;54(4):729-737. PMID 18258670 · DOI
- Sackett DL, Haynes RB. The architecture of diagnostic research. BMJ. 2002;324(7336):539-541. PMID 11872558 · DOI
- Pepe MS, Feng Z, Janes H, Bossuyt PM, Potter JD. Pivotal evaluation of the accuracy of a biomarker used for classification or prediction: standards for study design. J Natl Cancer Inst. 2008;100(20):1432-1438. PMID 18840817 · DOI
- Califf RM. Biomarker definitions and their applications. Exp Biol Med (Maywood). 2018;243(3):213-221. PMID 29405771 · DOI
- U.S. Food and Drug Administration. About Biomarkers and Qualification. Erişim 1 Ekim 2026 · fda.gov
- U.S. Food and Drug Administration. Biomarker Qualification: Evidentiary Framework. Draft Guidance for Industry and FDA Staff. Aralık 2018 · fda.gov