Yapay zekâ destekli bir uygulamanın soruları doğru yanıtlaması, hastanın ya da bakım verenin daha iyi bir karar verdiğini, bu kararı uyguladığını ya da sağlık sonucunun düzeldiğini tek başına göstermez.
JAMA Network Open'da 21 Eylül 2026'da yayımlanan bir randomize klinik çalışma, bilgi düzeyini birincil, aşı yaptırma kararını ikincil sonlanım olarak ölçtü; aşağıda bu çalışmanın sonlanımlarını yazarların tanımlarıyla aktarıyoruz.
HPV aşısı sohbet botu çalışmasında neler ölçüldü?
Kobayashi ve arkadaşları, Japonya'da 12–18 yaşında aşısız kızı olan 848 kadın bakım vereni ulusal bir araştırma paneli üzerinden çalışmaya aldı ve 1:1 oranında GPT-4o tabanlı bir HPV aşısı sohbet botuna (chatbot) ya da Japonya Sağlık, Çalışma ve Refah Bakanlığının herkese açık HPV aşısı broşürüne randomize etti. Yazarlara göre broşür Japonya'daki güncel standart bilgilendirmeyi yansıtıyordu; iki gruptaki katılımcıların da devam etmeden önce atandıkları materyalde en az 5 dakika geçirmesi zorunluydu. Bizim okumamızla bu düzende yanıtlanan soru, sohbet botunun bilgi verilmemesine göre değil, resmî yazılı bilgilendirmeye göre ne kattığıdır.
Birincil sonlanım, makalede HPV aşısı okuryazarlığı diye adlandırılan ve yedi olgusal soruyla 0–7 puan arasında ölçülen bilgi düzeyiydi; müdahaleden hemen sonra ve 2. haftada değerlendirildi. İkincil sonlanım olan aşı yaptırma kararı, 2. haftada aşı yaptırma isteğini soran maddeye "istekliyim" ya da "çok istekliyim" yanıtı verilmesi olarak tanımlandı. Yazarlara göre bilgi puanı olgusal bilgiyi ölçüyordu; aşı yaptırmaya karar vermek ise bakım verenin bilgiyi kızı için kişisel bir karara uygulamasını gerektiriyordu. Aşağıdaki tabloda makaledeki bilgileri kendi düzenimizle özetledik.
| Sonlanım | Ölçüm aracı | Değerlendirme zamanı | Veri kaynağı | Analize giren katılımcı |
|---|---|---|---|---|
| Bilgi düzeyi (birincil) | Yedi olgusal soru, 0–7 puan | Müdahaleden hemen sonra ve 2. hafta | Çevrim içi anket | Japonya'da yaşayan 841 randomize katılımcının 704'ü (hemen sonra) ve 477'si (2. hafta) |
| Aşı yaptırma kararı (ikincil) | Aşı yaptırma isteği maddesi; "istekliyim" ve "çok istekliyim" karar sayıldı | Gruplar arası karşılaştırma 2. haftada; başlangıçta ve müdahaleden hemen sonra da soruldu | Çevrim içi anket (öz bildirim) | Başlangıç ve 2. hafta karar verisi bulunan 513 katılımcı (sohbet botu 253, broşür 260) |
Randomize edilen 848 kişiden yedisi, ikameti Japonya dışı ya da başka bir kategoride sınıflandırıldığı için birincil analizlerin dışında kaldı.
Bilgi düzeyi sohbet botu grubunda müdahaleden hemen sonra da 2. haftada da daha yüksek bulundu; başlangıç puanı ve önceden belirlenen değişkenlerle ayarlanmış ortalama fark iki değerlendirmede de 0,30 puandı (%95 güven aralığı [GA] hemen sonra 0,18–0,43, 2. haftada 0,13–0,47). Ham sayılara göre 2. haftada karar tanımını sohbet botu grubunda 253 bakım verenin 102'si (%40,3), broşür grubunda 260 bakım verenin 103'ü (%39,6) karşıladı. Başlangıçtaki karar, başlangıç bilgi puanı ve önceden belirlenen değişkenlerle ayarlandıktan sonra sohbet botu grubunu broşür grubuyla karşılaştıran odds oranı 0,74'tü (%95 GA 0,41–1,33) ve fark anlamlı değildi. Yazarların keşif amaçlı analizinde bilgi puanındaki değişim aşı yaptırma kararıyla anlamlı bir ilişki göstermedi; yazarlar bu analizin gözlemsel olduğunu ve nedensel yorumlanamayacağını belirtiyor.
Yazarlar aşı yaptırma kararının öz bildirime dayandığını, yalnız iki haftalık bir süre içinde değerlendirildiğini ve gerçekleşen aşılanmayla doğrulanmadığını sınırlılık olarak yazıyor; doğrulanmış aşılanmanın daha uzun süreli çalışmalarda değerlendirilmesini öneriyorlar. Gözlenen etkiyi de aşı kararı verme sürecine kapsamlı bir çözüm olarak değil, ek bir eğitim kazanımı olarak yorumluyorlar.
Örneklem hesabı bilgi düzeyine göre yapıldı ve %40 izlem kaybı varsayımıyla hedef 844 katılımcı oldu. Yazarlara göre çalışmanın gücü bilgi düzeyi için hesaplandığından karardaki küçük etkiler saptanamamış olabilir. Bizim okumamızla karar sonucunun güven aralığı geniştir; belirgin bir azalmayı da daha sınırlı bir artışı da dışlamıyor. Bu yüzden sonuç, iki haftalık izlemde gruplar arasında anlamlı bir fark gösterilemediği biçiminde okunur; sohbet botunun karar üzerinde etkisiz olduğu ya da broşürle eşdeğer olduğu sonucu çıkmaz. Eşdeğerliğin hangi tasarımla gösterildiğini iki tedavinin eşdeğerliğini anlattığımız yazıda ele aldık.
Sohbet botu grubuna atanan 424 katılımcının 176'sı (%41,5) sohbet botunun arka uç kayıtlarıyla eşleşti; yazarlar sohbet botu kullanımının yalnız anket ve sohbet botu kayıtları eşleşen katılımcılarda doğrulanabildiğini yazıyor. Protokole uygun analiz, kayıtları eşleşen kullanıcıları ilgili değerlendirmenin birincil analizine giren broşür grubu katılımcılarıyla karşılaştırdı. Yazarlar kayıt eşleşmesi randomizasyondan sonra yapıldığı için bu analizi keşif amaçlı saydı ve tahminlerin randomizasyon sonrası seçilimden etkilenmiş olabileceğini belirtiyor. Çevrim içi ortamda dikkatin tam olarak doğrulanamadığını ve broşür grubunda içerik düzeyinde kullanım verisi bulunmadığını da sınırlılık olarak yazıyorlar.
Birincil analiz, Japonya'da yaşayan, başlangıç bilgi puanı ve ilgili değerlendirmedeki sonlanım ölçümü bulunan randomize katılımcıları atandıkları grupta ele aldı. Yazarlar ters olasılık ağırlıklandırmalı ve tekrarlı ölçümlü duyarlılık analizlerinin birincil sonuçlarla genel olarak tutarlı olduğunu yazıyor. Yine de 2. haftadaki bilgi düzeyi analizinin Japonya'da yaşayan 841 randomize katılımcının 477'sini içerdiğini, bunun kesinliği sınırladığını ve izlemin tamamlanması ölçülmemiş etkenlere bağlıysa kalıntı izlem kaybı yanlılığının dışlanamayacağını belirtiyorlar.
Uygulama kimin hangi kararını değiştirecek?
CONSORT-AI, yapay zekâ bileşeni içeren müdahaleleri değerlendiren randomize çalışmaların raporlanması için CONSORT 2010'a eklenen bir uzantıdır. Uzantı, müdahalenin klinik bakım sürecindeki amaçlanan kullanımının, amacı ve hedef kullanıcılarıyla birlikte açıklanmasını istiyor; kullanıcılar örneğin sağlık çalışanları, hastalar ya da halk olabilir. Kullanıcının ve değişmesi beklenen kararın baştan adlandırılması bizce hangi sonlanımın ölçüleceğini belirlemeye yardım eder.
Yapay zekâ tabanlı karar destek sistemlerinin erken klinik değerlendirmesinin raporlanması için 2022'de yayımlanan DECIDE-AI rehberine göre giderek artan sayıda yapay zekâ tabanlı klinik karar destek sistemi, klinik öncesi, bilgisayar ortamındaki (in silico) değerlendirmelerde umut verici başarım gösteriyordu; ama hasta bakımına gerçek yarar sağladığını gösterebilmiş olanlar henüz azdı. Bizce modelin yanıtlarını klinik senaryolarla puanlayan masa başı çalışmalar başka bir soruya yanıt verir; bu tasarımı klinik senaryolarla yapay zekâ araştırmasını anlattığımız yazıda ele aldık.
Bilgi, karar, davranış ve sağlık sonucu ayrı sonlanımlardır
Bilgi düzeyindeki bir artış, kişinin farklı bir karar verdiğini; verilen bir karar da davranışın gerçekleştiğini ya da sağlık sonucunun düzeldiğini kendiliğinden göstermez. Her sonlanım için ölçüm aracı, değerlendirme zamanı ve veri kaynağı ayrıca belirlenir.
Çin'de ortaokul çağındaki kızların ebeveynleriyle yapılmış küme randomize bir sohbet botu çalışmasında (Hou ve arkadaşları, 2025) birincil sonlanım, iki haftalık müdahale döneminde kızın HPV aşısı olması ya da aşı için randevu alınmasıydı. Yazarlar aşılanmayı resmî aşı kayıtlarıyla doğruladı; ortak bir randevu sistemi bulunmadığı için randevuyu müdahale sonrası anketle ölçtü.
Randomize çalışma raporlarında vekil sonlanımların raporlanması için hazırlanan CONSORT-Surrogate uzantısı, vekil sonlanımı, hastanın nasıl hissettiğini, işlevini ya da sağkalımını doğrudan ölçen bir sonlanımın yerine kullanılan ve epidemiyolojik, tedaviye ilişkin, patofizyolojik ya da başka bilimsel kanıtlara dayanarak klinik yarar ya da zarar üzerindeki etkiyi öngörmesi beklenen sonlanım diye tanımlıyor. Uzantıya göre geçerleme, müdahalenin vekil sonlanım üzerindeki etkisinin hedef sonuç üzerindeki etkisini öngörüp öngörmediğinin belirlenmesidir. Bu tanım klinik sonlanımların yerine kullanılan ölçümler için yazılmıştır; bilgi düzeyi gibi klinik olmayan ölçümlere ancak benzetme yoluyla uygulanabilir. Yine de aynı mantıkla, bilgi düzeyindeki bir etki davranış ya da sağlık sonucu üzerindeki etkiyi kendiliğinden göstermez.
Karşılaştırma grubunda ne yapılacak?
Karşılaştırma grubu, araştırmanın hangi soruya yanıt verdiğini belirler. Sohbet botunu hiçbir bilgilendirme almayan bir grupla, standart yazılı bilgilendirmeyle ya da olağan bakımla karşılaştırmak farklı soruları yanıtlar.
CONSORT-AI, karşılaştırma koşulunun ürettiği bilginin de müdahaledeki gibi anlatılmasını ve ilgili olduğunda bu bilginin hasta yönetimine ilişkin klinik kararlara varmak için nasıl kullanıldığının açıklanmasını istiyor. Randomize çalışmaların raporlanması için hazırlanan CONSORT 2025 kontrol listesine de müdahalenin ve karşılaştırma koşulunun fiilen nasıl uygulandığını soran yeni bir madde eklendi; CONSORT 2025 açıklama belgesine göre madde, uygun olduğunda örneğin uygulamayı kimin yaptığının, katılımcıların uyup uymadığının ve planlandığı gibi uygulanıp uygulanmadığının yazılmasını istiyor.
Karşılaştırma grubu her aşamada gerekmeyebilir. DECIDE-AI'ın tartışma bölümüne göre bu tür gruplar gelecekteki büyük ölçekli denemelerin tasarımı için yararlı bilgi verebilir; ama karşılaştırmalı etkililiğin dışındaki konulara odaklanılan erken klinik değerlendirme aşamasında çoğu zaman gereksizdir ve küçük ölçekli çalışmalar etkililik hakkında istatistiksel olarak anlamlı sonuca varmaya genellikle yetecek güçte değildir.
Birincil sonlanım ve değerlendirme zamanı
CONSORT 2025 açıklama belgesi, önceden belirlenmiş birincil ve ikincil sonlanımların her biri için ölçülen değişkenin, analiz ölçüsünün (örneğin başlangıca göre değişim, son değer ya da olaya kadar geçen süre), özetleme yönteminin ve değerlendirme zamanının raporlanmasını istiyor. Belgeye göre birincil sonlanım, ilgili paydaşlar için en önemli sayılan, önceden belirlenmiş sonlanımdır ve örneklem hesabında da bu sonlanım kullanılmalıdır.
Değerlendirme zamanı da sonlanımın parçasıdır. Bilgi düzeyi müdahaleden hemen sonra ölçülebilir; bir davranışın gerçekleşmesi ise daha uzun süre gerektirebilir. Davranışı hedefleyen bir çalışmada izlem süresi bu yüzden davranışın gerçekleşmesi için gereken zamana göre planlanır.
Uygulamayı kullanmayanlar ve izlemden çıkanlar
Klinik denemelerde hedeflenen etkiyi (estimand) tanımlayan ICH E9(R1), ara olayı tedavi başladıktan sonra gerçekleşen ve ilgilenilen klinik soruyla ilişkili ölçümlerin yorumunu ya da varlığını etkileyen olay diye tanımlıyor. Kılavuz, randomizasyonla atanan tedaviyi bırakmayı hedeflenen etkinin tanımında ele alınan bir ara olay, çalışmadan çekilmeyi ise istatistiksel analizde ele alınan eksik veri kaynağı olarak birbirinden ayırıyor. E9(R1) ilaç geliştirme ve ruhsatlandırma bağlamında yazılmıştır; ilkelerinin etkililik ya da güvenlilikle ilgili bir tedavi etkisinin tahmin edildiği ya da sınandığı her durumla ilgili olduğunu belirtiyor. Bu ayrımı bir sohbet botu çalışmasına taşımak bizim okumamızdır. Bu okumayla uygulamayı erken bırakmak bir ara olay olarak düşünülebilir; uygulamayı hiç açmamanın bu tanıma nasıl gireceği, tedavinin ne zaman başlamış sayıldığına bağlıdır. E9(R1)'in sözlüğüne göre eksik veri ise belirli bir hedeflenen etkinin analizi için anlamlı olacak ama toplanmamış veridir.
Ara olaya hangi stratejiyle yaklaşılacağı araştırma sorusuna bağlıdır. Tedavi politikası stratejisinde ara olay, hedeflenen etkinin tanımında dikkate alınmaz ve sonlanım değeri ara olay gerçekleşse de gerçekleşmese de kullanılır. Kılavuz, her iki kolda aynı ara olayı yaşayan alt grupların birbiriyle karşılaştırılmasının tedavilerin etkisini bu alt gruplardaki kişilerin farklı özelliklerinden kaynaklanabilecek sonuç farklarıyla karıştırdığını yazıyor. Bizim okumamızla müdahale kolunda yalnız müdahaleyi gerçekten alanları karşılaştırma kolunun tamamıyla karşılaştırmak da benzer bir sorun doğurabilir.
E9(R1)'e göre verinin neden eksik kaldığına ilişkin bilgilerin önceden planlanarak toplanması, ara olayları eksik veriden ayırmaya yardım edebilir; kılavuzun örneğinde "izlemden çıktı" kaydı daha doğru biçimde "etkisizlik nedeniyle tedaviyi bıraktı" diye tutulabilir. Kılavuz, ana analizin dayandığı istatistiksel varsayımların belgelenmesini ve ana tahminin bu varsayımlardan sapmalara karşı sağlam olup olmadığının aynı hedeflenen etkiye odaklanan, önceden belirlenmiş duyarlılık analizleriyle incelenmesini istiyor.
CONSORT 2025 açıklama belgesine göre randomizasyonun yararlarını korumak için randomize edilen bütün katılımcılar analize alınır ve atandıkları grupta tutulur; bu iki koşul tedavi niyetine göre (ITT) analizi tanımlar ve belge bu analizi yaygın olarak önerilen yaklaşım sayıyor. Sonlanımı gözlenmeyen katılımcılar analizden çıkarıldığında analiz artık tam anlamıyla bu tanıma uymaz; izlemden çıkma katılımcının tedaviye yanıtıyla ilişkiliyse güç kaybının yanında yanlılık da doğabilir. Belge izlemden çıkmanın sıklığı ya da nedenleri gruplar arasında farklıysa kaygı doğabileceğini belirtiyor; eksik veri mekanizmasına ilişkin varsayımların, eksik veri duyarlılık analizlerinin ve her koldaki eksik veri nedenlerinin raporlanmasını istiyor. Yaklaşım seçeneklerini eksik veri analizi yöntemlerini anlattığımız yazıda ele aldık.
Birincil sonlanım, değerlendirme zamanı ve izlem kayıplarına yaklaşım istatistiksel analiz planında araştırmanın amacıyla birlikte tanımlanabilir; planın bölümlerini istatistiksel analiz planını anlattığımız yazıda ele aldık.
Etki büyüklüğü ve belirsizlik birlikte raporlanır
CONSORT 2025 açıklama belgesi, her sonlanım için grup sonuçlarının, tahmin edilen etki büyüklüğünün ve bu tahminin kesinliğinin (örneğin %95 güven aralığı) verilmesini; ikili sonlanımlarda göreli etkinin yanında mutlak etkinin de raporlanmasını istiyor. Belgeye göre güven aralıkları özellikle anlamlı çıkmayan farklarda değerlidir, çünkü böyle bir sonucun önemli bir klinik farkı çoğu zaman dışlamadığını gösterir. Belge istatistiksel anlamlılık ile klinik önemin farkını akılda tutmayı ve anlamlı çıkmayan bir sonucu müdahalelerin eşdeğerliği diye yorumlamaktan özellikle kaçınmayı öğütlüyor.
Zararlar ve yapay zekâ hataları
CONSORT 2025 açıklama belgesi, sistematik olarak değerlendirilen zararları kendiliğinden yapılan bildirimlere dayanan zararlardan ayırıyor. Belge sistematik olarak değerlendirilen her zarar için tanımın, ölçüm aracının, değerlendirme zamanlarının ve kayıt süresinin; sistematik olarak değerlendirilmeyen zararlar için veri toplama biçiminin, zamanının ve kayıt süresinin raporlanmasını istiyor. Belgeye göre sistematik olarak değerlendirilen zararlar hiç olay görülmese de raporlanmalıdır.
CONSORT-AI, uygun olduğunda performans hatalarına ilişkin analizlerin sonuçlarını ve hataların nasıl saptandığını raporlamayı, böyle bir analiz planlanmadıysa ya da yapılmadıysa gerekçesini açıklamayı istiyor. DECIDE-AI de çalışma sırasında saptanan hasta güvenliği risklerinin ve dolaylı zarar dâhil gözlenen zarar örneklerinin raporlanmasını öneriyor.
Kullanılan kaynaklar
- Kobayashi K, Wu Z, Tomoi H, Masuda K, Larson HJ, Leung K, Wu JT, Lin L. AI chatbot use for human papillomavirus vaccine literacy in Japan: a randomized clinical trial. JAMA Netw Open. 2026;9(9):e2634696. PMID 42804696 · DOI
- International Council for Harmonisation. ICH E9(R1): Addendum on estimands and sensitivity analysis in clinical trials to the guideline on statistical principles for clinical trials. Step 4, 20 Kasım 2019 · ich.org
- Liu X, Cruz Rivera S, Moher D, Calvert MJ, Denniston AK; SPIRIT-AI and CONSORT-AI Working Group. Reporting guidelines for clinical trial reports for interventions involving artificial intelligence: the CONSORT-AI extension. BMJ. 2020;370:m3164. PMID 32909959 · DOI
- Vasey B, Nagendran M, Campbell B, ve ark. Reporting guideline for the early stage clinical evaluation of decision support systems driven by artificial intelligence: DECIDE-AI. BMJ. 2022;377:e070904. PMID 35584845 · DOI
- Hopewell S, Chan AW, Collins GS, ve ark. CONSORT 2025 explanation and elaboration: updated guideline for reporting randomised trials. BMJ. 2025;389:e081124. PMID 40228832 · DOI
- Manyara AM, Davies P, Stewart D, ve ark. Reporting of surrogate endpoints in randomised controlled trial reports (CONSORT-Surrogate): extension checklist with explanation and elaboration. BMJ. 2024;386:e078524. PMID 38981645 · DOI
- Hou Z, Wu Z, Qu Z, ve ark. A vaccine chatbot intervention for parents to improve HPV vaccination uptake among middle school girls: a cluster randomized trial. Nat Med. 2025;31(6):1855-1862. PMID 40195450 · DOI