Kalıtsal kanser sendromlarının genetik danışmanlığında üretken yapay zeka araçlarının bilgi sağlayıcılığı açısından karşılaştırılması
Comparison of generative artificial intelligence tools in terms of information provision in the genetic counseling of hereditary cancer syndromes
- Tez No: 1020367
- Danışmanlar: DOÇ. DR. ÇAĞRI GÜLEÇ
- Tez Türü: Yüksek Lisans
- Konular: Genetik, Onkoloji, Genetics, Oncology
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: Türkçe
- Üniversite: İstanbul Üniversitesi
- Enstitü: Sağlık Bilimleri Enstitüsü
- Ana Bilim Dalı: Tıbbi Genetik Ana Bilim Dalı
- Bilim Dalı: Genetik Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu çalışmada, üretken yapay zeka araçlarının (ÜYZA), kalıtsal kanser sendromları (KKS) bağlamında genetik danışma (GD) oturumlarına hazırlık sürecinde genetik danışmanlara destekleyici bilgi kaynağı olarak sağlayabileceği katkının karşılaştırmalı olarak değerlendirilmesi amaçlandı. Mart 2026 itibarıyla dünyada en çok kullanılan altı ÜYZA, sırasıyla ChatGPT, Gemini, Claude, Grok, DeepSeek ve Copilot, ücretsiz planlarında sunulan en güncel modelleriyle üç ayrı analizde değerlendirildi. İlk aşamada güncel kılavuzlara dayanan 60 açık uçlu soru, ikinci aşamada PubMed'den seçilmiş case report'lardan uyarlanan 60 vaka öyküsü, standart promptlarla ÜYZA'lara yöneltildi. Yanıtlar doktora seviyesinde iki bağımsız genetik uzmanı tarafından skorlandı. Üçüncü aşamada vaka öykülerinden Doc2Hpo yardımıyla türetilen Human Phenotype Ontology (HPO) ID'leri, PubCaseFinder ve ÜYZA'lara verilerek ilk yanıtta doğru final tanıya ulaşılıp ulaşılamadığı ikili değişken olarak kaydedildi. İstatistiksel analizlerde, açık uçlu soru ve vaka öyküsü yanıtlarına ait birleşik skorlar Friedman test ile karşılaştırıldı, ikili karşılaştırmalarda Wilcoxon signed-rank test kullanıldı ve çoklu karşılaştırmalar Holm correction ile düzeltildi. Değerlendiriciler arası uyum kuadratik ağırlıklı Cohen kappa ile incelendi. HPO temelli tanı analizinde araçlar arasındaki genel fark Cochran's Q test ile, PubCaseFinder ile ÜYZA'lar arasındaki ikili karşılaştırmalar ise exact McNemar test ile değerlendirildi. Açık uçlu soru analizinde Gemini ve DeepSeek en yüksek medyan skorlara ulaştı (her ikisi de 8), Grok ve Claude orta düzeyde (medyan 7), Copilot ve ChatGPT en düşük düzeyde (medyan 6) kaldı. ÜYZA'lar arası fark istatistiksel olarak anlamlıydı (Friedman test, chi-square = 252,59, df = 5, p < 0,0001) ve değerlendiriciler arası uyum orta düzeydeydi (kappa = 0,484). Vaka öyküsü analizinde Claude en yüksek skorlarla (medyan 8) belirgin biçimde öne çıktı, Grok ve DeepSeek onu izledi, ChatGPT, Gemini ve Copilot geride kaldı. Bu analizde de ÜYZA'lar arası genel fark istatistiksel olarak anlamlıydı (Friedman test, chi-square = 140,90, df = 5, p < 0,0001), ancak değerlendiriciler arası uyum belirgin biçimde düşüktü (kappa = -0,096). Bu bulgu, vaka temelli yanıtların değerlendirilmesinin daha yoruma açık olduğunu düşündürdü. HPO temelli tanı analizinde en yüksek doğruluk PubCaseFinder'da saptandı (%20). Claude %16,7 ile onu izledi. ChatGPT %10 doğruluk oranına ulaşırken, Copilot, DeepSeek, Grok ve Gemini %10'un altında kaldı. Araçlar arası genel fark anlamlı bulundu (Cochran's Q test, Q = 23,17, df = 6, p = 0,0007), ancak çoklu karşılaştırma düzeltmesi sonrası PubCaseFinder ile hiçbir ÜYZA arasındaki ikili fark anlamlı değildi (Holm-adjusted p > 0,005). Bulgular, tek bir ÜYZA'nın tüm görevlerde üstün olmadığını, performansın görev türüne, yani bilgi sağlama, klinik vaka yorumlama ve ontoloji temelli tanı tahmini düzeylerine göre belirgin biçimde değiştiğini gösterdi. Çalışmanın sınırlı örneklem büyüklüğü, yalnızca ilk yanıtların değerlendirilmesi, ÜYZA'ların hızla güncellenen doğası nedeniyle bulguların ilgili döneme özgü model versiyonlarına ait olması ve gerçek danışan görüşmelerindeki empati, etik ve otonomi boyutlarının kapsam dışı bırakılması başlıca limitasyonlarıdır. ÜYZA'ların genetik danışmanlara güvenilir/verimli şekilde bilgi sağlayabilme potansiyeli yüksektir ancak bu araçlar bağımsız karar vericiler olarak değil, denetim altında kullanılması gereken destekleyici bilgi kaynakları olarak düşünülmelidir.
Özet (Çeviri)
This study aimed to comparatively evaluate the potential contribution of generative artificial intelligence tools (GAI) as supportive information sources for genetic counselors during preparation for genetic counseling (GC) sessions in the context of hereditary cancer syndromes (HCS). As of March 2026, the six most widely used GAI tools worldwide, namely ChatGPT, Gemini, Claude, Grok, DeepSeek, and Copilot, were evaluated across three separate analyses using the latest models available in their free plans. In the first stage, 60 open-ended questions based on current guidelines were submitted to the GAI tools using standardized prompts. In the second stage, 60 case narratives adapted from PubMed-indexed case reports were submitted in the same manner. The responses were scored by two independent doctoral-level genetics specialists. In the third stage, Human Phenotype Ontology (HPO) IDs derived from the case narratives using Doc2HPO were provided to PubCaseFinder and the GAI tools, and whether each tool reached the correct final diagnosis in its first response was recorded as a binary outcome. In the statistical analyses, combined scores from the open-ended question and case narrative responses were compared using the Friedman test. Pairwise comparisons were performed using the Wilcoxon signed-rank test, and multiple comparisons were corrected using the Holm correction. Inter-rater agreement was assessed using quadratic weighted Cohen's kappa. In the HPO-based diagnostic analysis, the overall difference among tools was evaluated using Cochran's Q test, while pairwise comparisons between PubCaseFinder and the GAI tools were assessed using exact McNemar tests. In the open-ended question analysis, Gemini and DeepSeek achieved the highest median scores, both with a median of 8. Grok and Claude showed intermediate performance with a median of 7, whereas Copilot and ChatGPT had the lowest median scores with a median of 6. The difference among GAI tools was statistically significant (Friedman test, chi-square = 252.59, df = 5, p < 0.0001), and inter-rater agreement was moderate (kappa = 0.484). In the case narrative analysis, Claude clearly stood out with the highest scores, reaching a median of 8. Grok and DeepSeek followed Claude, while ChatGPT, Gemini, and Copilot showed lower performance. The overall difference among GAI tools was also statistically significant in this analysis (Friedman test, chi-square = 140.90, df = 5, p < 0.0001), but inter-rater agreement was markedly low (kappa = -0.096). This finding suggested that the evaluation of case-based responses was more open to interpretation. In the HPO-based diagnostic analysis, the highest accuracy was observed for PubCaseFinder (20%). Claude followed with an accuracy of 16.7%. ChatGPT reached an accuracy of 10%, whereas Copilot, DeepSeek, Grok, and Gemini remained below 10%. The overall difference among tools was statistically significant (Cochran's Q test, Q = 23.17, df = 6, p = 0.0007). However, after multiple-comparison correction, no pairwise difference between PubCaseFinder and any GAI tool reached the predefined significance threshold of p < 0.005. Overall, the findings showed that no single GAI tool was superior across all tasks and that performance varied substantially according to task type, namely information provision, clinical case interpretation, and ontology-based diagnostic prediction. The main limitations of this study include the limited sample size, evaluation of only first responses, the fact that the findings reflect the model versions available during the study period due to the rapidly evolving nature of GAI tools, and the exclusion of empathy, ethics, and autonomy-related dimensions of real counseling encounters. GAI tools have high potential to provide reliable and efficient informational support to genetic counselors. However, these tools should not be regarded as independent decision-makers, but rather as supportive information resources that require expert supervision.
Benzer Tezler
- Variant detection in inflammatory diseases
İnflamatuvar hastalıklarda varyant belirlenmesi
GİZEM ALKURT
Doktora
İngilizce
2024
Biyolojiİstanbul Teknik ÜniversitesiMoleküler Biyoloji-Genetik ve Biyoteknoloji Ana Bilim Dalı (disiplinlerarası)
PROF. DR. GİZEM DİNLER DOĞANAY
- PREMM5 risk modellemesinin Lynch sendromu ön tanılı hastalarda mutasyon saptanmasını öngörmedeki başarısının retrospektif olarak değerlendirilmesi
Retrospective evaluation of the success of PREMM5 risk modeling in predicting mutation detection in patients with Lynch syndrome
ALİ GÜLEN
Tıpta Uzmanlık
Türkçe
2024
GenetikDokuz Eylül ÜniversitesiTıbbi Genetik Ana Bilim Dalı
PROF. DR. AHMET OKAY ÇAĞLAYAN
- 50 yaş altı kolorektal kanserli hastaların klinikopatolojik ve genetik özelliklerinin değerlendirilmesi
Evaluation of clinicopathological and genetic characteristics of colorectal cancer patients under 50 years of age
RIFKI SARICA
Tıpta Uzmanlık
Türkçe
2026
İç HastalıklarıErciyes Üniversitesiİç Hastalıkları Ana Bilim Dalı
PROF. DR. METİN ÖZKAN
- Clinical and molecular collaboration studies: i)comparison of CNV by NGS&MLPA in hereditary breast and ovarian cancer ii)effective covid-19 sampling and storage
Klinik ve molküler işbirliği çalışmaları: i)HBOC kapsamında NGS ve MLPA ile CNV karşılaştırması ii) covıd-19 için etkili örnek toplama ve saklama koşulları
JALE YILDIZ
Doktora
İngilizce
2024
Genetikİstanbul Teknik ÜniversitesiMoleküler Biyoloji-Genetik ve Biyoteknoloji Ana Bilim Dalı (disiplinlerarası)
PROF. DR. GİZEM DİNLER DOĞANAY
- Nörofibromatozis tip1 olgularında NF1 gen mutasyonlarının yeni nesil dizileme teknolojisi ile araştırılması
Investigation of NF1 gene mutations with next generation sequencing technology in neurofibromatosis type1 cases
SHAHRASHOUB SHARIFI