Geri Dön

Farklı yapay zeka uygulamalarının MRONJ (ilaç kullanımına bağlı çene osteonekrozu) ile ilgili soruları cevaplamada doğruluk ve kalite açısından değerlendirilmesi

Evaluation of the accuracy and quality of different artificial intelligence applications in answering questions on MRONJ (Medication-Related Osteonecrosis of the Jaw)

  1. Tez No: 1002405
  2. Yazar: TUĞBA AKÇAY
  3. Danışmanlar: PROF. DR. BANU ÖZVERİ KOYUNCU
  4. Tez Türü: Diş Hekimliği Uzmanlık
  5. Konular: Diş Hekimliği, Dentistry
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: Türkçe
  9. Üniversite: Ege Üniversitesi
  10. Enstitü: Diş Hekimliği Fakültesi
  11. Ana Bilim Dalı: Ağız, Diş ve Çene Cerrahisi Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Amaç: Bu çalışmanın temel amacı, ilaç kullanımına bağlı çene osteonekrozu ile ilgili genel bilgiler , tanı, tedavi, önleme ve vaka temelli sorulara verilen yanıtlar üzerinden, üç farklı yapay zekâ uygulamasının (ChatGPT, Claude ve Google Gemini) iki uzman tarafından doğruluk ve kalite açısından değerlendirilmesidir. İkincil amacı ise uzmanlara ait değerlendirme skorları ile uzmanlık eğitimini almakta olan araştırma görevlilerinin değerlendirme skorları karşılaştırılarak iki farklı eğitim düzeyine sahip kullanıcıların, yapay zeka yanıtlarını algılama farklılıklarını değerlendirmektir. Gereç ve Yöntem: Bu çalışma, Ege Üniversitesi Bilimsel Araştırmalar ve Yayın Etiği Kurulu onayı alınarak yürütülmüştür. MRONJ ile ilgili güncel uluslararası rehberler temel alınarak 35 soru çalışmaya dahil edilmiştir. Sorular; MRONJ ile ilgili genel bilgiler, tanı, tedavi, önleme ve vaka temelli olacak şekilde gruplandırılmıştır. Sorular, ChatGPT, Claude ve Google Gemini'nin en güncel sürümlerine her seferinde ayrı sohbet oturumlarında yöneltilmiştir. Sorular Türkçe olarak sorulmuş ve yanıtlar Türkçe olarak kaydedilmiştir. Yanıtların doğruluğu, 5'li Likert tipi doğruluk ölçeği kullanılarak; kalite değerlendirmesi ise modifiye Küresel Kalite Ölçeği (GQS) ile yapılmıştır. Değerlendirmeler, alanında 7 yıl ve üzerinde deneyimi olan iki Ağız Diş ve Çene Cerrahisi uzmanı (iç değerlendirici) ile beş araştırma görevlisi (dış değerlendirici) tarafından gerçekleştirilmiştir. İstatistiksel analizlerde Gwet'in AC2 katsayısı, Spearman sıra korelasyonu, Friedman ve Dunn testleri kullanılmıştır. İstatistiksel anlamlılık düzeyi p<0.05 olarak kabul edilmiştir. Çoklu karşılaştırmalarda hata riskini azaltmak amacıyla Bonferroni düzeltmesi uygulanmıştır. Bulgular: Çalışmanın sonuçlarına göre doğruluk açısından yapılan istatistiksel analizler sonucunda ChatGPT'nin Gemini'ye kıyasla doğruluk performansının istatistiksel olarak anlamlı düzeyde daha yüksek olduğu saptanmışır(p<0.001). ChatGPT ile Claude arasında istatistiksel olarak anlamlı bir fark bulunmamakla birlikte, ChatGPT'nin doğruluk performansının daha yüksek olduğu belirlenmiştir. Claude ile Gemini karşılaştırıldığında ise, anlamlı olmamakla birlikte, Claude'un doğruluk performansının Gemini'den daha yüksek olduğu görülmüştür. Kalite açısından yapılan istatistiksel analizler sonucunda ise ChatGPT'nin yanıtlarına ait kalite puanlarının Gemini'ye kıyasla istatistiksel olarak anlamlı derecede daha yüksek olduğu belirlenmiştir. ChatGPT-Claude, Gemini-Claude arasında yanıt kalitesi bakımından istatistiksel olarak anlamlı bir fark bulunmamıştır. Araştırma görevlilerinin değerlendirme skorlarına göre; doğruluk boyutunda uygulamalar arasında anlamlı fark bulunmazken, kalite boyutunda ChatGPT'nin Gemini'ye göre anlamlı derecede yüksek olarak puanlandığı görülmüştür. Farklı eğitim düzeyine sahip değerlendiriciler arasındaki uyum incelendiğinde, özellikle Gemini uygulamasında diğer uygulamalara kıyasla istatistiksel olarak daha yüksek bulunmuştur Sonuç: Bu çalışma, ChatGPT'nin doğruluk ve yanıt kalitesi açısından Google Gemini'ye göre istatistiksel olarak anlamlı biçimde üstün olduğunu; Claude ile karşılaştırıldığında ise anlamlı fark olmamakla birlikte daha yüksek performans sergilediğini göstermektedir. Değerlendirici deneyimi, yapay zekâ yanıtlarının yorumlanmasında belirleyici bir faktördür. Bulgular, yapay zekâ uygulamalarının MRONJ alanında tek başına klinik karar aracı olarak uygun olmadığını; ancak uzman denetimi ve literatür desteğiyle eğitim ve bilgi edinmede yararlı olabileceğini ortaya koymaktadır. Anahtar Kelimeler; çene osteonekrozu; ilaç kullanımına bağlı çene osteonekrozu (MRONJ); yapay zekâ, ChatGPT, Google Gemini, Claude

Özet (Çeviri)

Objective: The primary objective of this study was to evaluate the accuracy and quality of responses given to questions related to medication-related osteonecrosis of the jaw, including general information, diagnosis, treatment, prevention, and case-based scenarios, by three different artificial intelligence applications (ChatGPT, Claude, and Google Gemini), as assessed by two experts. The secondary objective was to compare the evaluation scores of experts with those of research assistants undergoing specialty training, in order to assess differences in the perception of artificial intelligence responses between users with different levels of education and clinical experience. Materials and Methods: This study was conducted with the approval of the Ege University Scientific Research and Publication Ethics Committee. A total of 35 questions were included in the study based on current international guidelines related to MRONJ. The questions were grouped into general information, diagnosis, treatment, prevention, and case-based categories. The questions were directed to the most up-to-date versions of ChatGPT, Claude, and Google Gemini in separate chat sessions each time. All questions were asked in Turkish, and the responses were recorded in Turkish. The accuracy of the responses was evaluated using a 5-point Likert-type accuracy scale, while quality was assessed using a modified Global Quality Scale (GQS). Evaluations were performed by two oral and maxillofacial surgeons with at least seven years of experience (internal evaluators) and five research assistants (external evaluators). Statistical analyses included Gwet's AC2 coefficient, Spearman rank correlation, Friedman test, and Dunn test. The level of statistical significance was set at p<0.05. Bonferroni correction was applied to reduce the risk of error in multiple comparisons. Results: According to the results of the study, statistical analyses performed in terms of accuracy demonstrated that ChatGPT showed a statistically significantly higher accuracy performance compared to Gemini (p<0.001). Although no statistically significant difference was found between ChatGPT and Claude, ChatGPT demonstrated higher accuracy performance. When Claude and Google Gemini were compared, Claude showed higher accuracy performance than Gemini, although the difference was not statistically significant. In terms of quality, statistical analyses revealed that the quality scores of responses generated by ChatGPT were statistically significantly higher than those of Google Gemini. No statistically significant differences were found between ChatGPT and Claude or between Google Gemini and Claude with respect to response quality. According to the evaluation scores of research assistants, no significant differences were observed among the applications in terms of accuracy; however, in the quality dimension, ChatGPT was rated significantly higher than Gemini. When the agreement between evaluators with different levels of education was examined, it was found to be statistically higher for the Gemini application compared to the other applications. Conclusion: This study demonstrates that ChatGPT is statistically significantly superior to Gemini in terms of accuracy and response quality, and although no statistically significant difference was observed when compared with Claude, ChatGPT exhibited higher performance. Evaluator experience was identified as a determining factor in the interpretation of artificial intelligence responses. The findings indicate that artificial intelligence applications are not suitable as standalone clinical decision-making tools in the field of MRONJ; however, they may be useful for education and information acquisition when supported by expert supervision and verification with the scientific literature. Keywords; jaw osteonecrosis; medication related osteonecrosis of the jaw (MRONJ); arificial intelligence; ChatGPT; Google Gemini; Claude

Benzer Tezler

  1. Farklı yapay zeka uygulamalarının endodontik tedavi ve prosedürler hakkındaki bilgisinin değerlendirilmesi

    Evaluation of the knowledge of different artificial intelligence applications on endodontic treatments and procedures

    EZGİ AVCI

    Diş Hekimliği Uzmanlık

    Türkçe

    Türkçe

    2025

    Diş HekimliğiEge Üniversitesi

    Endodonti Ana Bilim Dalı

    DOÇ. DR. ILGIN İLGENLİ

  2. Armutta zararlı Cacopsylla pyri L. (Hemiptera: Psyllidae)'nın biyoteknik mücadelesine esas farklı sarı yapışkan tuzak uygulamalarının yapay zekâ yöntemleri ile incelenmesi

    Investigation of different yellow sticky trap applications based on biotechnical control of pear pest Cacopsylla pyri L. (Hemiptera: Psyllidae) using artificial intelligence

    TUBA ASLAN KÜÇÜKÖZER

    Doktora

    Türkçe

    Türkçe

    2025

    BiyomühendislikFırat Üniversitesi

    Biyomühendislik Ana Bilim Dalı

    PROF. DR. İNANÇ ÖZGEN

  3. Türkiye ve Mısır medyası'nda yapay zeka uygulamalarının karşılaştırmalı analizi

    A comparative analysis of artificial intelligence applications in Turkish and Egyptian media

    NADA MOHAMMED ABDELAAL MOHAMED MEKEIBEL

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    GazetecilikAnkara Hacı Bayram Veli Üniversitesi

    Gazetecilik Ana Bilim Dalı

    PROF. DR. EROL İLHAN

  4. Yapay zekâ uygulamalarının reklam ve pazarlama aktivitelerine etkileri: Sektör çalışanları ile bir araştırma

    Effects on advertising and marketing activities of artificial intelligence applications: A research with sector employees

    BURCU GEBEŞ

    Yüksek Lisans

    Türkçe

    Türkçe

    2021

    ReklamcılıkBahçeşehir Üniversitesi

    Reklamcılık ve Marka İletişimi Yönetimi Bilim Dalı

    PROF. DR. HASAN KEMAL SÜHER

  5. Yapay zeka uygulamalarının reklam ajanslarında kullanımı: Üretim süreçlerine yönelik nitel bir araştırma

    The use of artificial intelligence applications in advertising agencies: A qualitative research on production processes

    BİLGİ GÖKMEN ŞENEL

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    ReklamcılıkEge Üniversitesi

    Reklamcılık Ana Bilim Dalı

    PROF. DR. F. BELMA FIRLAR