Geri Dön

Kritik hasta tanısında yapay zeka performansı: ChatGPT, Gemini, Claude ve acil servis hekimlerinin karşılaştırılması

Performance of artificial intelligence in critical patient diagnosis: Comparison of ChatGPT, Gemini, Claude and emergency physicians

  1. Tez No: 971805
  2. Yazar: İBRAHİM GÜNAYDIN
  3. Danışmanlar: DOÇ. DR. SİNAN PASLI
  4. Tez Türü: Tıpta Uzmanlık
  5. Konular: Acil Tıp, Emergency Medicine
  6. Anahtar Kelimeler: Yapay zeka, Büyük dil modeli, Claude, Gemini, ChatGPT, Artificial intelligence, ChatGPT, Claude, Gemini, Large language model
  7. Yıl: 2025
  8. Dil: Türkçe
  9. Üniversite: Karadeniz Teknik Üniversitesi
  10. Enstitü: Tıp Fakültesi
  11. Ana Bilim Dalı: Acil Tıp Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Amaç: Bu çalışmanın amacı, acil servise başvuran kritik hastalarda, hekimin tanısal sürecini ChatGPT, Claude ve Gemini'nin oluşturduğu tanısal çıktılarıyla karşılaştırmaktır. Gereç ve yöntem: Acil servise başvuran kritik hastaların vital bulgu ve anamnez bilgilerine göre hekim tarafından, henüz fizik muayene ve tetkik-görüntüleme aşamasına geçilmeden önce en olası 5 adet ön tanı belirlendi. Aynı veriler AI modellerine kimliksizleştirilmiş olarak girildi. Modellerden en olası 5 ön tanı oluşturması istendi. İkinci aşamada hekim, fizik muayene, laboratuvar ve görüntüleme sonuçlarıyla ön tanılarını gözden geçirdi ve 3 ayırıcı tanı olarak güncelledi. Bu verilerle AI modellerinden 3 ayırıcı tanı oluşturması istendi. Son aşamada toplanan tüm veriler ışığında hastanın klinik durumuna neden olan primer kesin tanısı netleştirildi ve bu karar altın standart karar olarak belirlendi. AI modellerinden de tüm veriler ışığında hastanın kesin tanısının belirlenmesi istendi. Her bir model tarafından üretilen ön tanı, ayırıcı tanı ve kesin tanı çıktıları altın standart karar ile karşılaştırıldı. İstatistiksel analizler, R programlama dili kullanılarak gerçekleştirildi. Bulgular: Çalışma 180 hasta ile tamamlandı. Dahil edilen hastaların %56 sı erkek, %44'ü kadındı. Kesin tanı doğruluk oranları incelendiğinde, GPT-4o'nun doğruluk oranı %67,2 GPT-5'in %65,6, Claude'un %63,3 ve Gemini'nin %59,4 olarak saptandı. Gruplar arasında anlamlı istatistiksel fark saptanmadı (p=0.16). Altın standart tanı ile kesin tanı uyum düzeyleri değerlendirildiğinde, Cohen's κ katsayısı GPT-4o için 0,656, GPT-5 için 0,638, Claude için 0,616 ve Gemini için 0,575 olarak bulundu. Sonuç: Yapay zekâ modellerinin kesin tanı doğruluk oranlarının %60-70 seviyelerinde olması, altın standart karar ile genel olarak iyi düzeyde uyum göstermesi bu sistemlerin acil servis ortamında klinik karar vermede yardımcı olabilme potansiyelini desteklemektedir.

Özet (Çeviri)

Introduction: This study aimed to compare the diagnostic process of emergency physicians with the diagnostic outputs generated by ChatGPT, Claude, and Gemini in critically ill patients presenting to the emergency department(ED). Methods: For critically ill patients presenting to the ED, physicians identified five preliminary diagnoses based on vital signs and medical history. The same anonymized data were entered into AI models, which were asked to generate five preliminary diagnoses. After physical examination, laboratory, and imaging results became available, both physicians and AI models refined these into three differential diagnoses. Finally, the physician's final diagnosis, explaining the patient's clinical condition, was accepted as the gold standard. Each AI model was then asked to determine the final diagnosis using the complete dataset. The preliminary, differential, and final diagnoses generated by each model were compared with the gold standard. Statistical analyses were performed using R. Results: The study included 180 patients (56% male, 44% female). Regarding the accuracy of final diagnoses, GPT-4o achieved an accuracy rate of 67.2%, GPT-5 achieved 65.6%, Claude achieved 63.3%, and Gemini achieved 59.4%. No statistically significant difference was found among the groups (p=0.16).When evaluating the agreement between the AI models' definitive diagnoses and the gold-standard diagnosis, Cohen's κ coefficients were calculated as 0.656 for GPT-4o, 0.638 for GPT-5, 0.616 for Claude, and 0.575 for Gemini. Conclusion The finding that AI models achieved diagnostic accuracy rates of 60%-70% and showed overall substantial agreement with the gold standard decision supports their potential to assist clinical decision-making in the ED setting.

Benzer Tezler

  1. ChatGPT'nin lazer refraktif cerrahi ve keratokonus yönetimi önerilerinin kornea uzmanlarıyla karşılaştırılması

    Comparison of ChatGPT's recommendations on laser refractive surgery and keratoconus management with corneal specialists

    CEM SAĞLIK

    Tıpta Uzmanlık

    Türkçe

    Türkçe

    2026

    Göz HastalıklarıSağlık Bilimleri Üniversitesi

    Göz Hastalıkları Ana Bilim Dalı

    DOÇ. DR. BURCU KASIM TEKDEMİR

    UZMAN MİRAY FAİZ TURAN

  2. Çocuklarda dirsek çevresi kırıkları ve eklem efüzyonuna yapay zekâ kullanılarak tanı konulması

    Diagnosis of pediatric elbow fractures and joint effusion using artificial intelligence

    OĞUZHAN NAYMAN

    Tıpta Uzmanlık

    Türkçe

    Türkçe

    2025

    Ortopedi ve TravmatolojiSağlık Bilimleri Üniversitesi

    Ortopedi ve Travmatoloji Ana Bilim Dalı

    PROF. DR. İSMAİL DEMİRKALE

  3. Aksiyel spondiloartritin erken tanısı için yapay zekâ tabanlı klinik karar destek sistemi

    An artificial intelligence-based clinical decision support system for the early diagnosis of axial spondyloarthritis

    FATİH TARAKCI

    Doktora

    Türkçe

    Türkçe

    2026

    RomatolojiSelçuk Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. İLKER ALİ ÖZKAN

  4. Meme kanseri tanısı için gelişmiş yapay zeka tabanlı çok aşamalı tespit sistemi

    Advanced artificial intelligence based multi-stage detection system for breast cancer diagnosis

    ABDUL SAMAD

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Elektrik ve Elektronik MühendisliğiSakarya Üniversitesi

    Elektrik-Elektronik Mühendisliği Ana Bilim Dalı

    DOÇ. DR. MUHAMMED KÜRŞAD UÇAR

  5. Çocuk akciğer x-ışını görüntülerinin derin öğrenme yöntemleri ile analizi

    Analysis of child lung x-ray images with deep learningmethods

    ÇAĞDAŞ ŞİMŞEK

    Doktora

    Türkçe

    Türkçe

    2025

    Fizik ve Fizik Mühendisliğiİstanbul Üniversitesi

    Fizik Ana Bilim Dalı

    PROF. DR. SUAT ÖZKORUCUKLU