Geri Dön

Accuracy of advanced large language models for assessing depression and anxiety: A comparative study with evidence-based scales

Gelişmiş büyük dil modellerinin depresyon ve anksiyete değerlendirme doğruluğu: Kanıta dayalı ölçeklerle karşılaştırmalı bir çalışma

  1. Tez No: 966174
  2. Yazar: FURKAN KIZILIŞIK
  3. Danışmanlar: DR. ÖĞR. ÜYESİ MEHMET KAAN İLDİZ
  4. Tez Türü: Yüksek Lisans
  5. Konular: Psikiyatri, Psikoloji, Psychiatry, Psychology
  6. Anahtar Kelimeler: Anksiyete, Depresyon, Dil modelleri, Nörobilim, Psikiyatri, Psikoloji, Psikolojik ölçekler, Psikometri, Psikometrik ölçümler, İnsan-makine ilişkisi, Anxiety, Depression, Language models, Neuroscience, Psychiatry, Psychology, Psychological scales, Psychometrics, Psychometric measurements, Human-machine relationship
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: Üsküdar Üniversitesi
  10. Enstitü: Sağlık Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Nörobilim Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Depresyon ve anksiyete bozuklukları, doğru ve erişilebilir değerlendirme araçlarını gerektiren önemli bir küresel sağlık yükünü temsil etmektedir. Beck Depresyon Envanteri (BDE) ve Beck Anksiyete Envanteri (BAE) gibi kanıta dayalı ölçekler klinik temel taşlar olsa da, bu ölçeklerin geliştirilmesi kaynak-yoğun bir süreçtir ve geliştiricilerinin öznel deneyimleriyle sınırlanabilmektedir. Bu çalışmanın amacı, GPT-o3-mini ve DeepSeek-R1 adlı iki gelişmiş Büyük Dil Modeli (BDM) tarafından oluşturulan depresyon ve anksiyete ölçen karma birer ölçek geliştirmek ve performanslarını BDE ve BAE'nin geçerli Türkçe versiyonları ile karşılaştırmaktır. Çalışmaya 222 Türkçe konuşan yetişkin katılmış ve dört ölçeği de içeren çevrimiçi bir anketi tamamlamıştır. Güvenilirlik Cronbach alfa katsayısı ile, geçerlilik ise Pearson korelasyon analizi ile değerlendirilmiştir. Sonuçlar, BDM tarafından geliştirilenler de dahil olmak üzere tüm ölçeklerin yüksek iç tutarlılığa sahip olduğunu göstermiştir (α ≥ .86). DeepSeek-R1 ölçeği, ilgili standart ölçeklerle (BDE: r=.538, p<.001; BAE: r=.500, p<.001) orta düzeyde yakınsak geçerlilik sergilemiştir. GPT-o3-mini ölçeği, özellikle anksiyete için (r=.266, p<.001) daha zayıf bir yakınsak geçerlilik göstermiştir. Ayırt edici geçerlilikte önemli bir sınırlılık ortaya çıkmıştır; örneğin, DeepSeek-R1 anksiyete alt ölçeği, anksiyete ile depresyonu ayırt etmede başarısız olmuştur (BDE ile r=.547). Sonuç olarak, BDM'ler ruh sağlığı değerlendirmesi için psikometrik olarak güvenilir madde havuzları oluşturabilmekte, ancak klinik ayrım için gerekli olan ayırt edici geçerliliği sağlamada önemli zorluklar yaşamaktadır. Bu bulgular, BDM'lerin ölçek geliştirmeyi destekleyici bir araç olarak potansiyelini vurgularken, klinik düzeyde özgüllüğe ulaşmak için uzman denetiminin ve titiz doğrulama süreçlerinin vazgeçilmez rolünün altını çizmektedir.

Özet (Çeviri)

Depression and anxiety disorders represent a significant global health burden, necessitating accurate and accessible assessment tools. While evidence-based scales like the Beck Depression Inventory (BDI) and Beck Anxiety Inventory (BAI) are clinical cornerstones, their development is resource-intensive and may be constrained by the subjective experiences of their creators. This study aimed to develop a composite scale measuring depression and anxiety generated by two advanced Large Language Models (LLMs)—GPT-o3-mini and DeepSeek-R1—and to compare their performance against the validated Turkish versions of the BDI and BAI. A sample of 222 Turkish-speaking adults completed an online survey containing all four instruments. Reliability was assessed using Cronbach's alpha, and validity was examined via Pearson correlations. The results indicated that all scales, including the LLM-generated ones, possess high internal consistency (α ≥ .86). The DeepSeek-R1 scale demonstrated moderate convergent validity with their respective standard measures (BDI: r=.538, p<.001; BAI: r=.500, p<.001). The GPT-o3-mini scale exhibited weaker convergent validity, particularly for anxiety (r=.266, p<.001). A significant limitation emerged in discriminant validity; the DeepSeek-R1 anxiety subscale, for instance, failed to differentiate between anxiety and depression (r=.547 with BDI). In conclusion, LLMs can generate psychometrically reliable item pools for mental health assessment, but they exhibit considerable difficulty in ensuring the discriminant validity essential for clinical differentiation. These findings underscore the potential of LLMs as a tool to augment scale development while highlighting the indispensable role of expert oversight and rigorous validation to achieve clinical-grade specificity.

Benzer Tezler

  1. ChatGPT'nin lazer refraktif cerrahi ve keratokonus yönetimi önerilerinin kornea uzmanlarıyla karşılaştırılması

    Comparison of ChatGPT's recommendations on laser refractive surgery and keratoconus management with corneal specialists

    CEM SAĞLIK

    Tıpta Uzmanlık

    Türkçe

    Türkçe

    2026

    Göz HastalıklarıSağlık Bilimleri Üniversitesi

    Göz Hastalıkları Ana Bilim Dalı

    DOÇ. DR. BURCU KASIM TEKDEMİR

    UZMAN MİRAY FAİZ TURAN

  2. Retrospektif kohort çalışmaları için yapay zeka destekli kullanıcı arayüzü geliştirilmesi: Nükleer tıp alanında bir vaka çalışması

    Development of an artificial intelligence- assisted user interface for retrospective cohort studies: A case study in nuclear medicine

    ABDURRAHMAN RAJAB

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Bilgi ve Belge YönetimiMarmara Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ ALİ SARIKAŞ

    DOÇ. DR. RABİA LEBRİZ USLU BEŞLİ

  3. Automated code review: Empirical evidence from experiments and industry

    Otomatik kod gözden geçirme: Deneylerden ve endüstriden elde edilen bulgular

    UMUT CİHAN

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİhsan Doğramacı Bilkent Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ ERAY TÜZÜN

  4. İklimlendirme sistemleri üzerinde makine öğrenmesi ile anomali tespiti

    Anomaly detection with machine learning on air conditioning systems

    REFİK KİBAR

    Yüksek Lisans

    Türkçe

    Türkçe

    2023

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ MUHAMMED FATİH ADAK

    DR. ÖĞR. ÜYESİ KEVSER OVAZ AKPINAR