Accuracy of advanced large language models for assessing depression and anxiety: A comparative study with evidence-based scales
Gelişmiş büyük dil modellerinin depresyon ve anksiyete değerlendirme doğruluğu: Kanıta dayalı ölçeklerle karşılaştırmalı bir çalışma
- Tez No: 966174
- Danışmanlar: DR. ÖĞR. ÜYESİ MEHMET KAAN İLDİZ
- Tez Türü: Yüksek Lisans
- Konular: Psikiyatri, Psikoloji, Psychiatry, Psychology
- Anahtar Kelimeler: Anksiyete, Depresyon, Dil modelleri, Nörobilim, Psikiyatri, Psikoloji, Psikolojik ölçekler, Psikometri, Psikometrik ölçümler, İnsan-makine ilişkisi, Anxiety, Depression, Language models, Neuroscience, Psychiatry, Psychology, Psychological scales, Psychometrics, Psychometric measurements, Human-machine relationship
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Üsküdar Üniversitesi
- Enstitü: Sağlık Bilimleri Enstitüsü
- Ana Bilim Dalı: Nörobilim Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Depresyon ve anksiyete bozuklukları, doğru ve erişilebilir değerlendirme araçlarını gerektiren önemli bir küresel sağlık yükünü temsil etmektedir. Beck Depresyon Envanteri (BDE) ve Beck Anksiyete Envanteri (BAE) gibi kanıta dayalı ölçekler klinik temel taşlar olsa da, bu ölçeklerin geliştirilmesi kaynak-yoğun bir süreçtir ve geliştiricilerinin öznel deneyimleriyle sınırlanabilmektedir. Bu çalışmanın amacı, GPT-o3-mini ve DeepSeek-R1 adlı iki gelişmiş Büyük Dil Modeli (BDM) tarafından oluşturulan depresyon ve anksiyete ölçen karma birer ölçek geliştirmek ve performanslarını BDE ve BAE'nin geçerli Türkçe versiyonları ile karşılaştırmaktır. Çalışmaya 222 Türkçe konuşan yetişkin katılmış ve dört ölçeği de içeren çevrimiçi bir anketi tamamlamıştır. Güvenilirlik Cronbach alfa katsayısı ile, geçerlilik ise Pearson korelasyon analizi ile değerlendirilmiştir. Sonuçlar, BDM tarafından geliştirilenler de dahil olmak üzere tüm ölçeklerin yüksek iç tutarlılığa sahip olduğunu göstermiştir (α ≥ .86). DeepSeek-R1 ölçeği, ilgili standart ölçeklerle (BDE: r=.538, p<.001; BAE: r=.500, p<.001) orta düzeyde yakınsak geçerlilik sergilemiştir. GPT-o3-mini ölçeği, özellikle anksiyete için (r=.266, p<.001) daha zayıf bir yakınsak geçerlilik göstermiştir. Ayırt edici geçerlilikte önemli bir sınırlılık ortaya çıkmıştır; örneğin, DeepSeek-R1 anksiyete alt ölçeği, anksiyete ile depresyonu ayırt etmede başarısız olmuştur (BDE ile r=.547). Sonuç olarak, BDM'ler ruh sağlığı değerlendirmesi için psikometrik olarak güvenilir madde havuzları oluşturabilmekte, ancak klinik ayrım için gerekli olan ayırt edici geçerliliği sağlamada önemli zorluklar yaşamaktadır. Bu bulgular, BDM'lerin ölçek geliştirmeyi destekleyici bir araç olarak potansiyelini vurgularken, klinik düzeyde özgüllüğe ulaşmak için uzman denetiminin ve titiz doğrulama süreçlerinin vazgeçilmez rolünün altını çizmektedir.
Özet (Çeviri)
Depression and anxiety disorders represent a significant global health burden, necessitating accurate and accessible assessment tools. While evidence-based scales like the Beck Depression Inventory (BDI) and Beck Anxiety Inventory (BAI) are clinical cornerstones, their development is resource-intensive and may be constrained by the subjective experiences of their creators. This study aimed to develop a composite scale measuring depression and anxiety generated by two advanced Large Language Models (LLMs)—GPT-o3-mini and DeepSeek-R1—and to compare their performance against the validated Turkish versions of the BDI and BAI. A sample of 222 Turkish-speaking adults completed an online survey containing all four instruments. Reliability was assessed using Cronbach's alpha, and validity was examined via Pearson correlations. The results indicated that all scales, including the LLM-generated ones, possess high internal consistency (α ≥ .86). The DeepSeek-R1 scale demonstrated moderate convergent validity with their respective standard measures (BDI: r=.538, p<.001; BAI: r=.500, p<.001). The GPT-o3-mini scale exhibited weaker convergent validity, particularly for anxiety (r=.266, p<.001). A significant limitation emerged in discriminant validity; the DeepSeek-R1 anxiety subscale, for instance, failed to differentiate between anxiety and depression (r=.547 with BDI). In conclusion, LLMs can generate psychometrically reliable item pools for mental health assessment, but they exhibit considerable difficulty in ensuring the discriminant validity essential for clinical differentiation. These findings underscore the potential of LLMs as a tool to augment scale development while highlighting the indispensable role of expert oversight and rigorous validation to achieve clinical-grade specificity.
Benzer Tezler
- ChatGPT'nin lazer refraktif cerrahi ve keratokonus yönetimi önerilerinin kornea uzmanlarıyla karşılaştırılması
Comparison of ChatGPT's recommendations on laser refractive surgery and keratoconus management with corneal specialists
CEM SAĞLIK
Tıpta Uzmanlık
Türkçe
2026
Göz HastalıklarıSağlık Bilimleri ÜniversitesiGöz Hastalıkları Ana Bilim Dalı
DOÇ. DR. BURCU KASIM TEKDEMİR
UZMAN MİRAY FAİZ TURAN
- Retrospektif kohort çalışmaları için yapay zeka destekli kullanıcı arayüzü geliştirilmesi: Nükleer tıp alanında bir vaka çalışması
Development of an artificial intelligence- assisted user interface for retrospective cohort studies: A case study in nuclear medicine
ABDURRAHMAN RAJAB
Yüksek Lisans
Türkçe
2025
Bilgi ve Belge YönetimiMarmara ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ ALİ SARIKAŞ
DOÇ. DR. RABİA LEBRİZ USLU BEŞLİ
- Automated code review: Empirical evidence from experiments and industry
Otomatik kod gözden geçirme: Deneylerden ve endüstriden elde edilen bulgular
UMUT CİHAN
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİhsan Doğramacı Bilkent ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ ERAY TÜZÜN
- İnsansız hava aracı için bir borda bilgisayarının mimarisi ve tasarımı
Başlık çevirisi yok
SAİT N. YURT
Yüksek Lisans
Türkçe
1995
Astronomi ve Uzay Bilimleriİstanbul Teknik ÜniversitesiY.DOÇ.DR. T. BERAT KARYOT
- İklimlendirme sistemleri üzerinde makine öğrenmesi ile anomali tespiti
Anomaly detection with machine learning on air conditioning systems
REFİK KİBAR
Yüksek Lisans
Türkçe
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ MUHAMMED FATİH ADAK
DR. ÖĞR. ÜYESİ KEVSER OVAZ AKPINAR