Geri Dön

Evaluati̇ng the performance of large language models on long-context bi̇omedi̇cal questi̇on answeri̇ng

Büyük dil modellerinin uzun bağlamlı biyomedikal soru cevaplama üzerindeki performansının değerlendirilmesi

  1. Tez No: 1019801
  2. Yazar: FERAS AL MANNAA
  3. Danışmanlar: PROF. FERDİ SÖNMEZ
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: İstanbul Aydın Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Yapay Zeka ve Veri Bilimi Ana Bilim Dalı
  12. Bilim Dalı: Yapay Zeka ve Veri Bilimi Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Büyük Dil Modellerinin (LLM) klinik uygulanabilirliğini değerlendirmek, mevcut metodolojilerdeki önemli bir boşluğu doldurarak, uzun ve karmaşık Elektronik Sağlık Kayıtları (EHR) üzerindeki gerçek dünya akıl yürütmesini yansıtan kıyaslamalar gerektirir. Bu tez, görev formülasyonunun, bağlam uzunluğunun, model özelliklerinin ve tam bağlamlı istemcilik ile Geri-Getirme Destekli Üretim (RAG) arasındaki ödünleşmelerin etkisini sistematik olarak değerlendirerek, açık kaynaklı BDM'lerin uzun bağlamlı biyomedikal soru cevaplama performansı üzerine kapsamlı bir değerlendirme sunmaktadır. MIMIC-III ve MIMIC-IV'ten türetilen insan tarafından doğrulanmış dört SC veri seti kullanılarak, bu çalışma farklı boyut (7B, 32B) ve tiplerdeki Qwen model ailesini test etmiştir. Tam hasta kaydını bağlam olarak sunmanın etkinliği, yoğun, seyrek ve geç etkileşimli geri getirmeyi birleştiren hibrit bir RAG boru hattına karşı karşılaştırılmıştır. Üretken, çıkarımsal ve çoktan seçmeli görevlerdeki performansı ölçmek için, BDM-değerlendirici metriklerini de içeren çok yönlü bir değerlendirme çerçevesi kullanılmıştır. Sonuçlar, RAG stratejilerinin tam bağlamlı istemcilikten tutarlı bir şekilde daha iyi performans gösterdiğini ve hiyerarşik geri getirmenin çoklu not akıl yürütmesi için en uygun yöntem olduğunu göstermektedir. Daha büyük modeller daha iyi performans gösterse de, artan bağlam uzunluğuyla performans düşerek uzun bağlamları yönetme zorluğunu vurgulamıştır. Odaklanmış ve tasarlanmış bağlam genellikle tam kaydı sağlamayı geride bırakmış ve alana özgü akıl yürütme verileriyle yapılan ince ayar, özellikle daha küçük model boyutları için talimat takip becerileriyle potansiyel bir ödünleşmeye işaret ederek, iyileşmeyi garanti etmemiştir. Bu çalışma, sağlam bir değerlendirme çerçevesi ve ayrıntılı bir hata analizi sunarak, sağlık hizmetlerinde daha güvenli ve etkili LLM uygulamaları geliştirmek için pratik bilgiler sağlamaktadır.

Özet (Çeviri)

Evaluating the clinical viability of Large Language Models (LLMs) requires benchmarks that mirror real-world reasoning over long and complex Electronic Health Records (EHRs), a notable gap in current methodologies. This thesis investigates open LLMs comprehension on long-context biomedical question answering tasks, systematically assessing the impact of task formulation, context length, model characteristics, and the trade-offs between full-context prompting and RAG. Using four human-validated QA datasets derived from MIMIC-III and MIMIC-IV, this work evaluated Qwen family models of varying sizes (7B, 32B) and types. We compared multiple context settings against a hybrid RAG pipeline combining dense, sparse, and late-interaction retrieval. A varied evaluation framework, including LLM-as-a-judge metrics, was used to measure performance across generative, extractive, and multiple-choice tasks on the different context settings. Results show that RAG strategies outperform full-context prompting, with hierarchical retrieval method being the better approach for multi-note reasoning. Although larger models performed better overall, performance got worse with longer context lengths, indicating the challenge of handling longer contexts and showing the importance of proper context engineering. Domain-specific fine tuning with reasoning on reasoning trajectories did not show improved results on most tasks, indicating a potential trade-off with instruction-following skills and long context capabilities of smaller models. By providing a strong evaluation framework and detailed error analysis, this work offers insights for developing safer, more effective LLM applications in the healthcare system.

Benzer Tezler

  1. The significance and the contribution of 6+1 traits of writing to the success of the students in writing courses in English language teaching

    Yazmanın 6+1 özelliğinin İngilizce öğretiminde yazılı anlatım derslerindeki öğrenci başarısına katkısı ve önemi

    ÖZLEM YAZAR

    Yüksek Lisans

    İngilizce

    İngilizce

    2004

    Eğitim ve ÖğretimGazi Üniversitesi

    İngiliz Dili Eğitimi Ana Bilim Dalı

    YRD. DOÇ. DR. PAŞA TEVFİK CEPHE

  2. An agent-based framework for systematic generative feature engineering in financial markets

    Finansal piyasalarda sistematik üretici değişken mühendisliği için yapay zekâ ajanları temelli bir yaklaşım

    MUSTAFA ENES KARAMAN

    Yüksek Lisans

    İngilizce

    İngilizce

    2026

    Bilim ve Teknolojiİstanbul Teknik Üniversitesi

    Büyük Veri ve İş Analitiği Ana Bilim Dalı (disiplinlerarası)

    PROF. DR. ALP ÜSTÜNDAĞ

  3. Evaluating performance of large language models in bluff-based card games: A comparative study

    Blöf temelli kart oyunlarında büyük dil modeline ait performans değerlendirilmesi: Karşılaştırmalı bir çalışma

    İREM ŞALK

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Oyun ve Etkileşim Teknolojileri Ana Bilim Dalı (disiplinlerarası)

    PROF. DR. SANEM SARIEL UZER

  4. Hakem atama otomasyonu için bir karar destek sistemi: Doğal dil işleme ve veri-güdümlü optimizasyon ile bütünleşik bir yaklaşım

    A decision support system for reviewer assignment automation: An integrated approach with natural language processing and data-driven optimization

    MELTEM AKSOY

    Doktora

    Türkçe

    Türkçe

    2023

    Endüstri ve Endüstri Mühendisliğiİstanbul Teknik Üniversitesi

    Endüstri Mühendisliği Ana Bilim Dalı

    DOÇ. DR. SEDA YANIK ÖZBAY

    PROF. DR. MEHMET FATİH AMASYALI

  5. Finansal haber içerikleriyle zenginleştirilmiş zaman serisi verilerinde derin öğrenme tabanlı anomali tespiti

    Deep learning based anomaly detection in time series data enriched with financial news content

    HASAN DEMİR

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolKarabük Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ KÜRŞAT MUSTAFA KARAOĞLAN