Geri Dön

Towards a novel benchmark for autonomous scientific discovery: a comparative evaluation

Otonom bilimsel keşif için yeni bir ölçüt setine doğru: karşılaştırmalı bir değerlendirme

  1. Tez No: 1016977
  2. Yazar: SAMIN TAHERI
  3. Danışmanlar: PROF. DR. ÜMİT DENİZ ULUŞAR, DR. ÖĞR. ÜYESİ HÜSEYİN GÖKHAN AKÇAY, PROF. DR. HİLAL KAZAN
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: Akdeniz Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Yapay Zeka Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu tez, güncel büyük dil modellerinin biyolojik bilimsel keşif görevlerindeki performansını BAISBench ölçütü temelinde karşılaştırmalı olarak incelemektedir. Son yıllarda büyük dil modelleri, doğal dil işleme görevlerinin ötesine geçerek bilimsel açıklama üretme, hipotez değerlendirme ve çok seçenekli akıl yürütme gibi daha karmaşık görevlerde kullanılmaya başlanmıştır. Ancak bu modellerin bilimsel keşif bağlamındaki başarılarının yalnızca genel doğrulukla değil, kullanılan ölçütlerin yapısı ve değerlendirme metrikleriyle birlikte incelenmesi gerekmektedir. Çalışmada, BAISBench'in birinci ve ikinci görevleri özgün istemler, görev yapısı ve resmi puanlama mantığı korunarak uygulanmıştır. Birinci görev olan BAIS-DPTA, hiyerarşi-duyarlı S_CTA metriği ile; ikinci görev olan BAIS-SD ise özgün S_SD metriği ile değerlendirilmiştir. Buna ek olarak, çok seçenekli bilimsel keşif sorularında modellerin seçenek düzeyindeki yapılandırılmış akıl yürütme kalitesini daha ayrıntılı incelemek amacıyla OA-SD adı verilen seçenek-duyarlı bir değerlendirme yaklaşımı önerilmiştir. Bu yaklaşım, özgün BAISBench metriğinin yerine geçmekten ziyade, onunla uyumlu çalışan tanılayıcı bir genişletme olarak tasarlanmıştır. Elde edilen bulgular, güncel öncü modellerin BAISBench üzerinde önceki temel modellere kıyasla daha yüksek performans gösterdiğini, ancak modellerin göreli başarı sıralamasının kullanılan metriğe bağlı olarak değişebildiğini göstermektedir. Özellikle özgün BAIS-SD metriği altında yüksek puan alan modellerin, çok seçenekli sorularda her zaman aynı düzeyde yapılandırılmış akıl yürütme başarısı göstermediği görülmüştür. Önerilen OA-SD analizi, kısmi örtüşmeye dayalı puanlamanın daha az görünür kıldığı model farklılıklarını ortaya çıkararak seçenek düzeyindeki akıl yürütme kalitesini daha açık biçimde değerlendirmektedir. Sonuç olarak bu tez, bilimsel keşif yeteneğinin değerlendirilmesinde yalnızca seçilen ölçütün değil, metrik tasarımının da belirleyici olduğunu göstermektedir. BAISBench bağlamında önerilen OA-SD yaklaşımı, özgün metriği değiştirmeden değerlendirme sürecinin yorumlanabilirliğini artırmakta ve biyolojik bilimsel keşif görevlerinde büyük dil modellerinin performansını daha ayrıntılı incelemek için pratik bir katkı sunmaktadır.

Özet (Çeviri)

This thesis presents a comparative evaluation of recent large language models on biological scientific discovery tasks using the BAISBench benchmark. The main goal is to see how these models perform under the original BAISBench protocol and whether their scientific discovery metrics can be improved. The study evaluates recent frontier models on BAISBench Tasks 1 and 2 using the benchmark's original prompts, task structure, and official scoring logic. Task 1 is assessed with the hierarchy-aware S_CTA metric for BAIS-DPTA, and Task 2 is assessed with the original BAIS-SD (S_SD) metric. In addition, this thesis proposes OA-SD, an option-aware refinement for Task 2, to better measure structured reasoning quality in multi-option scientific discovery questions. This refinement is introduced as a diagnostic extension that preserves compatibility with the original benchmark while providing more informative option-level evaluation. The findings show that current frontier models perform strongly on BAISBench, but their relative standing varies by metric. Strong performance under the original BAIS-SD metric does not necessarily indicate equally strong structured reasoning on multi-option questions. The proposed OA-SD analysis reveals model differences that are less apparent under the original overlap-based scoring rule alone, especially when partial overlap can obscure the quality of option-level reasoning. Evaluating scientific discovery capability depends not only on benchmark choice but also on metric design. Within the BAISBench setting, the proposed OA-SD refinement improves interpretability and provides a more faithful diagnostic view of multi-option reasoning without replacing the original benchmark metric. This thesis, therefore, contributes a focused benchmark evaluation of recent frontier models and a practical refinement of a metric for biological scientific discovery assessment.

Benzer Tezler

  1. Elektrikli gemilerin şarj prosesi için yapay zekâ tabanlı yeni bir otonom kontrol sistemi

    A novel AI-based autonomous control system for the charging process of electric ships

    EMİN GÜNEY

    Doktora

    Türkçe

    Türkçe

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. CÜNEYT BAYILMIŞ

  2. Graph-based object classification techniques for autonomous vehicle radar sensors

    Otonom araç radar sensörleri için çizge tabanlı nesne sınıflandırma teknikleri

    RASİM AKIN SEVİMLİ

    Doktora

    İngilizce

    İngilizce

    2023

    Elektrik ve Elektronik MühendisliğiBaşkent Üniversitesi

    Elektrik ve Elektronik Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ MURAT ÜÇÜNCÜ

    DOÇ. DR. AYKUT KOÇ

  3. Geliştirilmiş SPEA2 ile envanter probleminin çözümü

    Inventory optimization with a novel SPEA2 algorithm

    ALİ BAYRAKDAR

    Yüksek Lisans

    Türkçe

    Türkçe

    2020

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Aydın Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. ILHAM HUSEYINOV

  4. Multi-perspective analysis and systematic benchmarking for binary-classification performance evaluation instruments

    İkili sınıflandırma başarım değerlendirme araçları için çok perspektifli analiz ve sistematik kıyaslama

    GÜROL CANBEK

    Doktora

    İngilizce

    İngilizce

    2019

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik Üniversitesi

    Bilişim Sistemleri Ana Bilim Dalı

    DOÇ. DR. TUĞBA TAŞKAYA TEMİZEL

    PROF. DR. ŞEREF SAĞIROĞLU

  5. Investigation of NO2 and SO2 adsorption/desorption properties of advanced ternary and quaternary mixed oxides for denox catalysis

    SO2 ve NO2 moleküllerinin denox katalızörü olarak kullanılan üçlü ve dörtlü karmaşık oksit yapılar üzerindeki emilim ve salınım özelliklerinin incelenmesi

    ZAFER SAY

    Doktora

    İngilizce

    İngilizce

    2015

    Kimyaİhsan Doğramacı Bilkent Üniversitesi

    Kimya Ana Bilim Dalı

    DOÇ. DR. EMRAH ÖZENSOY