Towards a novel benchmark for autonomous scientific discovery: a comparative evaluation
Otonom bilimsel keşif için yeni bir ölçüt setine doğru: karşılaştırmalı bir değerlendirme
- Tez No: 1016977
- Danışmanlar: PROF. DR. ÜMİT DENİZ ULUŞAR, DR. ÖĞR. ÜYESİ HÜSEYİN GÖKHAN AKÇAY, PROF. DR. HİLAL KAZAN
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: İngilizce
- Üniversite: Akdeniz Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Yapay Zeka Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu tez, güncel büyük dil modellerinin biyolojik bilimsel keşif görevlerindeki performansını BAISBench ölçütü temelinde karşılaştırmalı olarak incelemektedir. Son yıllarda büyük dil modelleri, doğal dil işleme görevlerinin ötesine geçerek bilimsel açıklama üretme, hipotez değerlendirme ve çok seçenekli akıl yürütme gibi daha karmaşık görevlerde kullanılmaya başlanmıştır. Ancak bu modellerin bilimsel keşif bağlamındaki başarılarının yalnızca genel doğrulukla değil, kullanılan ölçütlerin yapısı ve değerlendirme metrikleriyle birlikte incelenmesi gerekmektedir. Çalışmada, BAISBench'in birinci ve ikinci görevleri özgün istemler, görev yapısı ve resmi puanlama mantığı korunarak uygulanmıştır. Birinci görev olan BAIS-DPTA, hiyerarşi-duyarlı S_CTA metriği ile; ikinci görev olan BAIS-SD ise özgün S_SD metriği ile değerlendirilmiştir. Buna ek olarak, çok seçenekli bilimsel keşif sorularında modellerin seçenek düzeyindeki yapılandırılmış akıl yürütme kalitesini daha ayrıntılı incelemek amacıyla OA-SD adı verilen seçenek-duyarlı bir değerlendirme yaklaşımı önerilmiştir. Bu yaklaşım, özgün BAISBench metriğinin yerine geçmekten ziyade, onunla uyumlu çalışan tanılayıcı bir genişletme olarak tasarlanmıştır. Elde edilen bulgular, güncel öncü modellerin BAISBench üzerinde önceki temel modellere kıyasla daha yüksek performans gösterdiğini, ancak modellerin göreli başarı sıralamasının kullanılan metriğe bağlı olarak değişebildiğini göstermektedir. Özellikle özgün BAIS-SD metriği altında yüksek puan alan modellerin, çok seçenekli sorularda her zaman aynı düzeyde yapılandırılmış akıl yürütme başarısı göstermediği görülmüştür. Önerilen OA-SD analizi, kısmi örtüşmeye dayalı puanlamanın daha az görünür kıldığı model farklılıklarını ortaya çıkararak seçenek düzeyindeki akıl yürütme kalitesini daha açık biçimde değerlendirmektedir. Sonuç olarak bu tez, bilimsel keşif yeteneğinin değerlendirilmesinde yalnızca seçilen ölçütün değil, metrik tasarımının da belirleyici olduğunu göstermektedir. BAISBench bağlamında önerilen OA-SD yaklaşımı, özgün metriği değiştirmeden değerlendirme sürecinin yorumlanabilirliğini artırmakta ve biyolojik bilimsel keşif görevlerinde büyük dil modellerinin performansını daha ayrıntılı incelemek için pratik bir katkı sunmaktadır.
Özet (Çeviri)
This thesis presents a comparative evaluation of recent large language models on biological scientific discovery tasks using the BAISBench benchmark. The main goal is to see how these models perform under the original BAISBench protocol and whether their scientific discovery metrics can be improved. The study evaluates recent frontier models on BAISBench Tasks 1 and 2 using the benchmark's original prompts, task structure, and official scoring logic. Task 1 is assessed with the hierarchy-aware S_CTA metric for BAIS-DPTA, and Task 2 is assessed with the original BAIS-SD (S_SD) metric. In addition, this thesis proposes OA-SD, an option-aware refinement for Task 2, to better measure structured reasoning quality in multi-option scientific discovery questions. This refinement is introduced as a diagnostic extension that preserves compatibility with the original benchmark while providing more informative option-level evaluation. The findings show that current frontier models perform strongly on BAISBench, but their relative standing varies by metric. Strong performance under the original BAIS-SD metric does not necessarily indicate equally strong structured reasoning on multi-option questions. The proposed OA-SD analysis reveals model differences that are less apparent under the original overlap-based scoring rule alone, especially when partial overlap can obscure the quality of option-level reasoning. Evaluating scientific discovery capability depends not only on benchmark choice but also on metric design. Within the BAISBench setting, the proposed OA-SD refinement improves interpretability and provides a more faithful diagnostic view of multi-option reasoning without replacing the original benchmark metric. This thesis, therefore, contributes a focused benchmark evaluation of recent frontier models and a practical refinement of a metric for biological scientific discovery assessment.
Benzer Tezler
- Elektrikli gemilerin şarj prosesi için yapay zekâ tabanlı yeni bir otonom kontrol sistemi
A novel AI-based autonomous control system for the charging process of electric ships
EMİN GÜNEY
Doktora
Türkçe
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. CÜNEYT BAYILMIŞ
- Graph-based object classification techniques for autonomous vehicle radar sensors
Otonom araç radar sensörleri için çizge tabanlı nesne sınıflandırma teknikleri
RASİM AKIN SEVİMLİ
Doktora
İngilizce
2023
Elektrik ve Elektronik MühendisliğiBaşkent ÜniversitesiElektrik ve Elektronik Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ MURAT ÜÇÜNCÜ
DOÇ. DR. AYKUT KOÇ
- Geliştirilmiş SPEA2 ile envanter probleminin çözümü
Inventory optimization with a novel SPEA2 algorithm
ALİ BAYRAKDAR
Yüksek Lisans
Türkçe
2020
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Aydın ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. ILHAM HUSEYINOV
- Multi-perspective analysis and systematic benchmarking for binary-classification performance evaluation instruments
İkili sınıflandırma başarım değerlendirme araçları için çok perspektifli analiz ve sistematik kıyaslama
GÜROL CANBEK
Doktora
İngilizce
2019
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik ÜniversitesiBilişim Sistemleri Ana Bilim Dalı
DOÇ. DR. TUĞBA TAŞKAYA TEMİZEL
PROF. DR. ŞEREF SAĞIROĞLU
- Investigation of NO2 and SO2 adsorption/desorption properties of advanced ternary and quaternary mixed oxides for denox catalysis
SO2 ve NO2 moleküllerinin denox katalızörü olarak kullanılan üçlü ve dörtlü karmaşık oksit yapılar üzerindeki emilim ve salınım özelliklerinin incelenmesi
ZAFER SAY
Doktora
İngilizce
2015
Kimyaİhsan Doğramacı Bilkent ÜniversitesiKimya Ana Bilim Dalı
DOÇ. DR. EMRAH ÖZENSOY