A behavioral evaluation framework for arithmetic reasoning in large language models: is it just memorization?
Büyük dil modellerinde aritmetik muhakemeye yönelik davranışsal bir değerlendirme çerçevesi: Sadece ezber mi?
- Tez No: 1016348
- Danışmanlar: PROF. DR. UMUT ORHAN
- Tez Türü: Doktora
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: İngilizce
- Üniversite: Çukurova Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu çalışma, Büyük Dil Modellerinin (LLM) aritmetik muhakeme yeteneklerini değerlendirmek amacıyla, geleneksel soru-cevap yöntemlerinin ötesine geçen, özgün ve yapılandırılmış bir test çerçevesi sunmaktadır. Bu bağlamda Llama, DeepSeek, Mistral, GPT ve Gemini olmak üzere beş farklı model; DROP veri setinden seçilen karmaşık bir metne dayalı, kontrollü ve türetilmiş bir soru seti kullanılarak 1.860 soruyu ve 60 oturumu kapsayan kapsamlı bir analize tabi tutulmuştur. Değerlendirme süreci; yalnızca geleneksel nicel metrikleri değil, aynı zamanda bilgi getirme, dört işlem ve tekrarlama hataları ile mantıksal tutarsızlıklar gibi nitel kriterleri de içerecek şekilde çok boyutlu olarak tasarlanmıştır. Bulgular, modellerin aritmetik muhakeme kararlılığı açısından keskin bir şekilde ayrıştığını ve yüksek doğruluk oranlarının her zaman gerçek mantıksal muhakeme becerilerini yansıtmadığını ortaya koymaktadır. Kapalı kaynaklı (ticari) modeller, genel doğruluk oranlarında açık kaynaklı sistemlerden daha iyi performans gösterse de, girdi formatı veya soru sırası değiştirildiğinde bu modellerin önemli tutarsızlıklar ve/veya mantıksal kopukluklar yaşadığı gözlemlenmiştir. Bu sonuçlar, LLM performanslarının yalnızca ölçeklendirme yoluyla çözülemeyecek istatistiksel geri çağırma ve sıralama yanlılığı (order bias) sorunları barındırdığını ampirik olarak kanıtlamakta; dolayısıyla modelleri sadece nihai cevaplarına göre değil, bilişsel süreçlerine ve davranışsal tutarlılıklarına göre değerlendiren derinlemesine inceleme protokollerine duyulan kritik ihtiyacı vurgulamaktadır.
Özet (Çeviri)
This study proposes a novel and structured testing framework that transcends traditional question-answering methods to evaluate the arithmetic reasoning abilities of Large Language Models (LLMs). In this context, five different models, Llama, DeepSeek, Mistral, GPT and Gemini, were subjected to a comprehensive analysis encompassing 1,860 questions and 60 sessions, utilizing a controlled and derived question set based on a complex text selected from the DROP dataset. The evaluation process was designed multidimensionally, incorporating not only traditional quantitative metrics but also qualitative criteria such as retrieval, four operation and repetition errors, as well as logical inconsistencies. The findings reveal that the models diverge sharply in terms of arithmetic reasoning stability, and that high accuracy rates do not always reflect genuine logical reasoning skills. Although proprietary models outperformed open-source systems in overall accuracy rates, it was observed that they experienced significant inconsistencies and/or logical disconnects when the input format or question order was altered. These results empirically prove that LLM performances harbor issues of statistical recall and order bias that cannot be resolved solely through scaling, thereby underscoring the critical need for in-depth evaluation protocols that assess models based on their cognitive processes and behavioral consistencies rather than merely their final answers.
Benzer Tezler
- Köprüüstü simülatör uygulamaları ile teknik ve davranışsal becerilerin ölçülmesine yönelik model önerisi
A model proposal for evaluating technical and behavioral skills through bridge simulator practices
EDA KEFELİ
Yüksek Lisans
Türkçe
2026
Denizcilikİstanbul Teknik ÜniversitesiDeniz Ulaştırma İşletme Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ ESMA UFLAZ
DOÇ. DR. ALİ CEM KUZU
- Development of a coverage-driven cocotb-based functional verification framework for the RISC-V load-store and r-type instructions
Rısc-v yükleme-saklama ve r-tipi buyrukları için kapsam odaklı cocotb tabanlı bir fonksiyonel doğrulama ortamının geliştirilmesi
ŞENNUR GÜNEY
Yüksek Lisans
İngilizce
2024
Elektrik ve Elektronik MühendisliğiGebze Teknik ÜniversitesiElektronik Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ İHSAN ÇİÇEK
- Application of the control theory for processing of environmental indicators and determination of the environmental sustainability index
Kontrol teorisinin çevresel göstergelerin oluşturulmasına uygulanması ve çevresel sürdürülebilirlik endeksinin tanımlanması
MERİH KERESTECİOĞLU
- İngilizce Hazırlık Programı Dinleme-Konuşma dersi konuşma alt alanının Tyler'ın Hedefe Dayalı Değerlendirme Modeline göre değerlendirilmesi
Evaluation of the speaking sub-component of the Listening-Speaking course in the English Preparatory Program based on Tyler's Goal Oriented Evaluation Model
İLHAN YADİGAR KILAVUZ
Yüksek Lisans
Türkçe
2024
Eğitim ve ÖğretimBurdur Mehmet Akif Ersoy ÜniversitesiEğitim Bilimleri Ana Bilim Dalı
PROF. DR. RAMAZAN SAĞ
- Orta öğretim kurumlarına öğretmen yetiştirmede üniversite öğretiminin önemi
Başlık çevirisi yok
HAKAN SONAY