Geri Dön

A behavioral evaluation framework for arithmetic reasoning in large language models: is it just memorization?

Büyük dil modellerinde aritmetik muhakemeye yönelik davranışsal bir değerlendirme çerçevesi: Sadece ezber mi?

  1. Tez No: 1016348
  2. Yazar: FERHAT ALBAYRAK
  3. Danışmanlar: PROF. DR. UMUT ORHAN
  4. Tez Türü: Doktora
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: Çukurova Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu çalışma, Büyük Dil Modellerinin (LLM) aritmetik muhakeme yeteneklerini değerlendirmek amacıyla, geleneksel soru-cevap yöntemlerinin ötesine geçen, özgün ve yapılandırılmış bir test çerçevesi sunmaktadır. Bu bağlamda Llama, DeepSeek, Mistral, GPT ve Gemini olmak üzere beş farklı model; DROP veri setinden seçilen karmaşık bir metne dayalı, kontrollü ve türetilmiş bir soru seti kullanılarak 1.860 soruyu ve 60 oturumu kapsayan kapsamlı bir analize tabi tutulmuştur. Değerlendirme süreci; yalnızca geleneksel nicel metrikleri değil, aynı zamanda bilgi getirme, dört işlem ve tekrarlama hataları ile mantıksal tutarsızlıklar gibi nitel kriterleri de içerecek şekilde çok boyutlu olarak tasarlanmıştır. Bulgular, modellerin aritmetik muhakeme kararlılığı açısından keskin bir şekilde ayrıştığını ve yüksek doğruluk oranlarının her zaman gerçek mantıksal muhakeme becerilerini yansıtmadığını ortaya koymaktadır. Kapalı kaynaklı (ticari) modeller, genel doğruluk oranlarında açık kaynaklı sistemlerden daha iyi performans gösterse de, girdi formatı veya soru sırası değiştirildiğinde bu modellerin önemli tutarsızlıklar ve/veya mantıksal kopukluklar yaşadığı gözlemlenmiştir. Bu sonuçlar, LLM performanslarının yalnızca ölçeklendirme yoluyla çözülemeyecek istatistiksel geri çağırma ve sıralama yanlılığı (order bias) sorunları barındırdığını ampirik olarak kanıtlamakta; dolayısıyla modelleri sadece nihai cevaplarına göre değil, bilişsel süreçlerine ve davranışsal tutarlılıklarına göre değerlendiren derinlemesine inceleme protokollerine duyulan kritik ihtiyacı vurgulamaktadır.

Özet (Çeviri)

This study proposes a novel and structured testing framework that transcends traditional question-answering methods to evaluate the arithmetic reasoning abilities of Large Language Models (LLMs). In this context, five different models, Llama, DeepSeek, Mistral, GPT and Gemini, were subjected to a comprehensive analysis encompassing 1,860 questions and 60 sessions, utilizing a controlled and derived question set based on a complex text selected from the DROP dataset. The evaluation process was designed multidimensionally, incorporating not only traditional quantitative metrics but also qualitative criteria such as retrieval, four operation and repetition errors, as well as logical inconsistencies. The findings reveal that the models diverge sharply in terms of arithmetic reasoning stability, and that high accuracy rates do not always reflect genuine logical reasoning skills. Although proprietary models outperformed open-source systems in overall accuracy rates, it was observed that they experienced significant inconsistencies and/or logical disconnects when the input format or question order was altered. These results empirically prove that LLM performances harbor issues of statistical recall and order bias that cannot be resolved solely through scaling, thereby underscoring the critical need for in-depth evaluation protocols that assess models based on their cognitive processes and behavioral consistencies rather than merely their final answers.

Benzer Tezler

  1. Köprüüstü simülatör uygulamaları ile teknik ve davranışsal becerilerin ölçülmesine yönelik model önerisi

    A model proposal for evaluating technical and behavioral skills through bridge simulator practices

    EDA KEFELİ

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Denizcilikİstanbul Teknik Üniversitesi

    Deniz Ulaştırma İşletme Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ ESMA UFLAZ

    DOÇ. DR. ALİ CEM KUZU

  2. Development of a coverage-driven cocotb-based functional verification framework for the RISC-V load-store and r-type instructions

    Rısc-v yükleme-saklama ve r-tipi buyrukları için kapsam odaklı cocotb tabanlı bir fonksiyonel doğrulama ortamının geliştirilmesi

    ŞENNUR GÜNEY

    Yüksek Lisans

    İngilizce

    İngilizce

    2024

    Elektrik ve Elektronik MühendisliğiGebze Teknik Üniversitesi

    Elektronik Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ İHSAN ÇİÇEK

  3. Application of the control theory for processing of environmental indicators and determination of the environmental sustainability index

    Kontrol teorisinin çevresel göstergelerin oluşturulmasına uygulanması ve çevresel sürdürülebilirlik endeksinin tanımlanması

    MERİH KERESTECİOĞLU

    Doktora

    İngilizce

    İngilizce

    1999

    Çevre Mühendisliğiİstanbul Teknik Üniversitesi

    PROF.DR. ETHEM GÖNENÇ

  4. İngilizce Hazırlık Programı Dinleme-Konuşma dersi konuşma alt alanının Tyler'ın Hedefe Dayalı Değerlendirme Modeline göre değerlendirilmesi

    Evaluation of the speaking sub-component of the Listening-Speaking course in the English Preparatory Program based on Tyler's Goal Oriented Evaluation Model

    İLHAN YADİGAR KILAVUZ

    Yüksek Lisans

    Türkçe

    Türkçe

    2024

    Eğitim ve ÖğretimBurdur Mehmet Akif Ersoy Üniversitesi

    Eğitim Bilimleri Ana Bilim Dalı

    PROF. DR. RAMAZAN SAĞ