Geri Dön

Comparison and evaluation of large language models (LLMS) in mathematics education

Matematik eğitiminde büyük dil modellerinin (LLM) karşılaştırılması ve değerlendirilmesi

  1. Tez No: 977372
  2. Yazar: TÜRKÜ YILDIRIM
  3. Danışmanlar: DR. ÖĞR. ÜYESİ HAKAN EMEKCİ
  4. Tez Türü: Yüksek Lisans
  5. Konular: Matematik, Eğitim ve Öğretim, İstatistik, Mathematics, Education and Training, Statistics
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: Ted Üniversitesi
  10. Enstitü: Lisansüstü Programlar Enstitüsü
  11. Ana Bilim Dalı: Uygulamalı Veri Bilimi Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Eğitim sektöründe hızla yaygınlaşan üretken yapay zeka (GenAI) sistemleri arasında yer alan büyük dil modellerinin (LLM) kullanımı günümüzde kritik ve önemli bir hale gelmiştir. LLM'lerin matematik eğitimi bağlamında değerlendirilmesi ve karşılaştırılması büyük önem kazanmıştır. Bu çalışma, dört farklı LLM'in matematiksel problem çözme yeteneklerini hem nihai cevap doğruluğuna hem de adım adım muhakeme aşamalarına göre kapsamlı bir şekilde incelemektedir. Matematik eğitiminde yaygın olarak kullanılan bir veri seti olan Grade School Mathematics'i (GSM8K) ölçüt olarak kullanarak, çoklu talimatlara göre ayarlanmış LLM'lerin (Gemini 2.0 Flash, Llama-3-8B-Instruct, Qwen2.5-Math ve Mistral-7B-Instruct) performansları karşılaştırılmıştır. Bulunan sonuçlar, nihai cevap doğruluğunda bir kontrast ortaya koymaktadır; bir model neredeyse insan güvenilirliğine ulaşırken, diğerleri önemli ölçüde daha düşük cevap doğruluğu oranlarında kümelenmektedir. Bu farklılıkları araştırmak için model yanıtlarının adım dağılımlarını analiz ediyor ve bunları GSM8K'nın içsel yapısıyla karşılaştırıyoruz. Veri seti kısa ve öz bir yapı göstererek 2 ila 4 adımlı çözümlere odaklanmış olsa da, model yanıtları farklı eğilimler göstermektedir: Bazıları gerekli adım sayısını aşarak muhakeme zincirlerini sistematik olarak uzatırken, diğerleri nihai bir sayısal yanıt vermemektedir. Bu dağılımlar, ayrıntılı ve yetersiz muhakeme başarısızlık durumlarını vurgulamakta ve nihai cevap doğruluğun tek başına LLM'lerin matematiksel muhakeme yeteneklerinin inceliklerini tam olarak ortaya koyamadığını göstermektedir. Sonuçlarımız, mevcut yöntemlerin potansiyelini ve dezavantajlarını vurgulamakta ve doğru matematiksel muhakemenin içsel bilişsel problem yapılarıyla uyum gerektirdiğini göstermektedir.

Özet (Çeviri)

The use of large language models (LLMs), which are among the generative artificial intelligence (GenAI) systems rapidly increasing in the education sector, has become critical and important. It has become vitally significant to evaluate and compare LLMs in the context of mathematics education. This study comprehensively investigates the mathematical problem-solving capabilities of four distinct LLMs, with a focus on both final answer accuracy and step-by-step reasoning patterns. Using the Grade School Mathematics (GSM8K), a widely used dataset in mathematics education, as the benchmark, we compare the performance of multiple instruction-tuned LLMs (Gemini 2.0 Flash, Llama-3-8B-Instruct, Qwen2.5-Math, and Mistral-7B-Instruct). Our results unveil a contrast in final answer accuracy, where one model achieves near-human reliability while others cluster around substantially lower accuracy scores. In order to probe these discrepancies, we analyze step distributions of model responses and contrast them with the intrinsic structure of GSM8K. Although the dataset is naturally centered on succinct 2 to 4 step solutions, the model responses show varying tendencies: some systematically inflate reasoning chains beyond the required step count, while others collapse prematurely without providing a final numeric response. The verbose and under-reasoning failure modes are highlighted by these distributions, demonstrating that accuracy by itself is unable to fully convey the subtleties of LLMs' mathematical reasoning abilities. Together, our results highlight the potential and drawbacks of existing methods, showing that accurate mathematical reasoning necessitates alignment with the inherent cognitive problem structures.

Benzer Tezler

  1. Kuantum hesaplama temelli optimizasyon yöntemleri ile büyük dil modellerinin eğitim ve çıkarım süreçlerinin iyileştirilmesi

    Improving training and inference processes of large language models with quantum computing-based optimization methods

    BETÜL CANDAN

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolMarmara Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ ALİ SARIKAŞ

  2. Doğal dil ile SQL ve görselleştirme koduna dönüşümde büyük dil modellerinin karşılaştırmalı analizi

    Comparative analysis of large language models for natural language to SQL and visualization code generation

    BAYKAL MEHMET UÇAR

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Hesaplamalı Bilim ve Mühendislik Ana Bilim Dalı (disiplinlerarası)

    DOÇ. DR. SEFER BADAY

  3. Politika duyarlı text-to-SQL ajanının postgresql satır düzeyi güvenlik (RLS) ile uygulamalı değerlendirilmesi

    Applied evaluation of the policy-sensitive text-to-SQL agent with postgresql row level security (RLS)

    ALI ATIA ALI KOUNDI

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya Üniversitesi

    Bilişim Sistemleri Mühendisliği Ana Bilim Dalı

    PROF. DR. İSMAİL HAKKI CEDİMOĞLU

  4. Advancements in vector retrieval: Analyzing methods and applications in NLP and LLM

    Vektör çıkarımındaki gelişmeler: Yöntemlerin ve uygulamaların NLP ve büyük dil modellerinde incelenmesi

    YAZIM BERİL ULUER

    Yüksek Lisans

    İngilizce

    İngilizce

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstinye Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ ALPER ÖNER

  5. Turkuaz Türkçe anlamsal temsil modeli ve çok bağlamlı bilgi getirimi kıyaslama veri kümesi

    Turkuaz Turkish semantic representation model and multi-context information retrieval benchmark

    ENES SADİ UYSAL

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolYıldız Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. MEHMET FATİH AMASYALI