Comparison and evaluation of large language models (LLMS) in mathematics education
Matematik eğitiminde büyük dil modellerinin (LLM) karşılaştırılması ve değerlendirilmesi
- Tez No: 977372
- Danışmanlar: DR. ÖĞR. ÜYESİ HAKAN EMEKCİ
- Tez Türü: Yüksek Lisans
- Konular: Matematik, Eğitim ve Öğretim, İstatistik, Mathematics, Education and Training, Statistics
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Ted Üniversitesi
- Enstitü: Lisansüstü Programlar Enstitüsü
- Ana Bilim Dalı: Uygulamalı Veri Bilimi Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Eğitim sektöründe hızla yaygınlaşan üretken yapay zeka (GenAI) sistemleri arasında yer alan büyük dil modellerinin (LLM) kullanımı günümüzde kritik ve önemli bir hale gelmiştir. LLM'lerin matematik eğitimi bağlamında değerlendirilmesi ve karşılaştırılması büyük önem kazanmıştır. Bu çalışma, dört farklı LLM'in matematiksel problem çözme yeteneklerini hem nihai cevap doğruluğuna hem de adım adım muhakeme aşamalarına göre kapsamlı bir şekilde incelemektedir. Matematik eğitiminde yaygın olarak kullanılan bir veri seti olan Grade School Mathematics'i (GSM8K) ölçüt olarak kullanarak, çoklu talimatlara göre ayarlanmış LLM'lerin (Gemini 2.0 Flash, Llama-3-8B-Instruct, Qwen2.5-Math ve Mistral-7B-Instruct) performansları karşılaştırılmıştır. Bulunan sonuçlar, nihai cevap doğruluğunda bir kontrast ortaya koymaktadır; bir model neredeyse insan güvenilirliğine ulaşırken, diğerleri önemli ölçüde daha düşük cevap doğruluğu oranlarında kümelenmektedir. Bu farklılıkları araştırmak için model yanıtlarının adım dağılımlarını analiz ediyor ve bunları GSM8K'nın içsel yapısıyla karşılaştırıyoruz. Veri seti kısa ve öz bir yapı göstererek 2 ila 4 adımlı çözümlere odaklanmış olsa da, model yanıtları farklı eğilimler göstermektedir: Bazıları gerekli adım sayısını aşarak muhakeme zincirlerini sistematik olarak uzatırken, diğerleri nihai bir sayısal yanıt vermemektedir. Bu dağılımlar, ayrıntılı ve yetersiz muhakeme başarısızlık durumlarını vurgulamakta ve nihai cevap doğruluğun tek başına LLM'lerin matematiksel muhakeme yeteneklerinin inceliklerini tam olarak ortaya koyamadığını göstermektedir. Sonuçlarımız, mevcut yöntemlerin potansiyelini ve dezavantajlarını vurgulamakta ve doğru matematiksel muhakemenin içsel bilişsel problem yapılarıyla uyum gerektirdiğini göstermektedir.
Özet (Çeviri)
The use of large language models (LLMs), which are among the generative artificial intelligence (GenAI) systems rapidly increasing in the education sector, has become critical and important. It has become vitally significant to evaluate and compare LLMs in the context of mathematics education. This study comprehensively investigates the mathematical problem-solving capabilities of four distinct LLMs, with a focus on both final answer accuracy and step-by-step reasoning patterns. Using the Grade School Mathematics (GSM8K), a widely used dataset in mathematics education, as the benchmark, we compare the performance of multiple instruction-tuned LLMs (Gemini 2.0 Flash, Llama-3-8B-Instruct, Qwen2.5-Math, and Mistral-7B-Instruct). Our results unveil a contrast in final answer accuracy, where one model achieves near-human reliability while others cluster around substantially lower accuracy scores. In order to probe these discrepancies, we analyze step distributions of model responses and contrast them with the intrinsic structure of GSM8K. Although the dataset is naturally centered on succinct 2 to 4 step solutions, the model responses show varying tendencies: some systematically inflate reasoning chains beyond the required step count, while others collapse prematurely without providing a final numeric response. The verbose and under-reasoning failure modes are highlighted by these distributions, demonstrating that accuracy by itself is unable to fully convey the subtleties of LLMs' mathematical reasoning abilities. Together, our results highlight the potential and drawbacks of existing methods, showing that accurate mathematical reasoning necessitates alignment with the inherent cognitive problem structures.
Benzer Tezler
- Kuantum hesaplama temelli optimizasyon yöntemleri ile büyük dil modellerinin eğitim ve çıkarım süreçlerinin iyileştirilmesi
Improving training and inference processes of large language models with quantum computing-based optimization methods
BETÜL CANDAN
Yüksek Lisans
Türkçe
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolMarmara ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ ALİ SARIKAŞ
- Doğal dil ile SQL ve görselleştirme koduna dönüşümde büyük dil modellerinin karşılaştırmalı analizi
Comparative analysis of large language models for natural language to SQL and visualization code generation
BAYKAL MEHMET UÇAR
Yüksek Lisans
Türkçe
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiHesaplamalı Bilim ve Mühendislik Ana Bilim Dalı (disiplinlerarası)
DOÇ. DR. SEFER BADAY
- Politika duyarlı text-to-SQL ajanının postgresql satır düzeyi güvenlik (RLS) ile uygulamalı değerlendirilmesi
Applied evaluation of the policy-sensitive text-to-SQL agent with postgresql row level security (RLS)
ALI ATIA ALI KOUNDI
Yüksek Lisans
Türkçe
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya ÜniversitesiBilişim Sistemleri Mühendisliği Ana Bilim Dalı
PROF. DR. İSMAİL HAKKI CEDİMOĞLU
- Advancements in vector retrieval: Analyzing methods and applications in NLP and LLM
Vektör çıkarımındaki gelişmeler: Yöntemlerin ve uygulamaların NLP ve büyük dil modellerinde incelenmesi
YAZIM BERİL ULUER
Yüksek Lisans
İngilizce
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstinye ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ ALPER ÖNER
- Turkuaz Türkçe anlamsal temsil modeli ve çok bağlamlı bilgi getirimi kıyaslama veri kümesi
Turkuaz Turkish semantic representation model and multi-context information retrieval benchmark
ENES SADİ UYSAL
Yüksek Lisans
Türkçe
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolYıldız Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. MEHMET FATİH AMASYALI