Ai-powered EFL writing assessment: Investigating the validity and reliability of large language models in automated scoring
Yapay zekâ destekli İngilizce yazma değerlendirmesi: Otomatik puanlamada büyük dil modellerinin geçerlik ve güvenirliğinin incelenmesi
- Tez No: 1010818
- Danışmanlar: PROF. DR. SALİM RAZI, DR. ÖZGÜR ÇELİK
- Tez Türü: Yüksek Lisans
- Konular: Eğitim ve Öğretim, Education and Training
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: İngilizce
- Üniversite: Çanakkale Onsekiz Mart Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Yabancı Diller Eğitimi Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu tezin amacı, Büyük Dil Modellerinin Otomatik Kompozisyon Değerlendirme araçları olarak güvenirliğini ve geçerliğini değerlendirmek; bu modellerin tutarlılık ve doğruluğunu insan tarafından yapılan değerlendirmelerle karşılaştırmak ve alan özgü ince ayarın performansı arttırmadaki etkililiğini incelemektir. Bu doğrultuda, öğrenci kompozisyonları toplanmış ve Akademik Yazımın Temelleri Rubriği (FAWR, Razı, 2023) doğrultusunda puanlamıştır. Devamında, bu öğrenci kompozisyonları temel ve ince ayar çekilmiş Büyük Dil Modelleri ile puanlamıştır. Son olarak ise, verilerin güvenilirliği Sınıf İçi Korelasyon Katsayısı, geçerliliği Spearman Sıralama Korelasyonu, ince ayarın etkililiği ise Ortalama Mutlak Sapma ile analiz edilmiştir. Bulgular güvenirliğin modellerin temel mimarileri ve önceliklerine bağlı olduğunu gösterirken, geçerliğinin model kaynaklı farklılıklara ve veri setine bağlı olduğunu ortaya koymuştur. İnce ayar değerlendirildiğinde ise, bu sürecin alana özgü ince ayar ve aşırı uyum gibi faktörlerin etkisiyle, değerlendirmede hem iyileşmeye hem de kötüleşmeye yol açtığını göstermektedir. Bu analizlerin sonuçlarındaki değişmeler ve farklılıklar Büyük Dil Modellerinin insan muhakemesini yerine geçmekten ziyade, onların destekleyici araçlar olarak kullanılma potansiyeli taşıdığını göstermektedir.
Özet (Çeviri)
The purpose of this thesis is to evaluate the reliability and validity of Large Language Models (LLMs) as Automated Essay Scoring (AES) tools by comparing their consistency and accuracy against human-graded benchmarks, while investigating the efficacy of domain specific fine-tuning in improving performance. Accordingly, student essays were gathered and graded based on Fundamentals of Academic Writing Rubric (FAWR, Razı, 2023). Following this, these student essays were scored by base and fine-tuned LLMs. Finally, the data were analyzed reliability of LLMs using Intraclass Correlation Coefficient (ICC), assessed validity using Spearman's Rank Correlation, and evaluated the efficacy of fine tuning using Mean Absolute Error (MAE). The findings indicated that reliability varies depending on the underlying architectures and priorities of models, whereas validity is influenced by model-based differences and the dataset. Regarding fine-tuning, the results showed that this process lead to both improvements and degradations in the evaluation of rubric criteria driving from factors such as domain-specific fine-tuning and overfitting. The variances observed in validity, reliability and efficacy of fine-tuning show that LLMs suggest a potential to be used as augmentation tools rather than a replacement for human judgment.
Benzer Tezler
- Üretken yapay zekâ destekli otomatik metin değerlendirme sisteminin tasarlanması, geliştirilmesi, uygulanması ve değerlendirilmesi
Design, development, implementation and evaluation of a generative aı-supported automatic text evaluation system
EDA SAKA ŞİMŞEK
Doktora
Türkçe
2025
Eğitim ve ÖğretimAtatürk ÜniversitesiBilgisayar ve Öğretim Teknolojileri Eğitimi Ana Bilim Dalı
DOÇ. DR. EMBİYA ÇELİK
- Exploring the combination of ai-powered writing assistants and the teacher-written feedback in EFL writing classes
EFL yazma sınıflarında yapay zeka destekli yazma asistanları ile öğretmen geri bildirimlerinin kombinasyonunun incelenmesi
MİHRİ DİŞLİ
Yüksek Lisans
İngilizce
2025
Eğitim ve Öğretimİstanbul Aydın Üniversitesiİngiliz Dili Eğitimi Ana Bilim Dalı
DR. HÜLYA YUMRU
- The impact of artificial intelligence-powered writing assistance systems on metacognitive writing strategies in the EFL learning context
Yapay zekâ destekli yazma sistemlerinin yabancı dil olarak İngilizce öğrenme bağlamında üstbilişsel yazma stratejileri üzerindeki etkisi
ECE HATİCE BERK
Yüksek Lisans
İngilizce
2024
Eğitim ve Öğretimİstanbul Medeniyet ÜniversitesiYabancı Diller Eğitimi Ana Bilim Dalı
PROF. DR. SELAMİ AYDIN
- Comparing the impact of teacher feedback and combined automated and teacher feedback on EFL learners' paragraph writing performance
Öğretmen geri bildirimi ve birleştirilmiş otomatik geri bildirim ve öğretmen geri bildirimi modelinin yabancı dil olarak İngilizce öğrenen öğrencilerin paragraf yazma performansı üzerindeki etkisinin karşılaştırılması
FATMA UZMAN
Yüksek Lisans
İngilizce
2025
Eğitim ve ÖğretimAnadolu ÜniversitesiYabancı Diller Eğitimi Ana Bilim Dalı
DR. ÖĞR. ÜYESİ AYLİN SEVİMEL ŞAHİN
- Investigating the impact of ChatGPT on EFL student engagement, autonomy, and writing skills
ChatGPT'nin İngilizceyi yabancı dil olarak öğrenen öğrencinin katılımını, özerklik, ve yazma becerileri üzerindeki etkisinin incelenmesi
DERİN GÖRMÜŞ
Yüksek Lisans
İngilizce
2025
Eğitim ve ÖğretimÇukurova Üniversitesiİngiliz Dili Eğitimi Ana Bilim Dalı
PROF. DR. YASEMİN KIRKGÖZ