Geri Dön

Ai-powered EFL writing assessment: Investigating the validity and reliability of large language models in automated scoring

Yapay zekâ destekli İngilizce yazma değerlendirmesi: Otomatik puanlamada büyük dil modellerinin geçerlik ve güvenirliğinin incelenmesi

  1. Tez No: 1010818
  2. Yazar: İREM SILA ÖZER
  3. Danışmanlar: PROF. DR. SALİM RAZI, DR. ÖZGÜR ÇELİK
  4. Tez Türü: Yüksek Lisans
  5. Konular: Eğitim ve Öğretim, Education and Training
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: Çanakkale Onsekiz Mart Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Yabancı Diller Eğitimi Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu tezin amacı, Büyük Dil Modellerinin Otomatik Kompozisyon Değerlendirme araçları olarak güvenirliğini ve geçerliğini değerlendirmek; bu modellerin tutarlılık ve doğruluğunu insan tarafından yapılan değerlendirmelerle karşılaştırmak ve alan özgü ince ayarın performansı arttırmadaki etkililiğini incelemektir. Bu doğrultuda, öğrenci kompozisyonları toplanmış ve Akademik Yazımın Temelleri Rubriği (FAWR, Razı, 2023) doğrultusunda puanlamıştır. Devamında, bu öğrenci kompozisyonları temel ve ince ayar çekilmiş Büyük Dil Modelleri ile puanlamıştır. Son olarak ise, verilerin güvenilirliği Sınıf İçi Korelasyon Katsayısı, geçerliliği Spearman Sıralama Korelasyonu, ince ayarın etkililiği ise Ortalama Mutlak Sapma ile analiz edilmiştir. Bulgular güvenirliğin modellerin temel mimarileri ve önceliklerine bağlı olduğunu gösterirken, geçerliğinin model kaynaklı farklılıklara ve veri setine bağlı olduğunu ortaya koymuştur. İnce ayar değerlendirildiğinde ise, bu sürecin alana özgü ince ayar ve aşırı uyum gibi faktörlerin etkisiyle, değerlendirmede hem iyileşmeye hem de kötüleşmeye yol açtığını göstermektedir. Bu analizlerin sonuçlarındaki değişmeler ve farklılıklar Büyük Dil Modellerinin insan muhakemesini yerine geçmekten ziyade, onların destekleyici araçlar olarak kullanılma potansiyeli taşıdığını göstermektedir.

Özet (Çeviri)

The purpose of this thesis is to evaluate the reliability and validity of Large Language Models (LLMs) as Automated Essay Scoring (AES) tools by comparing their consistency and accuracy against human-graded benchmarks, while investigating the efficacy of domain specific fine-tuning in improving performance. Accordingly, student essays were gathered and graded based on Fundamentals of Academic Writing Rubric (FAWR, Razı, 2023). Following this, these student essays were scored by base and fine-tuned LLMs. Finally, the data were analyzed reliability of LLMs using Intraclass Correlation Coefficient (ICC), assessed validity using Spearman's Rank Correlation, and evaluated the efficacy of fine tuning using Mean Absolute Error (MAE). The findings indicated that reliability varies depending on the underlying architectures and priorities of models, whereas validity is influenced by model-based differences and the dataset. Regarding fine-tuning, the results showed that this process lead to both improvements and degradations in the evaluation of rubric criteria driving from factors such as domain-specific fine-tuning and overfitting. The variances observed in validity, reliability and efficacy of fine-tuning show that LLMs suggest a potential to be used as augmentation tools rather than a replacement for human judgment.

Benzer Tezler

  1. Üretken yapay zekâ destekli otomatik metin değerlendirme sisteminin tasarlanması, geliştirilmesi, uygulanması ve değerlendirilmesi

    Design, development, implementation and evaluation of a generative aı-supported automatic text evaluation system

    EDA SAKA ŞİMŞEK

    Doktora

    Türkçe

    Türkçe

    2025

    Eğitim ve ÖğretimAtatürk Üniversitesi

    Bilgisayar ve Öğretim Teknolojileri Eğitimi Ana Bilim Dalı

    DOÇ. DR. EMBİYA ÇELİK

  2. Exploring the combination of ai-powered writing assistants and the teacher-written feedback in EFL writing classes

    EFL yazma sınıflarında yapay zeka destekli yazma asistanları ile öğretmen geri bildirimlerinin kombinasyonunun incelenmesi

    MİHRİ DİŞLİ

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Eğitim ve Öğretimİstanbul Aydın Üniversitesi

    İngiliz Dili Eğitimi Ana Bilim Dalı

    DR. HÜLYA YUMRU

  3. The impact of artificial intelligence-powered writing assistance systems on metacognitive writing strategies in the EFL learning context

    Yapay zekâ destekli yazma sistemlerinin yabancı dil olarak İngilizce öğrenme bağlamında üstbilişsel yazma stratejileri üzerindeki etkisi

    ECE HATİCE BERK

    Yüksek Lisans

    İngilizce

    İngilizce

    2024

    Eğitim ve Öğretimİstanbul Medeniyet Üniversitesi

    Yabancı Diller Eğitimi Ana Bilim Dalı

    PROF. DR. SELAMİ AYDIN

  4. Comparing the impact of teacher feedback and combined automated and teacher feedback on EFL learners' paragraph writing performance

    Öğretmen geri bildirimi ve birleştirilmiş otomatik geri bildirim ve öğretmen geri bildirimi modelinin yabancı dil olarak İngilizce öğrenen öğrencilerin paragraf yazma performansı üzerindeki etkisinin karşılaştırılması

    FATMA UZMAN

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Eğitim ve ÖğretimAnadolu Üniversitesi

    Yabancı Diller Eğitimi Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ AYLİN SEVİMEL ŞAHİN

  5. Investigating the impact of ChatGPT on EFL student engagement, autonomy, and writing skills

    ChatGPT'nin İngilizceyi yabancı dil olarak öğrenen öğrencinin katılımını, özerklik, ve yazma becerileri üzerindeki etkisinin incelenmesi

    DERİN GÖRMÜŞ

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Eğitim ve ÖğretimÇukurova Üniversitesi

    İngiliz Dili Eğitimi Ana Bilim Dalı

    PROF. DR. YASEMİN KIRKGÖZ