Human vs. AI scoring in EFL writing: A criterion-based investigation within the CEFR context
Yabancı dil olarak İngilizce yazma becerisinde insan ve yapay zekâ puanlaması: CEFR bağlamında ölçüt temelli bir inceleme
- Tez No: 992325
- Danışmanlar: DR. ÖĞR. ÜYESİ EYYÜP YAŞAR KÜRÜM
- Tez Türü: Yüksek Lisans
- Konular: İngiliz Dili ve Edebiyatı, English Language and Literature
- Anahtar Kelimeler: artificial intelligence, EFL writing assessment, CEFR, ChatGPT, preparatory program, yapay zekâ, EFL yazma değerlendirmesi, CEFR, ChatGPT, hazırlık programı
- Yıl: 2025
- Dil: İngilizce
- Üniversite: İstanbul Aydın Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Yabancı Diller Eğitimi Ana Bilim Dalı
- Bilim Dalı: İngiliz Dili Öğretimi Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
This study explores the extent to which AI-generated evaluations align with human raters' evaluations in assessing the writing of English as a Foreign Language (EFL) learners in a Turkish university preparatory program. The research focuses on four CEFR-aligned writing assessment criteria: organization, content, use of English, and lexical resource. Writing samples from twelve students at levels A1 to B2 were evaluated by two groups: twenty-two human raters and ChatGPT+, using a shared rubric. The study adopts a comparative mixed-methods design, combining quantitative analysis of scoring patterns with qualitative interpretation of justification comments provided by four human raters and the AI system. Descriptive statistics and significance tests were used to examine differences between human raters and AI scores, while open-ended justifications helped reveal underlying reasoning for discrepancies. Findings indicate a moderate to high level of agreement in overall scoring trends between ChatGPT+ and human raters, particularly in the criteria of organization and content. However, noticeable discrepancies were observed in lexical resource ratings across CEFR levels. Human raters also demonstrated greater variation in their scoring of“use of English,”especially at lower proficiency levels. These results suggest that AI-based writing evaluation tools like ChatGPT+ can serve as a supplementary resource in formative assessment, supporting teachers by providing immediate and consistent feedback. Nevertheless, human oversight remains indispensable, particularly in subjective areas such as organization and content, where teacher expertise ensures fairness, contextual sensitivity, and pedagogical validity.
Özet (Çeviri)
Bu çalışma, yapay zeka tabanlı değerlendirmelerin, bir Türk üniversitesinin hazırlık programında öğrenim gören İngilizceyi yabancı dil olarak öğrenen öğrencilerin yazılarında, öğretmenlerin puanlamalarıyla ne ölçüde örtüştüğünü incelemektedir. Araştırma, Avrupa Dilleri Ortak Çerçeve Programı'na uyumlu dört yazma değerlendirme ölçütüne odaklanmıştır: organizasyon, içerik, İngilizce kullanımı ve sözcük bilgisi. A1'den B2'ye kadar farklı düzeylerdeki on iki öğrencinin yazma örnekleri, yirmi iki öğretmen ve ChatGPT+ tarafından ortak bir rubrik kullanılarak değerlendirilmiştir. Araştırma, nicel puanlama eğilimlerinin karşılaştırmalı analizini ve dört öğretmen ile yapay zeka tarafından sağlanan gerekçelendirme yorumlarının nitel incelemesini birleştiren karma yöntemli bir tasarım benimsemiştir. Betimsel istatistikler ve anlamlılık testleri, insan değerlendiriciler ve yapay zeka puanları arasındaki farklılıkları ortaya koyarken, açık uçlu gerekçelendirmeler ise bu farklılıkların ardındaki düşünme süreçlerini açığa çıkarmıştır. Bulgular, ChatGPT+ ile öğretmenler arasında genel puanlama eğilimlerinde orta ile yüksek düzeyde bir uyum olduğunu göstermektedir; özellikle organizasyon ve içerik ölçütlerinde benzerlik dikkat çekicidir. Ancak, CEFR düzeylerinde sözcük bilgisi ölçütünde belirgin farklılıklar gözlenmiş, ayrıca özellikle düşük yeterlik düzeylerinde insan değerlendiriciler İngilizce kullanımı ölçütünde daha büyük varyans sergilemiştir. Bu sonuçlar, ChatGPT+ gibi yapay zeka tabanlı yazma değerlendirme araçlarının, insan gözetimi ve ölçüt bazlı kalibrasyonla desteklenmesi koşuluyla, EFL bağlamlarında biçimlendirici değerlendirme sürecinde tamamlayıcı bir kaynak olarak kullanılabileceğini göstermektedir. Bununla birlikte, organizasyon ve içerik gibi daha öznel alanlarda ortaya çıkan küçük farklılıklar, öğretmenlerin nihai karar verici rolünün pedagojik açıdan vazgeçilmez olduğunu vurgulamaktadır.
Benzer Tezler
- Kolorektal kanser tanısı için güvenli çok dilli LLM tabanlı diyalog sistemi: Guardrails ve Monte Carlo risk puanlamasının entegrasyonu
A secure multilingual LLM-based dialogue system for colorectal cancer diagnosis: Integration of guardrails and Monte Carlo risk scoring
ABDURRAHİM KIZILAY
Yüksek Lisans
Türkçe
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAfyon Kocatepe ÜniversitesiBilgisayar Ana Bilim Dalı (disiplinlerarası)
DR. ÖĞR. ÜYESİ KEREM GENCER
- Meme kanserinde tümör infiltre lenfosit skorunun yapay zeka analiziyle tespiti ve patologlar ile uyumunun belirlenmesi
Detection of tumor-infiltrating lymphocyte score in breast cancer using artificial intelligence analysis and assessment of concordance with pathologists
İBRAHİM ALOĞLU
Tıpta Uzmanlık
Türkçe
2025
PatolojiSağlık Bilimleri ÜniversitesiTıbbi Patoloji Ana Bilim Dalı
PROF. DR. FÜGEN AKER
- Doğal dil ile SQL ve görselleştirme koduna dönüşümde büyük dil modellerinin karşılaştırmalı analizi
Comparative analysis of large language models for natural language to SQL and visualization code generation
BAYKAL MEHMET UÇAR
Yüksek Lisans
Türkçe
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiHesaplamalı Bilim ve Mühendislik Ana Bilim Dalı (disiplinlerarası)
DOÇ. DR. SEFER BADAY
- Bağırsak hasar modellerinde kemik iliği mezenkimal kök hücre ve bağırsak mezenkimal kök hücrelerin rejeneratif ve immün modülatuvar etkilerinin karşılaştırılması
Comparison of regenerative and immune modulatory effecets of bone marrow and intestinal mesenchymal stem cells i intestinal damage models
BURCU PERVİN
Doktora
İngilizce
2025
BiyolojiHacettepe ÜniversitesiKök Hücre Ana Bilim Dalı
DOÇ. DR. FATİMA AERTS KAYA
- AHP ve TOPSIS yöntemlerini kullanarak tip 2 diyabet hastalığı için risk puanı hesaplama ve en iyi tedavi seçeneğini belirleme
Identification of the ideal treatment option and calculation the risk score for the type 2 diabetes mellitus by using AHP and TOPSIS methods
SERCAN DİNÇ
Yüksek Lisans
Türkçe
2019
Endüstri ve Endüstri Mühendisliğiİstanbul Teknik ÜniversitesiEndüstri Mühendisliği Ana Bilim Dalı
PROF. DR. YUSUF İLKER TOPCU