Geri Dön

Quality of instructor- and AI-generated feedback on EFL opinion writing: A multi-dimensional comparison

Yabancı dil olarak İngilizce yazılan fikir yazıları üzerine öğretmen ve yapay zeka tarafından oluşturulan geri bildirimlerin kalitesi: Çok boyutlu bir karşılaştırma

  1. Tez No: 1020982
  2. Yazar: GÖKÇEN BAHADIR
  3. Danışmanlar: DOÇ. DR. ZEKİYE MÜGE TAVİL
  4. Tez Türü: Yüksek Lisans
  5. Konular: Eğitim ve Öğretim, Education and Training
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: Gazi Üniversitesi
  10. Enstitü: Eğitim Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Yabancı Diller Eğitimi Ana Bilim Dalı
  12. Bilim Dalı: İngiliz Dili Eğitimi Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu çalışma, Türkiye'deki bir devlet üniversitesinin hazırlık programı öğrencileri tarafından yazılan B1 düzeyindeki fikir yazılarına, deneyimli İngilizce okutmanları ve ChatGPT-5.1 tarafından sağlanan yazılı geri bildirimlerin kalitesini, Steiss ve arkadaşlarından (2024) uyarlanan beş boyutlu bir analitik dereceli puanlama anahtarı (ölçüt referanslılık, açıklık, doğruluk, önceliklendirme ve destekleyici ton) kullanarak karşılaştırmıştır. Çalışmada, her iki geri bildirim kaynağının aynı on denemeyi iki farklı koşulda değerlendirdiği 2x2 tekrarlı ölçümler karşılaştırmalı deseni kullanılmıştır: hata düzeltme sembolleri tablosu dışında herhangi bir yapılandırılmış değerlendirme rehberliğinin sağlanmadığı serbest koşul ve IELTS Yazma Görevi 2 Bant Tanımlayıcılarından uyarlanan bir geri bildirim protokolünün ek olarak sunulduğu rehberli koşul. Türkiye genelinde beş devlet üniversitesinde görev yapan sekiz İngilizce okutmanı, her iki koşulda da on denemenin tamamına geri bildirim sağlamış ve toplam 160 insan geri bildirimi örneği elde edilmiştir; ChatGPT-5.1 ise aynı denemelere aynı koşullar altında geri bildirim sağlayarak toplam 20 yapay zekâ geri bildirimi örneği üretmiştir. İki eğitimli puanlayıcı, uyarlanan dereceli puanlama anahtarını kullanarak toplam 180 geri bildirim örneğinin tamamını puanlamış ve puanlayıcılar arası güvenirlik (Cohen's Kappa) boyutlara göre .76 ile .84 arasında değişmiştir. Shapiro-Wilk testleri verilerin normal dağılım göstermediğini ortaya koyduğundan, tüm karşılaştırmalarda Wilcoxon işaretli sıralar testi kullanılmış ve etki büyüklükleri r olarak raporlanmıştır. Bulgular, serbest koşulda ChatGPT-5.1'in ölçüt referanslılık, açıklık, doğruluk ve destekleyici ton boyutlarında okutmanlardan anlamlı düzeyde üstün performans gösterdiğini (tüm r ≥ .73), okutmanların ise önceliklendirme boyutunda anlamlı bir üstünlük sergilediğini (r = .90) ortaya koymuştur. Rehberli koşulda ise ChatGPT-5.1, önceliklendirme dahil olmak üzere beş boyutun tamamında okutmanlardan anlamlı düzeyde üstün performans göstermiş; bu durum, yapılandırılmış rehberliğin okutmanların tek üstünlük alanını ortadan kaldırdığını ve kaynaklar arasındaki performans farkını daraltmak yerine genişlettiğini göstermiştir. Kaynak-içi karşılaştırmalar, yapılandırılmış rehberliğin okutmanlar için seçici etkiler ürettiğini; ölçüt referanslılık ve doğruluk boyutlarını geliştirirken destekleyici tonda anlamlı bir düşüşe yol açtığını, açıklık, önceliklendirme ve toplam puanda ise anlamlı bir değişim yaratmadığını göstermiştir. Bireysel düzeydeki analizler, okutmanlar arasında iki kutuplu bir örüntü ortaya koymuş; dört okutman rehberlik altında belirgin bir gelişim gösterirken diğer dört okutman net bir gerileme sergilemiştir. ChatGPT-5.1 için rehberlik, önceliklendirme puanlarında tam bir dönüşüme (sabit 3 puandan sabit 5 puana) ve toplam geri bildirim kalitesinde anlamlı bir artışa yol açarken, doğruluk ve destekleyici ton her iki koşulda da tavan etkisi göstermiştir. Bulgular, hiçbir geri bildirim kaynağının koşulsuz biçimde üstün olmadığını göstermektedir: ChatGPT-5.1 değerlendirme kesinliği, dilsel doğruluk ve tonsal tutarlılık açısından istikrarlı güçlü yönler sergilerken, okutmanlar yapılandırılmamış koşullarda bağlama duyarlı önceliklendirme konusunda belirgin bir üstünlüğe sahiptir; ancak bu üstünlük yapılandırılmış rehberlik altında korunmamaktadır. Çalışma, güncel nesil bir büyük dil modeli kullanarak, yeterince araştırılmamış bir yabancı dil olarak İngilizce bağlamında insan-yapay zekâ geri bildirim karşılaştırmasına yönelik bağlama özgü ampirik kanıtlar sunmakta ve Steiss ve arkadaşlarının (2024) çalışmasının bir replikasyonu ve genişletilmesi niteliği taşıyarak yabancı dil olarak İngilizce yazma eğitiminde geri bildirim protokollerinin tasarımı ve yapay zekâ entegrasyonu açısından çıkarımlar sunmaktadır.

Özet (Çeviri)

This study compared the quality of written feedback produced by experienced EFL instructors and ChatGPT-5.1 on B1-level opinion essays written by Turkish university preparatory students, using a five-dimension analytic rubric (criterion-referencing, clarity, accuracy, prioritization, and supportive tone) adapted from Steiss et al. (2024). A 2×2 repeated-measures comparative design was employed, in which both feedback sources evaluated the same ten essays under two conditions: a free condition, in which no structured evaluative guidance was provided beyond an error correction symbols table, and a guided condition, in which a feedback protocol adapted from the IELTS Writing Task 2 Band Descriptors was additionally provided. Eight EFL instructors employed at five state universities across Türkiye produced feedback on all ten essays under both conditions, yielding 160 human feedback instances; ChatGPT-5.1 produced feedback on the same essays under the same conditions, yielding 20 AI feedback instances. Two trained raters scored all 180 feedback instances using the adapted rubric, with inter-rater reliability (Cohen's kappa) ranging from .76 to .84 across dimensions. As Shapiro-Wilk tests indicated non-normal distributions, Wilcoxon signed-rank tests were used for all comparisons, with effect sizes reported as r. Results showed that in the free condition, ChatGPT-5.1 significantly outperformed instructors on criterion-referencing, clarity, accuracy, and supportive tone (all r ≥ .73), while instructors demonstrated a significant advantage on prioritization (r = .90). In the guided condition, ChatGPT-5.1 significantly outperformed instructors on all five dimensions, including prioritization, indicating that structured guidance eliminated instructors' sole area of advantage and widened, rather than narrowed, the overall performance gap. Within-source comparisons revealed that structured guidance produced selective effects for instructors, improving criterion-referencing and accuracy but producing a significant decline in supportive tone, with no significant change in clarity, prioritization, or total score. Individual-level analysis further revealed a bipartite pattern among instructors, with four improving substantially under guidance and four showing net declines. For ChatGPT-5.1, guidance produced a complete transformation in prioritization scores (from a uniform score of 3 to a uniform score of 5) and a significant increase in total feedback quality, while accuracy and supportive tone remained at ceiling levels in both conditions. The findings indicate that neither feedback source is unconditionally superior: ChatGPT-5.1 demonstrates consistent strengths in evaluative precision, linguistic accuracy, and tonal consistency, while instructors retain a distinct advantage in context-sensitive prioritization under unguided conditions, an advantage that structured guidance does not preserve. The study contributes context-specific empirical evidence on human-AI feedback comparison in an under-researched EFL setting using a current-generation large language model, and offers a replication and extension of Steiss et al. (2024) with implications for the design of feedback protocols and AI integration in EFL writing instruction.

Benzer Tezler

  1. Human or machine? A study on the role of ai and teacher feedback in writing instruction for EFL learners

    İnsan mı makine mı? EFL öğrencileri için yazma eğitiminde yapay zeka ve öğretmen geri bildiriminin rolü üzerine bir çalışma

    ALİ YASİN YILMAZ

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Eğitim ve ÖğretimÇağ Üniversitesi

    İngiliz Dili Eğitimi Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ GÜRCAN DEMİROGLARI

  2. Yükseköğretimde Eğitmen ve Üretken Yapay Zekâ Destekli Geri Bildirimlerin Etkililiğine İlişkin Öğrenci Algılarının İncelenmesi

    Examining Student Perceptions Regarding the Effectiveness of Instructor and Generative AI-Supported Feedback in Higher Education

    AYŞEGÜL PÜRBUDAK

    Doktora

    Türkçe

    Türkçe

    2026

    Eğitim ve ÖğretimAnkara Üniversitesi

    Bilgisayar ve Öğretim Teknolojileri Eğitimi Ana Bilim Dalı

    DOÇ. DİLEK DOĞAN KARAOĞLU

    PROF. AYFER ALPER

  3. ChatGPT vs. teacher feedback: Impact on university preparatory class essay writing quality

    ChatGPT ve öğretmen geri bildirimi: Üniversite hazırlık sınıfı deneme yazma kalitesi üzerindeki etkisi

    HATİCE ESLEM BAŞAR

    Yüksek Lisans

    İngilizce

    İngilizce

    2026

    Eğitim ve ÖğretimHacettepe Üniversitesi

    Yabancı Diller Eğitimi Ana Bilim Dalı

    PROF. DR. ELENA ANTONOVA ÜNLÜ

  4. Öğretimsel videolar için öğretme analitiği temelli pedagojik rehberlik sisteminin geliştirilmesi, uygulanması ve değerlendirilmesi

    Development, implementation, and evaluation of a teaching analytics-based pedagogical guidance system for instructional videos

    ARİF DAŞ

    Doktora

    Türkçe

    Türkçe

    2025

    Eğitim ve ÖğretimAtatürk Üniversitesi

    Bilgisayar ve Öğretim Teknolojileri Eğitimi Ana Bilim Dalı

    PROF. DR. ENGİN KURŞUN

  5. İmalat sistemlerinin tasarlanması ve öncelik kurallarının belirlenmesinde yapay sinir ağlarının kullanılması

    <the use of neural networks in determination of the manufacturing systems design and dispatching rules

    TARIK ÇAKAR

    Doktora

    Türkçe

    Türkçe

    1997

    İşletmeİstanbul Teknik Üniversitesi

    İşletme Mühendisliği Ana Bilim Dalı

    PROF. DR. AYHAN TORAMAN