Geri Dön

Açık uçlu maddelerin otomatik puanlanmasında puanlayıcılar arası güvenirliğin çok yüzeyli Rasch ölçme modeli ile incelenmesi

An Investigation of Inter-Rater Reliability in the Automated Scoring of Open-Ended Items Using the Many-Facet Rasch Measurement Model

  1. Tez No: 1024858
  2. Yazar: GÖKHAN ALTAY
  3. Danışmanlar: DOÇ. DR. EREN CAN AYBEK
  4. Tez Türü: Yüksek Lisans
  5. Konular: Eğitim ve Öğretim, Education and Training
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: Türkçe
  9. Üniversite: Pamukkale Üniversitesi
  10. Enstitü: Eğitim Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Eğitim Bilimleri Ana Bilim Dalı
  12. Bilim Dalı: Eğitimde Ölçme ve Değerlendirme Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu araştırma, açık uçlu maddelerin otomatik puanlanmasında insan ve yapay zekâ tabanlı puanlayıcılar arasındaki güvenirliği çok yüzeyli Rasch ölçme modeli kapsamında incelemeyi amaçlamaktadır. Çalışma, nicel araştırma yöntemlerinden ilişkisel tarama modeli ile yürütülmüştür. Bu doğrultuda insan ve yapay zekâ puanlayıcılar tarafından verilen puanlar arasındaki uyum düzeyleri ve puanlama davranışlarındaki farklılıklar sistematik olarak analiz edilmiştir. Araştırmanın çalışma grubunu 2025-2026 eğitim-öğretim yılında Pamukkale Üniversitesinde Ölçme ve Değerlendirme dersini alan 57 lisans öğrencisi oluşturmaktadır. Veri toplama aracı; araştırmacı tarafından geliştirilen ve uzman görüşleri doğrultusunda revize edilen analitik dereceli puanlama anahtarı (rubrik) ile puanlanan altı açık uçlu maddeden oluşan bir ölçme aracıdır. Maddeler 0-1-2-3 puan aralığında derecelendirilmiş olup çok kategorili yapıdadır. Bu kapsamda analizlerde Rasch temelli modelleme yaklaşımı kullanılmıştır. Öğrenci yanıtları iki insan puanlayıcı ve üç yapay zekâ modeli tarafından sıfır-atım ve birkaç-atım koşullarında bağımsız olarak puanlanmıştır. Yapay zekâ puanlamaları, CLEAR çerçevesi temel alınarak geliştirilen yapılandırılmış bir istem (prompt) aracılığıyla gerçekleştirilmiş ve süreç R Shiny tabanlı RoboRater uygulaması üzerinden yürütülmüştür. Veri analizinde açımlayıcı faktör analizi, Karesel Ağırlıklandırılmış Kappa (Quadratic Weighted Kappa, QWK) katsayıları ve çok yüzeyli Rasch ölçme modeli kullanılmıştır. Analizler R yazılımı ve FACETS programı aracılığıyla gerçekleştirilmiştir. Bulgular, insan puanlayıcılar arasında önemli düzeyde uyum bulunduğunu göstermektedir (QWK = .61-.80). Yapay zekâ modelleri arasındaki uyumun ise sıfır-atım ve birkaç-atım koşullarına bağlı olarak değiştiği belirlenmiştir. Birkaç-atım yaklaşımının bazı model çiftlerinde uyumu artırdığı ancak bu etkinin model özelliklerine göre farklılaştığı görülmüştür. İnsan ve yapay zekâ puanlayıcıların karşılaştırılmasında bazı yapay zekâ modellerinin insan puanlayıcılarla orta ve yüksek düzeyde uyum gösterdiği bazılarında ise uyum düzeyinin daha değişken olduğu belirlenmiştir. Genel olarak model türünün puanlama davranışını etkilediği görülmüştür. Çok yüzeyli Rasch ölçme modeli sonuçları, model-veri uyumunun kabul edilebilir düzeyde olduğunu ve puanlayıcı yüzeyinin ölçme sürecinde önemli bir varyans kaynağı olduğunu göstermiştir. Puanlayıcılar arasında katılık ve cömertlik bakımından anlamlı farklılıklar bulunmuş, insan ve yapay zekâ puanlayıcıların sistematik biçimde farklılaşabildiği belirlenmiştir. Madde analizleri ise maddelerin farklı zorluk düzeylerine sahip olduğunu ve ölçme aracının yapısal olarak güçlü bir yapıya sahip olduğunu ortaya koymuştur. Elde edilen bulgular, açık uçlu maddelerin otomatik puanlanmasında insan ve yapay zekâ puanlayıcıların puanlama davranışlarının sistematik olarak değişebildiğini ve puanlayıcı değişkeninin ölçme sonuçları üzerinde önemli bir etkiye sahip olduğunu göstermektedir. Çalışma, insan-yapay zekâ uyumuna ilişkin deneysel kanıt sunmakta ve otomatik puanlama sistemlerinin geliştirilmesine yönelik kuramsal ve uygulamalı katkı sağlamaktadır.

Özet (Çeviri)

The present study aims to examine the reliability between human and artificial intelligence–based raters in the automated scoring of open-ended items within the framework of the Many-Facet Rasch Measurement Model (MFRM). The study was conducted using a correlational survey design, one of the quantitative research methods. In this regard, the levels of agreement between the scores given by human and artificial intelligence raters and the differences in scoring behaviors were analyzed. The study group consisted of 57 undergraduate students enrolled in the Measurement and Evaluation course offered at Pamukkale University during the 2025-2026 academic year. The data collection instrument was an assessment tool developed by the researcher and revised based on expert opinions, consisting of six open-ended items that were scored using an analytic scoring rubric. The items were rated on a 0-1-2-3 score range and had a polytomous structure. In this context, a Rasch-based modeling approach was used in the analyses. Student responses were independently scored by two human raters and three large language models under zero-shot and few-shot conditions. The artificial intelligence scoring was conducted using a structured prompt developed based on the CLEAR Framework, and the process was carried out through the R Shiny–based RoboRater application. In the data analysis process, exploratory factor analysis (EFA), Quadratic Weighted Kappa (QWK) coefficients, and the Many-Facet Rasch Measurement Model were used. The analyses were performed using R software and the FACETS program. The findings indicate that there was a significant level of agreement between human raters (QWK =.61-.80). It was determined that the level of agreement among artificial intelligence models varied depending on the zero-shot and few-shot conditions. It was observed that the few-shot approach increased agreement in some model pairs; however, this effect varied according to model characteristics. In the comparison between human and artificial intelligence raters, it was determined that some artificial intelligence models demonstrated moderate and high levels of agreement with human raters, whereas in some cases the level of agreement was more variable. Overall, it was observed that the model type influenced scoring behavior. The results of the Many-Facet Rasch Measurement Model showed that the model-data fit was at an acceptable level and that the rater facet was an important source of variance in the measurement process. Significant differences were found among raters in terms of severity and leniency; it was determined that human and artificial intelligence raters could systematically differ. Item analyses revealed that the items had different difficulty levels and that the assessment tool had a structurally strong configuration. The findings indicate that in the automated scoring of open-ended items, the scoring behaviors of human and artificial intelligence raters may systematically vary and that the rater variable has a significant effect on measurement results. The study provides experimental evidence regarding human-artificial intelligence agreement and offers theoretical and practical contributions to the development of automated scoring systems.

Benzer Tezler

  1. Açık uçlu maddelerin değerlendirildiği ekosistemin yapay zekâ entegrasyonuyla geliştirilen otomatik puanlama sonuçlarının incelenmesi

    Analyzing the automated scoring results of the ecosystem in which open-ended items are assessed with artificial intelligence integration

    OYTUN ÇETİN

    Doktora

    Türkçe

    Türkçe

    2025

    Eğitim ve ÖğretimBahçeşehir Üniversitesi

    Bilgisayar ve Öğretim Teknolojileri Ana Bilim Dalı

    PROF. DR. TUFAN ADIGÜZEL

  2. Açık uçlu maddelerin otomatik puanlanmasında kullanılan yöntemlerin karşılaştırılması

    A comparative analysis of methods for the automated scoring of open-ended items

    İREM ÇELİK

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Eğitim ve ÖğretimAnkara Üniversitesi

    Eğitim Bilimleri Ana Bilim Dalı

    PROF. DR. ÖMAY ÇOKLUK BÖKEOĞLU

  3. Açık uçlu maddelerde otomatik puanlamanın güvenirliği ve test eşitleme hatalarına etkisi

    The reliability of automated essay scoring and its effect on test equating errors

    İBRAHİM UYSAL

    Doktora

    Türkçe

    Türkçe

    2019

    Eğitim ve ÖğretimHacettepe Üniversitesi

    Eğitim Bilimleri Ana Bilim Dalı

    PROF. DR. NURİ DOĞAN

  4. Açık uçlu maddelerin otomatik puanlanmasında doğal dil işleme yönteminden yararlanılarak makine öğrenmesi algoritmalarının karşılaştırılması

    Comparison of machine learning algorithms utilizing natural language processing in the automatic scoring of open-ended items

    KÜBRA YILMAZ

    Doktora

    Türkçe

    Türkçe

    2025

    Eğitim ve ÖğretimAnkara Üniversitesi

    Eğitim Bilimleri Ana Bilim Dalı

    PROF. DR. KAAN ZÜLFİKAR DENİZ

  5. Essays on estimation methods

    Tahmin yöntemleri üzerine makaleler

    YASİN KÜTÜK

    Doktora

    İngilizce

    İngilizce

    2019

    Ekonomiİstanbul Teknik Üniversitesi

    İktisat Ana Bilim Dalı

    PROF. DR. BÜLENT GÜLOĞLU