Geri Dön

Ensurıng academıc ıntegrıty: transformer-based and ensemble machıne learnıng approaches for dıfferentıatıng human-wrıtten and aı-generated text

Akademik bütünlükün sağlanması: insan tarafından yazılmış ve yapay zekâ tarafından üretilmiş metinleri ayırt etmek için transformer tabanlı ve toplu makine öğrenme yaklaşımları

  1. Tez No: 1000880
  2. Yazar: LAYTH RAFEA HAZIM HAZIM
  3. Danışmanlar: DOÇ. DR. OĞUZ ATA
  4. Tez Türü: Doktora
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: Altınbaş Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Elektrik ve Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Elektrik ve Bilgisayar Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

ChatGPT ve Bard gibi büyük dil modellerinin (LLM) patlayıcı gelişimi, metin oluşturmayı dönüştürerek akademik iletişim için yeni olanaklar sunmuş ve özgünlük ve yazarlık konusunda derin endişeler doğurmuştur. Yapay zeka tarafından oluşturulan içerik neredeyse insan yazısından ayırt edilemez hale geldiğinden, yazarlığı doğrulamak için açık ve güvenilir mekanizmalara duyulan ihtiyaç, akademik güveni sürdürmede hayati önem kazanmıştır. Bu çalışma, birbirini tamamlayan iki Doğal Dil İşleme (NLP) çerçevesini, Transformer Tabanlı Algılama Çerçevesi ve Topluluk Öğrenme Tabanlı Algılama Çerçevesini sunmakta ve bunları üç eşit dengeli veri kümesi üzerinde karşılaştırmaktadır: AI-GA, HWAI ve HAGT-1M. İlki, derin anlamsal ve sözdizimsel eğilimleri tespit etmek için Cümle-BERT (SBERT) ve RoBERTa gömülü vektörlerini Lojistik Regresyon (LR) ve İleri Beslemeli Sinir Ağları (FNN) ile birlikte kullanmaktadır. Veri kümeleri genelinde, transformatör konfigürasyonları güçlü performans sergiledi: SBERT+LR: %93,66 (AI-GA), %91,37 (HWAI), %99,64 (HAGT-1M); RoBERTa+FNN: %91,13 (AI-GA), %90,29 (HWAI), %99,95 (HAGT-1M), RoBERTa-FNN ise HAGT-1M'de %99,95'e ulaştı. Şeffaflığı sağlamak ve transformatörlerin“kara kutu”sınırlamasının üstesinden gelmek için, ikinci yöntem, TF-IDF ve dilsel özellik kümeleri (n-gramlar, sözcük çeşitliliği, cümle uzunluğu) üzerinde yumuşak oylama ile LR, SVM, Rastgele Orman, Son Derece Rastgele Ağaçlar, XGBoost, AdaBoost ve SGD'yi birleştirerek topluluk öğreniminden yararlanır. Bu topluluk, %99,88 (AI-GA), %99,37 (HWAI) ve %100 (HAGT-1M) başarı oranlarına ulaşarak önceki en iyi sonuçları geride bıraktı ve çeşitli akademik metinlerde artan sağlamlık sergiledi. Mevcut çalışma, özellikle anadili İngilizce olmayan araştırmacılar için hassasiyet ve adalet açısından tekrarlanabilir ön işleme, veri keşfi ve dikkatli eşik ayarlamasına odaklanmaktadır. Dilsel özgünlüğü, sözdizimi, anlambilim ve stilistik tutarlılıkta bulunan üç boyutlu bir özellik olarak modellemektedir. Üniversiteler, yayıncılar ve araştırma bütünlüğü ofisleri için uygun, açık, ölçeklenebilir ve şeffaf tespit protokolleri sunmaktadır. Gelecekteki araştırmalar, alanlar arası genelleme sağlamak için hibrit kuantum makine öğrenimi (HQML), daha ayrıntılı açıklanabilir yapay zeka araçları (örneğin, SHAP/LIME/dikkat görselleştirme) ve çok dilli genişletme konularını içerecektir.

Özet (Çeviri)

The explosive development of large language models (LLMs) such as ChatGPT and Bard transformed text creation, offering new possibilities for academic communication and raising deep concerns regarding authenticity and authorship. As AI-created content has come to be almost indistinguishable from human writing, the need for open and reliable mechanisms to authenticate authorship has become crucial in sustaining academic trust. This work presents and illustrates two mutually complementary Natural Language Processing (NLP) frameworks the Transformer-Based Detection Framework and the Ensemble Learning-Based Detection Framework and contrasts them on three evenly balanced datasets: AI-GA, HWAI, and HAGT-1M. The former uses Sentence-BERT (SBERT) and RoBERTa embeddings together with Logistic Regression (LR) and Feed-Forward Neural Networks (FNNs) to detect deep semantic and syntactic trends. Across datasets, transformer configurations achieved strong performance: SBERT+LR: 93.66% (AI-GA), 91.37% (HWAI), 99.64% (HAGT-1M); RoBERTa+FNN: 91.13% (AI-GA), 90.29% (HWAI), 99.95% (HAGT-1M) with RoBERTa-FNN peaking at 99.95% on HAGT-1M. To ensure transparency and surmount the“black-box”limitation of transformers, the second method leverages ensemble learning by combining LR, SVM, Random Forest, Extremely Randomized Trees, XGBoost, AdaBoost, and SGD with soft voting over TF-IDF and linguistic feature sets (n-grams, lexical diversity, sentence length). The ensemble achieved 99.88% (AI-GA), 99.37% (HWAI), and 100% (HAGT-1M), outperforming prior state-of-the-art and demonstrating increased robustness on varied academic text. The current study focuses on reproducible preprocessing, data exploration, and careful threshold tuning regarding sensitivity and fairness, especially for non-native research scholars. Model linguistic authenticity as a three-dimensional property present in syntax, semantics, and stylistic coherence. Offer open, scalable, and transparent detection protocols suitable for universities, publishers, and research integrity offices. Future research will include the investigation of hybrid quantum machine learning (HQML), explainable-AI tools with more detail (e.g., SHAP/LIME/attention visualization), and multilingual extension in order to maintain cross-domain generalization.

Benzer Tezler

  1. Güç transformatörleri sfra tarama frekans cevabı analizi sonuçlarının yapay zeka uygulamaları ile karşılaştırılması

    Comparison of power transformer sfra sweep frequency response analysis results with artificial intelligence applications

    HAKAN ÇUHADAROĞLU

    Doktora

    Türkçe

    Türkçe

    2025

    Elektrik ve Elektronik MühendisliğiSakarya Üniversitesi

    Elektrik-Elektronik Mühendisliği Ana Bilim Dalı

    PROF. DR. YILMAZ UYAROĞLU

  2. 2004-2022 yılları arasında Kırklareli kentsel sit alanı ve çevresinin değişimi ve korunmasına yönelik öneriler

    Transformation of the Kırklareli urban conservation area and its surroundings between 2004 and 2022 and conservation proposals

    ZEYNEP GÖKÇEN

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Mimarlıkİstanbul Teknik Üniversitesi

    Mimarlık Ana Bilim Dalı

    DOÇ. DR. ZEYNEP ERES ÖZDOĞAN

  3. Iso standartları temelinde iş sürekliliği yönetim sistemi ve endüstriyel tesislerde uygulanabilirliğinin incelenmesi

    An investigation into business continuity management system based on iso standarts and their applicability within industrial facicilities

    SİNAN YACILAR

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    İşletmeİstanbul Teknik Üniversitesi

    Afet ve Acil Durum Yönetimi Ana Bilim Dalı (disiplinlerarası)

    PROF. DR. DİDEM SALOĞLU DERTLİ

  4. Mil-Std 1553 tabanlı sistemler için yeni bir saldırı tespiti yaklaşımı

    A new intrusion detection approach for Mil-Std 1553 based systems

    YUNUS EMRE ÇİLOĞLU

    Yüksek Lisans

    Türkçe

    Türkçe

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. ŞERİF BAHTİYAR

  5. Sürdürülebilir doğal alan yönetiminde kent ormanlarının rolü: Hacıosman Atatürk Kent Ormanı örneği

    The role of urban forests in sustainable natural area management: The case of Hacıosman Atatürk Urban Forest

    BAŞAR SELAM ALİPAÇA

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Şehircilik ve Bölge Planlamaİstanbul Teknik Üniversitesi

    Kentsel Tasarım Ana Bilim Dalı

    PROF. DR. ALİYE AHU GÜLÜMSER