Ensurıng academıc ıntegrıty: transformer-based and ensemble machıne learnıng approaches for dıfferentıatıng human-wrıtten and aı-generated text
Akademik bütünlükün sağlanması: insan tarafından yazılmış ve yapay zekâ tarafından üretilmiş metinleri ayırt etmek için transformer tabanlı ve toplu makine öğrenme yaklaşımları
- Tez No: 1000880
- Danışmanlar: DOÇ. DR. OĞUZ ATA
- Tez Türü: Doktora
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Altınbaş Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Elektrik ve Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Elektrik ve Bilgisayar Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
ChatGPT ve Bard gibi büyük dil modellerinin (LLM) patlayıcı gelişimi, metin oluşturmayı dönüştürerek akademik iletişim için yeni olanaklar sunmuş ve özgünlük ve yazarlık konusunda derin endişeler doğurmuştur. Yapay zeka tarafından oluşturulan içerik neredeyse insan yazısından ayırt edilemez hale geldiğinden, yazarlığı doğrulamak için açık ve güvenilir mekanizmalara duyulan ihtiyaç, akademik güveni sürdürmede hayati önem kazanmıştır. Bu çalışma, birbirini tamamlayan iki Doğal Dil İşleme (NLP) çerçevesini, Transformer Tabanlı Algılama Çerçevesi ve Topluluk Öğrenme Tabanlı Algılama Çerçevesini sunmakta ve bunları üç eşit dengeli veri kümesi üzerinde karşılaştırmaktadır: AI-GA, HWAI ve HAGT-1M. İlki, derin anlamsal ve sözdizimsel eğilimleri tespit etmek için Cümle-BERT (SBERT) ve RoBERTa gömülü vektörlerini Lojistik Regresyon (LR) ve İleri Beslemeli Sinir Ağları (FNN) ile birlikte kullanmaktadır. Veri kümeleri genelinde, transformatör konfigürasyonları güçlü performans sergiledi: SBERT+LR: %93,66 (AI-GA), %91,37 (HWAI), %99,64 (HAGT-1M); RoBERTa+FNN: %91,13 (AI-GA), %90,29 (HWAI), %99,95 (HAGT-1M), RoBERTa-FNN ise HAGT-1M'de %99,95'e ulaştı. Şeffaflığı sağlamak ve transformatörlerin“kara kutu”sınırlamasının üstesinden gelmek için, ikinci yöntem, TF-IDF ve dilsel özellik kümeleri (n-gramlar, sözcük çeşitliliği, cümle uzunluğu) üzerinde yumuşak oylama ile LR, SVM, Rastgele Orman, Son Derece Rastgele Ağaçlar, XGBoost, AdaBoost ve SGD'yi birleştirerek topluluk öğreniminden yararlanır. Bu topluluk, %99,88 (AI-GA), %99,37 (HWAI) ve %100 (HAGT-1M) başarı oranlarına ulaşarak önceki en iyi sonuçları geride bıraktı ve çeşitli akademik metinlerde artan sağlamlık sergiledi. Mevcut çalışma, özellikle anadili İngilizce olmayan araştırmacılar için hassasiyet ve adalet açısından tekrarlanabilir ön işleme, veri keşfi ve dikkatli eşik ayarlamasına odaklanmaktadır. Dilsel özgünlüğü, sözdizimi, anlambilim ve stilistik tutarlılıkta bulunan üç boyutlu bir özellik olarak modellemektedir. Üniversiteler, yayıncılar ve araştırma bütünlüğü ofisleri için uygun, açık, ölçeklenebilir ve şeffaf tespit protokolleri sunmaktadır. Gelecekteki araştırmalar, alanlar arası genelleme sağlamak için hibrit kuantum makine öğrenimi (HQML), daha ayrıntılı açıklanabilir yapay zeka araçları (örneğin, SHAP/LIME/dikkat görselleştirme) ve çok dilli genişletme konularını içerecektir.
Özet (Çeviri)
The explosive development of large language models (LLMs) such as ChatGPT and Bard transformed text creation, offering new possibilities for academic communication and raising deep concerns regarding authenticity and authorship. As AI-created content has come to be almost indistinguishable from human writing, the need for open and reliable mechanisms to authenticate authorship has become crucial in sustaining academic trust. This work presents and illustrates two mutually complementary Natural Language Processing (NLP) frameworks the Transformer-Based Detection Framework and the Ensemble Learning-Based Detection Framework and contrasts them on three evenly balanced datasets: AI-GA, HWAI, and HAGT-1M. The former uses Sentence-BERT (SBERT) and RoBERTa embeddings together with Logistic Regression (LR) and Feed-Forward Neural Networks (FNNs) to detect deep semantic and syntactic trends. Across datasets, transformer configurations achieved strong performance: SBERT+LR: 93.66% (AI-GA), 91.37% (HWAI), 99.64% (HAGT-1M); RoBERTa+FNN: 91.13% (AI-GA), 90.29% (HWAI), 99.95% (HAGT-1M) with RoBERTa-FNN peaking at 99.95% on HAGT-1M. To ensure transparency and surmount the“black-box”limitation of transformers, the second method leverages ensemble learning by combining LR, SVM, Random Forest, Extremely Randomized Trees, XGBoost, AdaBoost, and SGD with soft voting over TF-IDF and linguistic feature sets (n-grams, lexical diversity, sentence length). The ensemble achieved 99.88% (AI-GA), 99.37% (HWAI), and 100% (HAGT-1M), outperforming prior state-of-the-art and demonstrating increased robustness on varied academic text. The current study focuses on reproducible preprocessing, data exploration, and careful threshold tuning regarding sensitivity and fairness, especially for non-native research scholars. Model linguistic authenticity as a three-dimensional property present in syntax, semantics, and stylistic coherence. Offer open, scalable, and transparent detection protocols suitable for universities, publishers, and research integrity offices. Future research will include the investigation of hybrid quantum machine learning (HQML), explainable-AI tools with more detail (e.g., SHAP/LIME/attention visualization), and multilingual extension in order to maintain cross-domain generalization.
Benzer Tezler
- Güç transformatörleri sfra tarama frekans cevabı analizi sonuçlarının yapay zeka uygulamaları ile karşılaştırılması
Comparison of power transformer sfra sweep frequency response analysis results with artificial intelligence applications
HAKAN ÇUHADAROĞLU
Doktora
Türkçe
2025
Elektrik ve Elektronik MühendisliğiSakarya ÜniversitesiElektrik-Elektronik Mühendisliği Ana Bilim Dalı
PROF. DR. YILMAZ UYAROĞLU
- 2004-2022 yılları arasında Kırklareli kentsel sit alanı ve çevresinin değişimi ve korunmasına yönelik öneriler
Transformation of the Kırklareli urban conservation area and its surroundings between 2004 and 2022 and conservation proposals
ZEYNEP GÖKÇEN
Yüksek Lisans
Türkçe
2026
Mimarlıkİstanbul Teknik ÜniversitesiMimarlık Ana Bilim Dalı
DOÇ. DR. ZEYNEP ERES ÖZDOĞAN
- Iso standartları temelinde iş sürekliliği yönetim sistemi ve endüstriyel tesislerde uygulanabilirliğinin incelenmesi
An investigation into business continuity management system based on iso standarts and their applicability within industrial facicilities
SİNAN YACILAR
Yüksek Lisans
Türkçe
2026
İşletmeİstanbul Teknik ÜniversitesiAfet ve Acil Durum Yönetimi Ana Bilim Dalı (disiplinlerarası)
PROF. DR. DİDEM SALOĞLU DERTLİ
- Mil-Std 1553 tabanlı sistemler için yeni bir saldırı tespiti yaklaşımı
A new intrusion detection approach for Mil-Std 1553 based systems
YUNUS EMRE ÇİLOĞLU
Yüksek Lisans
Türkçe
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. ŞERİF BAHTİYAR
- Sürdürülebilir doğal alan yönetiminde kent ormanlarının rolü: Hacıosman Atatürk Kent Ormanı örneği
The role of urban forests in sustainable natural area management: The case of Hacıosman Atatürk Urban Forest
BAŞAR SELAM ALİPAÇA
Yüksek Lisans
Türkçe
2026
Şehircilik ve Bölge Planlamaİstanbul Teknik ÜniversitesiKentsel Tasarım Ana Bilim Dalı
PROF. DR. ALİYE AHU GÜLÜMSER