Türkçe metinlerde yazım ve dil bilgisi hatalarının tespiti ve düzeltilmesinde doğal dil işleme modellerinin karşılaştırmalı analizi
Comparative analysis of natural language processing models for the detection and correction of spelling and grammatical errors in turkish texts
- Tez No: 1022182
- Danışmanlar: DR. ÖĞR. ÜYESİ İRFAN ÖKTEN
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Doğal dil işleme, Natural language processing
- Yıl: 2026
- Dil: Türkçe
- Üniversite: Bitlis Eren Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu tez çalışmasında, Türkçe metinlerde yer alan yazım ve dil bilgisi hatalarının otomatik olarak tespit edilmesi ve düzeltilmesi amacıyla farklı doğal dil işleme modelleri karşılaştırmalı olarak incelenmiştir. Çalışmada temel veri kaynağı olarak GECTurk veri seti kullanılmıştır. Araştırma iki aşamalı olarak yürütülmüştür. İlk aşamada hata tespiti görevi ele alınmış ve CRF, BiLSTM-CRF, BERTurk, ELECTRATurk ve ConvBERTurk modelleri token düzeyinde değerlendirilmiştir. İkinci aşamada ise hata düzeltme görevi kapsamında Zemberek, Seq2Seq LSTM, mT5, ByT5, VBART ve LLM tabanlı yöntem karşılaştırılmıştır. Hata tespiti modelleri Accuracy, Precision, Recall, F1-score ve F0.5-score metrikleriyle; hata düzeltme modelleri ise Precision, Recall, F0.5-score, GLEU, Exact Match, Word Error Rate ve Character Error Rate metrikleriyle değerlendirilmiştir. Elde edilen bulgular, hata tespiti görevinde Transformer tabanlı modellerin genel olarak yüksek başarı gösterdiğini; ConvBERTurk modelinin genel metriklerde, ELECTRATurk modelinin hatalı tokenları yakalama başarısında ve BERTurk modelinin dengeli sınıflandırma performansında öne çıktığını ortaya koymuştur. Hata düzeltme görevinde ise ByT5 ve mT5 modellerinin genel performans bakımından daha dengeli sonuçlar ürettiği görülmüştür. Sonuçlar, Türkçe gibi eklemeli ve morfolojik açıdan zengin dillerde bağlamı dikkate alan Transformer tabanlı modellerin yazım ve dil bilgisi hatalarının otomatik tespiti ve düzeltilmesinde etkili olduğunu göstermektedir. Çalışma kapsamında geliştirilen kullanıcı arayüzü, değerlendirilen modellerin çıktılarını kullanıcı etkileşimli biçimde incelemeye ve hata tespiti ile hata düzeltme sonuçlarını görsel olarak karşılaştırmaya olanak sağlamıştır.
Özet (Çeviri)
In this thesis, different natural language processing models were comparatively examined for the automatic detection and correction of spelling and grammatical errors in Turkish texts. The GECTurk dataset was used as the main data source of the study. The research was conducted in two stages. In the first stage, the error detection task was addressed, and CRF, BiLSTM-CRF, BERTurk, ELECTRATurk and ConvBERTurk models were evaluated at the token level. In the second stage, Zemberek, Seq2Seq LSTM, mT5, ByT5, VBART and an LLM-based method were compared within the scope of the error correction task. The error detection models were evaluated using Accuracy, Precision, Recall, F1-score and F0.5-score metrics, while the error correction models were assessed using Precision, Recall, F0.5-score, GLEU, Exact Match, Word Error Rate and Character Error Rate metrics. The findings showed that Transformer-based models generally achieved high performance in the error detection task. ConvBERTurk stood out in terms of overall metrics, ELECTRATurk was prominent in detecting erroneous tokens, and BERTurk demonstrated a balanced classification performance. In the error correction task, ByT5 and mT5 produced more balanced results in terms of overall performance. The results indicate that Transformer-based models, which consider contextual information, are effective in the automatic detection and correction of spelling and grammatical errors in morphologically rich and agglutinative languages such as Turkish. The user interface developed within the scope of the study enabled the outputs of the evaluated models to be examined interactively and allowed the error detection and error correction results to be compared visually.
Benzer Tezler
- Analyse und bewertung der fehler der studierenden mit Türkisch als muttersprache bei der textproduktion im Deutschunterricht
Ana dili Türkçe olan lisans öğrencilerinin Almanca dersinde yazılı metin oluşturmadaki hatalarının analizi ve değerlendirilmesi
GÜLFİDAN DÜRÜK
Yüksek Lisans
Almanca
2019
DilbilimTrakya ÜniversitesiYabancı Diller Eğitimi Ana Bilim Dalı
PROF. DR. SEVİNÇ MADEN SAKARYA
- Sosyal medyada kullanıcı gizliliğini korumak için taraf tespiti görevinde dönüştürücü dil modellerini yanıltma yöntemleri
Methods of deceiving transformer language models in stance detection to protect user privacy in social media
DİLARA DOĞAN
Yüksek Lisans
Türkçe
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolTobb Ekonomi ve Teknoloji ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ MÜCAHİD KUTLU
- Лингво-стилистические особенности ложныхдрузей переводчика
Tuzak kelimelerin çevirisinde dilbilimsel ve üslupbilimselözellikler
ŞUHEDA RENGİN ÖZTÜRK
Yüksek Lisans
Rusça
2024
Mütercim-TercümanlıkKırgızistan-Türkiye Manas ÜniversitesiMütercim Tercümanlık Ana Bilim Dalı
DOÇ. DR. SALTANAT MAMBAYEVA
- Ankara İlinde Lise Birinci Sınıf Öğrencilerinin Yazılı Anlatım Becerilerinin İç Yapı Bakımından Gelişimi Üzerine Bir İnceleme
A research on develop of narration abilities in writings of high school's first class students about micro structure in ankara city
FATİH AYAZ
Yüksek Lisans
Türkçe
2007
Türk Dili ve EdebiyatıGazi ÜniversitesiOrtaöğretim Sosyal Alanlar Eğitimi Ana Bilim Dalı
PROF.DR. ALEMDAR YALÇIN
- Adana ili Aladağ ilçesi ağız incelemesi
Dialect examination of Aladağ district of adana province
ZÜLEYHA AK
Yüksek Lisans
Türkçe
2020
Türk Dili ve EdebiyatıVan Yüzüncü Yıl ÜniversitesiTürk Dili ve Edebiyatı Ana Bilim Dalı
DOÇ. DR. VEYSİ SEVİNÇLİ