Geri Dön

Türkçe metinlerde yazım ve dil bilgisi hatalarının tespiti ve düzeltilmesinde doğal dil işleme modellerinin karşılaştırmalı analizi

Comparative analysis of natural language processing models for the detection and correction of spelling and grammatical errors in turkish texts

  1. Tez No: 1022182
  2. Yazar: SERVET AKBULUT
  3. Danışmanlar: DR. ÖĞR. ÜYESİ İRFAN ÖKTEN
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Doğal dil işleme, Natural language processing
  7. Yıl: 2026
  8. Dil: Türkçe
  9. Üniversite: Bitlis Eren Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu tez çalışmasında, Türkçe metinlerde yer alan yazım ve dil bilgisi hatalarının otomatik olarak tespit edilmesi ve düzeltilmesi amacıyla farklı doğal dil işleme modelleri karşılaştırmalı olarak incelenmiştir. Çalışmada temel veri kaynağı olarak GECTurk veri seti kullanılmıştır. Araştırma iki aşamalı olarak yürütülmüştür. İlk aşamada hata tespiti görevi ele alınmış ve CRF, BiLSTM-CRF, BERTurk, ELECTRATurk ve ConvBERTurk modelleri token düzeyinde değerlendirilmiştir. İkinci aşamada ise hata düzeltme görevi kapsamında Zemberek, Seq2Seq LSTM, mT5, ByT5, VBART ve LLM tabanlı yöntem karşılaştırılmıştır. Hata tespiti modelleri Accuracy, Precision, Recall, F1-score ve F0.5-score metrikleriyle; hata düzeltme modelleri ise Precision, Recall, F0.5-score, GLEU, Exact Match, Word Error Rate ve Character Error Rate metrikleriyle değerlendirilmiştir. Elde edilen bulgular, hata tespiti görevinde Transformer tabanlı modellerin genel olarak yüksek başarı gösterdiğini; ConvBERTurk modelinin genel metriklerde, ELECTRATurk modelinin hatalı tokenları yakalama başarısında ve BERTurk modelinin dengeli sınıflandırma performansında öne çıktığını ortaya koymuştur. Hata düzeltme görevinde ise ByT5 ve mT5 modellerinin genel performans bakımından daha dengeli sonuçlar ürettiği görülmüştür. Sonuçlar, Türkçe gibi eklemeli ve morfolojik açıdan zengin dillerde bağlamı dikkate alan Transformer tabanlı modellerin yazım ve dil bilgisi hatalarının otomatik tespiti ve düzeltilmesinde etkili olduğunu göstermektedir. Çalışma kapsamında geliştirilen kullanıcı arayüzü, değerlendirilen modellerin çıktılarını kullanıcı etkileşimli biçimde incelemeye ve hata tespiti ile hata düzeltme sonuçlarını görsel olarak karşılaştırmaya olanak sağlamıştır.

Özet (Çeviri)

In this thesis, different natural language processing models were comparatively examined for the automatic detection and correction of spelling and grammatical errors in Turkish texts. The GECTurk dataset was used as the main data source of the study. The research was conducted in two stages. In the first stage, the error detection task was addressed, and CRF, BiLSTM-CRF, BERTurk, ELECTRATurk and ConvBERTurk models were evaluated at the token level. In the second stage, Zemberek, Seq2Seq LSTM, mT5, ByT5, VBART and an LLM-based method were compared within the scope of the error correction task. The error detection models were evaluated using Accuracy, Precision, Recall, F1-score and F0.5-score metrics, while the error correction models were assessed using Precision, Recall, F0.5-score, GLEU, Exact Match, Word Error Rate and Character Error Rate metrics. The findings showed that Transformer-based models generally achieved high performance in the error detection task. ConvBERTurk stood out in terms of overall metrics, ELECTRATurk was prominent in detecting erroneous tokens, and BERTurk demonstrated a balanced classification performance. In the error correction task, ByT5 and mT5 produced more balanced results in terms of overall performance. The results indicate that Transformer-based models, which consider contextual information, are effective in the automatic detection and correction of spelling and grammatical errors in morphologically rich and agglutinative languages such as Turkish. The user interface developed within the scope of the study enabled the outputs of the evaluated models to be examined interactively and allowed the error detection and error correction results to be compared visually.

Benzer Tezler

  1. Analyse und bewertung der fehler der studierenden mit Türkisch als muttersprache bei der textproduktion im Deutschunterricht

    Ana dili Türkçe olan lisans öğrencilerinin Almanca dersinde yazılı metin oluşturmadaki hatalarının analizi ve değerlendirilmesi

    GÜLFİDAN DÜRÜK

    Yüksek Lisans

    Almanca

    Almanca

    2019

    DilbilimTrakya Üniversitesi

    Yabancı Diller Eğitimi Ana Bilim Dalı

    PROF. DR. SEVİNÇ MADEN SAKARYA

  2. Sosyal medyada kullanıcı gizliliğini korumak için taraf tespiti görevinde dönüştürücü dil modellerini yanıltma yöntemleri

    Methods of deceiving transformer language models in stance detection to protect user privacy in social media

    DİLARA DOĞAN

    Yüksek Lisans

    Türkçe

    Türkçe

    2023

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolTobb Ekonomi ve Teknoloji Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ MÜCAHİD KUTLU

  3. Лингво-стилистические особенности ложныхдрузей переводчика

    Tuzak kelimelerin çevirisinde dilbilimsel ve üslupbilimselözellikler

    ŞUHEDA RENGİN ÖZTÜRK

    Yüksek Lisans

    Rusça

    Rusça

    2024

    Mütercim-TercümanlıkKırgızistan-Türkiye Manas Üniversitesi

    Mütercim Tercümanlık Ana Bilim Dalı

    DOÇ. DR. SALTANAT MAMBAYEVA

  4. Ankara İlinde Lise Birinci Sınıf Öğrencilerinin Yazılı Anlatım Becerilerinin İç Yapı Bakımından Gelişimi Üzerine Bir İnceleme

    A research on develop of narration abilities in writings of high school's first class students about micro structure in ankara city

    FATİH AYAZ

    Yüksek Lisans

    Türkçe

    Türkçe

    2007

    Türk Dili ve EdebiyatıGazi Üniversitesi

    Ortaöğretim Sosyal Alanlar Eğitimi Ana Bilim Dalı

    PROF.DR. ALEMDAR YALÇIN

  5. Adana ili Aladağ ilçesi ağız incelemesi

    Dialect examination of Aladağ district of adana province

    ZÜLEYHA AK

    Yüksek Lisans

    Türkçe

    Türkçe

    2020

    Türk Dili ve EdebiyatıVan Yüzüncü Yıl Üniversitesi

    Türk Dili ve Edebiyatı Ana Bilim Dalı

    DOÇ. DR. VEYSİ SEVİNÇLİ