Tokenizasyon, veri kalitesi ve alan uyarlaması ekseninde Türkçe dil modellerinin geliştirilmesi ve değerlendirilmesi
Developing and evaluating Turkish language models within a tokenization, data quality, and domain adaptation framework
- Tez No: 1011924
- Danışmanlar: PROF. DR. BANU DİRİ, DOÇ. DR. SAVAŞ YILDIRIM
- Tez Türü: Doktora
- Konular: Dilbilim, Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Linguistics, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Hücresel yapay sinir ağları, İnsan bilgisayar etkileşimi, İnsan-yapay zeka etkileşimi, Cellular artificial neural networks, Human computer interaction, Human-artificial intelligence interaction
- Yıl: 2026
- Dil: Türkçe
- Üniversite: Yıldız Teknik Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Büyük dil modellerinin İngilizce gibi yüksek kaynaklı dillerde elde ettiği başarılar, Türkçe gibi eklemeli ve biçimbilimsel olarak zengin dillere aynı ölçüde yansımamaktadır; bu performans açığının başlıca nedenleri arasında biçimsel yapıyı gözetmeyen tokenizasyon, heterojen kalitedeki eğitim verileri ve alan-özel uyarlama yöntemlerinin yetersizliği yer almaktadır. Bu tez, söz konusu üç sorunu değerlendirme standardizasyonuyla birlikte ele alan bütüncül ve tekrar üretilebilir bir araştırma çerçevesi sunmaktadır: Değerlendirme ekseninde, Türkiye'nin ulusal sınav sisteminden derlenen yaklaşık 280.000 sorudan seçilen, 62 kategoride 6.200 çoktan seçmeli soru içeren TR-MMLU karşılaştırıcısı geliştirilmiş ve açık liderlik tablosu 85 model değerlendirmesine ulaşarak Türkçe için en geniş kapsamlı kamuya açık değerlendirme zemini oluşturulmuştur. Tokenizasyon ekseninde, Türkçenin kök-ek yapısını, ses olaylarını ve biçimbirimsel bütünlüğü koruyan Morfolojik Farkındalıklı Tokenizer geliştirilmiş; önerilen Türkçe Token Oranı (%TR) ve Saf Token Oranı (%Pure) metrikleriyle TR-MMLU metni üzerinde %TR=90,29 ve %Pure=85,80 değerlerine ulaşmış, aynı mimari, veri ve başlangıç ağırlıkları altında yalnızca tokenizer değişkeninin ayrıştırıldığı kontrollü deney hattında üç farklı BPE tabanlı Türkçe tokenizera karşı STSbTR ve 26 görevli TR-MTEB değerlendirmelerinde en yüksek skorları elde etmiş ve decode(encode(w)) doğruluğu %99,48 ile tersinir bir Türkçe metin çözümleyici olarak konumlandırılmıştır. Buna ek olarak TurBLiMP üzerinde, MFT'nin morfoloji-ağırlıklı olgularda daha kararlı semantik temsil ürettiği kısa bir tanılayıcı analizle gösterilmiştir. Veri kalitesi ekseninde, örneklerin güvenilirlik sinyallerini öğrenme oranına yansıtan Veri Kalitesi Tabanlı Uyarlanabilir Öğrenme Oranı stratejisi kavramsal olarak önerilmiş ve sağlık alanındaki veri heterojenliğinin model eğitiminde dikkate alınması gerekliliği tartışılmıştır. Alan uyarlaması ekseninde, 167.000'den fazla gerçek hasta-doktor etkileşiminden derlenen Türkçe tıbbi veri seti üzerinde düşük-rank uyarlama ve küresel doğrusal enterpolasyon birleştirmesiyle alan-özel modeller geliştirilmiş; ince ayarlı model, taban modele göre uzman yanıtlarına benzerlikte %11,33 artış sağlamıştır. Cümle gömme tarafında, 8K bağlam penceresi ve 128K çok dilli sözlük kapasitesine sahip embeddingmagibu-200m modeli sunulmuş; model, STSbTR test bölümünde %77,55 (Pearson) ve %77,45 (Spearman) değerlerine ulaşmış ve TR-MTEB üzerinde 26 model arasında 63,9 puanla 7. sırada yer alarak yaklaşık $5 - $20 eğitim maliyetiyle rekabetçi bir maliyet-performans dengesi üretmiştir. Tüm veri setleri, modeller ve değerlendirme betikleri açık bilim ilkeleriyle yayımlanarak Türkçe Doğal Dil İşleme (Natural Language Processing, NLP) topluluğu için sürdürülebilir bir araştırma altyapısı oluşturulmuştur.
Özet (Çeviri)
The strong performance of large language models in high-resource languages such as English does not transfer equally to agglutinative, morphologically rich languages like Turkish; this gap largely stems from morphology-unaware tokenization, heterogeneous training data quality, and insufficient domain-specific adaptation. This thesis proposes a unified and reproducible research framework that addresses these three challenges alongside evaluation standardization: On the evaluation axis, the TR-MMLU benchmark is introduced with 6,200 multiple-choice questions across 62 categories selected from roughly 280,000 items in Turkey's national examination system, and its open leaderboard has reached 85 model evaluations, forming the most comprehensive public evaluation platform for Turkish. On the tokenization axis, the Morphology-Aware Tokenizer is developed to preserve root–suffix structure, phonological processes, and morphemic integrity; using the proposed Turkish Ratio (%TR) and Purity Ratio (%Pure) metrics, MFT achieves %TR=90.29 and %Pure=85.80 on TR-MMLU text, and in a controlled pipeline where architecture, data, and initial weights are fixed and only the tokenizer varies, it outperforms three Turkish BPE-based tokenizers on STSbTR and across 26 TR-MTEB tasks, while also acting as a reversible processor with 99.48% decode(encode(w)) accuracy. In addition, a short diagnostic analysis on TurBLiMP indicates that MFT yields more stable semantic representations on morphology-heavy phenomena. On the data quality axis, the Data Quality-Based Adaptive Learning Rate strategy is proposed as a conceptual framework that integrates sample reliability signals into the learning process; the healthcare-domain dataset's metadata (doctor title, specialty) motivates this perspective by illustrating how data heterogeneity can inform training decisions. On the domain adaptation axis, domain-specific models are trained on a Turkish medical dataset of over 167,000 real patient–doctor interactions using Low-Rank Adaptation combined with Spherical Linear Interpolation, yielding an 11.33% similarity improvement over the base model relative to expert responses. On the sentence embedding front, embeddingmagibu-200m is introduced with an 8K context window and a 128K multilingual tokenizer vocabulary; it reaches %77.55 (Pearson) ve %77.45 (Spearman) on the STSbTR test split and ranks 7th out of 26 models with a 63.9 average score across TR-MTEB, achieving competitive cost–performance at an estimated training cost of $5 - $20. All datasets, models, and evaluation scripts are released under open-science principles to establish a sustainable research infrastructure for the Turkish Natural Language Processing (NLP) community.
Benzer Tezler
- A method for predicting title of given text
Verilen metnin başlığını tahmin etmek için bir yöntem
MOHAMED BARRE OMER
Yüksek Lisans
İngilizce
2021
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Ticaret ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. MUSTAFA CEM KASAPBAŞI
- Veri sızıntısı önlemede veri maskeleme yöntemlerinin etkinliği
The effectiveness of data masking techniques in data loss prevention
YEŞİM ALAN KILIÇ
Yüksek Lisans
Türkçe
2024
Bilgi ve Belge YönetimiBahçeşehir ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ AHMET NACİ ÜNAL
- Karbon ticareti ve dijitalleşme: Denizcilik sektöründe EUA transfer işlemlerinde tokenizasyon potansiyelinin araştırılması
Carbon trading and digitalization: Investigation the potential of tokenization in EUA transfer transactions in the maritime sector
BARIŞ YILDIZLI
Yüksek Lisans
Türkçe
2025
DenizcilikDokuz Eylül ÜniversitesiDenizcilik İşletmeleri Yönetimi Ana Bilim Dalı
DR. ÖĞR. ÜYESİ VOLKAN ÇETİNKAYA
- Istoken : The digital revolution of fractional Ownership & Real estate tokenization model in Türkiye
Istoken : Türkiye'de parçalı mülkiyetin dijital devrimi ve gayrimenkul tokenizasyon modeli
GÖKSU SABUNCUOĞLU
Yüksek Lisans
İngilizce
2024
Ekonomiİstanbul Teknik ÜniversitesiGayrimenkul Geliştirme Ana Bilim Dalı
DOÇ. DR. KEREM YAVUZ ARSLANLI
- Social media mining with R
R ile sosyal medya madenciliği
SAHBAN TARIQ MALIK
Yüksek Lisans
İngilizce
2018
İşletmeMarmara Üniversitesiİşletme Ana Bilim Dalı
DR. ÖĞR. ÜYESİ AYŞE ÇINAR