Improving optimization algorithms for training language models
Dil modellerinin eğitimi için optimizasyon algoritmalarının geliştirilmesi
- Tez No: 985483
- Danışmanlar: PROF. DR. MEHMET FATİH AMASYALI
- Tez Türü: Doktora
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Doğal dil işleme, Yapay zeka, Natural language processing, Artificial intelligence
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Yıldız Teknik Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Büyük dil modelleri, genellikle gürültülü, yinelenen veya düşük kaliteli metinler içeren devasa web ölçekli veri kümelerine dayanır. Bu tür veriler, modellerin performansını ve adilliğini olumsuz etkileyebilir. Yaygın olarak kullanılan geleneksel ön işleme tabanlı filtreleme yöntemleri, katı eşik değerleri ve geri döndürülemez eleme kararları nedeniyle değerli örnekleri yanlışlıkla dışlayabilir. Bu tez, veri kalitesi optimizasyonunu doğrudan ön eğitim sürecine entegre eden, olasılıksal, döngüsel ve uyarlamalı bir filtreleme çerçevesi önermektedir. Önerilen yöntem, örnek başına kayıp istatistiklerini kullanarak dinamik bir tipik kayıp aralığı hesaplar ve bu aralığın dışındaki örnekleri, sapma miktarına bağlı bir olasılıkla geçici olarak hariç tutar. Döngüsel eşik güncellemeleri, eğitim süresince farklı zorluk bölgelerinin yeniden ziyaret edilmesini sağlayarak yapısal çeşitliliği korur ve gürültüye duyarlılığı azaltır. Türkçe veri kümeleri üzerinde yapılan deneyler, yöntemin ek bir ön işleme veya harici puanlamaya gerek duymadan doğrulama kaybını azalttığını ve aşağı akış görev performansını artırdığını göstermektedir.
Özet (Çeviri)
Large language models (LLMs) rely on massive web-scale datasets that often contain noisy, redundant, or low-quality text, which can impair both model performance and fairness. Traditional preprocessing-based filtering methods—though widely adopted—are limited by rigid thresholds and irreversible exclusion decisions that may remove valuable examples. This thesis proposes an in-training, probabilistic, cyclical, and adaptive filtering framework that integrates data quality optimization directly into the pretraining process. The method dynamically estimates a typical loss range using robust per-sample loss statistics and temporarily excludes samples outside this range with probability proportional to their deviation. Cyclic threshold updates ensure that different difficulty regions of the data are revisited throughout training, maintaining structured diversity and reducing noise sensitivity. Experiments on Turkish-language corpora demonstrate that the proposed approach lowers validation loss and enhances downstream task performance without additional preprocessing or external scoring.
Benzer Tezler
- Soğan mimarisinde metin içeriklerinin yapay zekâ destekli modeller ile değerlendirilmesi ve dağıtımı
Evaluation and distribution of text contents with models supported by artificial intelligence techniques in onion architecture
SEMİH OSMAN SAKA
Yüksek Lisans
Türkçe
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSamsun ÜniversitesiYazılım Mühendisliği Ana Bilim Dalı
DOÇ. DR. ZAFER CÖMERT
- Derin öğrenme algoritmaları ile personel geri bildirimlerinin sınıflandırılması ve analizi
Classification and analysis of employee feedback with deep learning algorithms
GÖKHAN YİĞİDEFE
Yüksek Lisans
Türkçe
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ SERAP ÇAKAR KAMAN
- Meme kanseri tanısı için gelişmiş yapay zeka tabanlı çok aşamalı tespit sistemi
Advanced artificial intelligence based multi-stage detection system for breast cancer diagnosis
ABDUL SAMAD
Yüksek Lisans
Türkçe
2026
Elektrik ve Elektronik MühendisliğiSakarya ÜniversitesiElektrik-Elektronik Mühendisliği Ana Bilim Dalı
DOÇ. DR. MUHAMMED KÜRŞAD UÇAR
- Türkçe e-ticaret yorumlarında transformer tabanlı duygu analizi
Transformer-based sentiment analysis on Turkish e-commerce reviews
MUHAMMET ŞAMİL İKİZOĞLU
Yüksek Lisans
Türkçe
2026
Endüstri ve Endüstri Mühendisliğiİstanbul Teknik Üniversitesiİşletme Mühendisliği Ana Bilim Dalı
DOÇ. DR. TUNCAY ÖZCAN
- Yapay sinir ağları ile optik karakter tanıma
Optical character recognition with artificial neural network
MURATCAN UZTEMUR
Yüksek Lisans
Türkçe
2019
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiKontrol ve Otomasyon Mühendisliği Ana Bilim Dalı
PROF. DR. AFİFE LEYLA GÖREN SÜMER