Geri Dön

Improving optimization algorithms for training language models

Dil modellerinin eğitimi için optimizasyon algoritmalarının geliştirilmesi

  1. Tez No: 985483
  2. Yazar: HİMMET TOPRAK KESGİN
  3. Danışmanlar: PROF. DR. MEHMET FATİH AMASYALI
  4. Tez Türü: Doktora
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Doğal dil işleme, Yapay zeka, Natural language processing, Artificial intelligence
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: Yıldız Teknik Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Büyük dil modelleri, genellikle gürültülü, yinelenen veya düşük kaliteli metinler içeren devasa web ölçekli veri kümelerine dayanır. Bu tür veriler, modellerin performansını ve adilliğini olumsuz etkileyebilir. Yaygın olarak kullanılan geleneksel ön işleme tabanlı filtreleme yöntemleri, katı eşik değerleri ve geri döndürülemez eleme kararları nedeniyle değerli örnekleri yanlışlıkla dışlayabilir. Bu tez, veri kalitesi optimizasyonunu doğrudan ön eğitim sürecine entegre eden, olasılıksal, döngüsel ve uyarlamalı bir filtreleme çerçevesi önermektedir. Önerilen yöntem, örnek başına kayıp istatistiklerini kullanarak dinamik bir tipik kayıp aralığı hesaplar ve bu aralığın dışındaki örnekleri, sapma miktarına bağlı bir olasılıkla geçici olarak hariç tutar. Döngüsel eşik güncellemeleri, eğitim süresince farklı zorluk bölgelerinin yeniden ziyaret edilmesini sağlayarak yapısal çeşitliliği korur ve gürültüye duyarlılığı azaltır. Türkçe veri kümeleri üzerinde yapılan deneyler, yöntemin ek bir ön işleme veya harici puanlamaya gerek duymadan doğrulama kaybını azalttığını ve aşağı akış görev performansını artırdığını göstermektedir.

Özet (Çeviri)

Large language models (LLMs) rely on massive web-scale datasets that often contain noisy, redundant, or low-quality text, which can impair both model performance and fairness. Traditional preprocessing-based filtering methods—though widely adopted—are limited by rigid thresholds and irreversible exclusion decisions that may remove valuable examples. This thesis proposes an in-training, probabilistic, cyclical, and adaptive filtering framework that integrates data quality optimization directly into the pretraining process. The method dynamically estimates a typical loss range using robust per-sample loss statistics and temporarily excludes samples outside this range with probability proportional to their deviation. Cyclic threshold updates ensure that different difficulty regions of the data are revisited throughout training, maintaining structured diversity and reducing noise sensitivity. Experiments on Turkish-language corpora demonstrate that the proposed approach lowers validation loss and enhances downstream task performance without additional preprocessing or external scoring.

Benzer Tezler

  1. Soğan mimarisinde metin içeriklerinin yapay zekâ destekli modeller ile değerlendirilmesi ve dağıtımı

    Evaluation and distribution of text contents with models supported by artificial intelligence techniques in onion architecture

    SEMİH OSMAN SAKA

    Yüksek Lisans

    Türkçe

    Türkçe

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSamsun Üniversitesi

    Yazılım Mühendisliği Ana Bilim Dalı

    DOÇ. DR. ZAFER CÖMERT

  2. Derin öğrenme algoritmaları ile personel geri bildirimlerinin sınıflandırılması ve analizi

    Classification and analysis of employee feedback with deep learning algorithms

    GÖKHAN YİĞİDEFE

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ SERAP ÇAKAR KAMAN

  3. Meme kanseri tanısı için gelişmiş yapay zeka tabanlı çok aşamalı tespit sistemi

    Advanced artificial intelligence based multi-stage detection system for breast cancer diagnosis

    ABDUL SAMAD

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Elektrik ve Elektronik MühendisliğiSakarya Üniversitesi

    Elektrik-Elektronik Mühendisliği Ana Bilim Dalı

    DOÇ. DR. MUHAMMED KÜRŞAD UÇAR

  4. Türkçe e-ticaret yorumlarında transformer tabanlı duygu analizi

    Transformer-based sentiment analysis on Turkish e-commerce reviews

    MUHAMMET ŞAMİL İKİZOĞLU

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Endüstri ve Endüstri Mühendisliğiİstanbul Teknik Üniversitesi

    İşletme Mühendisliği Ana Bilim Dalı

    DOÇ. DR. TUNCAY ÖZCAN

  5. Yapay sinir ağları ile optik karakter tanıma

    Optical character recognition with artificial neural network

    MURATCAN UZTEMUR

    Yüksek Lisans

    Türkçe

    Türkçe

    2019

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Kontrol ve Otomasyon Mühendisliği Ana Bilim Dalı

    PROF. DR. AFİFE LEYLA GÖREN SÜMER