Geri Dön

Synthetic data curation architecture for agile slm adaptation to emerging programming specifications

Yeni programlama standartlarına çevik slm uyarlaması için sentetik veri kürasyon mimarisi

  1. Tez No: 1024515
  2. Yazar: MEHMET DAVUT
  3. Danışmanlar: DOÇ. DR. SAVAŞ YILDIRIM
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Bilgisayar yazılım dilleri, Doğal dil işleme, Computer software languages, Natural language processing
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: İstanbul Bilgi Üniversitesi
  10. Enstitü: Lisansüstü Programlar Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Yazılım mühendisliği endüstrisi; uzmanlaşmış, ajan tabanlı (agentic) iş akışları için maliyet etkin ve uç cihazlarda (edge) çalışabilen motorlar olarak Küçük Dil Modellerine (Small Language Models, SLM) doğru bir paradigma değişimi yaşıyor. Ne var ki SLM'ler, ön eğitim verilerinin“bilgi kesim tarihi”ile yapıları gereği sınırlı; Ruby 3.4 gibi yeni dil sürümleriyle gelen modern paradigmalara neredeyse hiç maruz kalmamış durumdalar. Bu çalışmada, SLM'leri belirli dil sürümlerine sentetik veri damıtması yoluyla hızlıca uyarlayan otonom bir veri hattı (pipeline) öneriyoruz. 1,5B–9B parametre aralığındaki 8 mimari üzerinde, LoRA ile eğitilmiş 96 model üzerinde kapsamlı bir deneysel değerlendirme yürütüyoruz. Sonuçlarımız, yalnızca 1.845 yüksek kaliteli sentetik örnekle ince ayar (fine-tuning) yapılan, koda özelleşmiş 1,5B'lik bir modelin, 4,7 kat daha büyük genel amaçlı bir modelin kod çalıştırma (execution) başarısına yaklaştığını gösteriyor. Tanılayıcı bir araç olarak önerdiğimiz Tanılayıcı Sterilizasyon Prosedürü (Diagnostic Sanitization Procedure, DSP) sayesinde, ham (vanilla) modellerin aslında ciddi bir örtük algoritmik akıl yürütmeye —İçsel Yetenek (Intrinsic Capability, IC)— sahip olduğunu ortaya koyuyoruz; bu prosedür, çalıştırma başarı oranlarını ortalama +21,1 puan (5 katlık göreli artış) yukarı çekiyor. Bununla birlikte, üretime hazır kodun gerektirdiği Dışsal Uyumu (Extrinsic Compliance, EC) sağlamada asıl operasyonel çözüm LoRA ince ayarı olmayı sürdürüyor. Model başına yaklaşık 4,20 €'luk tek seferlik bir maliyetle (LoRA uyarlaması ve otomatik değerlendirme dâhil) bu yöntem, SLM'leri gelecekteki herhangi bir dil sürümüne veya yeterince temsil edilmeyen dillere çok düşük maliyetle uyarlamak için tekrar uygulanabilir bir reçete sunuyor ve pahalı, devasa LLM API'lerine olan bağımlılığı etkin biçimde ortadan kaldırıyor.

Özet (Çeviri)

The software engineering industry is experiencing a paradigm shift towards Small Language Models (SLMs) as cost-effective, edge-deployable engines for specialized agentic workflows. However, SLMs are inherently constrained by the“knowledge cut-off date”of their pre-training data, possessing little to no exposure to modern paradigms introduced in recent programming language releases, such as Ruby 3.4. In this study, we propose an autonomous pipeline for the rapid adaptation of SLMs to specific language versions via synthetic data distillation. We conduct a large-scale empirical evaluation of 96 LoRA-trained models across 8 architectures, ranging from 1.5B to 9B parameters. Our results demonstrate that a 1.5B parameter code-specialist model, fine-tuned on exactly 1,845 high-quality synthetic examples, approaches the execution capabilities of a 4.7x larger generalist model. By introducing the Diagnostic Sanitization Procedure (DSP) as a diagnostic tool, we reveal that vanilla models possess significant latent algorithmic reasoning defined as Intrinsic Capability (IC)—rescuing execution pass rates by an average of +21.1 percentage points (a 5x relative increase)—while LoRA fine-tuning remains the essential operational solution for achieving the Extrinsic Compliance (EC) required for production-ready code. With an amortized per-model deployment cost of approximately €4.20 (encompassing both LoRA adaptation and automated evaluation), this methodology provides a repeatable blueprint for adapting SLMs to any future language specification or under-represented languages at a negligible cost, effectively eliminating dependency on expensive, monolithic LLM APIs.

Benzer Tezler

  1. Arkeolojik miras bilgi yönetimi: HBIM Erythrai (Ildır) örneği

    Archaeological heritage information management: HBIM Erythrae (Ildır)

    TUĞBA SARICAOĞLU

    Doktora

    Türkçe

    Türkçe

    2021

    MimarlıkDokuz Eylül Üniversitesi

    Mimarlık Ana Bilim Dalı

    PROF. DR. NEZİHAT KÖŞKLÜK KAYA

  2. Enhancing intrusion detection with random forest and feature selection

    Rastgele orman ve özellik seçimi ile girişim tespitinin geliştirilmesi

    LUHAIB MOHAMMED ATIYAH

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Üsküdar Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ HAMZA ABUNIMA

  3. Strategic social media use under algorithmic curation: A comparative study of student practices in Türkiye and Germany

    Algoritmik kürasyon altında stratejik sosyal medya kullanımı: Türkiye ve Almanya'daki öğrenci pratiklerinin karşılaştırmalı analizi

    İREM DÖLEN

    Yüksek Lisans

    İngilizce

    İngilizce

    2026

    İletişim BilimleriTürk-Alman Üniversitesi

    Kültür ve İletişim Bilimleri Ana Bilim Dalı

    DOÇ. DR. ELİF POSOS DEVRANİ

    DR. ÖĞR. ÜYESİ BURAK POLAT

  4. Polihidroksibütirat üretimi için entegre multi-omik, mekanistik makina ögrenmesi ve CRISPR yaklaşımı

    An integrated multi-omics, mechanistic machine learning and CRISPR approach for polyhydroxybutyrate production

    BLAISE MANGA ENUH

    Doktora

    İngilizce

    İngilizce

    2022

    BiyoteknolojiEskişehir Osmangazi Üniversitesi

    Biyoteknoloji ve Biyogüvenlik Ana Bilim Dalı

    DOÇ. DR. PINAR AYTAR ÇELİK

  5. Synthetic data generation for training and evaluation of deep learning-based computer vision models

    Derin öğrenme-bazlı bilgisayarlı göre modellerinin eğitimi ve değerlendirilmesi için sentetik veri üretimi

    ABDULRAHMAN KERİM

    Yüksek Lisans

    İngilizce

    İngilizce

    2021

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolHacettepe Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    YRD. DOÇ. DR. UFUK ÇELİKCAN