Açık kaynak LLM'lerle dil öğrenme ve performans analizi
Language learning and performance analysis with open source LLMs
- Tez No: 989659
- Danışmanlar: DOÇ. DR. AYŞE BERNA ALTINEL GİRGİN, DR. ABDULLAH SÖNMEZ
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: Türkçe
- Üniversite: Marmara Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu çalışmada, büyük dil modellerinin (LLM) kelime temelli cümle üretme performansı beş farklı CEFR seviyesinde kapsamlı biçimde incelenmiş ve ticari modeller ile açık kaynak modelleri karşılaştırmalı olarak değerlendirilmiştir. Oxford 3000/5000 sözlük listelerinden seçilen kelimeler için altı farklı modelden cümle üretilmiş; bu cümleler dört temel ölçüte (kelime kullanımı, seviye uygunluğu, dilbilgisi doğruluğu, doğallık) göre hem 99 insan değerlendirici hem de ChatGPT-5 ve DeepSeek-Reasoner olmak üzere iki LLM değerlendirici tarafından puanlanmıştır. Ayrıca GPT-4o tarafından üretilen 23.093 sentetik cümle kullanılarak Llama-3.2-1B modeli üzerinde LoRA tabanlı ince ayar uygulanmış ve ince ayarın etkisi beş seviyede ayrı ayrı analiz edilmiştir. Bulgular, ticari modellerin genel performansta üstün olmakla birlikte, model boyutunun tek başına belirleyici olmadığını göstermiştir. İnce ayar uygulanmış modelin, tüm seviyelerde temel modeli geride bıraktığı ve %50'in üzerinde anlamlı bir performans artışı sağladığı, hatta A1–B2 seviyelerinde bazı 8B modelleri de geçerek ticari modellerle yarıştığı görülmüştür. Ayrıca, dil öğrenimindeki U-şekilli öğrenme eğrisine benzer şekilde modellerin A2 seviyesinde performans düşüşü yaşadığı ve LLM tabanlı değerlendiricilerin insanlara kıyasla ortalama olarak %20–32 daha yüksek puan verme eğiliminde olduğu tespit edilmiştir. İnsan ve LLM değerlendirmeleri arasında puanlama düzeyleri farklılık gösterse de modellerin sıralamaları açısından her iki değerlendirme metodolojisinde yüksek tutarlılık elde edilmiştir. Sonuçlar, küçük açık kaynak modellerin iyi yapılandırılmış sentetik verilerle eğitildiğinde görev odaklı dilsel içerik üretimi bağlamında yüksek performansa ulaşabileceğini ve eğitim teknolojilerinde daha ölçeklenebilir, ekonomik ve güvenli çözümler sunabileceğini göstermektedir.
Özet (Çeviri)
In this study, the word-based sentence generation performance of large language models (LLMs) was comprehensively examined across five different CEFR levels, and commercial models were comparatively evaluated against open-source models. Sentences were generated by six different models for words selected from the Oxford 3000/5000 vocabulary lists; these sentences were scored based on four main criteria (word usage, level appropriateness, grammatical accuracy, naturalness) by both 99 human evaluators and two LLM evaluators, namely ChatGPT-5 and DeepSeek-Reasoner. In addition, a LoRA-based fine-tuning was applied to the Llama-3.2-1B model using 23,093 synthetic sentences produced by GPT-4o, and the effect of fine-tuning was analyzed separately for the five levels. The findings indicate that although commercial models generally outperform others, model size alone is not a decisive factor. The fine-tuned model surpassed its base version at all levels, achieved a significant performance increase of over 50%, and even outperformed some 8B models at the A1–B2 levels, becoming competitive with commercial models. In addition, it was observed that the models experienced a performance decline at the A2 level, similar to the U-shaped learning curve in language learning, and that LLM-based evaluators tended to assign, on average, 20–32% higher scores compared to human evaluators. Although score magnitudes differed between human and LLM evaluations, a high level of consistency was observed in terms of model rankings across both evaluation methodologies. The results indicate that small open-source models, when trained with well-structured synthetic data, can achieve high performance in task-oriented linguistic content generation and may offer more scalable, economical, and secure solutions in educational technologies.
Benzer Tezler
- Açıklanabilir yapay zeka kullanarak saldırı tespit sistemi geliştirme
Developing an intrusion detection system using explainable artificial intelligence
SAMED AL
Doktora
Türkçe
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGazi ÜniversitesiBilgi Güvenliği Mühendisliği Ana Bilim Dalı
PROF. DR. ŞEREF SAĞIROĞLU
- Yeni Cami'nin akustik açıdan performans değerlendirmesi
Evaluation of the acoustical performance of the New Mosque
EVREN YILDIRIM
Yüksek Lisans
Türkçe
2003
Mimarlıkİstanbul Teknik ÜniversitesiMimarlık Ana Bilim Dalı
PROF. DR. SEVTAP YILMAZ DEMİRKALE
- Performance evaluation of llm based chatbots with E2e method:LLama-8b,LLama-7b,Gemma-7b and mistral-7b
Uçtan uca yöntemi ile büyük dil modeli tabanlı sohbet botlarının performans değerlendirmesi:LLama-8B,LLama-7B,Gemma-7b ve mıstral-7B
NAİLE CENK
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolMef ÜniversitesiBilişim Teknolojileri Mühendisliği Ana Bilim Dalı
PROF. DR. ADEM KARAHOCA
- Efficient resource orchestration for distributed large language model inference at the edge
Uç bilişimde dağıtık büyük dil modeli çıkarımı için etkin kaynak orkestrasyonu
SAMA HABIBI
Doktora
İngilizce
2025
Elektrik ve Elektronik MühendisliğiSabancı ÜniversitesiElektronik Mühendisliği Ana Bilim Dalı
PROF. DR. ÖZGÜR ERÇETİN
- Aı-assisted automation of the scan-to-HBIM process for cultural heritage: development of an open framework
Kültürel miras için scan-to-HBIM sürecinin yapay zeka destekli otomasyonu: açık bir çerçeve geliştirilmesi
HİLAL SILA ŞENTÜRK
Yüksek Lisans
İngilizce
2026
MimarlıkAnkara Yıldırım Beyazıt ÜniversitesiMimarlık Ana Bilim Dalı
DR. ÖĞR. ÜYESİ CEMİLE FEYZAN ŞİMŞEK
ÖĞR. GÖR. ÖMER FARUK PAMAK