A comprehensive multi-prompt evaluation of large language models on Turkish datasets
Büyük dil modellerinin Türkçe veri kümeleri üzerinde kapsamlı ve çok-istemli değerlendirmesi
- Tez No: 978207
- Danışmanlar: DR. ÖĞR. ÜYESİ EMRE UĞUR, PROF. AYŞE BAŞAR
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Performans değerlendirme, Türkçe, Performance evaluation, Turkish
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Boğaziçi Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu çalışma, Türkçe dilinde hem anlama hem de güvenilirlik görevlerinde büyük dil modellerini (LLM'ler) kapsamlı bir şekilde değerlendirmeyi amaçlamaktadır. Ayrıca, modellerin istem sağlamlığı ve ince ayarlı LLM'lerin sohbet versiyonlarıyla kıyası üzerine analizler de içerir. Türkçe, kaynaklara sahip ancak yeterince araştırılmamış bir dildir. Bu, Türkçe dilinin doğal dil işlemedeki (NLP) son gelişmelerin gerisinde kalmasına yol açmıştır. Kapsamlı değerlendirmeler ve standartlaşmış kıyaslamalar, Türkçe LLM'lerin ilerlemesinde önemlidir, çünkü neyin işe yaradığını saptamaya yardımcı olurlar. Biz de Türkçe LLM'lerin ilerlemesine katkıda bulunmak için, 17 veri kümesi kullanarak 11 görevde 10 açık kaynaklı LLM'yi değerlendirdik. Hem orijinal Türkçe veri kümelerini hem de çevrilmiş veri kümelerini kullandık. Bazı görevlerde Türkçe veya çok dilli önceden eğitilmiş dil modellerini (PLM'ler) referans olarak kullandık. Gemma2-9b-it modelinin, değerlendirilen LLM'ler arasında hem anlama hem de güvenilirlik görevlerin-de net en iyi performansı gösteren model olduğunu bulduk. Ancak ince ayar deneylerinde net bir en iyi performans gösteren model olmadığını ve en iyi PLM'nin, deneylerin çoğunda en iyi LLM ile karşılaştırılabilir sonuçlara sahip olduğunu gördük. Modellerin başka şekilde ifade edilmiş istemlerdeki performanslarında önemli farklılıklar olduğunu bulduk; bu da sağlamlığın LLM'lerin üzerinde iyileştirme yapması gereken bir alan olduğunu gösteriyor. Ayrıca, çok dilli baz LLM'lerin Türkçe'ye uyarlanmasıyla elde edilen wiroai-turkish-llm-8b gibi modellerin, çoğunlukla baz alındıkları modellerden daha iyi performans gösterdiğini gözlemledik.
Özet (Çeviri)
This study aims to comprehensively evaluate large language models (LLMs) on both understanding and trustworthiness tasks in Turkish language. In this study, we also conducted analyses on the prompt robustness of the models and the comparison of fine-tuned LLMs with their chat versions. Turkish is a resourced language, but it is an under-researched language. This led the Turkish language to be behind on recent advances in natural language processing (NLP). Having comprehensive evaluations and standardized benchmarks are important in the progress of Turkish LLMs, as they help to identify what is working. To contribute to the progress of Turkish LLMs, we evaluated 10 open-source LLMs on 11 tasks using 17 datasets. We used both originally Turkish datasets, and translated datasets. In some tasks, we used Turkish and multilingual pre-trained language models (PLMs), including TURNA, BERTurk, and mT5, as baselines. We found that the gemma2-9b-it is the clear best performer among the chat versions of the LLMs we evaluated, in both understanding and trustworthiness tasks. However, in fine-tuning experiments, there was no clear best performer and the best PLM had comparable results with the best LLM in most of the experiments. We found that there are significant differences in the performances of the models on paraphrased prompts, suggesting that robustness is an area that the LLMs need improvement on. We also observed that models like Trendyol-8B-chat-v2.0 and wiroai-turkish-llm-8b, which are adapted to Turkish by instruction tuning multilingual LLMs with Turkish instructions, usually outperform the models they are based on.
Benzer Tezler
- Doğal dil ile SQL ve görselleştirme koduna dönüşümde büyük dil modellerinin karşılaştırmalı analizi
Comparative analysis of large language models for natural language to SQL and visualization code generation
BAYKAL MEHMET UÇAR
Yüksek Lisans
Türkçe
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiHesaplamalı Bilim ve Mühendislik Ana Bilim Dalı (disiplinlerarası)
DOÇ. DR. SEFER BADAY
- Performance evaluation of llm based chatbots with E2e method:LLama-8b,LLama-7b,Gemma-7b and mistral-7b
Uçtan uca yöntemi ile büyük dil modeli tabanlı sohbet botlarının performans değerlendirmesi:LLama-8B,LLama-7B,Gemma-7b ve mıstral-7B
NAİLE CENK
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolMef ÜniversitesiBilişim Teknolojileri Mühendisliği Ana Bilim Dalı
PROF. DR. ADEM KARAHOCA
- A large language model (LLM)-based framework for bid/no-bid decision support in construction public procurement: Validated on romanian tenders
İnşaat kamu ihalelerinde teklif verme / vermeme karar desteği için büyük dil modeli (LLM) tabanlı bir çerçeve: Romanya ihaleleri üzerinde doğrulama
ELİF GÜLİN PETEK
Yüksek Lisans
İngilizce
2026
İnşaat Mühendisliğiİstanbul Teknik Üniversitesiİnşaat Mühendisliği Ana Bilim Dalı
DOÇ. DR. ONUR BEHZAT TOKDEMİR
- Dinamik konumlandırma sistemine sahip gemilerde pozisyon kaybı olaylarının risk analizi
Risk analysis of loss of position incidents on ships with dynamic positioning system
DOĞANAY ALPER ELİDOLU
Yüksek Lisans
Türkçe
2025
Denizcilikİstanbul Teknik ÜniversitesiDeniz Ulaştırma İşletme Mühendisliği Ana Bilim Dalı
PROF. DR. YASİN ARSLANOĞLU
- Entegre BWM-CoCoSo ve entegre sezgisel bulanık AHP-bulanık MOORA uygulamaları ile otel seçimi
Hotel selection with integrated BWM-CoCoSo and integrated intuitionistic fuzzy AHP-fuzzy MOORA applications
ZELİHA NUR GİRESUNLU
Yüksek Lisans
Türkçe
2023
Endüstri ve Endüstri MühendisliğiSakarya ÜniversitesiEndüstri Mühendisliği Ana Bilim Dalı
DOÇ. DR. TÜLAY KORKUSUZ POLAT