Performance evaluation of llm based chatbots with E2e method:LLama-8b,LLama-7b,Gemma-7b and mistral-7b
Uçtan uca yöntemi ile büyük dil modeli tabanlı sohbet botlarının performans değerlendirmesi:LLama-8B,LLama-7B,Gemma-7b ve mıstral-7B
- Tez No: 986645
- Danışmanlar: PROF. DR. ADEM KARAHOCA
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Mef Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilişim Teknolojileri Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Yapay Zeka Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu çalışma, müşteri destek sohbet robotları bağlamında büyük dil modellerinin (LLM) performansını uçtan uca (E2E) değerlendirme çerçevesi kullanarak incelemektedir. Özellikle, Gemma-7B, Mistral-7B,Llama-8B ve Llama-7B adlı dört önde gelen açık kaynak model; kullanıcı sorgularını anlamada ve anlamlı, doğru yanıtlar üretmede gösterdikleri başarıya göre karşılaştırılmıştır. İncelenen chatbot uygulaması, eğitim içerikleri sunan bir dijital platformda danışmanlık hizmeti vermek amacıyla tasarlanmış ve 3000'den fazla özenle hazırlanmış soru-cevap çiftiyle test edilmiştir. Değerlendirme süreci, hem anlamsal hem de sözcük düzeyinde ölçütleri birleştirmektedir. Model yanıtlarının uzmanlarca yazılmış yanıtlarla ne derece örtüştüğünü belirlemek için kosinüs benzerliği; sözcük düzeyindeki doğruluğu ölçmek için ise ROUGE metrikleri kullanılmıştır. Bulgular, Gemma-7B ve Llama-8B modelinin tüm metrikler boyunca en tutarlı performansı sergilediğini, Mistral-7B'nin dengeli ancak zaman zaman değişken çıktılar ürettiğini, Llama-7B'nin ise yapısal olarak güçlü olmasına rağmen anlamlı ve bağlama uygun yanıtlar üretmede zorlandığını göstermektedir. Sonuçlar, gerçek dünya chatbot uygulamaları için model seçiminin pratik sonuçlarını ortaya koymakta ve LLM performansının müşteri etkileşimi bağlamında değerlendirilmesinde çok boyutlu analiz yöntemlerinin önemini vurgulamaktadır.
Özet (Çeviri)
This study investigates the performance of large language models (LLMs) within the context of customer support chatbots by employing an end-to-end (E2E) evaluation framework. Specifically, it compares three prominent open-source models (Gemma-7B, Mistral-7B, Llama-7B and Llama-8B) based on their ability to comprehend and respond to user queries in a meaningful and accurate manner. The chatbot application under review was designed to provide assistance on an educational content platform and was tested using over 3000 curated question-answer pairs. The evaluation combines both semantic and lexical metrics, using cosine similarity to measure the alignment of model responses with expert-written answers, and ROUGE metrics to assess word-level accuracy. Additionally, the study incorporates prompt engineering techniques and analyses how models handle random or off-topic inputs, providing a comprehensive view of their reliability and contextual sensitivity. Results indicate that Gemma-7B and Llama-8B performs most consistently across all metrics, while Mistral-7B offers balanced outputs with occasional variance. Llama-7B, although structurally robust, struggled to deliver semantically aligned and contextually appropriate responses. Overall, the findings highlight the practical implications of model selection for real-world chatbot deployments and demonstrate the importance of multi-dimensional evaluation methods when assessing LLM performance in customer interaction settings.
Benzer Tezler
- Sohbet robotu veri seti ile niyet sınıflandırmasında geleneksel ve modern yaklaşımların karşılaştırılması
Comparison of traditional and modern methods in intent classification using a chatbot dataset
KARDEL RÜVEYDA ÇETİN
Yüksek Lisans
Türkçe
2025
Bilim ve TeknolojiYıldız Teknik ÜniversitesiMatematik Mühendisliği Ana Bilim Dalı
PROF. DR. FATMA AYDIN AKGÜN
- Yapay zeka tabanlı chatbotların protetik diş hekimliğindeki etkililiğinin bilimsel olarak değerlendirilmesi
Scientific evaluation of the effectiveness of artificial intelligence-based chatbots in prosthodontics
AHMET DOĞAN IŞIK
Diş Hekimliği Uzmanlık
Türkçe
2025
Diş HekimliğiTokat Gaziosmanpaşa ÜniversitesiProtetik Diş Tedavisi Ana Bilim Dalı
DOÇ. DR. KAAN YERLİYURT
- Generative AI in Healthcare: A Turkish Chatbot for Symptom Assesment and Tailored Recommendations
Sağlikta üretken yapay zekâ: semptom değerlendirmesi ve kişiye özel öneriler için Türkçe bir sohbet botu
YUNUS EMRE IŞIKDEMİR
Yüksek Lisans
İngilizce
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolHacettepe ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. MURAT AYDOS
- Sağlık verileri üzerinde büyük dil modellerinin ince ayar performansı
Fine tuning performance of large language models on health data
MUHAMMED KAYRA BULUT
Yüksek Lisans
Türkçe
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolYıldız Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. BANU DİRİ
- Evaluating performance of large language models in bluff-based card games: A comparative study
Blöf temelli kart oyunlarında büyük dil modeline ait performans değerlendirilmesi: Karşılaştırmalı bir çalışma
İREM ŞALK
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiOyun ve Etkileşim Teknolojileri Ana Bilim Dalı (disiplinlerarası)
PROF. DR. SANEM SARIEL UZER