Geri Dön

Performance evaluation of llm based chatbots with E2e method:LLama-8b,LLama-7b,Gemma-7b and mistral-7b

Uçtan uca yöntemi ile büyük dil modeli tabanlı sohbet botlarının performans değerlendirmesi:LLama-8B,LLama-7B,Gemma-7b ve mıstral-7B

  1. Tez No: 986645
  2. Yazar: NAİLE CENK
  3. Danışmanlar: PROF. DR. ADEM KARAHOCA
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: Mef Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilişim Teknolojileri Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Yapay Zeka Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu çalışma, müşteri destek sohbet robotları bağlamında büyük dil modellerinin (LLM) performansını uçtan uca (E2E) değerlendirme çerçevesi kullanarak incelemektedir. Özellikle, Gemma-7B, Mistral-7B,Llama-8B ve Llama-7B adlı dört önde gelen açık kaynak model; kullanıcı sorgularını anlamada ve anlamlı, doğru yanıtlar üretmede gösterdikleri başarıya göre karşılaştırılmıştır. İncelenen chatbot uygulaması, eğitim içerikleri sunan bir dijital platformda danışmanlık hizmeti vermek amacıyla tasarlanmış ve 3000'den fazla özenle hazırlanmış soru-cevap çiftiyle test edilmiştir. Değerlendirme süreci, hem anlamsal hem de sözcük düzeyinde ölçütleri birleştirmektedir. Model yanıtlarının uzmanlarca yazılmış yanıtlarla ne derece örtüştüğünü belirlemek için kosinüs benzerliği; sözcük düzeyindeki doğruluğu ölçmek için ise ROUGE metrikleri kullanılmıştır. Bulgular, Gemma-7B ve Llama-8B modelinin tüm metrikler boyunca en tutarlı performansı sergilediğini, Mistral-7B'nin dengeli ancak zaman zaman değişken çıktılar ürettiğini, Llama-7B'nin ise yapısal olarak güçlü olmasına rağmen anlamlı ve bağlama uygun yanıtlar üretmede zorlandığını göstermektedir. Sonuçlar, gerçek dünya chatbot uygulamaları için model seçiminin pratik sonuçlarını ortaya koymakta ve LLM performansının müşteri etkileşimi bağlamında değerlendirilmesinde çok boyutlu analiz yöntemlerinin önemini vurgulamaktadır.

Özet (Çeviri)

This study investigates the performance of large language models (LLMs) within the context of customer support chatbots by employing an end-to-end (E2E) evaluation framework. Specifically, it compares three prominent open-source models (Gemma-7B, Mistral-7B, Llama-7B and Llama-8B) based on their ability to comprehend and respond to user queries in a meaningful and accurate manner. The chatbot application under review was designed to provide assistance on an educational content platform and was tested using over 3000 curated question-answer pairs. The evaluation combines both semantic and lexical metrics, using cosine similarity to measure the alignment of model responses with expert-written answers, and ROUGE metrics to assess word-level accuracy. Additionally, the study incorporates prompt engineering techniques and analyses how models handle random or off-topic inputs, providing a comprehensive view of their reliability and contextual sensitivity. Results indicate that Gemma-7B and Llama-8B performs most consistently across all metrics, while Mistral-7B offers balanced outputs with occasional variance. Llama-7B, although structurally robust, struggled to deliver semantically aligned and contextually appropriate responses. Overall, the findings highlight the practical implications of model selection for real-world chatbot deployments and demonstrate the importance of multi-dimensional evaluation methods when assessing LLM performance in customer interaction settings.

Benzer Tezler

  1. Sohbet robotu veri seti ile niyet sınıflandırmasında geleneksel ve modern yaklaşımların karşılaştırılması

    Comparison of traditional and modern methods in intent classification using a chatbot dataset

    KARDEL RÜVEYDA ÇETİN

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Bilim ve TeknolojiYıldız Teknik Üniversitesi

    Matematik Mühendisliği Ana Bilim Dalı

    PROF. DR. FATMA AYDIN AKGÜN

  2. Yapay zeka tabanlı chatbotların protetik diş hekimliğindeki etkililiğinin bilimsel olarak değerlendirilmesi

    Scientific evaluation of the effectiveness of artificial intelligence-based chatbots in prosthodontics

    AHMET DOĞAN IŞIK

    Diş Hekimliği Uzmanlık

    Türkçe

    Türkçe

    2025

    Diş HekimliğiTokat Gaziosmanpaşa Üniversitesi

    Protetik Diş Tedavisi Ana Bilim Dalı

    DOÇ. DR. KAAN YERLİYURT

  3. Generative AI in Healthcare: A Turkish Chatbot for Symptom Assesment and Tailored Recommendations

    Sağlikta üretken yapay zekâ: semptom değerlendirmesi ve kişiye özel öneriler için Türkçe bir sohbet botu

    YUNUS EMRE IŞIKDEMİR

    Yüksek Lisans

    İngilizce

    İngilizce

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolHacettepe Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. MURAT AYDOS

  4. Sağlık verileri üzerinde büyük dil modellerinin ince ayar performansı

    Fine tuning performance of large language models on health data

    MUHAMMED KAYRA BULUT

    Yüksek Lisans

    Türkçe

    Türkçe

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolYıldız Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. BANU DİRİ

  5. Evaluating performance of large language models in bluff-based card games: A comparative study

    Blöf temelli kart oyunlarında büyük dil modeline ait performans değerlendirilmesi: Karşılaştırmalı bir çalışma

    İREM ŞALK

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Oyun ve Etkileşim Teknolojileri Ana Bilim Dalı (disiplinlerarası)

    PROF. DR. SANEM SARIEL UZER