Geri Dön

Konuşmacı ayırt etme algoritmalarının LLM tabanlı optimizasyonu ve performans analizi

LLM based optimization and performance analysis of speaker diarization algorithms

  1. Tez No: 1016781
  2. Yazar: SEDANUR KARABAYRAM
  3. Danışmanlar: DOÇ. DR. GÜLSÜM ZEYNEP GÜRKAŞ AYDIN
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: Türkçe
  9. Üniversite: İstanbul Üniversitesi-Cerrahpaşa
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Günümüzde Konuşmacı Ayırt Etme (Speaker Diarization - SD) sistemleri toplantı analizi, çağrı merkezi çözümleri, medya içeriklerinin işlenmesi ve konuşma tabanlı uygulamalar gibi birçok alanda kullanılmaktadır. Bununla birlikte üst üste konuşmalar, benzer konuşmacı özellikleri, gürültülü kayıt koşulları ve konuşmacı sayısındaki artış gibi etkenler SD sistemlerinin hata üretmesine neden olabilmektedir. Özellikle Otomatik Konuşma Tanıma (Automatic Speech Recognition - ASR) sistemleri ile birlikte kullanılan SD çıktılarındaki hatalar, konuşmacı etiketli transkriptlerin doğruluğunu doğrudan etkilemektedir. Son yıllarda Büyük Dil Modelleri'nin (Large Language Models – LLM'ler) doğal dil anlama ve bağlamsal ilişki kurma yetenekleri sayesinde SD hata düzeltme çalışmalarında kullanılmaya başlandığı görülmektedir. Bu kapsamda geliştirilen DiarizationLM sistemi, mevcut konuşmacı etiketli transkriptler üzerindeki SD hatalarını yalnızca metin tabanlı işlem yaparak düzeltmeyi amaçlayan açık kaynaklı bir yaklaşım sunmaktadır. Bu tez çalışmasında, DiarizationLM çerçevesi temel alınarak çok konuşmacılı toplantı kayıtları içeren AMI veri seti üzerinde LLM tabanlı SD hata düzeltme işlemleri gerçekleştirilmiştir. İlk aşamada WhisperX ve PyAnnote sistemleri kullanılarak ASR ve SD işlemleri uygulanmış ve kelime düzeyinde konuşmacı etiketli transkriptler elde edilmiştir. Sonrasında açık kaynaklı Qwen2.5, Llama3 ve Mistral model ailelerinden farklı kapasitelerde toplam sekiz farklı LLM kullanılarak Sıfır-Atış (Zero-Shot - ZS), Tek-Atış (One-Shot - OS) ve İnce Ayar (Fine Tuning - FT) konfigürasyonları gerçekleştirilmiştir. Modellerin performansları Kelime Hata Oranı (Word Error Rate - WER), Kelime Ayırt Etme Hata Oranı (Word Diarization Error Rate - WDER) ve Birleştirilmiş Minimum Permütasyon Kelime Hata Oranı (Concatenated Minimum-Permutation Word Error Rate - cpWER) metrikleri kullanılarak değerlendirilmiştir. Ayrıca, FT sonrası elde edilen konuşmacı etiketi düzeltmeleri yayılım uzunluklarına göre analiz edilmiş ve yayılım uzunluğuna dayalı seçici bir kabul yaklaşımı önerilmiştir.

Özet (Çeviri)

Nowadays, Speaker Diarization (SD) systems are widely used in various application areas such as meeting analysis, call center solutions, media content processing, and speech based applications. However, factors such as overlapping speech, similarities between speakers, noisy recording conditions, and increasing numbers of speakers may cause SD systems to produce errors. In particular, errors in SD outputs used together with Automatic Speech Recognition (ASR) systems directly affect the accuracy of speaker attributed transcripts. In recent years, Large Language Models (LLMs) have started to be utilized for SD error correction tasks due to their strong natural language understanding and contextual reasoning capabilities. In this context, the DiarizationLM framework introduced an open source approach that aims to correct SD errors on existing speaker labeled transcripts using only text based processing. In this thesis, LLMs based SD error correction experiments were conducted on the AMI meeting corpus by following the DiarizationLM framework. In the first stage, ASR and SD processes were performed using WhisperX and PyAnnote systems, resulting in word level speaker attributed transcripts. Afterwards, Zero-Shot (ZS), One-Shot (OS), and Fine-Tuning (FT) configurations were applied using eight different open source LLMs with varying parameter capacities from the Qwen2.5, Llama3, and Mistral model families. Model performances were evaluated using Word Error Rate (WER), Word Diarization Error Rate (WDER), and Concatenated Minimum-Permutation Word Error Rate (cpWER) metrics. In addition, speaker label corrections obtained after FT were analyzed according to their correction span lengths and a selective acceptance approach based on span length was proposed.

Benzer Tezler

  1. İşitsel düzenliliğin fark edilmesinin gürültüde konuşmayı ayırt etme problemi olan ve olmayan bireylerde elektrofizyolojik yöntemlerle karşılaştırılması

    Comparision of auditory regularity detection between individuals with and without speech in noise problems BY electrophysiological methods

    MEHMET YARALI

    Doktora

    Türkçe

    Türkçe

    2015

    BiyofizikHacettepe Üniversitesi

    Odyoloji ve Konuşma Bozuklukları Ana Bilim Dalı

    PROF. DR. SONGÜL AKSOY

  2. Fake news classification using machine learning and deep learning approaches

    Makine öğrenimi ve derin öğrenme yaklaşımlarını kullanarak sahte haber sınıflandırması

    SAJA ABDULHALEEM MAHMOOD AL-OBAIDI

    Yüksek Lisans

    İngilizce

    İngilizce

    2023

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGazi Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ TUBA ÇAĞLIKANTAR

  3. Enhance the performance of preprocessing techniques by using artificial intelligence algorithms

    Yapay zeka algoritmaları kullanarak ön işleme tekniklerinin performansını artırın

    HUMAM QUTAIBA ABDULRAHMAN AL-DOORI

    Yüksek Lisans

    İngilizce

    İngilizce

    2022

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAltınbaş Üniversitesi

    Elektrik ve Bilgisayar Mühendisliği Ana Bilim Dalı

    YRD. DOÇ. DR. ABDULLAHİ ABDUL IBRAHIM

  4. Classification of abnormal respiratory sounds using deep learning techniques

    Solunum seslerinin derin öğrenme yöntemleri ile sınıflandırılması

    AHAMADI ABDALLAH IDRISSE

    Yüksek Lisans

    İngilizce

    İngilizce

    2023

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGazi Üniversitesi

    Bilgisayar Bilimleri Ana Bilim Dalı

    DOÇ. DR. OKTAY YILDIZ

  5. Structure and interaction in Cretan leaping dances: Connecting ethnography and computational analysis

    Girit danslarının yapısı ve etkileşimi: Etnoğrafya ve bilişimsel analizin bağlantısı

    ANDRE HOLZAPFEL

    Doktora

    İngilizce

    İngilizce

    2018

    Müzikİstanbul Teknik Üniversitesi

    Müzik Ana Bilim Dalı

    DOÇ. DR. EMİNE ŞİRİN ÖZGÜN TANIR