Konuşmacı ayırt etme algoritmalarının LLM tabanlı optimizasyonu ve performans analizi
LLM based optimization and performance analysis of speaker diarization algorithms
- Tez No: 1016781
- Danışmanlar: DOÇ. DR. GÜLSÜM ZEYNEP GÜRKAŞ AYDIN
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: Türkçe
- Üniversite: İstanbul Üniversitesi-Cerrahpaşa
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Günümüzde Konuşmacı Ayırt Etme (Speaker Diarization - SD) sistemleri toplantı analizi, çağrı merkezi çözümleri, medya içeriklerinin işlenmesi ve konuşma tabanlı uygulamalar gibi birçok alanda kullanılmaktadır. Bununla birlikte üst üste konuşmalar, benzer konuşmacı özellikleri, gürültülü kayıt koşulları ve konuşmacı sayısındaki artış gibi etkenler SD sistemlerinin hata üretmesine neden olabilmektedir. Özellikle Otomatik Konuşma Tanıma (Automatic Speech Recognition - ASR) sistemleri ile birlikte kullanılan SD çıktılarındaki hatalar, konuşmacı etiketli transkriptlerin doğruluğunu doğrudan etkilemektedir. Son yıllarda Büyük Dil Modelleri'nin (Large Language Models – LLM'ler) doğal dil anlama ve bağlamsal ilişki kurma yetenekleri sayesinde SD hata düzeltme çalışmalarında kullanılmaya başlandığı görülmektedir. Bu kapsamda geliştirilen DiarizationLM sistemi, mevcut konuşmacı etiketli transkriptler üzerindeki SD hatalarını yalnızca metin tabanlı işlem yaparak düzeltmeyi amaçlayan açık kaynaklı bir yaklaşım sunmaktadır. Bu tez çalışmasında, DiarizationLM çerçevesi temel alınarak çok konuşmacılı toplantı kayıtları içeren AMI veri seti üzerinde LLM tabanlı SD hata düzeltme işlemleri gerçekleştirilmiştir. İlk aşamada WhisperX ve PyAnnote sistemleri kullanılarak ASR ve SD işlemleri uygulanmış ve kelime düzeyinde konuşmacı etiketli transkriptler elde edilmiştir. Sonrasında açık kaynaklı Qwen2.5, Llama3 ve Mistral model ailelerinden farklı kapasitelerde toplam sekiz farklı LLM kullanılarak Sıfır-Atış (Zero-Shot - ZS), Tek-Atış (One-Shot - OS) ve İnce Ayar (Fine Tuning - FT) konfigürasyonları gerçekleştirilmiştir. Modellerin performansları Kelime Hata Oranı (Word Error Rate - WER), Kelime Ayırt Etme Hata Oranı (Word Diarization Error Rate - WDER) ve Birleştirilmiş Minimum Permütasyon Kelime Hata Oranı (Concatenated Minimum-Permutation Word Error Rate - cpWER) metrikleri kullanılarak değerlendirilmiştir. Ayrıca, FT sonrası elde edilen konuşmacı etiketi düzeltmeleri yayılım uzunluklarına göre analiz edilmiş ve yayılım uzunluğuna dayalı seçici bir kabul yaklaşımı önerilmiştir.
Özet (Çeviri)
Nowadays, Speaker Diarization (SD) systems are widely used in various application areas such as meeting analysis, call center solutions, media content processing, and speech based applications. However, factors such as overlapping speech, similarities between speakers, noisy recording conditions, and increasing numbers of speakers may cause SD systems to produce errors. In particular, errors in SD outputs used together with Automatic Speech Recognition (ASR) systems directly affect the accuracy of speaker attributed transcripts. In recent years, Large Language Models (LLMs) have started to be utilized for SD error correction tasks due to their strong natural language understanding and contextual reasoning capabilities. In this context, the DiarizationLM framework introduced an open source approach that aims to correct SD errors on existing speaker labeled transcripts using only text based processing. In this thesis, LLMs based SD error correction experiments were conducted on the AMI meeting corpus by following the DiarizationLM framework. In the first stage, ASR and SD processes were performed using WhisperX and PyAnnote systems, resulting in word level speaker attributed transcripts. Afterwards, Zero-Shot (ZS), One-Shot (OS), and Fine-Tuning (FT) configurations were applied using eight different open source LLMs with varying parameter capacities from the Qwen2.5, Llama3, and Mistral model families. Model performances were evaluated using Word Error Rate (WER), Word Diarization Error Rate (WDER), and Concatenated Minimum-Permutation Word Error Rate (cpWER) metrics. In addition, speaker label corrections obtained after FT were analyzed according to their correction span lengths and a selective acceptance approach based on span length was proposed.
Benzer Tezler
- İşitsel düzenliliğin fark edilmesinin gürültüde konuşmayı ayırt etme problemi olan ve olmayan bireylerde elektrofizyolojik yöntemlerle karşılaştırılması
Comparision of auditory regularity detection between individuals with and without speech in noise problems BY electrophysiological methods
MEHMET YARALI
Doktora
Türkçe
2015
BiyofizikHacettepe ÜniversitesiOdyoloji ve Konuşma Bozuklukları Ana Bilim Dalı
PROF. DR. SONGÜL AKSOY
- Fake news classification using machine learning and deep learning approaches
Makine öğrenimi ve derin öğrenme yaklaşımlarını kullanarak sahte haber sınıflandırması
SAJA ABDULHALEEM MAHMOOD AL-OBAIDI
Yüksek Lisans
İngilizce
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGazi ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ TUBA ÇAĞLIKANTAR
- Enhance the performance of preprocessing techniques by using artificial intelligence algorithms
Yapay zeka algoritmaları kullanarak ön işleme tekniklerinin performansını artırın
HUMAM QUTAIBA ABDULRAHMAN AL-DOORI
Yüksek Lisans
İngilizce
2022
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAltınbaş ÜniversitesiElektrik ve Bilgisayar Mühendisliği Ana Bilim Dalı
YRD. DOÇ. DR. ABDULLAHİ ABDUL IBRAHIM
- Classification of abnormal respiratory sounds using deep learning techniques
Solunum seslerinin derin öğrenme yöntemleri ile sınıflandırılması
AHAMADI ABDALLAH IDRISSE
Yüksek Lisans
İngilizce
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGazi ÜniversitesiBilgisayar Bilimleri Ana Bilim Dalı
DOÇ. DR. OKTAY YILDIZ
- Structure and interaction in Cretan leaping dances: Connecting ethnography and computational analysis
Girit danslarının yapısı ve etkileşimi: Etnoğrafya ve bilişimsel analizin bağlantısı
ANDRE HOLZAPFEL
Doktora
İngilizce
2018
Müzikİstanbul Teknik ÜniversitesiMüzik Ana Bilim Dalı
DOÇ. DR. EMİNE ŞİRİN ÖZGÜN TANIR