Comparison of text-independent speaker verification systems in a multi-class, semi-automatic detection scenario
Metinden bağımsız konuşmacı doğrulama sistemlerinin çok sınıflı, yarı otomatik bir tanıma senaryosunda karşılaştırılması
- Tez No: 335574
- Danışmanlar: YRD. DOÇ. DR. CENK DEMİROĞLU
- Tez Türü: Yüksek Lisans
- Konular: Elektrik ve Elektronik Mühendisliği, Electrical and Electronics Engineering
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2013
- Dil: İngilizce
- Üniversite: Özyeğin Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Elektrik-Elektronik Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Konu şmacı do ğrulama sistemlerinin ba şarı sı tipik olarak bu sistemlerin ikili karar vermedeki do ğrulu guna dayanarak öl ç ül ür. Sistemlerin ger çek de ğerli çı kt ıları ço ğunlukla sistem kalibrasyonu veya çoklu sistem kombinasyonlar ı gibi ama çlar do ğrultusunda kullanı lı r. Ancak, finans fi rmaları nı n ça grı merkezleri gibi yerlerde kullan ılan ve %100'e yak ın kesinlik gerektiren konu şmac ı do ğrulama uygulamalar ında, varolan sistemlerin ikili kararlar ına g üvenmek m ümk ün de ğildir. Yine de bu t ür durumlarda, konu şmacı do ğrulama sistemi taraf ından d önd ür ülen çoklu-sı nı f do ğrulama çıkt ıları ( örne gin y üksek, orta, d üşük do ğrulama y üzdesi) ça grı merkezi temsilcisi tarafı ndan, sadece insan olan senaryoya g öre do ğrulama s üresini kı saltmak ve/veya do ğrulama kesinli ğini arttı rmak i çin kullan ılabilir. Bu tezde ilk olarak ger çekleyip kulland ığımı z algoritmaları detaylı bir şekilde anlatarak bir konu şmac ı do ğrulama sisteminin genel g ör ün üm ün ü verece ğiz. Bilhassa bir do ğrulama amacı i çin ilk defa bizim kulland ı ğı mı z, bir s ın ıfland ırı cı olan GDA hakkı nda detaylı bilgi verece ğiz. GDA bizim ele ald ığımı z problemdeki gibi do ğrusal olmayan verilerin sı nıfland ır ılmas ında g örece olarak daha iyi çalı şı yor. Deneyler b öl üm ünde ise öncelikle baz ı çok bilinen konu şmac ı do ğrulama sistemlerinin ba şar ımları nı klasik ba şarı m öl ç ütlerini kullanarak kar şı la ştı rdı k. Daha sonra, do ğrulama d öng üs ünde bir ça grı merkezi temsilcisinin de oldu ğunu varsayarak, bu sistemlerin çoklu-sı nı f ba şar ımları nı kar ş ıla stı rd ık. Ba şar ım, temsilcinin g üvenlikten öd ün vermeden sorması gereken soru miktarı ndaki azalmaya g öre öl ç üld ü. Deneyler NIST 2006 ve 2008 veritabanlar ı kullanı larak ger çekle ştirildi. Herbiri be şer dakikalı k olan bir ve sekiz kar şı l ıkl ı konu şmadan al ınan kay ıtlar ses imzalar ını n çı kar ımı nda kullanı ld ı. Do ğrulama yapı lacak konuşma i çinse be ş dakikalı k bir ve on saniyelik bir kay ıt kullanıldı.
Özet (Çeviri)
Performance of the speaker veri cation systems is typically measured based on their binary decision accuracy. Soft outputs of the systems are used mostly for calibration or multiple system combination purposes. However, in speaker veri cation applications where close to 100% accuracy is required, such as the systems that are used in the call centers of nance companies, it is not possible to rely on the binary decisions of the existing veri cation systems. Still, in such cases, multi-class veri cation outputs (for example, high, medium and low veri cation score) returned by the speaker veri cation systems can be used by a human agent to either reduce the veri cation time and/or increase the veri cation accuracy compared to a human-only scenario. In this thesis, an overview of a speaker veri cation system is given explaining in detail the algorithms that are implemented. Particularly the details about a classi- er, GDA, which was rstly used by us for a veri cation purpose are given. It does relatively better job than state of the art algorithms for non-linear data like in our case. In the experiments section, some of the most popular speaker veri cation systems are compared in terms of the classical performance metric used in the literature. Then, multi-class output performance of them is compared when a human agent is assumed to be in the veri cation loop. Performance is measured by the reduction in the number of questions used by the human agent for verifying the identity of the caller without compromising the security. Experiments are performed using the NIST 2006 and 2008 databases. Eight and one conversation sides (5 minutes each) enrollment data and 1 side and 10 seconds veri cation data conditions are used.
Benzer Tezler
- Konuşmacı tanımada map uyarlamalı sınıflandırıcılar
Map adapted classifiers for speaker recognition
CEMAL HANİLÇİ
Doktora
Türkçe
2013
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolUludağ ÜniversitesiElektronik Mühendisliği Bölümü
YRD. DOÇ. FİGEN ERTAŞ
- Küresel fiziksel aktivite anketinin (GPAQ) Türkçeye uyarlanması, güvenilirlik ve geçerliliğinin Bornova Belediyesi çalışanlarında değerlendirilmesi
Adaptation of the global physical activity questionnaire (GPAQ) to turkish and its reliability and validity among bornova municipality employees
İLKER ADIGÜZEL
Tıpta Uzmanlık
Türkçe
2017
Halk SağlığıEge ÜniversitesiHalk Sağlığı Ana Bilim Dalı
DOÇ. DR. İSABEL RAİKA DURUSOY ONMUŞ
- Domain adaptation for speech-driven affective facial features synthesis
Başlık çevirisi yok
RIZWAN SADIQ
Doktora
İngilizce
2020
Elektrik ve Elektronik MühendisliğiKoç ÜniversitesiElektrik-Elektronik Mühendisliği Ana Bilim Dalı
Prof. Dr. ENGİN ERZİN
- Cross-lingual voice conversion
Diller arasında konuşmacı dönüştürme
OYTUN TÜRK
Doktora
İngilizce
2007
Elektrik ve Elektronik MühendisliğiBoğaziçi ÜniversitesiElektrik-Elektronik Mühendisliği Ana Bilim Dalı
PROF.DR. LEVENT MUSTAFA ARSLAN
- Metin tabanlı ve görsel blok tabanlı kodlama öğretiminin özel yetenekli öğrencilerin akademik başarılarına ve motivasyonlarına etkilerinin karşılaştırılması
Comparison of the effects of text-based and visual block-based coding instruction on the academic achievement and motivation of gifted students
SEYİT YÖRÜR
Yüksek Lisans
Türkçe
2025
Eğitim ve ÖğretimGazi ÜniversitesiBilgisayar ve Öğretim Teknolojileri Eğitimi Ana Bilim Dalı
PROF. DR. MEHMET AKİF OCAK