Statistical and discriminative language modeling for Turkish large vocabulary continuous speech recognition
Türkçe geniş dağarcıklı konuşma tanıma için istatistiksel ve ayırıcı dil modellemesi
- Tez No: 255903
- Danışmanlar: YRD. DOÇ. DR. MURAT SARAÇLAR
- Tez Türü: Doktora
- Konular: Elektrik ve Elektronik Mühendisliği, Electrical and Electronics Engineering
- Anahtar Kelimeler: Konuşma tanıma, Speech recognition
- Yıl: 2009
- Dil: İngilizce
- Üniversite: Boğaziçi Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Elektrik-Elektronik Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Sondan eklemeli ve zengin biçimbilimsel yapıya sahip olan Türkçe, Geniş Dağarcıklı Sürekli Konuşma Tanıma (GDSKT) için zor bir dildir.Türkçe'nin sondan eklemeli yapısı yüzünden çok fazla sayıda dağarcık dışı kelime bulunmakta ve bu kelimelerin varlığı konuşma tanıma başarımlarını düşürmektedir.Türkçe'nin göreceli serbest kelime dizilimine sahip olması gürbüz olmayan dil modeli kestirimlerine sebep olmaktadır.Bu zorluklar, kelime-altı birimler olarak adlandırılan, anlamlı kelime parçacıklarının dil modellemesinde kullanılmasıyla büyük ölçüde aşılmıştır.Fakat, kelime-altı birimlerin bir kusuru Türkçe'de bulunmayan kelimeleri fazladan üretmesidir.Daha yüksek başarımlar için bu sorunun da çözülmesi gerekmektedir.Bu tez Türkçe'nin GDSKT sistemlerindeki zorluklarını çözmeyi hedeflemektedir.Dil modellemesi için dilbilimsel ve istatistiksel kelime-altı birimler araştırılmış ve bu birimler kelime dil modelleri üzerinden anlamlı başarım artışı sağlamıştır.Dinamik dağarcık uyarlamasından esinlenerek önerdiğimiz yeni yaklaşımımız kelime-altı birimlerdeki fazladan üretilen kelime hatalarını büyük ölçüde düzeltmiş ve kelime-altı birimlerin başarımını daha da arttırmıştır.Ayrıca Ayırıcı Dil Modelleri (ADM) dilbilimsel ve istatistiksel özniteliklerle birlikte kullanılmıştır.Hem ayırıcı eğitim ile daha iyi parametre kestirimleri sağlaması, hem de Türkçe'nin dil özelliklerini dil modellemesine katması sayesinde ADM geleneksel yöntemlerden daha iyi başarımlar göstermiştir.Bu tezin önemi birçok kelime-altı birimi aynı GDSKT sisteminde karşılaştıran bir çalışma olmasında, kelime-altı birimlerdeki fazladan kelime üretme hatalarını düzeltmeye çalışmasında ve Türkçe dil modelleme yaklaşımlarına ADM'ni eklemesinde yatmaktadır.Önerilen yöntemler benzer sorunları yaşayan diğer zengin biçimbilimsel yapıya sahip dillere kolaylıkla genişletilebilir.
Özet (Çeviri)
Turkish, being an agglutinative language with rich morphology, presents challenges for Large Vocabulary Continuous Speech Recognition (LVCSR) systems.First, the agglutinative nature of Turkish leads to a high number of Out-of-Vocabulary (OOV) words which in turn lower Automatic Speech Recognition (ASR) accuracy.Second, Turkish has a relatively free word order that leads to non-robust language model estimates.These challenges have been mostly handled by using meaningful segmentations of words, called sub-lexical units, in language modeling.However, a shortcoming of sub-lexical units is over-generation which needs to be dealt with for higher accuracies.This dissertation aims to address the challenges of Turkish in LVCSR.Grammatical and statistical sub-lexical units for language modeling are investigated and they yield substantial improvements over the word language models.Our novel approach inspired by dynamic vocabulary adaptation mostly recovers the errors caused by over-generation and further improves the accuracy of sub-lexical units.Additionally, discriminative language models (DLMs) with linguistically and statistically motivated features are utilized.DLM outperforms the conventional approaches, partly due to the improved parameter estimates with discriminative training and partly due to integrating the complex language characteristics of Turkish into language modeling.The significance of this dissertation lies in being a comparative study of several sub-lexical units on the same LVCSR system, addressing the over-generation problem of sub-lexical units and extending sub-lexical-based generative language modeling of Turkish to discriminative language modeling.These approaches can be easily extended to other morphologically rich languages that suffer from similarproblems.
Benzer Tezler
- Çimentonun sertleşmesi üzerinde kimyasal komponentlerin etkisi
Başlık çevirisi yok
NACİYE TÜRKEL
Yüksek Lisans
Türkçe
1986
Kimya MühendisliğiUludağ ÜniversitesiKimya Ana Bilim Dalı
PROF. DR. MUSTAFA CEBE
- Dokuma kumaşlarda örgü tipinin ham kumaşın boyutları ve geometrik özellikleri üzerindeki etkilerinin araştırılması
Başlık çevirisi yok
EMEL ÖNDER
Yüksek Lisans
Türkçe
1985
Tekstil ve Tekstil MühendisliğiEge ÜniversitesiTekstil Mühendisliği Ana Bilim Dalı
DOÇ. DR. GÜNGÖR BAŞER
- İki katlı pamuk ipliklerinden dokunan kumaşlarda örgüye bağlı olarak maksimum atkı sıklığının değişimi üzerinde bir araştırma
Başlık çevirisi yok
MELTEM ASLI NARTER
Yüksek Lisans
Türkçe
1985
Tekstil ve Tekstil MühendisliğiEge ÜniversitesiTekstil Mühendisliği Ana Bilim Dalı
DOÇ. DR. GÜNGÖR BAŞER
- Izgara ve altlık üstünde barındırılan ile de france X kıvırcık (Fl) ve merinos kuzularının entansif besideki performansları
Başlık çevirisi yok
ÜMRAN ŞAHAN
Yüksek Lisans
Türkçe
1987
Veteriner HekimliğiUludağ ÜniversitesiZootekni Ana Bilim Dalı
PROF. DR. ERDOĞAN TUNCEL
- Bir pamuk iplikhanesinde fiili çalışma metodlarının incelenmesi ve mevcut işlemlerin standart sürelerinin saptanması
Başlık çevirisi yok
MÜRŞİDE KESEROĞLU
Yüksek Lisans
Türkçe
1985
İşletmeEge ÜniversitesiTekstil Mühendisliği Ana Bilim Dalı
DOÇ. DR. MUSTAFA NAZMİ ERCAN