Adaptive expert selection for robust and efficient speech-to-text systems
Dayanıklı ve verimli konuşmadan metne sistemleri için uyarlamalı uzman seçimi
- Tez No: 1024177
- Danışmanlar: PROF. DR. SÜLEYMAN SERDAR KOZAT
- Tez Türü: Yüksek Lisans
- Konular: Elektrik ve Elektronik Mühendisliği, Electrical and Electronics Engineering
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: İngilizce
- Üniversite: İhsan Doğramacı Bilkent Üniversitesi
- Enstitü: Mühendislik ve Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Elektrik-Elektronik Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu tezde, otomatik konuşma tanıma sistemleri için uyarlamalı uzman seçimi problemini çalışmakta ve konuşmadan metne çeviri başarımını artırırken tüm mevcut modelleri çalıştırmanın yüksek hesaplama maliyetinden kaçınan iki tamamlayıcı yöntem sunmaktayız. Modern önceden eğitilmiş konuşma tanıma modelleri standart veri kümelerinde güçlü sonuçlar elde etse de, arka plan gürültüsü, yankılanma, uzak alan kayıtları, konuşmacı çakışması, aksan farklılıkları ve konuşma hızı değişimleri gibi gerçekçi akustik koşullarda başarımları önemli ölçüde değişebilmektedir. Bu nedenle, tek bir konuşma tanıma modelinin tüm girişler için en iyi sonucu vermesi beklenemez. Bu tezde, konuşmadan metne model seçimini önceden eğitilmiş uzmanlardan oluşan sabit bir havuz üzerinde uyarlamalı bir yönlendirme problemi olarak ele almaktayız. İlk yöntemde, sözce düzeyinde uyarlamalı uzman seçimi yaklaşımı sunmaktayız. Her ses parçası; akustik, prozodik, sinyal-zamansal ve sinirsel gömme tabanlı özniteliklerden oluşan kompakt bir öznitelik vektörü ile temsil edilmektedir. Gradyan destekli ağaçlar veya yapay sinir ağı ile gerçekleştirilebilen hafif bir yönlendirici, bu öznitelik vektörünü aday konuşma tanıyıcılar üzerinde bir olasılık dağılımına eşlemektedir. Yönlendirici, kelime hata oranına dayalı ve nihai transkripsiyon kalitesiyle uyumlu bir beklenen kayıp fonksiyonu ile eğitilmektedir. Eğitim sırasında tüm uzmanlar etiketli bir referans veri kümesi üzerinde çalıştırılarak uzman bazlı transkripsiyon hataları hesaplanmakta, çıkarım sırasında ise yalnızca seçilen uzman çalıştırılmaktadır. İkinci yöntemde, çerçeve düzeyinde dönüştürücü tabanlı bir uzman seçimi yaklaşımı sunmaktayız. Bu yöntem, tüm ses parçasını tek bir küresel öznitelik vektörüne indirgemek yerine, aday uzmanların kodlayıcıları tarafından üretilen çerçeve düzeyindeki gizli temsilleri korumaktadır. Hiyerarşik bir dönüştürücü yönlendirici, önce her uzman akışı içindeki zamansal kanıtı modellemekte, daha sonra uzmanlar arası bilgiyi birleştirerek nihai konuşma tanıyıcıyı seçmektedir. Önerilen yöntemler modülerdir ve önceden eğitilmiş konuşmadan metne sistemlerinin iç mimarilerinin değiştirilmesini gerektirmez. Yapay ve gerçek dünya konuşma tanıma veri kümeleri üzerindeki deneyler, uyarlamalı uzman seçiminin heterojen akustik koşullarda sabit tek model kullanımına, rastgele uzman seçimine, hipotez düzeyinde füzyona ve havuzlanmış temsil tabanlı yönlendirme yaklaşımlarına göre daha iyi sonuçlar verebildiğini göstermektedir. Sözce düzeyindeki yöntem hafif ve verimli bir yönlendirme mekanizması sağlarken, çerçeve düzeyindeki dönüştürücü tabanlı yöntem zamansal olarak karmaşık sesler için daha ifade gücü yüksek bir alternatif sunmaktadır. Birlikte değerlendirildiğinde, bu yöntemler önceden eğitilmiş konuşma tanıma sistemlerinin dayanıklı ve verimli transkripsiyon için uyarlamalı bir yönlendirme çerçevesinde tamamlayıcı uzmanlar olarak kullanılabileceğini göstermektedir.
Özet (Çeviri)
We study adaptive expert selection for automatic speech recognition and introduce two complementary methods that improve transcription robustness while avoiding the computational cost of exhaustively running all available speech-to-text systems. Modern pretrained speech recognition models achieve strong performance on standard benchmarks. However, their accuracy can vary significantly under heterogeneous acoustic conditions such as background noise, reverberation, far-field recording, speaker overlap, accent variation, and speaking-rate changes. Since no single recognizer is uniformly optimal across all possible inputs, we formulate speech-to-text model selection as an adaptive routing problem over a fixed pool of pretrained experts. In the first method, we introduce an utterance-level adaptive expert selection framework. We represent each audio clip by a compact feature vector composed of acoustic, prosodic, signal-temporal, and neural embedding-based features. A lightweight router, implemented using either gradient-boosted trees or a neural network, maps this feature vector to a probability distribution over the candidate models. The router is trained with a transcription-quality-aware expected word error rate objective. During training, all experts are evaluated on a labeled reference set to compute their expert-level transcription errors. During inference, however, only the selected expert is decoded. In the second method, we introduce a frame-level transformer-based expert selection framework. Instead of summarizing the entire clip into a single feature vector, this method preserves the frame-level encoder representations produced by the candidate experts. A hierarchical transformer router first models temporal evidence within each expert stream and then fuses cross-expert information to select the final recognizer. The training objective combines expected word error rate, hard oracle supervision, and soft word-error-rate-derived targets in order to account for both expert identity and the relative cost of incorrect expert choices. The introduced methods are modular and do not require modifying the internal architectures of the pretrained speech-to-text systems. Experiments on synthetic and real-world speech recognition benchmarks show that adaptive expert selection can outperform static single-model deployment, random expert selection, hypothesis-level fusion, and pooled-routing baselines under heterogeneous acoustic conditions. The utterance-level method provides a lightweight and efficient routing mechanism, while the frame-level transformer method offers a more expressive alternative for temporally complex audio. Together, these methods demonstrate that pretrained speech recognition systems can be used as complementary experts within an adaptive routing framework for robust and efficient transcription.
Benzer Tezler
- Düşük bir hızlarında konuşma kodlama ve uygulamaları
Low bit rate speech coding and applications
TARIK AŞKIN
Doktora
Türkçe
1999
Elektrik ve Elektronik Mühendisliğiİstanbul Teknik ÜniversitesiPROF.DR. GÜNSEL DURUSOY
- Robust and efficient learning methods for time series processing under missing data
Eksik veri içeren zaman serilerinin işlenmesi için gürbüz ve etkin öğrenme yöntemleri
SAFA ONUR ŞAHİN
Doktora
İngilizce
2025
Elektrik ve Elektronik Mühendisliğiİhsan Doğramacı Bilkent ÜniversitesiElektrik ve Elektronik Mühendisliği Ana Bilim Dalı
PROF. DR. SÜLEYMAN SERDAR KOZAT
- Denoising sea ice wide beam sar images based on extracted features, adaptive fuzzy logic network and adaptive thresholding based on semi adaptive fuzzy logic controllers
Çıkarılmış özellikler, uyarlanabilir bulanık mantık ağı ve yarı uyarlanabilir bulanık mantık denetleyicilerine dayalı uyarlanabilir eşikleme kullanılarak deniz buzu geniş hüzmeli sar görüntülerinin gürültü giderimi
HALİT NAZLI
Doktora
İngilizce
2026
Elektrik ve Elektronik Mühendisliğiİstanbul Aydın ÜniversitesiElektrik-Elektronik Mühendisliği Ana Bilim Dalı
PROF. DR. OSMAN YILDIRIM
- Toplu taşıma hatlarının optimizasyonu için bir model önerisi: Sivas örneği
A model proposal for the optimization of public transportation lines: The case of Sivas
İSMAİL ÖZÇELİK
Yüksek Lisans
Türkçe
2026
Ulaşımİstanbul Teknik Üniversitesiİnşaat Mühendisliği Ana Bilim Dalı
DOÇ. DR. HÜSEYİN ONUR TEZCAN
- The development of circular economy-based decision support framework for construction project designs
İnşaat proje tasarımları için döngüsel ekonomi tabanlı bir karar destek çerçevesinin geliştirilmesi
MAHMUT ATTAROĞLU
Yüksek Lisans
İngilizce
2025
İnşaat MühendisliğiYıldız Teknik Üniversitesiİnşaat Mühendisliği Ana Bilim Dalı
PROF. ZEYNEP IŞIK
DOÇ. DR. GÖKHAN DEMİRDÖĞEN