Geri Dön

Adaptive expert selection for robust and efficient speech-to-text systems

Dayanıklı ve verimli konuşmadan metne sistemleri için uyarlamalı uzman seçimi

  1. Tez No: 1024177
  2. Yazar: ABDULLAH ŞAMİL NAMLI
  3. Danışmanlar: PROF. DR. SÜLEYMAN SERDAR KOZAT
  4. Tez Türü: Yüksek Lisans
  5. Konular: Elektrik ve Elektronik Mühendisliği, Electrical and Electronics Engineering
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: İhsan Doğramacı Bilkent Üniversitesi
  10. Enstitü: Mühendislik ve Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Elektrik-Elektronik Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu tezde, otomatik konuşma tanıma sistemleri için uyarlamalı uzman seçimi problemini çalışmakta ve konuşmadan metne çeviri başarımını artırırken tüm mevcut modelleri çalıştırmanın yüksek hesaplama maliyetinden kaçınan iki tamamlayıcı yöntem sunmaktayız. Modern önceden eğitilmiş konuşma tanıma modelleri standart veri kümelerinde güçlü sonuçlar elde etse de, arka plan gürültüsü, yankılanma, uzak alan kayıtları, konuşmacı çakışması, aksan farklılıkları ve konuşma hızı değişimleri gibi gerçekçi akustik koşullarda başarımları önemli ölçüde değişebilmektedir. Bu nedenle, tek bir konuşma tanıma modelinin tüm girişler için en iyi sonucu vermesi beklenemez. Bu tezde, konuşmadan metne model seçimini önceden eğitilmiş uzmanlardan oluşan sabit bir havuz üzerinde uyarlamalı bir yönlendirme problemi olarak ele almaktayız. İlk yöntemde, sözce düzeyinde uyarlamalı uzman seçimi yaklaşımı sunmaktayız. Her ses parçası; akustik, prozodik, sinyal-zamansal ve sinirsel gömme tabanlı özniteliklerden oluşan kompakt bir öznitelik vektörü ile temsil edilmektedir. Gradyan destekli ağaçlar veya yapay sinir ağı ile gerçekleştirilebilen hafif bir yönlendirici, bu öznitelik vektörünü aday konuşma tanıyıcılar üzerinde bir olasılık dağılımına eşlemektedir. Yönlendirici, kelime hata oranına dayalı ve nihai transkripsiyon kalitesiyle uyumlu bir beklenen kayıp fonksiyonu ile eğitilmektedir. Eğitim sırasında tüm uzmanlar etiketli bir referans veri kümesi üzerinde çalıştırılarak uzman bazlı transkripsiyon hataları hesaplanmakta, çıkarım sırasında ise yalnızca seçilen uzman çalıştırılmaktadır. İkinci yöntemde, çerçeve düzeyinde dönüştürücü tabanlı bir uzman seçimi yaklaşımı sunmaktayız. Bu yöntem, tüm ses parçasını tek bir küresel öznitelik vektörüne indirgemek yerine, aday uzmanların kodlayıcıları tarafından üretilen çerçeve düzeyindeki gizli temsilleri korumaktadır. Hiyerarşik bir dönüştürücü yönlendirici, önce her uzman akışı içindeki zamansal kanıtı modellemekte, daha sonra uzmanlar arası bilgiyi birleştirerek nihai konuşma tanıyıcıyı seçmektedir. Önerilen yöntemler modülerdir ve önceden eğitilmiş konuşmadan metne sistemlerinin iç mimarilerinin değiştirilmesini gerektirmez. Yapay ve gerçek dünya konuşma tanıma veri kümeleri üzerindeki deneyler, uyarlamalı uzman seçiminin heterojen akustik koşullarda sabit tek model kullanımına, rastgele uzman seçimine, hipotez düzeyinde füzyona ve havuzlanmış temsil tabanlı yönlendirme yaklaşımlarına göre daha iyi sonuçlar verebildiğini göstermektedir. Sözce düzeyindeki yöntem hafif ve verimli bir yönlendirme mekanizması sağlarken, çerçeve düzeyindeki dönüştürücü tabanlı yöntem zamansal olarak karmaşık sesler için daha ifade gücü yüksek bir alternatif sunmaktadır. Birlikte değerlendirildiğinde, bu yöntemler önceden eğitilmiş konuşma tanıma sistemlerinin dayanıklı ve verimli transkripsiyon için uyarlamalı bir yönlendirme çerçevesinde tamamlayıcı uzmanlar olarak kullanılabileceğini göstermektedir.

Özet (Çeviri)

We study adaptive expert selection for automatic speech recognition and introduce two complementary methods that improve transcription robustness while avoiding the computational cost of exhaustively running all available speech-to-text systems. Modern pretrained speech recognition models achieve strong performance on standard benchmarks. However, their accuracy can vary significantly under heterogeneous acoustic conditions such as background noise, reverberation, far-field recording, speaker overlap, accent variation, and speaking-rate changes. Since no single recognizer is uniformly optimal across all possible inputs, we formulate speech-to-text model selection as an adaptive routing problem over a fixed pool of pretrained experts. In the first method, we introduce an utterance-level adaptive expert selection framework. We represent each audio clip by a compact feature vector composed of acoustic, prosodic, signal-temporal, and neural embedding-based features. A lightweight router, implemented using either gradient-boosted trees or a neural network, maps this feature vector to a probability distribution over the candidate models. The router is trained with a transcription-quality-aware expected word error rate objective. During training, all experts are evaluated on a labeled reference set to compute their expert-level transcription errors. During inference, however, only the selected expert is decoded. In the second method, we introduce a frame-level transformer-based expert selection framework. Instead of summarizing the entire clip into a single feature vector, this method preserves the frame-level encoder representations produced by the candidate experts. A hierarchical transformer router first models temporal evidence within each expert stream and then fuses cross-expert information to select the final recognizer. The training objective combines expected word error rate, hard oracle supervision, and soft word-error-rate-derived targets in order to account for both expert identity and the relative cost of incorrect expert choices. The introduced methods are modular and do not require modifying the internal architectures of the pretrained speech-to-text systems. Experiments on synthetic and real-world speech recognition benchmarks show that adaptive expert selection can outperform static single-model deployment, random expert selection, hypothesis-level fusion, and pooled-routing baselines under heterogeneous acoustic conditions. The utterance-level method provides a lightweight and efficient routing mechanism, while the frame-level transformer method offers a more expressive alternative for temporally complex audio. Together, these methods demonstrate that pretrained speech recognition systems can be used as complementary experts within an adaptive routing framework for robust and efficient transcription.

Benzer Tezler

  1. Düşük bir hızlarında konuşma kodlama ve uygulamaları

    Low bit rate speech coding and applications

    TARIK AŞKIN

  2. Robust and efficient learning methods for time series processing under missing data

    Eksik veri içeren zaman serilerinin işlenmesi için gürbüz ve etkin öğrenme yöntemleri

    SAFA ONUR ŞAHİN

    Doktora

    İngilizce

    İngilizce

    2025

    Elektrik ve Elektronik Mühendisliğiİhsan Doğramacı Bilkent Üniversitesi

    Elektrik ve Elektronik Mühendisliği Ana Bilim Dalı

    PROF. DR. SÜLEYMAN SERDAR KOZAT

  3. Denoising sea ice wide beam sar images based on extracted features, adaptive fuzzy logic network and adaptive thresholding based on semi adaptive fuzzy logic controllers

    Çıkarılmış özellikler, uyarlanabilir bulanık mantık ağı ve yarı uyarlanabilir bulanık mantık denetleyicilerine dayalı uyarlanabilir eşikleme kullanılarak deniz buzu geniş hüzmeli sar görüntülerinin gürültü giderimi

    HALİT NAZLI

    Doktora

    İngilizce

    İngilizce

    2026

    Elektrik ve Elektronik Mühendisliğiİstanbul Aydın Üniversitesi

    Elektrik-Elektronik Mühendisliği Ana Bilim Dalı

    PROF. DR. OSMAN YILDIRIM

  4. Toplu taşıma hatlarının optimizasyonu için bir model önerisi: Sivas örneği

    A model proposal for the optimization of public transportation lines: The case of Sivas

    İSMAİL ÖZÇELİK

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Ulaşımİstanbul Teknik Üniversitesi

    İnşaat Mühendisliği Ana Bilim Dalı

    DOÇ. DR. HÜSEYİN ONUR TEZCAN

  5. The development of circular economy-based decision support framework for construction project designs

    İnşaat proje tasarımları için döngüsel ekonomi tabanlı bir karar destek çerçevesinin geliştirilmesi

    MAHMUT ATTAROĞLU

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    İnşaat MühendisliğiYıldız Teknik Üniversitesi

    İnşaat Mühendisliği Ana Bilim Dalı

    PROF. ZEYNEP IŞIK

    DOÇ. DR. GÖKHAN DEMİRDÖĞEN