Geri Dön

Noise suppression in audio signals using artificial intelligence

Ses sinyallerinde yapay zeka kullanılarak gürültünün bastırılması

  1. Tez No: 1016077
  2. Yazar: CİHAT CAN ZIVALIOĞLU
  3. Danışmanlar: PROF. DR. OLCAY AKAY
  4. Tez Türü: Yüksek Lisans
  5. Konular: Elektrik ve Elektronik Mühendisliği, Electrical and Electronics Engineering
  6. Anahtar Kelimeler: Konuşma iyileştirme, Speech enhancement
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: Dokuz Eylül Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Elektrik-Elektronik Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Konuşma iyileştirme, gürültü, yankı veya diğer bozulmalar nedeniyle kalitesi ve anlaşılırlığı azalmış konuşma sinyallerini iyileştirmeye yönelik tekniklerin geliştirilmesini içerir. Gürültü kaynaklı bozulmalar, gürültünün karakteristiklerinin sürekliliğine göre durağan ve durağan olmayan olarak iki sınıf altında toplanabilir. Benzer şekilde, konuşma iyileştirme yöntemleri de, gürültü karakteristiklerinin bilindiği ve bilinmediği durumlar olmak üzere ikiye ayrılabilir. Makine öğrenmesindeki son gelişmelerle birlikte, sinyal işleme alanında derin öğrenme tekniklerinin kullanımı artmaktadır. Bu tezde, hem derin öğrenmenin hem de klasik sinyal işleme yöntemlerinin avantajlarını kullanarak ölçeklenebilir ve gerçek zamanlı konuşma gürültüsü giderimi sağlayan bir konuşma iyileştirme algoritması geliştirilmesi amaçlanmaktadır. Bu çalışmada, özel olarak tasarlanmış CNN ve LSTM ağları, konuşmayı bozan çevresel gürültü türünü sınıflandırmak için kullanılmaktadır. Ardından, tanımlanan gürültü ile konuşma sinyali arasındaki korelasyon kullanılarak, eklemeli olduğu varsayılan gürültünün konuşma ile en çok örtüştüğü anlar tespit edilir. Son olarak, alt uzay algoritmaları kullanılarak konuşma sinyali içindeki gürültü bileşeninin genliği bulunur ve bu bileşen sinyalden çıkarılır. Gürültülü konuşma veri seti, temiz konuşma sinyallerine gürültü kayıtlarının eklenmesiyle sentetik olarak oluşturulmuştur. Evrişimsel (CNN) modelin hızlı tepkisi ve uzun kısa süreli bellek (LSTM) modelinin doğruluğu, yüksek doğrulukta gürültü tahminleri sağlayan hibrit bir modelde birleştirilmiştir. Sessiz ve düşük SNR bölgelerinde dayanıklılığı artırmak için tahmin yumuşatma (prediction smoothing) uygulanmıştır. Önerilen sistem, durağan ve durağan olmayan gürültü senaryolarında sinyal-gürültü oranı (SNR), kısa zamanlı nesnel anlaşılırlık (STOI) ve algısal konuşma kalitesi değerlendirmesi (PESQ) açısından belirgin iyileşmeler elde etmektedir.

Özet (Çeviri)

Speech enhancement involves the development of techniques designed to improve the quality and intelligibility of speech signals that have been degraded by noise, reverberation, or other distortions. Degradation by noise can be separated into two classes based on noise characteristics as stationary and non-stationary noise. Similarly, speech enhancement methods can be divided into two, depending on the availability of noise characteristics. With recent developments in machine learning, the use of deep learning techniques in signal processing has been increasing. In this thesis, we aim to exploit the advantages of both deep learning and signal processing methods to come up with a speech enhancement algorithm that is applicable for scalable real-time speech denoising. In this thesis, custom convolutional neural network (CNN) and long short term memory (LSTM) networks are used to identify the type of environmental noise that the speech signal is degraded by. Correlation between the identified noise and the speech signal is calculated to determine the time instances when the noise, which is assumed to be additive, overlaps with the speech the most. Finally, subspace algorithms are used to find the magnitude of the noise component degrading the speech signal and that component is subtracted from the signal. The noisy speech dataset is synthetically created by adding noise recordings to clean speech signals. The quick response of the CNN model and the accuracy of the LSTM model is combined to form a hybrid model that provides highly accurate noise predictions. Prediction smoothing is applied to improve robustness in silent and low-SNR regions of speech. The proposed system achieves noticeable improvement in terms of signal-to-noise ratio (SNR), short-time objective intelligibility (STOI), and perceptual evaluation of speech quality (PESQ) under stationary and nonstationary noise environments.

Benzer Tezler

  1. Wıener filtresi kullanarak konuşma sinyallerinde gürültünün azaltılması

    The reduction of noise in speech signals using wiener filter

    ABDULLAH HAJ YOUSEF

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Elektrik ve Elektronik MühendisliğiTokat Gaziosmanpaşa Üniversitesi

    Elektrik ve Elektronik Mühendisliği Ana Bilim Dalı

    Prof. Dr. MAHMUT HEKİM

  2. Özyinelemeli tek yan bantlı genlik modülasyonunun modelleme yoluyla geliştirilmesi

    Improvement of recursive single sideband amplitude modulation through modeling

    DOĞUHAN EREN KARACAN

    Doktora

    Türkçe

    Türkçe

    2024

    MüzikAnkara Müzik ve Güzel Sanatlar Üniversitesi

    Müzikoloji Ana Bilim Dalı

    PROF. DR. ABDURRAHMAN TARİKCİ

  3. Hafif ve orta derece sensorinöral işitme kayıplarında Türkçe matris testi kullanılarak konuşma anlaşılabilirlik düzeyinin işitme cihazlı ve işitme cihazsız sonuçlarının karşılaştırılması

    Comparison of the result of speech intelligibility level with and without the hearing aid in mild and moderate sensorineural loss using Turkish matrix test

    ÖMER YÜCEL AYTAÇ

    Yüksek Lisans

    Türkçe

    Türkçe

    2016

    Kulak Burun ve BoğazTurgut Özal Üniversitesi

    Odyoloji ve Konuşma Bozuklukları Ana Bilim Dalı

    YRD. DOÇ. DR. MESUT KAYA

  4. Bessel, butterworth ve chebyshev aktif filtre modellerinde parametre kestirimi için PSO, DE ve ABC optimizasyon algoritmalarının uygulanması

    Application of PSO, DE and ABC optimization algorithms to bessel, butterworth and chebyshev active filter models for parameter estimation

    MUSTAFA AKKUŞ

    Yüksek Lisans

    Türkçe

    Türkçe

    2014

    Elektrik ve Elektronik MühendisliğiDumlupınar Üniversitesi

    Elektrik-Elektronik Mühendisliği Ana Bilim Dalı

    YRD. DOÇ. DR. HASAN TEMURTAŞ

  5. Audio visual attention for robots from a developmental perspective

    Gelişimsel perspektiften robotlar için görsel ve işitsel diıkkat

    NADA AL AZZAWI

    Yüksek Lisans

    İngilizce

    İngilizce

    2018

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    YRD. DOÇ. DR. GÖKHAN İNCE