Noise suppression in audio signals using artificial intelligence
Ses sinyallerinde yapay zeka kullanılarak gürültünün bastırılması
- Tez No: 1016077
- Danışmanlar: PROF. DR. OLCAY AKAY
- Tez Türü: Yüksek Lisans
- Konular: Elektrik ve Elektronik Mühendisliği, Electrical and Electronics Engineering
- Anahtar Kelimeler: Konuşma iyileştirme, Speech enhancement
- Yıl: 2026
- Dil: İngilizce
- Üniversite: Dokuz Eylül Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Elektrik-Elektronik Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Konuşma iyileştirme, gürültü, yankı veya diğer bozulmalar nedeniyle kalitesi ve anlaşılırlığı azalmış konuşma sinyallerini iyileştirmeye yönelik tekniklerin geliştirilmesini içerir. Gürültü kaynaklı bozulmalar, gürültünün karakteristiklerinin sürekliliğine göre durağan ve durağan olmayan olarak iki sınıf altında toplanabilir. Benzer şekilde, konuşma iyileştirme yöntemleri de, gürültü karakteristiklerinin bilindiği ve bilinmediği durumlar olmak üzere ikiye ayrılabilir. Makine öğrenmesindeki son gelişmelerle birlikte, sinyal işleme alanında derin öğrenme tekniklerinin kullanımı artmaktadır. Bu tezde, hem derin öğrenmenin hem de klasik sinyal işleme yöntemlerinin avantajlarını kullanarak ölçeklenebilir ve gerçek zamanlı konuşma gürültüsü giderimi sağlayan bir konuşma iyileştirme algoritması geliştirilmesi amaçlanmaktadır. Bu çalışmada, özel olarak tasarlanmış CNN ve LSTM ağları, konuşmayı bozan çevresel gürültü türünü sınıflandırmak için kullanılmaktadır. Ardından, tanımlanan gürültü ile konuşma sinyali arasındaki korelasyon kullanılarak, eklemeli olduğu varsayılan gürültünün konuşma ile en çok örtüştüğü anlar tespit edilir. Son olarak, alt uzay algoritmaları kullanılarak konuşma sinyali içindeki gürültü bileşeninin genliği bulunur ve bu bileşen sinyalden çıkarılır. Gürültülü konuşma veri seti, temiz konuşma sinyallerine gürültü kayıtlarının eklenmesiyle sentetik olarak oluşturulmuştur. Evrişimsel (CNN) modelin hızlı tepkisi ve uzun kısa süreli bellek (LSTM) modelinin doğruluğu, yüksek doğrulukta gürültü tahminleri sağlayan hibrit bir modelde birleştirilmiştir. Sessiz ve düşük SNR bölgelerinde dayanıklılığı artırmak için tahmin yumuşatma (prediction smoothing) uygulanmıştır. Önerilen sistem, durağan ve durağan olmayan gürültü senaryolarında sinyal-gürültü oranı (SNR), kısa zamanlı nesnel anlaşılırlık (STOI) ve algısal konuşma kalitesi değerlendirmesi (PESQ) açısından belirgin iyileşmeler elde etmektedir.
Özet (Çeviri)
Speech enhancement involves the development of techniques designed to improve the quality and intelligibility of speech signals that have been degraded by noise, reverberation, or other distortions. Degradation by noise can be separated into two classes based on noise characteristics as stationary and non-stationary noise. Similarly, speech enhancement methods can be divided into two, depending on the availability of noise characteristics. With recent developments in machine learning, the use of deep learning techniques in signal processing has been increasing. In this thesis, we aim to exploit the advantages of both deep learning and signal processing methods to come up with a speech enhancement algorithm that is applicable for scalable real-time speech denoising. In this thesis, custom convolutional neural network (CNN) and long short term memory (LSTM) networks are used to identify the type of environmental noise that the speech signal is degraded by. Correlation between the identified noise and the speech signal is calculated to determine the time instances when the noise, which is assumed to be additive, overlaps with the speech the most. Finally, subspace algorithms are used to find the magnitude of the noise component degrading the speech signal and that component is subtracted from the signal. The noisy speech dataset is synthetically created by adding noise recordings to clean speech signals. The quick response of the CNN model and the accuracy of the LSTM model is combined to form a hybrid model that provides highly accurate noise predictions. Prediction smoothing is applied to improve robustness in silent and low-SNR regions of speech. The proposed system achieves noticeable improvement in terms of signal-to-noise ratio (SNR), short-time objective intelligibility (STOI), and perceptual evaluation of speech quality (PESQ) under stationary and nonstationary noise environments.
Benzer Tezler
- Wıener filtresi kullanarak konuşma sinyallerinde gürültünün azaltılması
The reduction of noise in speech signals using wiener filter
ABDULLAH HAJ YOUSEF
Yüksek Lisans
Türkçe
2025
Elektrik ve Elektronik MühendisliğiTokat Gaziosmanpaşa ÜniversitesiElektrik ve Elektronik Mühendisliği Ana Bilim Dalı
Prof. Dr. MAHMUT HEKİM
- Özyinelemeli tek yan bantlı genlik modülasyonunun modelleme yoluyla geliştirilmesi
Improvement of recursive single sideband amplitude modulation through modeling
DOĞUHAN EREN KARACAN
Doktora
Türkçe
2024
MüzikAnkara Müzik ve Güzel Sanatlar ÜniversitesiMüzikoloji Ana Bilim Dalı
PROF. DR. ABDURRAHMAN TARİKCİ
- Hafif ve orta derece sensorinöral işitme kayıplarında Türkçe matris testi kullanılarak konuşma anlaşılabilirlik düzeyinin işitme cihazlı ve işitme cihazsız sonuçlarının karşılaştırılması
Comparison of the result of speech intelligibility level with and without the hearing aid in mild and moderate sensorineural loss using Turkish matrix test
ÖMER YÜCEL AYTAÇ
Yüksek Lisans
Türkçe
2016
Kulak Burun ve BoğazTurgut Özal ÜniversitesiOdyoloji ve Konuşma Bozuklukları Ana Bilim Dalı
YRD. DOÇ. DR. MESUT KAYA
- Bessel, butterworth ve chebyshev aktif filtre modellerinde parametre kestirimi için PSO, DE ve ABC optimizasyon algoritmalarının uygulanması
Application of PSO, DE and ABC optimization algorithms to bessel, butterworth and chebyshev active filter models for parameter estimation
MUSTAFA AKKUŞ
Yüksek Lisans
Türkçe
2014
Elektrik ve Elektronik MühendisliğiDumlupınar ÜniversitesiElektrik-Elektronik Mühendisliği Ana Bilim Dalı
YRD. DOÇ. DR. HASAN TEMURTAŞ
- Audio visual attention for robots from a developmental perspective
Gelişimsel perspektiften robotlar için görsel ve işitsel diıkkat
NADA AL AZZAWI
Yüksek Lisans
İngilizce
2018
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
YRD. DOÇ. DR. GÖKHAN İNCE