Deep learning-based phoneme segmentation and alignment for Quranic Arabic recitation
Kur'an-ı Kerim tilavetinde derin öğrenme tabanlı fonem segmentasyonu ve hizalaması
- Tez No: 1013536
- Danışmanlar: DR. ÖĞR. ÜYESİ AMMAR MOHAMMED ALİ AL-QADASİ
- Tez Türü: Yüksek Lisans
- Konular: Belirtilmemiş.
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: İngilizce
- Üniversite: Karabük Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu çalışmada, Fonem segmentasyonu ve hizalama; telaffuz değerlendirme, konuşma tanıma ve dil öğrenimi gibi konuşma işleme uygulamalarında önemli bir role sahiptir. Bununla birlikte, Kur'an-ı Kerim Arapçası tilaveti; tecvid kuralları, medd, gunne, nazalizasyon, uzatma, ritmik okuma ve okuma hızındaki farklılıklar gibi çeşitli faktörler nedeniyle birçok zorluk içermektedir. Bu nedenle, otomatik fonem sınırı tespiti ve hizalama işlemleri geleneksel konuşma tanıma tekniklerine göre daha zor hale gelmektedir. Bu araştırmada, Kur'an-ı Kerim Arapçası tilavetinde fonemlerin segmentasyonu ve hizalanması için derin öğrenme yaklaşımları incelenmiştir. Bu amaçla, farklı okuyucular tarafından farklı hızlarda okunan belirli Kur'an ayetlerinden oluşan açıklamalı bir veri seti hazırlanmıştır. Deneylerde, Praat kullanılarak fonem düzeyinde etiketlenen ses kayıtları referans veri olarak kullanılmıştır. Çalışmada dört farklı model ele alınmıştır: yalnızca CNN, yalnızca BiLSTM, CNN-BiLSTM ve Wav2Vec2 XLSR-53. Modeller; Fonem Hata Oranı, hizalama doğruluğu, fonem sınırı tespit doğruluğu, doğruluk, kesinlik, duyarlılık ve F1-skoru ölçütlerine göre değerlendirilmiştir. Elde edilen sonuçlara göre, CNN-BiLSTM modeli diğer tüm modellerden daha iyi performans göstermiştir; %85.75 doğruluk, %85.78 F1-skoru, %17.05 PER ve %25.09 hizalama doğruluğu elde etmiştir. Bu bulgular, yerel akustik özellik çıkarımı ile zamansal dizi modellemesinin birleştirilmesinin Kur'an fonem segmentasyonu görevinde etkili bir şekilde kullanılabileceğini göstermektedir.
Özet (Çeviri)
In this study, we aim to develop and evaluate deep learning-based models for automatic phoneme segmentation and alignment in Quranic Arabic recitation, with a focus on improving phoneme boundary detection under Tajweed-related acoustic variations. Phoneme segmentation and alignment have significant roles to play in speech processing applications, including those relating to pronunciation assessment, speech recognition, and language learning. Nevertheless, Quranic Arabic recitation poses several challenges due to various factors such as Tajweed rules, Madd, Ghunnah, nasalization, elongation, rhythmic recitation, and differences in the speed of recitation. Consequently, automatic phoneme boundary detection and alignment prove to be more challenging than conventional speech recognition techniques. Deep learning approaches were investigated in this research to segment and align phonemes in Quranic Arabic recitation. An annotated dataset for this purpose was compiled using specific Quranic verses recited at varying speeds by several reciters. Reference audio recordings annotated using Praat at the phoneme level were used in the experiments conducted. Four types of models were considered: CNN only, BiLSTM only, CNN-BiLSTM, and Wav2Vec2 XLSR-53. The models were assessed based on Phoneme Error Rate, alignment accuracy, phoneme boundary accuracy, accuracy, precision, recall, and F1 score. According to the findings, the CNN-BiLSTM model performed better than all other models, attaining an accuracy of 85.75%, F1-score of 85.78%, PER of 17.05%, and alignment accuracy of 25.09%. These findings show that the combination of local acoustic feature extraction and modeling of temporal sequences can be used effectively in the Quranic phoneme segmentation task.
Benzer Tezler
- Derin öğrenme kullanarak konuşma bölütlerinin tespiti için optimal özellik parametre kümesi belirleme
Determining optimal feature parameter set for detection of speech segments using deep learning
ÖZLEM BATUR DİNLER
Doktora
Türkçe
2020
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolYıldız Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. NİZAMETTİN AYDIN
- Derin öğrenme tabanlı konuşma tanıma sistem tasarımı
Deep learning based speech recognition system design
BURAK KORCUKLU
Yüksek Lisans
Türkçe
2021
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBursa Uludağ ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. AHMET EMİR DİRİK
- Türkçe konuşma tanıma sistemleri için derin öğrenme tabanlı modellerin geliştirilmesi
Development of deep learning based models for Turkish speech recognition
SAADİN OYUCU
Doktora
Türkçe
2020
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGazi ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. HÜSEYİN POLAT
- Derin konuşma ile Kur'an-ı Kerim'i hatalı okuma tespiti
Detecting incorrect reading of the Quran through deep talk
ABDULLAH TAHA GUMAR AL-DULAIMI
Yüksek Lisans
Türkçe
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolKütahya Dumlupınar ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ PINAR ÖZEN KAVAS
- Türkçe otomatik konuşma tanıma ve işaret diline çevirme
Automatic speech recognition and sign language translation for Turkish
BURAK TOMBALOĞLU
Doktora
Türkçe
2021
Elektrik ve Elektronik MühendisliğiBaşkent ÜniversitesiElektrik-Elektronik Mühendisliği Ana Bilim Dalı
PROF. DR. HAMİT ERDEM