Geri Dön

Deep learning-based phoneme segmentation and alignment for Quranic Arabic recitation

Kur'an-ı Kerim tilavetinde derin öğrenme tabanlı fonem segmentasyonu ve hizalaması

  1. Tez No: 1013536
  2. Yazar: ABDO IBRAHIM
  3. Danışmanlar: DR. ÖĞR. ÜYESİ AMMAR MOHAMMED ALİ AL-QADASİ
  4. Tez Türü: Yüksek Lisans
  5. Konular: Belirtilmemiş.
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: Karabük Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu çalışmada, Fonem segmentasyonu ve hizalama; telaffuz değerlendirme, konuşma tanıma ve dil öğrenimi gibi konuşma işleme uygulamalarında önemli bir role sahiptir. Bununla birlikte, Kur'an-ı Kerim Arapçası tilaveti; tecvid kuralları, medd, gunne, nazalizasyon, uzatma, ritmik okuma ve okuma hızındaki farklılıklar gibi çeşitli faktörler nedeniyle birçok zorluk içermektedir. Bu nedenle, otomatik fonem sınırı tespiti ve hizalama işlemleri geleneksel konuşma tanıma tekniklerine göre daha zor hale gelmektedir. Bu araştırmada, Kur'an-ı Kerim Arapçası tilavetinde fonemlerin segmentasyonu ve hizalanması için derin öğrenme yaklaşımları incelenmiştir. Bu amaçla, farklı okuyucular tarafından farklı hızlarda okunan belirli Kur'an ayetlerinden oluşan açıklamalı bir veri seti hazırlanmıştır. Deneylerde, Praat kullanılarak fonem düzeyinde etiketlenen ses kayıtları referans veri olarak kullanılmıştır. Çalışmada dört farklı model ele alınmıştır: yalnızca CNN, yalnızca BiLSTM, CNN-BiLSTM ve Wav2Vec2 XLSR-53. Modeller; Fonem Hata Oranı, hizalama doğruluğu, fonem sınırı tespit doğruluğu, doğruluk, kesinlik, duyarlılık ve F1-skoru ölçütlerine göre değerlendirilmiştir. Elde edilen sonuçlara göre, CNN-BiLSTM modeli diğer tüm modellerden daha iyi performans göstermiştir; %85.75 doğruluk, %85.78 F1-skoru, %17.05 PER ve %25.09 hizalama doğruluğu elde etmiştir. Bu bulgular, yerel akustik özellik çıkarımı ile zamansal dizi modellemesinin birleştirilmesinin Kur'an fonem segmentasyonu görevinde etkili bir şekilde kullanılabileceğini göstermektedir.

Özet (Çeviri)

In this study, we aim to develop and evaluate deep learning-based models for automatic phoneme segmentation and alignment in Quranic Arabic recitation, with a focus on improving phoneme boundary detection under Tajweed-related acoustic variations. Phoneme segmentation and alignment have significant roles to play in speech processing applications, including those relating to pronunciation assessment, speech recognition, and language learning. Nevertheless, Quranic Arabic recitation poses several challenges due to various factors such as Tajweed rules, Madd, Ghunnah, nasalization, elongation, rhythmic recitation, and differences in the speed of recitation. Consequently, automatic phoneme boundary detection and alignment prove to be more challenging than conventional speech recognition techniques. Deep learning approaches were investigated in this research to segment and align phonemes in Quranic Arabic recitation. An annotated dataset for this purpose was compiled using specific Quranic verses recited at varying speeds by several reciters. Reference audio recordings annotated using Praat at the phoneme level were used in the experiments conducted. Four types of models were considered: CNN only, BiLSTM only, CNN-BiLSTM, and Wav2Vec2 XLSR-53. The models were assessed based on Phoneme Error Rate, alignment accuracy, phoneme boundary accuracy, accuracy, precision, recall, and F1 score. According to the findings, the CNN-BiLSTM model performed better than all other models, attaining an accuracy of 85.75%, F1-score of 85.78%, PER of 17.05%, and alignment accuracy of 25.09%. These findings show that the combination of local acoustic feature extraction and modeling of temporal sequences can be used effectively in the Quranic phoneme segmentation task.

Benzer Tezler

  1. Derin öğrenme kullanarak konuşma bölütlerinin tespiti için optimal özellik parametre kümesi belirleme

    Determining optimal feature parameter set for detection of speech segments using deep learning

    ÖZLEM BATUR DİNLER

    Doktora

    Türkçe

    Türkçe

    2020

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolYıldız Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. NİZAMETTİN AYDIN

  2. Derin öğrenme tabanlı konuşma tanıma sistem tasarımı

    Deep learning based speech recognition system design

    BURAK KORCUKLU

    Yüksek Lisans

    Türkçe

    Türkçe

    2021

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBursa Uludağ Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. AHMET EMİR DİRİK

  3. Türkçe konuşma tanıma sistemleri için derin öğrenme tabanlı modellerin geliştirilmesi

    Development of deep learning based models for Turkish speech recognition

    SAADİN OYUCU

    Doktora

    Türkçe

    Türkçe

    2020

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGazi Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. HÜSEYİN POLAT

  4. Derin konuşma ile Kur'an-ı Kerim'i hatalı okuma tespiti

    Detecting incorrect reading of the Quran through deep talk

    ABDULLAH TAHA GUMAR AL-DULAIMI

    Yüksek Lisans

    Türkçe

    Türkçe

    2023

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolKütahya Dumlupınar Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ PINAR ÖZEN KAVAS

  5. Türkçe otomatik konuşma tanıma ve işaret diline çevirme

    Automatic speech recognition and sign language translation for Turkish

    BURAK TOMBALOĞLU

    Doktora

    Türkçe

    Türkçe

    2021

    Elektrik ve Elektronik MühendisliğiBaşkent Üniversitesi

    Elektrik-Elektronik Mühendisliği Ana Bilim Dalı

    PROF. DR. HAMİT ERDEM