Geri Dön

Derin öğrenme tabanlı spektro-temporal ve cnn özellik birleşimi ile derin sahte ses tespiti ve sentezleyici tanıma

Deep learning-based spectro-temporal and cnn feature fusion for deepfake speech detection and synthesizer recognition

  1. Tez No: 994663
  2. Yazar: BUKET SOYHAN
  3. Danışmanlar: DR. ÖĞR. ÜYESİ ZUHAL CAN
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: Türkçe
  9. Üniversite: Eskişehir Osmangazi Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Yazılımı Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Metinden sese dönüştürme (text-to-speech, TTS) ve ses dönüştürme (voice conversion, VC) teknolojilerindeki son gelişmeler, ses içeriklerinin özgünlüğünü giderek daha fazla tehdit etmekte ve bu durum etkili tespit yöntemlerine olan ihtiyacı artırmaktadır. Bu çalışmada, Mel-spektrogramlardan çıkarılan derin Evrişimli Sinir Ağı (Convolutional Neural Network, CNN) temsilleri ile çeşitli zamansal özellikleri bütünleştiren yeni bir iki aşamalı tespit çerçevesi önerilmektedir. Sınıflandırma aşamasında, Rastgele Orman (Random Forest, RF), Aşırı Gradyan Artırma (Extreme Gradient Boosting, XGBoost) ve Hafif Gradyan Artırma Makinesi (Light Gradient Boosting Machine, LightGBM) algoritmalarından oluşan bir topluluk model kullanılmış ve bu modellerin çıktıları çoğunluk oylaması yöntemiyle birleştirilmiştir. Özel bir veri kümesi, 44.1 kHz ve 48 kHz örnekleme frekanslarında, mono ve stereo kayıtlar içeren toplam 135 konuşmacıdan toplanmıştır. Ayrıca, her bir özgün kaydın sentetik türevleri CoquiTTS, DiffVC ve FreeVC sistemleri kullanılarak üretilmiştir. Gerçekleştirilen kapsamlı ablasyon deneyleri, yalnızca CNN tabanlı özelliklerin kullanılmasının %9.3 doğruluk sağladığını, zamansal özelliklerin dâhil edilmesiyle ise doğruluk oranının %100'e ulaştığını göstermiştir. Beş katlı çapraz doğrulama deneylerinde, özellik füzyonu ile kullanılan EfficientNet-B0+ modeli, en zor katmanlar boyunca %92 ile %98 arasında doğruluk değerleri elde etmiştir. Önerilen yöntemin genellenebilirliği, EfficientNet-B1, EfficientNet-B4, EfficientNet-V2-S, EfficientNet-V2-M, Xception ve ResNet-50 dâhil olmak üzere birden fazla CNN mimarisi üzerinde doğrulanmış; elde edilen sonuçlar, başarımın büyük ölçüde model mimarisinden ziyade özellik mühendisliği tarafından belirlendiğini ortaya koymuştur. Grad-CAM görselleştirmeleri, modelin gerçek ve sentetik konuşmayı ayırt eden ince ancak kritik fonetik ipuçlarına odaklandığını doğrulamıştır. Genel olarak bulgular, derin öğrenme özelliklerinin el yapımı zamansal temsillerle bir topluluk çerçevesinde birleştirilmesinin, gelişmekte olan TTS ve VC tabanlı ses sahteciliği tehditlerine karşı sağlam ve aktarılabilir bir savunma sunduğunu göstermektedir.

Özet (Çeviri)

Recent advancements in text-to-speech (TTS) and voice conversion (VC) technologies increasingly threaten the authenticity of audio content, thereby intensifying the need for effective detection methods. This study proposes a novel two-stage detection framework that integrates deep Convolutional Neural Network (CNN) representations extracted from Mel-spectrograms with various temporal features. In the classification stage, an ensemble model composed of Random Forest (RF), Extreme Gradient Boosting (XGBoost), and Light Gradient Boosting Machine (LightGBM) algorithms is employed, and their outputs are combined using a majority voting strategy. A custom dataset was collected from a total of 135 speakers, including mono and stereo recordings at sampling rates of 44.1 kHz and 48 kHz. In addition, synthetic variants of each original recording were generated using CoquiTTS, DiffVC, and FreeVC systems. Comprehensive ablation experiments demonstrated that using only CNN-based features achieved an accuracy of 9.3%, whereas incorporating temporal features increased the accuracy to 100%. In five-fold cross-validation experiments, the EfficientNet-B0+ model with feature fusion achieved accuracy values ranging from 92% to 98% across the most challenging folds. The generalizability of the proposed method was validated across multiple CNN architectures, including EfficientNet-B1, EfficientNet-B4, EfficientNet-V2-S, EfficientNet-V2-M, Xception, and ResNet-50. The results indicate that performance is largely driven by feature engineering rather than model architecture. Grad-CAM visualizations further confirmed that the model focuses on subtle yet critical phonetic cues that distinguish real from synthetic speech. Overall, the findings demonstrate that combining deep learning features with handcrafted temporal representations within an ensemble framework provides a robust and transferable defense against emerging TTS- and VC-based audio spoofing threats.

Benzer Tezler

  1. Design of robust speaker idintification with built-in noise immunity

    Gürültü ayırıma özellikli hoparlör tasarımı

    ALI NAJDET NASRET CORAN

    Doktora

    İngilizce

    İngilizce

    2021

    Elektrik ve Elektronik MühendisliğiÇankaya Üniversitesi

    Elektronik ve Haberleşme Mühendisliği Ana Bilim Dalı

    PROF. DR. HAYRİ SEVER

    DR. ÖĞR. ÜYESİ MURAD MOHAMMED AMIN

  2. Towards adaptive brain-computer interfaces: Statistical inference for mental state recognition

    Uyarlanabilir beyin-bilgisayar arayüzlerine doğru: Zihinsel durum tanıma için istatistiksel çıkarım

    MASTANEH TORKAMANI AZAR

    Doktora

    İngilizce

    İngilizce

    2020

    Elektrik ve Elektronik MühendisliğiSabancı Üniversitesi

    Elektronik Mühendisliği Ana Bilim Dalı

    DOÇ. DR. MÜJDAT ÇETİN

    Prof. Dr. SELİM SAFFET BALCISOY

  3. Derin öğrenme tabanlı yüz ayırt etme ve tanıma

    Deep learning based face detecti̇on and recognition

    EMİNE CENGİL

    Yüksek Lisans

    Türkçe

    Türkçe

    2017

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolFırat Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    YRD. DOÇ. DR. AHMET ÇINAR

  4. Derin öğrenme tabanlı adli analiz uygulamaları

    Deep learning based forensic applications

    AHMET GÖKHAN POYRAZ

    Yüksek Lisans

    Türkçe

    Türkçe

    2019

    Elektrik ve Elektronik MühendisliğiBursa Uludağ Üniversitesi

    Elektronik Mühendisliği Ana Bilim Dalı

    DOÇ. DR. AHMET EMİR DİRİK

  5. Derin öğrenme tabanlı beyin MR görüntülerinden beyin tümörlerinin tespit edilmesi ve sınıflandırılması

    Detection and classification of brain tumors from MR images based on deep learning

    ALİ ARI

    Doktora

    Türkçe

    Türkçe

    2019

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİnönü Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. DAVUT HANBAY