Geri Dön

Adversarial one-shot voice conversion using disentangledrepresentations

Çözülmüş gösterimleri kullanarak tek örnekle çekişmeli ses dönüşümü

  1. Tez No: 632540
  2. Yazar: ALİ YEŞİLKANAT
  3. Danışmanlar: PROF. DR. SADIK FİKRET GÜRGEN
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2020
  8. Dil: İngilizce
  9. Üniversite: Boğaziçi Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu tezde, en yeni varyasyonel özkodlayıcı tabanlı tek örnekli ses dönüşümü yöntemlerinden biri geliştirilerek yeni bir ses dönüştürme yöntemi tanıtılmıştır. Önerilen yöntem, akustik öznitelikler olarak Mel-spektrogramları kullanmakta ve konuşulan içeriğin konuşmacı ve içerik gösterimlerini ayırarak çözülmüş gösterimler oluşturmaktadır. Üretilen Mel-spektrogramlarının kalitesini arttırmak için çekişmeli ve algısal kayıplar kullanılmıştır. Ses çevrim modelinin eğitimi sırasında algısal kaybı uyarlayabilmek için bilgisayarlı görme alanında iyi bilinen bir modelin mimarisini kullanarak bir konuşmacı sınıflandırıcısı eğitilmiştir. Voice Cloning Toolkit veri seti üzerinde deneyler yapılmış, global varyans ve insansı bir yorum simülatörü olan MOSNet açısından değerlendirilmiştir. Deneysel sonuçlar, çalışmamızın referans aldığımız ses dönüşüm yönteminin ses çevrim kalitesini önemli ölçüde artırdığını göstermektedir.

Özet (Çeviri)

In this thesis, a new adversarial one-shot voice conversion (VC) method is introduced by enhancing one of the latest variational autoencoder based one-shot VC methods. The proposed method utilizes acoustic features as Mel-spectrograms and relies on disentangled representations by separating speaker and content representations of the spoken content. An adversarial loss and perceptual loss are combined in order to increase the quality of generated Mel-spectrograms. We train a speaker classifier by utilizing the architecture of a well-known model in the computer vision area, to be able to adapt perceptual loss during the training of the VC model. We conduct experiments on the Voice Cloning Toolkit dataset and evaluate the proposed approach in terms of Global Variance and MOSNet, a humanoid opinion score simulator. Experimental results indicate that our approach improves VC quality remarkably.

Benzer Tezler

  1. Toplam kalite yönetimi, kalite güvencesi sistemleri ve Türkiye'deki uygulamaları

    Total quality management, quality assurance systems and their applications in Turkey

    AHMET BEŞKESE

    Yüksek Lisans

    Türkçe

    Türkçe

    1995

    Endüstri ve Endüstri Mühendisliğiİstanbul Teknik Üniversitesi

    PROF.DR. ATAÇ SOYSAL

  2. Ana sanayi yan sanayi ilişkileri ve Türk otomotiv sanayinde bir uygulama

    Buyer-supplier relations and buyer-supplier relations in Turkish automative industry

    A. YAĞMUR AKBULUT

    Yüksek Lisans

    Türkçe

    Türkçe

    1997

    İşletmeAnkara Üniversitesi

    İşletme Ana Bilim Dalı

    PROF. DR. AKMUT ÖZDEMİR

  3. Toplam kalite yönetimi

    Total quality management

    AFET BONCUK

    Yüksek Lisans

    Türkçe

    Türkçe

    1997

    Makine Mühendisliğiİstanbul Teknik Üniversitesi

    Makine Ana Bilim Dalı

    PROF. DR. İRFAN SAYGILI

  4. Hicri II. asırda Kufe merkezli Şii nitelikli gulat hareketleri

    Başlık çevirisi yok

    YUSUF BENLİ

    Doktora

    Türkçe

    Türkçe

    1999

    TarihHarran Üniversitesi

    Temel İslam Bilimleri Ana Bilim Dalı

    PROF. DR. HASAN ONAT