Geri Dön

Çok dilli ortamlarda gerçek zamanlı ses ve video konferans için ölçeklenebilir bir sistem tasarımı

A scalable system design for real-time audio and video conferencing in multilingual environments

  1. Tez No: 1009386
  2. Yazar: EREN ÇAĞLAR
  3. Danışmanlar: PROF. DR. MEHMET SIDDIK AKTAŞ
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Bilim ve Teknoloji, Mühendislik Bilimleri, Computer Engineering and Computer Science and Control, Science and Technology, Engineering Sciences
  6. Anahtar Kelimeler: Anında çeviri, Bilgisayar çevirisi, Makine çevirisi, Immediately translation, Computer translation, Machine translation
  7. Yıl: 2026
  8. Dil: Türkçe
  9. Üniversite: Yıldız Teknik Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Veri Bilimi ve Büyük Veri Ana Bilim Dalı
  12. Bilim Dalı: Veri Bilimi ve Büyük Veri Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Gerçek zamanlı çok dilli iletişim, akıllı sağlık terminallerinden işbirlikçi telepresence sistemlerine kadar uzanan yeni nesil Nesnelerin Yapay Zekası (AIoT) ekosistemleri için kritik bir gereksinim olarak ortaya çıkmıştır. Ancak; tipik olarak ardışık Konuşmadan Metne (STT), Makine Çevirisi (MT), Metinden Konuşmaya (TTS) ve dudak senkronizasyonu modüllerinden oluşan geleneksel bulut merkezli çeviri boru hatları (pipelines), sıralı bağımlılıkları ve hesaplama darboğazları nedeniyle yüksek uçtan uca gecikme ve sınırlı ölçeklenebilirlikten muzdariptir. Bu tez; gerçek zamanlı video konferanslarda düşük gecikmeli, kaynak açısından verimli ve doğru çok dilli dudak senkronizasyonu sağlamak üzere tasarlanmış, Transformer tabanlı özgün bir paralel ve asenkron çerçeve önermektedir. Önerilen mimari; dilsel ve görsel işleme boru hatlarını mesaj kuyruğu tabanlı bir ara katman yazılımı tasarımı aracılığıyla temelden ayırarak (decouple), çeviri ve görsel sentez görevlerinin eş zamanlı yürütülmesine olanak tanır. Akış tabanlı çeviride sıklıkla gözlemlenen anlamsal parçalanmayı ele almak için, konuşma tutarlılığını korumak amacıyla enerji tabanlı ses aktivitesi tespiti ile Transformer tabanlı sınır analizini bütünleştiren bağlama duyarlı bir konuşma bölümleme mekanizması sunulmuştur. Ayrıca, gerçek zamanlı etkileşimin katı zamanlama kısıtlamalarını karşılamak için görsel çıkarım iş akışı, düşük seviyeli grafik derlemesi yoluyla optimize edilmiştir. Özellikle Wav2Lip dudak senkronizasyonu modülü; FP16 karma hassasiyetli niceleme (quantization) ve donanıma duyarlı çekirdek füzyonu (kernel fusion) kullanılarak TensorRT ile hızlandırılmıştır. Bu optimizasyonlar, yüksek görsel doğruluğu korurken hesaplama yükünü önemli ölçüde azaltır. Deneysel sonuçlar; önerilen asenkron mimarinin geleneksel sıralı boru hatlarından daha iyi performans gösterdiğini, uçtan uca gecikmede 3.1 kata kadar azalma sağladığını ve dudak senkronizasyonu bileşeni için 4.7 kat çıkarım hızlanması elde ederek kare başına işlem süresini 1 milisaniyenin altına düşürdüğünü göstermektedir. Öznel değerlendirmeler ayrıca, sistemin temel yaklaşımlara kıyasla üstün senkronizasyon kararlılığı ve çeviri doğallığı sağladığını doğrulamaktadır. Sonuç olarak bu çalışma; kaynak kısıtlı uç cihazlarda yüksek doğruluğa sahip, diller arası çok modlu iletişim sistemlerinin konuşlandırılması için ölçeklenebilir bir temel oluşturmaktadır.

Özet (Çeviri)

Real-time multilingual communication has emerged as a critical requirement for next-generation Artificial Intelligence of Things (AIoT) ecosystems, ranging from smart healthcare terminals to collaborative telepresence systems. However, traditional cloud-centric translation pipelines—typically composed of cascaded Speech-to-Text (STT), Machine Translation (MT), Text-to-Speech (TTS), and lip synchronization modules—suffer from high end-to-end latency and limited scalability due to their sequential dependency and computational bottlenecks. This thesis proposes a novel parallel and asynchronous Transformer-based framework designed to enable low-latency, resource-efficient, and accurate multilingual lip synchronization in real-time video conferencing. The proposed architecture fundamentally decouples the linguistic and visual processing pipelines through a message-queue-based middleware design, allowing for the concurrent execution of translation and visual synthesis tasks. To address the semantic fragmentation often observed in streaming translation, a context-adaptive speech segmentation mechanism is introduced, which integrates energy-based voice activity detection with Transformer-based boundary analysis to preserve conversational coherence. Furthermore, to meet the stringent timing constraints of real-time interaction, the visual inference workflow is optimized through low-level graph compilation. Specifically, the Wav2Lip lip-synchronization module is accelerated using TensorRT, employing FP16 mixed-precision quantization and hardware-aware kernel fusion. These optimizations significantly reduce the computational overhead while maintaining high visual fidelity. Experimental results demonstrate that the proposed asynchronous architecture outperforms conventional sequential pipelines, achieving a reduction in end-to-end latency by up to 3.1x and an inference speedup of 4.7x for the lip-synchronization component, reducing per-frame processing time to under 1 millisecond. Subjective evaluations further confirm that the system provides superior synchronization stability and translation naturalness compared to baseline approaches. Consequently, this work establishes a scalable foundation for deploying high-fidelity, cross-lingual multimodal communication systems on resource-constrained edge devices.

Benzer Tezler

  1. Enhancing virtual reality musical instrument design: Solving software topology problems with VRMI Creation Toolkit

    Sanal gerçeklik müzik enstrumanı tasarımının iyileştirilmesi: Yazılım mimarisi sorunlarının VRMI Creation Toolkit ile çözümü

    OZAN SARIER

    Doktora

    İngilizce

    İngilizce

    2021

    Müzikİstanbul Teknik Üniversitesi

    Müzik Ana Bilim Dalı

    PROF. DR. CAN KARADOĞAN

  2. Promptshıeld: polıcy-aware data loss preventıon framework for generatıve AI prompts

    Promptshıeld: Politika farkındalıklı üretken yapay zekâ istemleri için veri kaybı önleme çerçevesi

    EZGİ KELEŞ

    Yüksek Lisans

    İngilizce

    İngilizce

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. ŞERİF BAHTİYAR

  3. Yeni Cami'nin akustik açıdan performans değerlendirmesi

    Evaluation of the acoustical performance of the New Mosque

    EVREN YILDIRIM

    Yüksek Lisans

    Türkçe

    Türkçe

    2003

    Mimarlıkİstanbul Teknik Üniversitesi

    Mimarlık Ana Bilim Dalı

    PROF. DR. SEVTAP YILMAZ DEMİRKALE

  4. Die wirkung der pragmalinguistik auf den daf unterricht

    Edimbilimin Almanca yabancı dil dersine etkisi

    HATİCE KOÇ

    Yüksek Lisans

    Almanca

    Almanca

    2022

    Eğitim ve ÖğretimNecmettin Erbakan Üniversitesi

    Yabancı Diller Eğitimi Ana Bilim Dalı

    PROF. DR. HASAN YILMAZ

  5. Virtual reality based decision support model for design process ofmuseum exhibition projects

    Müze sergileme projeleri tasarım süreci içinsanal gerçeklik tabanlı bir karar destek modeli

    UMUT DURMUŞ

    Doktora

    İngilizce

    İngilizce

    2023

    Müzecilikİstanbul Teknik Üniversitesi

    Mimarlık Ana Bilim Dalı

    PROF. DR. HÜSNÜ MURAT GÜNAYDIN