Geri Dön

Challenger: Detecting copy number variants in challenging regions using whole genome sequencing data

Challenger: Tüm genom dizileme verilerini kullanarak zorlu bölgelerde kopya sayısı varyantlarnın tespiti

  1. Tez No: 1019788
  2. Yazar: MEHMET ALPER YILMAZ
  3. Danışmanlar: DOÇ. DR. ABDULLAH ERCÜMENT ÇİÇEK
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: İhsan Doğramacı Bilkent Üniversitesi
  10. Enstitü: Mühendislik ve Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Kopya sayısı varyasyonları (CNV'ler), genomik çeşitliliğin başlıca kaynaklarından biridir ve çok sayıda hastalıkla ilişkilidir. Kısa okuma uzunluklu tüm genom dizilemesinden (srWGS) CNV tespiti, hizalama belirsizliği, okuma derinliği değişkenliği ve karmaşık genomik bölgeler nedeniyle hâlâ zorludur. Uzun okuma dizilemesi çözünürlüğü artırsa da, yüksek maliyeti yaygın kullanımını sınırlar. Bu tez, yalnızca kısa okuma verisini kullanarak CNV tespitini geliştiren bir derin öğrenme çerçevesi olan CHALLENGER'ı sunmaktadır. Maskeli dil modellemeden yararlanarak, kodlayıcı bölgelerdeki okuma derinliği sinyallerinden temsiller öğrenir ve genellikle yalnızca uzun okuma dizilemesi ve tamamlayıcı teknolojilerle tespit edilebilen CNV'leri geri kazanır; böylece pratik ve maliyet etkin bir alternatif sunar. Eğitim iki aşamada gerçekleştirilir: Önce srWGS'den türetilmiş yaklaşık CNV etiketleriyle ön eğitim, ardından uzun okuma çağrıları, uzman anotasyonları ve doğrulanmış veri kümelerinden elde edilen yüksek güvenilirlikli verilerle ince ayar yapılır. Bu strateji, zorlu genomik bölgelerde genelleme yeteneğini artırır. Sonuçlar, yöntemin mevcut yaklaşımlardan daha iyi performans gösterdiğini; F1-skorunda %40.8 artış sağladığını ve genellikle yalnızca uzun okuma dizilemesiyle belirlenen CNV'lerin %80.3'ünü tespit ettiğini göstermektedir. Uzmanlarca küratörlü veri kümelerinde, duplikasyonlar için F1-skorunda %70.5, delesyonlar için ise %24.6 iyileşme sağlanmıştır. Model ayrıca paralog gen ailelerini ele alacak şekilde genişletilmiş olup, hem paraloga özgü hem de toplu CNV tahminlerini ek performans kazanımlarıyla mümkün kılmaktadır.

Özet (Çeviri)

Copy number variations (CNVs) are a major source of genomic diversity and are associated with numerous diseases. Detecting CNVs from short-read whole- genome sequencing (srWGS) is still challenging due to alignment ambiguity, read-depth variability, and complex genomic regions. Although long-read sequencing improves resolution, its high cost limits widespread adoption. This thesis presents CHALLENGER, a deep learning framework that enhances CNV detection using only short-read data. Leveraging masked language modeling, it learns representations from read-depth signals in coding regions and recovers CNVs typically detectable only with long-read sequencing and complementary technologies, providing a practical and cost-effective alternative. Training proceeds in two stages: pre-training on approximate CNV labels derived from srWGS, followed by fine-tuning using high-confidence data from long-read calls, expert annotations, and validated datasets. This strategy improves generalization across challenging genomic regions. Results demonstrate that the method outperforms existing approaches, achieving a 40.8% increase in F1-score and detecting 80.3% of CNVs usually identified only through long-read sequencing. On expert-curated datasets, it improves F1-scores by 70.5% for duplications and 24.6% for deletions. The model is further extended to handle paralogous gene families, enabling both paralog-specific and aggregate CNV predictions with additional performance gains.

Benzer Tezler

  1. Dağıtılmış veri yönetimi

    Başlık çevirisi yok

    HIRAÇ KASAPOĞLU

  2. Taze et ürünlerinin raf ömürlerinin izlenebilirliğinde biyo-indikatörlerin akıllı ambalajlama sistemi içerisinde kullanımı

    The application of bio-i̇ndicators entegrated to the smart packaging system for the shelf life of fresh meat products

    GÜLAY MERVE BAYRAKAL

    Doktora

    Türkçe

    Türkçe

    2016

    Besin Hijyeni ve Teknolojisiİstanbul Üniversitesi

    Besin Hijyeni ve Teknolojisi Ana Bilim Dalı

    PROF. DR. GÜRHAN RAİF ÇİFTÇİOĞLU

  3. Bim-based facilities management: A aconceptual framework for bim implementation of the fm industry

    Bim-tabanli tesis yönetimi: Tesis yönetimi endüstrisinde bim uygulama i̇çin kavramsal bir çerçeve

    ECEM TEZEL

    Doktora

    İngilizce

    İngilizce

    2023

    Mimarlıkİstanbul Teknik Üniversitesi

    Mimarlık Ana Bilim Dalı

    PROF. DR. FATMA HEYECAN GİRİTLİ

  4. Dijital ikiz teknolojisinin bir altyapı projesinde tesis yönetimi amaçlı kullanımı: İstanbul Havalimanı örneği

    The use of digital twin technology for facility management in an infrastructure project: A case study of İstanbul Airport

    MUHİTTİN EGEMEN YILDIRIM

    Yüksek Lisans

    Türkçe

    Türkçe

    2023

    İnşaat Mühendisliğiİstanbul Teknik Üniversitesi

    İnşaat Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ SENEM BİLİR MAHÇİÇEK

  5. Assessing the effectiveness of enhancements and modified Yolov11 in malaria detection on microscopic small objects

    Mikroskobik küçük nesnelerde sıtma tespitinde iyileştirmelerin ve modifiye Yolov11'in etkinliğinin değerlendirilmesi

    SHAHD HASHIM HASSAN ABDALGADIR

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Elektrik ve Elektronik MühendisliğiSakarya Uygulamalı Bilimler Üniversitesi

    Elektrik-Elektronik Mühendisliği Ana Bilim Dalı

    DOÇ. DR. ALİ FURKAN KAMANLI