Geri Dön

Derin öğrenme yöntemleri ile protein ikincil yapı tahmini

Protein secondary structure prediction with deep learning methods

  1. Tez No: 1016603
  2. Yazar: YAHYA NAJIB HAMOOD AL-SHAMERI
  3. Danışmanlar: DR. ÖĞR. ÜYESİ İRFAN KÖSESOY
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilim ve Teknoloji, Science and Technology
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: Türkçe
  9. Üniversite: Kocaeli Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Mühendislik Bilimleri Ana Bilim Dalı
  12. Bilim Dalı: Yazılım Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Protein ikincil yapı tahmini (PİYT), bir proteinin amino asit dizisinden yerel yapısal motiflerini (α-heliks, β-Şerit vb.) öngörmeyi amaçlayan temel bir biyoinformatik problemidir. Bu tahminler, proteinlerin fonksiyonlarını anlamak, ilaç tasarımı ve sentetik biyoloji gibi alanlarda kritik öneme sahiptir. Son yıllarda, Transformer tabanlı dil modelleri, özellikle ProtBERT, protein dizilerinden bağlama duyarlı ve yüksek boyutlu özellikler çıkararak PİYT alanında önemli doğruluk artışları sağlamıştır. Ancak, ProtBERT tarafından üretilen 1024 boyutlu gömü vektörleri, derin öğrenme modellerinin eğitimi sırasında yüksek hesaplama maliyeti ve bellek tüketimi gibi zorluklara yol açmakta, bu da modellerin ölçeklenebilirliğini ve daha kısıtlı kaynaklara sahip platformlarda kullanımını kısıtlamaktadır. Bu tez çalışmasında, PİYT için hem hesaplama açısından verimli hem de yüksek doğruluk oranını koruyan ölçeklenebilir bir derin öğrenme çerçevesi önerilmektedir. Önerilen metodoloji, ProtBERT tarafından üretilen yüksek boyutlu gömülerin, bir yığınlanmış otokodlayıcı (stacked autoencoder) mimarisi kullanılarak daha düşük boyutlara (512, 256, 128, 64 ve 32) indirgenmesiyle başlar. Bu sıkıştırılmış özellik vektörleri, model eğitimini hızlandırmak ve bellek kullanımını optimize etmek amacıyla sabit uzunluklu alt dizilere (subsequences) bölünür. Ardından, bu alt diziler, protein ikincil yapılarının Q3 (3-sınıf) ve Q8 (8-sınıf) şemalarına göre sınıflandırılması için Çift Yönlü Uzun-Kısa Süreli Bellek (Bi-LSTM) tabanlı bir sinir ağına girdi olarak verilir. Son olarak, tahminlerin sağlamlığını ve doğruluğunu artırmak için iki farklı çoğunluk oylaması (majority voting) tabanlı topluluk stratejisi uygulanmıştır. PISCES sunucusundan elde edilen ve 10931 protein içeren standart bir veri seti üzerinde yapılan deneyler, önerilen yaklaşımın etkinliğini göstermiştir. Bulgular, gömü boyutunu 1024'ten 256'ya düşürmenin, Q3 tahmin doğruluğunda %1'den daha az bir kayıpla sonuçlandığını, ancak eğitim süresini %90'ın üzerinde azalttığını ortaya koymuştur. 256 boyutlu gömüler ve 50 kalıntı uzunluğundaki alt dizilerle eğitilen modelin, hesaplama verimliliği ve tahmin performansı arasında en iyi dengeyi sağladığı görülmüştür. Ayrıca, Farklı boyut indirgeme seviyeleri ve alt dizi uzunlukları kullanılarak eğitilmiş en iyi F1 skoruna sahip modellerin tahminleri birleştirilmiştir. Bu strateji ile Q3 sınıflandırmasında %82,5, Q8 sınıflandırmasında ise %70,9 F1 skoru elde edilmiştir. Bu sonuçlar, önerilen çerçevenin, hesaplama verimliliğini önemli ölçüde artırırken literatürdeki modern yöntemlerle rekabet edebilir bir doğruluk seviyesini koruduğunu göstermektedir. Bu çalışma, PİYT alanında doğruluk ve verimlilik arasında etkili bir denge kurarak, derin öğrenme tabanlı modellerin daha geniş ölçekte ve kaynak-kısıtlı ortamlarda uygulanabilirliğine önemli bir katkı sunmaktadır.

Özet (Çeviri)

Protein Secondary Structure Prediction (PSSP) is a fundamental bioinformatics problem that aims to predict the local structural motifs (alpha-helix, beta-strand, etc.) of a protein from its amino acid sequence. These predictions are of critical importance for understanding protein functions, drug design, and synthetic biology. In recent years, Transformer-based language models, particularly ProtBERT, have achieved significant accuracy improvements in the PSSP field by extracting context-aware and high-dimensional features from protein sequences. However, the 1024-dimensional embedding vectors generated by ProtBERT lead to challenges such as high computational cost and memory consumption during the training of deep learning models, which limits their scalability and usability on platforms with more constrained resources. This thesis proposes a scalable deep learning framework for PSSP that is both computationally efficient and maintains a high level of accuracy. The proposed methodology begins with the reduction of high-dimensional embeddings generated by ProtBERT to lower dimensions (512, 256, 128, 64, and 32) using a stacked autoencoder architecture. To accelerate model training and optimize memory usage, these compressed feature vectors are segmented into fixed-length subsequences. Subsequently, these subsequences are fed as input to a Bidirectional Long-Short Term Memory (Bi-LSTM) based neural network for the classification of protein secondary structures according to the Q3 (3-class) and Q8 (8-class) schemes. Finally, two different majority voting-based ensemble strategies are applied to enhance the robustness and accuracy of the predictions. Experiments conducted on a standard dataset of 10931 proteins curated from the PISCES server demonstrate the effectiveness of the proposed approach. The findings reveal that reducing the embedding dimension from 1024 to 256 results in a loss of less than 1% in Q3 prediction accuracy while reducing training time by over 90%. The model trained with 256-dimensional embeddings and subsequence lengths of 50 residues was found to provide the best trade-off between computational efficiency and prediction performance. Furthermore, the predictions from the models with the best F1 scores, trained using different dimensionality reduction levels and subsequence lengths, were combined. With this strategy, an F1 score of 82.5% was achieved for Q3 classification and 70.9% for Q8 classification. These results demonstrate that the proposed framework maintains a competitive level of accuracy with modern methods in the literature while significantly improving computational efficiency. This work makes a significant contribution to the applicability of deep learning-based models in the PSSP field on a larger scale and in resource-constrained environments by striking an effective balance between accuracy and efficiency.

Benzer Tezler

  1. Derin öğrenme yöntemi ile protein ikincil yapı tahmini

    Protein secondary structure prediction using deep learning method

    EZGİ ÇAKMAK

    Yüksek Lisans

    Türkçe

    Türkçe

    2021

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya Üniversitesi

    Bilişim Sistemleri Mühendisliği Ana Bilim Dalı

    DOÇ. DR. İHSAN HAKAN SELVİ

  2. Exposing data leakage in ligand binding site prediction

    Ligand bağlanma bölgesi tahmininde veri sızıntısının ortaya çıkarılması

    BARIŞ HASDEMİR

    Yüksek Lisans

    İngilizce

    İngilizce

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Bilimleri Ana Bilim Dalı

    DOÇ. DR. SEFER BADAY

  3. Prediction of protein-protein interaction sites using an ensemble learning method

    Topluluk öğrenme yöntemi kullanılarak protein-protein etkileşim bölgelerinin tahmini

    ENGİN AYBEY

    Doktora

    İngilizce

    İngilizce

    2022

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolEge Üniversitesi

    Sağlık Biyoinformatiği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ ÖZGÜR GÜMÜŞ

  4. mRNA dizi ve yapısal özelliklerini kullanarak translasyon verimliliğinin makine öğrenimi ile tahmini

    Machine learning-based prediction of translation efficiency from mRNA sequence and structural characteristics

    ÇAĞLAN TURGUT

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Biyolojiİstanbul Üniversitesi

    Biyoloji Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ MEHMET TARDU

  5. Accelerating molecular docking using machine learning methods

    Kenetleme hesaplarının makine öğrenme metotları ile hızlandırılması

    ABDULSALAM YAZID BANDE

    Yüksek Lisans

    İngilizce

    İngilizce

    2022

    Bilim ve Teknolojiİstanbul Teknik Üniversitesi

    Bilgisayar Bilimleri Ana Bilim Dalı

    Assist. Prof. Dr. SEFER BADAY