Derin öğrenme yöntemleri ile protein ikincil yapı tahmini
Protein secondary structure prediction with deep learning methods
- Tez No: 1016603
- Danışmanlar: DR. ÖĞR. ÜYESİ İRFAN KÖSESOY
- Tez Türü: Yüksek Lisans
- Konular: Bilim ve Teknoloji, Science and Technology
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: Türkçe
- Üniversite: Kocaeli Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Mühendislik Bilimleri Ana Bilim Dalı
- Bilim Dalı: Yazılım Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Protein ikincil yapı tahmini (PİYT), bir proteinin amino asit dizisinden yerel yapısal motiflerini (α-heliks, β-Şerit vb.) öngörmeyi amaçlayan temel bir biyoinformatik problemidir. Bu tahminler, proteinlerin fonksiyonlarını anlamak, ilaç tasarımı ve sentetik biyoloji gibi alanlarda kritik öneme sahiptir. Son yıllarda, Transformer tabanlı dil modelleri, özellikle ProtBERT, protein dizilerinden bağlama duyarlı ve yüksek boyutlu özellikler çıkararak PİYT alanında önemli doğruluk artışları sağlamıştır. Ancak, ProtBERT tarafından üretilen 1024 boyutlu gömü vektörleri, derin öğrenme modellerinin eğitimi sırasında yüksek hesaplama maliyeti ve bellek tüketimi gibi zorluklara yol açmakta, bu da modellerin ölçeklenebilirliğini ve daha kısıtlı kaynaklara sahip platformlarda kullanımını kısıtlamaktadır. Bu tez çalışmasında, PİYT için hem hesaplama açısından verimli hem de yüksek doğruluk oranını koruyan ölçeklenebilir bir derin öğrenme çerçevesi önerilmektedir. Önerilen metodoloji, ProtBERT tarafından üretilen yüksek boyutlu gömülerin, bir yığınlanmış otokodlayıcı (stacked autoencoder) mimarisi kullanılarak daha düşük boyutlara (512, 256, 128, 64 ve 32) indirgenmesiyle başlar. Bu sıkıştırılmış özellik vektörleri, model eğitimini hızlandırmak ve bellek kullanımını optimize etmek amacıyla sabit uzunluklu alt dizilere (subsequences) bölünür. Ardından, bu alt diziler, protein ikincil yapılarının Q3 (3-sınıf) ve Q8 (8-sınıf) şemalarına göre sınıflandırılması için Çift Yönlü Uzun-Kısa Süreli Bellek (Bi-LSTM) tabanlı bir sinir ağına girdi olarak verilir. Son olarak, tahminlerin sağlamlığını ve doğruluğunu artırmak için iki farklı çoğunluk oylaması (majority voting) tabanlı topluluk stratejisi uygulanmıştır. PISCES sunucusundan elde edilen ve 10931 protein içeren standart bir veri seti üzerinde yapılan deneyler, önerilen yaklaşımın etkinliğini göstermiştir. Bulgular, gömü boyutunu 1024'ten 256'ya düşürmenin, Q3 tahmin doğruluğunda %1'den daha az bir kayıpla sonuçlandığını, ancak eğitim süresini %90'ın üzerinde azalttığını ortaya koymuştur. 256 boyutlu gömüler ve 50 kalıntı uzunluğundaki alt dizilerle eğitilen modelin, hesaplama verimliliği ve tahmin performansı arasında en iyi dengeyi sağladığı görülmüştür. Ayrıca, Farklı boyut indirgeme seviyeleri ve alt dizi uzunlukları kullanılarak eğitilmiş en iyi F1 skoruna sahip modellerin tahminleri birleştirilmiştir. Bu strateji ile Q3 sınıflandırmasında %82,5, Q8 sınıflandırmasında ise %70,9 F1 skoru elde edilmiştir. Bu sonuçlar, önerilen çerçevenin, hesaplama verimliliğini önemli ölçüde artırırken literatürdeki modern yöntemlerle rekabet edebilir bir doğruluk seviyesini koruduğunu göstermektedir. Bu çalışma, PİYT alanında doğruluk ve verimlilik arasında etkili bir denge kurarak, derin öğrenme tabanlı modellerin daha geniş ölçekte ve kaynak-kısıtlı ortamlarda uygulanabilirliğine önemli bir katkı sunmaktadır.
Özet (Çeviri)
Protein Secondary Structure Prediction (PSSP) is a fundamental bioinformatics problem that aims to predict the local structural motifs (alpha-helix, beta-strand, etc.) of a protein from its amino acid sequence. These predictions are of critical importance for understanding protein functions, drug design, and synthetic biology. In recent years, Transformer-based language models, particularly ProtBERT, have achieved significant accuracy improvements in the PSSP field by extracting context-aware and high-dimensional features from protein sequences. However, the 1024-dimensional embedding vectors generated by ProtBERT lead to challenges such as high computational cost and memory consumption during the training of deep learning models, which limits their scalability and usability on platforms with more constrained resources. This thesis proposes a scalable deep learning framework for PSSP that is both computationally efficient and maintains a high level of accuracy. The proposed methodology begins with the reduction of high-dimensional embeddings generated by ProtBERT to lower dimensions (512, 256, 128, 64, and 32) using a stacked autoencoder architecture. To accelerate model training and optimize memory usage, these compressed feature vectors are segmented into fixed-length subsequences. Subsequently, these subsequences are fed as input to a Bidirectional Long-Short Term Memory (Bi-LSTM) based neural network for the classification of protein secondary structures according to the Q3 (3-class) and Q8 (8-class) schemes. Finally, two different majority voting-based ensemble strategies are applied to enhance the robustness and accuracy of the predictions. Experiments conducted on a standard dataset of 10931 proteins curated from the PISCES server demonstrate the effectiveness of the proposed approach. The findings reveal that reducing the embedding dimension from 1024 to 256 results in a loss of less than 1% in Q3 prediction accuracy while reducing training time by over 90%. The model trained with 256-dimensional embeddings and subsequence lengths of 50 residues was found to provide the best trade-off between computational efficiency and prediction performance. Furthermore, the predictions from the models with the best F1 scores, trained using different dimensionality reduction levels and subsequence lengths, were combined. With this strategy, an F1 score of 82.5% was achieved for Q3 classification and 70.9% for Q8 classification. These results demonstrate that the proposed framework maintains a competitive level of accuracy with modern methods in the literature while significantly improving computational efficiency. This work makes a significant contribution to the applicability of deep learning-based models in the PSSP field on a larger scale and in resource-constrained environments by striking an effective balance between accuracy and efficiency.
Benzer Tezler
- Derin öğrenme yöntemi ile protein ikincil yapı tahmini
Protein secondary structure prediction using deep learning method
EZGİ ÇAKMAK
Yüksek Lisans
Türkçe
2021
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya ÜniversitesiBilişim Sistemleri Mühendisliği Ana Bilim Dalı
DOÇ. DR. İHSAN HAKAN SELVİ
- Exposing data leakage in ligand binding site prediction
Ligand bağlanma bölgesi tahmininde veri sızıntısının ortaya çıkarılması
BARIŞ HASDEMİR
Yüksek Lisans
İngilizce
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Bilimleri Ana Bilim Dalı
DOÇ. DR. SEFER BADAY
- Prediction of protein-protein interaction sites using an ensemble learning method
Topluluk öğrenme yöntemi kullanılarak protein-protein etkileşim bölgelerinin tahmini
ENGİN AYBEY
Doktora
İngilizce
2022
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolEge ÜniversitesiSağlık Biyoinformatiği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ ÖZGÜR GÜMÜŞ
- mRNA dizi ve yapısal özelliklerini kullanarak translasyon verimliliğinin makine öğrenimi ile tahmini
Machine learning-based prediction of translation efficiency from mRNA sequence and structural characteristics
ÇAĞLAN TURGUT
Yüksek Lisans
Türkçe
2025
Biyolojiİstanbul ÜniversitesiBiyoloji Ana Bilim Dalı
DR. ÖĞR. ÜYESİ MEHMET TARDU
- Accelerating molecular docking using machine learning methods
Kenetleme hesaplarının makine öğrenme metotları ile hızlandırılması
ABDULSALAM YAZID BANDE
Yüksek Lisans
İngilizce
2022
Bilim ve Teknolojiİstanbul Teknik ÜniversitesiBilgisayar Bilimleri Ana Bilim Dalı
Assist. Prof. Dr. SEFER BADAY