Exposing data leakage in ligand binding site prediction
Ligand bağlanma bölgesi tahmininde veri sızıntısının ortaya çıkarılması
- Tez No: 1000338
- Danışmanlar: DOÇ. DR. SEFER BADAY
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: İngilizce
- Üniversite: İstanbul Teknik Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Bilgisayar Bilimleri Ana Bilim Dalı
- Bilim Dalı: Bilgisayar Bilimleri Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Protein-ligand bağlanma bölgesi tahmini, yapı temelli ilaç keşfinin temel adımlarından biridir. Bir proteindeki bağlanma bölgelerinin doğru tespiti, potansiyel ilaç moleküllerinin tasarlanması ve optimize edilmesi için kritik öneme sahiptir. Son yıllarda derin öğrenme yöntemleri bu alanda önemli başarılar elde etmiş ve geleneksel geometrik yöntemlerin ötesine geçmiştir. Ancak bu çalışmada gösterdiğimiz üzere, bildirilen yüksek doğruluk oranlarının önemli bir kısmı gerçek genelleştirme yeteneğinden ziyade veri sızıntısından kaynaklanmaktadır. Makine öğrenmesi modelleri tipik olarak scPDB gibi büyük yapısal veritabanlarında eğitilir ve COACH420, HOLO4K gibi bağımsız kıyaslamalarda değerlendirilir. scPDB veritabanı 2017 sürümünde 16.612 benzersiz protein-ligand kompleksi içermekte ve derin öğrenme tabanlı bağlanma bölgesi tahmin yöntemleri için standart eğitim korpusu olarak kullanılmaktadır. Veritabanı, 2.5 Angstrom'dan daha iyi kristalografik çözünürlük, 100-1000 Dalton arasında moleküler ağırlık ve bağlanma bölgesi başına en az 5 amino asit kalıntısı gibi katı kalite kriterlerine göre filtrelenmiştir. Yakından incelendiğinde bu kıyaslamaların tamamen bağımsız olmadığı görülmektedir. COACH420 ve HOLO4K'daki proteinlerin yaklaşık yüzde 40'ı aynı zamanda scPDB eğitim verilerinde de bulunmaktadır. Bu örtüşme, modeller genelleştirilebilir örüntüler öğrenmek yerine eğitim örneklerini ezberlediğinde bildirilen doğruluğu yapay olarak şişirmektedir. Veri sızıntısı olarak bilinen bu durum, makine öğrenmesi modellerinin gerçek performansının değerlendirilmesini zorlaştırmakta ve yanıltıcı sonuçlara yol açmaktadır. Bu örtüşmeyi sistematik olarak ölçmek için 4 karakterlik PDB kodlarını veri setleri arasında eşleştirdik. Analizimiz şu sonuçları ortaya koymuştur: COACH420 yüzde 38.2 örtüşen protein içermektedir, HOLO4K yüzde 41.0 örtüşme oranına sahiptir, PDBbind yüzde 26.5 örtüşme göstermektedir ve SC6K tasarım gereği scPDB ile sıfır örtüşmeye sahiptir. Bu bulgular, yaygın olarak kullanılan kıyaslamaların önemli ölçüde kontamine olduğunu ve bildirilen yüksek performansların gerçek genelleştirme yeteneğini yansıtmayabileceğini göstermektedir. Bu sorunu çözmek için Graber ve arkadaşlarının 2025 yılında önerdiği CleanSplit metodolojisini bağlanma bölgesi tahminine uyarladık. CleanSplit yaklaşımı, başlangıçta bağlanma afinitesi tahmini için geliştirilmiş olup, eğitim ve test verileri arasındaki benzerliği sistematik olarak değerlendirerek sızan proteinleri filtrelemeyi hedeflemektedir. Bağlanma bölgesi tahmini için önemli bir fark, ligand benzerliğinin bu problem için büyük ölçüde alakasız olmasıdır; çünkü burada sorulan soru bağlanmanın ne kadar güçlü olduğu değil, nerede gerçekleştiğidir. İki seviyeli filtreleme stratejisi uyguladık. Birinci seviye, doğrudan örtüşme için PDB kodu eşleştirmesidir. Bu yöntemle eğitim ve test setlerinde aynı 4 karakterli PDB koduna sahip proteinler tespit edilir. İkinci seviye ise yapısal benzerlik analizidir. Foldseek aracını kullanarak TM-skoru 0.8'den büyük olan yapısal olarak benzer proteinleri belirliyoruz. TM-skoru, iki protein yapısı arasındaki fold düzeyinde benzerliği ölçen standart bir metriktir ve 0.8 üzeri değerler aynı fold ailesine ait yapıları gösterir. Analizimiz, scPDB proteinlerinin yüzde 93.4'ünün test proteinleriyle fold düzeyinde benzerlik paylaştığını ortaya koymuştur. Bu oran, sadece PDB kodu örtüşmesinden çok daha kapsamlı bir kontaminasyona işaret etmektedir. Toplam 2.117.240 yüksek benzerlik çifti tespit edilmiş olup, bunların yüzde 14.8'i COACH420, yüzde 24.2'si HOLO4K, yüzde 12.6'sı SC6K ve yüzde 48.4'ü PDBbind ile eşleşmektedir. Bu bulgular, eğitim verilerinin test verileriyle ne kadar iç içe geçmiş olduğunu açıkça göstermektedir. Eğitim verilerinin yüzde 93'ünü global olarak kaldırmaktan kaçınmak için kıyaslama bazlı filtreleme stratejisi benimsedik. Her kıyaslama için ayrı bir filtrelenmiş eğitim seti oluşturduk. COACH420 için değerlendirme yapılırken, yalnızca COACH420 ile örtüşen proteinler kaldırılır; benzer şekilde HOLO4K, SC6K ve PDBbind için de ayrı filtrelenmiş setler oluşturulur. Bu yaklaşım, her model için eğitim verisinin yüzde 88-92'sinin korunmasını sağlarken, test seti kontaminasyonunu ortadan kaldırır. Bu CleanSplit protokolü altında dört son teknoloji modeli değerlendirdik. DeepPocket ve Kalasanty, 3D konvolüsyon sinir ağı tabanlı yöntemlerdir. DeepPocket, iki aşamalı bir boru hattı kullanır: ilk aşamada bir segmentasyon ağı aday bölgeleri tespit eder, ikinci aşamada bir sınıflandırma ağı bu adayları sıralar. Kalasanty ise U-Net mimarisi ile volumetrik segmentasyon gerçekleştirir. RefinePocket, dikkat mekanizması tabanlı bir yaklaşım benimser ve kaba tahminleri iyileştirmek için çapraz dikkat mekanizmaları kullanır. ProtGeoNet ise protein dil modeli gömüleri, geometrik özellikler ve graf sinir ağı temsillerini birleştiren çok modlu bir mimaridir. Deneyler TRUBA Türkiye Ulusal Bilim e-Altyapısı HPC kümesinde gerçekleştirilmiştir. NVIDIA A100 80GB GPU'lar, Intel Xeon işlemciler ve PyTorch 1.12 çerçevesi kullanılmıştır. Her model için 10 katlı çapraz doğrulama uygulanmış ve dört bağımsız test seti üzerinde değerlendirme yapılmıştır. CleanSplit eğitimi, mimariler arasında veri sızıntısına karşı dramatik farklı duyarlılıklar ortaya koymuştur. ProtGeoNet en büyük düşüşleri göstermiş, ortalama DCC yüzde 87.85'ten yüzde 56.20'ye düşmüştür; bu 31.65 puanlık bir azalmaya karşılık gelmektedir. COACH420 kıyaslamasında düşüş 41.14 puan, HOLO4K'da 21.14 puan, SC6K'da 38.52 puan ve PDBbind'de 25.78 puan olmuştur. Bu dramatik düşüşler, ProtGeoNet'in yüksek model kapasitesinin ezberlemeye olanak tanıdığını göstermektedir. Buna karşılık, DeepPocket, Kalasanty ve RefinePocket nispeten stabil kalmıştır. DeepPocket ortalama 1.90 puan, Kalasanty 1.30 puan ve RefinePocket 1.63 puan düşüş göstermiştir. Bu daha basit mimariler, sınırlı kapasiteleri nedeniyle eğitim verilerini ezberlemek yerine daha genel özellikler öğrenmeye zorlanmaktadır. Özellikle dikkat çekici bir bulgu, CleanSplit altında tüm modeller için SC6K performansının iyileşmesi veya stabil kalmasıdır. SC6K, scPDB ile sıfır PDB kodu örtüşmesine sahip olduğundan, bu kıyaslama üzerindeki performans gerçek genelleştirme yeteneğini yansıtmaktadır. DeepPocket SC6K'da yüzde 85.10, RefinePocket yüzde 93.80 DCC değerlerine ulaşmış olup, bu değerler orijinal eğitimle elde edilenlerle karşılaştırılabilir veya daha yüksektir. DCC dışındaki metriklerde de benzer örüntüler gözlemlenmiştir. DVO ayrık hacim örtüşme metriği 20-33 puan düşüş göstermiş, bu da mekansal doğruluğun da benzer şekilde şişirilmiş olduğunu göstermektedir. Ancak ilginç bir şekilde, DCA ligand yakınlık metriği stabil kalmış veya hafif iyileşme göstermiştir; bu, DCA'nın DCC veya DVO'ya kıyasla ezberlemeye daha az duyarlı olduğunu düşündürmektedir. Bu sonuçlar, ProtGeoNet için daha önce bildirilen yüksek performansın büyük ölçüde sızan proteinlerin ezberlemesinden kaynaklandığını göstermektedir. ProtGeoNet mimarisi, ESM-2 gömüleri, ProtT5 gömüleri, PointNet'ten geometrik özellikler ve graf sinir ağı katmanlarını birleştirerek kalıntı başına 3.328 özellik üretmektedir. Bu yüksek boyutlu temsil, modelin eğitim verilerindeki spesifik örüntüleri ezberlemesine olanak tanımaktadır. Test zamanında sızan proteinler ortaya çıktığında, ProtGeoNet gerçek bağlanma bölgesi tahmini yapmak yerine bu ezberlenmiş örüntüleri kullanmaktadır. Daha basit mimariler bu kapasiteden yoksundur. Kalasanty yerel voksel örüntülerini kullanır; DeepPocket iki aşamalı segmentasyon ve sınıflandırma boru hattı uygular; RefinePocket aday cepler üzerinde dikkat mekanizması uygular. Bu tasarımlar, modellerin öğrenebileceği şeyleri kısıtlar ve onları daha genel özelliklere yönlendirir. Bu bulgular, kıyaslama sonuçlarının yorumlanmasını karmaşıklaştırmaktadır. COACH420 veya HOLO4K performansı raporlayan makaleler, örtüşmeyi kontrol etmedikleri takdirde genelleştirmeyi abartıyor olabilir. Yüzde 40 kontaminasyon oranı, bildirilen doğruluğu önemli ölçüde şişirmek için yeterli büyüklüktedir. Gelecek çalışmaların SC6K üzerinde sonuç raporlamasını ve adil model karşılaştırması için CleanSplit eğitimini standart uygulama olarak benimsemesini öneriyoruz. SC6K, şu anda mevcut en güvenilir kıyaslama olarak öne çıkmaktadır. Filtreleme prosedürü basittir ve eğitim verilerini yüzde 10'dan az azaltır; bu, daha adil değerlendirme için kabul edilebilir bir maliyettir. Çalışmamızın bazı sınırlamaları bulunmaktadır. Birincisi, filtrelemeyi yalnızca PDB kodu eşleştirmesi ile gerçekleştirdik. Foldseek analizi, scPDB proteinlerinin yüzde 93.4'ünün test proteinleriyle TM-skoru 0.8 üzerinde fold düzeyinde yapısal benzerlik paylaştığını göstermektedir; bu, daha derin filtrelemenin ek sızıntı etkileri ortaya çıkarabileceğini düşündürmektedir. İkincisi, dört mimari test ettik. Bu mimariler voksel tabanlı, segmentasyon tabanlı, dikkat tabanlı ve graf tabanlı gibi çeşitli tasarım seçeneklerini temsil etse de, P2Rank veya GrASP gibi ek modellerin test edilmesi sonuçlarımızın genelliğini güçlendirecektir. Üçüncüsü, ligand benzerliğini göz önünde bulundurmadık. Farklı yapılara sahip iki protein benzer ligandları bağlayabilir ve bu, PDB tabanlı filtrelememizin ele almadığı kimyasal düzeyde sızıntıya neden olabilir. Bu sınırlamalara rağmen, modeller ve kıyaslamalar arasındaki sonuçların tutarlılığı ana bulguyu desteklemektedir: yüksek kapasiteli modeller veri sızıntısına daha duyarlıdır ve sızan verilerin kaldırılması genelleştirme performansının daha gerçekçi tahminlerini ortaya koymaktadır.
Özet (Çeviri)
Machine learning models for protein-ligand binding site prediction are typically trained on large structural databases like scPDB and evaluated on independent benchmarks. However, closer inspection reveals that these benchmarks are not entirely independent: roughly 40% of proteins in COACH420 and HOLO4K also appear in scPDB training data. This overlap, known as data leakage, inflates reported accuracy when models memorize training examples rather than learning generalizable patterns. We systematically quantify this overlap by matching 4-character PDB codes between datasets. Our analysis shows that COACH420 contains 38% overlapping proteins, HOLO4K contains 41%, PDBbind contains 26.5%, while SC6K has zero overlap with scPDB by design. To address this issue, we adapt the CleanSplit methodology proposed by Graber et al. (2025) for binding site prediction. We apply a two-level filtering strategy: PDB code matching for direct overlap, and structural similarity using Foldseek (TM-score > 0.8) for near-duplicates. Our analysis reveals that 93.4% of scPDB proteins share fold-level similarity with test proteins, indicating contamination far more extensive than PDB code overlap alone. To avoid removing 93% of training data globally, we adopt a per-benchmark filtering strategy: for each benchmark (COACH420, HOLO4K, SC6K, PDBbind), we create a separate filtered training set and train a dedicated model. We evaluate four state-of-the-art models under this CleanSplit protocol: DeepPocket and Kalasanty (3D CNN-based), RefinePocket (attention-based), and ProtGeoNet (graph neural network with protein language model embeddings). CleanSplit training reveals dramatically different sensitivities to data leakage across architectures. ProtGeoNet shows the largest drops, with average DCC falling from 87.85% to 56.20% (-31.65 points). In contrast, DeepPocket (-1.90 points), Kalasanty (-1.30 points), and RefinePocket (-1.63 points) remain relatively stable. Notably, SC6K performance improves or remains stable for all models under CleanSplit, confirming that zero-overlap benchmarks provide more reliable evaluation. These results demonstrate that previously reported high performance for ProtGeoNet was largely due to memorization of leaked proteins. Different architectures respond differently to leakage removal, with attention-based methods showing greater robustness. We recommend that future work report results on SC6K and adopt per-benchmark CleanSplit training as standard practice for fair model comparison.
Benzer Tezler
- Türkiye'deki ahşap dış duvar sistemlerinin ısıl ve nemsel performansının test kabininde uzun dönem sürekli ölçme ve benzetim yöntemleriyle değerlendirilmesi
Evaluation of the hygrothermal performance of timber exterior wall systems in Turkey using long-term in-situ measurements and simulation methods
AYŞEGÜL EKŞİ KILIÇASLAN
- Yeni nesil self-etching adeziv sistemlerin mikrogerilim bağlanma dayanımları ve nanosızıntı bakımından etkinliğinin karşılaştırmalı olarak incelenmesi
A comparison of microtensile bond strength and nanoleakage of current-generation self-etching adhesive systems
İHSAN HUBBEZOĞLU
Doktora
Türkçe
2004
Diş HekimliğiCumhuriyet ÜniversitesiDiş Hastalıkları ve Tedavisi Ana Bilim Dalı
Y.DOÇ.DR. FERİDUN HÜRMÜZLÜ
- Karalarda su kütlesi değişimlerinin uydu gravimetrisi ile izlenmesi
Determining the continental surface water mass changes using satellite gravimetry
HÜSEYİN MERCAN
Doktora
Türkçe
2013
Jeodezi ve Fotogrametriİstanbul Teknik ÜniversitesiGeomatik Mühendisliği Ana Bilim Dalı
DOÇ. DR. ORHAN AKYILMAZ
- Network security: Attacks and defense mechanism by designing an intelligent firewall agent
Ağ güvenliği: Saldırılar ve zeki güvenlik duvarı etmeni ile savunma mekanizmaları
HAFUSWA NAKATO
Yüksek Lisans
İngilizce
2016
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. İSMAİL HAKKI CEDİMOĞLU
- Federeated learning under attack: Exposing vulenrabilites through data poisoning attacks in computer networks
Saldırı altında federasyonu öğrenme: Bilgisayar ağlarındaki veri zehirlendirme saldırıları yoluyla hassasiyetleri açığa çıkarmak
IMRAN HAIDER
Yüksek Lisans
İngilizce
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBahçeşehir ÜniversitesiBilgisayar Ana Bilim Dalı
Dr. EHSAN NOWROOZİ