Data vectorization in blockchain smart contracts
Blokzincir akıllı sözleşmelerde veri vektörleştirme
- Tez No: 1023453
- Danışmanlar: DOÇ. DR. SELÇUK TOPAL
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Matematik, Computer Engineering and Computer Science and Control, Mathematics
- Anahtar Kelimeler: Matematik, Mathematics
- Yıl: 2026
- Dil: İngilizce
- Üniversite: Gebze Teknik Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Matematik Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu tezde, Ethereum Sanal Makinesi'nin (EVM) hesaplama kapasitesini donanım seviyesinde artırmak hedeflenmektedir. Temel amaç, yapay zeka ve veri bilimi algoritmalarının doğrudan akıllı kontratlar üzerinde çalıştırılabilmesini sağlamaktır. Standart EVM tamamen skaler ve 256-bitlik yığın tabanlı bir mimariye sahiptir. Dolayısıyla veriler tek tek ve ardışık olarak işlenmektedir. Ayrıca, mevcut mimaride matris, tensör veya çok boyutlu dizi gibi veri biliminin temel yapı taşlarını destekleyen yerel bir veri türü bulunmamaktadır. Bu yapısal eksiklikler, lineer cebir işlemlerinde ciddi darboğazlara neden olmaktadır. Temel Bileşen Analizi (PCA), kovaryans matrisi hesabı ve Gram matrisi hesabı gibi büyük ölçekli matris operasyonları, EVM üzerinde milyarlarca işlem adımı gerektirmektedir. Bu işlem yükü, Ethereum ağının her blok için ayırdığı 30 milyon gas limitini yüzlerce kat aşmaktadır. Bu nedenle geliştiriciler, yoğun matematiksel hesaplamalar içeren işlemleri merkezi sunuculara devreden zincir dışı yöntemleri kullanmaktadırlar. Ancak bu yaklaşım, blokzincir teknolojisinin temelindeki şeffaflık ve merkeziyetsiz güven ilkelerini zayıflatmakta ve merkezileşme riski yaratmaktadır. Son yıllarda üretken yapay zeka (Generative AI) ve büyük dil modelleri (LLM) gibi makine öğrenmesi sistemlerinin hızla yaygınlaşması, bu alandaki hesaplama ihtiyacını daha da artırmıştır. Bu durum, akıllı kontratların modern yapay zeka uygulamalarıyla entegrasyonu önünde ciddi bir engel oluşturmaktadır. Bu hesaplama darboğazını aşmak için EVM mimarisine tek komut, çoklu veri (SIMD) uzantıları entegre edilmiştir. Geliştirme platformu olarak açık kaynaklı C++ EVM istemcisi olan evmone tercih edilmiştir. Sistemde donanımsal paralelleştirmeyi sağlamak amacıyla libsimdpp kütüphanesinden faydalanılmıştır. Bu sayede işlemcinin Intel Gelişmiş Vektör Uzantıları 2 (AVX2)'ye doğrudan erişimi sağlanmıştır. Bu entegrasyon ile 256-bitlik veri kelimeleri 16 adet bağımsız 16-bitlik tam sayıya dönüştürülmüştür. Böylece, tek bir donanım döngüsünde 16 farklı veri noktası eş zamanlı olarak işlenebilmektedir. Mimarinin temel yeniliklerinden biri, Python NumPy kütüphanesinden esinlenilerek tasarlanan MatrixHeader adlı 32 baytlık meta veri yapısıdır. Bu yapı, EVM'in tek boyutlu doğrusal bellek modelini çok boyutlu matris temsiline dönüştürmektedir. Standart EVM mimarisinde O(N²) karmaşıklığa sahip olan transpoz alma ve yeniden şekillendirme işlemleri, bu yapı sayesinde O(1) karmaşıklığa indirgenmiştir. Verinin bellekteki fiziksel konumu değiştirilmeden, yalnızca başlık bilgisindeki boyut ve adım değerleri güncellenerek bu işlemler gerçekleştirilebilmektedir. Çalışma kapsamında evmone kod tabanına 8 yeni paralel SIMD komutu entegre edilmiştir. Bunlar eleman bazlı toplama (XADD), çarpma (XMUL), çıkarma (XSUB), koşullu karşılaştırma (XGT), sıfır-kopyalama transpozisyon (XTRANSPOSE), yeniden şekillendirme (XRESHAPE), yatay indirgeme (XREDUCE) ve indeks tabanlı seçim (XGATHER) komutlarıdır. Her bir komutun gas maliyeti, yığın gereksinimleri ve donanım davranışı Ethereum Shanghai protokolüne uygun olarak yapılandırılmıştır. Önerilen sistemin performansı, 1024 × 1024 boyutlarındaki matrisler kullanılarak 10 farklı test senaryosu ile değerlendirilmiştir. Test verisi olarak büyük ölçüde gerçek Iris veri seti kullanılmış, eleman bazlı aritmetik testlerde (XADD, XMUL) ise birbirinden farklı değerler içeren iki bağımsız 1024 × 1024 matris tercih edilmiştir. Tüm veriler dinamik bayt kodu üretimi yöntemiyle EVM komut işleme hattına aktarılmıştır. Tüm test senaryolarında standart EVM mimarisi ile geliştirilen SIMD tabanlı EVM mimarisi, aynı donanım koşulları altında yan yana karşılaştırılmıştır. Elde edilen sonuçlar, geliştirilen SIMD tabanlı EVM mimarisinin yürütme süresini ve hesaplama maliyetlerini ciddi ölçüde düşürdüğünü doğrulamaktadır. Eleman bazlı temel aritmetik işlemlerde 16 kat gas tasarrufu elde edilerek SIMD şeritleri tam verimle kullanılmıştır. Sıfır-kopyalama stratejisi sayesinde, transpoz ve yeniden şekillendirme işlemlerinde 600.000 katı aşan gas tasarrufu elde edilmiştir. Ayrıca, kovaryans matrisi hesabı ve Gram matrisi hesabı gibi çok aşamalı istatistiksel işlemlerde 16,02 katlık bir gas tasarrufu oranına ulaşılmıştır. Bu performans artışı, geliştirilen sistemin yalnızca tekil operasyonlarda değil, ardışık ve zincirleme algoritmaları yürütmedeki başarısını da açıkça ortaya koymaktadır. Ayrıca, algoritma türüne bağlı olarak işlemlerin yürütme sürelerindeki hızlanmalar 3,44 ile 80.771 kat arasında değişmektedir. Tüm bu veriler, SIMD uzantıları sayesinde büyük ölçekli veri bilimi ve makine öğrenmesi algoritmalarının Ethereum ağı üzerinde hem hız hem de maliyet açısından uygulanabilir hale gelebileceğini göstermektedir. Böylece, büyük dil modelleri ve sinir ağları gibi modern yapay zeka sistemlerinin gelecekte zincir üzerinde yürütülebilmesi için sağlam bir temel atılmıştır.
Özet (Çeviri)
This study enhances the computational capacity of the Ethereum Virtual Machine (EVM) at the hardware level to enable the direct execution of artificial intelligence and data science algorithms on smart contracts. The standard EVM architecture has a scalar structure and processes data sequentially on a 256-bit stack. It does not natively support fundamental data structures such as matrices, tensors, or multi-dimensional arrays. This deficiency leads to significant performance bottlenecks in linear algebra operations. Large-scale calculations such as Principal Component Analysis (PCA), covariance, and Gram matrices exceed the Ethereum block gas limit by hundreds of times. Consequently, developers are forced to move computationally intensive processes to off-chain solutions, which weakens the blockchain's principles of transparency and decentralization. The rapid proliferation of generative artificial intelligence (AI) and large language models (LLMs) has further increased the computational demands for on-chain data processing, making the direct integration of such systems with smart contracts practically impossible under the current EVM design. To overcome this bottleneck, single instruction, multiple data (SIMD) extensions have been integrated into the EVM architecture. The open-source C++ client evmone was chosen as the development platform, and the libsimdpp library was used to access the Intel Advanced Vector Extensions 2 (AVX2). In the proposed architecture, 256-bit data words are converted into 16 independent 16-bit integers, enabling 16 data points to be processed simultaneously in a single hardware cycle. A key innovation is the 32-byte MatrixHeader structure, inspired by the Python NumPy library, which maps the EVM's one-dimensional memory into a multi-dimensional matrix representation. Transpose and reshape operations, originally with O(N²) complexity, were thus reduced to O(1). Eight new SIMD instructions were added to the evmone codebase: XADD, XMUL, XSUB, XGT, XTRANSPOSE, XRESHAPE, XREDUCE, and XGATHER. Their gas costs and stack behaviors were configured in accordance with the Ethereum Shanghai protocol. The performance of the proposed architecture was evaluated through 10 test scenarios on 1024 × 1024 matrices, predominantly using the real Iris dataset transferred via dynamic bytecode generation. In all scenarios, the standard EVM and the SIMD-based EVM were compared under identical hardware conditions. The results confirm that the proposed architecture significantly reduces execution times and computational costs. A 16× gas reduction was achieved in element-wise arithmetic operations. Through the zero-copy strategy, transpose and reshape operations achieved gas savings exceeding 600,000×. In multi-stage statistical computations such as covariance and Gram matrices, a 16.02× gas reduction was obtained. Execution time speedups ranged between 3.44× and 80,771× depending on the algorithm. These findings demonstrate that the proposed SIMD-based EVM provides a viable infrastructure not only for classical matrix operations but also for tensor operations underlying generative AI and machine learning models. Consequently, this architecture lays a solid foundation for the future on-chain execution of large language models and neural networks.
Benzer Tezler
- Ovulasyon indüksiyonu tedavisinde folliküler gelişimin ultrasonografik takibi
Başlık çevirisi yok
MERİH BAYRAM
Tıpta Uzmanlık
Türkçe
1987
Kadın Hastalıkları ve DoğumGazi ÜniversitesiKadın Hastalıkları ve Doğum Ana Bilim Dalı
DOÇ. DR. MÜLAZIM YILDIRIM
- Diesel motorları yakıt püskürtme sistemlerinin dinamik simülasyonu
Başlık çevirisi yok
İRFAN KARAGÖZ
Yüksek Lisans
Türkçe
1986
Makine MühendisliğiUludağ ÜniversitesiMakine Mühendisliği Ana Bilim Dalı
PROF. DR. OĞUZ BORAT
- Doğuştan kalça çıkıklı hastalarda kalça patolojilerinin bilgisayarlı tomografi ile değerlendirilmesi
Başlık çevirisi yok
NECDET ŞÜKRÜ ALTUN
Tıpta Uzmanlık
Türkçe
1987
Ortopedi ve TravmatolojiGazi ÜniversitesiOrtopedi ve Travmatoloji Ana Bilim Dalı
PROF.DR. ORHAN ASLANOĞLU
- İşletmelerde veri örgütlenmesi ve yönetim açısından bilgi sistemleri
Başlık çevirisi yok
FAHAMET TOPALOĞLU
- Kuyruk modelleri ve analizi üzerine bir uygulama
Başlık çevirisi yok
DİDEM ÖZPULAT
Yüksek Lisans
Türkçe
1985
İstatistikEge ÜniversitesiBilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı
DOÇ. DR. FİKRET İKİZ
- Dokuma kumaşlarda örgü tipinin ham kumaşın boyutları ve geometrik özellikleri üzerindeki etkilerinin araştırılması
Başlık çevirisi yok
EMEL ÖNDER
Yüksek Lisans
Türkçe
1985
Tekstil ve Tekstil MühendisliğiEge ÜniversitesiTekstil Mühendisliği Ana Bilim Dalı
DOÇ. DR. GÜNGÖR BAŞER