Geri Dön

Impacts of frequent itemset hiding algorithms on privacy preserving data mining

Sık kümeleri gizleme algoritmalarının gizliliği koruyan veri madenciliği üzerine etkileri

  1. Tez No: 266606
  2. Yazar: BARIŞ YILDIZ
  3. Danışmanlar: YRD. DOÇ. DR. BELGİN ERGENÇ
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Gizlilik, Veri madenciliği, Privacy, Data mining
  7. Yıl: 2010
  8. Dil: İngilizce
  9. Üniversite: İzmir Yüksek Teknoloji Enstitüsü
  10. Enstitü: Mühendislik ve Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Son yıllarda bilgisayar yeteneklerinin önlenemez büyümesi ve büyük miktarda verinin toplanması, veri madenciliğini gözde bir analiz aracı yapmıştır. Birliktelik kuralları (sık kümeler), sınıflandırma ve kümeleme veri madenciliğinin temel yöntemleridir. Bu tezin ilk çalışması aday küme üretmeyen iki algoritma Matrix Apriori ve FP-Growth sık küme bulma algoritmalarının uygulanması ve değerlendirilmesidir. Bu iki algoritmanın karşılaştırılması hızlı matris veri yapısıyla Matrix Apriori'nin daha yüksek başarıma sahip olduğunu açığa çıkarmıştır.Veri madenciliğinin artan gücünün ortaya çıkardığı sorunlardan bir tanesi kişilerin ve şirketlerin gizliliğini ihlal etmeden saklı örüntülerin bulunmasıdır. Bu tezin ikinci bölümünde gözde veri madenciliği tekniklerinden biri olan sık kümelerin bulunması için gizliği koruyan bir yaklaşım önerilmiştir. İkinci olarak, Matrix Apriori algoritması üzerinde değişlik yapılmış ve sık küme gizleme çerçevesi geliştirilmiştir. Dört sık küme gizleme algoritması önerilmiştir, öyle ki: i) bütün sürümler ön madencilik olmadan çalışmakta ve sık kümelerin önceden bulunmasının neden olduğu gizlilik açığı önlenmektedir, ii) ön madencilik gerekmediğinden verimlilik artmıştır, iii) destek değerleri gizleme sürecinde bulunmaktadır ve sonunda temizlenmiş veri kümesi ve bu veri kümesinin sık kümeleri çıktı olarak verilmektedir yani sonradan madenciliğe gerek yoktur, iv) sezgiseller işlem uzunluğundansa örüntü uzunluğunu kullanarak daha değerli veri üzerinde bozma yapma olasılığını elemektedir.

Özet (Çeviri)

The invincible growing of computer capabilities and collection of large amounts of data in recent years, make data mining a popular analysis tool. Association rules (frequent itemsets), classification and clustering are main methods used in data mining research. The first part of this thesis is implementation and comparison of two frequent itemset mining algorithms that work without candidate itemset generation: Matrix Apriori and FP-Growth. Comparison of these algorithms revealed that Matrix Apriori has higher performance with its faster data structureOne of the great challenges of data mining is finding hidden patterns without violating data owners? privacy. Privacy preserving data mining came into prominence as a solution. In the second study of the thesis, Matrix Apriori algorithm is modified and a frequent itemset hiding framework is developed. Four frequent itemset hiding algorithms are proposed such that: i) all versions work without pre-mining so privacy breech caused by the knowledge obtained by finding frequent itemsets is prevented in advance, ii) efficiency is increased since no pre-mining is required, iii) supports are found during hiding process and at the end sanitized dataset and frequent itemsets of this dataset are given as outputs so no post-mining is required, iv) the heuristics use pattern lengths rather than transaction lengths eliminating the possibility of distorting more valuable data.

Benzer Tezler

  1. Discovering users' usage patterns of web log through association rules mining methodology

    Kullanıcıların web log kullanım şekillerinin ilişkili kurallar madencilik metodolojisiyle keşfi

    AHMAD HISHAM ARNAOUT

    Yüksek Lisans

    İngilizce

    İngilizce

    2021

    Bilim ve TeknolojiBahçeşehir Üniversitesi

    Büyük Veri Analitiği ve Yönetimi Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ TAMER UÇAR

  2. Impacts of climate variability on physical and social environment: Study on adaptation process in bangladesh coastal region

    Fiziksel ve sosyal çevre üzerine iklim değişikliğinin etkileri: Bangladeş kıyı bölgesinde adapte olma süreci üzerine bir çalışma

    MOZHARUL ISLAM

    Doktora

    İngilizce

    İngilizce

    2016

    SosyolojiHacettepe Üniversitesi

    Sosyoloji Ana Bilim Dalı

    PROF. DR. FATMA GÜLAY ARIKAN

  3. Greenhouse gas dynamics of saline lakes: A study on the impacts of environmental change

    Tuzlu göllerin sera gazı dinamikleri: Çevresel değişimlerin etkileri üzerine bir çalışma

    GÜLTEKİN YILMAZ

    Doktora

    İngilizce

    İngilizce

    2024

    Deniz BilimleriOrta Doğu Teknik Üniversitesi

    Oşinografi Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ KORHAN ÖZKAN

    PROF. DR. MERYEM BEKLİOĞLU

  4. Climatologies of severe convective storms in Turkey, their environments, and their impacts

    Türkiye şiddetli konvektif fırtına klimatolojileri, çevre koşulları ve etkileri

    ŞEYDA TİLEV TANRIÖVER

    Doktora

    İngilizce

    İngilizce

    2016

    Meteorolojiİstanbul Teknik Üniversitesi

    Meteoroloji Mühendisliği Ana Bilim Dalı

    PROF. DR. MİKDAT KADIOĞLU

    PROF. DR. DAVID M. SCHULTZ

  5. 1999 Marmara depremlerinin etkilerinin travma sonrası gelişim modeli çerçevesinde değerlendirilmesi

    The investigation of the impacts of 1999 Marmara earthquakes from the posttraumatic growth model perspective

    TUĞBA ÇAPAR

    Yüksek Lisans

    Türkçe

    Türkçe

    2016

    PsikolojiHacettepe Üniversitesi

    Psikoloji Ana Bilim Dalı

    DOÇ. DR. SAİT ULUÇ