Geri Dön

Hiyerarşik kümeleme metotları ile veri madenciliği uygulamaları

Data mining applications using hierarchical clustering algorithms

  1. Tez No: 198304
  2. Yazar: MERAL DEMİRALAY
  3. Danışmanlar: DOÇ. DR. YILMAZ ÇAMURCU
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2005
  8. Dil: Türkçe
  9. Üniversite: Marmara Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Belirtilmemiş.
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: 124

Özet

Veri üretme, veri toplama ve veri kullanımındaki teknolojik gelişmeler sonucuhızlı bir şekilde artan veritabanı boyutları, verileri kısa süre içinde kullanışlı veanlaşılır bilgilere çevirebilen yeni teknikler ve araçlar gerektirmektedir. Bugereksinimlere yanıt vermek üzere tanımlanan veri madenciliği, mevcut verikaynaklarından, kullanıcının farklı sorularına yanıt verecek, kesin, faydalı, anlaşılır,önceden bilinmeyen ve kullanışlı bilgilerin elde edilmesi işlemidir. Verimadenciliğinde yaygın olarak kullanılan yöntemlerden biri kümeleme analizidir.Kümeleme işlemi veri analizlerinin örüntü oluşturma aşamasında, verikaynağındaki tüm verileri kullanmak yerine, benzer özellik gösteren verileri temsileden kümeleri kullanır. Veri madenciliğinde bir çok kümeleme metodubulunmaktadır. Bu çalışmada, kümeleme metotlarından hiyerarşik kümelememetodunun farklı algoritmalarının uygulamalı karşılaştırmaları yapılmıştır.Hiyerarşik kümeleme metotlarında, verilerin iç içe gruplaşma ilişkisini vegruplaşmaların değiştiği benzerlik seviyelerini ağaç yapısı şeklinde gösteren birdendrogram yapısı oluşturulur. Bu işlem veri noktalarını veya küçük kümeleribirleştirerek yada büyük kümeleri parçalara bölerek gerçekleştirilir.Bu tezde, veri madenciliği ve veri madenciliğinde kullanılan kümeleme analizimetotları ve bu metotlardan birisi olan hiyerarşik kümeleme algoritmaları hakkındateorik bilgiler verilmiştir. Daha sonra hiyerarşik kümeleme algoritmalarından CURE(Clustering Using REpresentatives) ve AGNES (AGglomerative NESting) ilebölümleyici kümeleme algoritmalarından k-means algoritmasının yapıları ayrıntılıolarak incelenmiş ve bu algoritmalar tarafımızca MATLAB'de hazırlanmış birprogram aracılığıyla sentetik veri setleri üzerinde uygulanmıştır. Elde edilensonuçların karşılaştırmaları yapılmıştır. Algoritmaların gerçek veri setleri üzerindekisonuçlarının değerlendirilmesini sağlamak için süsen bitkisinin taç ve çanak yapraklarınınbüyüklükleri bilgilerini taşıyan iris veri setinde de uygulamalar gerçekleştirilmiştir.Gerçekleştirilen uygulamalar sonucunda, k-means algoritmasının ayrık ve sıkışıkbulutlar halindeki kümeleri başarıyla bulduğu görülmüştür. Bu algoritma benzer büyüklüktekiküresel kümeleri bulabilirken çok büyük kümeleri küresel de olsa parçalara ayırmaktadır.AGNES algoritması uygulamaları bu algoritmanın küresel kümeleri etkili bir şekildebulduğunu ancak sıradışı noktalara karşı çok duyarlı olduğunu göstermiştir. CUREalgoritması uygulamalarında bu algoritmanın farklı büyüklüklerde ve farklı şekillerdekikümeleri sıradışı noktalardan etkilenmeden başarıyla bulduğu görülmüştür. Ancak, CUREalgoritmasıyla elde edilen kümeler giriş parametrelerinin değerlerinden etkilendiğisaptanmıştır.Temmuz, 2005 Meral DEMİRALAY

Özet (Çeviri)

The rapid growth in the size of data and databases, has generated an urgentneed for new techniques and tools that can intelligently and automatically transformthe processed data into useful information and knowledge. Data mining (DM) is theprocess of discovering meaningful, understandable, implicit, previously unknownand potentially useful information from databases. There are number of techniquesused in DM. One of the techniques is the cluster analysis.Clustering in data analysis prevents using all data points to find meaningfulpatterns in a database by using clusters that represents a number of very similar datapoints as one data point. There are number of techniques used in cluster analysis. Inthis thesis, hierarchical clustering methods are investigated. Hierarchical clusteringmethods builds a dendrogram representing the nested grouping of patterns and thesimilarity levels at which grouping change.In this thesis, data mining and clustering step of data mining process isdescribed briefly and some theoretical background of most frequently usedhierarchical clustering algorithms are explained. Detailed information on CURE,AGNES and k-means are presented and these algorithms are applied to syntheticdatabases in MATLAB platform to compare the performance of each algorithm. Irisdataset is chosen for real world data and CURE, AGNES and k-means algorithmsare applied to that dataset to observe the performance and behavior of thesealgorithms. The results of the applications showed that k-means algorithm can findwell-separated and compact clusters. When there are large differences in cluster sizesk-means algorithm splits the clusters into smaller clusters. AGNES algorithmefficiently finds the spherical clusters but it is very sensitive to outliers. CUREalgorithm efficiently identifies the clusters with different size and arbitrary shapes. Thealgorithm is not very sensitive to the outliers but the input parameters affect the clusteringresults very much. The experimental studies showed that because of the execution time,CURE algorithm is not very useful in real world applications.July, 2005 Meral DEMİRALAY

Benzer Tezler

  1. 2000 sonrası Türkiye'de yerel yönetim yasalarının 'Yerel yönetişim' kavramı üzerinden değerlendirilmesi

    To vi̇ew Turkish local administration act from a perspective of 'Local governance'

    NAZLI NALCI ARIBAŞ

    Yüksek Lisans

    Türkçe

    Türkçe

    2012

    Kamu Yönetimiİnönü Üniversitesi

    Kamu Yönetimi Ana Bilim Dalı

    DOÇ. DR. YUSUF KARAKILÇIK

  2. Örgütsel demokrasiyi ve akademik özgürlüğü benimseme ve Türkiye'de uygulanabilir bulma düzeyine ilişkin öğretim elemanlarının görüşleri

    Academicians' point of view about organizational democracy and academic freedom receptivity and applicability level in Turkey

    SÜHEYLA BOZKURT

    Doktora

    Türkçe

    Türkçe

    2012

    Eğitim ve ÖğretimAnkara Üniversitesi

    Eğitim Yönetimi ve Politikası Ana Bilim Dalı

    PROF. DR. ALİ BALCI

  3. İş sağlığı ve güvenliği risk değerlendirme yöntemlerinin bulanık mantık yaklaşımı ile analizi: KOBİ uygulama örneği

    A fuzzy logic approach to analyzing occupational health and safety risk assessment methods: A case study of sme

    EKREM ÇAKMAK

    Yüksek Lisans

    Türkçe

    Türkçe

    2015

    Halk SağlığıYıldırım Beyazıt Üniversitesi

    İş Sağlığı ve Güvenliği Ana Bilim Dalı

    YRD. DOÇ. KEMAL BİLEN

  4. Beden eğitimi ve spor yüksekokulunda okuyan ciddi boş zaman katılımcılarının kişilik özelliklerinin incelenmesi

    Investigation of personality traits to serios leisure participant's in school of physical education and sports.

    UTKU IŞIK

    Yüksek Lisans

    Türkçe

    Türkçe

    2014

    SporDumlupınar Üniversitesi

    Beden Eğitimi ve Spor Ana Bilim Dalı

    PROF. DR. SEYDİ KARAKUŞ

  5. Cooperation & coordination of distributed intelligent agents for manufacturing systems

    Dağınık imalat sistemlerinde etmen tabanlı sistemlerin koordinasyonu ve kooperasyonu

    BANU ÇALIŞ

    Doktora

    İngilizce

    İngilizce

    2015

    Endüstri ve Endüstri MühendisliğiMarmara Üniversitesi

    Endüstri Mühendisliği Ana Bilim Dalı

    PROF. DR. ERCAN ÖZTEMEL

  6. Milli park planlamalarında ziyaretçi yönetimine ilişkin yeni bir model önerisi: Altındere Vadisi Milli Parkı (Maçka/Trabzon) örneği

    A new model proposal for visitor management in planning national parks: Case of Altındere Valley National Park (Macka/Trabzon)

    ERTAN DÜZGÜNEŞ

    Doktora

    Türkçe

    Türkçe

    2015

    Peyzaj MimarlığıKaradeniz Teknik Üniversitesi

    Peyzaj Mimarlığı Ana Bilim Dalı

    PROF. DR. ÖNER DEMİREL