Hiyerarşik kümeleme metotları ile veri madenciliği uygulamaları
Data mining applications using hierarchical clustering algorithms
- Tez No: 198304
- Danışmanlar: DOÇ. DR. YILMAZ ÇAMURCU
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2005
- Dil: Türkçe
- Üniversite: Marmara Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Belirtilmemiş.
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: 124
Özet
Veri üretme, veri toplama ve veri kullanımındaki teknolojik gelişmeler sonucuhızlı bir şekilde artan veritabanı boyutları, verileri kısa süre içinde kullanışlı veanlaşılır bilgilere çevirebilen yeni teknikler ve araçlar gerektirmektedir. Bugereksinimlere yanıt vermek üzere tanımlanan veri madenciliği, mevcut verikaynaklarından, kullanıcının farklı sorularına yanıt verecek, kesin, faydalı, anlaşılır,önceden bilinmeyen ve kullanışlı bilgilerin elde edilmesi işlemidir. Verimadenciliğinde yaygın olarak kullanılan yöntemlerden biri kümeleme analizidir.Kümeleme işlemi veri analizlerinin örüntü oluşturma aşamasında, verikaynağındaki tüm verileri kullanmak yerine, benzer özellik gösteren verileri temsileden kümeleri kullanır. Veri madenciliğinde bir çok kümeleme metodubulunmaktadır. Bu çalışmada, kümeleme metotlarından hiyerarşik kümelememetodunun farklı algoritmalarının uygulamalı karşılaştırmaları yapılmıştır.Hiyerarşik kümeleme metotlarında, verilerin iç içe gruplaşma ilişkisini vegruplaşmaların değiştiği benzerlik seviyelerini ağaç yapısı şeklinde gösteren birdendrogram yapısı oluşturulur. Bu işlem veri noktalarını veya küçük kümeleribirleştirerek yada büyük kümeleri parçalara bölerek gerçekleştirilir.Bu tezde, veri madenciliği ve veri madenciliğinde kullanılan kümeleme analizimetotları ve bu metotlardan birisi olan hiyerarşik kümeleme algoritmaları hakkındateorik bilgiler verilmiştir. Daha sonra hiyerarşik kümeleme algoritmalarından CURE(Clustering Using REpresentatives) ve AGNES (AGglomerative NESting) ilebölümleyici kümeleme algoritmalarından k-means algoritmasının yapıları ayrıntılıolarak incelenmiş ve bu algoritmalar tarafımızca MATLAB'de hazırlanmış birprogram aracılığıyla sentetik veri setleri üzerinde uygulanmıştır. Elde edilensonuçların karşılaştırmaları yapılmıştır. Algoritmaların gerçek veri setleri üzerindekisonuçlarının değerlendirilmesini sağlamak için süsen bitkisinin taç ve çanak yapraklarınınbüyüklükleri bilgilerini taşıyan iris veri setinde de uygulamalar gerçekleştirilmiştir.Gerçekleştirilen uygulamalar sonucunda, k-means algoritmasının ayrık ve sıkışıkbulutlar halindeki kümeleri başarıyla bulduğu görülmüştür. Bu algoritma benzer büyüklüktekiküresel kümeleri bulabilirken çok büyük kümeleri küresel de olsa parçalara ayırmaktadır.AGNES algoritması uygulamaları bu algoritmanın küresel kümeleri etkili bir şekildebulduğunu ancak sıradışı noktalara karşı çok duyarlı olduğunu göstermiştir. CUREalgoritması uygulamalarında bu algoritmanın farklı büyüklüklerde ve farklı şekillerdekikümeleri sıradışı noktalardan etkilenmeden başarıyla bulduğu görülmüştür. Ancak, CUREalgoritmasıyla elde edilen kümeler giriş parametrelerinin değerlerinden etkilendiğisaptanmıştır.Temmuz, 2005 Meral DEMİRALAY
Özet (Çeviri)
The rapid growth in the size of data and databases, has generated an urgentneed for new techniques and tools that can intelligently and automatically transformthe processed data into useful information and knowledge. Data mining (DM) is theprocess of discovering meaningful, understandable, implicit, previously unknownand potentially useful information from databases. There are number of techniquesused in DM. One of the techniques is the cluster analysis.Clustering in data analysis prevents using all data points to find meaningfulpatterns in a database by using clusters that represents a number of very similar datapoints as one data point. There are number of techniques used in cluster analysis. Inthis thesis, hierarchical clustering methods are investigated. Hierarchical clusteringmethods builds a dendrogram representing the nested grouping of patterns and thesimilarity levels at which grouping change.In this thesis, data mining and clustering step of data mining process isdescribed briefly and some theoretical background of most frequently usedhierarchical clustering algorithms are explained. Detailed information on CURE,AGNES and k-means are presented and these algorithms are applied to syntheticdatabases in MATLAB platform to compare the performance of each algorithm. Irisdataset is chosen for real world data and CURE, AGNES and k-means algorithmsare applied to that dataset to observe the performance and behavior of thesealgorithms. The results of the applications showed that k-means algorithm can findwell-separated and compact clusters. When there are large differences in cluster sizesk-means algorithm splits the clusters into smaller clusters. AGNES algorithmefficiently finds the spherical clusters but it is very sensitive to outliers. CUREalgorithm efficiently identifies the clusters with different size and arbitrary shapes. Thealgorithm is not very sensitive to the outliers but the input parameters affect the clusteringresults very much. The experimental studies showed that because of the execution time,CURE algorithm is not very useful in real world applications.July, 2005 Meral DEMİRALAY
Benzer Tezler
- 2000 sonrası Türkiye'de yerel yönetim yasalarının 'Yerel yönetişim' kavramı üzerinden değerlendirilmesi
To vi̇ew Turkish local administration act from a perspective of 'Local governance'
NAZLI NALCI ARIBAŞ
Yüksek Lisans
Türkçe
2012
Kamu Yönetimiİnönü ÜniversitesiKamu Yönetimi Ana Bilim Dalı
DOÇ. DR. YUSUF KARAKILÇIK
- Örgütsel demokrasiyi ve akademik özgürlüğü benimseme ve Türkiye'de uygulanabilir bulma düzeyine ilişkin öğretim elemanlarının görüşleri
Academicians' point of view about organizational democracy and academic freedom receptivity and applicability level in Turkey
SÜHEYLA BOZKURT
Doktora
Türkçe
2012
Eğitim ve ÖğretimAnkara ÜniversitesiEğitim Yönetimi ve Politikası Ana Bilim Dalı
PROF. DR. ALİ BALCI
- İş sağlığı ve güvenliği risk değerlendirme yöntemlerinin bulanık mantık yaklaşımı ile analizi: KOBİ uygulama örneği
A fuzzy logic approach to analyzing occupational health and safety risk assessment methods: A case study of sme
EKREM ÇAKMAK
Yüksek Lisans
Türkçe
2015
Halk SağlığıYıldırım Beyazıt Üniversitesiİş Sağlığı ve Güvenliği Ana Bilim Dalı
YRD. DOÇ. KEMAL BİLEN
- Beden eğitimi ve spor yüksekokulunda okuyan ciddi boş zaman katılımcılarının kişilik özelliklerinin incelenmesi
Investigation of personality traits to serios leisure participant's in school of physical education and sports.
UTKU IŞIK
Yüksek Lisans
Türkçe
2014
SporDumlupınar ÜniversitesiBeden Eğitimi ve Spor Ana Bilim Dalı
PROF. DR. SEYDİ KARAKUŞ
- Cooperation & coordination of distributed intelligent agents for manufacturing systems
Dağınık imalat sistemlerinde etmen tabanlı sistemlerin koordinasyonu ve kooperasyonu
BANU ÇALIŞ
Doktora
İngilizce
2015
Endüstri ve Endüstri MühendisliğiMarmara ÜniversitesiEndüstri Mühendisliği Ana Bilim Dalı
PROF. DR. ERCAN ÖZTEMEL
- Milli park planlamalarında ziyaretçi yönetimine ilişkin yeni bir model önerisi: Altındere Vadisi Milli Parkı (Maçka/Trabzon) örneği
A new model proposal for visitor management in planning national parks: Case of Altındere Valley National Park (Macka/Trabzon)
ERTAN DÜZGÜNEŞ
Doktora
Türkçe
2015
Peyzaj MimarlığıKaradeniz Teknik ÜniversitesiPeyzaj Mimarlığı Ana Bilim Dalı
PROF. DR. ÖNER DEMİREL