Özellik tabanlı zaman serisi kümelemesi yöntemlerinin performanslarının karşılaştırılması
Comparision performances of feature-based time series clustering techniques via simulation studies
- Tez No: 621918
- Danışmanlar: DOÇ. DR. NEVİN GÜLER DİNCER
- Tez Türü: Yüksek Lisans
- Konular: İstatistik, Statistics
- Anahtar Kelimeler: Veri Madenciliği, Kümeleme Analizi, Zaman Serisi Kümelemesi, Özellik Tabanlı Zaman Serisi Kümelemesi, Data mining, clustering analysis, time series clustering, feature-based time series clustering
- Yıl: 2020
- Dil: Türkçe
- Üniversite: Muğla Sıtkı Koçman Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: İstatistik Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Kümeleme analizi, bir veri setini aynı gruptaki bireyler arasındaki uzaklık mümkün olduğunca minimum, farklı gruplardaki bireyler arasındaki uzaklık mümkün olduğunca maksimum olacak şekilde homojen gruplara bölmeyi amaçlayan veri madenciliği yöntemlerinden biridir. Zaman Serisi Kümelemesi (ZSK) ise, herhangi bir kümeleme yönteminin çok sayıda zaman serisinden oluşan bir veri setine uygulanması şeklinde düşünülebilir. Burada zaman serisi ardışık zaman aralıklarında ölçülen gözlemlerden oluşan bir veri kümesidir. ZSK yöntemleri i) ham veri tabanlı, ii) model tabanlı ve iii) özellik tabanlı olmak üzere 3 ana kategoriye ayrılır. Ham veri tabanlı ZSK yöntemleri kümeleme algoritmalarının zaman serisine doğrudan uygulanmasına dayanır ve bu nedenle büyük boyutlu zaman serisinde hesaplama maliyeti oldukça yüksektir. Ham veri tabanlı ZSK yöntemlerinin bu dezavantajını ortadan kaldırmak amacıyla, zaman serisinin daha düşük boyutlu bir uzaya dönüştürülmesine dayanan Model tabanlı ve özellik tabanlı ZSK yöntemleri önerilmiştir. Burada model tabanlı ZSK yöntemleri, her bir zaman serisi için bir model öngörülmesi ve kümelemede model parametrelerinin kullanılmasına dayanırken, özellik tabanlı ZSK yöntemleri her bir zaman serisi için özellik çıkarım yöntemlerinin uygulanıp, kümelemede çıkarılan özelliklerin kullanılmasına dayanır. Bu tezde özellik tabanlı ZSK yöntemlerine odaklanılmıştır. Şu ana kadar çok sayıda özellik tabanlı ZSK yöntemi geliştirilmiştir. Ancak, bu yöntemlerin performanslarının karşılaştırılmasına yönelik kapsamlı bir çalışmaya rastlanmamıştır. Bu tezde, simülasyon çalışması yardımıyla ZSK'de en iyi performansı sağlayan zaman serisi özelliği ve kümeleme algoritmasının tespit edilmesi amaçlanmıştır. Bu amaç doğrultusunda, 14 kümeleme algoritması ve 13 zaman serisi özellik çıkarım yöntemi, beş farklı simülasyon çalışması gerçekleştirilerek doğru kümeleme başarılarına göre karşılaştırılmıştır. Yapılan analizler sonucunda“Kesikli Dalgacık Dönüşümü”ve“Ward”bağlantı kümeleme algoritmasının en iyi performansa sahip olduğu görülmüştür.
Özet (Çeviri)
Clustering analysis is one of the data mining techniques that aims dividing a data set into homogenous groups such that the distance between individuals in the same group is as minimum as possible, the distance between individuals in the different group is as maximum as possible. Time series clustering (TSC) can be considered application of any clustering algorithm to a data set consisted of numerous time series. In here, time series is data set consisted of observations measured at successive time points. TSC techniques are divided into three categories as i) raw-based, ii) model-based, and iii)feature-based. Raw-based TSC techniques are based on directly applying the clustering algorithms to time series and therefore, their computational cost is very high in large-scale time series. In order to overcome this disadvantage of raw-based TSC techniques, feature based and model based TSC techniques that are based on converting time series into lower dimension space are proposed. While model-based TSC techniques are based on predicting a model for each time series and using the model parameters in clustering, feature-based TSC techniques are based on applying feature extraction method to each time series and using features extracted in clustering. In this thesis, feature-based TSC methods are focused. So far, many feature-based TSC techniques have been developed. But, a comprehensive study has not been encountered aimed at comparison of performances of these methods. In this thesis, it is aimed determining of clustering algorithm and time series's features that provide best performance in TSC via simulation study. In the direction of this purpose, 14 clustering algorithms and 13 feature extraction methods have been compared by performing five simulation studies according to correctly clustering success. At the result of analyses, it is observed that Discrete Wavelet Transform and Ward linkage clustering algorithm have best performance.
Benzer Tezler
- Ege bölgesi keçi liflerinin bazı önemli fiziksel, kimyasal özellikleri ve değerlendirme imkanları
Başlık çevirisi yok
NİLÜFER ERDEM
Doktora
Türkçe
1985
Tekstil ve Tekstil MühendisliğiEge ÜniversitesiTekstil Mühendisliği Ana Bilim Dalı
PROF. DR. GÜLSEREN YAZICIOĞLU
- Yenileme yatırımları
Başlık çevirisi yok
OSMAN NURİ FİLİZ
Yüksek Lisans
Türkçe
1986
İşletmeGazi ÜniversitesiEndüstri Mühendisliği Ana Bilim Dalı
DOÇ. DR. OSMAN OKKA
- Üzüm sularının pastörizasyonu ve kontsantresi sırasında hidroksimetilfurfural oluşumu üzerinde bir araştırma
Başlık çevirisi yok
ŞERİFE ŞAHİN
Yüksek Lisans
Türkçe
1985
Gıda MühendisliğiEge ÜniversitesiTarım Ürünleri Teknolojisi Ana Bilim Dalı
DOÇ. DR. AYDIN URAL
- 1,3-difenil-4,5-bis(hidroksiimino)-imidazolidin ve Ni(II), Cu(II), Pd(II), UO2(VI) komplekslerinin sentezi
Başlık çevirisi yok
VEFA AHSEN
Doktora
Türkçe
1984
Kimya MühendisliğiUludağ ÜniversitesiKimya Mühendisliği Ana Bilim Dalı
PROF. DR. ÖZER BEKAROĞLU