Geri Dön

Bulut üzerinde dağıtık doküman sınıflandırma ve kümeleme

Distributed document classification and clustering on cloud

  1. Tez No: 424203
  2. Yazar: SELEN GÜRBÜZ
  3. Danışmanlar: YRD. DOÇ. DR. GALİP AYDIN
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Büyük Veri, Dağıtık Hesaplama, Bulut Bilişim, Big Data, Distributed Computing, Cloud Computing
  7. Yıl: 2015
  8. Dil: Türkçe
  9. Üniversite: Fırat Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: 65

Özet

Büyük veriler geleneksel sistemlerin işleyemeyeceği kadar yüksek hacimli ve karmaşık veriler olup bunların bilinen veri tabanı veya dosya sistemleri üzerinde saklanması ve geleneksel algoritmalarla işlenmesi zordur. Dolayısıyla büyük verileri işlemek ve saklamak için geleneksel hesaplama yöntemleri yerine yeni teknolojiler kullanılmaktadır. Farklı kaynaklar tarafından üretilen çok büyük sayıda dokümanın içerikleri ile ilgili otomatik çıkarsamaların yapılması, alan ve konularının belirlenmesi, özetlerinin çıkarılması veya örüntü keşfi gibi doküman analizi konuları bilim insanlarının çözmeye çalıştığı konulardır. Bu tez çalışmasında Türkçe bilimsel makalelerden oluşan bir veri seti üzerinde çalıştırılan dağıtık sınıflandırma ve kümeleme algoritmaları ile Büyük Veri analizleri yapılmaya çalışılmıştır. Dağıtık Makine Öğrenmesi algoritmaları çalıştırabilmek için Apache Mahout ve Apache Spark kullanılmıştır. Dağıtık doküman sınıflandırma ve kümeleme yapılabilmesi için gerekli olan sunucular Google Cloud, Amazon AWS ve Microsoft Azure bulut altyapıları üzerinde çalıştırılmıştır.

Özet (Çeviri)

Big data is described as large and complex data sets which can not be stored and processed using traditional databases, file systems and algorithms.Therefore new technologies are being utilized to store and process these big data sets. Automatic content extraction, field and topic discovery, summarization or pattern recognition over very large document sets which are produced by various sources are the subjects of many current research. In this thesis, Big Data analysis, namely distributed classification and clustering algorithms are applied to a large data sets consisting Turkish scientific articles, To be able to run distributed Machine Learning algorithms Apache Mahout and Apache Spark are used. The servers needed for distributed classification and clustering algorithms are deployed on the Google Cloud, Amazon AWS and Microsoft Azure cloud computing infrastructures.

Benzer Tezler

  1. Osmanlının son döneminde eğitim yöneticileri tarafından hazırlanmış olan değer eğitimi konulu ders örnekleri ve analizi

    Analysis of value education related lecture samples prepared by education managers of late ottoman era

    BAHATTİN KARALTI

    Yüksek Lisans

    Türkçe

    Türkçe

    2013

    Eğitim ve ÖğretimHasan Kalyoncu Üniversitesi

    İşletme Ana Bilim Dalı

    YRD. DOÇ. ŞAHİN ORUÇ

  2. Türkiye'de yaşayan Suriyeli göçmenlerin gündelik yaşam pratikleri: Mardin örneği

    Everyday life living in practices of Syrian immigrants in Turkey: Example of Mardi̇n

    D. BULUT UNAT

    Yüksek Lisans

    Türkçe

    Türkçe

    2015

    SosyolojiMuğla Sıtkı Koçman Üniversitesi

    Sosyoloji Ana Bilim Dalı

    DOÇ. DR. HASAN ŞEN

  3. IL-17, IL-17R, IL-23 VE IL-23R GEN gen polimorfizmlerinin apikal periodontitis hastalarının periapikal lezyonlarında kemik yıkımı oluşması üzerine etkisi

    Effect of İL-17, İL-17R, IL-23 and İL-23R gene polymorphisms on the formation of bone destruction at periapical lesions of apical periodontitis patients

    ELÇİN TEKİN BULUT

    Doktora

    Türkçe

    Türkçe

    2015

    Diş Hekimliğiİnönü Üniversitesi

    Endodonti Ana Bilim Dalı

    DOÇ. DR. NESLİHAN ŞİMŞEK

    PROF. DR. SEMA BELLİ

  4. Scalable Data Analytics using Spark

    Spark kullanarak Ölçeklenebilir Veri Analitiği

    ASLAN BAKIROV

    Yüksek Lisans

    İngilizce

    İngilizce

    2015

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Şehir Üniversitesi

    Elektronik ve Bilgisayar Mühendisliği Ana Bilim Dalı

    YRD. DOÇ. DR. AHMET BULUT

  5. Adscope: Intelligent scoping of paid search campaigns using relevance feedback

    Adscope: Ücretli arama kampanyaları ı̇çin ı̇lişkili geri bildirimleri kullanarak akıllı kapsam belirleme

    KEVSER NUR ÇOĞALMIŞ

    Yüksek Lisans

    İngilizce

    İngilizce

    2015

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Şehir Üniversitesi

    Elektrik ve Bilgisayar Mühendisliği Ana Bilim Dalı

    YRD. DOÇ. DR. AHMET BULUT