Geri Dön

Improving the performance of Hadoop/Hive by sharing scan and computation tasks

Tarama ve hesaplama “işlerinin payla“ştırılmasıyla Hadoop/Hive üzerinde performans iyileş“tirimi

  1. Tez No: 338458
  2. Yazar: SERKAN ÖZAL
  3. Danışmanlar: DOÇ. DR. AHMET COŞAR
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Dağıtık veri tabanı sistemleri, Distributed database systems
  7. Yıl: 2013
  8. Dil: İngilizce
  9. Üniversite: Orta Doğu Teknik Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

MapReduce zaman alan analitik sorguları n büyük ölçekli veriler üzerinde toplu olarak işletilmesi için popüler bir yöntemdir. Çoklu sorguları n eşzamanlı işletilmelerinde, tarama ve hesaplama işlemleri için birçok yöntem kullanı labilmektedir. Ortak kı sı mları n sadece bir kere işletilmesi toplam i³lem süresini önemli ölçüde düşürebilmektedir. Buradan yola çı karak, biz Hadoop üstünde çal ışan açı k kaynak kodlu SQL tabanl ı dağıtı k veri ambar ı yönetim sistemi olan Hive framework'ü ile çal ışan Çoklu Sorgu iyileştirimi (ÇS) yöntemi öneriyoruz. Bizim framework'ümüz, SharedHive, benzer kı s ımları bulunan HiveQL sorguları nı ortak kı sı mları n birlikte kullan ılması nı sağlayarak genel HiveQL sorgular na dönüştürmektedir. Bu sayede toplam işletim süresinde önemli iyileşmeler görülebilmektedir. SharedHive ile ortak kı sı mları bulunan TPC-H sorguları nda toplam işletim süresi olarak %20-90 arası nda iyileştirme sağlanabilmektedir.

Özet (Çeviri)

MapReduce is a popular model of executing time-consuming analytical queries as a batch of tasks on large scale data. During simultaneous execution of multiple queries, many opportunities can arise for sharing scan and/or computation tasks. Executing common tasks only once can reduce the total execution time of all queries remarkably. Therefore, we propose to use Multiple Query Optimization (MQO) techniques to improve the overall performance of Hadoop Hive, an open source SQL-based distributed warehouse system based on MapReduce. Our framework, SharedHive, transforms a set of correlated HiveQL queries into new global queries that can produce the same results in remarkably smaller total execution times. It is experimentally shown that SharedHive outperforms the conventional Hive by %20-90 reduction, depending on the number of queries and percentage of shared tasks, in the total execution time of correlated TPC-H queries.

Benzer Tezler

  1. DNS big data processing for detecting customersbehaviour of isp using an optimized apache spark cluster

    İSP müşterilerin davranışlarını tespiti için optimize edilmiş bir apache spark kümesi kullanarak dns büyük veri işleme

    YOUSEF ALKHANAFSEH

    Yüksek Lisans

    İngilizce

    İngilizce

    2022

    Elektrik ve Elektronik Mühendisliğiİstanbul Teknik Üniversitesi

    Elektrik ve Elektronik Mühendisliği Ana Bilim Dalı

    PROF. DR. TAHİR ÇETİN AKINCI

  2. Mapreduce kullanarak RDFS üzerinde dağıtık çıkarsama

    Implementation of distributed RDFS reasoning

    YİĞİT ÇETİN

    Yüksek Lisans

    Türkçe

    Türkçe

    2014

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolTobb Ekonomi ve Teknoloji Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. OSMAN ABUL

  3. Improving the performance of speaker identification systems by classifier combination techniques

    Konuşmacı tanıma sistemlerinin başarımının sınıflandırıcı birleştirme yöntemleri ile iyileştirilmesi

    HAKAN ALTINÇAY

    Doktora

    İngilizce

    İngilizce

    2000

    Elektrik ve Elektronik MühendisliğiOrta Doğu Teknik Üniversitesi

    Elektrik-Elektronik Mühendisliği Ana Bilim Dalı

  4. Improving the performance of software defect predictors with internal and external information sources

    Dahili ve harici bilgi kaynakları ile yazılım hata tahmini performansının iyileştirilmesi

    BURAK TURHAN

    Doktora

    İngilizce

    İngilizce

    2008

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBoğaziçi Üniversitesi

    Bilgisayar Mühendisliği Bölümü

    YRD. DOÇ. DR. AYŞE BAŞAR BENER

  5. Improving the performance of similarity joins using graphics processing unit

    Benzerlik birleşimlerinin performansının grafik işleme birimi kullanılarak arttırılması

    ZEYNEP KORKMAZ

    Yüksek Lisans

    İngilizce

    İngilizce

    2012

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİhsan Doğramacı Bilkent Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. HAKAN FERHATOSMANOĞLU

    PROF. DR. CEVDET AYKANAT