Geri Dön

Derin öğrenme ile web verisi ayıklama altyapısı geliştirilmesi

Development of a web data extraction infrastructure using deep learning

  1. Tez No: 663256
  2. Yazar: GİZEM ABALI
  3. Danışmanlar: PROF. DR. OĞUZ DİKENELLİ
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilim ve Teknoloji, Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Bilgi ve Belge Yönetimi, Science and Technology, Computer Engineering and Computer Science and Control, Information and Records Management
  6. Anahtar Kelimeler: Otomatik Veri Çıkarımı, Metin Sınıflandırma, Derin Öğrenme, Konvolüsyonel Sinir Ağı, Sözcük Yerleştirme, Yapay Sinir Ağı, Automatic Data Extraction, Text Classification, Deep Learning, Convolutional Neural Network, Word Embedding, Artificial Neural Network
  7. Yıl: 2021
  8. Dil: Türkçe
  9. Üniversite: Ege Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Teknolojinin gelişmesi ile birçok şirket, pazarlamak istedikleri ürünleri e-ticaret siteleri aracılığı ile kullanıcılara sunmaya başlamıştır. Bu süreç sonucunda e-ticaret siteleri kullanıcılarının tüketim eğilimini analiz eden yeni çalışma alanları meydana gelmiştir. Günümüzde webten toplanan HTML sayfalarından bilgi çıkarımı yapan yazılımlar, web geliştiricilerin web sitelerinin tasarımlarını periyodik olarak değiştirmesi sebebi ile otomatik bilgi çıkarımında kullanıma uygun değildir. Web sayfalarında yapılan güncellemelerden etkilenen yazılım sistemleri, yeniden uyarlanmaya ihtiyaç duymaktadır. Bu sebeple web verilerinden otomatik bilgi çıkarımı işlemi, web verisi analizinde önemli bir yer haline gelmiştir. Web sayfalarından bilgi çıkarımı için yapılan çalışmalar teknoloji geliştikçe beklentileri karşılayamaz duruma gelmektedir ya da karmaşık bilgilerin (içerik haritası, renk, ölçü gibi iç içe geçirilmiş birden fazla bloktan oluşan yapılar -Örneğin; <div> <div> <div> small </div> <div> medium </div> </div> </div>) çıkarımı yapılamamaktadır. Bu çalışmada, moda alanında derin öğrenme yöntemi kullanılarak web sayfalarından otomatik olarak karmaşık bilgi çıkarımı için HTML blok sınıflandırması yapılmış, alana özgü çalışmalarda derin öğrenme tabanlı modellerin güvenilir sonuç verdiği gösterilmiştir. Çalışma kapsamında içerik haritası, renk, ölçü, tanım ve başlık bilgilerinin çıkarılması hedeflenmiştir. Bu çalışmada HTML web sayfaları DOM ağaçlarına dönüştürülmüş ve üzerinde basit bir filtreleme işlemi yapılmıştır. Filtreleme sonrasında oluşan veriler ön işleme adımlarından geçirilmiştir. Dört konvolüsyonel derin öğrenme ağı oluşturulmuş ve sonuçları incelenmiştir. Sonuçlar, konvolüsyonel derin öğrenme ağlarının HTML bloklarını bulmada güvenilir bir yaklaşım olduğunu göstermiştir.

Özet (Çeviri)

When the technology has improved, a lot of companies started to sell their products to consumers using e-commerce websites. As a result of this process, new work areas that analyze the tendency of consumers who use e-commerse websites were formed. Nowadays, software systems that extract information from websites cannot be used in automatic web data extraction because the design of the websites are changed by the developers periodically. The software systems that are affected by the changes are needed to be updated. Because of that, automatic information extraction from web data becomes an important study field. Information extraction studies from web data could not fulfill their promises when the technology has improved or cannot extract complex information like breadcrumb, size and color which consist of multiple nested HTML blocks (i.e.; <div> <div> <div> small </div> <div> medium </div> </div> </div>). In this study, an HTML block classification-based information extraction approach from fashion websites has been proposed that uses deep learning models and it has been shown that deep learning models give promising results. The study focuses on breadcrumb, color, size, description ve title extraction from the product pages. In this study, HTML web sites are turned to DOM trees and basic filtring are performed. After filtring the unneccessary blocks from the dataset, preproccessing process are followed. Four new convolutional neural networks are implemented and their findings are evaluated. The results show that proposed convolutional models are very effective in identifying HTML blocks.

Benzer Tezler

  1. Değişik derim zamanı ve önsoğutmanın Bursa siyahı incir çeşidinin meyve kalitesi ve pazarlama süresi üzerine etkileri

    Effects of haruest time and precooling on fruit quality and shelf-life of the fig variety“Bursa siyahı”

    FÜSUN GÜRSEL ÇELİKEL

    Yüksek Lisans

    Türkçe

    Türkçe

    1985

    Gıda MühendisliğiEge Üniversitesi

    Bahçe Bitkileri Ana Bilim Dalı

  2. Tekstil boyamacılığında atık flottede boyama imkanları üzerine araştırma

    Başlık çevirisi yok

    MEHMET YAKARTEPE

    Yüksek Lisans

    Türkçe

    Türkçe

    1985

    Tekstil ve Tekstil MühendisliğiEge Üniversitesi

    Tekstil Mühendisliği Ana Bilim Dalı

    YRD. DOÇ. DR. KERİM DURAN

  3. Ön işlemenin ve askorbik asitin dondurularak depolanan yılan balıklarının (Anguilla anguilla) kalitesine etkileri

    Başlık çevirisi yok

    H.VOLKAN GÖKSEL

    Yüksek Lisans

    Türkçe

    Türkçe

    1985

    Gıda MühendisliğiEge Üniversitesi

    Su Ürünleri Ana Bilim Dalı

    DOÇ. DR. AYDIN URAL

  4. Antakya tarihi ticaret merkezi mekansal yapı değişim ve gelişim sürecinin kent ticaret merkezi planlamasına etkinliği

    The Effectiveness of spatial structural chance and development period of the historical trade center of Antakya in the urban trade planning

    NEVİN TURGUT

    Yüksek Lisans

    Türkçe

    Türkçe

    1986

    Şehircilik ve Bölge PlanlamaGazi Üniversitesi

    Şehir ve Bölge Planlama Ana Bilim Dalı

    YRD. DOÇ. DR. NURCAN UYDAŞ