Derin öğrenme ile web verisi ayıklama altyapısı geliştirilmesi
Development of a web data extraction infrastructure using deep learning
- Tez No: 663256
- Danışmanlar: PROF. DR. OĞUZ DİKENELLİ
- Tez Türü: Yüksek Lisans
- Konular: Bilim ve Teknoloji, Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Bilgi ve Belge Yönetimi, Science and Technology, Computer Engineering and Computer Science and Control, Information and Records Management
- Anahtar Kelimeler: Otomatik Veri Çıkarımı, Metin Sınıflandırma, Derin Öğrenme, Konvolüsyonel Sinir Ağı, Sözcük Yerleştirme, Yapay Sinir Ağı, Automatic Data Extraction, Text Classification, Deep Learning, Convolutional Neural Network, Word Embedding, Artificial Neural Network
- Yıl: 2021
- Dil: Türkçe
- Üniversite: Ege Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Teknolojinin gelişmesi ile birçok şirket, pazarlamak istedikleri ürünleri e-ticaret siteleri aracılığı ile kullanıcılara sunmaya başlamıştır. Bu süreç sonucunda e-ticaret siteleri kullanıcılarının tüketim eğilimini analiz eden yeni çalışma alanları meydana gelmiştir. Günümüzde webten toplanan HTML sayfalarından bilgi çıkarımı yapan yazılımlar, web geliştiricilerin web sitelerinin tasarımlarını periyodik olarak değiştirmesi sebebi ile otomatik bilgi çıkarımında kullanıma uygun değildir. Web sayfalarında yapılan güncellemelerden etkilenen yazılım sistemleri, yeniden uyarlanmaya ihtiyaç duymaktadır. Bu sebeple web verilerinden otomatik bilgi çıkarımı işlemi, web verisi analizinde önemli bir yer haline gelmiştir. Web sayfalarından bilgi çıkarımı için yapılan çalışmalar teknoloji geliştikçe beklentileri karşılayamaz duruma gelmektedir ya da karmaşık bilgilerin (içerik haritası, renk, ölçü gibi iç içe geçirilmiş birden fazla bloktan oluşan yapılar -Örneğin; <div> <div> <div> small </div> <div> medium </div> </div> </div>) çıkarımı yapılamamaktadır. Bu çalışmada, moda alanında derin öğrenme yöntemi kullanılarak web sayfalarından otomatik olarak karmaşık bilgi çıkarımı için HTML blok sınıflandırması yapılmış, alana özgü çalışmalarda derin öğrenme tabanlı modellerin güvenilir sonuç verdiği gösterilmiştir. Çalışma kapsamında içerik haritası, renk, ölçü, tanım ve başlık bilgilerinin çıkarılması hedeflenmiştir. Bu çalışmada HTML web sayfaları DOM ağaçlarına dönüştürülmüş ve üzerinde basit bir filtreleme işlemi yapılmıştır. Filtreleme sonrasında oluşan veriler ön işleme adımlarından geçirilmiştir. Dört konvolüsyonel derin öğrenme ağı oluşturulmuş ve sonuçları incelenmiştir. Sonuçlar, konvolüsyonel derin öğrenme ağlarının HTML bloklarını bulmada güvenilir bir yaklaşım olduğunu göstermiştir.
Özet (Çeviri)
When the technology has improved, a lot of companies started to sell their products to consumers using e-commerce websites. As a result of this process, new work areas that analyze the tendency of consumers who use e-commerse websites were formed. Nowadays, software systems that extract information from websites cannot be used in automatic web data extraction because the design of the websites are changed by the developers periodically. The software systems that are affected by the changes are needed to be updated. Because of that, automatic information extraction from web data becomes an important study field. Information extraction studies from web data could not fulfill their promises when the technology has improved or cannot extract complex information like breadcrumb, size and color which consist of multiple nested HTML blocks (i.e.; <div> <div> <div> small </div> <div> medium </div> </div> </div>). In this study, an HTML block classification-based information extraction approach from fashion websites has been proposed that uses deep learning models and it has been shown that deep learning models give promising results. The study focuses on breadcrumb, color, size, description ve title extraction from the product pages. In this study, HTML web sites are turned to DOM trees and basic filtring are performed. After filtring the unneccessary blocks from the dataset, preproccessing process are followed. Four new convolutional neural networks are implemented and their findings are evaluated. The results show that proposed convolutional models are very effective in identifying HTML blocks.
Benzer Tezler
- Türkiye'de aile planlaması çalışmalarında erkeklerin önemi, hastane personeli ile fabrika işçilerinin doğum kontrol yöntemlerine karşı tutum ve davranranışlarında farklılığın araştırılması
Başlık çevirisi yok
KAMİL MALKOÇLU
Yüksek Lisans
Türkçe
1987
Demografiİstanbul ÜniversitesiAile Sağlığı Ana Bilim Dalı
DOÇ. DR. DERİN KÖSEBAY
- Değişik derim zamanı ve önsoğutmanın Bursa siyahı incir çeşidinin meyve kalitesi ve pazarlama süresi üzerine etkileri
Effects of haruest time and precooling on fruit quality and shelf-life of the fig variety“Bursa siyahı”
FÜSUN GÜRSEL ÇELİKEL
- Tekstil boyamacılığında atık flottede boyama imkanları üzerine araştırma
Başlık çevirisi yok
MEHMET YAKARTEPE
Yüksek Lisans
Türkçe
1985
Tekstil ve Tekstil MühendisliğiEge ÜniversitesiTekstil Mühendisliği Ana Bilim Dalı
YRD. DOÇ. DR. KERİM DURAN
- Ön işlemenin ve askorbik asitin dondurularak depolanan yılan balıklarının (Anguilla anguilla) kalitesine etkileri
Başlık çevirisi yok
H.VOLKAN GÖKSEL
Yüksek Lisans
Türkçe
1985
Gıda MühendisliğiEge ÜniversitesiSu Ürünleri Ana Bilim Dalı
DOÇ. DR. AYDIN URAL
- Antakya tarihi ticaret merkezi mekansal yapı değişim ve gelişim sürecinin kent ticaret merkezi planlamasına etkinliği
The Effectiveness of spatial structural chance and development period of the historical trade center of Antakya in the urban trade planning
NEVİN TURGUT
Yüksek Lisans
Türkçe
1986
Şehircilik ve Bölge PlanlamaGazi ÜniversitesiŞehir ve Bölge Planlama Ana Bilim Dalı
YRD. DOÇ. DR. NURCAN UYDAŞ