Compositional representations of language structures in multilingual joint-vector space
Çok dilli eklem-vektör uzayda dil yapılarının bileşim temsili
- Tez No: 522506
- Danışmanlar: DR. ÖĞR. ÜYESİ BARIŞ ARSLAN
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Doğal dil işleme, Natural language processing
- Yıl: 2018
- Dil: İngilizce
- Üniversite: İstanbul Şehir Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Son dönemdeki yapay sinir ağları ve derin öğrenme tekniklerinde ki gelişmelerle beraber, temsili öğrenme pek çok araştırmanın odak noktasında yer almaya başladı. Doğal dil işleme(DDÍ) alanında, temsili öğrenme tekniklerinin uygulamasında ve diğer metodlara göre DDÍ problemlerinin çözümünde ilerleme sağlamıştır. Bu alandaki ana araıstırma konularından biri, dil yapılarının ortak çok dilli uzayda birleşimsel temsillerini oluşturmaktır. Bu çalışmanın hedefi derin öğrenme ve DDÍ mede kullanılan bazıtekniklerin birleştirilerek temsillerin DDÍ uygulamalarındaki etkisini araştırmaktır. Bu amaçla 4 değişik birleşim vektör modeli üzerinde çalışılmıştır. Token yada morpheme gibi dil yapılarının temsil uzaylarının oluşturulması için ilk olarak token yada morfolojik ayrıştırma ile paralel korpus hazırlanmış sonra değişik hiyerarşik birleşim metodları ikilidil modelleri üzerinden kullanılmıştır. Íkili-dil modelleri 4 dil için hazırlanan cümle sıralı korpuslar kullanılarak eğitilmiştir. Bu sayede model, birleşimsel vectör modelini kullanarak cümle elemanlarının temsillerini oluşturmayı öğrenmektedir. Degişik birleşimsel vektör metodlarını değerlendirmek için iki test senaryosu kullanılmıştır. Ílki açımlama testidir. Bu senaryoda ikili model, birleşimsel vektör modelini kullanarak egitilir. Sonra paralel korpusdan iki dil için seçilen karşılıklı cümle çiftlerinin karşılaştır ılmaları ile performansları hesaplanır. Diğer test senaryosu ise gözetimli döküman sınıflama testidir. Bir dilden seçilen dökümanlar kullanılarak eğitilen sınıflandırıcı diğer bir dilden seçilen test dökümanları ile test edilir. Dökümanlar değişik konu başlıkları için pozitif ve negatif olarak işaretlenmiştir. Sınıflandırıcı pozitif ve negatif örnekleri ayırmayı ögrenmektedir.
Özet (Çeviri)
After the recent developments in Artificial Neural Networks and deep learning techniques, representation learning has become the focus of many research interests. In the field of Natural Language Processing, representation learning techniques have gained many implementation advances and improved different tasks compared to any other methods. One of the primary research topics in this area is to construct compositional representations of discrete language structures in multilingual joint-vector space. In this thesis study, several techniques from deep learning and NLP are combined to investigate their potential impact on NLP tasks. For this purpose, 4 different composition vector models (CVM) by using tokens and morphemes as basic language structures are studied. To construct the embedding space of language structures such as tokens and morphemes, first, a parallel corpus is prepared by segmenting into discrete objects via tokenization and morphological analysis. Several hierarchical composition methods via the bilingual method are employed to construct the embeddings of these structures. Bilingual models are trained by using sentence-aligned corpora for 4 languages. The models learn how to employ compositional vector models and construct embeddings of sentence constituents as well. Two different test scenarios are performed to evaluate different CVMs. The first one is the paraphrase test. In this case, the bilingual models using CVMs are trained with each language pair L1-L2 ( English, Turkish, German and French) parallel corpus. Then the models are tested by evaluating their performance in finding the corresponding pairs correctly from 100 randomly selected sentences from each L1-L2 pair. The other test scenario is Cross-lingual document classification. In this case, the trained models are employed by a document classifier model to evaluate their performance in classification task by first training in L1 documents and testing with L2 documents
Benzer Tezler
- Üzüm sularının pastörizasyonu ve kontsantresi sırasında hidroksimetilfurfural oluşumu üzerinde bir araştırma
Başlık çevirisi yok
ŞERİFE ŞAHİN
Yüksek Lisans
Türkçe
1985
Gıda MühendisliğiEge ÜniversitesiTarım Ürünleri Teknolojisi Ana Bilim Dalı
DOÇ. DR. AYDIN URAL
- 1,3-difenil-4,5-bis(hidroksiimino)-imidazolidin ve Ni(II), Cu(II), Pd(II), UO2(VI) komplekslerinin sentezi
Başlık çevirisi yok
VEFA AHSEN
Doktora
Türkçe
1984
Kimya MühendisliğiUludağ ÜniversitesiKimya Mühendisliği Ana Bilim Dalı
PROF. DR. ÖZER BEKAROĞLU
- Şeker şurubunun inversiyonuna etki eden kimi faktörlerin araştırılması
Başlık çevirisi yok
SAİDE GÜNERİ
Yüksek Lisans
Türkçe
1985
Gıda MühendisliğiEge ÜniversitesiTarım Bilimleri ve Teknolojileri Ana Bilim Dalı
DOÇ. DR. ÜNAL YURDAGEL
- Ön işlemenin ve askorbik asitin dondurularak depolanan yılan balıklarının (Anguilla anguilla) kalitesine etkileri
Başlık çevirisi yok
H.VOLKAN GÖKSEL
Yüksek Lisans
Türkçe
1985
Gıda MühendisliğiEge ÜniversitesiSu Ürünleri Ana Bilim Dalı
DOÇ. DR. AYDIN URAL
- Pik demiri ve karbon çeliğinin sulu çözeltiler içindeki korozyon hızının tayini
Determination of the rate of corrosion of the cast iran and carbon steel in the aqueous solutions
EMİNE NAZAN ÜNAL
Yüksek Lisans
Türkçe
1985
Kimya MühendisliğiGazi ÜniversitesiKimya Mühendisliği Ana Bilim Dalı
DOÇ. DR. HAYRİ YALÇIN