Gövdelemenin ve gömünün türkçe bir bilgi erişim sistemi üzerindeki etkisinin araştırılması
A Study on the effects of stemming and thesaurus for retrieving information in Turkish documents
- Tez No: 97873
- Danışmanlar: DOÇ. DR. HAYRİ SEVER
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Bilgi erişim sistemi, Performans, Türkçe, Information access system, Performance, Turkish
- Yıl: 2000
- Dil: Türkçe
- Üniversite: Hacettepe Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
IV ÖZET Bilgi Erişim Sistemleri (Information Retrieval Systems), çağımızda bilgi teknolojilerindeki hızlı gelişme ile beraber büyük miktardaki verilerin elektronik ortamlarda tutarlı ve güvenli bir şekilde saklanıp, gerektiğinde bu bilgilere kolay ve hızlı bir şekilde, otomatik olarak erişilmesi amacıyla geliştirilmiş sistemlerdir. Araştırmacıların hızla artan bilgi gereksinimlerini karşılamada kullanabilecekleri vazgeçilmez, belki de işlevi açısından biricik araç konumundadır. 60'h yıllardan başlayarak, bilgisayar teknolojisi ile birlikte bir gelişme süreci gösteren BES'lerinin Türkiye'ye yansıması süreklilik arzetmemiştir. Değişik zamanlarda, değişik araştırma grupları tarafından çeşitli çalışmalar yapılmışsa da, henüz Türkçe dokümanlar üzerinde işlem yapabilecek bir BES geliştirilmemiştir. Bu amaçla Hacettepe Üniversitesi bünyesinde 1997 yılında“Kaşgarh Mahmut Bilgi Geri-Getirim (KM-BGS)”projesi başlatılmıştır. KM-BGS genişletilmiş Boole modelinde çalışan, geribildirimli deneysel bir BES'dir. Proje kapsamında şu ana kadar, Türkçe gövdeleme algoritması gövdebul geliştirilmiş ve projeye temel olacak SMART BES'nin Türkçe yerelleştirilmesi yapılmıştır. Tez kapsamında, sistem için bir el kitabı (manual) hazırlanmış ve şu aşamada vektör uzayı modelinde olan KM-BGS'nin performans ölçümleri ve analizleri yapılmıştır. Bu amaçla daha sonraki çalışmalara kaynaklık edebilecek orta ölçekli bir belge koleksiyonu (benchmark) oluşturulmuştur. Performans ölçümleri, sisteme yerleştirilen Türkçe gövdeleme algoritmasının ve üretilen değişik boylardaki gömülerin erişim performansı üzerindeki etkilerinin araştırılması olmak üzere iki noktada olmuştur. Yapılan deneysel çalışmalar sonucunda, geliştirilen KM-BGS'nin Türkçe belgeler için kabul edilebilir bir erişim performansına sahip olduğu görülmüştür.
Özet (Çeviri)
V ABSTRACT Information Retrieval Systems are the kind of systems which have been developed in order to keep huge amount of data, which are a result of the rapid development in Information Technologies, in electronic media consistently and safely and to retrieve the data easily, rapidly and automatically when needed. These systems are indispensable and even unique in terms of their functions for researchers to meet their ever increasing information needs. Beginning from the sixties, the reflections of Information Retrieval Systems, which followed a parallel development process with computer technologies, on Turkey was not continual and stable. Even though at different times various studies were carried out by different research groups, an Information Retrieval System which is able to work on Turkish documents hasn't been developed yet. To this end, a project named“Kaşgarlı Mahmut Information Retrieval System (Kaşgarlı Mahmut Bilgi Geri Getirim Sistemi)”was started in 1997 under the frame of Hacettepe University. KM-BGS is an experimental Information Retrieval System which runs under Extended Boolean Model. So far Turkish stemming algoritm (gövdebul) has been developed within the frame of this project and Turkish localisation of SMART Information Retrieval System which is considered to be the basis of the project has been achieved. A (manual) handbook has been prepared within the frame of the thesis and performance measurements and analysis of KM-BGS which is yet in vector space model have been completed. To this end, a middle scaled benchmark of documents to be used as a resource for later studies has been formed. Performance measurements have been focused on two points: research on the Turkish stemming algoritm which was installed into the system and the effects of thesaurus which was produced at different wave lengths on retrieval performance. As a result of the completed experimental studies it was seen that KM-BGS has an acceptable retrieval performance for Turkish documents.
Benzer Tezler
- Gürbüz bilgi erişimi için seçkili gövdeleme
Selective stemming for robust information retrieval
GÖKHAN GÖKSEL
Doktora
Türkçe
2022
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolEskişehir Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. AHMET ARSLAN
PROF. DR. BEKİR TANER DİNÇER
- Türkçe'de hesaplamalı metin analizi
Computational text analysis in turkish
SENEM KUMOVA METİN
Doktora
Türkçe
2011
Bilim ve TeknolojiEge ÜniversitesiUluslararası Bilgisayar Ana Bilim Dalı (disiplinlerarası)
PROF. DR. BAHAR KARAOĞLAN
- Multiword expression detection using word vector representations
Sözcük temsilleri kullanarak çok sözcüklü ifade tespiti
TANSU TAŞÇIOĞLU
Yüksek Lisans
İngilizce
2019
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİzmir Ekonomi ÜniversitesiBilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı
DOÇ. DR. SENEM KUMOVA METİN
- Smart Bilgi Erişim Sistemi'nin Türkçe yerelleştirilmesi ve otomatik gömü üretimi
Turkish localization of Smart Information Retrieval System and automatic thesaurus construction
EBRU SEZER
Yüksek Lisans
Türkçe
1999
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolHacettepe ÜniversitesiBilgisayar Bilimleri Ana Bilim Dalı
DOÇ. DR. HAYRİ SEVER
- Türkçe için sözcük etiketleme ve cümle türü tespit yöntemi
A method for part of speech tagging and finding type of sentence in Turkish
TUĞBA YILMAZ
Yüksek Lisans
Türkçe
2017
Bilim ve TeknolojiEge ÜniversitesiUluslararası Bilgisayar Ana Bilim Dalı (disiplinlerarası)
PROF. DR. BAHAR KARAOĞLAN