Türkçe'nin biçimbilim yapısına dayalı bir metin sıkıştırma sistemi
A document compression system based on the morphology of the Turkish language
- Tez No: 84981
- Danışmanlar: PROF. DR. M. YAHYA KARSLIGİL
- Tez Türü: Doktora
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Veri sıkıştırma, Huffman kodlaması, Zipf kanunu, Türkçe'nin biçimbilimsel analizi, Türkçe XII, Hoffman kodlama, Morfoloji, Türkçe, Data compression, Huffman coding, Zipf law, The morphology of the Turkish Language, Turkish X11J, Hoffman coding, Morphology, Turkish
- Yıl: 1999
- Dil: Türkçe
- Üniversite: Yıldız Teknik Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Bilimleri Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
ÖZET Bu doktora çalışmasında veri sıkıştırma konusunda yapılan diğer çalışmalardan farklı olarak, Türkçe metinlerin biçimbilimsel (morfolojik) olarak incelenmesi yapılmış ve bu inceleme sonucunda elde edilen gövde-kök, hece ve eklere ait istatistiksel verilere göre, yeni bir veri sıkıştırma yöntemi geliştirilmiştir. Sistemin başarımı ve çalışması değişik Türkçe metinlere uygulanarak değerlendirilmiştir. Geliştirilen sistemin en önemli özelliği, var olan sıkıştırma yöntemlerinden farklı olarak, sıkıştırılacak veriyi ikili bilgi yapısında değil, Türkçe dilinin yapısına uygun şekilde hece, gövde-kök ve eklerine ayırarak değerlendirmesidir. Geliştirilen bu sıkıştırma yönteminde Huffman kodlama ağacı temel alınıp ilk olarak kelimenin heceleri, ikinci olarak kelimenin kök ve ekleri, son olarak da kelimenin alınabilen en uzun ilk hecesi ve ekleri için üç ayrı statik şablon oluşturulup, Türkçe bir metnin kayıpsız geri dönüşümü sağlanmıştır. Sıkıştırma verimindeki başarıyı daha da arttırmak amacıyla kelimenin gövde-kök ve ekleri için iki ayrı sözlük kullanarak dinamik Huffman kodlaması gerçekleştirilmiştir. Ayrıca kod çözme işleminde ihtiyaç duyulan Huffman ağaç yapısına ait bilginin, sıkıştırılan metnin önüne konan başlık (header) alanında tuttuğu yer, bu doktora çalışması kapsamında geliştirilen bir yöntem ile n elemanlı bir Huffman ağacının (2n-2) adet bit ile ifade edilmesi sağlanmış olup, sıkıştırma veriminde %1.5'luk bir artış elde edilmiştir. Veri sıkıştırma tekniklerinin test edilmesinde kullanılan Galgary Corpus ve Catenbury Corpus'a uygun olarak 1 4 adet Türkçe metinden oluşan bir test kümesi oluşturulmuş ve sistem başarımı bu test kümesi üzerinde incelenerek değerlendirilmiştir. Türkçe metinler üzerinde yapılan analiz sonucunda, Türkçe bir metin içerisinde geçen kelime kullanım sıklıklarının Zipf kanununa uyum gösterdiği de belirlenmiş ve kullanım sıklıklarına göre matematiksel bir model kurulmuştur.
Özet (Çeviri)
ABSTRACT In this thesis, a new approach for the compression of turkish documents is proposed. In contrast to common data-compression methods, this approach determines the frequency of root, stem,syllables and suffixes in a document through a morphological analysis and uses this output in the generation of dynamic Huffman codes. The evaluation of the proposed approach has been accomplished by implementing the system on several different turkish documents. The proposed approach distinguishes itself from common place algorithms by the fact that the document to the compressed is evaluated in accordance to the turkish language and rather than as plain binary data hence broken into its roots, stems, suffixes and syllables. Since text compression and decompression requires lossless operation, the proposed method expresses the roots, stems and suffices using Huffman trees to maximize the ratio of coded information to the number of required bits. The header part which carries information to be used during decompression has been optimized by the proposal of a new coding method to describe a Huffman tree which resulted in approximately %1.5 gain in overall compression performance. The proposed coding expresses a Huffman tree with (n) elements in (2n-2) bits and thus reduces the header size clearly. A corpus consisting of 14 turkish documents similar to Galgary Corpus and Catenbury Corpus has been formed and the systems overall performance has been evaluated on this corpus. Through analysis on turkish documents it has been observed that the frequency distribution of words in a turkish document conforms to the Zipf s law which helps the development of the implemented mathematical model.
Benzer Tezler
- Çeviri dersinde yapılaşma (uygulama sorunları-yöntem önerileri)
Strukturierung im übersetzungsunterricht (probleme der praxis-vorschlage zur methodik)
A. TURGAY KURULTAY
Doktora
Türkçe
1989
Eğitim ve Öğretimİstanbul ÜniversitesiAlman Dili ve Edebiyatı Bilim Dalı
PROF.DR. ŞARA SAYIN
- Mimarlıkta yapı ve yapım teknolojileri (MYYT) eğitimine yönelik bir yaklaşım ve eğitim materyali önerisi: Detayın üretici dönüşümsel dilbilgisi
Proposal for an approach and instructional material for the education of construction technologies in architecture (CTA): Transformational generative grammar of detail
HÜLYA NUR KIZILYAPRAK
Doktora
Türkçe
2020
Mimarlıkİstanbul Teknik ÜniversitesiMimarlık Ana Bilim Dalı
DR. ÖĞR. ÜYESİ MEHMET CEM ALTUN
- Tommaso Campanella ve Thomas More`un ütopyalarının karşılaştırılması
Comparing Thomas More and Tommaso Campanella`s utopias
MAHMUT AVCI
Yüksek Lisans
Türkçe
2006
FelsefeAtatürk ÜniversitesiFelsefe ve Din Bilimleri Ana Bilim Dalı
YRD. DOÇ. DR. OSMAN ELMALI
- Aspect verbal en grec Istanbouliote: modele de description fonctionnaliste
Başlık çevirisi yok
EMİNE YAVAŞGEL
Yüksek Lisans
Fransızca
1993
Dilbilimİstanbul ÜniversitesiYabancı Diller Eğitimi Ana Bilim Dalı
PROF. DR. NÜKHET GÜZ
- Ovulasyon indüksiyonu tedavisinde folliküler gelişimin ultrasonografik takibi
Başlık çevirisi yok
MERİH BAYRAM
Tıpta Uzmanlık
Türkçe
1987
Kadın Hastalıkları ve DoğumGazi ÜniversitesiKadın Hastalıkları ve Doğum Ana Bilim Dalı
DOÇ. DR. MÜLAZIM YILDIRIM