Turkısh legal NLP: a comprehensıve aı framework for legal document understandıng, summarızatıon, and retrıeval-augmented generatıon
Türkçe hukuk NLP: hukuki metin anlama, özetleme ve erişim destekli üretim için kapsamlı yapay zekâ yaklaşımı
- Tez No: 972182
- Danışmanlar: PROF. DR. CEYLAN YOZGATLIGİL
- Tez Türü: Yüksek Lisans
- Konular: İstatistik, Statistics
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Orta Doğu Teknik Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: İstatistik Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Doğal Dil İşleme yöntemleri birçok alanda yaygın olarak kullanılmasına rağmen, özellikle Türkçe hukuk metinleri bu kapsamda görece az araştırılmış durumdadır. Türkçe hukuk dilinin karmaşık yapısı ve zengin içeriği, yapay zekâ (YZ) sistemleri için değerli fakat zorlu bir kaynak haline getirmektedir. Bu tez, Türkçe hukuk metinlerini anlama, özetleme ve değerlendirme amacıyla tasarlanmış uçtan uca bir YZ tabanlı yaklaşım sunmaktadır. Çalışma kapsamında, Yargıtay, Danıştay, Anayasa Mahkemesi, UYAP, mevzuat bültenleri ve bakanlık kararlarından toplanan 23.035 yargı kararı ve 9.277 mevzuat ve düzenleyici belge içeren geniş ölçekli bir veri kümesi oluşturulmuştur. Bu metinler temizlenmiş, normalleştirilmiş ve Türkçe hukuk alanına yönelik kıyaslama veri kümeleri oluşturmak üzere yapılandırılmıştır. Ayrıntılı bir tokenizasyon analizi gerçekleştirilmiş ve karakter tabanlı, kelime tabanlı ve hukuk-farkındalıklı yaklaşımlar arasında verimlilik ile anlamsal temsiliyet arasındaki denge ortaya konmuştur. Gömme yöntemleri sistematik olarak karşılaştırılmış ve bulgular, genel olarak üstün bir tekniğin bulunmadığını; aksine yöntemlerin etkinliğinin, hukuki metin kategorisine ve ilgili alt göreve bağlı olarak değiştiğini göstermiştir. Bunlara ek olarak, Türkçe hukuk dilinin yapısal özelliklerine özel olarak tasarlanmış yeni bir özetleme algoritması geliştirilmiştir. Bu algoritma, geleneksel taban çizgisi yöntemlerini aşarak daha yüksek düzeyde ilgililik, tutarlılık ve hukuki kapsayıcılık sağlamıştır. Son olarak, hukuk alanında en iyi performansı veren yoğun erişim ve üretim modellerini birleştirerek bir Erişim Destekli Üretim (RAG) sistemi inşa edilmiştir. Bu sistem, olgular ve atıflar konusunda yüksek doğruluk ve güvenilirlik sağlayarak yalnızca avukatlara değil, aynı zamanda vatandaşlara da araştırma yapma, karar verme ve hukuki bilgiye erişim süreçlerinde yardımcı olabileceğini göstermiştir.
Özet (Çeviri)
Natural Language Processing (NLP) has been widely used across various domains; however, legal texts especially particularly in Turkish remain relatively underexplored. The complexity and richness of the Turkish legal language make it a valuable yet challenging source for artificial intelligence (AI) systems. This thesis presents an end-to-end AI-based framework designed to understand, summarize, and evaluate Turkish legal texts. A large-scale dataset was compiled, consisting of 23,035 judicial decisions and 9,277 legislative and regulatory documents collected from Yargıtay, Danıştay, the Constitutional Court, UYAP, legislative bulletins, and ministry decisions. These texts are cleaned, normalized, and structured to create benchmark datasets for legal NLP in Turkish. A detailed tokenization analysis was conducted, highlighting the trade-offs between efficiency and semantic representation across character-level, word-based, and legal- aware approaches. Embedding methods were systematically compared, and findings indicated that no single technique universally dominates; instead, their effectiveness varies depending on the legal text category and downstream task. Additionally, a new summarization algorithm was created that was specifically designed for the structural features of Turkish legal language. It beat traditional baselines by being more relevant, coherent, and legally comprehensive. Finally, a Retrieval-Augmented Generation (RAG) system was built by combining dense retrieval and generation models that work best in the legal field. This system showed that it could help lawyers and citizens with research, making decisions, and accessing legal information by being very accurate and reliable when it came to facts and citations.
Benzer Tezler
- Corporate compliance enhanced by artificial intelligence
Yapay zeka ile güçlendirilmiş kurumsal compliance
İREM SERRA SEÇER
Yüksek Lisans
İngilizce
2025
Hukukİstanbul Medeniyet ÜniversitesiÖzel Hukuk Ana Bilim Dalı
DR. ÖĞR. ÜYESİ MELTEM KARATEPE KAYA
- Experimenting dense passage retrieval for turkish legal texts
Türkçe hukuki metinlerde yoğun paragraf getirimi üzerine deneysel çalışmalar
YAĞMUR TİRYAKİ ONAY
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. FEHİME NİHAN ÇİÇEKLİ
- Improving the performance of NLP tasks in legal tech
Hukuk teknolojisinde NLP görevlerinin performansının iyileştirilmesi
FARNAZ ZEIDI
Doktora
İngilizce
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul ÜniversitesiEnformatik Ana Bilim Dalı
DOÇ. DR. ÇİĞDEM EROL
PROF. DR. MEHMET FATİH AMASYALI
- Türkiye ve Azerbaycan hukukunda yabancı çalışanların çalışma hakkı ve izinleri
Work rights and permits of foreign employees in Turkish and Azerbaijani law
SHOLA SHAHBAZOVA
Yüksek Lisans
Türkçe
2025
Çalışma Ekonomisi ve Endüstri İlişkileriDokuz Eylül ÜniversitesiÇalışma Ekonomisi ve Endüstri İlişkileri Ana Bilim Dalı
PROF. DR. HAKAN KESER
- Natural language processings in legal domain: Classification of Turkish legal texts
Hukuk alanında doğal dil işleme: Türkçe hukuki metinlerin sınıflandırılması
ONUR AKÇA
Yüksek Lisans
İngilizce
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolMarmara ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. MURAT CAN GANİZ