Geri Dön

Natural language processings in legal domain: Classification of Turkish legal texts

Hukuk alanında doğal dil işleme: Türkçe hukuki metinlerin sınıflandırılması

  1. Tez No: 825257
  2. Yazar: ONUR AKÇA
  3. Danışmanlar: DOÇ. DR. MURAT CAN GANİZ
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2023
  8. Dil: İngilizce
  9. Üniversite: Marmara Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Yüksek mahkeme kararları gibi hukuki belgeler, teknik kelimelerin yoğun kullanımı nedeniyle karmaşıktır. Genellikle çok uzun ve karmaşık cümlelerden oluşurlar. Bu durum, dilin yüksek morfolojik ve eklemeli yapısı nedeniyle özellikle Türkçe hukuki belgelerde daha belirgindir. Bu zorluklar ve büyük kıyaslama veri kümelerinin eksikliği nedeniyle, Türkçe hukuk metinlerinde yapay zeka kullanımı üzerine sadece birkaç Doğal Dil İşleme (DDİ) çalışması yapılmıştır. Bu çalışmada, yaklaşık 10 GB'lık hukuk metinlerinden oluşan büyük bir denetimsiz veri kümesi kullandık ve benzersiz 56 suç etiketine sahip yaklaşık 90 bin yüksek mahkeme kararından oluşan bir denetimli veri kümesi derledik. Temel amacımız, etki alanı uyarlamasının, yani büyük bir dil modeli olan BERT'in etki alanına özgü bir derlem kullanılarak ince ayarının sınıflandırma performansını nasıl etkilediğini görmektir. Çeşitli sınıflandırıcılarla kapsamlı tek etiketli ve çok etiketli sınıflandırma deneyleri gerçekleştiriyoruz. Beklendiği gibi, BERT modelleri diğer sınıflandırıcılardan büyük bir farkla daha iyi performans gösteriyor. Daha da önemlisi, etki alanı uyarlamasının F1 puanında yaklaşık %2 artışa yol açtığını gösteriyoruz. Çalışmamız, hukuk alanında DDİ üzerine giderek artan araştırmalara katkıda bulunmakta ve alana özgü dil modellerinin potansiyelini vurgulamaktadır.

Özet (Çeviri)

Legal documents such as higher court decisions are complicated due to the intensive use of technical vocabulary. They are usually composed of very long and complex sentences. This is especially visible in Turkish legal documents due to the highly morphological and agglutinative nature of the language. Due to these difficulties and the lack of large benchmark datasets, there have been only a few Natural Language Processing (NLP) studies on artificial intelligence use in Turkish legal texts. In this research, we utilize a large unsupervised dataset of about 10 GBs of legal texts and compile a supervised dataset of about 90 thousand higher court decisions having unique 56 crime labels. Our main aim is the see how domain adaptation, i.e. continued pre-training of BERT, a large language model, by employing a domain-specific corpus affects the classification performance. We conduct extensive multi-class and multilabel classification experiments with a range of classifiers. As expected, BERT models outperform other classifiers by a wide margin. More importantly, we show that domain adaptation leads to about a 2% increase in F1 score. Our study contributes to the expanding corpus of studies on NLP in the legal domain and highlights the potential of domain-specific language models.

Benzer Tezler

  1. Yapay zekâ tekniklerinin hukuk alanında uygulanması

    Application of artificial intelligence techniques in the field of law

    MUSTAFA EMİRKAN OKURSOY

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Endüstri ve Endüstri MühendisliğiBursa Uludağ Üniversitesi

    Endüstri Mühendisliği Ana Bilim Dalı

    PROF. DR. TÜLİN İNKAYA

    DR. ÖĞR. ÜYESİ EMİNE GÖKÇE KARABEL

  2. Construction dispute resolution in the age of AI: Bridging the gap between engineering reality and legal doctrine in Türki̇ye

    Yapay zeka çağında inşaat uyuşmazlıklarının çözümü: Türkiye'de mühendislik gerçekliği ile hukuk doktrini arasındaki boşluğun köprülenmesi

    HASAN EFEKAN BİLEN

    Yüksek Lisans

    İngilizce

    İngilizce

    2026

    İnşaat Mühendisliğiİstanbul Teknik Üniversitesi

    İnşaat Mühendisliği Ana Bilim Dalı

    DOÇ. DR. ONUR BEHZAT TOKDEMİR

  3. LoRA adaptörlerinin aritmetik birleşimi yoluyla düşük kaynaklı dillerde parametre verimli diller arası hukuki metin sınıflandırması

    Enhancing parameter efficient cross lingual legal text classification in low resource languages via arithmetic module composition of LoRA adapters

    BERKE ÇELTİKCİ

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolYıldız Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. OĞUZ ALTUN

  4. A large language model (LLM)-based framework for bid/no-bid decision support in construction public procurement: Validated on romanian tenders

    İnşaat kamu ihalelerinde teklif verme / vermeme karar desteği için büyük dil modeli (LLM) tabanlı bir çerçeve: Romanya ihaleleri üzerinde doğrulama

    ELİF GÜLİN PETEK

    Yüksek Lisans

    İngilizce

    İngilizce

    2026

    İnşaat Mühendisliğiİstanbul Teknik Üniversitesi

    İnşaat Mühendisliği Ana Bilim Dalı

    DOÇ. DR. ONUR BEHZAT TOKDEMİR

  5. Avrupa insan hakları mahkemesi yargı kararlarının tahmin edilmesi

    Predicting the judgments of the european court of human rights

    NAGİHAN ÜNAL

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGazi Üniversitesi

    Adli Bilişim Ana Bilim Dalı

    DOÇ. DR. OKTAY YILDIZ