Geri Dön

TR-MTEB: A comprehensive benchmark and embedding model suite for Turkish sentence representations

TR-MTEB: Türkçe cümle temsilleri için kapsamlı bir değerlendirme seti ve vektörel temsil model paketi

  1. Tez No: 990548
  2. Yazar: MEHMET SELMAN BAYSAN
  3. Danışmanlar: PROF. DR. TUNGA GÜNGÖR
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: Boğaziçi Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu çalışmada, Türkçe cümle temsil modellerini değerlendirmek üzere tasarlanmış, görev çeşitliliği yüksek ilk büyük ölçekli ölçüt seti olan TR-MTEB geliştirilmiştir. Sınıflandırma, kümeleme, ikili sınıflandırma, bilgi getirme, iki dilli metin eşleştirme ve anlamsal metin benzerliği olmak üzere altı temel görevi kapsayan TR-MTEB, hem özgün Türkçe veri kümelerini hem de özenle seçilmiş makine çevirisi kaynaklarını içeren toplam 26 yüksek kaliteli veri kümesini bir araya getirmektedir. Model geliştirmeyi desteklemek amacıyla, 50'nin üzerinde açık veri kümesinden türetilmiş ve anlamsal uyumu sağlamak için çok aşamalı filtreleme uygulanmış 34,2 milyon cümle çiftinden oluşan bir Türkçe cümle korpusu oluşturulmuştur.Bu derlem kullanılarak, \texttt{BERTurk} tabanlı iki tek dilli Türkçe cümle temsil modeli eğitilmiştir: biri Cached-MNRL yöntemiyle karşıtlık temelli ön eğitim ile hazırlanmış, diğeri ise TR-MTEB görevleri üzerinde ince ayar yapılmış bir modeldir. Bu modeller, çok dilli karşılaştırmalı modellerden çok daha az veri ve hesaplama kaynağıyla eğitilmelerine rağmen, tüm görevlerde Türkçe BERT tabanlı modeli geride bırakmış; özellikle sınıflandırma ve benzerlik görevlerinde benzer performans sergilemiş, ancak çapraz dilli hizalama konusunda mevcut sınırlamaları da ortaya koymuştur. Tüm veri kümeleri, modeller ve kodlar açık olarak paylaşılmış olup, Türkçe doğal dil işleme ve düşük kaynaklı dil temsilleri alanında yeniden üretilebilirliği ve ileri araştırmaları teşvik etmeyi amaçlamaktadır.

Özet (Çeviri)

We introduce TR-MTEB, the first large-scale, task-diverse benchmark designed to evaluate sentence embedding models for Turkish. Covering six core tasks as classification, clustering, pair classification, retrieval, bitext mining, and semantic textual similarity, TR-MTEB integrates 26 high-quality datasets, including both native Turkish corpora and carefully curated machine-translated resources. To support embedding model development, we construct a 34.2 million pair Turkish sentence corpus derived from over 50 public datasets, applying multi-stage filtering to ensure semantic alignment. Using this corpus, we train two monolingual Turkish sentence embedding models from a \texttt{BERTurk} backbone: one with contrastive pretraining using Cached-MNRL and one further fine-tuned on TR-MTEB tasks. Despite being trained with significantly less data and computation resources than their multilingual counterparts, our models outperform the Turkish BERT baseline across all tasks and achieve competitive performance in classification and similarity, while highlighting limitations in cross-lingual alignment. All datasets, models, and code are publicly released to promote reproducibility and further research in Turkish natural language processing and low-resource sentence representation.

Benzer Tezler

  1. Tokenizasyon, veri kalitesi ve alan uyarlaması ekseninde Türkçe dil modellerinin geliştirilmesi ve değerlendirilmesi

    Developing and evaluating Turkish language models within a tokenization, data quality, and domain adaptation framework

    MEHMET ALİ BAYRAM

    Doktora

    Türkçe

    Türkçe

    2026

    DilbilimYıldız Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. BANU DİRİ

    DOÇ. DR. SAVAŞ YILDIRIM

  2. The Level-1 probabilistic safety assessment application of TR-2

    TR-2 1.düzeyden olasılıksal güvenlik analizi uygulaması

    BÜLENT ALPAY

    Yüksek Lisans

    İngilizce

    İngilizce

    2000

    Nükleer MühendislikBoğaziçi Üniversitesi

    Nükleer Mühendislik Ana Bilim Dalı

    PROF. DR. FAHİR BORAK

    PROF. DR. VURAL ALTIN

  3. TR-2 araştırma reaktörünün mevcut ışınlanmış yakıt elemanlarının sızdırmazlık testi

    Sipping tests for the irradiated nuclear fuel elements of TR-2 research reactor

    ÖZGÜR AYTAN

    Yüksek Lisans

    Türkçe

    Türkçe

    2010

    Fizik ve Fizik MühendisliğiMuğla Üniversitesi

    Fizik Ana Bilim Dalı

    DOÇ. DR. TAYFUN BÜKE

  4. TR ALL-2000 protokolü ile tedavi edilen akut lenfoblastik lösemi vakalarının değerlendirilmesi

    Evaluation of cases with acute lymphoblastic leukemia treated with TR ALL-2000 protocol

    TAYLAN ÇELİK

    Tıpta Uzmanlık

    Türkçe

    Türkçe

    2012

    Çocuk Sağlığı ve HastalıklarıTrakya Üniversitesi

    Çocuk Sağlığı ve Hastalıkları Ana Bilim Dalı

    PROF. DR. BETÜL BİNER ORHANER