TR-MTEB: A comprehensive benchmark and embedding model suite for Turkish sentence representations
TR-MTEB: Türkçe cümle temsilleri için kapsamlı bir değerlendirme seti ve vektörel temsil model paketi
- Tez No: 990548
- Danışmanlar: PROF. DR. TUNGA GÜNGÖR
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Boğaziçi Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu çalışmada, Türkçe cümle temsil modellerini değerlendirmek üzere tasarlanmış, görev çeşitliliği yüksek ilk büyük ölçekli ölçüt seti olan TR-MTEB geliştirilmiştir. Sınıflandırma, kümeleme, ikili sınıflandırma, bilgi getirme, iki dilli metin eşleştirme ve anlamsal metin benzerliği olmak üzere altı temel görevi kapsayan TR-MTEB, hem özgün Türkçe veri kümelerini hem de özenle seçilmiş makine çevirisi kaynaklarını içeren toplam 26 yüksek kaliteli veri kümesini bir araya getirmektedir. Model geliştirmeyi desteklemek amacıyla, 50'nin üzerinde açık veri kümesinden türetilmiş ve anlamsal uyumu sağlamak için çok aşamalı filtreleme uygulanmış 34,2 milyon cümle çiftinden oluşan bir Türkçe cümle korpusu oluşturulmuştur.Bu derlem kullanılarak, \texttt{BERTurk} tabanlı iki tek dilli Türkçe cümle temsil modeli eğitilmiştir: biri Cached-MNRL yöntemiyle karşıtlık temelli ön eğitim ile hazırlanmış, diğeri ise TR-MTEB görevleri üzerinde ince ayar yapılmış bir modeldir. Bu modeller, çok dilli karşılaştırmalı modellerden çok daha az veri ve hesaplama kaynağıyla eğitilmelerine rağmen, tüm görevlerde Türkçe BERT tabanlı modeli geride bırakmış; özellikle sınıflandırma ve benzerlik görevlerinde benzer performans sergilemiş, ancak çapraz dilli hizalama konusunda mevcut sınırlamaları da ortaya koymuştur. Tüm veri kümeleri, modeller ve kodlar açık olarak paylaşılmış olup, Türkçe doğal dil işleme ve düşük kaynaklı dil temsilleri alanında yeniden üretilebilirliği ve ileri araştırmaları teşvik etmeyi amaçlamaktadır.
Özet (Çeviri)
We introduce TR-MTEB, the first large-scale, task-diverse benchmark designed to evaluate sentence embedding models for Turkish. Covering six core tasks as classification, clustering, pair classification, retrieval, bitext mining, and semantic textual similarity, TR-MTEB integrates 26 high-quality datasets, including both native Turkish corpora and carefully curated machine-translated resources. To support embedding model development, we construct a 34.2 million pair Turkish sentence corpus derived from over 50 public datasets, applying multi-stage filtering to ensure semantic alignment. Using this corpus, we train two monolingual Turkish sentence embedding models from a \texttt{BERTurk} backbone: one with contrastive pretraining using Cached-MNRL and one further fine-tuned on TR-MTEB tasks. Despite being trained with significantly less data and computation resources than their multilingual counterparts, our models outperform the Turkish BERT baseline across all tasks and achieve competitive performance in classification and similarity, while highlighting limitations in cross-lingual alignment. All datasets, models, and code are publicly released to promote reproducibility and further research in Turkish natural language processing and low-resource sentence representation.
Benzer Tezler
- Tokenizasyon, veri kalitesi ve alan uyarlaması ekseninde Türkçe dil modellerinin geliştirilmesi ve değerlendirilmesi
Developing and evaluating Turkish language models within a tokenization, data quality, and domain adaptation framework
MEHMET ALİ BAYRAM
Doktora
Türkçe
2026
DilbilimYıldız Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. BANU DİRİ
DOÇ. DR. SAVAŞ YILDIRIM
- TR-2 reaktöründe kontrol çubuğu kalibrasyonunun karşılaştırılmalı incelenmesi
Başlık çevirisi yok
GÜLFEM BAHÇECİ
- The Level-1 probabilistic safety assessment application of TR-2
TR-2 1.düzeyden olasılıksal güvenlik analizi uygulaması
BÜLENT ALPAY
Yüksek Lisans
İngilizce
2000
Nükleer MühendislikBoğaziçi ÜniversitesiNükleer Mühendislik Ana Bilim Dalı
PROF. DR. FAHİR BORAK
PROF. DR. VURAL ALTIN
- TR-2 araştırma reaktörünün mevcut ışınlanmış yakıt elemanlarının sızdırmazlık testi
Sipping tests for the irradiated nuclear fuel elements of TR-2 research reactor
ÖZGÜR AYTAN
Yüksek Lisans
Türkçe
2010
Fizik ve Fizik MühendisliğiMuğla ÜniversitesiFizik Ana Bilim Dalı
DOÇ. DR. TAYFUN BÜKE
- TR ALL-2000 protokolü ile tedavi edilen akut lenfoblastik lösemi vakalarının değerlendirilmesi
Evaluation of cases with acute lymphoblastic leukemia treated with TR ALL-2000 protocol
TAYLAN ÇELİK
Tıpta Uzmanlık
Türkçe
2012
Çocuk Sağlığı ve HastalıklarıTrakya ÜniversitesiÇocuk Sağlığı ve Hastalıkları Ana Bilim Dalı
PROF. DR. BETÜL BİNER ORHANER