Geri Dön

Makine çevirisi için tıbbi ingilizce – türkçe paralel derlem oluşturma

Building medical english–turkish parallel corpus for machine translation

  1. Tez No: 947994
  2. Yazar: ZELİHA DEMİRCAN
  3. Danışmanlar: DR. ÖĞR. ÜYESİ EMRE ŞATIR
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: Türkçe
  9. Üniversite: İzmir Katip Çelebi Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Yazılım Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Makine çevirisi, doğal dil işleme alanının en yaygın ve etkin kullanım alanlarından biri olarak çok dilli iletişimi ve bilgiye erişimi kolaylaştırmaktadır. Ancak tıbbi metinler gibi terminolojik yoğun ve bağlama duyarlı alanlarda genel amaçlı çeviri sistemlerinin başarısı sınırlı kalmaktadır. İngilizce – Türkçe dil çifti için tıbbi paralel derlem eksikliği, bu alandaki ilerlemeyi kısıtlayan önemli bir faktördür. Bu tez çalışmasının veri toplama aşamasında tıbbi alana özgü tez ve makale özet metinlerinden İngilizce – Türkçe metinler derlenmiştir. BERTalign aracıyla cümle hizalaması gerçekleştirilmiş ve oluşturulan derlem yapısal ve tematik açıdan detaylı olarak analiz edilmiştir. Terminolojik çeşitlilik, cümle uzunluğu ve Zipf yasasına uyum gibi istatistiksel göstergeler değerlendirilmiştir. Elde edilen derlem, SentencePiece alt birimleme (subword tokenization) modeli (SPM) ile işlenmiş ve Fairseq çerçevesi kullanılarak her iki çeviri yönünde (Türkçeden İngilizceye ve İngilizceden Türkçeye) Transformer tabanlı sinirsel makine çevirisi modelleri eğitilmiştir. Modellerin performansı, BLEU, chrF++, METEOR, COMET ve BERTScore gibi otomatik metriklerle ve uzman hekimlerin katkısıyla yapılan manuel değerlendirmelerle ölçülmüştür. Sonuçlar, tıbbi alana özgü verilerle eğitilen modellerin terminolojik doğruluk ve bağlam uyumu açısından genel amaçlı modellerden daha yüksek performans gösterdiğini ortaya koymuştur. Bu çalışma, İngilizce – Türkçe tıbbi makine çevirisi alanına açık erişimli yeni bir paralel derlem sunarak alan uyumlu model geliştirme çalışmalarını desteklemeyi amaçlamaktadır. Ayrıca, farklı eğitim ve test veri setlerinin model performansına etkisine ilişkin kapsamlı değerlendirme sonuçları sağlamaktadır.

Özet (Çeviri)

Machine translation is one of the most common and effective applications of natural language processing, facilitating multilingual communication and access to information. However, in terminologically dense and context-sensitive domains such as medical texts, the performance of general-purpose translation systems remains limited. The lack of a high-quality medical parallel corpus for the English–Turkish language pair is a key factor hindering progress in this field. In this thesis, English – Turkish texts were collected from medical thesis and article abstracts. Sentence alignment was performed using the BERTalign tool, and the resulting corpus was analyzed in detail in terms of its structural and thematic properties. Statistical indicators such as terminological diversity, sentence length, and compliance with Zipf's law were evaluated. Based on this corpus, Transformer-based neural machine translation models were trained for both Turkish-to-English and English-to-Turkish translation directions, using data processed with the SentencePiece subword tokenization model (SPM) within the Fairseq framework. The models' performance was evaluated using automatic metrics such as BLEU, chrF++, METEOR, COMET, and BERTScore, alongside manual assessments conducted with input from expert physicians. The results demonstrate that models trained on domain-specific data outperform general-purpose models in terms of terminological accuracy and contextual coherence. This study provides a new open-access parallel corpus for the field of English–Turkish medical machine translation, supporting domain-adapted model development efforts. Additionally, it offers comprehensive evaluation findings regarding the impact of different training and test datasets on model performance.

Benzer Tezler

  1. Diesel motorları yakıt püskürtme sistemlerinin dinamik simülasyonu

    Başlık çevirisi yok

    İRFAN KARAGÖZ

    Yüksek Lisans

    Türkçe

    Türkçe

    1986

    Makine MühendisliğiUludağ Üniversitesi

    Makine Mühendisliği Ana Bilim Dalı

    PROF. DR. OĞUZ BORAT

  2. Kuyruk modelleri ve analizi üzerine bir uygulama

    Başlık çevirisi yok

    DİDEM ÖZPULAT

    Yüksek Lisans

    Türkçe

    Türkçe

    1985

    İstatistikEge Üniversitesi

    Bilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı

    DOÇ. DR. FİKRET İKİZ

  3. Yenileme yatırımları

    Başlık çevirisi yok

    OSMAN NURİ FİLİZ

    Yüksek Lisans

    Türkçe

    Türkçe

    1986

    İşletmeGazi Üniversitesi

    Endüstri Mühendisliği Ana Bilim Dalı

    DOÇ. DR. OSMAN OKKA

  4. Çeltik kabuklarının yalıtım malzemesi olarak kullanılması

    Başlık çevirisi yok

    B.CİHAN ÇELEBİ

    Yüksek Lisans

    Türkçe

    Türkçe

    1986

    Makine MühendisliğiUludağ Üniversitesi

    Makine Mühendisliği Ana Bilim Dalı

    DOÇ. DR. MEHMET KIRBIYIK

  5. Hızlı katılaşma ile yüksek mukavemetli malzemelerin üretilmesi ve kurşun-asit akümalatörlerine uygulanması

    Başlık çevirisi yok

    ÜMİT AKÇAL

    Yüksek Lisans

    Türkçe

    Türkçe

    1986

    Makine MühendisliğiUludağ Üniversitesi

    Makine Mühendisliği Ana Bilim Dalı

    DOÇ. DR. HALİM DEMİRCİ