Geri Dön

Adapting knowledge graphs for large language model-based medical record DE-identification

Büyük dil modeli tabanlı tıbbi kayıt kimliksizleştirme için bilgi çizgelerinin uyarlanması

  1. Tez No: 991172
  2. Yazar: ABDUL MOEED
  3. Danışmanlar: DR. ÖĞR. ÜYESİ EMRAH İNAN
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: İzmir Yüksek Teknoloji Enstitüsü
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Dijital tıbbi kayıtların artan yaygınlığı, hasta gizliliğini sağlamak için güçlü kimliksizleştirme tekniklerine duyulan ihtiyacın arttığını göstermektedir. Kimliksizleştirme, kayıtlar içinde bireylerin kimliğinin tespit edilmesi engellemek için kişisel bilgilerin çıkarılması içermektedir. Metin kimliksizleştirme, bir kişinin kimliğini tespit edebilecek bilgilerin kaldırılması veya maskelenmesi sürecini ifade etmektedir. Bu tür hassas bilgilerin özel veritabanlarından çıkarılması, çevrimiçi üretken yapay zeka modellerine hassas bilgilerin aktarılmasına yol açabilmektedir. Bu çalışma, bilgi çizgeleriyle geliştirilen büyük dil modellerinin, özellikle kişilerin, organizasyonların ve yerlerin isimlerini tanımlamak ve anonimleştirmek için adlandırılmış varlık tanıma üzerine odaklanarak tıbbi kayıtları kimliksizleştirme potansiyelini incelemektedir. Bu yaklaşımda, DBpedia bilgi çizgesi, aday kurgusal karakter isimleri, hastane isimleri ve ilgili şehir ve ülke bilgilerini çıkararak, kimliksizleştirme için adaylar listesi oluşturmaktadır. Bu listeler daha sonra yaygın olarak kullanılan bir tıbbi veri kümesine kimliksizleştirme işlemi olarak dönüştürmek için uygulanmaktadır. Deneysel sonuçlar, belirli bir varlık türü şeması üzerine ince ayar yapılmış dil modellerinin, farklı varlık türü şemalarına sahip veri kümeleri için uygun olmadığını göstermektedir. Ayrıca, bu modeller, eğitim verilerini belirli bir sabit etiket şemasına göre etiketlemek için önemli miktarda insan gücü gerektirmektedir. Bu zorlukları aşmak için, bu tez, tıbbi metin anonimleştirme için halk tarafından erişilebilir bir veri kümesi sunmaktadır. Ayrıca, tıbbi kimliksizleştirme görevine uyarlamak için bir varlık aday çıkarıcı ve bir varlık türü tahmin edici içeren iki aşamalı bir metodoloji uygulanmaktadır. Sonuç olarak, iki aşamalı yaklaşımımızın, en ileri düzeyde denetimli öğrenme yöntemleriyle karşılaştırılabilir sonuçlar sunduğunu göstermektedir. göstermektedir.

Özet (Çeviri)

The increasing use of digital medical records underscores the growing demand for effective de-identification methods to protect patient privacy. De-identification involves the removal of personal details to prevent the identification of individuals within these records. Text de-identification refers to the process of eliminating or concealing information that could identify a person. Extracting such sensitive data from private datasets may lead to its exposure to online generative artificial intelligence models. This study explores the potential of large language models, enhanced with knowledge graphs, for de-identifying medical records, focusing particularly on named entity recognition for identifying and anonymising names of people, organisations, and locations. In this approach, DBpedia is used as the knowledge graph to extract possible fictional character names, hospital names, and relevant city and country information, creating a list of candidates for de-identification. These lists are then applied to transform a widely used medical dataset into a de-identification task. The results of the experiments indicate that fine-tuned language models, trained on a specific entity-type schema, are not suited for datasets with different schemas. Moreover, these models require significant human effort to annotate training data according to a fixed tagging schema. To address these challenges, this thesis proposes a publicly available dataset for medical text de-identification. Additionally, a two-stage methodology is applied, involving an entity candidate extractor and an entity type predictor, to adapt two open-source language models for the medical de-identification task. In conclusion, our two-stage approach yields result comparable to state-of-the-art supervised learning methods.

Benzer Tezler

  1. The significance and the contribution of 6+1 traits of writing to the success of the students in writing courses in English language teaching

    Yazmanın 6+1 özelliğinin İngilizce öğretiminde yazılı anlatım derslerindeki öğrenci başarısına katkısı ve önemi

    ÖZLEM YAZAR

    Yüksek Lisans

    İngilizce

    İngilizce

    2004

    Eğitim ve ÖğretimGazi Üniversitesi

    İngiliz Dili Eğitimi Ana Bilim Dalı

    YRD. DOÇ. DR. PAŞA TEVFİK CEPHE

  2. Hybridization of probabilistic graphical models and metaheuristics for handling dynamism and uncertainty

    Değişimin ve belirsizliğin ele alınması için olasılıksal çizgesel biçelerin ve sezgi-üstlerinin melezleştirilmesi

    GÖNÜL ULUDAĞ

    Doktora

    İngilizce

    İngilizce

    2021

    Nörolojiİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. AYŞE ŞİMA UYAR

  3. Yapay zeka ve uygulamaları

    Artificial intelligence and its applications

    A.SEMİH ÖZKUL

  4. Uyum gösteren cepheler: Bir meta analizi

    Adaptive facades: A meta analysis

    SELİN KARAAĞAÇ

    Yüksek Lisans

    Türkçe

    Türkçe

    2020

    Mimarlıkİstanbul Teknik Üniversitesi

    Mimarlık Ana Bilim Dalı

    DOÇ. DR. İKBAL ÇETİNER