Adapting knowledge graphs for large language model-based medical record DE-identification
Büyük dil modeli tabanlı tıbbi kayıt kimliksizleştirme için bilgi çizgelerinin uyarlanması
- Tez No: 991172
- Danışmanlar: DR. ÖĞR. ÜYESİ EMRAH İNAN
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: İzmir Yüksek Teknoloji Enstitüsü
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Dijital tıbbi kayıtların artan yaygınlığı, hasta gizliliğini sağlamak için güçlü kimliksizleştirme tekniklerine duyulan ihtiyacın arttığını göstermektedir. Kimliksizleştirme, kayıtlar içinde bireylerin kimliğinin tespit edilmesi engellemek için kişisel bilgilerin çıkarılması içermektedir. Metin kimliksizleştirme, bir kişinin kimliğini tespit edebilecek bilgilerin kaldırılması veya maskelenmesi sürecini ifade etmektedir. Bu tür hassas bilgilerin özel veritabanlarından çıkarılması, çevrimiçi üretken yapay zeka modellerine hassas bilgilerin aktarılmasına yol açabilmektedir. Bu çalışma, bilgi çizgeleriyle geliştirilen büyük dil modellerinin, özellikle kişilerin, organizasyonların ve yerlerin isimlerini tanımlamak ve anonimleştirmek için adlandırılmış varlık tanıma üzerine odaklanarak tıbbi kayıtları kimliksizleştirme potansiyelini incelemektedir. Bu yaklaşımda, DBpedia bilgi çizgesi, aday kurgusal karakter isimleri, hastane isimleri ve ilgili şehir ve ülke bilgilerini çıkararak, kimliksizleştirme için adaylar listesi oluşturmaktadır. Bu listeler daha sonra yaygın olarak kullanılan bir tıbbi veri kümesine kimliksizleştirme işlemi olarak dönüştürmek için uygulanmaktadır. Deneysel sonuçlar, belirli bir varlık türü şeması üzerine ince ayar yapılmış dil modellerinin, farklı varlık türü şemalarına sahip veri kümeleri için uygun olmadığını göstermektedir. Ayrıca, bu modeller, eğitim verilerini belirli bir sabit etiket şemasına göre etiketlemek için önemli miktarda insan gücü gerektirmektedir. Bu zorlukları aşmak için, bu tez, tıbbi metin anonimleştirme için halk tarafından erişilebilir bir veri kümesi sunmaktadır. Ayrıca, tıbbi kimliksizleştirme görevine uyarlamak için bir varlık aday çıkarıcı ve bir varlık türü tahmin edici içeren iki aşamalı bir metodoloji uygulanmaktadır. Sonuç olarak, iki aşamalı yaklaşımımızın, en ileri düzeyde denetimli öğrenme yöntemleriyle karşılaştırılabilir sonuçlar sunduğunu göstermektedir. göstermektedir.
Özet (Çeviri)
The increasing use of digital medical records underscores the growing demand for effective de-identification methods to protect patient privacy. De-identification involves the removal of personal details to prevent the identification of individuals within these records. Text de-identification refers to the process of eliminating or concealing information that could identify a person. Extracting such sensitive data from private datasets may lead to its exposure to online generative artificial intelligence models. This study explores the potential of large language models, enhanced with knowledge graphs, for de-identifying medical records, focusing particularly on named entity recognition for identifying and anonymising names of people, organisations, and locations. In this approach, DBpedia is used as the knowledge graph to extract possible fictional character names, hospital names, and relevant city and country information, creating a list of candidates for de-identification. These lists are then applied to transform a widely used medical dataset into a de-identification task. The results of the experiments indicate that fine-tuned language models, trained on a specific entity-type schema, are not suited for datasets with different schemas. Moreover, these models require significant human effort to annotate training data according to a fixed tagging schema. To address these challenges, this thesis proposes a publicly available dataset for medical text de-identification. Additionally, a two-stage methodology is applied, involving an entity candidate extractor and an entity type predictor, to adapt two open-source language models for the medical de-identification task. In conclusion, our two-stage approach yields result comparable to state-of-the-art supervised learning methods.
Benzer Tezler
- The significance and the contribution of 6+1 traits of writing to the success of the students in writing courses in English language teaching
Yazmanın 6+1 özelliğinin İngilizce öğretiminde yazılı anlatım derslerindeki öğrenci başarısına katkısı ve önemi
ÖZLEM YAZAR
Yüksek Lisans
İngilizce
2004
Eğitim ve ÖğretimGazi Üniversitesiİngiliz Dili Eğitimi Ana Bilim Dalı
YRD. DOÇ. DR. PAŞA TEVFİK CEPHE
- Hybridization of probabilistic graphical models and metaheuristics for handling dynamism and uncertainty
Değişimin ve belirsizliğin ele alınması için olasılıksal çizgesel biçelerin ve sezgi-üstlerinin melezleştirilmesi
GÖNÜL ULUDAĞ
Doktora
İngilizce
2021
Nörolojiİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. AYŞE ŞİMA UYAR
- Yapay zeka ve uygulamaları
Artificial intelligence and its applications
A.SEMİH ÖZKUL
Yüksek Lisans
Türkçe
1991
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiY.DOÇ.DR. ORHAN KURUÜZÜM
- Cumhuriyet Dönemi`nde Türkiye Radyo Televizyon Kurumu ve Türk halk müziği ilişkileri
Başlık çevirisi yok
CAN ETİLİ ÖKTEN
- Uyum gösteren cepheler: Bir meta analizi
Adaptive facades: A meta analysis
SELİN KARAAĞAÇ
Yüksek Lisans
Türkçe
2020
Mimarlıkİstanbul Teknik ÜniversitesiMimarlık Ana Bilim Dalı
DOÇ. DR. İKBAL ÇETİNER