Türkçe finans alanına özgü bilgi grafı inşası için çok aşamalı bilgi çıkarımı ve denetlenebilir operasyon planlama
Multi-stage information extraction and auditable operation planning for constructing a turkish finance domain-specific knowledge graph
- Tez No: 1011471
- Danışmanlar: DOÇ. DR. AHMET CÜNEYD TANTUĞ
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: Türkçe
- Üniversite: İstanbul Teknik Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Bilgisayar Bilimleri Ana Bilim Dalı
- Bilim Dalı: Bilgisayar Bilimleri Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Finans haberleri şirketlerin yaptıkları yatırımlar açtıkları fabrikalar, genel şirket faaliyetleri ve yönetim değişiklikleri gibi somut olguları hızlı biçimde yansıtan; ancak dili ve bağlamı haberin kaynağına göre sürekli değişen bir metin türüdür. Bu farklı tarzda yazılan metin türlerinden sorgulanabilir ve güncellenebilir bir bilgi grafı inşa etmek ilk bakışta“metinden bilgi çıkarma”problemi gibi görünse de pratikte asıl güçlük çıkartan aday bilginin doğruluğunun sağlanması ve mevcut grafla tutarlı biçimde birleştirilmesidir. Türkçenin eklemeli yapısı, şirket kurum ve kuruluşların adlarının farklı yazımları, kısaltmalar ve borsa kodları nedeniyle aynı varlıklar farklı biçimlerde ifade edilebilmektedir. Bu durum graf üzerinde mükerrer düğüm birikimine sebep olmaktadır. Büyük dil modelleri (LLM) genel cümle bağlamına klasik yöntemlere göre hâkim olduğundan metinden olgu üretim becerisi başarılı olsa da özellikle alan dışı ve genel kavramları çıkarmaya eğilimleri ve ilişkilerde kanıt gücü zayıf ifadeleri kesin bilgi gibi yorumlaması veya şema dışı ilişki üretme eğilimi gösterebilmektedir. Bu nedenle, metinden yalnızca daha fazla bilgi çıkarmak yerine, çıkarılan bilgilerin denetlenebilir bir karar sürecinden geçirerek grafa eklenme yaklaşımı öne çıkmaktadır. Bu çalışmada, Türkçe finans haberlerinden alana özgü ve zaman farkındalığı taşıyan bir bilgi grafı üretmek için iki katmanlı bir yaklaşım benimsenmiştir. Buradaki zaman farkındalığı, yüksek frekanslı finansal metrikleri çıkarmayı hedeflemez; bunun yerine tesislerin faaliyete geçmesi/durması, yönetim rol değişiklikleri ve yatırım kararları gibi daha seyrek ama yapısal değişimleri, geçerlilik süreleriyle birlikte temsil etmeye odaklanır. İlk katmanda çıkarım tek adımda yapılmamış; varlık, ilişki ve öznitelik çıkarımı üç ardışık aşamada ele alınmıştır. Bu tasarımda amaç, modelin her adımda daha dar kapsamlı bir karar vermesini sağlayarak aşırı üretim (over-generation) eğilimini sınırlamak ve ara temsiller üzerinden şema uyumunu daha erken aşamalarda kontrol edebilmektir. İlk katmandaki varlık çıkarımı sonrasında varlık çözümleme aşaması gelmektedir. Bu ara aşamada aday varlıkların kanonik temsillerle eşleştirilmesi için vektör benzerliği temelli bir aday eşleştirme yöntemi kullanılmıştır. Benzerlik puanına göre kademeli bir güvenlik ağı kurgulanmıştır. Yüksek güven aralığında otomatik eşleştirme yapılırken, belirsiz aralıkta daha düşük maliyetli bir küçük dil modeli ile doğrulama tercih edilmiş; düşük güven aralığında ise daha güçlü muhakeme yeteneği gerektirdiği için büyük dil modeli doğrulama tercih edilmiştir. Bu kademeli yapı hem mükerrer düğüm oluşumunu azaltmayı hem de zaman içinde tekrarlayan yüzey biçimlerinin daha hızlı kanonikleştirilmesini hedeflemektedir. İkinci katmanda ise çıkarım çıktılarının doğrudan grafa yazılması yerine, her aday kaydın graf üzerindeki etkisini belirleyecek karar veren bir operasyon planlama katmanı eklenmiştir. Operasyon planlama yalnızca belge metnini değil graf üzerinde aynı olguya dair mevcut bilgileri ve bunların zamansal durumunu da dikkate alarak üç tür eylem üretmektedir. Bu eylemler ekle/güncelle (UPSERT), değişiklik yok (NOOP) ve reddet (REJECT) olarak tanımlanmıştır. Her ret kararı için tanımlanmış gerekçe tipi ve kısa bir açıklama tutulması hem iz sürme hem de daha sonradan yapılacak hata analizleri açısından denetlenebilirliği güçlendirmektedir. Bilgi grafı tasarımında, olguların zaman içindeki değişimini kaybetmemek ve kaynak izlenebilirliğini korumak amacıyla beyan merkezli (assertion-centric) bir model benimsenmiştir. Varlıklar kanonik düğümler olarak tutulurken, ilişkiler ve öznitelikler ayrı beyan kayıtları şeklinde modellenmiştir. Her beyana haber kaynağı ve haberin tarihi eklenmiştir. Böylece yeni bir haber önceki bir olguyu güncellediğinde, kayıt sil yaz şeklinde değil, önceki beyanın geçerliliğini kapatıp yeni bir beyan açacak biçimde ele alınabilmektedir. Bu yaklaşım, zamansal sorguların önünü açmakta hem de aynı olgunun farklı tarihlerde nasıl değiştiğini geriye dönük izlenebilir kılmaktadır. Sistem 200 Türkçe finans haberi üzerinde değerlendirilmiştir. Çıkarım düzeyi değerlendirmeleri çıkarım ve çözümleme biçimlerine göre dört yöntem ile karşılaştırılmıştır. Üç aşamalı çıkarımın çözümlemeli ve çözümlemesiz sürümleri ile tek geçişli çıkarımın çözümlemeli ve çözümlemesiz sürümleri. Varlık çıkarımında en yüksek F1 değeri %73,06 düzeyinde elde edilmiş; tek geçişli yöntemlerde F1 değerleri yaklaşık %69–%70 bandında kalmıştır. İlişki çıkarımı ise genel olarak daha kırılgan bir tablo sergilemiştir; en iyi F1 değerleri yaklaşık %33 seviyesinde gözlenmiştir. Bu durum, finans haberlerinde ilişkilerin çoğu zaman örtük ifade edilmesi, kanıtın birden fazla cümleye dağılması ve dilsel belirsizliğin artmasıyla uyumludur. Operasyon planlama katmanı, çıkarım çıktılarındaki toplam varlık–ilişki sayısına göre seçilen 50 haberlik bir alt küme üzerinde, operasyon düzeyi ölçütlerle incelenmiştir. Sonuçlar, planlayıcının UPSERT kararlarında kaçırma riskini düşük tutacak şekilde yüksek bulma oranı ürettiğini; buna karşın özellikle ilişkilerde UPSERT tutturma oranının görece düşük kalması nedeniyle fazladan kabul eğiliminin ortaya çıkabildiğini göstermektedir. REJECT kararlarında ise farklı bir desen görülmüştür: reddetme kararı verildiğinde çoğunlukla doğru olsa da reddedilmesi gereken adayların tamamına yakını yakalanamamaktadır. Bu tablo, operasyon planlamanın graf büyümesini belirli ölçüde kontrol altına aldığını ancak seçiciliğin özellikle ilişki tarafında daha güçlü kanıt sinyalleriyle desteklenmesi gerektiğini düşündürmektedir. Sistemin graf düzeyinde etkisine bakıldığında, operasyon planlama katmanı doğrudan yazım yaklaşımına kıyasla düğüm sayısını yaklaşık %19,55 ve ilişki sayısını yaklaşık %21,19 azaltarak daha kompakt bir yapı elde edilmesine katkı vermiştir. Bu kompaktlaşma, uzun vadede gürültü birikimini ve bakım maliyetini azaltan daha yönetilebilir bir graf yapısına işaret etmektedir. Genel olarak bu tez, Türkçe finans haberlerinden bilgi grafı üretiminde başarının yalnızca çıkarım ölçütleriyle sınırlı olmadığını; çıkarılan aday bilginin graf bağlamında denetlenebilir kararlara dönüştürülmesinin kalite ve sürdürülebilirlik açısından belirleyici olduğunu ortaya koymaktadır. Elde edilen bulgular, özellikle ilişki çıkarımında örtüklük ve kanıt dağınıklığı kaynaklı kırılganlığın devam ettiğini; buna karşılık, kanonikleştirme ve operasyon planlama gibi tamamlayıcı katmanların grafın uzun vadeli sağlığını iyileştirmede somut bir katkı sunduğunu göstermektedir.
Özet (Çeviri)
Financial news is a text genre that rapidly reflects concrete facts such as companies' investments, newly established facilities, day-to-day corporate activities, and managerial changes; however, its language and context vary continuously depending on the news source. At first glance, constructing a queryable and updatable knowledge graph from such heterogeneous texts may seem like a straightforward“information extraction from text”problem, yet in practice the main difficulty is ensuring the correctness of extracted candidate facts and integrating them consistently with the existing graph. Due to Turkish being an agglutinative language, and because company, institution, and organization names appear in multiple spellings—along with abbreviations and stock ticker symbols—the same entities may be expressed in different surface forms, which in turn leads to an accumulation of duplicate nodes in the graph. Although large language models (LLMs) can produce facts effectively thanks to their strong grasp of sentence-level context compared to classical methods, they may still tend to extract out-of-domain or overly generic concepts, interpret weakly supported relational statements as“definite facts,”or generate schema incompatible relations. For this reason, rather than focusing solely on extracting more information from text, an approach that incorporates extracted facts into the graph through an auditable decision process becomes more appropriate. In this study, a two-layer approach is adopted to build a domain-specific and time aware knowledge graph from Turkish financial news. Here,“time awareness”does not aim to extract high-frequency financial metrics; instead, it focuses on representing less frequent but structurally meaningful changes—such as facilities becoming operational or ceasing operation, changes in managerial roles, and investment decisions—together with their validity intervals. In the first layer, extraction is not performed in a single step; entity, relation, and attribute extraction are handled in three consecutive stages. The aim of this design is to limit the tendency toward over-generation by requiring the model to make a narrower decision at each step, and to enable earlier enforcement of schema compliance through intermediate representations. After the entity extraction stage in the first layer, an entity resolution stage is introduced. In this intermediate step, a vector-similarity-based candidate matching method is used to align extracted entities with canonical representations. A staged“safety net”is constructed based on similarity scores: high-confidence cases are matched automatically; ambiguous cases are verified using a lower-cost small language model; and low-confidence cases are validated using a large language model, since they require stronger reasoning capabilities. This staged structure both aims to reduce duplicate node creation and supports faster canonicalization of recurring surface forms over time. In the second layer, rather than writing extraction outputs directly into the graph, an operation planning layer is added to decide the graph-level impact of each candidate record. Operation planning considers not only the document text but also the existing information about the same fact in the graph and its temporal status, and it produces three action types: insert/update (UPSERT), no change (NOOP), and reject (REJECT). For each rejection decision, storing a predefined reason type together with a short explanation strengthens auditability for both traceability and subsequent error analysis. For the knowledge graph design, an assertion-centric model is adopted to preserve both temporal change and source traceability. While entities are stored as canonical nodes, relations and attributes are modeled as separate assertion records. Each assertion is augmented with the news source and the document date. Consequently, when a new article updates a previously stored fact, the update is not handled through a“delete and-rewrite”mechanism; instead, the validity of the previous assertion is closed, and a new assertion is created. This approach not only enables temporal querying but also makes it possible to retrospectively trace how the same fact evolved across different dates. The system is evaluated on 200 Turkish financial news articles. Extraction-level evaluations compare four methods based on different combinations of extraction and resolution settings: three-stage extraction with and without resolution, and single-pass extraction with and without resolution. The highest F1 score for entity extraction is 73.06%, whereas single-pass methods remain in the 69–70% range. Relation extraction exhibits a more fragile overall pattern, with the best F1 scores observed around 33%. This outcome is consistent with the fact that relations in financial news are often expressed implicitly, that evidence can be distributed across multiple sentences, and that linguistic ambiguity increases relational uncertainty. The operation planning layer is further analyzed using operation-level metrics on a 50 article subset derived from the extraction outputs. The results show that the planner yields high recall for UPSERT decisions, thereby keeping the risk of missing updates low; however, especially for relations, the relatively lower precision of UPSERT decisions indicates a tendency toward“over-acceptance.”A different pattern is observed for REJECT decisions: while rejection decisions are mostly correct when made, the vast majority of candidates that should be rejected are not successfully identified. This indicates that operation planning can control graph growth to some extent, yet the selectivity of the decision process, particularly for relations—needs to be supported by stronger evidence signals. At the graph level, compared to a direct-writing baseline, the operation planning layer contributes to a more compact structure by reducing the number of nodes by approximately 19.55% and the number of relations by approximately 21.19%. This compaction points to a more manageable graph structure, with reduced noise accumulation and lower maintenance costs in the long term. Overall, this thesis demonstrates that success in knowledge graph construction from Turkish financial news is not limited to extraction metrics alone; converting extracted candidate facts into auditable decisions within the graph context is critical for quality and long-term sustainability. The findings further indicate that fragility driven by implicitness and dispersed evidence remains a key challenge in relation extraction, whereas complementary layers such as canonicalization and operation planning provide a tangible contribution to improving the long-term health of the graph.
Benzer Tezler
- Financial named entity recognition for turkish news texts
Türkçe haber metinlerinde finansal varlık ismi tanıma
DUYGU DİNÇ
Yüksek Lisans
İngilizce
2022
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. ALİ HİKMET DOĞRU
PROF. DR. PINAR KARAGÖZ
- Kripto para birimlerine yatırımda beyin aktivitesi
Brain activity in cryptocurrency investment
YİĞİT HAN GAZEL
- Planlama sürecinde bilgi teknolojileri-planlama destek sistemi modeli
Information technologies in planning process-planning support system model
BERNA DİKÇINAR
Doktora
Türkçe
2000
Şehircilik ve Bölge PlanlamaYıldız Teknik ÜniversitesiŞehir ve Bölge Planlama Ana Bilim Dalı
PROF. DR. EMRE AYSU
- Dijital bankacılık kapsamında Türkiye'de fintech inovasyonu ve uygulaması: Rusya sektör karşılaştırması
Fintech inovation and its implementation in Turkey within the context of digital banking: Russi̇a sector compari̇son
OĞUZHAN KAYMAK
Yüksek Lisans
Türkçe
2019
Bankacılıkİstanbul ÜniversitesiPara Sermaye Piyasaları ve Finansal Kurumlar Bilim Dalı
DOÇ. DR. ARİF SALDANLI
- Katılım bankacılığı hizmet ve ürünlerinin pazarlanmasında yaşananzorluklar: Geleneksel bankacılıkla karşılaştırma bağlamında nitel bir araştırma
Challenges in marketing participation banking services and products: A qualitative study in the context of comparison with traditional banking
EMRAH BAĞ
Yüksek Lisans
Türkçe
2026
BankacılıkKarabük ÜniversitesiFinans ve Bankacılık Ana Bilim Dalı
DOÇ. DR. İSMAİL KARATAŞ