Story generation for ancient sites in Anatolia using large language models
Büyük dil modelleri kullanarak Anadolu'daki antik bölgeler için hikaye üretimi
- Tez No: 1022966
- Danışmanlar: DOÇ. DR. EMRAH İNAN
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: İngilizce
- Üniversite: İzmir Yüksek Teknoloji Enstitüsü
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Tarihsel ve kültürel miras metinleri, insanlık geçmişi hakkında değerli bilgiler sunar; ancak bu metinler daha geniş kitleler için dikkatli bir yorumlama gerektirir. Bu tür metinleri hikâyeye dönüştürmek, özgün kaynakların bilgi değerini korurken kültürel mirasa yönelik kamusal ilgiyi destekleyebilir. Ancak tarihsel metinlerden hikâye üretmek zordur; çünkü çıktıların okunabilir, tutarlı ve kaynak içeriğe bağlı olması gerekir. Büyük dil modelleri akıcı metinler üretebilse de olgusal dayanaklılık, girdi kullanımı ve anlatım tonu hâlâ denetlenmesi gereken konulardır. Bu tez, Anadolu'daki antik yerleşimler için büyük dil modeli tabanlı hikâye üretimini incelemektedir. Çalışmada, Wikipedia'dan alınan yapılandırılmış infobox bilgileri ve tarihsel metin bilgileriyle 89 antik yerleşimden oluşan bir veri seti oluşturulmuştur. Kaynaklar ön işleme adımlarından geçirilmiş ve tarihsel kesit girdisi, infobox girdisi ve bu iki girdinin birleşimi olmak üzere üç girdi temsili hazırlanmıştır. Hikâyeler sıfır örnekli ve az örnekli istemleme ile akademik, anlatısal, betimleyici ve müze rehberi olmak üzere dört tonda üretilmiştir. Çalışmada Llama-3.1-Tulu-3-8B temel model olarak, Gemma-2-9b-it ise karşılaştırma modeli olarak kullanılmıştır. Üretilen hikâyeler BERTScore, chrF, BARTScore, ROUGE-L, BLEU ve soru-cevap tabanlı olgusal tutarlılık değerlendirmesiyle incelenmiştir. Sonuçlar, tarihsel kesit girdilerinin infobox girdilerine göre genellikle daha güçlü çıktılar ürettiğini göstermektedir; bunun temel nedeni, tarihsel kesitlerin daha zengin bağlamsal bilgi içermesidir. Az örnekli istemleme, özellikle biçim ve içerik kısıtlarının örneklerle açık biçimde gösterildiği bazı ayarlarda sonuçları iyileştirmiştir. Model karşılaştırması da model seçiminin olgusal dayanaklılığı etkilediğini göstermektedir. Genel olarak bu tez, kültürel miras alanında kaynak metne dayalı tarihsel hikâye üretimi için tekrarlanabilir bir çerçeve sunmaktadır.
Özet (Çeviri)
Historical and cultural heritage texts provide valuable information about the human past, but they often require careful interpretation for wider audiences. Transforming such materials into stories can support public engagement with cultural heritage while preserving the informational value of the original sources. However, generating stories from historical texts is challenging because the output should be readable, coherent, and faithful to the source content. Although large language models can produce fluent text, controlling factual grounding, input use, and narrative tone remains an important problem. This thesis investigates LLM-based story generation for ancient sites in Anatolia. A dataset of 89 ancient sites was constructed from Wikipedia-derived materials, including historical text sections and structured infobox information. These sources were preprocessed as three input representations: history excerpt input, infobox input, and their combination. Stories were generated under zero-shot and few-shot prompting across four tones: academic, narrative, descriptive, and museum-guide. The study used Llama-3.1-Tulu-3-8B as the main baseline and Gemma-2-9b-it for comparison to examine how model choice affects story quality and factual grounding. The stories were evaluated using BERTScore, chrF, BARTScore, ROUGE-L, BLEU, and a QA-based factuality assessment. The results show that history excerpt inputs generally provide stronger outputs than infobox-only inputs because they contain richer contextual information. Few-shot prompting improves results in several settings, especially when style and content constraints are clearly demonstrated. The model comparison also shows that model choice affects factual grounding. Overall, this thesis presents a reproducible framework for source-grounded historical story generation in the cultural heritage domain.
Benzer Tezler
- Kültürel mirasın dijital temsili: Dara antik kenti agorasında artırılmış gerçeklik deneyimi
Digital representation of cultural heritage: An augmented reality experience in the agora of dara ancient city
BERYAR ZÜBEYDE BALABAN
Yüksek Lisans
Türkçe
2025
Mimarlıkİstanbul Teknik ÜniversitesiBilişim Ana Bilim Dalı
PROF. DR. LEMAN FİGEN GÜL
- Seyitömer bitümlü şist ve linyit örneklerinde ve piroliz kalıntılarındaki PAH'ların belirlenmesi
Detection of pah in pyrolysis residue and raw Seyitömer oil shale and lignite
DERYA DİLEK
- Kasımpaşa-Bedrettin mahallesi kentsel sit koruma önerisi
Conservation proposal of the urban site: Kasimpaşa-Bedrettin district
ASLI ÇOBANOĞLU
Yüksek Lisans
Türkçe
2013
Mimarlıkİstanbul Teknik ÜniversitesiMimarlık Ana Bilim Dalı
PROF. DR. YEGAN KAHYA
- Miras yapı komplekslerinin yeniden kullanımı: Ankara Saraçoğlu mahallesi için yeniden kullanım stratejileri
Adaptive reuse of heritage building complexes: Adaptive reuse strategies for Ankara Saraçoğlu neighborhood
DİLAY ÖZCAN
Yüksek Lisans
Türkçe
2022
İç Mimari ve Dekorasyonİstanbul Teknik Üniversitesiİç Mimarlık Ana Bilim Dalı
DOÇ. DR. ÖZGE CORDAN