Time based reward maximization
Zamana bağlı ödül azamileştirme
- Tez No: 376436
- Danışmanlar: YRD. DOÇ. FUAT BALCI
- Tez Türü: Yüksek Lisans
- Konular: Psikoloji, Psychology
- Anahtar Kelimeler: Belirsizlik, Karar verme, Karar verme süreci, Optimallik, Risk, Risk analizi, Zaman, Ödül, Uncertainty, Decision making, Decision making process, Optimality, Risk, Risk analysis, Time, Reward
- Yıl: 2014
- Dil: İngilizce
- Üniversite: Koç Üniversitesi
- Enstitü: Sosyal Bilimler Enstitüsü
- Ana Bilim Dalı: Psikoloji Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
İnsanlar ve hayvanlar saniyelerden dakikalara kadar olan zaman aralıklarında yüksek doğruluğa ancak düşük kesinliğe sahiplerdir. Bundan dolayı zamana bağlı bütün kararlar kaçınılmaz olarak içsel zaman belirsizliğine sahip olmakta ve zamansal risk analizi gerektirmektedir. Birinci çalışmada insanlar ödül alabilmek için bir önceki tepkilerinden sonra bir başka tepki vermeden en az asgari bir sure beklemeleri gereken zamansal risk analizi deneyi ile test edilmişlerdir. İlk grupta asgari süreden önceki tepkiler cezalandırılmamış ancak ikinci grupta bu tepkiler katılımcıların toplam kazançlarının azalmasına neden olmuştur (birim ödül/2). Katılımcılar sekiz seans boyunca sabit oturum süresi içinde ödüllerini azamileştirmeye çalışmışlardır. Deneyin başlangıcında ve devamında katılımcılara yönerge verilmemiş veya deneyin parametreleri hakkında bilgilendirme yapılmamıştır. İki gruptaki katılımcılar da kazanabilecekleri azami ödüle yaklaşmış ve optimal sürelere çok yakın beklemiştirler. Deney kurallarının öğrenimi hızlı ve ani olmuştur, ilk öğrenmeden sonra iyileşme veya kötüleşme olmamıştır. İkinci çalışmada ise aynı deney paradigması kullanılmış ancak erken tepkilere verilen ceza kazanılan ödül miktarına eşitlenmiş ve adaptasyon süreçlerinin incelenebilmesi için dördüncü deneyde asgari bekleme süresi ilk üç oturumun yarısına indirilmiştir. Katılımcılara durumsal kaygı ölçeği, davranışsal inhibisyon ve davranışsal aktivasyon ölçeği, barratt dürtüsellik ölçeği ve Padua obsesif kompülsif bozukluk envanteri verilmiş, skorların deney performansı ile olan ilişkisine bakılmıştır. İkinci deney sonucunda çoğu katılımcının dördüncü oturumdaki azami süre değişikliğine uyum sağlayabildiği gösterilmiştir. Yüksek davranışsal inhibisyon ve yüksek Padua envanteri skorlarına sahip katılımcıların optimale daha yakın olduğu gözlenmiştir. Bu iki çalışmanın sonuçları yönergesiz DRL deneyinin zamansal karar verme literatürü için önemli bir araç olduğunu göstermiştir.
Özet (Çeviri)
Humans and animals time intervals from seconds-to-minutes with high accuracy but limited precision. Consequently, time-based decisions are inevitably subject to our endogenous timing uncertainty and thus require temporal risk assessment. Study 1 tested the temporal risk assessment ability of humans when participants had to withhold each subsequent response for a minimum duration to earn reward and each response reset the trial time. Premature responses were not penalized in the first group but were penalized (reward/2) in the second group. Participants tried to maximize reward within a fixed session time (over 8 sessions) by pressing a key. No instructions were provided regarding the task rules/parameters. Participants nearly tracked the optimal target inter-response times (IRTs) that changed as a function of the level of timing uncertainty and maximized the reward rate in both experiments. Acquisition of optimal target IRT was rapid and abrupt without any further improvement or worsening. In Study 2 the same behavioral paradigm is used except the penalty was equated to reward, and the minimum withhold duration was halved in the 4th session to measure the adaptation to a new schedule after reaching the steady state. Participants were given trait anxiety scale, Barratt impulsivity scale, behavioral inhibition and behavioral activation scale, and Padua inventory for obsessive compulsive disorder to evaluate the relation between the personality and task performance. Most of the participants were able to adapt to the change in the fourth session. Participants with high behavioral inhibition and high Padua scores are shown to be closer to optimality. These results support the use of non-instructed differential reinforcement of low rates of responding (DRL) as a valuable tool in temporal decision-making literature.
Benzer Tezler
- Zaman pencereli kümelendirilmiş takım oryantiring problemi
Clustered team orienteering problem with time windows
ELÇİN KAYACI
Yüksek Lisans
Türkçe
2026
Endüstri ve Endüstri MühendisliğiBaşkent ÜniversitesiEndüstri Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ TUSAN DERYA
- Fındığın optimum satış süresinin belirlenmesi: oyun teorisi ve karar kriterleri yaklaşımları
Determining the optimal selling time of nut: game theory and decision criteria approaches
MELİKE MUNTAŞ
Yüksek Lisans
Türkçe
2023
Matematikİstanbul Teknik ÜniversitesiMatematik Mühendisliği Ana Bilim Dalı
DOÇ. DR. BURHANEDDİN İZGİ
- The effects of payoff manipulations on temporal bisection performance
Kazanç manipülasyonlarının süre ayrıştırması performansı üzerindeki etkileri
BAŞAK AKDOĞAN
- Deep reinforcement learning for stackelberg dynamic pricing: from dp benchmarks to multi-agent competition
Stackelberg dinamik fiyatlandırma için derin pekiştirmeli öğrenme: DP referanslarından çok ajanlı rekabete
FURKAN ORAL
Yüksek Lisans
İngilizce
2026
Endüstri ve Endüstri Mühendisliğiİstanbul Teknik ÜniversitesiVeri Mühendisliği ve İş Analitiği Ana Bilim Dalı (disiplinlerarası)
DR. ÖĞR. ÜYESİ MEHMET YASİN ULUKUŞ
- Elektrik güç sistemlerinde iletim ve dağıtım sistem operatörlerinin etkileşimini dikkate alan yeni yaklaşımların geliştirilmesi
Development of new approaches considering the interaction of transmission and distribution system operators in electric power systems
TAYFUR GÖKÇEK
Doktora
Türkçe
2025
Elektrik ve Elektronik MühendisliğiYıldız Teknik ÜniversitesiElektrik Mühendisliği Ana Bilim Dalı
PROF. DR. OZAN ERDİNÇ