Fatih Çağatay Akyön, Açıklanabilir Sahne Analizi için Görsel-Dil Modellerinin Kelime Dağarcığı Farkındalıklı Bilgi Damıtımı

Doktora Adayı: Fatih Çağatay Akyön
EABD: Çokluortam Bilişimi
Tarih: 01.09.2026 / 11:00
Yer: A-212

Özet: Temellendirilmiş sahne anlama, bir görüntüdeki nesnelerin varlığını, konumlarını ve ilişkilerini belirleyerek, özellikle hassas içerik moderasyonu gibi gözden kaçırmanın maliyetli olduğu durumlarda kararların gerekçelendirilmesine olanak tanır. Mevcut sistemler genellikle yalnızca güvenli/güvensiz çıktısı verirken, tespit edilen hassas içeriğin ne olduğunu veya nerede bulunduğunu açıklamakta yetersiz kalmaktadır.

Bu tez, söz konusu eksikliği gidermek amacıyla dört temel katkı sunmaktadır: (i) temellendirilmiş ve açıklanabilir hassas içerik analizi için SenBen ölçüt takımı, (ii) geri çağırma odaklı SenBen-Score değerlendirme metriği, (iii) sahne çizgesi üretimine yönelik kelime dağarcığı farkındalıklı bilgi damıtımı yaklaşımı ve (iv) gelişmiş bir görsel-dil modelinden türetilmiş kompakt bir moderasyon modeli.

Geliştirilen SenBen veri seti, 157 filmden alınan 13.999 kareyi kapsamaktadır. Sahneler, 25 nesne sınıfı, 28 öznitelik, 14 ilişki ve 5 kategori altında 16 hassasiyet etiketi ile Visual Genome tarzında sahne çizgeleriyle açıklanmıştır. Alan uzmanı düzeltmelerinin ardından tabakalı bir alt küme, ikinci bir değerlendirici ile doğrulanmıştır ve Cohen'in kappa katsayısı 0,85 olarak hesaplanmıştır. Kapsam analizi, hassas içerik söz varlığının yüzde 75'inin genel kaynaklarda bulunmadığını göstermiş ve alana özgü bir eşanlamlılar haritasının geliştirilmesini motive etmiştir.

Dağıtıma uygun bir model geliştirmek amacıyla Gemini öğretici modeli, 241 milyon parametreli Florence-2 öğrenci modeline damıtılmıştır. Otoregresif üretimdeki kelime dağarcığı dengesizliğini çözmek için ek tabanlı nesne kimliği tahmini, Vocabulary-Aware Recall (VAR) kaybı ve ayrıştırılmış bir Query2Label tabanlı hassasiyet başlığı önerilmiştir. Bu yaklaşım, standart çapraz entropi eğitimine kıyasla SenBen geri çağırma başarımını 5,2 puan artırmıştır. Model Florence-2-large sürümüne ölçeklendirildiğinde 0,441 SenBen geri çağırma skoru elde edilmiştir. Birleşik değerlendirmede temel öğrenci model, öğreticisi Gemini hariç test edilen tüm görsel-dil modellerini ve ticari güvenlik API'lerini geride bırakmıştır. Ayrıca, test edilen sistemler arasında en yüksek nesne tespiti ve görüntü altyazılama başarımına ulaşırken, en güçlü rakip yerel modele kıyasla 7,6 kat daha hızlı çalışmakta ve 16 kat daha az GPU belleği kullanmaktadır.