araştırmayoutube-analitiğitest

Thumbnail Skorunu Daha Doğru Hale Getirmek İçin Dört Yöntem Denedik

Bir değişiklik, ölçülen doğruluğu %59,5'ten %62,0'a yükseltti ve bu, daha iyi bir model değil, daha adil bir ölçüm oldu. Diğer üçü hiçbir şey değiştirmeden, skoru daha az güvenilir hale getirdi.

September 14, 20269 min read
Thumbnail Skorunu Daha Doğru Hale Getirmek İçin Dört Yöntem Denedik

321 gerçek video çiftiyle thumbnail skorumuzu test ettikten sonra, daha doğru hale getirmeyi denedik. Dört şey denedik. Bir tanesi sayıyı değiştirdi ve incelediğimizde, daha iyi bir model değil, daha adil bir ölçüm olduğu ortaya çıktı. Diğer üçü hiçbir şey değiştirmeden, skoru daha az güvenilir hale getirdi. Her biri ve sayıları burada.

Temel çıkarımlar

  • Tam hassasiyetle skorları karşılaştırmak, yuvarlanmış tam sayılara göre ölçülen doğruluğu %59,5'ten %62,0'a yükseltti ve bunun tamamı 17 eski beraberlikten geldi, bu beraberlikler yaklaşık olarak eşit şekilde bölündü.
  • Yeniden yazılan skorlama talimatları, 30 thumbnail üzerinde bir çığır açmış gibi göründü ama 322 üzerinde hiçbir şey yapmadı: 161 çift üzerinde %64,6 öncesi ve %63,4 sonrası.
  • Yapay zekâya iki thumbnaili baş başa karşılaştırmayı sormak, ortalama olarak normal skorla eşleşti, her ikisi de %62,7, ancak cevabı hangi resmin önce geldiğine bağlıydı.
  • Modelin akıl yürütme ayarı, en yüksek seviye dışında hiçbir şeyi değiştirmedi ve o seviye, yüklemeleri AB içinde tutmak için kullandığımız Avrupa bölgesinde hiçbir zaman cevap vermedi.
  • Yayınlanan, önceden kayıtlı sonuç %59,5'te kalıyor. Buradaki her şey takip çalışmasıdır ve böyle etiketlenmiştir.

Test edildikten sonra bir thumbnail skoru daha doğru hale getirilebilir mi?

Bu durumumuzda kolay değil. Gerçek videolarla test ettiğimiz dört değişiklikten biri, ölçülen doğruluğu %59,5'ten %62,0'a yükseltti ve bunu modelin yeni bir şey görmesini sağlamadan, skorların nasıl karşılaştırıldığını düzelterek yaptı. Diğer üçü doğruluğu olduğu yerde bıraktı. Skor, bu modelin yapabileceği şeylere yakın görünüyor.

Bu, yeni bir rekor kadar heyecan verici değil ama daha faydalı bir cevap. Nereye çaba harcamamak gerektiğini söylüyor ve her cazip fikrin neden başarısız olduğunu açıklıyor. Bu, sadece bu skorun ötesinde de önemli, çünkü aynı tuzaklar, kendi thumbnail’lerini test eden yaratıcıları da yakalıyor.

İşleyen düzeltme: karşılaştırmadan önce yuvarlamayı durdurun

Gördüğünüz skor, 0 ile 100 arasında bir tam sayıdır. Orijinal testimizde, bir çiftteki iki video bazen aynı tam sayıya denk geliyordu ve bu 321 çiftte 17 kez oldu. Önceden kayıtlı kurallarımız, iki videoyu ayıramayan bir skoru her beraberliği başarısız olarak sayıyordu.

Tam sayının arkasında kesin bir değer var ve yuvarlama farkı ortadan kaldırıyor. Kesin değerleri karşılaştırmak, hiçbir beraberlik bırakmıyor ve ölçülen doğruluk %59,5'ten %62,0'a yükseliyor: 321 çiftin 199'u, 191 yerine. Hiçbir video yeniden skorlanmadı ve hiçbir ağırlık değiştirilmedi; kesin değer zaten oradaydı.

Bu neden daha adil bir sayı, daha iyi bir model değil

Açık soru, bu 17 beraberliğin nasıl bölündüğü. Eğer model sessizce hepsini doğru yapıyorsa, yuvarlama gerçek beceriyi gizliyordu. Böyle değildi. 17 beraberliğin sekizi daha iyi performans gösteren videoya, dokuzu ise değil, bu da bir yazı tura atışıyla elde edilebilecek şeydi.

Yani kazanç, yazı turaları otomatik olarak başarısız olarak işaretlemeyi bırakmaktan geliyor, modelin daha fazla şey bilmesinden değil. Bu yüzden yayınlanan sonuç %59,5'te kalıyor: verileri görmemizden önce yazdığımız kurallar altında önceden taahhüt ettiğimiz rakam. %62,0, açıkça etiketlenmiş bir takip ölçümü olarak bildiriliyor ve aynı modeli tanımlıyor.

Talimatları ayarlamak: bir çığır gibi görünen küçük bir pilot

Modelin puanları bir arada toplanıyor. Skorun oluşturulduğu on iki faktörden birkaç tanesi, yüzlerce gerçek thumbnail üzerinde dar bantlarda yer alıyor ve orijinal testimiz, skorun iki videoyu uzak tuttuğunda en güvenilir olduğunu gösterdi. Bu yüzden, ölçeğe bir referans noktası vermek için talimatları yeniden yazdık: 50, aynı akıştaki tipik videoyu, 90 ve üzeri ise en iyi onda biri için ayrıldı.

30 thumbnail üzerinde yapılan pilot testte, her iki versiyonla skorlananlar arasında işe yaradığı gibi görünüyordu. On iki faktörden sekizi yayıldı ve ikisi neredeyse yayılımlarını ikiye katladı. Daha sonra yeni talimatları 322 thumbnail üzerinde çalıştırdık. Yayılımlarını neredeyse ikiye katlayan iki faktör, sadece 1,1 ve 0,1 puanlık bir artış gösterdi. 161 çift üzerinde, orijinal talimatlar daha iyi videoyu %64,6 oranında seçerken, yeni talimatlar %63,4 oranında seçti, bu fark şansın içindeydi. Yeni versiyon ayrıca neredeyse her puanı beş ila yedi puan düşürdü, bu yüzden her yaratıcıya hiçbir şey karşılığında birkaç puan maliyeti getirecekti.

Daha fazla yayılma neden daha fazla doğruluk anlamına gelmedi

Pilot sadece çok küçüktü. 30 thumbnail ile, puanların ne kadar yayıldığını ölçen bir değer, şansla büyük ölçüde değişebiliyor ve iki faktörün ikiye katlanması bu değişim içindeydi. Pilot, daha büyük bir test yapma nedeni olarak okunmalıydı, bir sonuç olarak değil.

Daha büyük test, ikinci bir ders verdi. Merak ve tıklama tuzağı riski olmak üzere iki faktör, 322 thumbnail üzerinde gerçekten yayıldı, ancak sıralama yine de iyileşmedi. Daha geniş puanlar, yalnızca ek genişlik videolar arasındaki gerçek farklılıkları takip ediyorsa yardımcı olur. Burada, gürültüyü takip ediyordu ve güvenli gibi görünen gürültü, hiç gürültüden daha kötüydü.

Thumbnail’leri tek tek skorlamak yerine baş başa karşılaştırmak

Her thumbnail’i tek tek skorlamak ve ardından sayıları karşılaştırmak, insanların thumbnail’leri seçme şekli değil; onlar iki thumbnaili yan yana bakarlar. Bu yüzden modelden bunu yapmasını istedik: bir çiftten her iki video gösterildiğinde, hangisi daha iyi performans gösterdi? 161 çiftin her biri, her iki sırayla iki kez gösterildi.

Her iki sıraya göre ortalamalandığında, baş başa karşılaştırma yapan model %62,7 oranında doğruydu, aynı 150 tam cevaplı çift üzerinde normal skorla tam olarak eşleşiyordu. Ancak ilk gördüğü thumbnail’i %64,7 oranında seçti ve çiftlerin neredeyse üçte birinde sadece sıraya bağlı olarak zıt cevaplar verdi. Eşit doğruluk, çok daha az kararlılık anlamına geliyordu, bu yüzden benimsenmedi. Tam sonuçlar, thumbnail’leri karşılaştırmak için bir yapay zekâya sorma üzerine ayrı bir yazımızda.

Modelin akıl yürütme modunu açmak

Model, cevap vermeden önce bir sorunu adım adım çözmesini sağlayan, birkaç çaba seviyesinde bir ayar sunar. Üç alt seviyede, bir test thumbnail’inin tam analizi, ayar kapalıyken elde edilen on iki puanla aynı geldi. Sadece en yüksek seviye, modelin davranışını biraz değiştirdi.

Yüklemelerin hiçbir zaman AB dışına işlenmemesi için kullandığımız Avrupa veri merkezinde, en yüksek seviye, üç dakikaya kadar süren tekrarlı denemelerde hiçbir zaman cevap vermedi. ABD bölgesinde, hiçbir thumbnail içermeyen uydurulmuş bir aritmetik sorusuyla çalıştığını doğruladık ve akıl yürütmesini cevabın önünde düz metin olarak yazdığını, ayrı tutmadığını bulduk. Sonuçların ne kadar yardımcı olacağını öğrenmek için yüklemeleri ABD’ye taşımak, yapmaya hazır olduğumuz bir değiş tokuş değildi.

Dört sonucu yan yana

Her değişiklik, aynı çiftler üzerinde orijinalle karşılaştırıldı, böylece aşağıdaki her fark doğrudan karşılaştırılabilir.

DeğişiklikSıralama doğruluğuna etkisiKorundu mu?
Yuvarlanmamış skorları karşılaştır321 çiftte %59,5'ten %62,0'a, tamamen eski beraberliklerin yaklaşık eşit şekilde bölünmesinden kaynaklanıyorEvet, daha adil bir ölçüm olarak
Skorlama talimatlarını kalibre et161 çiftte %64,6'dan %63,4'e, algılanabilir bir fark yokHayır
Thumbnail’leri baş başa karşılaştır150 çiftte %62,7'e karşı %62,7, cevaplar sıraya bağlıydıHayır
Model akıl yürütme moduÇalışan seviyelerde hiçbir değişiklik; en yüksek seviye, bölgemizde hiçbir zaman cevap vermediHayır

Buradaki her rakam, bir thumbnail ve başlığı analiz ettiğinizde çalışan aynı skorlama hattından geliyor. Testler, ürünün kendisi üzerinden gerçek videoları skorladı, ayrı bir araştırma kopyası üzerinden değil.

Bu takip testlerini nasıl dürüst tuttuk

Takip deneyleri, araştırmacıların zaten hangi cevabı istediklerini bildiği yerlerde genellikle yanlış gider. Beş kural bunu kontrol altında tuttu:

  1. Yayınlanan sonuç asla dokunulmadı. Önceden kayıtlı %59,5 başlıkta kalıyor ve her sonraki analiz takip çalışması olarak etiketleniyor.
  2. Kanallar, herhangi bir değişiklik test edilmeden önce ikiye bölündü. Deneyler bir yarım kullanıldı, diğer yarım son kontrol için ayrı tutuldu.
  3. Her değişiklik, aynı çiftler üzerinde orijinalle karşılaştırıldı, yalnızca ikisinin anlaşmadığı çiftleri sayarak, bu iki genel yüzdeyi karşılaştırmaktan çok daha duyarlıdır.
  4. Küçük bir pilot, asla bir sonuç olarak değil, daha büyük bir test yapma nedeni olarak ele alındı.
  5. Her baş başa karşılaştırma, her iki sırayla gösterildi, böylece pozisyon tercihi beceri olarak geçemeyecek.

Bunların hiçbiri istatistik derecesi gerektirmez ve çoğu, kendi thumbnail’lerini test eden bir yaratıcıya doğrudan uygulanabilir: bakmadan önce neyin kazanç sayılacağını kararlaştırın, benzeriyle karşılaştırın ve küçük bir erken sonucu, testlere devam etme nedeni olarak değerlendirin.

Bu takip sonuçlarının sınırları

Dört deney de orijinal testte kullanılan aynı kurulmuş, İngilizce kanalları ve bir modeli kullandı. Fikirler, orijinal sonuç bilindikten sonra seçildi, bu da bir bulguyu övme eğiliminde olan tam durum ve başlığın önceden kayıtlı rakamda kalmasının bir başka nedeni.

Her değişiklik, bir formda bir kez denendi. Talimatlar için farklı bir ifade daha iyi olabilirdi ve akıl yürütme modu sonucu, Eylül 2026'da bir bölgede mevcut olanı tanımlıyor. Bu sonuçların hiçbiri skorun iyileşemeyeceğini söylemiyor; bu dört yolun onu iyileştirmediğini söylüyor.

Sıkça sorulan sorular

Neden doğruluk olarak %62,0 rapor edilmiyor?

Çünkü test kuralları, herhangi bir veri var olmazdan önce sabitlenmişti ve beraberlikleri başarısız olarak sayıyordu. Sonuçları gördükten sonra bir kuralı değiştirmek, önceden kayıtlı olmanın tam olarak önlemek istediği şeydir, değişiklik mantıklı olsa bile. %62,0, %59,5'i yerine koymadığı açıkça etiketlenmiş bir takip ölçümü olarak yayınlanıyor.

Daha akıllı bir yapay zekâ modeli skoru daha doğru hale getirebilir mi?

Mümkün, ama bu yeni bir deney olurdu. Mevcut modelimizin akıl yürütme ayarı, kullandığımız bölgede yardımcı olmadı ve farklı bir model, herhangi bir iddia yapılmadan önce aynı çiftlerle, aynı şekilde test edilmeliydi. Yeni olan, bu özel görevde otomatik olarak daha iyi anlamına gelmez.

30 thumbnail üzerindeki bir test neden bu kadar ikna edici göründü?

Küçük örnekler, şansla büyük değişimlere neden olur ve büyük bir değişim bir keşif gibi görünür. 30 thumbnail ile, iki faktörün yayılımlarını ikiye katlaması normal değişimin içindeydi; 322 thumbnail ile etki neredeyse kayboldu. Bu, iki yüklemeye göre yeni bir thumbnail tarzını değerlendirmenin aynı tuzaklarıdır.

Bu, kendi thumbnail’lerimi test etmem için ne anlama geliyor?

Aynı kurallar geçerli. Bakmadan önce neyin başarı sayılacağını kararlaştırın, kanalınızın normal aralığına göre karşılaştırın, şansın sonucu açıklayamayacağı kadar örnek çalıştırın ve herhangi bir araçtan iki seçeneği karşılaştırmasını istiyorsanız, cevabının yerlerini değiştirildiğinde hayatta kalıp kalmadığını kontrol edin.

Bu iyileştirmeler başarısız olduysa skor hâlâ kullanılır mı?

Skor, gerçek sonuçlara karşı test edildi ve şansı açık bir farkla yendi. Bu takip çalışmaları, dört cazip değişikliğin onu daha da ileriye taşımadığını gösteriyor, bu da onu reddetme nedeni değil, bilinmesi faydalı bir şey. Onu, izlenme tahmini değil, birkaç bilgili girdiden biri olarak değerlendirin.