araştırmathumbnailyoutube-analitiği

321 Gerçek Video Üzerinde Thumbnail Skorunu Test Ettik

YouTube thumbnail ve başlık skorunun gerçek performansı takip edip etmediğini test ettik. 321 aynı kanal videosu, dört kontrol ve sonuç ne olursa olsun yayımlamaya karar verdiğimiz bir deney.

September 4, 20269 min read
321 Gerçek Video Üzerinde Thumbnail Skorunu Test Ettik

Bir thumbnail skoru, yalnızca YouTube'da gerçekten olanları takip ediyorsa değerlidir. Bu yüzden bizi utandırabilecek bir test yaptık: 321 gerçek video eş çifti, her çift aynı kanaldan, biri kanalın kendi ortalamasını aşan, diğeri ise altında kalan. Yöntemi herhangi bir veriye bakmadan önce yazdık. Skor, %59,5 oranında daha iyi performans gösteren videoyu doğru seçti; %50'lik bir yazı tura oranına karşı.

Temel çıkarımlar

  • 321 çift üzerinden, skor daha iyi performans gösteren videoyu %59,5 oranında daha yüksek sıraladı (p = 0,00079). Şans %50'dir.
  • Farklı kanallardaki videoları karşılaştırmak, paketlemeyi değil abone sayısını ölçer — buradaki her çift, ortanca olarak altı gün arayla yayınlanan tek bir kanaldan geldi.
  • Her thumbnail’ın aynı şablonu kullandığı kanallarda doğruluk %48,7'ye düştü. Bu, istediğimiz sonuçtu: okunacak fark yok, bulunacak sinyal yok.
  • Dört basit kural — daha uzun başlık, daha fazla kelime, daha büyük dosya, daha yüksek kontrast — hepsi şans düzeyinde kaldı. Skor, bunlardan hiçbirinin yerine geçmiyor.
  • Modelin iki video arasında koyduğu fark ne kadar büyükse, doğru tahmin etme oranı o kadar yüksek oldu: 1-3 puan farkta %56, 15 puan veya daha fazlasında %76,5.

YouTube thumbnail skoru gerçekten performansı tahmin ediyor mu?

Bu testte evet — hafif ve ölçülebilir bir şekilde. Aynı kanaldan gelen iki video verildiğinde, biri kendi taban çizgisini açıkça aşan, diğeri açıkça altında kalan, skorumuz onları %59,5 oranında doğru sıraladı. Şans %50'dir. %95 güven aralığı %53,9 ile %64,9 arasında, yani etki gerçek ama küçük.

Küçük, dürüst cevaptır ve daha fazlasını iddia eden herkes bir şey satıyor. Paketleme, birçok girdiden sadece biridir. Konu, yükleme zamanı, o haftaki algoritmanın ruh hali, bir videoyun platform dışından seçilip seçilmesi — hepsi bir thumbnail'dan çok daha fazla görüntüyü etkiler. %90 doğruluk iddia eden bir skor, var olmayan bir YouTube'u tanımlıyor olurdu.

%59,5’in pratikte ne anlama geldiğini: aynı video için iki seçenek arasında karar veriyorsanız, skor tahmin etmekten daha iyidir ve birini daha güçlü tercih ettiğinde daha faydalıdır.

Neden farklı kanallardaki thumbnail’ları karşılaştırmak hiçbir şey söylemez?

Bu testin açık versiyonu, bir grup thumbnail’ı skorlamak ve skorları görüntü sayılarıyla ilişkilendirmektir. Bu, kanal büyüklüğünü ölçer. Görüntüler, paketlemeden çok abone sayısı, konu ve video yaşı tarafından hareket eder ve karıştırıcı etki övgü yönünde çalışır: büyük kanallar iyi tasarımcılara sahip olabilir ve büyük kitlelere sahip olabilir.

Bu testi yaparsanız, hiçbir şey ifade etmeyen güzel bir pozitif korelasyon elde edersiniz. Tam olarak bir şüpheci okuyucu tarafından hayatta kalır.

Adil bir karşılaştırma neyi sabit tutmalı?

Aynı kanaldan iki videoyu karşılaştırmak, abone sayısı, kitle, bütçe ve tasarım becerisini tek bir hamlede iptal eder, çünkü dördü de çift içinde aynıdır. İkisinin de yakın zamanda yayınlanmasını gerektirmek, kanalın büyüme eğilimini ve o dönemin algoritma rejimini de iptal eder.

Kalan, sıfır hipotezi altında bilinen bir cevabı olan bir sorudur: bir kanalın kendi kitleleri tarafından çok farklı muamele gören iki video verildiğinde, skor hangisinin hangisi olduğunu söyleyebilir mi?

321 eşleştirilmiş çift üzerinde nasıl adil bir test kurduk?

Altı kategoride — teknoloji, eğitim, yemek, oyun, fitness ve yaşam tarzı — 60 kanal aldık ve her birinden en fazla 300 son yüklemeyi çektik. Dışlamalar sonucunda 17.250 video değerlendirildi ve 321 kullanışlı çift kaldı. Her çift aynı kanaldan, ortanca olarak altı gün arayla yayınlandı ve üstünlük gösteren, zayıf olanı ortanca olarak 4,7 katı kadar geçti.

Performans, kanal genel ortalaması değil, kayan yerel bir taban çizgisine göre ölçüldü. Her video için, kendisini hariç tutarak her iki yanında on komşu yüklemenin ortanca görüntü sayısını alıp, kendi görüntü sayısını bunun katı olarak ifade ettik. İki yıl içinde beş kat büyüyen bir kanalda, her erken video başarısız, her son video başarı olarak etiketlenirdi — paketlemeyi değil, takvimi ölçerdi.

Eşleştirme kuralları önceden sabitlendi:

  1. Her iki video da aynı kanaldan gelir ve her video en fazla bir çiftte yer alır.
  2. 120 gün içinde yayınlandılar.
  3. Üstünlük gösteren, zayıf olanı en az iki katı kadar geçti, böylece “daha iyi” ve “daha kötü” gürültüyü tanımlamak yerine bir şey ifade eder.
  4. Hiçbir kanal sekizden fazla çift katkısı yapmaz, böylece veri örneğini tek bir üretken yükleyici domine edemez.

Shorts, canlı yayınlar, 45 günden daha yeni videolar ve iki yıldan daha eski her şey hariç tutuldu. Skor, kullanıcıdan gelen tam olarak bir thumbnail ve başlık gördü — görüntü sayıları veya çiftin hangi tarafına baktığı hakkında hiçbir şey görmedi.

Skor neyi doğru bildi ve ne sıklıkla?

Model, 321 çiftin 191'inde daha iyi performans gösteren videoyu seçti: %59,5, %50'lik sıfır hipotezine karşı tam ikili p-değeri 0,00079. On yedi çift tam eşitlikle döndü ve hepsi, skorun iki girdiyi ayıramadığı için, bölünmüş ya da çıkarılmış yerine başarısız olarak sayıldı.

Eşitlikleri kaybetme olarak saymak, başlık sayısını koruyucu hale getirir. Hiçbir yeteneği olmayan bir model, bu kural altında yaklaşık %47,4 skor alırdı, %50 değil, bu yüzden testimiz gerçek şans seviyesinin hemen üzerinde bir barajı aşmasını istedi. Gerçekten ayırdığı 304 çift arasında, %62,8 oranında doğruydu.

Güven, doğruluğu takip etti

Sonucun bir şans eseri değil, bir ölçüm gibi davrandığına dair desen: skorun iki videoyu ne kadar uzaklaştırdığı, doğru tahmin etme oranının o kadar yüksek olduğu.

1-3 puan farkta doğruluk %56,0 idi. 4-7 puan arasında %64,1. 8-14 puan arasında %63,2. 15 puan veya daha fazlasında %76,5. Gürültü üreten bir model, bu kovalarda düz bir çizgi gösterirdi. Bu model, daha emin olduğunda sürekli olarak daha iyi performans gösteriyor — istediğiniz ve sahte olamayacak davranış.

Bizi yanlış çıkarabilecek dört kontrol

Başarısız olamayan bir çalışma kanıt değildir. Dört kontrolü önceden belirledik, her biri başlık sonucunu geçersiz kılabilirdi ve ne gösterirlerse göstersin hepsini yayımlamaya karar verdik. Her biri, olması gerektiği gibi davrandı.

KontrolBaşarısızlık ne anlama gelirdiSonuç
Kazanan/mağlup etiketlerini 1.000 kez karıştırİşlem hattı cevabı sızdırıyor; tüm sonuç geçersiz%47,1, teorinin tam olarak olması gereken yerde
Tek sabit şablonu kullanan kanallarSkor, paketlemenin dışında bir şey okuyor%48,7 — şans, öngörüldüğü gibi
Basit kurallar: başlık uzunluğu, kelime sayısı, dosya boyutu, kontrastBir satırlık kural modeli eşitler, yani model hiçbir şey eklemez%46,7-%54,5, hiçbiri anlamlı değil
Her thumbnail’ı diğer videoyun başlığına karşı yeniden skorlaBaşlık hiçbir şey katmaz ve sadece yarısını skorluyoruz, iki yarısını değilSkor ortalama 11,3 puan değişti

Şablon kontrolü, en önemli olanıdır ve nedenini net bir şekilde belirtmek değerdir. Tüm içerikler için tek bir thumbnail düzeni kullanan kanallarda, görsel bir modelin karşılaştırabileceği neredeyse hiçbir şey yoktur. Skorumuz orada da kazananları güvenle seçseydi, paketleme yerine kanal kimliğini veya yükleme dönemini okuyor olurdu. Bu kanallarda %48,7, diğer her yerde ise %61,0 skorladı. Bu fark, ölçülen şeyin iddia ettiğimiz şey olduğunu gösteren çalışmanın en güçlü kanıtıdır.

Hangi skorlama boyutları kazananları kaybedenlerden ayırdı?

Bu kısım doğrulayıcı değil, keşfedici niteliktedir ve genel YouTube yerine bu örneği tanımlar. İki grubu ne kadar ayırdığını ölçerek on iki alt skoru sıraladığımızda, en net ayrım vaat netliğiyle geldi, ardından kaybetme korkusu sinyali ve aciliyet geldi. Duygusal yoğunluk neredeyse hiç ayırmadı.

Vaat netliği — paketlemenin sizi ne izleyeceğinizi ne kadar belirsiz bir şekilde bildirdiği — modelin memnuniyet yönünü yakalamak için kurulduğu şeyi yansıtır. En zayıf ayırıcı olan ham duygusal yoğunluk, daha ilginç yarısıdır: bu örnekte, bir thumbnail'daki güçlü duygular, üst performans gösterenleri alt performans gösterenlerden ayırmadı — bu, çoğu thumbnail tavsiyesinin varsaydığı şey değildir.

Bu boyutları kendi paketlemenizde toplu değil, ayrı ayrı görmek istiyorsanız, bu çalışmanın kullandığı aynı skorlama işlem hattından bir thumbnail ve başlık geçirebilirsiniz — bu, bir demo sürümü değil, tam olarak aynı kod yolu.

Bu test neyi kanıtlamıyor?

Dört sınır, hepsi veri var olmazdan önce yazılmıştı.

Skoru test ediyor, tavsiyeyi değil. Önerilen bir başlığı uygulamanın gerçekten bir videoyu iyileştirip iyileştirmediği, henüz yapmadığımız farklı bir deneydir. Gözlemsel, nedensel değil: burada hiçbir şey, bir thumbnail’ı değiştirmenin görüntüleri değiştirdiğini göstermez, sadece skorun zaten var olan bir farkla ilişkili olduğunu gösterir.

Örnek, sonucun kimlere uygulanacağını belirler

Eşler, performans açısından keskin farklar gösterdikleri için seçildi, bu yüzden %59,5 bu nüfusu — açıkça üst performans gösterenler ve açıkça alt performans gösterenler — tanımlar, rastgele seçilmiş herhangi iki videoyu değil. Her kanal, kurulmuş, İngilizce ve kararlı bir taban çizgisine sahip yeterince büyüktü. Buradaki hiçbir şey, on iki yüklemesi ve ölçülecek bir geçmişi olmayan bir kanala genellenemez.

Görüntü sayıları tek bir tarihte yakalandı ve artmaya devam ediyor. Tamamı bir anlık görüntüdür ve bir anlık görüntüye dürüst yaklaşım, daha sonra başka bir tane almak.

Sıkça sorulan sorular

Thumbnail skoru için %59,5 doğruluk iyi midir?

Gerçek dünya sonuçlarına karşı tek bir paketleme sinyali için evet. Görüntüler, çoğunlukla konu, kitle büyüklüğü, zamanlama ve algoritmik şansla belirlenir, bu yüzden bir thumbnail ve başlık skoru sadece bir dilim açıklayabilir. %90'a yakın bir sayı, daha iyi bir model değil, test tasarımında bir sızıntı gösterirdi. Faydalı çerçeve, tahmin etmekten daha iyi olması ve daha emin olduğunda daha kararlı bir şekilde üstünlük sağlamasıdır.

Neden sadece thumbnail skorlarını doğrudan görüntü sayılarıyla karşılaştırmıyoruz?

Çünkü bu, kanal büyüklüğünü ölçer. Abone sayısı, konu ve video yaşı, paketlemeden çok daha fazla görüntüyü hareket ettirir ve daha büyük kanallar genellikle hem daha iyi tasarımcılara hem de daha büyük kitlelere sahiptir — bu yüzden korelasyon, thumbnail ile hiçbir ilgisi olmayan nedenlerle pozitif çıkar. Aynı kanaldan iki videoyu karşılaştırmak, hepsini tek bir adımda ortadan kaldırır.

Eşitliklerin başarısız olarak sayılması ne anlama geliyor?

On yedi çift, her iki tarafında da aynı skoru aldı. Sonucu övmek için bölünmüş ya da çıkarılmış yerine, her biri bir hata olarak kaydedildi. İki girdiyi ayıramayan bir skor, onları ayırmamıştır. Bu, bildirilen %59,5’in alternatif yaklaşımların ürettiği sayıdan daha düşük olmasını sağlar.

Daha yüksek bir thumbnail skoru daha fazla görüntü anlamına mı gelir?

Hayır. Çalışma, birçok çift arasında bir ilişki gösterir, tek bir video hakkında bir vaat değil. Yaklaşık onda dördü yanlış sıralandı. Paketleme, birkaç koldan sadece biridir ve kimse izlemek istemediği bir videoya yüksek skor, onu kurtaramaz.

60 kanal nasıl seçildi?

Veri toplanmadan önce sabitlenen bir kurala göre: uzun yükleme geçmişi olan, altı içerik kategorisinden her birinde onar tane, kategoriyi kapsayacak şekilde seçilen, thumbnail’ları hakkında hiçbir şey için değil, genel olarak bilinen kanallar. Liste, skorlama başlamadan önce donduruldu ve kaydedildi, böylece sonuçlar ortaya çıkmaya başladığında hiçbir kanal eklenemez ya da çıkarılamazdı.

Yöntemolojiyi görebilir ve kendim kontrol edebilir miyim?

Tam ön-kayıt — dışlamalar, eşleştirme kuralları, ana test, dört kontrol ve sıfır sonuç için önceden taahhüt edilen ifadeler — herhangi bir video skorlanmadan önce yazıldı ve zaman damgası konuldu. Toplu sonuçlar burada bildirildi; temel video verileri, YouTube API şartlarına uygun olarak yeniden yayınlanmadı.