risetthumbnailanalitik-youtube

Kami Uji Skor Thumbnail Kami pada 321 Video Nyata

Uji pra-terdaftar apakah skor thumbnail dan judul YouTube mencerminkan performa nyata. 321 pasangan video dari saluran yang sama, empat kontrol, dan hasil yang kami janjikan untuk dipublikasikan apa pun hasilnya.

September 4, 20269 min read
Kami Uji Skor Thumbnail Kami pada 321 Video Nyata

Skor thumbnail hanya berharga jika mencerminkan apa yang benar-benar terjadi di YouTube. Jadi kami menjalankan uji yang bisa mempermalukan kami: 321 pasangan video nyata, masing-masing pasangan dari saluran yang sama, satu yang mengungguli rata-rata saluran itu sendiri dan satu yang jatuh di bawahnya. Kami menuliskan metode sebelum melihat data apa pun. Skor memilih video dengan performa lebih baik sebanyak 59,5% dari waktu, dibandingkan lemparan koin 50%.

Ringkasan utama

  • Dari 321 pasangan, skor menempatkan video dengan performa lebih baik di posisi lebih tinggi sebanyak 59,5% (p = 0,00079). Peluang acak adalah 50%.
  • Membandingkan video dari saluran berbeda mengukur jumlah pelanggan, bukan kemasan — setiap pasangan di sini berasal dari satu saluran, dipublikasikan dengan selisih median enam hari.
  • Pada saluran di mana setiap thumbnail mengikuti template yang sama, akurasi turun menjadi 48,7%. Itu adalah hasil yang kami inginkan: tidak ada perbedaan untuk dibaca, tidak ada sinyal untuk ditemukan.
  • Empat heuristik sederhana — judul lebih panjang, lebih banyak kata, ukuran file lebih besar, kontras lebih tinggi — semuanya berada di tingkat peluang acak. Skor bukan proksi untuk salah satu dari mereka.
  • Semakin besar jarak yang diberikan model antara dua video, semakin sering model itu benar: 56% pada jarak 1-3 poin, 76,5% pada 15 poin atau lebih.

Apakah skor thumbnail YouTube benar-benar memprediksi performa?

Dalam uji ini, ya — secara moderat dan terukur. Diberikan dua video dari saluran yang sama, satu yang jelas mengungguli baseline-nya sendiri dan satu yang jelas di bawahnya, skor kami menempatkannya dengan benar 59,5% dari waktu. Peluang acak adalah 50%. Interval kepercayaan 95% berjalan dari 53,9% hingga 64,9%, jadi efeknya nyata tetapi kecil.

Kecil adalah jawaban jujur, dan siapa pun yang mengklaim lebih banyak sedang menjual sesuatu. Kemasan hanyalah satu dari banyak input. Topik, waktu unggah, suasana algoritma minggu itu, apakah video diangkat di luar platform — semua itu memengaruhi jumlah tayangan lebih besar daripada thumbnail. Skor yang mengklaim akurasi 90% akan menggambarkan YouTube yang tidak ada.

Apa arti 59,5% dalam praktik: jika Anda memilih antara dua opsi untuk video yang sama, skor ini lebih baik daripada menebak, dan lebih berguna semakin kuat preferensinya terhadap satu opsi.

Mengapa membandingkan thumbnail antar saluran tidak memberi informasi apa pun

Versi paling jelas dari uji ini adalah menilai sekelompok thumbnail dan mengkorelasikan skor terhadap jumlah tayangan. Itu mengukur ukuran saluran. Tayangan didorong oleh jumlah pelanggan, topik, dan usia video jauh lebih besar daripada kemasan, dan faktor pengganggu berjalan ke arah yang menguntungkan: saluran besar bisa membeli desainer bagus dan memiliki audiens besar.

Jalankan uji itu dan Anda akan mendapatkan korelasi positif yang bagus tetapi tidak berarti apa-apa. Hasil itu akan bertahan hanya untuk satu pembaca skeptis.

Apa yang harus tetap konstan dalam perbandingan yang adil

Membandingkan dua video dari saluran yang sama membatalkan jumlah pelanggan, audiens, anggaran, dan kompetensi desain dalam satu langkah, karena keempatnya identik dalam pasangan. Mensyaratkan keduanya dipublikasikan dekat satu sama lain juga membatalkan lintasan pertumbuhan saluran dan rezim algoritma periode itu.

Apa yang tersisa adalah pertanyaan dengan jawaban yang diketahui di bawah hipotesis nol: diberikan dua video yang audiens saluran itu sendiri perlakukan sangat berbeda, dapatkah skor mengenali mana yang mana?

Bagaimana kami membangun uji yang adil pada 321 pasangan yang cocok

Kami mengambil 60 saluran dari enam kategori — teknologi, pendidikan, memasak, gaming, kebugaran, dan gaya hidup — dan menarik hingga 300 unggahan terbaru dari masing-masing. Setelah pengecualian, tersisa 17.250 video yang dipertimbangkan dan 321 pasangan yang dapat digunakan. Setiap pasangan berasal dari saluran yang sama, dipublikasikan dengan selisih median enam hari, dengan video yang unggul mengalahkan yang kurang unggul dengan faktor median 4,7.

Performa diukur terhadap baseline lokal bergerak, bukan rata-rata saluran. Untuk setiap video, kami mengambil median tayangan dari sepuluh unggahan terdekat di kedua sisi, kecuali dirinya sendiri, dan menyatakan tayangannya sendiri sebagai kelipatan dari itu. Saluran yang tumbuh lima kali lipat dalam dua tahun akan menganggap setiap video awal sebagai kegagalan dan setiap video terbaru sebagai sukses — mengukur kalender, bukan kemasan.

Aturan pasangan ditetapkan sebelumnya:

  1. Kedua video berasal dari saluran yang sama, dan setiap video muncul dalam paling banyak satu pasangan.
  2. Mereka dipublikasikan dalam jangka waktu 120 hari satu sama lain.
  3. Video yang unggul mengalahkan yang kurang unggul dengan faktor minimal dua, sehingga "lebih baik" dan "lebih buruk" memiliki makna nyata, bukan hanya menggambarkan kebisingan.
  4. Tidak ada saluran yang menyumbang lebih dari delapan pasangan, sehingga satu pengunggah produktif tidak bisa mendominasi sampel.

Shorts dikecualikan, bersama dengan siaran langsung, video di bawah 45 hari, dan yang lebih dari dua tahun. Skor hanya melihat thumbnail dan judul — persis seperti yang diterima alat dari pengguna — dan tidak ada informasi tentang jumlah tayangan atau sisi mana dari pasangan yang sedang dilihat.

Apa yang benar menurut skor, dan seberapa sering

Model memilih video dengan performa lebih baik dalam 191 dari 321 pasangan: 59,5%, dengan nilai p binomial tepat 0,00079 terhadap nol 50%. Tujuh belas pasangan kembali sebagai hasil imbang tepat, dan setiap satu dihitung sebagai kegagalan, bukan dibagi atau dihapus, karena skor yang tidak bisa membedakan dua input belum membedakan keduanya.

Menghitung hasil imbang sebagai kegagalan membuat angka utama konservatif. Model tanpa kemampuan sama sekali akan mencetak sekitar 47,4% di bawah aturan itu, bukan 50%, jadi uji ini meminta model kami melewati batas sedikit di atas tingkat peluang nyata. Di antara 304 pasangan yang benar-benar dipisahkan, model benar 62,8% dari waktu.

Ketepatan mengikuti kepercayaan

Pola yang membuat hasil ini berperilaku seperti pengukuran, bukan kebetulan: semakin jauh skor memisahkan dua video, semakin sering skor itu benar.

Pada jarak 1-3 poin, akurasi 56,0%. Pada 4-7 poin, 64,1%. Pada 8-14 poin, 63,2%. Pada 15 poin atau lebih, 76,5%. Model yang menghasilkan kebisingan akan menunjukkan garis datar di seluruh kategori itu. Model ini justru semakin baik saat semakin yakin, yang merupakan perilaku yang Anda inginkan dan tidak bisa dipalsukan.

Empat pemeriksaan yang bisa membuktikan kami salah

Studi yang tidak bisa gagal bukanlah bukti. Kami menentukan empat kontrol sebelumnya, masing-masing mampu membatalkan hasil utama, dan berkomitmen untuk mempublikasikan keempatnya apa pun hasilnya. Semuanya berperilaku seperti yang seharusnya.

KontrolApa arti kegagalanHasil
Acak label pemenang/pecundang 1.000 kaliPipeline bocor jawaban; seluruh hasil tidak sah47,1%, tepat di mana teori menyatakan harus mendarat
Saluran yang thumbnail-nya mengikuti satu template tetapSkor membaca sesuatu selain kemasan48,7% — peluang acak, seperti diprediksi
Heuristik sederhana: panjang judul, jumlah kata, ukuran file, kontrasAturan satu baris cocok dengan model, jadi model tidak menambah apa-apa46,7%-54,5%, tidak ada yang signifikan
Ulangi penilaian setiap thumbnail terhadap judul video lainJudul tidak berkontribusi apa-apa dan kami hanya menilai satu bagian, bukan duaSkor berubah rata-rata 11,3 poin

Pemeriksaan template adalah yang paling penting, dan perlu dijelaskan mengapa. Pada saluran yang menggunakan satu tata letak thumbnail untuk semua video, hampir tidak ada yang bisa dibandingkan oleh model visual. Jika skor kami dengan percaya diri memilih pemenang di sana, itu berarti membaca identitas saluran atau era unggah, bukan kemasan. Skor mencapai 48,7% di saluran itu dan 61,0% di tempat lain. Selisih itu adalah bukti terkuat studi ini bahwa hal yang diukur adalah hal yang kami klaim.

Dimensi penilaian mana yang memisahkan pemenang dari pecundang

Bagian ini bersifat eksploratif, bukan konfirmatif, dan menggambarkan sampel ini, bukan YouTube secara umum. Menyusun ulang dua belas sub-skor berdasarkan seberapa jauh mereka memisahkan dua kelompok, pemisahan paling jelas datang dari kejelasan janji, diikuti oleh sinyal takut ketinggalan dan urgensi. Intensitas emosional hampir tidak memisahkan mereka sama sekali.

Kejelasan janji — seberapa jelas kemasan memberi tahu Anda apa yang akan Anda tonton — memimpin tabel sesuai dengan apa yang ingin ditangkap oleh sisi kepuasan model. Pemisah terlemah, intensitas emosional mentah, adalah bagian yang lebih menarik: perasaan kuat dalam thumbnail tidak membedakan antara video yang melebihi atau di bawah performa dalam sampel ini, yang bukan asumsi kebanyakan saran thumbnail.

Jika Anda ingin melihat dimensi ini pada kemasan Anda sendiri, bukan secara agregat, Anda bisa menjalankan thumbnail dan judul melalui pipeline penilaian yang sama yang digunakan dalam studi ini — ini adalah jalur kode yang identik, bukan versi demo.

Apa yang tidak dibuktikan oleh uji ini

Empat batasan, semuanya ditulis sebelum data ada.

Uji ini menguji skor, bukan saran. Apakah bertindak atas judul yang disarankan benar-benar meningkatkan video nyata adalah eksperimen berbeda yang belum kami lakukan. Ini bersifat observasional, bukan kausal: tidak ada di sini yang menunjukkan bahwa mengubah thumbnail mengubah tayangan, hanya bahwa skor dikaitkan dengan perbedaan yang sudah ada.

Sampel menentukan siapa yang hasilnya berlaku

Pasangan dipilih tepat karena mereka berbeda tajam dalam performa, jadi 59,5% menggambarkan populasi itu — jelas melebihi versus jelas di bawah — dan bukan dua video acak. Setiap saluran sudah mapan, berbahasa Inggris, dan cukup besar untuk memiliki baseline stabil. Tidak ada yang di sini bisa digeneralisasi ke saluran dengan dua belas unggahan dan tanpa riwayat untuk dijadikan acuan.

Jumlah tayangan dicatat pada satu tanggal dan terus bertambah. Semuanya adalah potret, dan cara jujur untuk memperlakukan potret adalah mengambil potret lain nanti.

Pertanyaan yang Sering Diajukan

Apakah akurasi 59,5% bagus untuk skor thumbnail?

Untuk satu sinyal kemasan terhadap hasil dunia nyata, ya. Tayangan tergantung terutama pada topik, ukuran audiens, waktu, dan keberuntungan algoritmik, jadi skor thumbnail-dan-judul hanya bisa menjelaskan sebagian. Angka lebih dekat ke 90% akan menunjukkan kebocoran dalam desain uji, bukan model yang lebih baik. Kerangka kerja yang berguna adalah bahwa skor ini lebih baik daripada menebak, dan lebih menentukan saat ia percaya diri.

Mengapa tidak langsung membandingkan skor thumbnail dengan jumlah tayangan?

Karena itu mengukur ukuran saluran. Jumlah pelanggan, topik, dan usia video memengaruhi tayangan jauh lebih besar daripada kemasan, dan saluran lebih besar cenderung memiliki desainer lebih baik dan audiens lebih besar — jadi korelasinya positif karena alasan yang tidak ada hubungannya dengan thumbnail. Membandingkan dua video dari saluran yang sama menghilangkan semua itu dalam satu langkah.

Apa artinya hasil imbang dihitung sebagai kegagalan?

Tujuh belas pasangan menerima skor identik di kedua sisi. Alih-alih membaginya atau menghapusnya, yang keduanya akan memperindah hasil, masing-masing dicatat sebagai kegagalan. Skor yang tidak bisa membedakan dua input belum membedakan keduanya. Ini membuat 59,5% yang dilaporkan lebih rendah daripada perlakuan alternatif.

Apakah skor thumbnail lebih tinggi berarti lebih banyak tayangan?

Tidak. Studi ini menunjukkan asosiasi di banyak pasangan, bukan janji tentang video tertentu. Sekitar empat dari sepuluh pasangan diberi peringkat terbalik. Kemasan hanyalah satu tuas di antara beberapa, dan skor kuat pada video yang tidak ingin ditonton siapa pun tidak akan menyelamatkannya.

Bagaimana 60 saluran dipilih?

Dengan aturan yang ditetapkan sebelum data dikumpulkan: saluran yang dikenal luas dengan riwayat unggah panjang, sepuluh di masing-masing enam kategori konten, dipilih untuk cakupan kategori, bukan karena apa pun tentang thumbnail mereka. Daftar dibekukan dan dicatat sebelum penilaian dimulai, sehingga tidak ada saluran yang bisa ditambahkan atau dihapus setelah hasil mulai muncul.

Bolehkah saya melihat metodologi dan memeriksanya sendiri?

Registrasi penuh sebelumnya — pengecualian, aturan pasangan, uji utama, keempat kontrol, dan perumusan yang dijanjikan sebelumnya untuk hasil nol — ditulis dan diberi stempel waktu sebelum video mana pun dinilai. Hasil agregat dilaporkan di sini; data video dasar tidak dipublikasikan ulang, sesuai dengan ketentuan API YouTube.