Anda mengganti thumbnail, video berikutnya performanya lebih baik, lalu menyimpulkan gaya baru itu berhasil. Kesimpulan ini biasanya salah — bukan karena thumbnail tidak berpengaruh, tapi karena perbandingan tidak mampu mendeteksi apakah benar-benar berpengaruh. Berikut cara membedakan hasil kemasan nyata dari kebetulan, menggunakan aturan yang sama saat kami menguji model skor kami terhadap 321 pasang video.
Ringkasan utama
- Membandingkan video dengan rata-rata sepanjang sejarah channel mengukur seberapa banyak channel Anda tumbuh, bukan seberapa bagus kemasannya.
- Bandngkan dengan median dari sepuluh unggahan sebelum dan sesudahnya, kecuali video itu sendiri.
- Dua video tidak pernah cukup. Perbedaan kecil antar video tunggal tidak bisa dibedakan dari variasi mingguan biasa.
- Tentukan apa yang dianggap menang sebelum melihat data, atau Anda akan selalu menemukan “kemenangan” di mana-mana.
- Uji yang tidak bisa menghasilkan hasil negatif bukanlah uji. Tuliskan hasil apa yang akan membuat Anda meninggalkan ide tersebut.
Mengapa sebagian besar hasil uji thumbnail tidak nyata
Uji khas kreator membandingkan satu video dengan video sebelumnya. Perbandingan ini mencakup semua hal yang berubah antar unggahan: topik, hari, durasi, apakah algoritma mendorongnya, dan kemasan. Mengatribusikan seluruh perbedaan ke thumbnail mengasumsikan variabel lain tetap, padahal tidak pernah demikian.
Hasilnya, hampir semua perubahan terlihat berhasil karena jumlah tayangan berfluktuasi besar secara alami. Variasi antar unggahan berurutan di channel sehat biasanya jauh lebih besar daripada efek keputusan desain.
Ini bukan alasan berhenti menguji. Ini alasan untuk membangun perbandingan sehingga noise dihitung, bukan disalahartikan sebagai sinyal.
Apa yang sebaiknya Anda bandingkan dengan video Anda
Bandngkan setiap video dengan tetangganya, bukan dengan sejarah channel Anda. Ambil sepuluh unggahan sebelum dan sepuluh setelahnya, cari median jumlah tayangan dari dua puluh video itu, lalu nyatakan tayangan video Anda sebagai kelipatan median tersebut. Video dengan 1.0 performanya persis seperti tetangganya. Dengan 2.5, performanya dua setengah kali lebih baik.
Dua detail penting dan mudah salah. Gunakan median bukan rata-rata, karena satu unggahan viral di jendela itu akan mendefinisikan ulang baseline untuk dua puluh tetangganya. Dan kecualikan video itu sendiri dari baseline-nya, atau setiap video akan tertarik ke 1.0 dan ekstrem yang Anda pedulikan akan diratakan.
| Metode perbandingan | Apa yang dikontrol | Di mana ia gagal |
|---|---|---|
| Terdapat video sebelumnya | Hampir tidak ada | Satu titik data bising dibandingkan titik lain |
| Terdapat rata-rata sepanjang sejarah | Tidak ada tentang waktu | Channel yang tumbuh membuat setiap video terbaru terlihat seperti hit |
| Terdapat 30 hari terakhir | Ukuran channel, kira-kira | Musiman, dan satu video viral memiringkan rata-rata |
| Terdapat median berjalan tetangga | Ukuran channel, pertumbuhan, era | Masih tidak bisa memisahkan topik dari kemasan |
Mengapa jendela tetangga bekerja
Channel yang tiga kali lipat ukurannya dalam 18 bulan akan menunjukkan setiap unggahan terbaru mengalahkan rata-rata seumur hidupnya dan setiap unggahan lama jatuh di bawahnya. Dengan cara ini, kesimpulan kemasan yang Anda buat sebenarnya adalah pernyataan tentang kapan setiap video dipublikasikan.
Jendela berjalan menghilangkan itu, karena tetangga video dipublikasikan ke channel, ukuran audiens, dan kondisi algoritmik yang sama. Apa yang tersisa lebih masuk akal berkaitan dengan video itu sendiri.
Seberapa besar perbedaan yang dianggap perbedaan nyata
Dasar yang berguna adalah faktor dua. Saat kami memilih pasangan untuk studi kami, kami mensyaratkan video yang performanya lebih baik memiliki setidaknya dua kali kelipatan tayangan dari yang lebih buruk. Apa pun yang lebih sempit meminta uji untuk membedakan dua video yang noise channel Anda sendiri bisa dengan mudah pisahkan.
Rasio di bawah sekitar 1.3 sebaiknya dianggap tidak ada hasil sama sekali. Ini bukan ambang batas universal yang ketat — tergantung seberapa bervariabel channel Anda — tapi jauh lebih mendekati benar daripada menganggap perbedaan 10% sebagai bukti.
Bagian lain dari pertanyaan ini adalah berapa banyak perbandingan yang Anda butuhkan. Satu pasang hampir tidak memberi informasi. Aritmetika yang tidak nyaman adalah mendeteksi efek kemasan kecil secara andal membutuhkan ratusan perbandingan, itulah sebabnya kreator individu kesulitan membuktikan apa pun tentang channel mereka sendiri dan mengapa langkah jujur adalah memperlakukan hasil tunggal sebagai bukti lemah, bukan bukti.
Daftar periksa untuk menguji kemasan di channel Anda sendiri
Lima langkah ini mengubah kesan menjadi sesuatu yang lebih dekat ke pengukuran. Tidak satu pun memerlukan alat selain spreadsheet.
- Tuliskan, sebelum memulai, hasil apa yang akan meyakinkan Anda bahwa perubahan itu tidak berhasil. Uji tanpa hasil gagal bukanlah uji.
- Hitung kelipatan tayangan setiap video terhadap median unggahan tetangganya, bukan terhadap angka seumur hidup.
- Kumpulkan setidaknya sepuluh video di setiap kondisi sebelum menarik kesimpulan, dan tahan diri dari melihat total berjalan di antaranya.
- Kecualikan Shorts, siaran langsung, kolaborasi, dan apa pun yang kurang dari enam minggu, karena keempatnya memiliki pendorong performa yang tidak terkait kemasan.
- Periksa apakah penjelasan lebih sederhana cocok — topik yang belum pernah Anda bahas, unggahan yang dibagikan di suatu tempat, lonjakan musiman.
Langkah tiga adalah yang paling sering dilewati, dan menghentikan uji saat terlihat menguntungkan adalah cara paling efektif untuk meyakinkan diri sendiri akan sesuatu yang tidak benar.
Jika Anda ingin menilai kemasan sebelum video dipublikasikan, bukan berminggu-minggu setelahnya, Anda bisa menilai thumbnail dan judul terhadap dua belas faktor kemasan dan membandingkan dua opsi berdampingan — prediksi yang kemudian bisa Anda periksa terhadap hasil setelah video matang.
Kesalahan yang membuat uji terlihat meyakinkan padahal tidak
Empat mode kegagalan menyebabkan sebagian besar kesimpulan salah, dan masing-masing memiliki perbaikan sederhana.
Menghentikan saat jawabannya terlihat bagus
Memeriksa hasil saat terakumulasi dan berhenti di momen menguntungkan pertama akan menghasilkan hasil positif dari noise murni jika diberi kesabaran cukup. Tetapkan ukuran sampel di awal dan analisis sekali. Dalam studi kami, kami sengaja menghilangkan keputusan penghentian sama sekali: sampel adalah apa pun yang dihasilkan aturan pra-setel, yang berjumlah 321 pasang terhadap target 400.
Kami melaporkan kekurangan itu sebagai kurang kuat daripada diam-diam memperpanjang pengumpulan, karena aturan penghentian yang bisa diterapkan siapa pun saat melihat hasil adalah cara hasil nol berubah menjadi temuan.
Memotong ulang hingga sesuatu bekerja
Jika hasil keseluruhan datar, menggoda untuk memeriksa apakah berhasil untuk konten panjang, atau satu kategori, atau video yang dipublikasikan hari Selasa. Uji cukup banyak subkelompok dan satu akan terlihat signifikan hanya karena kebetulan. Tentukan perbandingan mana yang penting sebelum melihat, dan labeli semua yang lain sebagai eksploratif saat Anda melaporkannya.
Bagaimana kami menerapkan aturan ini ke 321 pasang video
Studi kami sendiri mengikuti struktur ini persis. Enam puluh channel di enam kategori, hingga 300 unggahan masing-masing, 17.250 video dipertimbangkan setelah pengecualian. Video dinilai terhadap median berjalan tetangganya, dan pasangan dibentuk hanya dalam satu channel, dipublikasikan rata-rata enam hari terpisah, dengan yang unggul mengalahkan yang kalah dengan faktor median 4.7.
Semua aturan — pengecualian, batasan pasangan, uji utama, empat kontrol, dan perumusan untuk dipublikasikan jika hasilnya nol — ditulis dan diberi cap waktu sebelum video mana pun dinilai. Skor memilih video yang performanya lebih baik di 59.5% pasangan terhadap baseline 50%.
Bagian yang layak ditiru bukan ukuran sampelnya. Itu adalah analisis tidak memiliki keputusan tersisa saat data tiba.
Pertanyaan yang sering diajukan
Berapa banyak video yang saya butuhkan untuk menguji gaya thumbnail?
Lebih dari yang bisa dihasilkan sebagian besar channel dengan cepat. Mendeteksi efek kemasan kecil secara andal membutuhkan ratusan perbandingan, itulah sebabnya hasil video tunggal adalah bukti lemah. Dengan sepuluh video per kondisi Anda bisa melihat efek besar; Anda tidak bisa melihat efek halus, dan menganggap perbedaan kecil sebagai bukti pada ukuran sampel itu adalah kesalahan pengujian paling umum.
Apa yang sebaiknya saya bandingkan dengan tayangan video?
Median jumlah tayangan dari sepuluh unggahan sebelum dan sepuluh setelahnya, kecuali video itu sendiri. Ini menjaga ukuran, pertumbuhan, dan era channel Anda kira-kira konstan, sehingga yang tersisa lebih mungkin berkaitan dengan video itu. Membandingkan dengan rata-rata seumur hidup mengukur seberapa banyak channel Anda tumbuh.
Mengapa gunakan median bukan rata-rata?
Karena satu unggahan yang sangat sukses di dalam jendela akan menarik baseline rata-rata ke atas dan membuat dua puluh tetangganya semua terlihat seperti underperformer. Median hampir tidak terpengaruh oleh satu outlier, sehingga baseline terus menggambarkan video tipikal dari periode itu, bukan yang luar biasa.
Berapa lama saya harus menunggu sebelum menilai performa video?
Setidaknya enam minggu. Tayangan terakumulasi tidak merata, dan peringkat video terhadap tetangganya bisa berubah signifikan dalam bulan pertama. Dalam studi kami, kami mengecualikan apa pun yang dipublikasikan dalam 45 hari terakhir dari tanggal pengukuran karena alasan ini, serta apa pun yang lebih dari dua tahun.
Apakah saya bisa mempercayai uji thumbnail yang hanya membandingkan dua video?
Anggap sebagai petunjuk, bukan hasil. Dua video berbeda dalam topik, waktu, durasi, dan lusinan cara lain, jadi mengatribusikan seluruh celah ke kemasan mengasumsikan segala sesuatu lainnya tetap. Layak diperhatikan dan layak diulang, tapi bukan dasar untuk mengubah pendekatan seluruh channel.
Apa itu kelipatan tayangan dan bagaimana cara menghitungnya?
Bagi jumlah tayangan video dengan median tayangan unggahan tetangganya, kecuali dirinya sendiri. Hasil 1.0 berarti performanya seperti tetangganya, 2.0 berarti dua kali lebih baik, 0.5 berarti setengah. Ini mengubah jumlah tayangan mentah, yang sangat bergantung pada kapan video dipublikasikan, menjadi angka yang bisa dibandingkan sepanjang sejarah channel Anda.