Setelah menguji skor thumbnail kami terhadap 321 pasang video nyata, kami mencoba membuatnya lebih akurat. Kami mencoba empat hal. Satu mengubah angka, dan setelah diperiksa ternyata itu adalah pengukuran yang lebih adil, bukan model yang lebih baik. Tiga lainnya tidak mengubah apa pun, atau justru membuat skor lebih sulit dipercaya. Berikut masing-masingnya, beserta angkanya.
Ringkasan utama
- Membandingkan skor dengan presisi penuh, bukan sebagai bilangan bulat bulat, meningkatkan akurasi terukur dari 59,5% menjadi 62,0%, dan seluruh peningkatan itu berasal dari 17 hasil imbang sebelumnya yang terpecah secara merata.
- Petunjuk penilaian yang ditulis ulang terlihat seperti terobosan pada 30 thumbnail, tetapi tidak berpengaruh pada 322: 64,6% sebelum dan 63,4% setelah, pada 161 pasang.
- Meminta AI membandingkan dua thumbnail secara langsung memberi hasil rata-rata yang sama dengan skor biasa, 62,7% masing-masing, tetapi jawabannya bergantung pada gambar mana yang muncul lebih dulu.
- Pengaturan penalaran model tidak mengubah apa pun kecuali pada level tertinggi, dan level itu tidak pernah memberi jawaban di wilayah Eropa yang kami gunakan untuk menjaga unggahan tetap di dalam UE.
- Hasil yang dipublikasikan dan telah terdaftar sebelumnya tetap di 59,5%. Semua yang ada di sini adalah pekerjaan lanjutan dan dilabeli demikian.
Apakah skor thumbnail bisa dibuat lebih akurat setelah diuji?
Tidak mudah, dalam kasus kami. Dari empat perubahan yang kami uji terhadap video nyata, satu meningkatkan akurasi terukur, dari 59,5% menjadi 62,0%, dan itu dilakukan dengan memperbaiki cara skor dibandingkan, bukan dengan membuat model melihat sesuatu yang baru. Tiga lainnya tidak mengubah akurasi. Skor ini tampaknya sudah mendekati batas kemampuan model ini.
Itu jawaban yang kurang menarik dibanding rekor baru, tapi lebih berguna. Ini menunjukkan di mana usaha sebaiknya tidak diarahkan, dan menjelaskan mengapa setiap ide menarik gagal. Ini penting bukan hanya untuk skor ini, karena jebakan yang sama juga menjerat kreator yang menguji thumbnail mereka sendiri.
Perbaikan yang berhasil: hentikan pembulatan sebelum membandingkan
Skor yang Anda lihat adalah bilangan bulat dari 0 hingga 100. Dalam uji coba awal kami, dua video dalam satu pasang kadang-kadang mendapat skor bilangan bulat yang sama, dan ini terjadi 17 kali dari 321 pasang. Aturan pra-terdaftar kami menghitung setiap hasil imbang sebagai kegagalan, dengan alasan bahwa skor yang tidak bisa membedakan dua video belum membedakannya.
Di balik bilangan bulat itu ada nilai presisi, dan pembulatan membuang perbedaan tersebut. Membandingkan nilai presisi tidak menghasilkan hasil imbang sama sekali, dan akurasi terukur naik dari 59,5% menjadi 62,0%: 199 dari 321 pasang, bukan 191. Tidak ada video yang dinilai ulang dan tidak ada bobot yang diubah; nilai presisi sudah ada sebelumnya.
Mengapa itu angka yang lebih adil, bukan model yang lebih baik
Pertanyaan yang jelas adalah ke mana 17 hasil imbang itu berakhir. Jika model diam-diam sudah benar, pembulatan akan menyembunyikan kemampuan nyata. Ternyata tidak. Delapan dari 17 hasil imbang jatuh ke video yang performanya lebih baik, dan sembilan tidak — sekitar seperti hasil lemparan koin.
Jadi, peningkatan ini berasal dari tidak lagi menandai lemparan koin sebagai kegagalan otomatis, bukan karena model tahu lebih banyak. Itu sebabnya hasil yang dipublikasikan tetap di 59,5%: itu angka yang kami komitmenkan sebelumnya, di bawah aturan yang ditulis sebelum kami melihat data apa pun. 62,0% dilaporkan sebagai pengukuran lanjutan, dilabeli jelas, dan menggambarkan model yang sama.
Menyesuaikan instruksi: uji coba kecil yang terlihat seperti terobosan
Penilaian model cenderung berkumpul. Beberapa dari dua belas faktor yang membentuk skor berada dalam kisaran sempit di ratusan thumbnail nyata, dan uji coba awal kami menunjukkan skor paling andal ketika memisahkan dua video jauh-jauh. Jadi kami menulis ulang instruksi untuk memberi skala titik acuan: 50 berarti video biasa di feed yang sama, 90 ke atas disediakan untuk sepuluh persen teratas.
Pada uji coba 30 thumbnail, dinilai di bawah kedua versi, terlihat seperti berhasil. Delapan dari dua belas faktor menyebar, dan dua di antaranya hampir menggandakan sebarannya. Kami lalu menjalankan instruksi baru pada 322 thumbnail. Dua faktor yang hampir menggandakan sebarannya hanya tumbuh 1,1 dan 0,1 poin sebaran. Pada 161 pasang, instruksi asli memilih video yang lebih baik 64,6% dari waktu, dan yang baru 63,4%, perbedaan yang masih dalam batas kebetulan. Versi baru juga menurunkan hampir setiap penilaian sebesar lima hingga tujuh poin, sehingga akan merugikan setiap kreator beberapa poin skor tanpa hasil.
Mengapa sebaran lebih luas tidak berarti akurasi lebih tinggi
Uji coba ini terlalu kecil. Dengan 30 thumbnail, ukuran seberapa tersebarnya penilaian bisa berubah drastis karena kebetulan, dan dua faktor yang menggandakan sebarannya masih dalam rentang itu. Uji coba ini seharusnya dibaca sebagai alasan untuk menjalankan uji coba lebih besar, bukan sebagai hasil.
Uji coba lebih besar memberi pelajaran kedua. Dua faktor, rasa ingin tahu dan risiko clickbait, benar-benar menyebar di 322 thumbnail, tetapi peringkat tetap tidak membaik. Penilaian yang lebih lebar hanya membantu jika lebar tambahan mengikuti perbedaan nyata antar video. Di sini, itu mengikuti kebisingan, dan kebisingan yang terlihat seperti kepercayaan diri lebih buruk daripada tidak ada sama sekali.
Membandingkan thumbnail secara langsung, bukan menilainya
Menilai setiap thumbnail secara terpisah lalu membandingkan angkanya bukan cara orang memilih antar thumbnail; mereka melihat dua gambar berdampingan. Jadi kami meminta model melakukan itu: ditunjukkan kedua video dari satu pasang, mana yang lebih unggul? Setiap dari 161 pasang ditunjukkan dua kali, sekali dalam setiap urutan.
Rata-rata dari kedua urutan, penilai head-to-head benar 62,7% dari waktu, tepat sama dengan skor biasa pada 150 pasang yang dijawab lengkap. Tapi ia memilih thumbnail mana pun yang dilihat pertama 64,7% dari waktu, dan untuk hampir sepertiga pasang, ia memberi jawaban berlawanan hanya karena urutan. Akurasi sama dengan stabilitas jauh lebih rendah berarti tidak diadopsi. Hasil lengkap ada di tulisan terpisah kami tentang meminta AI membandingkan thumbnail.
Mengaktifkan mode penalaran model
Model menawarkan pengaturan yang membuatnya mengerjakan masalah langkah demi langkah sebelum menjawab, di beberapa tingkat usaha. Di tiga tingkat lebih rendah, analisis lengkap thumbnail uji coba kembali dengan dua belas penilaian yang sama seperti saat pengaturan dimatikan. Hanya tingkat tertinggi yang mengubah perilaku model sama sekali.
Di pusat data Eropa yang kami gunakan, agar thumbnail yang diunggah tidak pernah diproses di luar UE, tingkat tertinggi itu tidak pernah memberi jawaban, meski dicoba berulang kali hingga tiga menit. Kami memastikan ini berfungsi di wilayah AS menggunakan soal aritmetika buatan tanpa thumbnail, dan menemukan ia menulis penalarannya sebagai teks biasa di depan jawaban, bukan memisahkannya. Memindahkan unggahan ke AS untuk mencari tahu apakah ini membantu bukan pertukaran yang bersedia kami lakukan.
Keempat hasil berdampingan
Setiap perubahan dibandingkan dengan versi asli pada pasangan yang sama, jadi setiap perbedaan di bawah ini adalah perbandingan setara.
| Perubahan | Apa yang dilakukannya terhadap akurasi peringkat | Dipertahankan? |
|---|---|---|
| Bandingkan skor tanpa pembulatan | 59,5% ke 62,0% pada 321 pasang, seluruhnya dari hasil imbang sebelumnya yang pecah secara merata | Ya, sebagai pengukuran yang lebih adil |
| Instruksi penilaian yang dikalibrasi | 64,6% ke 63,4% pada 161 pasang, tidak ada perbedaan yang terdeteksi | Tidak |
| Bandingkan thumbnail secara langsung | 62,7% vs 62,7% pada 150 pasang, dengan jawaban yang bergantung pada urutan | Tidak |
| Mode penalaran model | Tidak ada perubahan di tingkat yang berjalan; tingkat tertinggi tidak pernah menjawab di wilayah kami | Tidak |
Semua angka di sini berasal dari pipa penilaian yang sama yang berjalan saat Anda menganalisis thumbnail dan judul. Uji coba menilai video nyata melalui produk itu sendiri, bukan melalui salinan riset terpisah.
Bagaimana kami menjaga kejujuran uji coba lanjutan ini
Uji coba lanjutan adalah tempat studi biasanya salah, karena peneliti sudah tahu jawaban mana yang mereka inginkan. Lima aturan menjaga hal ini tetap terkendali:
- Hasil yang dipublikasikan tidak pernah diubah. 59,5% yang telah terdaftar tetap menjadi berita utama, dan setiap analisis selanjutnya dilabeli sebagai pekerjaan lanjutan.
- Saluran dibagi dua sebelum setiap perubahan diuji. Eksperimen menggunakan satu setengah, dan setengah lainnya disimpan untuk pemeriksaan akhir.
- Setiap perubahan dibandingkan dengan versi asli pada pasangan yang sama, hanya menghitung pasangan di mana keduanya tidak setuju, yang jauh lebih sensitif daripada membandingkan dua persentase keseluruhan.
- Uji coba kecil diperlakukan sebagai alasan untuk menjalankan uji coba lebih besar, bukan sebagai hasil dalam dirinya sendiri.
- Setiap perbandingan head-to-head ditunjukkan dalam kedua urutan, sehingga preferensi posisi tidak bisa disamarkan sebagai kemampuan.
Tidak satu pun dari ini memerlukan gelar statistik, dan sebagian besar berlaku langsung bagi kreator yang menguji thumbnail mereka sendiri: tentukan apa yang dianggap menang sebelum melihat, bandingkan yang setara, dan perlakukan hasil awal kecil sebagai alasan untuk terus menguji.
Batasan hasil lanjutan ini
Semua empat eksperimen menggunakan saluran berbahasa Inggris yang sama dan sudah mapan seperti uji coba asli, dan satu model. Ide-ide ini dipilih setelah hasil asli diketahui, yang justru merupakan situasi yang cenderung memperindah temuan, dan satu alasan lagi mengapa berita utama tetap di angka pra-terdaftar.
Setiap perubahan dicoba sekali, dalam satu bentuk. Perumusan instruksi yang berbeda mungkin lebih baik, dan hasil mode penalaran menggambarkan apa yang tersedia di satu wilayah pada September 2026. Tidak satu pun dari hasil ini mengatakan skor tidak bisa ditingkatkan; mereka mengatakan keempat jalur ini tidak meningkatkannya.
Pertanyaan yang sering diajukan
Mengapa tidak melaporkan 62,0% sebagai akurasi?
Karena aturan uji coba ditetapkan sebelum ada data apa pun, dan mereka menghitung hasil imbang sebagai kegagalan. Mengubah aturan setelah melihat hasil adalah tepat apa yang pendaftaran sebelumnya ada untuk mencegah, bahkan ketika perubahan itu masuk akal. 62,0% dipublikasikan sebagai pengukuran lanjutan yang dilabeli jelas, di samping 59,5% yang tidak digantikannya.
Apakah model AI yang lebih pintar akan membuat skor lebih akurat?
Mungkin, tapi itu akan menjadi eksperimen baru. Pengaturan penalaran model kami saat ini tidak membantu di wilayah yang kami gunakan, dan model berbeda perlu diuji terhadap pasangan yang sama, dengan cara yang sama, sebelum klaim apa pun bisa dibuat. Lebih baru tidak otomatis berarti lebih baik untuk tugas khusus ini.
Mengapa uji coba pada 30 thumbnail terlihat begitu meyakinkan?
Sampel kecil menghasilkan fluktuasi besar karena kebetulan, dan fluktuasi besar terlihat seperti penemuan. Dengan 30 thumbnail, dua faktor yang tampaknya menggandakan sebarannya masih dalam variasi normal; pada 322 thumbnail, efeknya hampir hilang. Ini adalah jebakan yang sama seperti menilai gaya thumbnail baru berdasarkan dua unggahan.
Apa artinya ini untuk menguji thumbnail saya sendiri?
Aturan yang sama berlaku. Tentukan apa yang dianggap sukses sebelum Anda melihat, bandingkan dengan rentang normal saluran Anda daripada satu video sebelumnya, jalankan cukup contoh sehingga kebetulan tidak bisa menjelaskan hasilnya, dan jika Anda meminta alat apa pun untuk membandingkan dua opsi, periksa apakah jawabannya bertahan saat Anda menukar keduanya.
Apakah skor ini masih layak digunakan jika perbaikan ini gagal?
Skor ini diuji terhadap hasil nyata dan mengalahkan kebetulan dengan selisih jelas. Lanjutan ini menunjukkan bahwa empat perubahan menarik tidak mendorongnya lebih jauh, yang berguna untuk diketahui daripada alasan untuk membuangnya. Perlakukan sebagai satu masukan terinformasi di antara beberapa, bukan sebagai prediksi jumlah tayangan.