Wynik miniatury ma wartość tylko wtedy, gdy odzwierciedla to, co faktycznie dzieje się na YouTube. Przeprowadziliśmy test, który mógłby nas zawstydzić: 321 par rzeczywistych filmów, każda para z tego samego kanału — jeden przekraczający średnią kanału, drugi ją nie osiągający. Zapisaliśmy metodę zanim spojrzeliśmy na dane. Wynik wskazał lepiej performingowy film w 59,5% przypadków, wobec 50% przy losowym wyborze.
Kluczowe wnioski
- W 321 parach wynik poprawnie uporządkował lepiej performingowy film w 59,5% przypadków (p = 0,00079). Szansa to 50%.
- Porównywanie filmów z różnych kanałów mierzy liczbę subskrybentów, a nie pakowanie — każda para pochodziła z jednego kanału, opublikowana z medianą sześciu dni różnicy.
- Na kanałach, gdzie każda miniatura używa tego samego szablonu, dokładność spadła do 48,7%. To właśnie ten wynik chcieliśmy: brak różnic do odczytania, brak sygnału do znalezienia.
- Cztery proste heurystyki — dłuższy tytuł, więcej słów, większy plik, wyższy kontrast — wszystkie osiągnęły poziom losowości. Wynik nie jest proxy żadnej z nich.
- Im większa różnica, jaką model stworzył między dwoma filmami, tym częściej miał rację: 56% przy różnicy 1-3 punkty, 76,5% przy 15 punktach lub więcej.
Czy wynik miniatury na YouTube rzeczywiście przewiduje wydajność?
W tym teście tak — skromnie i mierzalnie. Mając dwa filmy z tego samego kanału, jeden wyraźnie przewyższający własny baseline, drugi wyraźnie go nie osiągający, nasz wynik poprawnie je uporządkował w 59,5% przypadków. Szansa to 50%. Przedział ufności 95% wynosi od 53,9% do 64,9%, więc efekt jest realny, ale mały.
Mały to uczciwa odpowiedź, a każdy, kto twierdzi inaczej, coś sprzedaje. Pakowanie to jeden z wielu czynników. Temat, czas publikacji, nastroj algorytmu w tym tygodniu, czy film został podchwycony poza platformą — wszystko to wpływa na liczbę wyświetleń bardziej niż miniatura. Wynik, który twierdziłby, że ma 90% dokładności, opisywałby YouTube, który nie istnieje.
Co 59,5% oznacza w praktyce: jeśli wybierasz między dwiema opcjami dla tego samego filmu, wynik jest lepszy niż losowanie, a im mocniej preferuje jedną opcję, tym bardziej przydatny.
Dlaczego porównywanie miniatur między kanałami niczego nie mówi
Obvious wersja tego testu to ocenienie partii miniatur i skorelowanie wyników z liczbą wyświetleń. To mierzy rozmiar kanału. Wyświetlenia są napędzane liczbą subskrybentów, tematem i wiekiem filmu znacznie bardziej niż pakowaniem, a zniekształcenie działa w pozytywnym kierunku: duże kanały mogą sobie pozwolić na dobrych projektantów i mają duże publiczności.
Przeprowadź ten test i otrzymasz ładną dodatnią korelację, która nic nie znaczy. Przetrwałaby dokładnie jednego sceptycznego czytelnika.
Co musi być utrzymywane stałe w uczciwym porównaniu
Porównanie dwóch filmów z tego samego kanału anuluje liczbę subskrybentów, publiczność, budżet i kompetencje projektowe w jednym ruchu, ponieważ wszystkie cztery są identyczne w obrębie pary. Wymaganie, aby oba były opublikowane blisko siebie, anuluje również trajektorię wzrostu kanału i reżim algorytmu w tym okresie.
Pozostaje pytanie znaną odpowiedzią pod hipotezą zerową: mając dwa filmy, które publiczność kanału traktowała bardzo różnie, czy wynik może wskazać, który był który?
Jak zbudowaliśmy uczciwy test na 321 parach
Wybraliśmy 60 kanałów z sześciu kategorii — technologia, edukacja, gotowanie, gry, fitness i styl życia — i pobraliśmy do 300 ostatnich uploadów z każdego. Po wykluczeniach pozostało 17 250 rozważanych filmów i 321 użytecznych par. Każda para pochodzi z tego samego kanału, opublikowana z medianą sześciu dni różnicy, z lepiej performingowym filmem przekraczającym słabszy o medianę 4,7 razy.
Wydajność mierzona jest względem przewijanego lokalnego baseline, a nie średniej kanału. Dla każdego filmu bierzemy medianę wyświetleń jego dziesięciu sąsiednich uploadów z obu stron, wykluczając sam film, i wyrażamy jego własne wyświetlenia jako wielokrotność tej wartości. Kanał, który wzrósł pięciokrotnie w ciągu dwóch lat, miałby inaczej każdy wczesny film oznaczony jako porażka, a każdy ostatni jako sukces — mierząc kalendarz, a nie pakowanie.
Zasady parowania zostały ustalone z góry:
- Oba filmy pochodzą z tego samego kanału, a każdy film pojawia się w co najwyżej jednej parze.
- Zostały opublikowane w ciągu 120 dni od siebie.
- Lepszy film przewyższył słabszy co najmniej dwukrotnie, więc „lepszy” i „gorszy” oznaczają coś konkretnego, a nie opisują szum.
- Żaden kanał nie przyczynia się więcej niż ośmioma parami, więc jeden produktywny uploader nie może dominować próbki.
Shorts zostały wykluczone, podobnie jak transmisje na żywo, filmy młodsze niż 45 dni i starsze niż dwa lata. Wynik widział miniaturę i tytuł — dokładnie to, co narzędzie otrzymuje od użytkownika — i nic o liczbie wyświetleń ani o tym, którą stronę pary ogląda.
Co wynik poprawnie wychwycił i jak często
Model wybrał lepiej performingowy film w 191 z 321 par: 59,5%, z dokładną wartością p binominalną 0,00079 wobec hipotezy zerowej 50%. Siedemnaście par zwróciło się jako dokładne remisy, a każdy z nich został policzony jako porażka, a nie podzielony lub usunięty, ponieważ wynik, który nie może rozdzielić dwóch wejść, nie rozróżnił między nimi.
Liczenie remisów jako porażek sprawia, że liczba główna jest konserwatywna. Model bez żadnej zdolności uzyskałby około 47,4% pod tą regułą, a nie 50%, więc test wymagał od naszego modelu przekroczenia progu nieco powyżej rzeczywistego poziomu szans. Wśród 304 par, które faktycznie rozdzielił, miał rację w 62,8% przypadków.
Pewność towarzyszyła poprawności
Wzorzec, który sprawia, że wynik zachowuje się jak pomiar, a nie przypadkowość: im dalej model oddzielił dwa filmy, tym częściej miał rację.
Przy różnicy 1-3 punkty dokładność wyniosła 56,0%. Przy 4-7 punktach 64,1%. Przy 8-14 punktach 63,2%. Przy 15 punktach lub więcej 76,5%. Model produkujący szum pokazałby płaską linię w tych kategoriach. Ten model staje się stopniowo lepszy, gdy staje się bardziej pewny — to zachowanie, którego chcesz i którego nie da się sfałszować.
Cztery kontrole, które mogłyby udowodnić, że się mylimy
Badanie, które nie może zawieść, nie jest dowodem. Zdefiniowaliśmy cztery kontrole z góry, każda zdolna do unieważnienia głównego wyniku, i zobowiązaliśmy się do opublikowania wszystkich czterech, niezależnie od tego, co pokazały. Każda zachowała się tak, jak powinna.
| Kontrola | Co oznaczałby jej niepowodzenie | Wynik |
|---|---|---|
| Przetasuj etykiety zwycięzca/przegrany 1000 razy | Pipeline wycieka odpowiedź; cały wynik jest nieważny | 47,1%, dokładnie tam, gdzie teoria mówi, że musi wylądować |
| Kanały, których miniatury stosują jeden stały szablon | Wynik odczytuje coś innego niż pakowanie | 48,7% — szansa, jak przewidywano |
| Trywialne heurystyki: długość tytułu, liczba słów, rozmiar pliku, kontrast | Reguła jednolinijkowa pasuje do modelu, więc model niczego nie dodaje | 46,7%-54,5%, żadna nieistotna |
| Ponownie ocenij każdą miniaturę względem tytułu drugiego filmu | Tytuł niczego nie wnosi, a my oceniamy jedną połowę, nie dwie | Wynik zmienił się średnio o 11,3 punktu |
Kontrola szablonu jest najważniejsza, i warto jasno wyjaśnić dlaczego. Na kanałach, które ponownie używają jednego układu miniatury dla wszystkiego, prawie nic nie ma do porównania dla modelu wizualnego. Gdyby nasz wynik pewnie wybierał zwycięzców tam, czytałby tożsamość kanału lub epokę uploadu, a nie pakowanie. Uzyskał 48,7% na tych kanałach i 61,0% wszędzie indziej. Ta różnica to najsilniejszy dowód w badaniu, że to, co mierzymy, to to, co twierdzimy.
Które wymiary oceny rozdzieliły zwycięzców od przegranych
Ta część jest eksploracyjna, a nie potwierdzająca, i opisuje tę próbkę, a nie YouTube ogólnie. Uporządkowanie dwunastu podwyników według tego, jak daleko oddzieliły dwie grupy, najjaśniejsze rozdzielenie przyniosła jasność obietnicy, następnie sygnał strachu przed przegapieniem i pilność. Intensywność emocjonalna ledwo je rozdzieliła.
Jasność obietnicy — jak jednoznacznie pakowanie mówi Ci, co zaraz zobaczysz — prowadząca tabelę pasuje do tego, co strona zadowolenia modelu miała uchwycić. Najsłabszy separator — surowa intensywność emocjonalna — to ciekawsza połowa: silne uczucia w miniaturze nie rozdzieliły nad- od podperformujących w tej próbce, co nie jest tym, co zakłada większość porad dotyczących miniatur.
Jeśli chcesz zobaczyć te wymiary na własnym pakowaniu, a nie w agregacie, możesz przepuścić miniaturę i tytuł przez ten sam proces oceny, który użył ten studyj — to identyczna ścieżka kodu, nie wersja demonstracyjna.
Czego ten test nie udowadnia
Cztery ograniczenia, wszystkie zapisane zanim istniały dane.
Testuje wynik, nie poradę. Czy działanie na podstawie zaproponowanego tytułu rzeczywiście poprawia rzeczywisty film, to inny eksperyment, którego nie przeprowadziliśmy. Jest obserwacyjny, a nie przyczynowy: nic tutaj nie pokazuje, że zmiana miniatury zmienia wyświetlenia, tylko że wynik jest związany z różnicą, która już istniała.
Próbka decyduje, do kogo stosuje się wynik
Pary zostały wybrane dokładnie dlatego, że różniły się wyraźnie pod względem wydajności, więc 59,5% opisuje tę populację — wyraźnie nad- versus wyraźnie podperformujących — a nie dowolne dwa filmy wybrane losowo. Każdy kanał był ugruntowany, w języku angielskim i wystarczająco duży, aby mieć stabilny baseline. Nic tutaj nie uogólnia się na kanał z dwunastoma uploadami i bez historii do pomiaru.
Liczba wyświetleń została przechwycona w jednym dniu i nadal rośnie. Całość to zrzut ekranu, a uczciwy sposób traktowania zrzutu ekranu to wykonanie kolejnego później.
Często zadawane pytania
Czy 59,5% dokładności to dobry wynik dla wyniku miniatury?
Dla pojedynczego sygnału pakowania wobec rzeczywistych wyników, tak. Wyświetlenia zależą głównie od tematu, wielkości publiczności, czasu i algorytmicznej szczęśliwości, więc wynik miniatury i tytułu może wyjaśniać tylko fragment. Liczba bliższa 90% wskazywałaby na wyciek w projekcie testu, a nie lepszy model. Użyteczne ujęcie to, że pokonuje losowanie i robi to bardziej decydująco, gdy jest pewny.
Dlaczego nie po prostu porównać wyników miniatur z liczbą wyświetleń bezpośrednio?
Ponieważ to mierzy rozmiar kanału. Liczba subskrybentów, temat i wiek filmu wpływają na wyświetlenia znacznie bardziej niż pakowanie, a większe kanały zazwyczaj mają zarówno lepszych projektantów, jak i większe publiczności — więc korelacja wychodzi dodatnia z powodów, które nie mają nic wspólnego z miniaturą. Porównanie dwóch filmów z tego samego kanału usuwa wszystko to w jednym kroku.
Co oznacza, że remisy były liczone jako porażki?
Siedemnaście par otrzymało identyczne wyniki z obu stron. Zamiast dzielić je lub usuwać, co oba zafałszowałyby wynik, każdy został zapisany jako porażka. Wynik, który nie może rozróżnić dwóch wejść, nie rozróżnił między nimi. To sprawia, że zgłoszone 59,5% jest niższe niż wynik, który wyprodukowałyby alternatywne traktowania.
Czy wyższy wynik miniatury oznacza więcej wyświetleń?
Nie. Badanie pokazuje skojarzenie wśród wielu par, a nie obietnicę dotyczącą pojedynczego filmu. Mniej więcej cztery z dziesięciu par zostały uporządkowane w niewłaściwym porządku. Pakowanie to jedna z wielu dźwigni, a silny wynik na filmie, który nikt nie chce oglądać, go nie uratuje.
Jak wybrano 60 kanałów?
Zgodnie z regułą ustaloną zanim zebrano dane: szeroko znane kanały z długą historią uploadów, dziesięć w każdej z sześciu kategorii treści, wybrane ze względu na pokrycie kategorii, a nie coś dotyczącego ich miniatur. Lista została zablokowana i zapisana przed rozpoczęciem oceny, więc żaden kanał nie mógł zostać dodany ani usunięty po pojawieniu się wyników.
Czy mogę zobaczyć metodologię i sprawdzić ją sam?
Pełna wstępna rejestracja — wykluczenia, zasady parowania, główny test, wszystkie cztery kontrole i sformułowanie zapisane z góry na wypadek wyniku zerowego — została napisana i znakowana czasowo zanim oceniono jakikolwiek film. Ogólne wyniki są tu zgłaszane; podstawowe dane filmowe nie są ponownie publikowane, zgodnie z warunkami API YouTube.