testowanieanaliza-youtubeminiatury

Jak sprawdzić, czy wynik testu miniatury jest wiarygodny

Większość testów miniatur mierzy rozwój kanału, a nie jakość pakowania. Dowiedz się, jak porównywać wyniki, co liczy się jako różnica i jakie błędy sprawiają, że test wydaje się jednoznaczny.

September 4, 20268 min read
Jak sprawdzić, czy wynik testu miniatury jest wiarygodny

Zmieniasz miniaturę, następny film działa lepiej i wnioskujesz, że nowy styl działa. Ten wniosek zwykle jest błędny — nie dlatego, że miniatura nic nie zrobiła, ale dlatego, że porównanie nie mogło wykryć, czy coś zrobiła. Oto jak odróżnić prawdziwy wynik pakowania od przypadku, używając tych samych zasad, których użyliśmy podczas testowania naszego własnego modelu oceniania na 321 parach filmów.

Kluczowe wnioski

  • Porównywanie filmu ze średnią wszystkich czasów kanału mierzy, jak bardzo kanał się rozwinął, a nie jak dobre było pakowanie.
  • Zamiast tego porównuj z medianą dziesięciu filmów po obu stronach, wykluczając sam film.
  • Dwa filmy nigdy nie wystarczą. Małe różnice między pojedynczymi filmami są nierozróżnialne od zwykłych tygodniowych wahań.
  • Ustal, co liczy się jako zwycięstwo przed spojrzeniem, inaczej za każdym razem znajdziesz coś w danych.
  • Test, który nie może dać wyniku ujemnego, nie jest testem. Zapisz, jaki wynik sprawiłby, że porzucisz pomysł.

Dlaczego większość wyników testów miniatur nie jest prawdziwa

Typowy test twórcy porównuje jeden film z poprzednim. To porównanie zawiera wszystko, co się zmieniło między dwoma uploadami: temat, dzień tygodnia, długość, czy algorytm przypadkiem go wypchnął, i pakowanie. Przypisanie całej różnicy miniaturze zakłada, że inne zmienne pozostały stałe — a nigdy tak nie jest.

Wynikiem jest to, że prawie każda zmiana wygląda jakby działała, ponieważ liczba wyświetleń sama w sobie dużo się zmienia. Wariacja między kolejnymi uploadami na zdrowym kanale zwykle zatyka efekt decyzji projektowych.

To nie jest powód, by przestać testować. To powód, by zbudować porównanie tak, by szum był uwzględniony, a nie mylony z sygnałem.

Co powinieneś porównywać z filmem

Porównuj każdy film z jego najbliższymi sąsiadami, a nie z historią kanału. Weź dziesięć uploadów przed nim i dziesięć po, znajdź medianę liczby wyświetleń tych dwudziestu i wyraź własne wyświetlenia filmu jako wielokrotność tej mediany. Film o wartości 1.0 wykonał się dokładnie jak jego otoczenie. O 2.5 — dwa i pół raza lepiej.

Dwa szczegóły są ważne i łatwo je pomylić. Użyj mediany zamiast średniej, ponieważ pojedynczy wiralowy upload w oknie inaczej przedefiniowałby bazę dla swoich dwudziestu sąsiadów. I wyklucz sam film z własnej bazy, inaczej każdy film będzie przyciągany ku 1.0, a ekstrema, które Cię interesują, zostaną wypłaszczone.

Metoda porównaniaCo kontrolujeGdzie zawodzi
Wobec poprzedniego filmuPrawie nicJeden szumny punkt danych wobec innego
Wobec średniej wszystkich czasówNic co do czasuRosnący kanał sprawia, że każdy nowy film wygląda jak hit
Wobec ostatnich 30 dniRozmiar kanału, w przybliżeniuSezonowość i pojedynczy wiralowy film zniekształcający średnią
Wobec toczącej się mediany sąsiadówRozmiar kanału, rozwój, epokaNadal nie może oddzielić tematu od pakowania

Dlaczego okno sąsiedztwa działa

Kanał, który potroił rozmiar w osiemnaście miesięcy, pokaże każdy nowy upload przewyższający średnią całego życia i każdy starszy nie spełniający jej. Ustawiony w ten sposób, wniosek o pakowaniu, do którego dochodzisz, naprawdę mówi o tym, kiedy każdy film został opublikowany.

Toczące się okno usuwa to, ponieważ sąsiedzi filmu zostały opublikowane w mniej więcej tym samym kanale, z tą samą wielkością publiczności i tymi samymi warunkami algorytmicznymi. To, co zostało, bardziej prawdopodobnie dotyczy samego filmu.

Jak duża różnica liczy się jako prawdziwa różnica

Użyteczny próg to czynnik dwa. Gdy wybieraliśmy pary do własnego badania, wymagaliśmy, by lepiej performingowy film miał co najmniej dwukrotnie większy mnożnik wyświetleń niż gorszy. Cokolwiek węższe to pytanie do testu, by rozróżnić dwa filmy, które własny szum kanału mógłby łatwo oddzielić sam.

Stosunki poniżej około 1.3 powinny być traktowane jako brak wyniku. To nie jest rygorystyczny uniwersalny próg — zależy od tego, jak zmienny jest Twój kanał — ale jest znacznie bliższy prawdy niż traktowanie 10% różnicy jako dowodu.

Druga połowa pytania to, ile porównań potrzebujesz. Jedna para mówi Ci praktycznie nic. Niewygodna arytmetyka jest taka, że wykrycie skromnego efektu pakowania wymaga setek porównań, dlatego pojedyncze twórcy mają trudności z udowodnieniem czegokolwiek o swoim kanale, a uczciwym posunięciem jest traktowanie pojedynczych wyników jako słabego dowodu, a nie dowodu.

Szczegółowa lista kontrolna do testowania pakowania na własnym kanale

Te pięć kroków zamienia wrażenie w coś bliższego pomiaru. Żaden z nich nie wymaga narzędzi poza arkuszem kalkulacyjnym.

  1. Zapisz, zanim zaczniesz, jaki wynik przekona Cię, że zmiana nie zadziałała. Test bez wyniku negatywnego nie jest testem.
  2. Oblicz mnożnik wyświetleń każdego filmu wobec mediany jego sąsiednich uploadów, a nie wobec jakiegokolwiek wskaźnika z całego życia.
  3. Zbierz co najmniej dziesięć filmów w każdej warunku przed wyciągnięciem jakichkolwiek wniosków i opieraj się na patrzeniu na bieżącą sumę w międzyczasie.
  4. Wyklucz Shorts, transmisje na żywo, współprace i wszystko, co ma mniej niż sześć tygodni, ponieważ wszystkie cztery mają czynniki wydajności niezwiązane z pakowaniem.
  5. Sprawdź, czy prostsze wyjaśnienie pasuje — temat, którego nigdy wcześniej nie poruszałeś, upload, który został gdzieś udostępniony, sezonowy szczyt.

Krok trzeci to ten, który ludzie pomijają, a zatrzymanie testu w momencie, gdy wygląda korzystnie, jest najskuteczniejszym sposobem na przekonanie się do czegoś nieprawdziwego.

Jeśli chcesz ocenić pakowanie przed opublikowaniem filmu, a nie tygodnie później, możesz ocenić miniaturę i tytuł pod kątem dwunastu czynników pakowania i porównać dwie opcje obok siebie — przewidywanie, które możesz później sprawdzić z wynikiem, gdy film dojrzeje.

Błędy, które sprawiają, że test wygląda jakby był jednoznaczny, gdy nim nie jest

Cztery tryby awarii odpowiadają za większość fałszywych wniosków, a każdy ma proste rozwiązanie.

Zatrzymywanie, gdy odpowiedź wygląda dobrze

Sprawdzanie wyników w miarę ich gromadzenia i zatrzymywanie przy pierwszej korzystnej chwili wyprodukuje pozytywny wynik z czystego szumu, jeśli masz wystarczająco dużo cierpliwości. Ustal rozmiar próbki z góry i przeanalizuj raz. W naszym własnym badaniu celowo całkowicie usunęliśmy decyzję o zatrzymaniu: próbka była taka, jaką wyprodukowały ustawione z góry zasady, co dało 321 par wobec celu 400.

Zgłosiliśmy tę niedobór jako niedostatecznie mocny, a nie cicho przedłużając zbieranie, ponieważ reguła zatrzymania, którą każdy może zastosować podczas obserwowania wyniku, to sposób, w jaki wynik zerowy staje się odkryciem.

Ponowne przycinanie, aż coś zadziała

Jeśli ogólny wynik jest płaski, kuszące jest sprawdzenie, czy zadziałało dla długich form, dla jednej kategorii, czy dla filmów opublikowanych we wtorki. Przetestuj wystarczająco dużo podgrup, a jedna będzie wyglądać jako istotna tylko przez przypadek. Ustal, które porównania są ważne, zanim spojrzysz, i oznacz wszystko inne jako eksploracyjne, gdy to zgłosisz.

Jak zastosowaliśmy te zasady do 321 par filmów

Nasze własne badanie dokładnie przestrzegało tej struktury. Sześćdziesiąt kanałów w sześciu kategoriach, do 300 uploadów każdy, 17 250 filmów rozważonych po wykluczeniach. Filmy były oceniane wobec toczącej się mediany ich sąsiadów, a pary tworzone były tylko w obrębie jednego kanału, opublikowane z medianą sześciu dni różnicy, z lepiej performingowym filmem przewyższającym gorszy o medianę czynnika 4.7.

Każda zasada — wykluczenia, ograniczenia parowania, główny test, cztery kontrole i sformułowanie do opublikowania, jeśli wynik byłby zerowy — została zapisana i zatwierdzona zanim jakikolwiek film został oceniony. Wynik wybrał lepiej performingowy film w 59,5% par wobec bazy 50%.

Częścią wartą skopiowania nie jest rozmiar próbki. To to, że analiza nie miała już żadnych decyzji, gdy dane się pojawiły.

Często zadawane pytania

Ile filmów potrzebuję, by przetestować styl miniatury?

Więcej niż większość kanałów może szybko wyprodukować. Wykrycie skromnego efektu pakowania wymaga setek porównań, dlatego wyniki z jednego filmu są słabym dowodem. Z dziesięcioma filmami na warunek możesz zauważyć duży efekt; nie możesz zauważyć subtelnego, a traktowanie małej różnicy jako dowodu przy tej wielkości próbki to najczęstszy błąd testowania.

Co powinienem porównywać z liczbą wyświetleń filmu?

Medianę liczby wyświetleń dziesięciu uploadów przed nim i dziesięciu po, wykluczając sam film. To utrzymuje rozmiar, rozwój i epokę kanału mniej więcej stałe, więc to, co pozostaje, bardziej prawdopodobnie dotyczy filmu. Porównywanie ze średnią całego życia mierzy, jak bardzo kanał się rozwinął.

Dlaczego używać mediany zamiast średniej?

Ponieważ jeden niezwykle udany upload w oknie wciągnąłby bazę średniej w górę i sprawiłby, że jego dwudziestu sąsiadów wyglądałoby jak niedoszli. Mediana jest ledwo dotknięta przez pojedynczy outlier, więc baza nadal opisuje typowy film z tego okresu, a nie wyjątkowy.

Jak długo powinienem czekać, zanim ocenię wydajność filmu?

Przynajmniej sześć tygodni. Wyświetlenia gromadzą się nierównomiernie, a ranking filmu wobec jego sąsiadów może znacznie się zmienić w pierwszym miesiącu. W naszym badaniu wykluczyliśmy wszystko opublikowane w ciągu 45 dni od daty pomiaru z tego właśnie powodu, wraz z wszystkim starszym niż dwa lata.

Czy mogę zaufać testowi miniatury, który porównuje tylko dwa filmy?

Traktuj to jako wskazówkę, a nie wynik. Dwa filmy różnią się tematem, czasem, długością i dziesiątkami innych sposobów, więc przypisanie całej luki pakowaniu zakłada, że wszystko inne pozostało stałe. Warto zauważyć i warto powtórzyć, ale nie jest to podstawa do zmiany podejścia na całym kanale.

Co to jest mnożnik wyświetleń i jak go obliczyć?

Podziel liczbę wyświetleń filmu przez medianę wyświetleń jego sąsiednich uploadów, wykluczając sam film. Wynik 1.0 oznacza, że wykonał się jak jego otoczenie, 2.0 — dwa razy lepiej, 0.5 — połowę. Konwertuje surowe liczby wyświetleń, które silnie zależą od momentu publikacji filmu, na liczbę, którą można porównywać w całej historii Twojego kanału.