badaniaanaliza-youtubetestowanie

Przetestowaliśmy cztery sposoby na dokładniejszy wynik miniatury

Jedna zmiana podniosła dokładność z 59,5% do 62,0% — okazało się, że to sprawiedliwszy pomiar, a nie lepszy model. Trzy inne nic nie zmieniły. Liczby i pułapki, w które wpadły.

September 14, 20269 min read
Przetestowaliśmy cztery sposoby na dokładniejszy wynik miniatury

Po przetestowaniu naszego wyniku miniatury na 321 parach rzeczywistych filmów spróbowaliśmy go poprawić. Przetestowaliśmy cztery rzeczy. Jedna zmieniła liczbę — po analizie okazało się, że to sprawiedliwszy pomiar, a nie lepszy model. Pozostałe trzy nic nie zmieniły, albo uczyniły wynik trudniejszy do zaufania. Oto każda z nich, z liczbami.

Kluczowe wnioski

  • Porównanie wyników z pełną precyzją zamiast zaokrąglonych liczb całkowitych podniosło zmierzoną dokładność z 59,5% do 62,0% — cały wzrost pochodził z 17 poprzednich remisów, które rozpadły się mniej więcej równomiernie.
  • Przepisane instrukcje oceniania wyglądały jak przełom na 30 miniaturach, ale nic nie zmieniły na 322: 64,6% przed i 63,4% po, na 161 parach.
  • Poproszenie AI o bezpośrednie porównanie dwóch miniatur dało średni wynik zgodny z normalnym wynikiem — po 62,7% — ale odpowiedź zależała od tego, która miniatura pojawiła się pierwsza.
  • Ustawienie „wnioskowania” modelu niczego nie zmieniło, z wyjątkiem najwyższego poziomu — a ten poziom nigdy nie zwrócił odpowiedzi w regionie europejskim, którego używamy, by przechowywać przesłane miniatury w UE.
  • Opublikowany, wstępnie zarejestrowany wynik pozostaje na poziomie 59,5%. Wszystko tutaj to praca uzupełniająca i jest tak oznaczona.

Czy wynik miniatury można poprawić po przeprowadzeniu testu?

Nie łatwo, w naszym przypadku. Z czterech zmian przetestowanych na rzeczywistych filmach, jedna podniosła zmierzoną dokładność — z 59,5% do 62,0% — i zrobiła to poprzez poprawę sposobu porównywania wyników, a nie poprzez zmuszenie modelu do „widzenia” czegoś nowego. Pozostałe trzy pozostawiły dokładność na tym samym poziomie. Wynik wydaje się być bliski granicy tego, co ten model potrafi.

To mniej ekscytująca odpowiedź niż nowy rekord, ale bardziej przydatna. Mówi, gdzie nie warto kierować wysiłku, i wyjaśnia, dlaczego każda kusząca idea zawiodła. To ma znaczenie poza tym jednym wynikiem, ponieważ te same pułapki łapią twórców testujących własne miniatury.

Poprawka, która zadziałała: przestanie zaokrąglania przed porównaniem

Wynik, który widzisz, to liczba całkowita od 0 do 100. W naszym oryginalnym teście, dwa filmy w parze czasem otrzymywały tę samą liczbę całkowitą — zdarzyło się to 17 razy w 321 parach. Nasze wstępnie zarejestrowane zasady liczyły każdy remis jako porażkę, z powodu założenia, że wynik, który nie potrafi rozróżnić dwóch filmów, nie dokonał między nimi dyskryminacji.

Za liczbą całkowitą kryje się dokładna wartość, a zaokrąglenie odrzuca różnicę. Porównanie dokładnych wartości eliminuje wszystkie remisy, a zmierzona dokładność rośnie z 59,5% do 62,0%: 199 z 321 par zamiast 191. Żaden film nie został ponownie oceniony, a żadne wagowanie nie zostało zmienione — dokładna wartość już istniała.

Dlaczego to sprawiedliwsza liczba, a nie lepszy model

Oczywiste pytanie brzmi: jak rozpadły się te 17 remisów? Gdyby model cicho je rozwiązywał, zaokrąglenie ukrywałoby rzeczywistą umiejętność. Nie zrobił tego. Osiem z 17 przypadków przeszło do lepiej performing filmu, a dziewięć nie — co odpowiada wynikowi rzutu monetą.

Więc zysk pochodzi z przestania automatycznego zaznaczania rzutów monetą jako porażek, a nie z tego, że model wie więcej. Dlatego opublikowany wynik pozostaje na poziomie 59,5%: to liczba, do której się zadeklarowaliśmy z góry, zgodnie z zasadami napisanymi przed zobaczeniem jakichkolwiek danych. 62,0% jest raportowane jako pomiar uzupełniający, jasno oznaczony, i opisuje ten sam model.

Dostrojenie instrukcji: mały pilot, który wyglądał jak przełom

Oceny modelu skupiają się wokół siebie. Kilka z dwunastu czynników, na których opiera się wynik, znajdowało się w wąskich pasmach na setkach rzeczywistych miniatur, a nasz oryginalny test pokazał, że wynik jest najbardziej wiarygodny, gdy oddziela dwa filmy znacznie od siebie. Dlatego przepisaliśmy instrukcje, by nadać skali punkt odniesienia: 50 oznacza typowy film w tym samym feedzie, 90 i więcej zarezerwowane dla najlepszej dziesiątki.

W pilotowym teście 30 miniatur, ocenionych w obu wersjach, wyglądało to, jakby działało. Osiem z dwunastu czynników rozszerzyło się, a dwa niemal podwoiły swój zakres. Następnie uruchomiliśmy nowe instrukcje na 322 miniaturach. Dwa czynniki, które niemal podwoiły zakres, rozszerzyły się jedynie o 1,1 i 0,1 punktu. Na 161 parach oryginalne instrukcje wybierały lepszy film w 64,6% przypadków, a nowe w 63,4% — różnica w granicach przypadku. Nowa wersja również obniżyła prawie każdą ocenę o pięć do siedmiu punktów, więc kosztowałaby każdego twórcę kilka punktów wyniku za nic.

Dlaczego większy zakres nie oznaczał większej dokładności

Pilot był po prostu zbyt mały. Z 30 miniaturami miara rozproszenia ocen znacznie się zmienia przez przypadek, a podwojenie dwóch czynników mieściło się w tym zakresie. Pilot powinien być odczytany jako powód do przeprowadzenia większego testu, a nie jako wynik.

Większy test zawierał drugą lekcję. Dwa czynniki — ciekawość i ryzyko clickbaitu — rzeczywiście rozszerzyły się na 322 miniaturach, ale klasyfikacja nadal się nie poprawiła. Szerzej rozłożone oceny pomagają tylko wtedy, gdy dodatkowa szerokość odpowiada rzeczywistym różnicom między filmami. Tutaj odpowiadała szumowi, a szum, który wygląda jak pewność, jest gorszy niż brak.

Porównywanie miniatur bezpośrednio zamiast oceniania ich oddzielnie

Ocenianie każdej miniatury osobno, a następnie porównywanie liczb, nie jest tym, jak ludzie wybierają między miniaturami — patrzą na dwie obok siebie. Dlatego poprosiliśmy model, by zrobił to samo: pokazano mu oba filmy z pary — który z nich był lepszy? Każda z 161 par została pokazana dwa razy, raz w każdej kolejności.

Średnio po obu kolejnościach, sędzia bezpośredniego porównania miał rację w 62,7% przypadków — dokładnie odpowiadając zwykłemu wynikowi na tych samych 150 parach z pełnymi odpowiedziami. Ale wybierał tę miniaturę, którą zobaczył pierwszą, w 64,7% przypadków, a w prawie jednej trzeciej par dał przeciwne odpowiedzi wyłącznie w zależności od kolejności. Równa dokładność przy znacznie mniejszej stabilności oznaczała, że nie została przyjęta. Pełne wyniki znajdują się w naszym osobnym opracowaniu na temat proszenia AI o porównanie miniatur.

Włączanie trybu wnioskowania modelu

Model oferuje ustawienie, które sprawia, że rozwiązuje problem krok po kroku przed udzieleniem odpowiedzi, na kilku poziomach wysiłku. Na trzech niższych poziomach pełna analiza testowej miniatury zwracała te same dwanaście ocen, co przy wyłączeniu ustawienia. Tylko najwyższy poziom w ogóle zmienił zachowanie modelu.

W europejskim centrum danych, którego używamy, by przesłane miniatury nigdy nie były przetwarzane poza UE, najwyższy poziom nigdy nie zwracał odpowiedzi — mimo wielokrotnych prób trwających do trzech minut. Potwierdziliśmy, że działa w regionie USA, używając wymyślonego pytania arytmetycznego bez miniatur, i odkryliśmy, że zapisuje swoje wnioskowanie jako zwykły tekst przed odpowiedzią, zamiast trzymać je osobno. Przeniesienie przesłanych plików do USA, by sprawdzić, czy to pomaga, nie było kompromisem, na który byliśmy gotowi.

Cztery wyniki obok siebie

Każda zmiana została porównana z oryginałem na tych samych parach, więc każda różnica poniżej jest porównaniem „jak do jak”.

ZmianaCo zrobiła z dokładnością klasyfikacjiZachowano?
Porównaj niezaokrąglone wyniki59,5% do 62,0% na 321 parach, całkowicie z poprzednich remisów rozpadających się mniej więcej równomiernieTak, jako sprawiedliwszy pomiar
Skalibrowane instrukcje oceniania64,6% do 63,4% na 161 parach, żadna wykrywalna różnicaNie
Porównaj miniatury bezpośrednio62,7% przeciwko 62,7% na 150 parach, z odpowiedziami zależnymi od kolejnościNie
Tryb wnioskowania modeluBrak zmian na poziomach, które działały; najwyższy poziom nigdy nie odpowiadał w naszym regionieNie

Każda liczba tutaj pochodzi z tego samego potoku oceniania, który działa, gdy analizujesz miniaturę i tytuł. Testy oceniały rzeczywiste filmy przez sam produkt, a nie przez osobną wersję badawczą.

Jak utrzymaliśmy uczciwość tych testów uzupełniających

Testy uzupełniające to miejsce, gdzie badania zwykle się psują, ponieważ badacz już wie, jaką odpowiedź chciałby uzyskać. Pięć zasad utrzymało to pod kontrolą:

  1. Opublikowany wynik nigdy nie został zmieniony. Wstępnie zarejestrowane 59,5% pozostaje głównym wynikiem, a każda późniejsza analiza jest oznaczona jako praca uzupełniająca.
  2. Kanały zostały podzielone na pół przed przetestowaniem jakiejkolwiek zmiany. Eksperymenty używały jednej połowy, a druga została odłożona na ostateczną weryfikację.
  3. Każda zmiana została porównana z oryginałem na tych samych parach, licząc tylko pary, w których dwie wersje się różniły — co jest znacznie bardziej wrażliwe niż porównywanie dwóch ogólnych procentów.
  4. Mały pilot był traktowany jako powód do przeprowadzenia większego testu, nigdy nie jako wynik sam w sobie.
  5. Każde bezpośrednie porównanie było pokazywane w obu kolejnościach, więc preferencja pozycji nie mogła być mylona z umiejętnością.

Żadna z tych zasad nie wymaga dyplomu z statystyki, a większość ma bezpośredni zastosowanie do twórcy testującego własne miniatury: zdecyduj, co liczy się jako zwycięstwo, zanim spojrzysz, porównuj „jak do jak”, a mały wstępny wynik traktuj jako powód, by kontynuować testowanie.

Ograniczenia tych wyników uzupełniających

Wszystkie cztery eksperymenty używały tych samych ustalonych, anglojęzycznych kanałów co oryginalny test oraz jednego modelu. Pomysły zostały wybrane po poznaniu oryginalnego wyniku — co jest dokładnie sytuacją, która zazwyczaj nadaje wynikom fałszywy połysk — i kolejnym powodem, dla którego główny wynik pozostaje na poziomie wstępnie zarejestrowanym.

Każda zmiana została przetestowana raz, w jednej formie. Inne sformułowanie instrukcji mogłoby dać lepszy wynik, a wynik trybu wnioskowania opisuje to, co było dostępne w jednym regionie w wrześniu 2026 roku. Żaden z tych wyników nie mówi, że wynik nie może się poprawić — mówi, że te cztery ścieżki go nie poprawiły.

Często zadawane pytania

Dlaczego nie podać 62,0% jako dokładności?

Ponieważ zasady testu zostały ustalone zanim istniały jakiekolwiek dane, i liczyły remisy jako porażki. Zmiana zasady po zobaczeniu wyników to dokładnie to, co ma zapobiegać wstępna rejestracja — nawet gdy zmiana jest rozsądna. 62,0% jest publikowane jako jasno oznaczony pomiar uzupełniający, obok 59,5%, które nie zastępuje.

Czy mądrzejszy model AI uczyniłby wynik dokładniejszym?

Możliwe, ale to byłby nowy eksperyment. Ustawienie wnioskowania naszego obecnego modelu nie pomogło w regionie, którego używamy, a inny model wymagałby przetestowania na tych samych parach, w ten sam sposób, zanim można byłoby coś stwierdzić. Nowszy nie oznacza automatycznie lepszy w tym konkretnym zadaniu.

Dlaczego test na 30 miniaturach wyglądał tak przekonująco?

Małe próbki dają duże wahania przez przypadek, a duże wahania wyglądają jak odkrycie. Z 30 miniaturami podwojenie zakresu dwóch czynników mieściło się w normalnej zmienności; na 322 miniaturach efekt prawie zniknął. To ta sama pułapka, co ocenianie nowego stylu miniatury na dwóch przesłaniach.

Co to oznacza dla testowania moich własnych miniatur?

Te same zasady obowiązują. Zdecyduj, co liczy się jako sukces, zanim spojrzysz, porównuj z normalnym zakresem swojego kanału, a nie z jednym poprzednim filmem, przeprowadź wystarczająco wiele przykładów, by przypadek nie mógł wyjaśnić wyniku, a jeśli poprosisz jakiekolwiek narzędzie o porównanie dwóch opcji, sprawdź, czy jego odpowiedź przetrwa zamianę miejsc.

Czy wynik nadal warto używać, jeśli te poprawki zawiodły?

Wynik został przetestowany na rzeczywistych wynikach i wygrał z przypadkiem wyraźnie. Te uzupełnienia pokazują, że cztery kuszące zmiany nie przesunęły go dalej — co jest przydatne do wiedzy, a nie powodem do odrzucenia go. Traktuj go jako jedno z kilku uzasadnionych wejść, a nie jako przewidywanie liczby wyświetleń.