Sie ändern ein Thumbnail, das nächste Video performt besser, und schließen daraus, dass der neue Stil funktioniert. Diese Schlussfolgerung ist meist falsch — nicht weil das Thumbnail nichts bewirkt hat, sondern weil der Vergleich nicht hätte feststellen können, ob es das tat. So erkennen Sie echte Verpackungsergebnisse von Zufällen, mit denselben Regeln, die wir bei unserem eigenen Scoring-Modell an 321 Videopaaren angewendet haben.
Wichtigste Erkenntnisse
- Ein Vergleich eines Videos mit dem Durchschnitt Ihres gesamten Kanals misst, wie sehr Ihr Kanal gewachsen ist — nicht, wie gut die Verpackung war.
- Vergleichen Sie stattdessen mit dem Median der zehn Uploads davor und danach, ohne das Video selbst.
- Zwei Videos reichen nie aus. Kleine Unterschiede zwischen Einzelvideos sind nicht von der normalen wöchentlichen Schwankung zu unterscheiden.
- Entscheiden Sie vorher, was als Erfolg zählt — sonst finden Sie jedes Mal irgendwo im Datensatz einen.
- Ein Test, der nicht negativ ausfallen kann, ist kein Test. Schreiben Sie auf, welches Ergebnis Sie dazu bringen würde, die Idee aufzugeben.
Warum die meisten Thumbnail-Testergebnisse nicht real sind
Der typische Creator-Test vergleicht ein Video mit dem davor. Dieser Vergleich enthält alles, was zwischen den beiden Uploads geändert wurde: das Thema, der Wochentag, die Länge, ob der Algorithmus es zufällig gepusht hat — und die Verpackung. Die gesamte Differenz dem Thumbnail zuzuschreiben, setzt voraus, dass alle anderen Variablen konstant blieben — was sie nie tun.
Das Ergebnis ist, dass fast jede Änderung so aussieht, als hätte sie funktioniert, weil Aufrufzahlen von selbst stark schwanken. Die Varianz zwischen aufeinanderfolgenden Uploads auf einem gesunden Kanal übertrifft routinemäßig den Effekt einer Designentscheidung.
Dies ist kein Grund, mit dem Testen aufzuhören. Es ist ein Grund, den Vergleich so aufzubauen, dass das Rauschen berücksichtigt und nicht mit dem Signal verwechselt wird.
Womit Sie ein Video vergleichen sollten
Vergleichen Sie jedes Video mit seinen unmittelbaren Nachbarn, nicht mit der Historie Ihres Kanals. Nehmen Sie die zehn Uploads davor und die zehn danach, ermitteln Sie den Median der Aufrufe dieser zwanzig und drücken Sie die eigenen Aufrufe des Videos als Vielfaches dieses Medians aus. Ein Video mit 1,0 hat genau wie seine Nachbarschaft performt. Bei 2,5 hat es zweieinhalbmal besser abgeschnitten.
Zwei Details sind entscheidend und beide leicht falsch zu machen. Verwenden Sie den Median statt des Mittelwerts, weil ein einzelnes virales Video im Fenster sonst die Basislinie für seine zwanzig Nachbarn neu definieren würde. Und schließen Sie das Video selbst von seiner eigenen Basislinie aus, sonst wird jedes Video in Richtung 1,0 gezogen und die Extrema, die Sie interessieren, werden abgeflacht.
| Vergleichsmethode | Was sie kontrolliert | Wo sie versagt |
|---|---|---|
| Gegen das vorherige Video | Fast nichts | Einer lauten Datenpunkte gegen einen anderen |
| Gegen Ihren Gesamtdurchschnitt | Nichts bezüglich Timing | Ein wachsender Kanal lässt jedes aktuelle Video wie einen Hit aussehen |
| Gegen die letzten 30 Tage | Roughly Kanalgröße | Saisonale Effekte und ein virales Video, das den Mittelwert verfälscht |
| Gegen den gleitenden Median der Nachbarn | Kanalgröße, Wachstum, Ära | Kann Thema und Verpackung immer noch nicht trennen |
Warum das Nachbarschaftsfenster funktioniert
Ein Kanal, der innerhalb von 18 Monaten dreimal so groß wurde, zeigt jedes aktuelle Upload, das seinen Lebenszeitdurchschnitt übertrifft, und jedes ältere, das darunter liegt. Auf diese Weise rangiert, ist die Verpackungsschlussfolgerung, die Sie ziehen, eigentlich eine Aussage darüber, wann jedes Video veröffentlicht wurde.
Das gleitende Fenster entfernt das, weil die Nachbarn eines Videos in etwa denselben Kanal, dieselbe Zielgrößen und dieselben algorithmischen Bedingungen veröffentlicht wurden. Was übrig bleibt, ist plausibler über das Video selbst.
Wie groß muss ein Unterschied sein, um als real zu gelten
Eine nützliche Untergrenze ist ein Faktor von zwei. Als wir Paare für unsere eigene Studie auswählten, verlangten wir, dass das besser performende Video mindestens das Doppelte des View-Multiples des schlechteren hatte. Alles enger ist eine Aufforderung an den Test, zwischen zwei Videos zu unterscheiden, die der eigene Kanalrauschen leicht voneinander getrennt haben könnte.
Verhältnisse unter etwa 1,3 sollten als kein Ergebnis betrachtet werden. Das ist keine strenge universelle Schwelle — sie hängt davon ab, wie variabel Ihr Kanal ist — aber sie ist viel näher an der Wahrheit als die Behandlung einer 10%-Differenz als Beweis.
Die andere Hälfte der Frage ist, wie viele Vergleiche Sie benötigen. Ein Paar sagt Ihnen im Wesentlichen nichts. Die unbequeme Mathematik ist, dass die zuverlässige Erkennung eines moderaten Verpackungseffekts Hunderte von Vergleichen erfordert — weshalb Einzelcreators Schwierigkeiten haben, irgendetwas über ihren eigenen Kanal zu beweisen, und warum der ehrliche Weg darin besteht, Einzelergebnisse als schwachen Hinweis und nicht als Beweis zu behandeln.
Checkliste für das Testen von Verpackungen auf Ihrem eigenen Kanal
Diese fünf Schritte verwandeln einen Eindruck in etwas, das einer Messung näher kommt. Keiner von ihnen erfordert Werkzeuge über eine Tabellenkalkulation hinaus.
- Schreiben Sie vor Beginn auf, welches Ergebnis Sie davon überzeugen würde, dass die Änderung nicht funktioniert hat. Ein Test ohne negatives Ergebnis ist kein Test.
- Berechnen Sie das View-Multiple jedes Videos gegen den Median seiner Nachbaruploads, nicht gegen irgendeine Lebenszeitangabe.
- Sammeln Sie mindestens zehn Videos pro Bedingung, bevor Sie eine Schlussfolgerung ziehen, und widerstehen Sie dem Drang, zwischenzeitlich auf die laufende Summe zu schauen.
- Schließen Sie Shorts, Livestreams, Kollaborationen und alles unter sechs Wochen alt aus, da alle vier Performance-Treiber haben, die nicht mit der Verpackung zusammenhängen.
- Prüfen Sie, ob eine einfachere Erklärung passt — ein Thema, das Sie noch nie behandelt haben, ein Upload, der irgendwo geteilt wurde, ein saisonaler Peak.
Schritt drei ist der, den die Leute überspringen, und das Stoppen eines Tests, sobald er günstig aussieht, ist der effektivste Weg, sich selbst etwas Unwahres einzureden.
Wenn Sie vor der Veröffentlichung eines Videos eine Einschätzung der Verpackung wünschen, anstatt Wochen später, können Sie ein Thumbnail und Titel gegen zwölf Verpackungsfaktoren bewerten und zwei Optionen nebeneinander vergleichen — eine Vorhersage, die Sie dann nach Reifung des Videos mit dem tatsächlichen Ergebnis abgleichen können.
Fehler, die einen Test trügerisch aussagekräftig erscheinen lassen
Vier Fehlermodi erklären die meisten falschen Schlussfolgerungen — und jeder hat eine einfache Lösung.
Stoppen, wenn die Antwort gut aussieht
Das Überprüfen von Ergebnissen während ihres Eintreffens und das Stoppen beim ersten günstigen Moment erzeugt ein positives Ergebnis aus reinem Rauschen, wenn man genug Geduld hat. Fixieren Sie die Stichprobengröße im Voraus und analysieren Sie einmal. In unserer eigenen Studie haben wir die Stop-Entscheidung bewusst vollständig entfernt: Die Stichprobe war, was die voreingestellten Regeln erzeugten — 321 Paare gegenüber einem Ziel von 400.
Wir berichteten diesen Mangel als unterdimensioniert, anstatt stillschweigend die Datensammlung zu verlängern, denn eine Stop-Regel, die jeder während des Beobachtens anwenden kann, ist der Weg, wie ein Nullergebnis zu einem Befund wird.
Neues Aufteilen, bis etwas funktioniert
Wenn das Gesamtergebnis flach ist, ist es verlockend zu prüfen, ob es für Langform, für eine Kategorie oder für Videos, die dienstags veröffentlicht wurden, funktioniert hat. Testen Sie genug Untergruppen, und eine wird zufällig signifikant aussehen. Entscheiden Sie vorher, welche Vergleiche wichtig sind, und kennzeichnen Sie alles andere bei der Berichterstattung als explorativ.
Wie wir diese Regeln auf 321 Videopaare angewendet haben
Unsere eigene Studie folgte genau dieser Struktur. Sechzig Kanäle über sechs Kategorien, bis zu 300 Uploads pro Kanal, 17.250 Videos nach Ausschlusskriterien. Videos wurden gegen den gleitenden Median ihrer Nachbarn bewertet, und Paare wurden nur innerhalb eines einzelnen Kanals gebildet, mit einem Median von sechs Tagen Abstand, wobei der Bessere den Schlechteren mit einem Medianfaktor von 4,7 übertraf.
Jede Regel — die Ausschlüsse, die Paarungsbeschränkungen, der Haupttest, die vier Kontrollen und die Formulierung für den Fall eines Nullergebnisses — wurde vor der Bewertung eines Videos schriftlich festgelegt und zeitgestempelt. Der Score wählte das besser performende Video in 59,5 % der Paare gegenüber einer 50 %-Basislinie.
Der Teil, den es wert ist, zu kopieren, ist nicht die Stichprobengröße. Es ist, dass die Analyse keine Entscheidungen mehr enthielt, als die Daten eintrafen.
Häufig gestellte Fragen
Wie viele Videos benötige ich, um einen Thumbnail-Stil zu testen?
Mehr, als die meisten Kanäle schnell produzieren können. Die zuverlässige Erkennung eines moderaten Verpackungseffekts erfordert Hunderte von Vergleichen — weshalb Einzelvideoergebnisse schwache Hinweise sind. Mit zehn Videos pro Bedingung können Sie einen großen Effekt erkennen; einen subtilen können Sie nicht erkennen, und die Behandlung einer kleinen Differenz als Beweis bei dieser Stichprobengröße ist der häufigste Testfehler.
Womit sollte ich die Aufrufe eines Videos vergleichen?
Mit dem Median der Aufrufe der zehn Uploads davor und der zehn danach, ohne das Video selbst. Dies hält die Größe, das Wachstum und die Ära Ihres Kanals grob konstant, sodass das Übrigbleibende wahrscheinlicher über das Video selbst ist. Ein Vergleich mit einem Lebenszeitdurchschnitt misst stattdessen, wie sehr Ihr Kanal gewachsen ist.
Warum den Median statt des Durchschnitts verwenden?
Weil ein ungewöhnlich erfolgreiches Upload innerhalb des Fensters einen Mittelwert nach oben ziehen und seine zwanzig Nachbarn alle wie Unterperformer erscheinen lassen würde. Der Median wird kaum von einem einzelnen Ausreißer beeinflusst, sodass die Basislinie weiterhin ein typisches Video aus dieser Periode beschreibt — nicht ein außergewöhnliches.
Wie lange sollte ich warten, bevor ich die Performance eines Videos beurteile?
Mindestens sechs Wochen. Aufrufe sammeln sich ungleichmäßig an, und das Ranking eines Videos gegenüber seinen Nachbarn kann sich im ersten Monat erheblich ändern. In unserer Studie haben wir genau aus diesem Grund alles ausgeschlossen, das innerhalb von 45 Tagen vor dem Messdatum veröffentlicht wurde, sowie alles über zwei Jahre alt.
Kann ich einem Thumbnail-Test vertrauen, der nur zwei Videos vergleicht?
Behandeln Sie ihn als Hinweis, nicht als Ergebnis. Zwei Videos unterscheiden sich in Thema, Timing, Länge und Dutzenden anderer Aspekte — daher setzt die Zuschreibung der gesamten Lücke an die Verpackung voraus, dass alles andere konstant blieb. Es ist wertvoll, es zu bemerken und zu wiederholen, aber es ist keine Grundlage für eine kanalweite Änderung.
Was ist ein View-Multiple und wie berechne ich es?
Teilen Sie die Aufrufanzahl eines Videos durch den Median der Aufrufe seiner Nachbaruploads, ohne sich selbst. Ein Ergebnis von 1,0 bedeutet, dass es wie seine Nachbarschaft performt hat, 2,0 bedeutet doppelt so gut, 0,5 bedeutet halb so gut. Es wandelt rohe Aufrufzahlen, die stark vom Veröffentlichungszeitpunkt abhängen, in eine Zahl um, die über die Historie Ihres Kanals vergleichbar ist.