ForschungThumbnailsYouTube-Analytik

Wir haben unseren Thumbnail-Score an 321 echten Videos getestet

Ein vorab registrierter Test, ob ein YouTube-Thumbnail- und Titelscore die tatsächliche Performance widerspiegelt. 321 Video-Paare, vier Kontrollen und das Ergebnis – egal wie es ausfiel.

September 4, 20269 min read
Wir haben unseren Thumbnail-Score an 321 echten Videos getestet

Ein Thumbnail-Score ist nur dann etwas wert, wenn er das widerspiegelt, was auf YouTube tatsächlich passiert. Also haben wir einen Test durchgeführt, der uns hätte blamieren können: 321 Paare echter Videos, jeweils aus demselben Kanal, eines, das den eigenen Kanaldurchschnitt übertraf, und eines, das darunter lag. Wir haben die Methode aufgeschrieben, bevor wir uns die Daten angesehen haben. Der Score wählte in 59,5 % der Fälle das besser performende Video – im Vergleich zu 50 % bei einer Münzwurf-Chance.

Wichtigste Erkenntnisse

  • Bei 321 Paaren bewertete der Score das besser performende Video in 59,5 % der Fälle höher (p = 0,00079). Die Zufallschance liegt bei 50 %.
  • Der Vergleich von Videos über verschiedene Kanäle misst Abonnentenzahlen, nicht die Verpackung – jedes Paar stammt hier aus einem Kanal, veröffentlicht mit einem Median von sechs Tagen Abstand.
  • Auf Kanälen, bei denen jedes Thumbnail dieselbe Vorlage verwendet, sank die Genauigkeit auf 48,7 %. Genau das wollten wir: keine Unterschiede zu erkennen, kein Signal zu finden.
  • Vier einfache Heuristiken – längere Titel, mehr Wörter, größere Dateien, höhere Kontraste – landeten alle bei Zufallschance. Der Score ist kein Proxy für irgendeine davon.
  • Je größer die Differenz, die das Modell zwischen zwei Videos feststellte, desto häufiger lag es richtig: 56 % bei einer Differenz von 1–3 Punkten, 76,5 % bei 15 Punkten oder mehr.

Prognostiziert ein YouTube-Thumbnail-Score tatsächlich die Performance?

In diesem Test ja – bescheiden und messbar. Bei zwei Videos aus demselben Kanal, eines, das eindeutig über seinem eigenen Baseline lag, und eines, das deutlich darunter lag, ordnete unser Score sie in 59,5 % der Fälle korrekt ein. Die Zufallschance liegt bei 50 %. Das 95 %-Konfidenzintervall liegt zwischen 53,9 % und 64,9 %, also ist der Effekt real, aber klein.

Klein ist die ehrliche Antwort, und wer mehr behauptet, verkauft etwas. Die Verpackung ist nur einer von vielen Faktoren. Thema, Upload-Zeitpunkt, die Stimmung des Algorithmus in dieser Woche, ob ein Video außerhalb der Plattform aufgegriffen wurde – all das beeinflusst die Aufrufe stärker als ein Thumbnail. Ein Score, der 90 % Genauigkeit behaupten würde, beschriebe ein YouTube, das nicht existiert.

Was 59,5 % in der Praxis bedeutet: Wenn Sie zwischen zwei Optionen für dasselbe Video wählen, ist der Score besser als Raten – und umso nützlicher, je deutlicher er eine Option bevorzugt.

Warum der Vergleich von Thumbnails über verschiedene Kanäle nichts aussagt

Die offensichtliche Version dieses Tests wäre, eine Reihe von Thumbnails zu bewerten und die Scores mit den Aufrufzahlen zu korrelieren. Das misst aber die Kanalgröße. Aufrufe werden viel stärker von der Abonnentenzahl, dem Thema und dem Alter des Videos als von der Verpackung beeinflusst – und der Zusammenhang läuft in eine schmeichelhafte Richtung: Große Kanäle können sich gute Designer leisten und haben große Zielgruppen.

Führen Sie diesen Test durch, erhalten Sie eine schöne positive Korrelation, die nichts bedeutet. Sie würde genau einem skeptischen Leser standhalten.

Was ein fairer Vergleich konstant halten muss

Der Vergleich zweier Videos aus demselben Kanal eliminiert Abonnentenzahl, Zielgruppe, Budget und Design-Kompetenz auf einen Schlag, da alle vier Faktoren innerhalb des Paares identisch sind. Die Forderung, dass beide Videos nahe beieinander veröffentlicht wurden, eliminiert außerdem die Wachstumskurve des Kanals und das Algorithmus-Regime dieser Periode.

Was übrig bleibt, ist eine Frage mit bekannter Antwort unter der Nullhypothese: Wenn ein Kanal seine eigene Zielgruppe bei zwei Videos sehr unterschiedlich behandelt hat – kann der Score erkennen, welches welches ist?

Wie wir einen fairen Test mit 321 Paaren aufbauten

Wir wählten 60 Kanäle aus sechs Kategorien – Technik, Bildung, Kochen, Gaming, Fitness und Lifestyle – und zogen bis zu 300 aktuelle Uploads von jedem. Nach Ausschlüssen blieben 17.250 Videos zur Betrachtung und 321 nutzbare Paare übrig. Jedes Paar stammt vom selben Kanal, wurde im Median sechs Tage auseinander veröffentlicht, und das besser performende Video übertraf das schlechter performende im Median um den Faktor 4,7.

Die Performance wird anhand einer rollierenden lokalen Baseline gemessen, nicht anhand eines Kanal-durchschnitts. Für jedes Video nehmen wir den Median der Aufrufe seiner zehn benachbarten Uploads auf beiden Seiten (ohne sich selbst) und drücken seine eigenen Aufrufe als Vielfaches davon aus. Ein Kanal, der über zwei Jahre um das Fünffache gewachsen ist, würde sonst jedes frühe Video als Fehlschlag und jedes aktuelle als Hit kennzeichnen – und messen damit den Kalender, nicht die Verpackung.

Die Paarungsregeln wurden im Voraus festgelegt:

  1. Beide Videos stammen vom selben Kanal, und jedes Video erscheint in höchstens einem Paar.
  2. Sie wurden innerhalb von 120 Tagen zueinander veröffentlicht.
  3. Das besser performende Video übertraf das schlechter performende um mindestens den Faktor zwei, damit „besser“ und „schlechter“ etwas bedeuten und nicht nur Rauschen beschreiben.
  4. Kein Kanal liefert mehr als acht Paare, damit ein besonders produktiver Uploader die Stichprobe nicht dominiert.

Shorts wurden ausgeschlossen, ebenso Livestreams, Videos jünger als 45 Tage und älter als zwei Jahre. Der Score sah nur ein Thumbnail und einen Titel – genau das, was das Tool vom Nutzer erhält – und nichts über Aufrufzahlen oder welche Seite eines Paares er betrachtete.

Was der Score richtig erkannte – und wie oft

Das Modell wählte in 191 von 321 Paaren das besser performende Video: 59,5 %, mit einem exakten binomialen p-Wert von 0,00079 gegen eine Nullhypothese von 50 %. Siebzehn Paare ergaben exakte Unentschieden, und jedes davon wurde als Fehlversuch gezählt – nicht aufgeteilt oder entfernt –, weil ein Score, der zwei Eingaben nicht unterscheiden kann, sie nicht diskriminiert hat.

Das Zählen von Unentschieden als Verluste macht die Hauptzahl konservativ. Ein Modell ohne jegliche Fähigkeit würde unter dieser Regel etwa 47,4 % erreichen, nicht 50 %, also musste unser Test eine Hürde leicht über dem echten Zufallsniveau überspringen. Unter den 304 Paaren, die es tatsächlich trennte, lag es in 62,8 % der Fälle richtig.

Vertrauen korrelierte mit Richtigkeit

Das Muster, das das Ergebnis wie eine Messung und nicht wie einen Zufall erscheinen lässt: Je weiter auseinander der Score zwei Videos einordnete, desto häufiger lag er richtig.

Bei einer Differenz von 1–3 Punkten lag die Genauigkeit bei 56,0 %. Bei 4–7 Punkten bei 64,1 %. Bei 8–14 Punkten bei 63,2 %. Bei 15 Punkten oder mehr bei 76,5 %. Ein Modell, das nur Rauschen erzeugt, würde über diese Kategorien eine flache Linie zeigen. Dieses Modell wird kontinuierlich besser, je sicherer es ist – genau das Verhalten, das Sie wollen und nicht vortäuschen können.

Die vier Prüfungen, die uns widerlegen hätten können

Eine Studie, die nicht scheitern kann, ist kein Beweis. Wir legten vier Kontrollen im Voraus fest, jede in der Lage, die Hauptüberschrift zu widerlegen, und verpflichteten uns, alle vier unabhängig von ihrem Ergebnis zu veröffentlichen. Jede verhielt sich wie vorgesehen.

KontrolleWas ein Versagen bedeutet hätteErgebnis
Die Gewinner-/Verlierer-Labels 1.000 Mal mischenDie Pipeline gibt die Antwort preis; das gesamte Ergebnis ist ungültig47,1 %, genau dort, wo die Theorie sagt, dass es landen muss
Kanäle, deren Thumbnails einer festen Vorlage folgenDer Score liest etwas anderes als die Verpackung48,7 % – Zufall, wie vorhergesagt
Triviale Heuristiken: Titellänge, Wortanzahl, Dateigröße, KontrastEine einzeilige Regel entspricht dem Modell, also fügt das Modell nichts hinzu46,7 %–54,5 %, keine signifikant
Jedes Thumbnail erneut gegen den Titel des anderen Videos bewertenDer Titel trägt nichts bei, und wir bewerten nur eine Hälfte, nicht zweiDer Score veränderte sich im Durchschnitt um 11,3 Punkte

Die Vorlagenprüfung ist die wichtigste, und es lohnt sich, klarzustellen, warum. Auf Kanälen, die für alles dieselbe Thumbnail-Layout-Vorlage wiederverwenden, gibt es fast nichts, woran ein visuelles Modell vergleichen könnte. Hätte unser Score dort selbstbewusst Gewinner ausgewählt, hätte er Kanal-Identität oder Upload-Zeitperiode gelesen, nicht die Verpackung. Er erreichte dort 48,7 % und 61,0 % überall sonst. Diese Differenz ist der stärkste Beweis der Studie, dass das Gemessene tatsächlich das ist, was wir behaupten.

Welche Bewertungsdimensionen Gewinner von Verlierern trennten

Dieser Teil ist explorativ, nicht bestätigend, und beschreibt diese Stichprobe, nicht YouTube im Allgemeinen. Wenn man die zwölf Teilscores danach rangiert, wie weit sie die beiden Gruppen auseinanderhielten, ergab sich die deutlichste Trennung durch „Versprechen-Klarheit“, gefolgt von „FOMO-Signal“ und „Dringlichkeit“. Emotionale Intensität trennte sie kaum.

„Versprechen-Klarheit“ – wie eindeutig die Verpackung verrät, was man gleich sehen wird – an der Spitze passt zu dem, was die Zufriedenheitsseite des Modells erfassen sollte. Die schwächste Trennung durch rohe emotionale Intensität ist die interessantere Hälfte: Starke Gefühle in einem Thumbnail unterschieden in dieser Stichprobe nicht zwischen Über- und Unterperformern – was nicht dem entspricht, was die meisten Thumbnail-Ratschläge annehmen.

Wenn Sie diese Dimensionen an Ihrer eigenen Verpackung sehen möchten, statt nur aggregiert, können Sie ein Thumbnail und einen Titel durch denselben Bewertungspipeline laufen lassen, die diese Studie verwendet hat – es ist derselbe Codepfad, keine Demo-Version.

Was dieser Test nicht beweist

Vier Grenzen, alle vor dem Vorhandensein der Daten aufgeschrieben.

Er testet den Score, nicht den Rat. Ob das Umsetzen eines vorgeschlagenen Titels tatsächlich ein echtes Video verbessert, ist ein anderer Versuch, den wir nicht durchgeführt haben. Es ist beobachtend, nicht kausal: Nichts hier zeigt, dass das Ändern eines Thumbnails die Aufrufe verändert, sondern nur, dass der Score mit einer bereits bestehenden Differenz assoziiert ist.

Die Stichprobe bestimmt, auf wen das Ergebnis zutrifft

Paare wurden genau deshalb ausgewählt, weil sie sich stark in der Performance unterschieden – also beschreibt 59,5 % diese Population – klare Über- versus klare Unterperformer – und nicht zwei zufällig gewählte Videos. Jeder Kanal war etabliert, englischsprachig und groß genug, um eine stabile Baseline zu haben. Nichts hier lässt sich auf einen Kanal mit zwölf Uploads und keiner Historie übertragen.

Aufrufzahlen wurden an einem einzigen Tag erfasst und steigen weiter an. Das Ganze ist ein Schnappschuss, und die ehrliche Art, mit einem Schnappschuss umzugehen, ist, später einen weiteren zu machen.

Häufig gestellte Fragen

Ist 59,5 % Genauigkeit gut für einen Thumbnail-Score?

Für ein einzelnes Verpackungssignal gegenüber realen Ergebnissen ja. Aufrufe hängen vor allem vom Thema, der Zielgruppengröße, dem Timing und dem algorithmischen Glück ab, also kann ein Thumbnail-und-Titel-Score nur einen Ausschnitt erklären. Eine Zahl nahe 90 % würde auf einen Fehler im Testdesign hinweisen, nicht auf ein besseres Modell. Die nützliche Perspektive ist, dass er besser ist als Raten – und umso entscheidender, je sicherer er ist.

Warum vergleicht man nicht einfach Thumbnail-Scores direkt mit Aufrufzahlen?

Weil das die Kanalgröße misst. Abonnentenzahl, Thema und Alter des Videos bewegen Aufrufe viel stärker als die Verpackung, und größere Kanäle haben tendenziell sowohl bessere Designer als auch größere Zielgruppen – also kommt die Korrelation positiv heraus aus Gründen, die nichts mit dem Thumbnail zu tun haben. Der Vergleich zweier Videos aus demselben Kanal eliminiert all das auf einen Schlag.

Was bedeutet es, dass Unentschieden als Fehlversuche gezählt wurden?

Siebzehn Paare erhielten auf beiden Seiten identische Scores. Anstatt sie aufzuteilen oder zu entfernen – was beide das Ergebnis schmeicheln würden –, wurde jeder als Fehlversuch aufgezeichnet. Ein Score, der zwei Eingaben nicht unterscheiden kann, hat sie nicht diskriminiert. Das macht die berichtete 59,5 % niedriger als alternative Behandlungen es ergeben hätten.

Bedeutet ein höherer Thumbnail-Score mehr Aufrufe?

Nein. Die Studie zeigt eine Assoziation über viele Paare, keine Garantie für ein einzelnes Video. Ungefähr vier von zehn Paaren wurden falsch herum eingestuft. Die Verpackung ist nur einer von mehreren Hebeln, und ein starker Score bei einem Video, das niemand sehen will, wird es nicht retten.

Wie wurden die 60 Kanäle ausgewählt?

Nach einer Regel, die vor Datensammlung festgelegt wurde: weitgehend bekannte Kanäle mit langer Upload-Historie, zehn in jeder der sechs Inhaltskategorien, ausgewählt für Kategorienabdeckung, nicht für irgendetwas an ihren Thumbnails. Die Liste wurde vor Beginn der Bewertung eingefroren und aufgezeichnet, damit kein Kanal hinzugefügt oder entfernt werden konnte, sobald Ergebnisse sichtbar wurden.

Kann ich die Methodik sehen und selbst überprüfen?

Die vollständige Vorabregistrierung – Ausschlüsse, Paarungsregeln, der Haupttest, alle vier Kontrollen und die im Voraus festgelegte Formulierung für ein Nullergebnis – wurde vor Bewertung irgendeines Videos verfasst und zeitgestempelt. Aggregierte Ergebnisse werden hier berichtet; die zugrundeliegenden Videodaten werden nicht erneut veröffentlicht, im Einklang mit den YouTube-API-Bedingungen.