ForschungYouTube-AnalytikTesten

Wir testeten vier Methoden, um unsere Thumbnail-Bewertung genauer zu machen

Eine Änderung erhöhte die gemessene Genauigkeit von 59,5 % auf 62,0 % – und erwies sich als fairere Messung, nicht als besseres Modell. Drei andere brachten nichts. Die Zahlen und die Fallstricke, in die jede geriet.

September 14, 20269 min read
Wir testeten vier Methoden, um unsere Thumbnail-Bewertung genauer zu machen

Nachdem wir unsere Thumbnail-Bewertung an 321 Paaren realer Videos getestet hatten, versuchten wir, sie genauer zu machen. Wir probierten vier Dinge aus. Eines veränderte die Zahl – und bei genauerer Betrachtung stellte sich heraus, dass es eine fairere Messung war, nicht ein besseres Modell. Die anderen drei änderten nichts oder machten die Bewertung schwerer zu vertrauen. Hier ist jedes einzelne mit den Zahlen.

Wichtigste Erkenntnisse

  • Der Vergleich von Bewertungen mit voller Genauigkeit statt als gerundete Ganzzahlen erhöhte die gemessene Genauigkeit von 59,5 % auf 62,0 % – und der gesamte Gewinn kam von 17 früheren Unentschieden, die sich etwa gleichmäßig auflösten.
  • Überarbeitete Bewertungsanweisungen wirkten wie ein Durchbruch bei 30 Thumbnails, brachten aber bei 322 nichts: 64,6 % davor und 63,4 % danach, bei 161 Paaren.
  • Wenn man die KI aufforderte, zwei Thumbnails direkt miteinander zu vergleichen, stimmte das Ergebnis im Durchschnitt mit der normalen Bewertung überein (jeweils 62,7 %), aber die Antwort hing davon ab, welches Bild zuerst kam.
  • Die „Begründungs“-Einstellung des Modells änderte nichts – außer auf höchstem Niveau, und dieses Niveau lieferte in unserer europäischen Region, in der wir Uploads im EU-Raum halten, nie eine Antwort.
  • Das veröffentlichte, vorab registrierte Ergebnis bleibt bei 59,5 %. Alles hier ist Folgearbeit und entsprechend gekennzeichnet.

Kann eine Thumbnail-Bewertung nach dem Test noch genauer gemacht werden?

Nicht leicht, zumindest in unserem Fall. Von vier Änderungen, die wir an realen Videos testeten, erhöhte eine die gemessene Genauigkeit von 59,5 % auf 62,0 % – und zwar, indem sie die Art des Vergleichs korrigierte, nicht indem das Modell etwas Neues sah. Die anderen drei ließen die Genauigkeit unverändert. Die Bewertung scheint nahe an dem zu liegen, was dieses Modell leisten kann.

Das ist eine weniger aufregende Antwort als ein neuer Rekord – aber eine nützlichere. Sie sagt, wo man keine Mühe investieren sollte, und erklärt, warum jede verlockende Idee scheiterte. Das ist nicht nur für diese eine Bewertung wichtig, sondern auch für Creator, die ihre eigenen Thumbnails testen – sie fallen in dieselben Fallen.

Die funktionierende Korrektur: Runden vor dem Vergleich stoppen

Die Bewertung, die Sie sehen, ist eine Ganzzahl von 0 bis 100. In unserem ursprünglichen Test landeten die beiden Videos eines Paares manchmal auf derselben Ganzzahl – und das geschah 17-mal bei 321 Paaren. Unsere vorab festgelegten Regeln zählten jedes Unentschieden als Fehler, da eine Bewertung, die zwei Videos nicht unterscheiden kann, sie nicht voneinander differenziert hat.

Hinter der Ganzzahl steckt ein präziser Wert – und das Runden wirft die Differenz weg. Der Vergleich der präzisen Werte lässt überhaupt keine Unentschieden zu, und die gemessene Genauigkeit steigt von 59,5 % auf 62,0 %: 199 von 321 Paaren statt 191. Kein Video wurde neu bewertet, keine Gewichtung geändert – der präzise Wert war bereits vorhanden.

Warum das eine fairere Zahl ist, nicht ein besseres Modell

Die naheliegende Frage ist, wie sich diese 17 Unentschieden auflösten. Wenn das Modell sie stillschweigend richtig erkannt hätte, hätte das Runden echte Fähigkeiten verdeckt. Hat es nicht. Acht der 17 gingen an das besser performende Video, neun nicht – was etwa dem entspricht, was ein Münzwurf ergeben würde.

Der Gewinn kommt also daher, dass Münzwürfe nicht mehr automatisch als Fehler gewertet werden – nicht weil das Modell mehr weiß. Deshalb bleibt das veröffentlichte Ergebnis bei 59,5 %: Es war die Zahl, die wir im Voraus festgelegt hatten, unter Regeln, die geschrieben wurden, bevor wir Daten sahen. Die 62,0 % werden als klar gekennzeichnete Folgemessung veröffentlicht und beschreiben dasselbe Modell.

Anpassung der Anweisungen: ein kleiner Pilot, der wie ein Durchbruch aussah

Die Bewertungen des Modells häufen sich. Mehrere der zwölf Faktoren, aus denen die Bewertung besteht, lagen bei Hunderten realer Thumbnails in engen Bereichen, und unser ursprünglicher Test zeigte, dass die Bewertung am zuverlässigsten ist, wenn sie zwei Videos weit auseinanderlegt. Also überarbeiteten wir die Anweisungen, um der Skala einen Bezugspunkt zu geben: 50 bedeutet das typische Video im gleichen Feed, 90 und darüber sind für das beste Zehntel reserviert.

Bei einem Pilot mit 30 Thumbnails, die unter beiden Versionen bewertet wurden, sah es so aus, als würde es funktionieren. Acht der zwölf Faktoren streuten stärker, zwei davon fast doppelt so stark. Dann führten wir die neuen Anweisungen bei 322 Thumbnails aus. Die beiden Faktoren, die sich fast verdoppelt hatten, wuchsen nur um 1,1 und 0,1 Punkte an Streuung. Bei 161 Paaren wählte die ursprüngliche Anweisung 64,6 % der Zeit das bessere Video, die neue 63,4 % – ein Unterschied, der gut im Bereich des Zufalls liegt. Die neue Version senkte außerdem fast jede Bewertung um fünf bis sieben Punkte, sodass jeder Creator für nichts mehrere Punkte an Bewertung verloren hätte.

Warum mehr Streuung nicht mehr Genauigkeit bedeutete

Der Pilot war einfach zu klein. Bei 30 Thumbnails schwankt ein Maß für die Streuung der Bewertungen stark zufällig – und dass zwei Faktoren sich verdoppelten, lag innerhalb dieser Schwankung. Der Pilot hätte als Grund für einen größeren Test gelesen werden sollen, nicht als Ergebnis.

Der größere Test brachte eine zweite Lektion. Zwei Faktoren – Neugier und Clickbait-Risiko – streuten tatsächlich bei 322 Thumbnails stärker, aber die Rangfolge verbesserte sich nicht. Breitere Bewertungen helfen nur, wenn die zusätzliche Breite echte Unterschiede zwischen Videos widerspiegelt. Hier spiegelte sie Rauschen wider – und Rauschen, das wie Sicherheit aussieht, ist schlimmer als gar keins.

Thumbnails direkt vergleichen statt einzeln bewerten

Die Bewertung jedes Thumbnails einzeln und dann den Vergleich der Zahlen ist nicht so, wie Menschen zwischen Thumbnails wählen – sie betrachten zwei nebeneinander. Also baten wir das Modell, genau das zu tun: Gezeigt beide Videos eines Paares – welches hat besser abgeschnitten? Jedes der 161 Paare wurde zweimal gezeigt, einmal in jeder Reihenfolge.

Im Durchschnitt beider Reihenfolgen lag der direkte Vergleich bei 62,7 % Treffsicherheit – exakt gleich der normalen Bewertung bei denselben 150 vollständig beantworteten Paaren. Aber es wählte das Thumbnail, das es zuerst sah, in 64,7 % der Fälle – und bei fast einem Drittel der Paare gab es je nach Reihenfolge entgegengesetzte Antworten. Gleiche Genauigkeit bei viel geringerer Stabilität bedeutete, dass es nicht übernommen wurde. Die vollständigen Ergebnisse finden Sie in unserem separaten Bericht darüber, eine KI zum Vergleich von Thumbnails zu befragen.

Aktivierung des Begründungsmodus des Modells

Das Modell bietet eine Einstellung, die es dazu bringt, ein Problem schrittweise zu bearbeiten, bevor es antwortet – auf mehreren Ebenen des Aufwands. Auf den drei niedrigeren Ebenen kam bei einer vollständigen Analyse eines Test-Thumbnail dieselben zwölf Bewertungen zurück wie mit der Einstellung ausgeschaltet. Nur die höchste Ebene veränderte das Verhalten des Modells überhaupt.

In unserem europäischen Rechenzentrum, damit hochgeladene Thumbnails nie außerhalb der EU verarbeitet werden, lieferte diese höchste Ebene bei wiederholten Versuchen, die bis zu drei Minuten dauerten, nie eine Antwort. Wir bestätigten, dass sie in einer US-Region funktioniert – mit einer erfundenen Rechenaufgabe ohne Thumbnails – und stellten fest, dass sie ihre Begründung als Klartext vor die Antwort schrieb, statt sie getrennt zu halten. Uploads in die USA zu verlagern, um herauszufinden, ob es hilft, war ein Kompromiss, den wir nicht eingehen wollten.

Die vier Ergebnisse nebeneinander

Jede Änderung wurde mit dem Original an denselben Paaren verglichen, sodass jeder Unterschied hier direkt vergleichbar ist.

ÄnderungWas sie mit der Rangfolgen-Genauigkeit machteBeibehalten?
Vergleich ungerundeter Bewertungen59,5 % auf 62,0 % bei 321 Paaren, vollständig aus früheren Unentschieden, die sich etwa gleichmäßig auflöstenJa, als fairere Messung
Kalibrierte Bewertungsanweisungen64,6 % auf 63,4 % bei 161 Paaren, kein nachweisbarer UnterschiedNein
Direkter Vergleich von Thumbnails62,7 % gegen 62,7 % bei 150 Paaren, mit Antworten, die von der Reihenfolge abhingenNein
Begründungsmodus des ModellsKeine Änderung auf den Ebenen, die liefen; die höchste Ebene antwortete in unserer Region nieNein

Jede Zahl hier stammt aus derselben Bewertungspipeline, die auch beim Analysieren eines Thumbnails und Titels verwendet wird. Die Tests bewerteten reale Videos über das Produkt selbst, nicht über eine separate Forschungskopie.

Wie wir diese Folgetests ehrlich hielten

Folgeexperimente sind der Punkt, an dem Studien normalerweise scheitern – denn der Forscher weiß bereits, welche Antwort er sich wünscht. Fünf Regeln hielten das in Schach:

  1. Das veröffentlichte Ergebnis wurde nie verändert. Die vorab registrierten 59,5 % bleiben die Überschrift, und jede spätere Analyse ist als Folgearbeit gekennzeichnet.
  2. Die Kanäle wurden vor jedem Test in zwei Hälften geteilt. Die Experimente verwendeten eine Hälfte, die andere wurde für eine abschließende Prüfung zurückgehalten.
  3. Jede Änderung wurde mit dem Original an denselben Paaren verglichen – und zählte nur die Paare, bei denen sich die beiden unterschieden, was viel sensitiver ist als der Vergleich zweier Gesamtprozentsätze.
  4. Ein kleiner Pilot wurde als Grund für einen größeren Test behandelt, niemals als eigenständiges Ergebnis.
  5. Jeder direkte Vergleich wurde in beiden Reihenfolgen gezeigt, damit eine Positionsvorliebe nicht als Fähigkeit durchgehen konnte.

Keine dieser Regeln erfordert einen Statistikabschluss – und die meisten gelten direkt für Creator, die ihre eigenen Thumbnails testen: Entscheiden Sie vor dem Blick, was als Erfolg zählt, vergleichen Sie Ähnliches mit Ähnlichem, und behandeln Sie ein kleines frühes Ergebnis als Grund, weiter zu testen.

Grenzen dieser Folgeergebnisse

Alle vier Experimente verwendeten dieselben etablierten, englischsprachigen Kanäle wie der ursprüngliche Test und ein einziges Modell. Die Ideen wurden gewählt, nachdem das ursprüngliche Ergebnis bekannt war – genau die Situation, die dazu neigt, ein Ergebnis zu schmeicheln, und ein weiterer Grund, warum die Überschrift bei der vorab registrierten Zahl bleibt.

Jede Änderung wurde einmal, in einer Form, ausprobiert. Eine andere Formulierung der Anweisungen hätte besser funktionieren können, und das Ergebnis des Begründungsmodus beschreibt, was im September 2026 in einer Region verfügbar war. Keines dieser Ergebnisse sagt, dass die Bewertung nicht verbessert werden kann – sie sagen, dass diese vier Wege sie nicht verbessert haben.

Häufig gestellte Fragen

Warum nicht 62,0 % als Genauigkeit angeben?

Weil die Regeln für den Test vor dem Vorhandensein jeglicher Daten festgelegt wurden – und sie Unentschieden als Fehler zählten. Eine Regel nach dem Sehen der Ergebnisse zu ändern, ist genau das, was die Vorabregistrierung verhindern soll – selbst wenn die Änderung vernünftig ist. Die 62,0 % werden als klar gekennzeichnete Folgemessung veröffentlicht, neben den 59,5 %, die sie nicht ersetzen.

Würde ein intelligenteres KI-Modell die Bewertung genauer machen?

Möglich, aber das wäre ein neues Experiment. Die Begründungseinstellung unseres aktuellen Modells half in unserer Region nicht, und ein anderes Modell müsste gegen dieselben Paare, auf dieselbe Weise getestet werden, bevor eine Behauptung gemacht werden könnte. Neuer bedeutet nicht automatisch besser bei dieser speziellen Aufgabe.

Warum sah ein Test mit 30 Thumbnails so überzeugend aus?

Kleine Stichproben erzeugen zufällig große Schwankungen – und eine große Schwankung sieht wie eine Entdeckung aus. Bei 30 Thumbnails lag das Doppeln der Streuung zweier Faktoren innerhalb der normalen Variation; bei 322 Thumbnails verschwand der Effekt fast vollständig. Es ist derselbe Fallstrick, wie einen neuen Thumbnail-Stil an zwei Uploads zu beurteilen.

Was bedeutet das für das Testen meiner eigenen Thumbnails?

Die gleichen Regeln gelten. Entscheiden Sie vor dem Blick, was als Erfolg zählt, vergleichen Sie mit dem normalen Bereich Ihres Kanals statt mit einem einzelnen früheren Video, führen Sie genügend Beispiele durch, damit der Zufall das Ergebnis nicht erklären kann, und wenn Sie ein Tool bitten, zwei Optionen zu vergleichen, prüfen Sie, ob die Antwort auch bei Vertauschung bestehen bleibt.

Ist die Bewertung noch wertvoll, wenn diese Verbesserungen scheiterten?

Die Bewertung wurde an realen Ergebnissen getestet und übertraf den Zufall deutlich. Diese Folgeuntersuchungen zeigen, dass vier verlockende Änderungen sie nicht weiterbrachten – was nützlich zu wissen ist, statt ein Grund, sie zu verwerfen. Behandeln Sie sie als einen informierten Input unter mehreren, nicht als Vorhersage von Aufrufen.