rechercheminiaturesanalytique-youtube

Nous avons testé notre score de miniature sur 321 vidéos réelles

Test pré-enregistré pour vérifier si le score de miniature et titre YouTube reflète la performance réelle. 321 paires de vidéos, quatre contrôles, et un résultat publié quel qu’en soit l’issue.

September 4, 20269 min de lecture
Nous avons testé notre score de miniature sur 321 vidéos réelles

Un score de miniature n’a de valeur que s’il reflète ce qui se passe réellement sur YouTube. Nous avons donc mené un test qui aurait pu nous embarrasser : 321 paires de vidéos réelles, chaque paire provenant de la même chaîne, l’une ayant dépassé la moyenne de la chaîne et l’autre l’ayant sous-performée. Nous avons rédigé la méthode avant d’examiner les données. Le score a sélectionné la vidéo mieux performante dans 59,5 % des cas, contre 50 % pour un tirage au sort.

Points clés

  • Sur 321 paires, le score a classé la vidéo mieux performante en première position dans 59,5 % des cas (p = 0,00079). Le hasard correspond à 50 %.
  • Comparer des vidéos entre différentes chaînes mesure le nombre d’abonnés, pas l’emballage — chaque paire ici provient d’une même chaîne, publiée avec une médiane de six jours d’écart.
  • Sur les chaînes où chaque miniature suit le même modèle, la précision est tombée à 48,7 %. C’est le résultat que nous souhaitions : aucune différence à analyser, aucun signal à détecter.
  • Quatre heuristiques simples — titre plus long, plus de mots, fichier plus volumineux, contraste plus élevé — ont toutes abouti au hasard. Le score n’est pas un proxy pour aucune d’entre elles.
  • Plus l’écart attribué par le modèle entre deux vidéos était important, plus il avait raison : 56 % pour un écart de 1 à 3 points, 76,5 % pour 15 points ou plus.

Un score de miniature YouTube prédit-il réellement la performance ?

Dans ce test, oui — modestement et de manière mesurable. Étant donné deux vidéos de la même chaîne, l’une ayant clairement surpassé sa propre moyenne et l’autre ayant clairement sous-performé, notre score les a classées correctement dans 59,5 % des cas. Le hasard correspond à 50 %. L’intervalle de confiance à 95 % va de 53,9 % à 64,9 %, donc l’effet est réel mais faible.

« Faible » est la réponse honnête, et quiconque prétend plus vend quelque chose. L’emballage n’est qu’un facteur parmi d’autres. Le sujet, le moment de publication, l’humeur de l’algorithme cette semaine-là, ou si la vidéo a été relayée hors plateforme — tout cela influence davantage les vues qu’une miniature. Un score prétendant 90 % de précision décrirait un YouTube qui n’existe pas.

Ce que signifie 59,5 % en pratique : si vous choisissez entre deux options pour la même vidéo, le score est meilleur qu’un simple tirage au sort, et d’autant plus utile qu’il préfère fortement l’une des deux.

Pourquoi comparer des miniatures entre chaînes ne vous dit rien

La version évidente de ce test consiste à noter un lot de miniatures et à corrélérer les notes avec les vues. Cela mesure la taille de la chaîne. Les vues sont principalement déterminées par le nombre d’abonnés, le sujet et l’âge de la vidéo, bien plus que par l’emballage, et le biais va dans le sens flatteur : les grandes chaînes peuvent se permettre de meilleurs designers et ont des audiences plus larges.

Mener ce test vous donne une belle corrélation positive qui ne signifie rien. Elle résisterait exactement à un seul lecteur sceptique.

Ce qu’une comparaison équitable doit maintenir constant

Comparer deux vidéos de la même chaîne annule en une seule étape le nombre d’abonnés, l’audience, le budget et la compétence en design, car les quatre sont identiques au sein de la paire. Exiger que les deux soient publiées proches l’une de l’autre annule également la trajectoire de croissance de la chaîne et le régime algorithmique de cette période.

Il reste une question avec une réponse connue sous l’hypothèse nulle : étant donné deux vidéos que l’audience de la chaîne a traitées très différemment, le score peut-il dire laquelle est laquelle ?

Comment nous avons construit un test équitable sur 321 paires appariées

Nous avons sélectionné 60 chaînes réparties dans six catégories — tech, éducation, cuisine, gaming, fitness et lifestyle — et extrait jusqu’à 300 publications récentes de chacune. Après exclusions, 17 250 vidéos ont été examinées, donnant 321 paires utilisables. Chaque paire provient de la même chaîne, publiée avec une médiane de six jours d’écart, la vidéo performante dépassant la sous-performante par un facteur médian de 4,7.

La performance est mesurée par rapport à une moyenne locale mobile, pas à une moyenne globale de la chaîne. Pour chaque vidéo, nous prenons la médiane des vues de ses dix publications voisines de chaque côté, en excluant elle-même, et exprimons ses propres vues comme un multiple de cette valeur. Une chaîne ayant quintuplé ses vues en deux ans aurait sinon chaque vidéo ancienne étiquetée comme un échec et chaque vidéo récente comme un succès — mesurant le calendrier, pas l’emballage.

Les règles d’appariement ont été fixées à l’avance :

  1. Les deux vidéos proviennent de la même chaîne, et chaque vidéo apparaît au plus dans une paire.
  2. Elles ont été publiées dans un délai de 120 jours l’une de l’autre.
  3. La vidéo performante a dépassé la sous-performante d’au moins un facteur deux, afin que « mieux » et « moins bien » aient un sens plutôt que de décrire du bruit.
  4. Aucune chaîne ne contribue à plus de huit paires, afin qu’un créateur prolifique ne domine pas l’échantillon.

Les Shorts ont été exclus, ainsi que les lives, les vidéos âgées de moins de 45 jours et celles de plus de deux ans. Le score a vu une miniature et un titre — exactement ce que l’outil reçoit d’un utilisateur — et rien sur les vues ou sur le côté de la paire qu’il examinait.

Ce que le score a bien identifié, et à quelle fréquence

Le modèle a sélectionné la vidéo mieux performante dans 191 des 321 paires : 59,5 %, avec une valeur p binomiale exacte de 0,00079 contre une hypothèse nulle de 50 %. Dix-sept paires ont été classées comme ex-aequo, et chacune a été comptée comme un échec plutôt que divisée ou supprimée, car un score qui ne peut pas distinguer deux entrées n’a pas discriminé entre elles.

Compter les ex-aequo comme des échecs rend le chiffre principal conservateur. Un modèle sans aucune capacité obtiendrait environ 47,4 % selon cette règle, pas 50 %, donc le test a demandé au nôtre de dépasser légèrement le niveau réel du hasard. Parmi les 304 paires qu’il a effectivement séparées, il avait raison dans 62,8 % des cas.

La confiance suivait la justesse

Le motif qui fait que le résultat se comporte comme une mesure plutôt qu’un hasard : plus le score séparait deux vidéos, plus il avait raison.

À un écart de 1 à 3 points, la précision était de 56,0 %. À 4 à 7 points, 64,1 %. À 8 à 14 points, 63,2 %. À 15 points ou plus, 76,5 %. Un modèle produisant du bruit montrerait une ligne plate à travers ces catégories. Celui-ci s’améliore progressivement à mesure qu’il devient plus certain, ce qui est le comportement souhaité et impossible à falsifier.

Les quatre vérifications qui auraient pu nous prouver tort

Une étude qui ne peut pas échouer n’est pas une preuve. Nous avons spécifié quatre contrôles à l’avance, chacun capable d’invalider le résultat principal, et nous nous sommes engagés à publier les quatre, quel que soit leur résultat. Chacun s’est comporté comme prévu.

ContrôleCe qu’un échec aurait signifiéRésultat
Mélanger les étiquettes gagnant/perdant 1 000 foisLe pipeline fuit la réponse ; le résultat entier est nul47,1 %, exactement là où la théorie dit qu’il doit atterrir
Chaînes dont les miniatures suivent un modèle fixe uniqueLe score lit autre chose que l’emballage48,7 % — hasard, comme prévu
Heuristiques triviales : longueur du titre, nombre de mots, taille du fichier, contrasteUne règle en une ligne correspond au modèle, donc le modèle n’ajoute rien46,7 %-54,5 %, aucune n’est significative
Re-noter chaque miniature avec le titre de l’autre vidéoLe titre ne contribue à rien et nous notons une moitié, pas les deuxLe score a changé en moyenne de 11,3 points

Le contrôle sur les modèles est le plus important, et il vaut la peine d’être clair sur pourquoi. Sur les chaînes qui réutilisent un seul modèle de miniature pour tout, il y a presque rien pour un modèle visuel à comparer. Si notre score avait confiantement sélectionné des gagnants là-bas, il aurait lu l’identité de la chaîne ou l’époque de publication plutôt que l’emballage. Il a obtenu 48,7 % sur ces chaînes et 61,0 % partout ailleurs. Cet écart est la preuve la plus forte de l’étude que ce qui est mesuré est bien ce que nous prétendons.

Quelles dimensions de notation ont séparé les gagnants des perdants

Cette partie est exploratoire plutôt que confirmatoire, et décrit cet échantillon plutôt que YouTube en général. En classant les douze sous-scores selon la distance qu’ils mettent entre les deux groupes, la séparation la plus nette est venue de la clarté de la promesse, suivie du signal de peur de manquer quelque chose et de l’urgence. L’intensité émotionnelle les a à peine séparés.

La clarté de la promesse — à quel point l’emballage indique clairement ce que vous allez regarder — en tête du classement correspond à ce que le côté satisfaction du modèle était censé capturer. Le fait que l’intensité émotionnelle brute soit le séparateur le plus faible est la moitié la plus intéressante : un fort sentiment dans une miniature n’a pas distingué les sur- des sous-performantes dans cet échantillon, ce qui n’est pas ce que suppose la plupart des conseils sur les miniatures.

Si vous souhaitez voir ces dimensions sur votre propre emballage plutôt qu’en agrégat, vous pouvez faire passer une miniature et un titre dans le même pipeline de notation utilisé dans cette étude — c’est le même chemin de code, pas une version démo.

Ce que ce test ne prouve pas

Quatre limites, toutes écrites avant l’existence des données.

Il teste le score, pas les conseils. Savoir si suivre un titre suggéré améliore réellement une vidéo est une autre expérience que nous n’avons pas menée. C’est observationnel plutôt que causal : rien ici ne montre que changer une miniature change les vues, seulement que le score est associé à une différence déjà existante.

L’échantillon détermine à qui le résultat s’applique

Les paires ont été choisies précisément parce qu’elles différaient fortement en performance, donc 59,5 % décrit cette population — sur- versus sous-performantes claires — et non deux vidéos choisies au hasard. Chaque chaîne était établie, en anglais, et suffisamment grande pour avoir une moyenne stable. Rien ici ne s’applique à une chaîne avec douze publications et aucune histoire à mesurer.

Les vues ont été capturées à une date unique et continuent d’augmenter. Le tout est un instantané, et la manière honnête de traiter un instantané est d’en prendre un autre plus tard.

Questions fréquentes

59,5 % de précision, est-ce bien pour un score de miniature ?

Pour un seul signal d’emballage face à des résultats réels, oui. Les vues dépendent surtout du sujet, de la taille de l’audience, du timing et de la chance algorithmique, donc un score miniature-et-titre ne peut jamais expliquer qu’une part. Un chiffre plus proche de 90 % indiquerait une fuite dans la conception du test plutôt qu’un meilleur modèle. Le cadre utile est qu’il bat le hasard, et le bat plus nettement lorsqu’il est confiant.

Pourquoi ne pas simplement comparer les scores de miniature aux vues directement ?

Parce que cela mesure la taille de la chaîne. Le nombre d’abonnés, le sujet et l’âge de la vidéo influencent bien plus les vues que l’emballage, et les grandes chaînes ont tendance à avoir à la fois de meilleurs designers et des audiences plus larges — donc la corrélation est positive pour des raisons qui n’ont rien à voir avec la miniature. Comparer deux vidéos de la même chaîne élimine tout cela en une étape.

Que signifie le fait que les ex-aequo ont été comptés comme des échecs ?

Dix-sept paires ont reçu des scores identiques des deux côtés. Plutôt que de les diviser ou de les supprimer, ce qui aurait tous deux flatté le résultat, chacune a été enregistrée comme un échec. Un score qui ne peut pas distinguer deux entrées n’a pas discriminé entre elles. Cela rend le 59,5 % rapporté inférieur à ce que les traitements alternatifs auraient produit.

Un score de miniature plus élevé signifie-t-il plus de vues ?

Non. L’étude montre une association à travers de nombreuses paires, pas une promesse sur une vidéo unique. Environ quatre paires sur dix ont été classées à l’envers. L’emballage n’est qu’un levier parmi plusieurs, et un score fort sur une vidéo que personne ne veut regarder ne la sauvera pas.

Comment les 60 chaînes ont-elles été choisies ?

Par une règle fixée avant la collecte de données : des chaînes largement connues avec une longue histoire de publications, dix dans chacune des six catégories de contenu, sélectionnées pour la couverture des catégories plutôt que pour quoi que ce soit concernant leurs miniatures. La liste a été figée et enregistrée avant le début du scoring, afin qu’aucune chaîne ne puisse être ajoutée ou supprimée après l’apparition des résultats.

Puis-je voir la méthodologie et la vérifier moi-même ?

Le pré-enregistrement complet — exclusions, règles d’appariement, test principal, les quatre contrôles, et la formulation engagée à l’avance pour un résultat nul — a été rédigé et horodaté avant que toute vidéo ne soit notée. Les résultats agrégés sont rapportés ici ; les données vidéo sous-jacentes ne sont pas republiées, conformément aux conditions d’utilisation de l’API YouTube.