Après avoir testé notre score de miniature sur 321 paires de vidéos réelles, nous avons tenté de l’améliorer. Nous avons essayé quatre choses. L’une a fait bouger le chiffre, et à l’examen, il s’agissait d’une mesure plus juste, pas d’un meilleur modèle. Les trois autres n’ont rien changé, ou ont rendu le score moins fiable. Voici chacune d’elles, avec les chiffres.
Points clés
- Comparer les scores avec leur précision complète au lieu de les arrondir en nombres entiers a fait passer la précision mesurée de 59,5 % à 62,0 %, et tout cela provenait de 17 anciens ex-aequo, qui se sont répartis à peu près équitablement.
- Les instructions de notation réécrites semblaient une percée sur 30 miniatures, mais n’ont rien changé sur 322 : 64,6 % avant et 63,4 % après, sur 161 paires.
- Demander à l’IA de comparer deux miniatures côte à côte a donné en moyenne le même score que la méthode ordinaire, 62,7 % chacun, mais sa réponse dépendait de l’ordre des images.
- Le réglage de raisonnement du modèle n’a rien changé, sauf au niveau le plus élevé — et ce niveau n’a jamais renvoyé de réponse dans la région européenne que nous utilisons pour garder les téléchargements dans l’UE.
- Le résultat publié, pré-enregistré, reste à 59,5 %. Tout ce qui suit est un travail complémentaire, clairement étiqueté comme tel.
Un score miniature peut-il devenir plus précis après avoir été testé ?
Pas facilement, dans notre cas. Sur les quatre changements testés sur des vidéos réelles, un seul a augmenté la précision mesurée, de 59,5 % à 62,0 %, et ce en corrigeant la façon dont les scores étaient comparés, pas en faisant voir quelque chose de nouveau au modèle. Les trois autres n’ont pas changé la précision. Le score semble proche de ce que ce modèle peut faire.
C’est une réponse moins excitante qu’un nouveau record, mais plus utile. Elle indique où l’effort ne devrait pas aller, et explique pourquoi chaque idée tentante a échoué. Cela dépasse ce seul score, car les mêmes pièges attrapent les créateurs testant leurs propres miniatures.
La correction qui a fonctionné : arrêter d’arrondir avant de comparer
Le score que vous voyez est un nombre entier de 0 à 100. Dans notre test initial, les deux vidéos d’une paire atterrissaient parfois sur le même nombre entier, ce qui s’est produit 17 fois sur 321 paires. Nos règles pré-enregistrées comptaient chaque ex-aequo comme un échec, car un score qui ne peut pas distinguer deux vidéos n’a pas discriminé entre elles.
Derrière le nombre entier se trouve une valeur précise, et l’arrondi jette la différence à la poubelle. Comparer les valeurs précises élimine tous les ex-aequo, et la précision mesurée passe de 59,5 % à 62,0 % : 199 sur 321 paires au lieu de 191. Aucune vidéo n’a été renotée, aucun poids n’a changé ; la valeur précise était déjà là.
Pourquoi c’est un chiffre plus juste, pas un meilleur modèle
La question évidente est de savoir comment ces 17 ex-aequo se sont résolus. Si le modèle les avait discrètement bien résolus, l’arrondi aurait masqué une vraie compétence. Ce n’était pas le cas. Huit des 17 sont allés à la vidéo la mieux performante, neuf non — ce qui correspond à peu près à ce qu’un pile ou face produirait.
Le gain vient donc du fait de ne plus marquer les pile ou face comme des échecs automatiques, pas du fait que le modèle en sache plus. C’est pourquoi le résultat publié reste à 59,5 % : c’était le chiffre auquel nous nous étions engagés à l’avance, selon des règles rédigées avant de voir les données. Le 62,0 % est rapporté comme une mesure complémentaire, clairement étiquetée, et décrit le même modèle.
Ajuster les instructions : un petit pilote qui ressemblait à une percée
Les notes du modèle sont groupées. Plusieurs des douze facteurs sur lesquels repose le score se situaient dans des bandes étroites sur des centaines de miniatures réelles, et notre test initial montrait que le score est le plus fiable lorsqu’il place deux vidéos très loin l’une de l’autre. Nous avons donc réécrit les instructions pour donner à l’échelle un point de référence : 50 signifiant la vidéo typique dans le même flux, 90 et plus réservés au dixième supérieur.
Sur un pilote de 30 miniatures, notées selon les deux versions, cela semblait fonctionner. Huit des douze facteurs se sont élargis, et deux ont presque doublé leur écart. Nous avons ensuite exécuté les nouvelles instructions sur 322 miniatures. Les deux facteurs qui avaient presque doublé n’ont augmenté que de 1,1 et 0,1 point d’écart. Sur 161 paires, les instructions originales ont choisi la meilleure vidéo 64,6 % du temps, les nouvelles 63,4 %, une différence bien dans la marge du hasard. La nouvelle version a aussi abaissé presque toutes les notes de cinq à sept points, ce qui aurait coûté plusieurs points de score à chaque créateur pour rien.
Pourquoi plus d’écart n’a pas signifié plus de précision
Le pilote était simplement trop petit. Avec 30 miniatures, une mesure de la dispersion des notes varie beaucoup par hasard, et deux facteurs doublant leur écart était dans cette marge. Le pilote aurait dû être lu comme une raison de faire un test plus grand, pas comme un résultat.
Le test plus large a apporté une deuxième leçon. Deux facteurs, la curiosité et le risque de clickbait, se sont réellement élargis sur 322 miniatures, et le classement n’a toujours pas progressé. Un écart plus large n’aide que si la largeur supplémentaire suit de vraies différences entre vidéos. Ici, elle suivait du bruit, et un bruit qui ressemble à de la confiance est pire que rien.
Comparer les miniatures côte à côte au lieu de les noter
Noter chaque miniature séparément puis comparer les chiffres n’est pas la façon dont les gens choisissent entre miniatures ; ils les regardent côte à côte. Nous avons donc demandé au modèle de faire cela : montrant les deux vidéos d’une paire, laquelle a surpassé l’autre ? Chaque paire de 161 a été montrée deux fois, une fois dans chaque ordre.
En moyenne sur les deux ordres, le juge côte à côte avait raison 62,7 % du temps, exactement comme le score ordinaire sur les mêmes 150 paires complètement répondues. Mais il choisissait la miniature qu’il voyait en premier 64,7 % du temps, et pour près d’un tiers des paires, il donnait des réponses opposées selon l’ordre. Une précision égale avec bien moins de stabilité signifiait qu’il n’a pas été adopté. Les résultats complets sont dans notre article séparé sur la demande à une IA de comparer des miniatures.
Activer le mode raisonnement du modèle
Le modèle propose un réglage qui le fait résoudre un problème étape par étape avant de répondre, à plusieurs niveaux d’effort. Aux trois niveaux inférieurs, une analyse complète d’une miniature de test renvoyait les mêmes douze notes qu’avec le réglage désactivé. Seul le niveau le plus élevé a changé le comportement du modèle.
Dans le centre de données européen que nous utilisons, pour que les miniatures téléchargées ne soient jamais traitées en dehors de l’UE, ce niveau le plus élevé n’a jamais renvoyé de réponse, malgré des tentatives répétées durant jusqu’à trois minutes. Nous avons confirmé qu’il fonctionne dans une région américaine en utilisant une question arithmétique inventée sans miniature, et avons constaté qu’il écrivait son raisonnement en texte brut avant la réponse au lieu de le garder séparé. Déplacer les téléchargements aux États-Unis pour savoir s’il aide n’était pas un compromis que nous étions prêts à faire.
Les quatre résultats côte à côte
Chaque changement a été comparé à l’original sur les mêmes paires, donc chaque différence ci-dessous est « pomme à pomme ».
| Changement | Effet sur la précision du classement | Conservé ? |
|---|---|---|
| Comparer les scores non arrondis | 59,5 % à 62,0 % sur 321 paires, entièrement dû à la rupture équitable des anciens ex-aequo | Oui, comme mesure plus juste |
| Instructions de notation calibrées | 64,6 % à 63,4 % sur 161 paires, aucune différence détectable | Non |
| Comparer les miniatures côte à côte | 62,7 % contre 62,7 % sur 150 paires, avec des réponses dépendant de l’ordre | Non |
| Mode raisonnement du modèle | Aucun changement aux niveaux qui fonctionnent ; le plus élevé n’a jamais répondu dans notre région | Non |
Tous les chiffres ici proviennent du même pipeline de notation utilisé lorsque vous analysez une miniature et un titre. Les tests ont noté des vidéos réelles via le produit lui-même, pas via une copie de recherche séparée.
Comment nous avons gardé ces tests complémentaires honnêtes
Les expériences complémentaires sont là où les études se trompent généralement, car le chercheur sait déjà quelle réponse il aimerait. Cinq règles ont empêché cela :
- Le résultat publié n’a jamais été modifié. Le 59,5 % pré-enregistré reste le chiffre principal, et toute analyse ultérieure est étiquetée comme travail complémentaire.
- Les chaînes ont été divisées en deux avant tout test. Les expériences ont utilisé une moitié, l’autre étant gardée pour un contrôle final.
- Chaque changement a été comparé à l’original sur les mêmes paires, en comptant uniquement les paires où les deux différaient — bien plus sensible que de comparer deux pourcentages globaux.
- Un petit pilote a été traité comme une raison de faire un test plus grand, jamais comme un résultat en soi.
- Toute comparaison côte à côte a été montrée dans les deux ordres, pour qu’une préférence de position ne puisse pas passer pour une compétence.
Aucune de ces règles ne nécessite un diplôme en statistiques, et la plupart s’appliquent directement à un créateur testant ses propres miniatures : décidez ce qui compte comme une victoire avant de regarder, comparez des choses similaires, et traitez un petit résultat précoce comme une raison de continuer à tester.
Limites de ces résultats complémentaires
Toutes les quatre expériences ont utilisé les mêmes chaînes établies, en anglais, que le test initial, et un seul modèle. Les idées ont été choisies après que le résultat initial était connu, ce qui est exactement la situation qui tend à embellir une découverte — et une autre raison pour laquelle le chiffre principal reste le chiffre pré-enregistré.
Chaque changement a été essayé une fois, sous une seule forme. Un autre libellé des instructions aurait pu mieux fonctionner, et le résultat du mode raisonnement décrit ce qui était disponible dans une région en septembre 2026. Aucun de ces résultats ne dit que le score ne peut pas s’améliorer ; ils disent que ces quatre voies ne l’ont pas amélioré.
Questions fréquentes
Pourquoi ne pas rapporter 62,0 % comme précision ?
Parce que les règles du test étaient fixées avant l’existence de toute donnée, et qu’elles comptaient les ex-aequo comme des échecs. Modifier une règle après avoir vu les résultats est exactement ce que le pré-enregistrement vise à empêcher, même quand le changement est raisonnable. Le 62,0 % est publié comme une mesure complémentaire clairement étiquetée, à côté du 59,5 % qu’il ne remplace pas.
Un modèle IA plus intelligent rendrait-il le score plus précis ?
Possiblement, mais ce serait une nouvelle expérience. Le réglage de raisonnement de notre modèle actuel n’a pas aidé dans la région que nous utilisons, et un modèle différent devrait être testé sur les mêmes paires, de la même manière, avant toute affirmation. Plus récent ne signifie pas automatiquement meilleur pour cette tâche précise.
Pourquoi un test sur 30 miniatures semblait-il si convaincant ?
Les petits échantillons produisent de grands écarts par hasard, et un grand écart ressemble à une découverte. Avec 30 miniatures, deux facteurs semblant doubler leur dispersion était dans la variation normale ; à 322 miniatures, l’effet a presque disparu. C’est le même piège que juger un nouveau style de miniature sur deux publications.
Que signifie cela pour tester mes propres miniatures ?
Les mêmes règles s’appliquent. Décidez ce qui compte comme un succès avant de regarder, comparez avec la gamme normale de votre chaîne plutôt qu’avec une seule vidéo précédente, faites assez d’exemples pour que le hasard ne puisse pas expliquer le résultat, et si vous demandez à un outil de comparer deux options, vérifiez si sa réponse tient en échangeant les deux.
Le score vaut-il encore la peine d’être utilisé si ces améliorations ont échoué ?
Le score a été testé contre des résultats réels et a surpassé le hasard de manière nette. Ces compléments montrent que quatre changements tentants ne l’ont pas poussé plus loin, ce qui est utile à savoir plutôt qu’une raison de l’écarter. Traitez-le comme une entrée informée parmi plusieurs, pas comme une prédiction de vues.