ricercaanalytics-youtubetest

Abbiamo provato quattro modi per rendere più accurato il punteggio della thumbnail

Un cambiamento ha aumentato l'accuratezza misurata dal 59,5% al 62,0%, rivelando una misurazione più equa, non un modello migliore. Gli altri tre non hanno avuto effetto. I numeri e le trappole in cui sono incappati.

September 14, 20269 min read
Abbiamo provato quattro modi per rendere più accurato il punteggio della thumbnail

Dopo aver testato il nostro punteggio thumbnail su 321 coppie di video reali, abbiamo cercato di renderlo più accurato. Abbiamo provato quattro cose. Una ha spostato il numero, e all’analisi si è rivelata una misurazione più equa, non un modello migliore. Le altre tre non hanno cambiato nulla, o hanno reso il punteggio meno affidabile. Ecco ciascuna, con i numeri.

Principali conclusioni

  • Confrontare i punteggi con precisione completa invece che come numeri interi arrotondati ha aumentato l’accuratezza misurata dal 59,5% al 62,0%, e tutto ciò è derivato da 17 ex pareggi, che si sono risolti in modo approssimativamente equo.
  • Le istruzioni di punteggio riscritte sembravano una svolta su 30 thumbnail, ma non hanno fatto nulla su 322: 64,6% prima e 63,4% dopo, su 161 coppie.
  • Chiedere all’IA di confrontare due thumbnail testa a testa ha corrisposto al punteggio ordinario in media, 62,7% ciascuno, ma la sua risposta dipendeva da quale immagine veniva prima.
  • La modalità di ragionamento del modello non ha cambiato nulla, tranne al livello più alto, e quel livello non ha mai restituito una risposta nella regione europea che usiamo per mantenere gli upload nell’UE.
  • Il risultato pubblicato e pre-registrato rimane al 59,5%. Tutto ciò che segue è lavoro di follow-up e contrassegnato come tale.

È possibile rendere più accurato un punteggio thumbnail dopo averlo testato?

Non facilmente, nel nostro caso. Di quattro modifiche testate su video reali, una ha aumentato l’accuratezza misurata, dal 59,5% al 62,0%, e lo ha fatto correggendo come i punteggi venivano confrontati, piuttosto che facendo vedere al modello qualcosa di nuovo. Le altre tre hanno lasciato l’accuratezza invariata. Il punteggio sembra vicino a ciò che questo modello può fare.

Questa è una risposta meno entusiasmante di un nuovo record, ma più utile. Indica dove non concentrare gli sforzi e spiega perché ogni idea allettante ha fallito. Questo è importante oltre questo singolo punteggio, perché le stesse trappole colpiscono i creatori che testano le proprie thumbnail.

La correzione che ha funzionato: smettere di arrotondare prima di confrontare

Il punteggio che vedi è un numero intero da 0 a 100. Nel nostro test originale, i due video in una coppia a volte finivano sullo stesso numero intero, e ciò è accaduto 17 volte su 321 coppie. Le nostre regole pre-registrate contavano ogni pareggio come un fallimento, ragionando che un punteggio che non riesce a separare due video non li ha discriminati.

Dietro il numero intero c’è un valore preciso, e l’arrotondamento scarta la differenza. Confrontare i valori precisi elimina completamente i pareggi, e l’accuratezza misurata sale dal 59,5% al 62,0%: 199 su 321 coppie invece di 191. Nessun video è stato ri-punteggiato e nessun peso è cambiato; il valore preciso era già lì.

Perché questo è un numero più equo, non un modello migliore

La domanda ovvia è come si sono risolti quei 17 pareggi. Se il modello li avesse segretamente indovinati, l’arrotondamento avrebbe nascosto una vera abilità. Non l’ha fatto. Otto dei 17 sono andati al video con prestazioni migliori e nove no, il che è all’incirca ciò che produrrebbe un lancio di moneta.

Quindi il guadagno deriva dal non segnare più i lanci di moneta come fallimenti automatici, non dal fatto che il modello sappia di più. Per questo il risultato pubblicato rimane al 59,5%: era la cifra a cui ci eravamo impegnati in anticipo, secondo regole scritte prima di vedere qualsiasi dato. Il 62,0% è riportato come misurazione di follow-up, chiaramente etichettata, e descrive lo stesso modello.

Regolazione delle istruzioni: un piccolo pilota che sembrava una svolta

I punteggi del modello si raggruppano. Diversi dei dodici fattori su cui si basa il punteggio si trovavano in fasce ristrette su centinaia di thumbnail reali, e il nostro test originale ha mostrato che il punteggio è più affidabile quando pone due video lontani tra loro. Quindi abbiamo riscritto le istruzioni per dare alla scala un punto di riferimento: 50 significa il video tipico nello stesso feed, 90 e oltre riservati al top 10%.

In un pilota di 30 thumbnail, punteggiate con entrambe le versioni, sembrava funzionare. Otto dei dodici fattori si sono allargati, e due hanno quasi raddoppiato la loro dispersione. Abbiamo poi eseguito le nuove istruzioni su 322 thumbnail. I due fattori che avevano quasi raddoppiato la dispersione sono cresciuti di soli 1,1 e 0,1 punti. Su 161 coppie, le istruzioni originali hanno scelto il video migliore nel 64,6% dei casi e le nuove nel 63,4%, una differenza ben entro il margine di casualità. La nuova versione ha inoltre abbassato quasi ogni valutazione di cinque a sette punti, quindi avrebbe costato a ogni creatore diversi punti di punteggio per nulla.

Perché una maggiore dispersione non ha significato maggiore accuratezza

Il pilota era semplicemente troppo piccolo. Con 30 thumbnail, una misura di quanto siano dispersi i punteggi oscilla molto per caso, e il raddoppio di due fattori rientrava in tale oscillazione. Il pilota avrebbe dovuto essere letto come motivo per eseguire un test più grande, non come risultato.

Il test più ampio ha fornito una seconda lezione. Due fattori, curiosità e rischio clickbait, si sono effettivamente dispersi su 322 thumbnail, ma il ranking non è migliorato. Una dispersione maggiore aiuta solo se la larghezza aggiuntiva segue differenze reali tra i video. Qui seguiva il rumore, e un rumore che sembra fiducia è peggiore di nessuno.

Confrontare le thumbnail testa a testa invece di punteggiarle

Punteggiare ogni thumbnail separatamente e poi confrontare i numeri non è come le persone scelgono tra thumbnail; guardano due immagini fianco a fianco. Quindi abbiamo chiesto al modello di farlo: mostrati entrambi i video di una coppia, quale ha avuto prestazioni migliori? Ogni coppia di 161 è stata mostrata due volte, una per ogni ordine.

In media su entrambi gli ordini, il giudice testa a testa ha avuto ragione nel 62,7% dei casi, corrispondendo esattamente al punteggio ordinario sulle stesse 150 coppie completamente risposte. Ma ha scelto la thumbnail che vedeva per prima nel 64,7% dei casi, e per quasi un terzo delle coppie ha dato risposte opposte a seconda dell’ordine. Uguale accuratezza con molto meno stabilità ha significato che non è stato adottato. I risultati completi sono nella nostra analisi separata su come chiedere a un’IA di confrontare thumbnail.

Attivare la modalità di ragionamento del modello

Il modello offre un’impostazione che lo fa lavorare su un problema passo dopo passo prima di rispondere, a diversi livelli di sforzo. Ai tre livelli inferiori, un’analisi completa di una thumbnail di test restituiva gli stessi dodici punteggi di quando l’impostazione era spenta. Solo il livello più alto ha cambiato il comportamento del modello.

Nel data center europeo che usiamo, affinché le thumbnail caricate non vengano mai elaborate fuori dall’UE, quel livello più alto non ha mai restituito una risposta, nonostante tentativi ripetuti che duravano fino a tre minuti. Abbiamo verificato che funziona in una regione USA usando una domanda aritmetica inventata senza thumbnail coinvolte, e abbiamo scoperto che scriveva il suo ragionamento come testo semplice davanti alla risposta invece di tenerlo separato. Spostare gli upload negli USA per scoprire se aiuta non era un compromesso che eravamo disposti a fare.

I quattro risultati affiancati

Ogni modifica è stata confrontata con l’originale sulle stesse coppie, quindi ogni differenza qui sotto è a parità di condizioni.

ModificaCosa ha fatto all’accuratezza del rankingMantenuta?
Confrontare punteggi non arrotondati59,5% a 62,0% su 321 coppie, interamente da ex pareggi che si sono risolti in modo approssimativamente equoSì, come misurazione più equa
Istruzioni di punteggio calibrate64,6% a 63,4% su 161 coppie, nessuna differenza rilevabileNo
Confrontare thumbnail testa a testa62,7% contro 62,7% su 150 coppie, con risposte dipendenti dall’ordineNo
Modalità di ragionamento del modelloNessun cambiamento ai livelli che funzionavano; il più alto non ha mai risposto nella nostra regioneNo

Ogni cifra qui proviene dalla stessa pipeline di punteggio che viene eseguita quando analizzi una thumbnail e un titolo. I test hanno punteggiato video reali attraverso il prodotto stesso, non attraverso una copia di ricerca separata.

Come abbiamo mantenuto onesti questi test di follow-up

Gli esperimenti di follow-up sono dove gli studi di solito vanno male, perché il ricercatore già sa quale risposta vorrebbe. Cinque regole hanno tenuto sotto controllo questo rischio:

  1. Il risultato pubblicato non è mai stato toccato. Il 59,5% pre-registrato rimane il titolo, e ogni analisi successiva è etichettata come lavoro di follow-up.
  2. I canali sono stati divisi a metà prima di testare qualsiasi modifica. Gli esperimenti hanno usato una metà, e l’altra è stata tenuta da parte per un controllo finale.
  3. Ogni modifica è stata confrontata con l’originale sulle stesse coppie, contando solo le coppie in cui i due non erano d’accordo, il che è molto più sensibile che confrontare due percentuali complessive.
  4. Un piccolo pilota è stato trattato come motivo per eseguire un test più grande, mai come risultato in sé.
  5. Ogni confronto testa a testa è stato mostrato in entrambi gli ordini, in modo che una preferenza per la posizione non potesse passare per abilità.

Nessuna di queste richiede una laurea in statistica, e la maggior parte si applica direttamente a un creatore che testa le proprie thumbnail: decidi cosa conta come vittoria prima di guardare, confronta cose simili con cose simili, e considera un risultato iniziale piccolo come motivo per continuare a testare.

Limiti di questi risultati di follow-up

Tutti e quattro gli esperimenti hanno usato gli stessi canali consolidati in lingua inglese del test originale e un solo modello. Le idee sono state scelte dopo che il risultato originale era noto, che è esattamente la situazione che tende a esaltare un risultato, e un altro motivo per cui il titolo rimane alla cifra pre-registrata.

Ogni modifica è stata provata una volta, in una forma. Una formulazione diversa delle istruzioni avrebbe potuto funzionare meglio, e il risultato della modalità di ragionamento descrive ciò che era disponibile in una regione nel settembre 2026. Nessuno di questi risultati dice che il punteggio non possa migliorare; dicono che questi quattro percorsi non lo hanno migliorato.

Domande frequenti

Perché non riportare il 62,0% come accuratezza?

Perché le regole del test erano fissate prima che esistesse qualsiasi dato, e contavano i pareggi come fallimenti. Cambiare una regola dopo aver visto i risultati è esattamente ciò che la pre-registrazione esiste per impedire, anche quando il cambiamento è ragionevole. Il 62,0% è pubblicato come misurazione di follow-up chiaramente etichettata, accanto al 59,5% che non sostituisce.

Un modello AI più intelligente renderebbe il punteggio più accurato?

Forse, ma sarebbe un nuovo esperimento. La modalità di ragionamento del nostro modello attuale non ha aiutato nella regione che usiamo, e un modello diverso avrebbe bisogno di essere testato sulle stesse coppie, nello stesso modo, prima di poter fare qualsiasi affermazione. Più recente non significa automaticamente migliore in questo compito specifico.

Perché un test su 30 thumbnail sembrava così convincente?

I campioni piccoli producono grandi oscillazioni per caso, e un’oscillazione grande sembra una scoperta. Con 30 thumbnail, due fattori che sembravano raddoppiare la loro dispersione rientravano nella variazione normale; a 322 thumbnail l’effetto è quasi scomparso. È la stessa trappola di giudicare uno stile thumbnail nuovo su due upload.

Cosa significa questo per testare le mie thumbnail?

Le stesse regole si applicano. Decidi cosa conta come successo prima di guardare, confronta con la gamma normale del tuo canale piuttosto che con un singolo video precedente, esegui abbastanza esempi perché il caso non possa spiegare il risultato, e se chiedi a qualsiasi strumento di confrontare due opzioni, verifica se la sua risposta resiste allo scambio.

Il punteggio vale ancora la pena se questi miglioramenti sono falliti?

Il punteggio è stato testato contro risultati reali e ha battuto il caso con un margine chiaro. Questi follow-up mostrano che quattro cambiamenti allettanti non lo hanno spinto oltre, il che è utile da sapere piuttosto che un motivo per scartarlo. Trattalo come un input informato tra diversi, non come una previsione di visualizzazioni.