Un punteggio thumbnail vale qualcosa solo se riflette ciò che accade davvero su YouTube. Abbiamo quindi eseguito un test che avrebbe potuto metterci in imbarazzo: 321 coppie di video reali, ciascuna da uno stesso canale, uno che ha superato la media del canale e uno che è rimasto al di sotto. Abbiamo scritto il metodo prima di guardare i dati. Il punteggio ha identificato il video con prestazioni migliori nel 59,5% dei casi, contro il 50% di una scelta casuale.
Principali conclusioni
- Su 321 coppie, il punteggio ha classificato il video con prestazioni migliori nel 59,5% dei casi (p = 0,00079). La probabilità casuale è del 50%.
- Confrontare video da canali diversi misura il numero di iscritti, non il packaging — ogni coppia qui proviene da un singolo canale, pubblicata con una mediana di sei giorni di differenza.
- Su canali dove ogni thumbnail segue lo stesso template, l'accuratezza è scesa al 48,7%. Questo è il risultato che volevamo: nessuna differenza da leggere, nessun segnale da trovare.
- Quattro euristiche semplici — titolo più lungo, più parole, file più grande, contrasto più alto — sono tutte risultate casuali. Il punteggio non è un surrogato di nessuna di esse.
- Più grande era il divario che il modello metteva tra due video, più spesso aveva ragione: 56% con un divario di 1-3 punti, 76,5% con 15 punti o più.
Un punteggio thumbnail YouTube predice davvero le performance?
In questo test, sì — in modo modesto e misurabile. Dati due video dello stesso canale, uno che ha chiaramente superato la propria baseline e uno che ha chiaramente deluso, il nostro punteggio li ha classificati correttamente nel 59,5% dei casi. La probabilità casuale è del 50%. L'intervallo di confidenza al 95% va dal 53,9% al 64,9%, quindi l'effetto è reale ma piccolo.
Piccolo è la risposta onesta, e chiunque ne prometta di più sta vendendo qualcosa. Il packaging è solo uno dei tanti fattori. Argomento, orario di pubblicazione, umore dell'algoritmo quella settimana, se un video è stato ripreso altrove — tutto questo influenza le visualizzazioni molto più di un thumbnail. Un punteggio che affermasse un'accuratezza del 90% descriverebbe un YouTube che non esiste.
Cosa significa il 59,5% nella pratica: se state scegliendo tra due opzioni per lo stesso video, il punteggio è meglio di un'ipotesi casuale, ed è più utile quanto più fortemente preferisce una delle due.
Perché confrontare thumbnail tra canali non dice nulla
La versione ovvia di questo test è assegnare un punteggio a un gruppo di thumbnail e correlarlo con i conteggi delle visualizzazioni. Questo misura la dimensione del canale. Le visualizzazioni sono guidate dal numero di iscritti, dall'argomento e dall'età del video molto più che dal packaging, e il confondente agisce nella direzione lusinghiera: i canali grandi possono permettersi designer migliori e hanno pubblici più ampi.
Eseguite quel test e otterrete una bella correlazione positiva che non significa nulla. Sopravvivrebbe esattamente a un solo lettore scettico.
Cosa deve rimanere costante in un confronto equo
Confrontare due video dello stesso canale annulla numero di iscritti, pubblico, budget e competenza di design in un colpo solo, perché tutti e quattro sono identici nella coppia. Richiedere che i due siano pubblicati vicini nel tempo annulla anche la traiettoria di crescita del canale e il regime dell'algoritmo di quel periodo.
Quello che rimane è una domanda con una risposta nota sotto l'ipotesi nulla: dati due video che il pubblico del canale ha trattato in modo molto diverso, il punteggio riesce a dire quale sia quale?
Come abbiamo costruito un test equo su 321 coppie abbinate
Abbiamo preso 60 canali in sei categorie — tecnologia, educazione, cucina, gaming, fitness e lifestyle — e recuperato fino a 300 upload recenti da ciascuno. Dopo esclusioni, sono stati considerati 17.250 video e 321 coppie utilizzabili. Ogni coppia è dello stesso canale, pubblicata con una mediana di sei giorni di differenza, con il video migliore che supera quello peggiore per un fattore mediano di 4,7.
Le performance sono misurate rispetto a una baseline locale mobile, non alla media del canale. Per ogni video prendiamo la mediana delle visualizzazioni dei dieci upload vicini su entrambi i lati, escludendo se stesso, e esprimiamo le sue visualizzazioni come multiplo di quella. Un canale che cresce cinque volte in due anni altrimenti etichetterebbe ogni video iniziale come fallimento e ogni video recente come successo — misurando il calendario, non il packaging.
Le regole di abbinamento sono state fissate in anticipo:
- Entrambi i video provengono dallo stesso canale, e ogni video appare in al massimo una coppia.
- Sono stati pubblicati entro 120 giorni l'uno dall'altro.
- Il video migliore ha superato quello peggiore di almeno un fattore due, in modo che "migliore" e "peggiore" abbiano un significato reale e non descrivano rumore.
- Nessun canale contribuisce con più di otto coppie, in modo che un singolo uploader prolifico non possa dominare il campione.
Sono stati esclusi i Shorts, i livestream, i video con meno di 45 giorni e quelli con più di due anni. Il punteggio ha visto solo un thumbnail e un titolo — esattamente ciò che lo strumento riceve dall'utente — e nulla sulle visualizzazioni o su quale lato della coppia stava esaminando.
Cosa ha indovinato il punteggio, e con quale frequenza
Il modello ha scelto il video con prestazioni migliori in 191 delle 321 coppie: 59,5%, con un valore p binomiale esatto di 0,00079 contro un'ipotesi nulla del 50%. Diciassette coppie sono risultate esattamente pari, e ognuna di esse è stata conteggiata come un fallimento invece che divisa o scartata, perché un punteggio che non riesce a separare due input non ha discriminato tra di essi.
Contare i pareggi come perdite rende il numero principale conservativo. Un modello senza alcuna capacità otterrebbe circa il 47,4% sotto questa regola, non il 50%, quindi il test ha chiesto al nostro di superare una soglia leggermente superiore al livello reale di casualità. Tra le 304 coppie che ha effettivamente separato, ha avuto ragione nel 62,8% dei casi.
La fiducia seguiva la correttezza
Il pattern che fa comportare il risultato come una misurazione piuttosto che un caso fortuito: più distanti erano i punteggi assegnati a due video, più spesso il modello aveva ragione.
Con un divario di 1-3 punti, l'accuratezza era del 56,0%. Con 4-7 punti, 64,1%. Con 8-14 punti, 63,2%. Con 15 punti o più, 76,5%. Un modello che produce rumore mostrerebbe una linea piatta attraverso questi gruppi. Questo invece migliora progressivamente man mano che diventa più certo, che è il comportamento che si desidera e che non si può falsificare.
I quattro controlli che avrebbero potuto dimostrarci sbagliati
Uno studio che non può fallire non è una prova. Abbiamo specificato quattro controlli in anticipo, ognuno in grado di invalidare il risultato principale, e ci siamo impegnati a pubblicare tutti e quattro indipendentemente dai risultati. Ognuno si è comportato come previsto.
| Controllo | Cosa avrebbe significato un fallimento | Risultato |
|---|---|---|
| Mescolare le etichette vincitore/perdente 1.000 volte | La pipeline rivela la risposta; l'intero risultato è nullo | 47,1%, esattamente dove la teoria dice che deve atterrare |
| Canali i cui thumbnail seguono un template fisso | Il punteggio sta leggendo qualcosa oltre il packaging | 48,7% — casualità, come previsto |
| Euristiche banali: lunghezza titolo, conteggio parole, dimensione file, contrasto | Una regola di una riga corrisponde al modello, quindi il modello non aggiunge nulla | 46,7%-54,5%, nessuno significativo |
| Ricalcolare ogni thumbnail con il titolo dell'altro video | Il titolo non contribuisce e noi valutiamo solo una metà, non due | Il punteggio si è spostato in media di 11,3 punti |
Il controllo sui template è quello che conta di più, e vale la pena chiarire il perché. Su canali che riutilizzano un unico layout thumbnail per tutto, c'è quasi nulla per un modello visivo da confrontare. Se il nostro punteggio avesse scelto con sicurezza i vincitori lì, avrebbe letto l'identità del canale o l'epoca di caricamento piuttosto che il packaging. Ha ottenuto il 48,7% su quei canali e il 61,0% ovunque altro. Quel divario è la prova più forte dello studio che ciò che viene misurato è ciò che affermiamo.
Quali dimensioni di punteggio hanno separato i vincitori dai perdenti
Questa parte è esplorativa piuttosto che confermativa, e descrive questo campione piuttosto che YouTube in generale. Classificando i dodici sottopunteggi in base a quanto distanziavano i due gruppi, la separazione più chiara è venuta dalla chiarezza della promessa, seguita dal segnale di paura di perdere e dall'urgenza. L'intensità emotiva li ha appena separati.
La chiarezza della promessa — quanto chiaramente il packaging ti dice cosa stai per guardare — che guida la classifica si adatta a ciò che il lato soddisfazione del modello è stato costruito per catturare. La separazione più debole, l'intensità emotiva grezza, è la metà più interessante: un forte sentimento in un thumbnail non ha distinto i sovraperformanti dai sottoperformanti in questo campione, il che non è ciò che la maggior parte dei consigli sui thumbnail assume.
Se volete vedere queste dimensioni sul vostro packaging invece che in aggregato, potete far passare un thumbnail e un titolo attraverso la stessa pipeline di punteggio usata in questo studio — è lo stesso percorso di codice, non una versione demo.
Cosa questo test non dimostra
Quattro limiti, tutti scritti prima che esistessero i dati.
Testa il punteggio, non i consigli. Se agire su un titolo suggerito migliori effettivamente un video reale è un esperimento diverso che non abbiamo eseguito. È osservazionale piuttosto che causale: nulla qui mostra che cambiare un thumbnail cambi le visualizzazioni, solo che il punteggio è associato a una differenza già esistente.
Il campione decide a chi si applica il risultato
Le coppie sono state scelte proprio perché differivano nettamente nelle performance, quindi il 59,5% descrive quella popolazione — chiaramente sovraperformanti contro chiaramente sottoperformanti — e non due video qualsiasi scelti a caso. Ogni canale era stabilito, in inglese e abbastanza grande da avere una baseline stabile. Nulla qui si generalizza a un canale con dodici upload e nessuna storia da misurare.
I conteggi delle visualizzazioni sono stati catturati in una singola data e continuano ad aumentare. L'intera cosa è uno scatto, e il modo onesto di trattare uno scatto è prenderne un altro in seguito.
Domande frequenti
Il 59,5% di accuratezza è buono per un punteggio thumbnail?
Per un singolo segnale di packaging rispetto a risultati reali, sì. Le visualizzazioni dipendono soprattutto dall'argomento, dalla dimensione del pubblico, dal momento e dalla fortuna algoritmica, quindi un punteggio thumbnail e titolo può spiegare solo una fetta. Un numero più vicino al 90% indicherebbe una fuga nel design del test piuttosto che un modello migliore. Il modo utile di vederlo è che batte l'ipotesi casuale, e lo batte più decisamente quando è sicuro.
Perché non confrontare semplicemente i punteggi thumbnail con i conteggi delle visualizzazioni?
Perché misura la dimensione del canale. Il numero di iscritti, l'argomento e l'età del video spostano le visualizzazioni molto più del packaging, e i canali più grandi tendono ad avere sia designer migliori sia pubblici più ampi — quindi la correlazione risulta positiva per ragioni che non hanno nulla a che fare con il thumbnail. Confrontare due video dello stesso canale rimuove tutto questo in un solo passaggio.
Cosa significa che i pareggi sono stati conteggiati come fallimenti?
Diciassette coppie hanno ricevuto punteggi identici su entrambi i lati. Piuttosto che dividerli o rimuoverli, che avrebbero entrambi lusingato il risultato, ognuno è stato registrato come un errore. Un punteggio che non riesce a distinguere due input non li ha discriminati. Questo rende il 59,5% riportato inferiore a quanto avrebbero prodotto altri trattamenti.
Un punteggio thumbnail più alto significa più visualizzazioni?
No. Lo studio mostra un'associazione attraverso molte coppie, non una promessa su un singolo video. Circa quattro coppie su dieci sono state classificate nel modo sbagliato. Il packaging è una leva tra molte, e un punteggio forte su un video che nessuno vuole guardare non lo salverà.
Come sono stati scelti i 60 canali?
Con una regola fissata prima della raccolta di qualsiasi dato: canali ampiamente noti con una lunga storia di upload, dieci in ciascuna delle sei categorie di contenuti, selezionati per copertura di categoria piuttosto che per qualcosa sui loro thumbnail. L'elenco è stato congelato e registrato prima dell'inizio della valutazione, in modo che nessun canale potesse essere aggiunto o rimosso dopo l'apparizione dei risultati.
Posso vedere la metodologia e verificarla da solo?
La registrazione completa pre-test — esclusioni, regole di abbinamento, test principale, tutti e quattro i controlli e la formulazione impegnata in anticipo per un risultato nullo — è stata scritta e timbrata prima che qualsiasi video fosse valutato. I risultati aggregati sono riportati qui; i dati video sottostanti non sono ripubblicati, in linea con i termini dell'API di YouTube.