testanalytics-youtubethumbnail

Come capire se un test di thumbnail è affidabile

La maggior parte dei test misura la crescita del canale, non l'efficacia del packaging. Scopri la baseline corretta, quanto conta una differenza e gli errori che rendono un test fuorviante.

September 4, 20268 min read
Come capire se un test di thumbnail è affidabile

Cambi un thumbnail, il video successivo va meglio e concludi che il nuovo stile funziona. Questa conclusione è di solito sbagliata — non perché il thumbnail non abbia fatto nulla, ma perché il confronto non avrebbe potuto rilevare se lo avesse fatto. Ecco come distinguere un vero risultato di packaging da una coincidenza, usando le stesse regole che abbiamo applicato quando abbiamo testato il nostro modello di punteggio su 321 coppie di video.

Principali punti chiave

  • Confrontare un video con la media storica del tuo canale misura quanto il tuo canale è cresciuto, non quanto è buono il packaging.
  • Confrontalo invece con la mediana dei dieci upload prima e dopo, escludendo il video stesso.
  • Due video non bastano mai. Piccole differenze tra singoli video sono indistinguibili dalla normale variazione settimanale.
  • Decidi cosa conta come vittoria prima di guardare i dati, altrimenti troverai sempre un risultato positivo da qualche parte.
  • Un test che non può dare esito negativo non è un test. Scrivi cosa ti farebbe abbandonare l’idea.

Perché la maggior parte dei test di thumbnail non sono reali

Il test tipico di un creator confronta un video con quello precedente. Questo confronto include tutto ciò che è cambiato tra i due upload: l’argomento, il giorno della settimana, la durata, se l’algoritmo lo ha promosso, e il packaging. Attribuire l’intera differenza al thumbnail presuppone che le altre variabili siano rimaste costanti, e non lo sono mai.

Il risultato è che quasi ogni cambiamento sembra funzionare, perché i conteggi delle visualizzazioni variano molto di loro. La varianza tra upload consecutivi su un canale sano supera di solito l’effetto di una scelta di design.

Questo non è un motivo per smettere di testare. È un motivo per costruire il confronto in modo che il rumore sia considerato, non scambiato per segnale.

Cosa dovresti confrontare con un video

Confronta ogni video con i suoi vicini immediati, non con la storia del tuo canale. Prendi i dieci upload prima e i dieci dopo, trova la mediana delle visualizzazioni di quei venti, e esprimi le visualizzazioni del video come multiplo di quella mediana. Un video a 1.0 ha performato esattamente come il suo quartiere. A 2.5 ha fatto due volte e mezzo meglio.

Due dettagli sono importanti e entrambi facili da sbagliare. Usa la mediana invece della media, perché un singolo upload virale nella finestra altrimenti ridefinirebbe la baseline per i suoi venti vicini. E escludi il video stesso dalla sua baseline, altrimenti ogni video viene tirato verso 1.0 e gli estremi che ti interessano vengono appiattiti.

Metodo di confrontoCosa controllaDove fallisce
Confronto con il video precedenteQuasi nullaUn punto dati rumoroso contro un altro
Confronto con la media storicaNiente riguardo al timingUn canale in crescita fa sembrare ogni video recente un successo
Confronto con gli ultimi 30 giorniDimensione del canale, approssimativamenteStagionalità e un singolo video virale che distorce la media
Confronto con la mediana mobile dei viciniDimensione del canale, crescita, epocaNon può ancora separare argomento da packaging

Perché la finestra dei vicini funziona

Un canale che ha triplicato le dimensioni in diciotto mesi mostrerà ogni upload recente che supera la media storica e ogni video più vecchio che resta indietro. Classificati così, la conclusione sul packaging che raggiungi è in realtà una dichiarazione su quando ogni video è stato pubblicato.

La finestra mobile rimuove questo, perché i vicini di un video sono stati pubblicati nello stesso canale, con la stessa dimensione di pubblico e le stesse condizioni algoritmiche. Quello che rimane è più plausibilmente legato al video stesso.

Quanto deve essere grande una differenza per essere considerata reale

Un limite utile è un fattore di due. Quando abbiamo selezionato le coppie per il nostro studio, abbiamo richiesto che il video con prestazioni migliori avesse almeno il doppio del multiplo di visualizzazioni di quello peggiore. Qualsiasi cosa più stretta chiede a un test di distinguere tra due video che il rumore del canale stesso avrebbe potuto facilmente separare da solo.

I rapporti inferiori a circa 1.3 dovrebbero essere considerati come nessun risultato. Non è una soglia rigorosa universale — dipende da quanto variabile è il tuo canale — ma è molto più vicino al giusto che considerare una differenza del 10% come prova.

L’altra metà della domanda è quante comparazioni ti servono. Una coppia ti dice essenzialmente nulla. L’aritmetica scomoda è che rilevare un effetto di packaging modesto in modo affidabile richiede centinaia di confronti, motivo per cui i creatori individuali faticano a dimostrare qualcosa sul loro canale e perché la mossa onesta è considerare i risultati singoli come prove deboli, non come dimostrazioni.

Checklist per testare il packaging sul tuo canale

Questi cinque passaggi trasformano un’impressione in qualcosa di più vicino a una misurazione. Nessuno richiede strumenti oltre un foglio di calcolo.

  1. Scrivi, prima di iniziare, quale risultato ti convincerebbe che il cambiamento non ha funzionato. Un test senza esito negativo non è un test.
  2. Calcola il multiplo di visualizzazioni di ogni video rispetto alla mediana dei suoi upload vicini, piuttosto che rispetto a qualsiasi cifra storica.
  3. Raccogli almeno dieci video per ogni condizione prima di trarre conclusioni, e resisti alla tentazione di guardare il totale in corso.
  4. Escludi Shorts, livestream, collaborazioni e qualsiasi video con meno di sei settimane, poiché tutti e quattro hanno driver di performance non legati al packaging.
  5. Verifica se una spiegazione più semplice si adatta — un argomento mai trattato, un upload condiviso da qualche parte, un picco stagionale.

Il terzo passaggio è quello che la gente salta, e fermare un test non appena sembra favorevole è il modo più efficace per convincersi di qualcosa di falso.

Se vuoi una valutazione del packaging prima che il video vada online, piuttosto che settimane dopo, puoi valutare un thumbnail e un titolo rispetto a dodici fattori di packaging e confrontare due opzioni fianco a fianco — una previsione che poi potrai verificare contro il risultato una volta che il video si sarà stabilizzato.

Errore che fanno sembrare un test conclusivo quando non lo è

Quattro modi di fallimento spiegano la maggior parte delle conclusioni false, e ognuno ha una correzione semplice.

Fermarsi quando la risposta sembra buona

Controllare i risultati man mano che si accumulano e fermarsi al primo momento favorevole produrrà un risultato positivo dal rumore puro, data abbastanza pazienza. Fissa la dimensione del campione in anticipo e analizza una volta sola. Nel nostro studio abbiamo deliberatamente rimosso del tutto la decisione di fermarsi: il campione era quello prodotto dalle regole preimpostate, che sono arrivate a 321 coppie contro un obiettivo di 400.

Abbiamo riportato questa carenza come “sottopotenziata” invece di estendere silenziosamente la raccolta, perché una regola di arresto che chiunque può applicare mentre osserva il risultato è il modo in cui un risultato nullo diventa una scoperta.

Risuddividere finché qualcosa non funziona

Se il risultato complessivo è piatto, è tentante verificare se ha funzionato per i video lunghi, o per una categoria, o per quelli pubblicati di martedì. Testa abbastanza sottogruppi e uno sembrerà significativo per caso. Decidi quali confronti contano prima di guardare, e etichetta tutto il resto come esplorativo quando lo riporti.

Come abbiamo applicato queste regole a 321 coppie di video

Il nostro studio ha seguito esattamente questa struttura. Sessanta canali in sei categorie, fino a 300 upload ciascuno, 17.250 video considerati dopo le esclusioni. I video sono stati valutati rispetto alla mediana mobile dei loro vicini, e le coppie sono state formate solo all’interno di un singolo canale, pubblicate con una mediana di sei giorni di distanza, con il migliore che superava il peggiore per un fattore mediano di 4.7.

Ogni regola — le esclusioni, i vincoli di accoppiamento, il test principale, i quattro controlli e la formulazione da pubblicare se il risultato fosse stato nullo — è stata scritta e timbrata prima che qualsiasi video fosse valutato. Il punteggio ha identificato il video con prestazioni migliori nel 59.5% delle coppie contro una baseline del 50%.

La parte da copiare non è la dimensione del campione. È che l’analisi non aveva più decisioni da prendere una volta arrivati i dati.

Domande frequenti

Quanti video mi servono per testare uno stile di thumbnail?

Più di quanti la maggior parte dei canali possa produrre rapidamente. Rilevare un effetto di packaging modesto in modo affidabile richiede centinaia di confronti, motivo per cui i risultati su singolo video sono prove deboli. Con dieci video per condizione puoi individuare un effetto grande; non puoi individuare uno sottile, e considerare una piccola differenza come prova a quella dimensione del campione è l’errore di test più comune.

Cosa dovrei confrontare con le visualizzazioni di un video?

La mediana delle visualizzazioni dei dieci upload prima e dei dieci dopo, escludendo il video stesso. Questo mantiene costanti, approssimativamente, la dimensione, la crescita e l’epoca del tuo canale, quindi ciò che rimane è più probabile che riguardi il video. Confrontare con una media storica misura quanto il tuo canale è cresciuto invece.

Perché usare la mediana invece della media?

Perché un upload eccezionalmente riuscito all’interno della finestra trascinerebbe la baseline media verso l’alto e farebbe sembrare tutti i suoi venti vicini dei sottoperformers. La mediana è appena influenzata da un singolo outlier, quindi la baseline continua a descrivere un video tipico di quel periodo piuttosto che uno eccezionale.

Quanto devo aspettare prima di giudicare le prestazioni di un video?

Almeno sei settimane. Le visualizzazioni si accumulano in modo irregolare, e il ranking di un video rispetto ai suoi vicini può cambiare sostanzialmente nel primo mese. Nel nostro studio abbiamo escluso qualsiasi video pubblicato entro 45 giorni dalla data di misurazione per questo motivo, insieme a qualsiasi video con più di due anni.

Posso fidarmi di un test di thumbnail che confronta solo due video?

Trattalo come un indizio, non come un risultato. Due video differiscono per argomento, tempistica, durata e dozzine di altri modi, quindi attribuire l’intero divario al packaging presuppone che tutto il resto sia rimasto costante. Vale la pena notarlo e ripeterlo, ma non è la base per cambiare un approccio a livello di canale.

Cos’è un multiplo di visualizzazioni e come lo calcolo?

Dividi il numero di visualizzazioni di un video per la mediana delle visualizzazioni dei suoi upload vicini, escludendo se stesso. Un risultato di 1.0 significa che ha performato come il suo quartiere, 2.0 significa il doppio, 0.5 significa la metà. Trasforma i conteggi grezzi delle visualizzazioni, che dipendono fortemente da quando il video è stato pubblicato, in una cifra che può essere confrontata attraverso la storia del tuo canale.