Cambias una miniatura, el siguiente video funciona mejor y concluyes que el nuevo estilo funciona. Esa conclusión suele ser incorrecta —no porque la miniatura no haya hecho nada, sino porque la comparación no pudo detectar si lo hizo. Aquí te explicamos cómo distinguir un resultado real de empaque de una coincidencia, usando las mismas reglas que aplicamos al probar nuestro propio modelo de puntuación contra 321 pares de videos.
Conclusiones clave
- Comparar un video con el promedio histórico de tu canal mide cuánto ha crecido tu canal, no cuán bueno fue el empaque.
- En su lugar, compáralo con la mediana de los diez uploads a cada lado, excluyendo el video en sí.
- Dos videos nunca son suficientes. Las pequeñas diferencias entre videos individuales son indistinguibles de la variación normal semana a semana.
- Decide qué cuenta como victoria antes de mirar, o siempre encontrarás una en algún lugar de los datos.
- Una prueba que no puede dar un resultado negativo no es una prueba. Anota qué resultado te haría abandonar la idea.
Por qué la mayoría de los resultados de pruebas de miniaturas no son reales
La prueba típica de un creador compara un video con el anterior. Esa comparación incluye todo lo que cambió entre los dos uploads: el tema, el día de la semana, la duración, si el algoritmo lo impulsó, y el empaque. Atribuir toda la diferencia a la miniatura asume que las demás variables se mantuvieron constantes, y nunca lo hacen.
El resultado es que casi cualquier cambio parece haber funcionado, porque las vistas varían mucho por sí solas. La variación entre uploads consecutivos en un canal saludable suele superar el efecto de una decisión de diseño.
Esto no es una razón para dejar de probar. Es una razón para construir la comparación de modo que el ruido se tenga en cuenta en lugar de confundirse con la señal.
Contra qué debes comparar un video
Compara cada video con sus vecinos inmediatos, no con el historial de tu canal. Toma los diez uploads anteriores y los diez posteriores, encuentra la mediana de vistas de esos veinte, y expresa las vistas del video como múltiplo de esa mediana. Un video en 1.0 tuvo un desempeño exactamente como su vecindario. En 2.5, hizo dos veces y media mejor.
Dos detalles importan y ambos son fáciles de equivocar. Usa la mediana en lugar de la media, porque un solo upload viral en la ventana redefiniría la línea de base para sus veinte vecinos. Y excluye el video en sí de su propia línea de base, o cada video se verá arrastrado hacia 1.0 y los extremos que te importan se aplanarán.
| Método de comparación | Qué controla | Dónde falla |
|---|---|---|
| Contra el video anterior | Casi nada | Un punto de datos ruidoso contra otro |
| Contra tu promedio histórico | Nada sobre el momento | Un canal en crecimiento hace que cada video reciente parezca un éxito |
| Contra los últimos 30 días | Tamaño del canal, aproximadamente | Estacionalidad y un solo video viral sesgando la media |
| Contra la mediana móvil de vecinos | Tamaño del canal, crecimiento, época | Todavía no puede separar tema de empaque |
Por qué funciona la ventana de vecindario
Un canal que triplicó su tamaño en dieciocho meses mostrará cada upload reciente superando su promedio histórico y cada uno antiguo quedando corto. Clasificado así, la conclusión sobre el empaque que obtienes es realmente una afirmación sobre cuándo se publicó cada video.
La ventana móvil elimina eso, porque los vecinos de un video se publicaron en un canal aproximadamente igual, con el mismo tamaño de audiencia y las mismas condiciones algorítmicas. Lo que queda es más plausible que se deba al video en sí.
Qué tan grande debe ser la diferencia para considerarla real
Un piso útil es un factor de dos. Cuando seleccionamos pares para nuestro propio estudio, exigimos que el video con mejor desempeño tuviera al menos el doble del múltiplo de vistas del peor. Cualquier cosa más estrecha le pide a una prueba distinguir entre dos videos que el ruido propio de un canal podría haber separado por sí solo.
Las razones por debajo de aproximadamente 1.3 deben tratarse como sin resultado alguno. Eso no es un umbral universal riguroso —depende de cuán variable sea tu canal— pero está mucho más cerca de lo correcto que tratar una diferencia del 10% como evidencia.
La otra mitad de la pregunta es cuántas comparaciones necesitas. Un par te dice esencialmente nada. La aritmética incómoda es que detectar un efecto modesto de empaque de forma confiable requiere cientos de comparaciones, por eso los creadores individuales luchan por probar algo sobre su propio canal y por eso el movimiento honesto es tratar los resultados individuales como evidencia débil, no como prueba.
Lista de verificación para probar empaque en tu propio canal
Estos cinco pasos convierten una impresión en algo más cercano a una medición. Ninguno requiere herramientas más allá de una hoja de cálculo.
- Anota, antes de empezar, qué resultado te convencería de que el cambio no funcionó. Una prueba sin resultado negativo no es una prueba.
- Calcula el múltiplo de vistas de cada video contra la mediana de sus uploads vecinos, en lugar de contra cualquier cifra histórica.
- Reúne al menos diez videos en cada condición antes de sacar cualquier conclusión, y resiste la tentación de mirar el total acumulado entre medias.
- Excluye Shorts, transmisiones en vivo, colaboraciones y cualquier cosa con menos de seis semanas, ya que los cuatro tienen factores de desempeño no relacionados con el empaque.
- Verifica si una explicación más simple encaja —un tema que nunca habías cubierto, un upload que se compartió en algún lugar, un pico estacional.
El paso tres es el que la gente omite, y detener una prueba en cuanto parece favorable es la forma más efectiva de convencerte de algo falso.
Si quieres una evaluación del empaque antes de que un video se publique en lugar de semanas después, puedes puntuar una miniatura y título contra doce factores de empaque y comparar dos opciones lado a lado —una predicción que luego puedes verificar contra el resultado una vez que el video madure.
Errores que hacen que una prueba parezca concluyente cuando no lo es
Cuatro modos de fallo explican la mayoría de las conclusiones falsas, y cada uno tiene una solución sencilla.
Detenerse cuando la respuesta parece buena
Revisar los resultados a medida que se acumulan y detenerse en el primer momento favorable producirá un resultado positivo del puro ruido, dada suficiente paciencia. Fija el tamaño de la muestra de antemano y analiza una sola vez. En nuestro propio estudio eliminamos deliberadamente la decisión de detenerse: la muestra fue lo que produjeron las reglas preestablecidas, que dieron 321 pares contra un objetivo de 400.
Reportamos esa falta como subpotente en lugar de extender silenciosamente la recolección, porque una regla de detención que cualquiera puede aplicar mientras observa el resultado es cómo un resultado nulo se convierte en un hallazgo.
Repartir los datos hasta que algo funcione
Si el resultado general es plano, es tentador verificar si funcionó para videos largos, o para una categoría, o para videos publicados los martes. Prueba suficientes subgrupos y uno parecerá significativo por puro azar. Decide qué comparaciones importan antes de mirar, y etiqueta todo lo demás como exploratorio cuando lo informes.
Cómo aplicamos estas reglas a 321 pares de videos
Nuestro propio estudio siguió exactamente esta estructura. Sesenta canales en seis categorías, hasta 300 uploads cada uno, 17.250 videos considerados tras exclusiones. Los videos se puntuaron contra la mediana móvil de sus vecinos, y los pares se formaron solo dentro de un mismo canal, publicados con una mediana de seis días de diferencia, con el mejor desempeño superando al peor por un factor mediano de 4.7.
Cada regla —las exclusiones, las restricciones de emparejamiento, la prueba principal, los cuatro controles y la redacción para publicar si el resultado fuera nulo— se escribió y se selló con marca de tiempo antes de puntuar cualquier video. La puntuación seleccionó el video con mejor desempeño en el 59.5% de los pares contra una línea de base del 50%.
La parte que vale la pena copiar no es el tamaño de la muestra. Es que el análisis no tenía decisiones pendientes cuando llegaron los datos.
Preguntas frecuentes
¿Cuántos videos necesito para probar un estilo de miniatura?
Más de los que la mayoría de los canales pueden producir rápidamente. Detectar un efecto modesto de empaque de forma confiable requiere cientos de comparaciones, por eso los resultados de un solo video son evidencia débil. Con diez videos por condición puedes detectar un efecto grande; no puedes detectar uno sutil, y tratar una pequeña diferencia como prueba con ese tamaño de muestra es el error de prueba más común.
¿Contra qué debo comparar las vistas de un video?
La mediana de vistas de los diez uploads anteriores y los diez posteriores, excluyendo el video en sí. Esto mantiene aproximadamente constantes el tamaño, crecimiento y época de tu canal, por lo que lo que queda es más probable que se deba al video. Comparar contra un promedio histórico mide cuánto ha crecido tu canal en su lugar.
¿Por qué usar la mediana en lugar del promedio?
Porque un upload inusualmente exitoso dentro de la ventana arrastraría la línea de base media hacia arriba y haría que sus veinte vecinos parecieran subdesempeñarse. La mediana apenas se ve afectada por un solo valor atípico, por lo que la línea de base sigue describiendo un video típico de ese período en lugar de uno excepcional.
¿Cuánto tiempo debo esperar antes de juzgar el desempeño de un video?
Al menos seis semanas. Las vistas se acumulan de forma desigual, y el posicionamiento de un video contra sus vecinos puede cambiar sustancialmente en el primer mes. En nuestro estudio excluimos cualquier cosa publicada dentro de 45 días de la fecha de medición por esta razón exacta, junto con cualquier cosa con más de dos años.
¿Puedo confiar en una prueba de miniatura que solo compara dos videos?
Trátala como una pista, no como un resultado. Dos videos difieren en tema, momento, duración y docenas de otras formas, por lo que atribuir toda la brecha al empaque asume que todo lo demás se mantuvo constante. Vale la pena notarlo y repetirlo, pero no es la base para cambiar un enfoque a nivel de canal.
¿Qué es un múltiplo de vistas y cómo lo calculo?
Divide el número de vistas de un video entre la mediana de vistas de sus uploads vecinos, excluyéndolo a sí mismo. Un resultado de 1.0 significa que tuvo un desempeño como su vecindario, 2.0 significa el doble, 0.5 significa la mitad. Convierte las vistas brutas, que dependen mucho de cuándo se publicó un video, en una cifra que se puede comparar a lo largo de la historia de tu canal.