Después de probar nuestro puntaje de miniatura contra 321 pares de videos reales, intentamos hacerlo más preciso. Probamos cuatro cosas. Una cambió el número, y al examinarlo resultó ser una medición más justa en lugar de un modelo mejor. Las otras tres no cambiaron nada, o hicieron que el puntaje fuera más difícil de confiar. Aquí está cada una, con los números.
Conclusiones clave
- Comparar puntajes con precisión completa en lugar de como números enteros redondeados elevó la precisión medida del 59,5% al 62,0%, y todo eso provino de 17 empates anteriores, que se rompieron aproximadamente por igual.
- Las instrucciones de puntuación reescritas parecían un avance en 30 miniaturas y no hicieron nada en 322: 64,6% antes y 63,4% después, en 161 pares.
- Pedirle a la IA que comparara dos miniaturas cara a cara coincidió con el puntaje ordinario en promedio, 62,7% cada uno, pero su respuesta dependía de qué imagen venía primero.
- El ajuste de razonamiento del modelo no cambió nada excepto en su nivel más alto, y ese nivel nunca devolvió una respuesta en la región europea que usamos para mantener las cargas en la UE.
- El resultado publicado y pre-registrado se mantiene en 59,5%. Todo lo aquí es trabajo de seguimiento y está etiquetado como tal.
¿Se puede hacer más preciso un puntaje de miniatura después de haberlo probado?
No fácilmente, en nuestro caso. De los cuatro cambios que probamos contra videos reales, uno elevó la precisión medida, del 59,5% al 62,0%, y lo hizo corrigiendo cómo se comparaban los puntajes en lugar de hacer que el modelo viera algo nuevo. Los otros tres dejaron la precisión donde estaba. El puntaje parece estar cerca de lo que este modelo puede hacer.
Esa es una respuesta menos emocionante que un nuevo récord, y más útil. Indica dónde no debería ir el esfuerzo, y explica por qué cada idea tentadora falló. Eso importa más allá de este puntaje, porque las mismas trampas atrapan a creadores que prueban sus propias miniaturas.
La solución que funcionó: dejar de redondear antes de comparar
El puntaje que ves es un número entero del 0 al 100. En nuestra prueba original, los dos videos en un par a veces caían en el mismo número entero, y eso ocurrió 17 veces en 321 pares. Nuestras reglas pre-registradas contaron cada empate como un fracaso, con el razonamiento de que un puntaje que no puede separar dos videos no ha discriminado entre ellos.
Detrás del número entero hay un valor preciso, y redondear descarta la diferencia. Comparar los valores precisos elimina todos los empates, y la precisión medida sube del 59,5% al 62,0%: 199 de 321 pares en lugar de 191. Ningún video fue re-puntuado y ningún peso cambió; el valor preciso ya estaba allí.
Por qué ese es un número más justo, no un modelo mejor
La pregunta obvia es cómo se rompieron esos 17 empates. Si el modelo hubiera estado obteniéndolos silenciosamente bien, redondear habría estado ocultando una habilidad real. No lo había hecho. Ocho de los 17 favorecieron al video con mejor desempeño y nueve no lo hicieron, lo cual es aproximadamente lo que produciría una moneda lanzada al aire.
Entonces, la mejora proviene de ya no marcar los lanzamientos de moneda como fracasos automáticos, no de que el modelo sepa más. Por eso el resultado publicado se mantiene en 59,5%: fue la cifra a la que nos comprometimos por adelantado, bajo reglas escritas antes de ver cualquier dato. El 62,0% se reporta como una medición de seguimiento, claramente etiquetada, y describe el mismo modelo.
Ajustar las instrucciones: un pequeño piloto que parecía un avance
Las calificaciones del modelo se agrupan. Varios de los doce factores en los que se basa el puntaje se situaron en bandas estrechas a través de cientos de miniaturas reales, y nuestra prueba original mostró que el puntaje es más confiable cuando coloca dos videos muy separados. Así que reescribimos las instrucciones para darle a la escala un punto de referencia: 50 significa el video típico en el mismo feed, 90 y más reservado para el top 10%.
En un piloto de 30 miniaturas, puntuadas bajo ambas versiones, parecía que funcionaba. Ocho de los doce factores se dispersaron, y dos de ellos casi duplicaron su dispersión. Luego ejecutamos las nuevas instrucciones en 322 miniaturas. Los dos factores que casi duplicaron su dispersión crecieron solo 1,1 y 0,1 puntos de dispersión. En 161 pares, las instrucciones originales eligieron el video mejor 64,6% de las veces y las nuevas 63,4%, una diferencia dentro del margen de azar. La nueva versión también redujo casi todas las calificaciones en cinco a siete puntos, por lo que habría costado a cada creador varios puntos de puntaje sin razón.
Por qué más dispersión no significó más precisión
El piloto simplemente fue demasiado pequeño. Con 30 miniaturas, una medida de cuán dispersas están las calificaciones varía mucho por azar, y que dos factores duplicaran su dispersión estaba dentro de ese margen. El piloto debería haberse leído como una razón para hacer una prueba más grande, no como un resultado.
La prueba más grande tuvo una segunda lección. Dos factores, curiosidad y riesgo de clickbait, realmente se dispersaron en 322 miniaturas, y la clasificación aún no mejoró. Las calificaciones más amplias solo ayudan si el ancho adicional sigue diferencias reales entre videos. Aquí siguió ruido, y un ruido que parece confianza es peor que ninguno.
Comparar miniaturas cara a cara en lugar de puntuarlas
Puntuar cada miniatura por separado y luego comparar los números no es cómo la gente elige entre miniaturas; miran dos lado a lado. Así que le pedimos al modelo que hiciera eso: mostrados ambos videos de un par, ¿cuál superó al otro? Cada uno de los 161 pares se mostró dos veces, una en cada orden.
En promedio sobre ambos órdenes, el juez cara a cara acertó el 62,7% de las veces, coincidiendo exactamente con el puntaje ordinario en los mismos 150 pares completamente respondidos. Pero eligió la miniatura que vio primero el 64,7% de las veces, y para casi un tercio de los pares dio respuestas opuestas dependiendo solo del orden. Igual precisión con mucha menos estabilidad significó que no se adoptó. Los resultados completos están en nuestro informe separado sobre pedirle a una IA que compare miniaturas.
Activar el modo de razonamiento del modelo
El modelo ofrece un ajuste que lo hace trabajar paso a paso en un problema antes de responder, en varios niveles de esfuerzo. En los tres niveles más bajos, un análisis completo de una miniatura de prueba devolvió las mismas doce calificaciones que con el ajuste apagado. Solo el nivel más alto cambió el comportamiento del modelo en absoluto.
En el centro de datos europeo que usamos, para que las miniaturas cargadas nunca se procesen fuera de la UE, ese nivel más alto nunca devolvió una respuesta, tras intentos repetidos que duraron hasta tres minutos. Confirmamos que sí funciona en una región de EE.UU. usando una pregunta aritmética inventada sin miniaturas involucradas, y descubrimos que escribía su razonamiento como texto plano antes de la respuesta en lugar de mantenerlo separado. Mover las cargas a EE.UU. para averiguar si ayuda no fue un intercambio que estuviéramos dispuestos a hacer.
Los cuatro resultados lado a lado
Cada cambio se comparó con el original en los mismos pares, así que cada diferencia a continuación es de igual a igual.
| Cambio | Qué hizo a la precisión de clasificación | ¿Se mantuvo? |
|---|---|---|
| Comparar puntajes sin redondear | 59,5% a 62,0% en 321 pares, completamente por empates anteriores que se rompieron aproximadamente por igual | Sí, como medición más justa |
| Instrucciones de puntuación calibradas | 64,6% a 63,4% en 161 pares, sin diferencia detectable | No |
| Comparar miniaturas cara a cara | 62,7% contra 62,7% en 150 pares, con respuestas que dependían del orden | No |
| Modo de razonamiento del modelo | Sin cambio en los niveles que funcionaron; el más alto nunca respondió en nuestra región | No |
Cada cifra aquí proviene de la misma canalización de puntuación que se ejecuta cuando analizas una miniatura y título. Las pruebas puntuaron videos reales a través del producto mismo, no a través de una copia de investigación separada.
Cómo mantuvimos honestas estas pruebas de seguimiento
Los experimentos de seguimiento son donde los estudios suelen fallar, porque el investigador ya sabe qué respuesta le gustaría. Cinco reglas mantuvieron eso bajo control:
- El resultado publicado nunca se tocó. El 59,5% pre-registrado sigue siendo el titular, y cada análisis posterior se etiqueta como trabajo de seguimiento.
- Los canales se dividieron por la mitad antes de probar cualquier cambio. Los experimentos usaron una mitad, y la otra se guardó para una verificación final.
- Cada cambio se comparó con el original en los mismos pares, contando solo los pares donde los dos discrepaban, lo cual es mucho más sensible que comparar dos porcentajes generales.
- Un pequeño piloto se trató como una razón para hacer una prueba más grande, nunca como un resultado en sí mismo.
- Cada comparación cara a cara se mostró en ambos órdenes, para que una preferencia por la posición no pudiera pasar por habilidad.
Ninguna de estas reglas requiere un título en estadística, y la mayoría se aplica directamente a un creador que prueba sus propias miniaturas: decide qué cuenta como victoria antes de mirar, compara lo similar con lo similar, y trata un resultado temprano pequeño como una razón para seguir probando.
Límites de estos resultados de seguimiento
Los cuatro experimentos usaron los mismos canales establecidos y en inglés que la prueba original, y un solo modelo. Las ideas se eligieron después de conocer el resultado original, lo cual es exactamente la situación que tiende a favorecer un hallazgo, y otra razón por la que el titular se mantiene en la cifra pre-registrada.
Cada cambio se probó una vez, en una forma. Una redacción diferente para las instrucciones podría haber funcionado mejor, y el resultado del modo de razonamiento describe lo que estaba disponible en una región en septiembre de 2026. Ninguno de estos resultados dice que el puntaje no pueda mejorar; dicen que estas cuatro vías no lo mejoraron.
Preguntas frecuentes
¿Por qué no reportar el 62,0% como la precisión?
Porque las reglas de la prueba se fijaron antes de que existiera cualquier dato, y contaron los empates como fracasos. Cambiar una regla después de ver los resultados es exactamente lo que la pre-registración existe para evitar, incluso cuando el cambio es razonable. El 62,0% se publica como una medición de seguimiento claramente etiquetada, junto al 59,5% que no reemplaza.
¿Un modelo de IA más inteligente haría el puntaje más preciso?
Posiblemente, pero eso sería un nuevo experimento. El ajuste de razonamiento de nuestro modelo actual no ayudó en la región que usamos, y un modelo diferente necesitaría probarse contra los mismos pares, de la misma manera, antes de poder hacer ninguna afirmación. Lo más nuevo no significa automáticamente mejor en esta tarea específica.
¿Por qué una prueba en 30 miniaturas pareció tan convincente?
Las muestras pequeñas producen grandes variaciones por azar, y una variación grande parece un descubrimiento. Con 30 miniaturas, que dos factores parecieran duplicar su dispersión estaba dentro de la variación normal; en 322 miniaturas el efecto casi desapareció. Es la misma trampa que juzgar un nuevo estilo de miniatura en dos cargas.
¿Qué significa esto para probar mis propias miniaturas?
Las mismas reglas aplican. Decide qué cuenta como éxito antes de mirar, compara contra el rango normal de tu canal en lugar de un solo video anterior, ejecuta suficientes ejemplos para que el azar no pueda explicar el resultado, y si le pides a cualquier herramienta que compare dos opciones, verifica si su respuesta sobrevive al intercambiarlas.
¿El puntaje aún vale la pena usarlo si estas mejoras fallaron?
El puntaje se probó contra resultados reales y superó al azar por un margen claro. Estos seguimientos muestran que cuatro cambios tentadores no lo impulsaron más, lo cual es útil saber en lugar de una razón para descartarlo. Trátalo como una entrada informada entre varias, no como una predicción de vistas.