Após testar nossa pontuação de miniatura contra 321 pares de vídeos reais, tentamos torná-la mais precisa. Testamos quatro abordagens. Uma delas alterou o número, e ao analisar, percebemos que foi uma medição mais justa, não um modelo melhor. As outras três não mudaram nada ou tornaram a pontuação mais difícil de confiar. Aqui estão todas, com os números.
Principais conclusões
- Comparar pontuações com precisão total, em vez de arredondadas para números inteiros, elevou a precisão medida de 59,5% para 62,0%, e todo esse ganho veio de 17 empates anteriores, que se dividiram aproximadamente igualmente.
- As instruções reescritas para pontuação pareciam um avanço em 30 miniaturas, mas não fizeram nada em 322: 64,6% antes e 63,4% depois, em 161 pares.
- Pedir ao IA que comparasse duas miniaturas lado a lado correspondeu à pontuação comum em média, 62,7% cada, mas sua resposta dependia de qual imagem vinha primeiro.
- A configuração de raciocínio do modelo não alterou nada, exceto no nível mais alto, e esse nível nunca retornou uma resposta na região europeia que usamos para manter os uploads na UE.
- O resultado publicado e pré-registrado permanece em 59,5%. Tudo aqui é trabalho de acompanhamento e está rotulado como tal.
É possível tornar uma pontuação de miniatura mais precisa após testá-la?
Não facilmente, no nosso caso. Das quatro alterações testadas contra vídeos reais, uma aumentou a precisão medida, de 59,5% para 62,0%, e o fez corrigindo como as pontuações eram comparadas, em vez de fazer o modelo enxergar algo novo. As outras três deixaram a precisão inalterada. A pontuação parece estar próxima do que este modelo pode alcançar.
Essa é uma resposta menos empolgante do que um novo recorde, mas mais útil. Ela indica onde o esforço não deve ser direcionado e explica por que cada ideia tentadora falhou. Isso importa além dessa única pontuação, porque as mesmas armadilhas pegam criadores testando suas próprias miniaturas.
A correção que funcionou: pare de arredondar antes de comparar
A pontuação que você vê é um número inteiro de 0 a 100. Em nosso teste original, os dois vídeos de um par às vezes caíam no mesmo número inteiro, e isso aconteceu 17 vezes em 321 pares. Nossas regras pré-registradas contavam cada empate como falha, com o raciocínio de que uma pontuação que não consegue separar dois vídeos não os discriminou.
Atrás do número inteiro há um valor preciso, e arredondar descarta a diferença. Comparar os valores precisos elimina todos os empates, e a precisão medida sobe de 59,5% para 62,0%: 199 de 321 pares em vez de 191. Nenhum vídeo foi reavaliado e nenhum peso foi alterado; o valor preciso já estava lá.
Por que isso é um número mais justo, não um modelo melhor
A pergunta óbvia é como esses 17 empates se dividiram. Se o modelo tivesse acertado silenciosamente, o arredondamento estaria escondendo habilidade real. Não foi o caso. Oito dos 17 foram para o vídeo com melhor desempenho e nove não, o que é aproximadamente o que uma moeda jogada produziria.
Portanto, o ganho vem de não mais marcar jogadas de moeda como falhas automáticas, e não do modelo saber mais. É por isso que o resultado publicado permanece em 59,5%: foi o número que comprometemos antecipadamente, sob regras escritas antes de vermos qualquer dado. O 62,0% é relatado como medição de acompanhamento, claramente rotulado, e descreve o mesmo modelo.
Ajuste das instruções: um pequeno piloto que parecia um avanço
As avaliações do modelo se agrupam. Vários dos doze fatores nos quais a pontuação é baseada estavam em faixas estreitas em centenas de miniaturas reais, e nosso teste original mostrou que a pontuação é mais confiável quando coloca dois vídeos bem distantes. Então reescrevemos as instruções para dar à escala um ponto de referência: 50 significando o vídeo típico no mesmo feed, 90 e acima reservados para o top 10%.
Em um piloto de 30 miniaturas, pontuadas sob ambas as versões, parecia que funcionou. Oito dos doze fatores se espalharam, e dois deles quase dobraram sua dispersão. Em seguida, executamos as novas instruções em 322 miniaturas. Os dois fatores que quase dobraram cresceram apenas 1,1 e 0,1 ponto de dispersão. Em 161 pares, as instruções originais escolheram o vídeo melhor 64,6% das vezes e as novas 63,4%, uma diferença bem dentro do acaso. A nova versão também reduziu quase todas as avaliações em cinco a sete pontos, então teria custado a cada criador vários pontos de pontuação sem motivo.
Por que mais dispersão não significou mais precisão
O piloto foi simplesmente muito pequeno. Com 30 miniaturas, uma medida de quão dispersas as avaliações estão oscila muito por acaso, e dois fatores dobrando estava dentro dessa oscilação. O piloto deveria ter sido lido como motivo para executar um teste maior, não como resultado.
A execução maior trouxe uma segunda lição. Dois fatores, curiosidade e risco de clickbait, realmente se espalharam em 322 miniaturas, e a classificação ainda não melhorou. Avaliações mais amplas só ajudam se a largura extra seguir diferenças reais entre vídeos. Aqui, seguiu ruído, e ruído que parece confiança é pior do que nenhum.
Comparar miniaturas lado a lado em vez de pontuá-las
Pontuar cada miniatura separadamente e depois comparar os números não é como as pessoas escolhem entre miniaturas; elas olham duas lado a lado. Então pedimos ao modelo que fizesse isso: mostrando ambos os vídeos de um par, qual superou o outro? Cada um dos 161 pares foi mostrado duas vezes, uma em cada ordem.
Em média, sobre ambas as ordens, o juiz lado a lado acertou 62,7% das vezes, exatamente correspondendo à pontuação comum nos mesmos 150 pares totalmente respondidos. Mas escolheu a miniatura que viu primeiro em 64,7% das vezes, e em quase um terço dos pares deu respostas opostas apenas dependendo da ordem. Precisão igual com muito menos estabilidade significou que não foi adotado. Os resultados completos estão em nosso relatório separado sobre pedir a um IA que compare miniaturas.
Ativar o modo de raciocínio do modelo
O modelo oferece uma configuração que o faz trabalhar em um problema passo a passo antes de responder, em vários níveis de esforço. Nos três níveis inferiores, uma análise completa de uma miniatura de teste retornou as mesmas doze avaliações que com a configuração desligada. Apenas o nível mais alto alterou o comportamento do modelo.
No data center europeu que usamos, para que miniaturas enviadas nunca sejam processadas fora da UE, esse nível mais alto nunca retornou uma resposta, mesmo após tentativas repetidas que duraram até três minutos. Confirmamos que funciona em uma região dos EUA usando uma pergunta aritmética fictícia sem miniaturas envolvidas, e descobrimos que escreve seu raciocínio como texto simples antes da resposta, em vez de mantê-lo separado. Mover uploads para os EUA para descobrir se ajuda não foi uma troca que estávamos dispostos a fazer.
Os quatro resultados lado a lado
Cada alteração foi comparada com a original nos mesmos pares, então toda diferença abaixo é de igual para igual.
| Alteração | O que fez à precisão de classificação | Mantido? |
|---|---|---|
| Comparar pontuações não arredondadas | 59,5% para 62,0% em 321 pares, inteiramente de empates anteriores se dividindo aproximadamente igualmente | Sim, como medição mais justa |
| Instruções de pontuação calibradas | 64,6% para 63,4% em 161 pares, nenhuma diferença detectável | Não |
| Comparar miniaturas lado a lado | 62,7% contra 62,7% em 150 pares, com respostas que dependiam da ordem | Não |
| Modo de raciocínio do modelo | Sem mudança nos níveis que funcionaram; o mais alto nunca respondeu em nossa região | Não |
Cada número aqui vem do mesmo pipeline de pontuação que roda quando você analisa uma miniatura e título. Os testes pontuaram vídeos reais através do próprio produto, não através de uma cópia de pesquisa separada.
Como mantivemos esses testes de acompanhamento honestos
Experimentos de acompanhamento são onde os estudos geralmente dão errado, porque o pesquisador já sabe qual resposta gostaria. Cinco regras mantiveram isso sob controle:
- O resultado publicado nunca foi alterado. Os 59,5% pré-registrados permanecem como destaque, e toda análise posterior é rotulada como trabalho de acompanhamento.
- Os canais foram divididos pela metade antes de qualquer alteração ser testada. Os experimentos usaram uma metade, e a outra foi guardada para uma verificação final.
- Cada alteração foi comparada com a original nos mesmos pares, contando apenas os pares em que as duas discordaram, o que é muito mais sensível do que comparar duas porcentagens gerais.
- Um pequeno piloto foi tratado como motivo para executar um teste maior, nunca como resultado em si.
- Cada comparação lado a lado foi mostrada em ambas as ordens, para que uma preferência por posição não pudesse passar por habilidade.
Nenhuma dessas regras exige um diploma em estatística, e a maioria se aplica diretamente a um criador testando suas próprias miniaturas: decida o que conta como vitória antes de olhar, compare igual com igual e trate um resultado inicial pequeno como motivo para continuar testando.
Limites desses resultados de acompanhamento
Todos os quatro experimentos usaram os mesmos canais estabelecidos, em inglês, e um único modelo do teste original. As ideias foram escolhidas após o resultado original ser conhecido, o que é exatamente a situação que tende a favorecer uma descoberta, e mais uma razão para o destaque permanecer no número pré-registrado.
Cada alteração foi tentada uma vez, em uma forma. Uma redação diferente para as instruções poderia ter funcionado melhor, e o resultado do modo de raciocínio descreve o que estava disponível em uma região em setembro de 2026. Nenhum desses resultados diz que a pontuação não pode melhorar; dizem que essas quatro rotas não a melhoraram.
Perguntas frequentes
Por que não relatar 62,0% como a precisão?
Porque as regras do teste foram fixadas antes de qualquer dado existir, e elas contavam empates como falhas. Alterar uma regra após ver os resultados é exatamente o que a pré-registração existe para evitar, mesmo quando a mudança é razoável. O 62,0% é publicado como medição de acompanhamento claramente rotulada, ao lado do 59,5% que não substitui.
Um modelo de IA mais inteligente tornaria a pontuação mais precisa?
Possivelmente, mas isso seria um novo experimento. A configuração de raciocínio do nosso modelo atual não ajudou na região que usamos, e um modelo diferente precisaria ser testado contra os mesmos pares, da mesma forma, antes de qualquer afirmação poder ser feita. Mais novo não significa automaticamente melhor nesta tarefa específica.
Por que um teste em 30 miniaturas pareceu tão convincente?
Amostras pequenas produzem grandes oscilações por acaso, e uma grande oscilação parece uma descoberta. Com 30 miniaturas, dois fatores parecendo dobrar sua dispersão estava dentro da variação normal; em 322 miniaturas, o efeito quase desapareceu. É a mesma armadilha de julgar um novo estilo de miniatura em dois uploads.
O que isso significa para testar minhas próprias miniaturas?
As mesmas regras se aplicam. Decida o que conta como sucesso antes de olhar, compare com o intervalo normal do seu canal em vez de um único vídeo anterior, execute exemplos suficientes para que o acaso não possa explicar o resultado, e se pedir a qualquer ferramenta que compare duas opções, verifique se sua resposta sobrevive à troca delas.
A pontuação ainda vale a pena usar se essas melhorias falharam?
A pontuação foi testada contra resultados reais e superou o acaso por uma margem clara. Esses acompanhamentos mostram que quatro mudanças tentadoras não a impulsionaram mais, o que é útil saber em vez de motivo para descartá-la. Trate-a como uma entrada informada entre várias, não como uma previsão de visualizações.