Se você já colou duas thumbnails em um chat de IA e perguntou qual obterá mais cliques, realizou um experimento sem controle. Nós realizamos um com controle: 161 pares de vídeos reais em que já sabíamos qual performou melhor, cada par mostrado à IA duas vezes, uma em cada ordem. Qual thumbnail ela viu primeiro acabou decidindo grande parte de suas respostas.
Principais conclusões
- Mostradas duas thumbnails do mesmo canal, a IA escolheu a que apareceu primeiro em 64,7% das vezes. Um juiz sem preferência por posição ficaria próximo de 50%.
- Quando o vencedor real apareceu primeiro, a IA acertou em 77,3% das vezes. Quando o mesmo vencedor apareceu em segundo, 48,0%.
- Em média, em ambas as ordens, acertou em 62,7% das vezes — exatamente igual a uma pontuação que avalia cada thumbnail separadamente. Comparar lado a lado não adicionou precisão.
- Deu respostas opostas quando apenas a ordem mudou em 30,7% dos pares.
- Quase nunca admitiu dúvida: uma resposta típica afirmava 85% de confiança, enquanto o modelo acertou cerca de 63% das vezes.
Uma IA pode dizer qual das duas thumbnails performará melhor?
Às vezes, mas não de forma confiável com uma única resposta. Em média, em ambas as ordens, o modelo testado escolheu a thumbnail com melhor desempenho em 62,7% das vezes — exatamente tão frequentemente quanto nossa pontuação, avaliando cada thumbnail separadamente. Mas sua escolha dependia de qual imagem viu primeiro: 77,3% de acertos quando o vencedor veio primeiro, 48,0% quando veio segundo.
Em termos simples, uma única resposta se comporta como uma moeda que cai na primeira opção com mais frequência. A informação está lá — quando o modelo dá a mesma resposta em ambas as ordens, acerta mais do que por acaso — mas só se descobre ao perguntar duas vezes.
Como testamos: pares reais com resposta conhecida, mostrados em ambas as ordens
Os pares vieram de nosso teste publicado da pontuação: dois vídeos do mesmo canal, publicados próximos, um que claramente superou a média recente do canal e outro que claramente ficou abaixo. Usar o mesmo canal cancela contagem de inscritos, audiência e orçamento de produção, então o que difere entre os dois é principalmente o pacote visual.
Usamos os 161 pares de metade dos canais do estudo e mantivemos a outra metade intocada. A IA — o mesmo modelo de visão que alimenta nossa pontuação — viu ambas as thumbnails com seus títulos reais, foi informada de que uma superou as visualizações habituais do canal e a outra ficou abaixo, e foi perguntada qual era qual. Onze das 322 respostas retornaram inutilizáveis, restando 150 pares respondidos em ambas as ordens.
Por que cada par precisou ser mostrado duas vezes
Uma IA comparando duas opções pode preferir uma posição independentemente do conteúdo, assim como algumas pessoas preferem o primeiro item de uma lista. Se essa preferência existir e você mostrar cada par apenas uma vez, não poderá distingui-la da habilidade: um juiz que sempre escolhe a primeira imagem parece brilhante sempre que a melhor thumbnail acontece de estar listada primeiro.
Mostrar cada par duas vezes, com a ordem invertida, separa os dois. A habilidade deve sobreviver à troca. Uma preferência por posição deve inverter com ela.
A thumbnail mostrada primeiro venceu a maioria dos argumentos
Em 300 respostas, a IA escolheu a thumbnail que viu primeiro em 64,7% das vezes. Essa preferência muda o valor de qualquer resposta única:
| Como o par foi mostrado | Com que frequência a IA escolheu o vencedor real |
|---|---|
| Vencedor mostrado primeiro | 77,3% |
| Vencedor mostrado segundo | 48,0% |
| Média em ambas as ordens | 62,7% |
| Nossa pontuação, avaliando cada thumbnail separadamente | 62,7% |
| Mesma resposta correta em ambas as ordens | 47,3% (adivinhação aleatória: cerca de 25%) |
A linha da média é a comparação justa com uma pontuação que avalia cada thumbnail isoladamente, pois ambas dão uma resposta por par. Nesse aspecto, os dois métodos empataram em 62,7%. Comparar lado a lado não adicionou precisão; adicionou dependência da ordem.
A última linha é o teste mais rigoroso: uma resposta conta apenas se a IA escolheu a mesma thumbnail correta ambas as vezes. Um juiz adivinhando aleatoriamente passaria nesse teste cerca de um quarto das vezes, e um que sempre escolhesse a primeira imagem nunca passaria. A IA passou em 47,3% dos pares, então o sinal é real — apenas emaranhado com a posição.
Ela mudou de ideia em quase um terço dos pares
Em 46 dos 150 pares, 30,7%, a IA deu respostas opostas dependendo apenas da ordem. Nada sobre qualquer thumbnail ou título mudou entre as duas perguntas.
Nos outros 104 pares, foi consistente, e nesses acertou em 68,3% das vezes. Nossa pontuação, nesses mesmos 104 pares, acertou em 63,5% das vezes. Essa diferença é pequena demais para ser confiável com esse número de pares, mas aponta para algo útil: uma resposta que sobrevive à troca vale mais do que uma que nunca foi testada.
Seu número de confiança não é uma probabilidade
Pedimos um número de confiança em cada resposta e dissemos à IA que 50 significava cara ou coroa. Ela quase não usou a metade inferior da escala. Sua confiança mais baixa em todas as 300 respostas foi 65, uma resposta típica afirmava 85, e apenas 4 respostas ficaram abaixo de 70.
Enquanto isso, acertou cerca de 63% das vezes. Respostas que avaliou entre 80 e 89 acertaram em 61,6% das vezes; respostas entre 70 e 79 acertaram em 63,5% das vezes. Na faixa onde quase todas as respostas caíram, o número não dizia nada sobre quais respostas acreditar.
As 17 respostas que avaliou em 90 ou mais acertaram em 82,4% das vezes, o que é sugestivo, mas 17 é muito pouco para confiar. A leitura prática é simples: um tom confiante de uma comparação por IA é seu registro padrão, não evidência.
Como verificar qualquer juiz de thumbnail por IA em cinco minutos
Testamos um modelo, e outras ferramentas podem se comportar de forma diferente. Você não precisa confiar em nossa palavra, pois o teste é rápido de executar sozinho:
- Escolha duas thumbnails em que você já sabe a resposta: dois vídeos antigos do seu próprio canal, publicados próximos, um claramente acima de suas visualizações habituais e outro claramente abaixo.
- Pergunte à IA qual performou melhor, mostrando a mais forte primeiro. Anote sua resposta e qualquer confiança que ela der.
- Inicie uma nova conversa, para que ela não lembre sua primeira resposta, e pergunte novamente com a ordem invertida.
- Repita com pelo menos dez pares. Conte quantas vezes ela escolhe a imagem que aparece primeiro e quantas vezes sua resposta sobrevive à troca.
- Confie apenas nas respostas que sobrevivem à troca, e ignore completamente o número de confiança.
Se preferir um número que não dependa da ordem de apresentação, você pode avaliar cada thumbnail e título separadamente. Uma pontuação separada para cada opção, comparada depois, não tem nenhuma posição inicial para preferir.
O que este experimento não mostra
Testou um modelo com um conjunto de instruções. Um modelo diferente, ou o mesmo modelo perguntado de forma diferente, pode preferir a primeira posição mais ou menos fortemente. O ponto não é que toda IA se comporte assim, mas que uma única comparação não pode dizer se a que você está usando o faz.
Os pares foram escolhidos porque diferiam fortemente em desempenho, então esses números de precisão descrevem acertos claros contra falhas claras, não duas thumbnails que performaram quase identicamente. Todos os canais eram estabelecidos e em inglês.
E nada disso trata de testes A/B reais. Um teste feito com espectadores reais mede o que eles realmente fizeram. Este experimento trata apenas de uma IA tentando prever esse resultado antecipadamente.
Perguntas frequentes
Uma IA pode escolher a melhor thumbnail do YouTube?
Parcialmente. O modelo testado escolheu a thumbnail com melhor desempenho cerca de 63% das vezes em média, o que supera o acaso, mas iguala — em vez de superar — a pontuação de cada thumbnail separadamente. Sua resposta dependeu fortemente de qual imagem viu primeiro, então uma única resposta é pouco confiável. Pergunte duas vezes com a ordem invertida e confie apenas nas respostas que sobrevivem à troca.
O que é viés de posição em comparações por IA?
Viés de posição é a tendência de preferir uma opção por causa de onde ela aparece, e não pelo que contém. Em nosso teste, a IA escolheu a thumbnail que viu primeiro em 64,7% das vezes. A solução é apresentar cada comparação em ambas as ordens e tratar uma resposta que muda como nenhuma resposta.
É melhor avaliar thumbnails separadamente ou compará-las lado a lado?
Em nosso teste, os dois métodos tiveram precisão igual em média, em 62,7%. A diferença foi a estabilidade. Avaliar cada thumbnail isoladamente dá o mesmo resultado independentemente da ordem em que você as verifica, enquanto comparar lado a lado produziu respostas que mudaram com a ordem em quase um terço dos pares.
Por que a IA parece tão certa de sua resposta?
Porque a linguagem confiante é seu padrão, não uma medição. Perguntada para avaliar sua própria certeza, o modelo testado quase nunca foi abaixo de 70 em 100 e normalmente afirmou 85, enquanto acertou cerca de 63% das vezes. Nessa faixa, uma confiança declarada mais alta não significava uma resposta mais confiável.
Isso significa que testes A/B de thumbnails são inúteis?
Não. Um teste real mostra suas thumbnails a espectadores reais e mede o que eles fazem, o que nenhuma previsão substitui. Este experimento trata apenas de perguntar a uma IA para adivinhar o vencedor antecipadamente. Para um teste real, a pergunta mais difícil é se a diferença que você vê é maior que a variação normal do seu canal de um upload para o próximo.