321쌍의 실제 영상을 대상으로 썸네일 점수를 테스트한 후, 정확도를 높이기 위해 네 가지 방법을 시도했습니다. 그중 하나는 수치를 움직였고, 검토 결과 더 나은 모델이 아니라 공정한 측정 방식이었음을 확인했습니다. 나머지 세 가지는 아무런 변화를 주지 못했거나, 점수에 대한 신뢰도를 떨어뜨렸습니다. 각각의 시도와 그 결과를 아래에 정리했습니다.
핵심 요약
- 점수를 반올림된 정수로 비교하는 대신 전체 정밀도로 비교하면 측정 정확도가 59.5%에서 62.0%로 상승합니다. 이는 17개의 동점이 균등하게 갈라졌기 때문입니다.
- 재작성된 점수 산출 지침은 30개 썸네일에서는 돌파구처럼 보였지만, 322개에서는 효과가 없었습니다. 161쌍 기준으로 64.6%에서 63.4%로 오히려 하락했습니다.
- AI에게 두 썸네일을 직접 비교하게 하면 평균적으로 일반 점수와 동일한 62.7%의 정확도를 보였지만, 결과는 어떤 이미지가 먼저 제시되었는지에 따라 달라졌습니다.
- 모델의 추론 설정은 가장 높은 수준을 제외하고는 아무런 변화를 주지 않았고, 그 최고 수준은 유럽 지역에서는 결코 응답을 반환하지 않았습니다.
- 공개된 사전 등록 결과는 여전히 59.5%입니다. 여기서 다루는 모든 내용은 후속 연구이며, 그에 따라 명시되어 있습니다.
테스트 후 썸네일 점수의 정확도를 높일 수 있을까요?
우리의 경우, 쉽게 가능하지는 않습니다. 실제 영상을 대상으로 테스트한 네 가지 변경 사항 중 하나만 측정 정확도를 59.5%에서 62.0%로 높였고, 이는 모델이 새로운 것을 인식하게 한 것이 아니라 점수 비교 방식을 수정한 결과였습니다. 나머지 세 가지는 정확도에 아무런 영향을 주지 않았습니다. 이 점수는 현재 모델이 달성할 수 있는 수준에 가까운 것으로 보입니다.
이는 새로운 기록보다 덜 흥미롭지만 더 유용한 답변입니다. 이는 어디에 노력을 들이지 말아야 하는지 알려주며, 각각의 매력적인 아이디어가 왜 실패했는지 설명합니다. 이는 단순히 이 점수에만 국한된 문제가 아니라, 크리에이터들이 자신의 썸네일을 테스트할 때도 같은 함정에 빠질 수 있기 때문입니다.
효과가 있었던 수정: 비교 전 반올림 중단
보시는 점수는 0에서 100 사이의 정수입니다. 원래 테스트에서 한 쌍의 두 영상이 같은 정수 점수를 받는 경우가 있었고, 321쌍 중 17번 발생했습니다. 사전 등록된 규칙은 동점은 모두 실패로 간주했습니다. 왜냐하면 두 영상을 구분하지 못하는 점수는 차별화에 실패했다고 판단했기 때문입니다.
정수 뒤에는 정밀한 값이 숨어 있으며, 반올림은 그 차이를 버립니다. 정밀한 값을 비교하면 동점이 전혀 없어지고, 측정 정확도는 59.5%에서 62.0%로 상승합니다: 321쌍 중 191쌍에서 199쌍으로 증가합니다. 영상은 재점수되지 않았고, 가중치도 변경되지 않았습니다. 정밀한 값은 이미 존재하고 있었습니다.
왜 이 수치가 더 나은 모델이 아니라 공정한 수치인지
당연한 질문은 이 17개의 동점이 어떻게 갈라졌는지입니다. 모델이 조용히 올바르게 판단하고 있었다면, 반올림은 진정한 실력을 숨기고 있었을 것입니다. 그러나 그렇지 않았습니다. 17개 중 8개는 더 잘 나온 영상으로, 9개는 그렇지 않았고, 이는 동전 던지기 결과와 비슷합니다.
따라서 이 개선은 동전 던지기를 자동 실패로 표시하지 않게 된 데서 비롯된 것이지, 모델이 더 잘 알게 된 것은 아닙니다. 그래서 공개된 결과는 여전히 59.5%입니다: 우리는 데이터를 보기 전에 미리 작성된 규칙 하에 사전에 약속한 수치입니다. 62.0%는 명확히 후속 측정으로 표시되며, 동일한 모델을 설명합니다.
지침 조정: 돌파구처럼 보였던 소규모 시범
모델의 평가가 밀집되어 있습니다. 점수를 구성하는 12가지 요소 중 몇 가지는 수백 개의 실제 썸네일에 걸쳐 좁은 범위에 머물렀고, 원래 테스트는 점수가 두 영상을 멀리 떨어뜨릴 때 가장 신뢰할 수 있음을 보여주었습니다. 그래서 우리는 척도에 기준점을 주기 위해 지침을 다시 작성했습니다: 50은 동일 피드의 평균 영상, 90 이상은 상위 10%를 의미합니다.
30개 썸네일을 대상으로 양쪽 버전으로 점수를 매긴 시범에서는 효과가 있는 것처럼 보였습니다. 12가지 요소 중 8개가 퍼졌고, 그중 2개는 거의 두 배로 퍼졌습니다. 그러나 322개 썸네일에 새 지침을 적용했을 때, 두 요소의 퍼짐은 각각 1.1점과 0.1점 증가에 그쳤습니다. 161쌍에서 원래 지침은 더 나은 영상을 64.6%의 확률로 선택했고, 새 지침은 63.4%로, 우연의 범위 내에서의 차이였습니다. 새 버전은 거의 모든 평가를 5~7점 낮췄기 때문에, 크리에이터들에게는 아무런 이득 없이 점수를 낮추는 결과를 초래했을 것입니다.
왜 더 퍼진 평가가 더 정확한 평가를 의미하지 않았는지
시범이 너무 작았기 때문입니다. 30개 썸네일에서는 평가의 퍼짐 정도가 우연에 따라 크게 변동할 수 있으며, 두 요소가 두 배로 퍼진 것은 그 변동 범위 내에 있었습니다. 시범은 더 큰 테스트를 실행해야 하는 이유로 읽혀야 했지, 결과로 간주되어서는 안 되었습니다.
더 큰 테스트는 두 번째 교훈을 제공했습니다. 호기심과 클릭베이트 위험이라는 두 요소는 322개 썸네일에 걸쳐 실제로 퍼졌지만, 순위는 여전히 개선되지 않았습니다. 더 넓은 평가는 영상 간 실제 차이를 반영할 때만 도움이 됩니다. 여기서는 잡음에 따라 퍼졌고, 자신감처럼 보이는 잡음은 아무것도 없는 것보다 더 나쁩니다.
썸네일을 개별 점수 매기기보다 직접 비교하기
각 썸네일을 개별적으로 점수 매기고 그 수치를 비교하는 것은 사람들이 썸네일을 선택하는 방식이 아닙니다. 사람들은 두 개를 나란히 보고 선택합니다. 그래서 우리는 모델에게 그렇게 하도록 요청했습니다: 한 쌍의 두 영상을 보여주고, 어느 쪽이 더 나았는지 묻는 것입니다. 161쌍 각각을 두 번씩, 순서를 바꿔서 보여주었습니다.
두 순서를 평균하면, 직접 비교한 판정은 62.7%의 정확도를 보였고, 이는 동일한 150쌍에 대해 일반 점수와 정확히 일치했습니다. 그러나 먼저 보여준 썸네일을 64.7%의 확률로 선택했고, 거의 3분의 1의 쌍에서는 순서에 따라 반대되는 답을 내놓았습니다. 정확도는 같지만 안정성은 훨씬 낮아 채택되지 않았습니다. 전체 결과는 썸네일 비교를 위해 AI에 요청하는 별도의 글에 있습니다.
모델의 추론 모드 켜기
모델은 답변 전에 문제를 단계별로 해결하도록 하는 설정을 제공하며, 여러 수준의 노력이 가능합니다. 세 가지 낮은 수준에서는 테스트 썸네일에 대한 전체 분석이 설정을 끈 경우와 동일한 12개 평가를 반환했습니다. 가장 높은 수준만 모델의 행동을 변경했습니다.
우리가 사용하는 유럽 데이터센터에서는 업로드된 썸네일이 유럽 외부에서 처리되지 않도록 하기 위해, 가장 높은 수준은 3분간 반복 시도해도 결코 응답을 반환하지 않았습니다. 우리는 미국 지역에서 썸네일 없이 가상의 산술 문제를 사용해 이 설정이 작동함을 확인했고, 추론을 답변 앞에 일반 텍스트로 작성하는 것을 발견했습니다. 미국으로 업로드를 옮겨서 이것이 도움이 되는지 확인하는 것은 우리가 원하지 않는 거래였습니다.
네 가지 결과를 나란히 비교
각 변경 사항은 동일한 쌍에 대해 원래 버전과 비교되었으므로, 아래의 모든 차이는 동일한 조건에서 비교된 것입니다.
| 변경 사항 | 순위 정확도에 미친 영향 | 채택 여부 |
|---|---|---|
| 반올림하지 않은 점수 비교 | 321쌍에서 59.5%에서 62.0%로, 전부 이전 동점이 균등하게 갈라졌기 때문 | 예, 공정한 측정 방식으로 |
| 보정된 점수 산출 지침 | 161쌍에서 64.6%에서 63.4%로, 감지 가능한 차이 없음 | 아니요 |
| 썸네일 직접 비교 | 150쌍에서 62.7% 대 62.7%, 순서에 따라 답이 달라짐 | 아니요 |
| 모델 추론 모드 | 작동한 수준에서는 변화 없음; 가장 높은 수준은 우리 지역에서 결코 응답하지 않음 | 아니요 |
여기 모든 수치는 썸네일과 제목을 분석할 때 실행되는 동일한 점수 산출 파이프라인에서 나온 것입니다. 테스트는 별도의 연구용 복사본이 아니라 제품 자체를 통해 실제 영상을 점수 매겼습니다.
이 후속 테스트의 신뢰성을 유지한 방법
후속 실험은 연구가 일반적으로 잘못되는 지점입니다. 왜냐하면 연구자는 이미 원하는 답을 알고 있기 때문입니다. 다섯 가지 규칙이 이를 통제했습니다:
- 공개된 결과는 절대 수정하지 않았습니다. 사전 등록된 59.5%는 헤드라인으로 남고, 이후 모든 분석은 후속 연구로 명시됩니다.
- 채널은 변경 사항을 테스트하기 전에 절반으로 나누었습니다. 실험은 한 절반을 사용했고, 다른 절반은 최종 검사를 위해 보관했습니다.
- 각 변경 사항은 동일한 쌍과 원래 버전을 비교했고, 두 버전이 의견이 다른 쌍만을 계산했습니다. 이는 두 개의 전체 비율을 비교하는 것보다 훨씬 민감합니다.
- 소규모 시범은 더 큰 테스트를 실행해야 하는 이유로 간주했고, 절대 결과 자체로 간주하지 않았습니다.
- 모든 직접 비교는 두 순서로 보여졌기 때문에, 위치 선호가 실력으로 오해되지 않았습니다.
이 중 어느 것도 통계학 학위가 필요하지 않으며, 대부분 크리에이터가 자신의 썸네일을 테스트할 때도 직접 적용할 수 있습니다: 결과를 보기 전에 무엇이 성공인지 결정하고, 유사한 것끼리 비교하며, 작은 초기 결과는 계속 테스트해야 하는 이유로 간주하세요.
이 후속 결과의 한계
네 가지 실험 모두 원래 테스트와 동일한 확립된 영어 채널과 한 모델을 사용했습니다. 아이디어는 원래 결과가 알려진 후에 선택되었고, 이는 결과를 과대평가하기 쉬운 상황이며, 헤드라인이 사전 등록된 수치로 남아야 하는 또 다른 이유입니다.
각 변경 사항은 한 번, 한 형태로만 시도되었습니다. 지침의 다른 문구는 더 나은 결과를 냈을 수 있고, 추론 모드 결과는 2026년 9월 한 지역에서 사용 가능한 것을 설명합니다. 이 결과들은 점수가 개선될 수 없다고 말하는 것이 아니라, 이 네 가지 경로는 개선하지 못했다고 말합니다.
자주 묻는 질문
왜 62.0%를 정확도로 보고하지 않나요?
테스트 규칙은 데이터가 존재하기 전에 고정되었고, 동점은 실패로 간주했습니다. 결과를 본 후 규칙을 변경하는 것은 사전 등록이 방지하려는 바로 그 행위입니다. 심지어 합리적인 변경이라도 말입니다. 62.0%는 명확히 후속 측정으로 표시되어 있으며, 59.5%를 대체하지 않습니다.
더 똑똑한 AI 모델이 점수를 더 정확하게 만들 수 있을까요?
가능할 수 있지만, 이는 새로운 실험입니다. 현재 모델의 추론 설정은 우리가 사용하는 지역에서는 도움이 되지 않았고, 다른 모델은 동일한 쌍과 동일한 방식으로 테스트되어야만 주장할 수 있습니다. 이 특정 작업에서 새롭다는 것이 자동으로 더 나은 것을 의미하지는 않습니다.
30개 썸네일에 대한 테스트가 왜 그렇게 설득력 있게 보였나요?
작은 표본은 우연에 따라 큰 변동을 일으키며, 큰 변동은 발견처럼 보입니다. 30개 썸네일에서는 두 요소가 퍼짐을 두 배로 늘린 것처럼 보이는 것이 정상적인 변동 범위 내에 있었습니다. 322개 썸네일에서는 그 효과가 거의 사라졌습니다. 이는 두 개의 업로드로 새 썸네일 스타일을 판단하는 것과 같은 함정입니다.
제가 제 썸네일을 테스트할 때 이 결과는 무엇을 의미하나요?
동일한 규칙이 적용됩니다. 결과를 보기 전에 성공의 기준을 정하고, 단일 이전 영상보다 채널의 일반 범위와 비교하세요. 우연으로 설명할 수 없을 정도로 충분한 사례를 실행하고, 어떤 도구에게 두 옵션을 비교하게 할 때는 순서를 바꿔도 답이 유지되는지 확인하세요.
이 개선 시도가 실패했음에도 점수는 여전히 사용할 가치가 있나요?
점수는 실제 결과와 비교했을 때 우연보다 분명히 우수했습니다. 이 후속 연구는 네 가지 매력적인 변경이 더 나아가지 못했음을 보여주며, 이는 버리기 위한 이유가 아니라 유용한 정보입니다. 여러 정보 중 하나로 간주하고, 조회수 예측으로 사용하지 마세요.