모든 유튜브 조언은 썸네일이 클릭을 이끈다고 말합니다. 우리는 제목과 썸네일 양쪽을 점수 매기는 도구를 만들고, 둘을 분리해 실험을 진행했고, 결과는 제목이 더 큰 신호를 담고 있었습니다. 두 영상의 제목을 바꾸는 것만으로도 점수의 성능이 약화된 게 아니라 역전됐습니다.
핵심 요약
- 각 영상에 이웃 영상의 제목을 붙이면 점수가 평균 11.3점(100점 만점) 이동했고, 최대 60점까지 움직였습니다.
- 다른 제목을 붙여도 점수가 동일한 썸네일은 3.9%에 불과해, 제목은 모델에서 무시할 수 없는 요소입니다.
- 제목을 바꾼 후 점수는 더 잘 나온 영상을 42.7%의 확률로 맞췄습니다 — 이는 무작위보다 낮아, 순위가 약화된 게 아니라 뒤집혔음을 의미합니다.
- 순수 썸네일 기반 점수는 59.5%를 유지했을 것이고, 순수 제목 기반 점수는 35.2%로 떨어졌을 것입니다. 관측된 42.7%는 제목 쪽에 훨씬 가깝습니다.
- 이것이 썸네일을 무가치하게 만드는 건 아닙니다. 실험은 제목만 조작했으므로 제목의 기여도를 측정할 뿐, 이미지의 직접적인 영향은 측정하지 않았습니다.
유튜브에서 제목과 썸네일 중 뭐가 더 중요한가요?
이 실험의 증거에 따르면, 제목은 채널 평균을 넘은 영상과 미달한 영상을 구분하는 신호의 더 큰 부분을 담고 있습니다. 썸네일 분석에 중점을 둔 도구를 만들었음에도 예상치 못한 결과였고, 전혀 다른 목적을 위해 설계된 통제 실험에서 나왔습니다.
이 주장은 한정되어야 합니다. 이 실험은 실제 성과를 추적하는 점수가 어떻게 움직이는지를 측정한 것이지, 시청자 행동을 직접 측정한 건 아닙니다. 또한 동일 채널 내에서 비교했으므로, 시청자, 주제, 디자인 예산은 이미 고정된 상태입니다.
그럼에도 방향은 명확하고, 효과의 크기는 미묘하지 않습니다.
제목의 기여도를 어떻게 분리했나요?
실험은 321쌍의 영상으로 구성됐습니다. 각 쌍은 동일 채널에서 평균 6일 간격으로 게시됐고, 하나는 채널 자체 기준을 뚜렷하게 넘었고, 다른 하나는 뚜렷하게 미달했습니다. 정상적으로 점수를 매기면, 모델은 59.5%의 정확도로 올바른 순위를 매겼고, 이는 50%의 동전 던지기보다 높습니다.
그 다음, 모든 썸네일을 두 번째로 점수 매겼습니다 — 다른 영상의 제목과 연결해서요. 이미지 바이트는 두 번의 점수 매기기 사이에 완전히 동일했습니다. 파이프라인의 다른 부분은 전혀 바뀌지 않았습니다. 따라서 첫 번째와 두 번째 점수 사이의 모든 변화는 제목에만 기인합니다.
한 실험에서 나온 두 가지 질문
첫 번째 질문은 제목이 점수를 움직이는지 여부입니다. 썸네일과 제목을 함께 점수 매긴다고 주장하지만, 제목을 바꿔도 거의 반응하지 않는 도구는 사실상 한 쪽만 점수 매기고 두 쪽을 광고하는 셈입니다.
두 번째 질문은 더 날카롭습니다: 제목을 바꾼 입력으로 전체 순위 테스트를 다시 실행하면, 어느 쪽이 구분력을 담고 있는지 드러납니다. 세 가지 가능한 결과는 실험 전에 미리 기록됐고, 각각의 의미도 함께 적혀 있었습니다.
| 점수를 결정하는 요소가 | 제목 교체 후 예상 정확도 | 해석 |
|---|---|---|
| 썸네일만 | 59.5% — 변동 없음 | 제목을 바꿔도 중요한 건 아무것도 바뀌지 않음 |
| 두 요소가 동일하게 | 약 50% — 무작위 | 두 기여도가 서로 상쇄됨 |
| 제목만 | 35.2% — 완전히 역전 | 제목을 뒤집으면 순위도 뒤집힘 |
| 관측된 결과 | 42.7% | 제목이 주도하지만, 전적으로는 아님 |
제목을 바꿨을 때 무슨 일이 일어났나요?
점수는 크게 움직였습니다. 0~100점 척도에서 평균 절대 이동량은 11.3점, 중앙값은 8점, 90퍼센타일은 26점, 최대 이동량은 60점이었습니다. 다른 제목을 붙여도 점수가 동일한 썸네일은 3.9%에 불과했습니다.
비교를 위해, 이 평균 11.3점의 이동은 모델이 쌍 영상 사이에 일반적으로 두는 간격보다 큽니다. 제목만 바꿔도, 모델이 채널의 히트작과 실패작 사이에 보통 두는 전체 거리보다 더 큰 점수 이동을 일으킬 수 있습니다.
그 다음 순위 테스트입니다. 제목을 바꾼 입력으로 점수는 321쌍 중 137쌍(42.7%)에서 더 잘 나온 영상을 맞췄고, 95% 신뢰구간은 37.2%~48.3%, p값은 50% 대비 0.0101입니다. 이는 무작위보다 유의미하게 낮은 수치입니다.
왜 역전이 측정 오차일 수 없는가?
제목을 바꾸면 제목과 이미지 간 일치도가 깨지며, 일관성 자체가 모델이 점수 매기는 12가지 요소 중 하나입니다. 이는 진짜 혼란 요인이며, 숨기기보다 명확히 밝히는 게 중요합니다. 그러나 이 결과를 설명할 수는 없습니다.
모든 쌍의 양쪽에 무작위로 페널티를 부여하면 잡음이 생깁니다. 잡음은 정확도를 50%로 끌어내립니다 — 신호를 묻히는 것이지, 뒤집는 건 아닙니다. 42.7%라는 결과는 동전 던지기(50%)와 이 테스트의 동점 처리가 암시하는 47.4% 하한선 모두를 밑돌며, 한쪽을 가리키던 것이 뒤집혔음을 의미합니다. 이는 구분력 있는 특징을 바꾸었을 때 일어나는 일이며, 불일치 잡음만으로는 발생할 수 없습니다.
이 결과에 의심을 품게 했을 상황
세 가지 결과가 이 해석에 반대했을 것이고, 그 어느 것도 발생하지 않았습니다:
- 새 제목 아래에서도 점수가 거의 움직이지 않는 경우 — 이는 모델이 제목을 무시하고 있다는 뜻이지, 중요하게 평가하고 있다는 뜻이 아닙니다.
- 바꾼 정확도가 59.5%에 도달하거나 그 바로 아래인 경우 — 이는 썸네일이 혼자 순위를 결정하고 있음을 보여줍니다.
- 바꾼 정확도가 정확히 50%인 경우 — 이는 두 요소가 동등하게 기여하고 상쇄되고 있음을 의미합니다.
제목을 쓰는 방식에 어떤 변화가 생기나요?
실용적인 해석은 제목 수정이 당신에게 가능한 가장 저렴한 고레버리지 편집이라는 점입니다. 썸네일을 다시 디자인하려면 한 시간 또는 디자이너가 필요합니다. 제목을 다시 쓰는 데는 두 분이면 충분하고, 게시 후에도 가능하며 — 이 증거에 따르면, 패키징 신호를 이미지만큼은 아니더라도 적어도 그만큼 움직입니다.
또한 제목의 역할을 재정의합니다. 동일 연구의 차원 분석에서, 과잉 성과와 부족 성과를 가장 뚜렷하게 구분한 요소는 '약속 명확성'이었습니다: 패키징이 시청자에게 무엇을 볼지 얼마나 명확하게 전달하는가. 이는 대부분 제목의 속성입니다. 썸네일 조언이 집중하는 원시적인 감정 강도는 두 그룹을 가장 적게 구분했습니다.
특정 쌍이 12가지 요소 전반에서 어떻게 점수를 받는지 보고 싶다면, 이 실험에서 사용된 동일 파이프라인을 통해 직접 썸네일과 제목을 점수 매겨보세요 — 하나의 이미지에 대해 두 가지 제목 옵션을 비교할 수 있습니다.
썸네일이 여전히 중요한 영역
이 실험은 제목만 조작하고 이미지는 고정했으므로, 제목의 기여도는 직접 측정했고 썸네일은 간접적으로만 측정했습니다. 반대 실험 — 썸네일을 바꾸고 제목은 고정 — 은 아직 실행되지 않았고, 그 전까지는 정직한 입장은 우리가 한 쪽은 제대로 측정했고 다른 쪽은 빼기로 추정했다는 점입니다.
썸네일을 무시해서는 안 되는 구조적 이유도 있습니다. 동일 연구에서, 모든 업로드에 단일 고정 썸네일 템플릿을 사용하는 채널의 경우, 점수 정확도는 61.0%에서 48.7%로 급락했습니다. 썸네일이 변하지 않으면 모델도 구분력을 잃는다는 건, 이미지가 무언가를 하고 있다는 증거입니다.
테스트하지 않은 부분
실험은 점수가 제목에 이미지보다 더 민감하게 반응하고, 점수가 실제 성과를 추적한다는 것을 보여줍니다. 그러나 시청자가 클릭을 결정할 때 제목이 썸네일보다 더 큰 영향을 미친다는 것을 보여주진 않습니다. 이 둘은 인접한 주장이며, 여기서는 첫 번째 주장만 증거가 있습니다.
모든 쌍은 충분한 업로드 이력이 있어 안정적인 기준선을 계산할 수 있는 기존 영어 채널에서 나왔습니다. 다른 언어의 제목이나 기준선이 없는 새 채널은 이 샘플이 다룰 수 있는 범위를 벗어납니다. 여기서는 제안된 제목을 적용하면 실제 영상이 개선된다는 것도 말하지 않습니다 — 이건 다른 실험이고, 아직 실행하지 않은 실험입니다.
자주 묻는 질문
유튜브에서 제목이 썸네일보다 더 중요한가요?
이 실험에서 제목은 동일 채널 내에서 과잉 성과와 부족 성과 영상을 구분하는 신호의 더 큰 부분을 담고 있었습니다. 쌍 영상의 제목을 바꾸면 순위가 약화된 게 아니라 역전됐고, 이는 실제 작동 중인 특징을 뒤집었을 때 일어나는 현상입니다. 이는 점수의 행동을 측정한 것이지, 시청자 심리를 직접 측정한 건 아닙니다.
제목을 바꾸면 썸네일 점수가 얼마나 바뀌나요?
0~100점 척도에서 평균 11.3점, 중앙값 8점, 최대 관측 이동량 60점입니다. 다른 제목을 붙여도 점수가 동일한 이미지는 3.9%에 불과합니다. 이미지 자체는 두 점수 매기기 사이에 바이트 단위로 동일했으므로, 모든 이동은 제목에 기인합니다.
영상 게시 후 제목을 바꾸는 게 가치 있나요?
가능한 가장 저렴한 패키징 편집이며, 이 증거는 그것이 사소한 게 아니라고 시사합니다. 제목은 아무것도 다시 디자인하지 않고 몇 분 안에 다시 쓸 수 있고, 이미지만큼은 아니더라도 적어도 그만큼 패키징 점수를 움직였습니다. 처음 쓴 제목이 최고라고 가정하지 말고, 두세 가지 옵션을 비교해보세요.
왜 제목을 바꾸면 점수가 무작위보다 더 나빠졌나요?
제목이 어떤 영상이 더 잘 나왔는지에 대한 정보를 담고 있었기 때문입니다. 각 영상에 이웃 영상의 제목을 주면 그 정보가 뒤집히고, 순위도 뒤집힙니다. 무작위 잡음은 정확도를 50%로 끌어내렸을 것이고, 50% 아래로 가려면 잘못된 방향을 가리키는 실제 신호가 필요합니다.
이것이 썸네일이 중요하지 않다는 뜻인가요?
아니요. 실험은 제목만 바꿨으므로 제목의 기여도는 직접 측정했고, 이미지는 간접적으로만 측정했습니다. 별도로, 모든 썸네일이 하나의 고정 템플릿을 사용하는 채널에서는 점수 정확도가 무작위 수준으로 떨어졌습니다 — 이는 이미지가 변하지 않으면 모델이 실제 가치를 잃는다는 증거입니다.
약속 명확성에서 좋은 점수를 받는 제목은 어떤 건가요?
약속 명확성은 패키징이 시청자에게 무엇을 볼지 얼마나 명확하게 전달하는지를 측정합니다. 구체적인 주제를 명시하고 이미지와 일치하는 제목이 모호한 호기심을 기반으로 한 제목보다 더 높은 점수를 받습니다. 연구 전반에서 이 요소가 과잉 성과와 부족 성과 영상을 가장 뚜렷하게 구분했습니다.