대부분의 썸네일 조언은 가독성에서 시작합니다: 큰 글씨, 높은 대비, 하나의 초점. 이 조언은 옳으며, 이미 정착된 채널들은 이 수준에 도달해 있습니다. 642개 실제 썸네일을 분석한 결과, 가독성 점수는 거의 변동이 없었고, 전체 점수에서 가독성을 제거해도 실제 영상 순위 정확도는 전혀 변하지 않았습니다.
핵심 요약
- 정착된 채널의 642개 썸네일에서 가독성 하위 점수는 85~95 사이로만 변동했습니다. 우리가 측정한 다른 모든 요소는 더 넓게 변동했습니다.
- 가독성을 점수에서 완전히 제거해도 순위 정확도는 그대로 유지됐습니다: 321개 동일 채널 쌍 중 62.0%.
- 가독성은 여전히 기본 요건으로 중요합니다. 휴대폰 크기에서 아무도 읽을 수 없는 썸네일은 다른 요소를 평가받기 전에 이미 실패합니다. 다만, 좋은 영상과 훌륭한 영상을 구분하는 요소는 더 이상 아닙니다.
- 우리는 가독성의 가중치를 크게 줄였지만, 완전히 0으로 만들지는 않았습니다. 샘플에 초보자 채널이 포함되지 않았기 때문입니다.
- 텍스트가 가독성 확보된 후에는 제목과 약속의 명확성이 남은 차이를 만듭니다.
썸네일 가독성이 영상 성과에 영향을 미치나요?
가독성은 썸네일이 게임에 참여할 수 있는지를 결정하지만, 이기느냐를 결정하지는 않습니다. 정착된 채널들 사이에서, 우리 모델은 거의 모든 썸네일을 쉽게 읽을 수 있다고 평가했기 때문에, 가독성은 채널의 히트작과 실패작을 구분할 수 없었습니다. 가독성을 점수에서 삭제했을 때, 점수는 이전과 동일하게 실제 영상을 순위 매겼습니다: 321개 쌍 중 62.0%.
이 주장은 듣기보다 좁은 범위를 가집니다. 좁은 범위가 중요합니다. 가독성이 중요하지 않다는 말이 아닙니다. 충분히 오래 업로드해온 채널들 사이에서는 가독성 문제가 이미 해결되었고, 모두가 통과하는 요소는 누구를 순위 매길 수 없습니다.
실제 썸네일 간 가독성의 실제 변동 범위
연구에 포함된 모든 썸네일은 12개 요소로 점수를 매겼습니다. 다음은 642개 썸네일 전체에서 6개 요소의 변동 범위입니다 — 우리가 발표한 점수 테스트에 사용된 동일한 321개 쌍입니다. '범위' 열은 표준 편차입니다: 대략적으로, 일반적인 썸네일이 평균에서 얼마나 떨어져 있는지를 나타냅니다.
| 요소 | 최저~최고 점수 | 범위 |
|---|---|---|
| 가독성 | 85~95 | 3.7 |
| 클릭베이트 위험 | 3~44 | 5.4 |
| 호기심 유발 | 29~68 | 6.8 |
| 제목 강도 | 23~93 | 10.3 |
| 약속 명확성 | 8~95 | 13.9 |
| 클리프행거 | 17~93 | 14.9 |
가독성은 단순히 가장 좁은 열이 아닙니다. 그 전체 범위(최저~최고)는 표 하단 요소들의 평균에서 일반적인 거리보다 작습니다. 전체 샘플에서 가장 약한 썸네일조차 85점을 받았습니다.
이것들은 우리 모델의 평가이며, 자를 사용한 측정이 아닙니다. 그러나 모델이 전반적으로 관대하게 평가한 것은 아닙니다: 약속 명확성은 8~95까지 거의 전체 범위에 걸쳐 점수를 분산시켰습니다. 모델은 가용 범위를 가지고 있었지만, 썸네일들이 그 요소에서 거의 차이가 없었기 때문에 가독성에는 사용하지 않았습니다.
좌우로 좁은 범위가 점수에 미치는 영향
점수에서 가중치는 그 요소가 얼마나 중요한지를 측정하지 않습니다. 그 요소가 변할 때 최종 점수가 얼마나 움직이는지를 결정합니다. 요소가 거의 변하지 않으면, 큰 가중치는 거의 모든 썸네일에 동일한 양을 추가합니다. 모든 사람의 점수를 올리지만, 누구를 구분하지는 않습니다.
가독성은 우리 점수의 클릭 측면에서 가장 큰 가중치 중 하나였지만, 우리가 측정한 요소 중 가장 적게 변동했습니다. 실제로는 거의 일정한 보너스처럼 작동했고, 일정한 보너스는 점수의 나머지 부분이 보여주려는 썸네일 간 차이를 압축시킵니다.
가독성을 점수에서 제거했을 때 일어난 일
우리는 추측할 필요가 없었습니다. 연구는 이미 모든 썸네일에 대한 모든 하위 점수를 포함하고 있으므로, 모델에 새로운 것을 요청하지 않고도 어떤 가중치 세트로든 전체 점수를 다시 계산할 수 있습니다. 우리는 원래 가중치, 여러 감소된 가중치, 그리고 0으로 가독성을 설정하여 모든 321개 쌍을 다시 순위 매겼고, 반올림된 정수보다 정밀한 점수를 비교했습니다 — 그래서 이 수치가 우리가 처음 발표한 59.5%보다 약간 높습니다.
원래 가중치에서 점수는 쌍의 62.0%에서 더 잘 수행된 영상을 선택했습니다. 0으로 설정했을 때, 가독성을 완전히 삭제했지만, 여전히 62.0%에서 더 나은 영상을 선택했습니다. 그 사이의 모든 값은 0.6포인트 이내에서 유지됐습니다. 우리 프롬프트 실험에 전혀 영향을 받지 않은 채널 절반에서도 결과는 유지됐습니다: 원래 가중치에서 59.4%, 0에서 59.4%.
왜 제거하지 않고 가중치를 줄였는가
데이터는 가독성을 완전히 삭제할 수 있게 했습니다. 그러나 우리는 샘플에 포함된 채널들 때문에 그렇게 하지 않았습니다. 연구에 포함된 모든 채널은 정착된 채널이었습니다: 긴 업로드 이력, 안정된 시청자, 텍스트를 가독성 있게 만들기 배운 사람들에 의해 제작된 썸네일. 이것이 바로 가독성이 비활성처럼 보인 이유입니다.
썸네일 체커를 사용하는 사람들은 아닙니다. 열 번째 영상을 업로드하면서 복잡한 배경 위에 작은 캡션을 넣는 창작자는 가독성이 잡아내야 할 대상이며, 그들에게는 가독성이 크게 변동합니다. 그런 썸네일이 전혀 포함되지 않은 샘플을 근거로 제거하는 것은 데이터가 결코 묻지 않은 질문에 답하는 것입니다. 그래서 가중치를 크게 줄였고, 그 차이를 기존 가중치에 비례하여 다른 클릭 요소들에 분배했습니다. 이는 순서를 그대로 유지합니다.
일반적인 썸네일의 전체 점수는 약 1점 감소합니다. 우리는 12개 요소 전체에 대한 완전한 통계적 재가중치도 테스트했으며, 1.9점이 증가했지만, 이 샘플 크기에서는 잡음 범위 내에 있어 나머지 가중치는 그대로 유지했습니다.
모든 썸네일이 통과해야 하는 가독성 기준
이 모든 것이 가독성을 무시해도 된다는 뜻은 아닙니다. 그것은 빠르게 통과해야 하는 통과/실패 체크이며, 그 후에는 더 이상 다듬지 않는다는 뜻입니다. 그 체크의 작동 방식:
- 썸네일을 추천 영상 목록에 나타나는 크기로 축소하고 1초 동안 보세요. 모든 단어를 읽을 수 없다면, 단어가 너무 많거나 너무 작습니다.
- 이미지의 단어 수를 세세요. 그 크기에서는 3~4개 단어도 이미 많으며, 짧은 구가 문장보다 일반적으로 더 잘 읽힙니다.
- 회색조에서 대비를 확인하세요. 색상만으로 배경과 구분되는 텍스트는 일부 시청자와 일부 화면에서는 사라집니다.
- 눈이 처음으로 머무는 단일 요소를 찾으세요. 두 개의 초점이 경쟁하면, 썸네일은 시청자가 클릭하기 전에 선택하게 만듭니다.
- 실제로 옆에 나타날 썸네일들과 함께 보세요. 빈 캔버스에서 가독성이 있다고 해서 혼잡한 피드에서 가독성이 있는 것은 아닙니다.
썸네일이 다섯 가지 모두를 통과하면, 가독성에 더 많은 노력을 기울여도 옆 영상과의 차이를 만들기 어렵습니다.
텍스트가 가독성 확보된 후에 어디에 노력을 쏟아야 하는가
원래 테스트에서, 채널의 과잉 수행 영상과 부진한 영상을 가장 명확히 구분한 요소는 약속 명확성: 패키징이 영상의 내용을 얼마나 명확하게 전달하는지였습니다. 그 다음은 놓칠까 봐 두려운 신호와 긴급성입니다. 이 세 요소는 대부분 제목에 있으며, 제목과 이미지가 어떻게 함께 작동하는지에 있습니다. 글자 가독성보다는요.
이것은 제목을 변경하고 이미지는 그대로 둔 연구의 유일한 실험과 일치합니다. 모든 썸네일을 다른 영상의 제목과 비교해 재점수를 매겼을 때, 점수는 평균 11점 이상 이동했습니다 — 가독성의 전체 범위의 약 3배입니다. 우리 모델의 관점에서, 단어는 글자보다 더 큰 차이를 만듭니다. 자신의 패키징이 어디에 있는지 확인하려면, 썸네일과 제목을 동일한 12개 요소로 점수 매기고 어떤 요소가 발목을 잡고 있는지 확인할 수 있습니다.
이 발견의 한계
여기 모든 내용은 정착된 영어권 채널, 하나의 모델에 의해 점수 매겨진 것입니다. 가독성이 비활성처럼 보인 이유는 그 채널들이 이미 이를 해결했기 때문이며, 이 발견은 그런 주의사항 없이 새 채널에 적용해서는 안 됩니다.
가독성 수치는 독립 측정이 아니라 모델의 평가이므로, 가독성을 체계적으로 과대평가하는 모델은 동일한 좁은 범위를 생성할 수 있습니다. 우리는 그럴 가능성이 낮다고 생각합니다. 왜냐하면 동일한 모델이 다른 요소에는 거의 전체 범위를 사용했기 때문입니다. 그러나 이 데이터만으로는 이를 배제할 수 없습니다. 그리고 원래 연구와 마찬가지로, 이 모든 것은 연관성일 뿐입니다: 어떤 썸네일도 변경 후 재게시되지 않았습니다.
자주 묻는 질문
유튜브에서 썸네일 텍스트 크기는 중요합니까?
네, 기본 요건으로서 중요합니다. 피드에 나타나는 크기에서 읽을 수 없는 텍스트는 그 공간을 낭비합니다. 우리의 데이터는 정착된 채널들이 거의 모두 이 기본 요건을 이미 통과했다는 것을 시사합니다. 텍스트가 가독성 확보된 후에는 더 크게 또는 더 굵게 만드는 것이 한 영상과 다른 영상을 구분하는 요소가 되기 어렵습니다.
왜 당신의 점수에서 가독성이 더 이상 중요하지 않게 됐나요?
중요하지 않게 된 것이 아니라, 구분하지 않게 된 것입니다. 정착된 채널의 642개 썸네일에서 가독성은 85~95 사이로만 변동했기 때문에, 거의 모든 점수에 동일한 양을 추가했습니다. 이를 제거해도 실제 영상 순위 매기기 능력은 변하지 않았고, 그래서 가중치를 줄였습니다.
썸네일 가독성 작업을 중단해야 하나요?
피드 크기에서 빠르게 확인할 수 있을 때만: 약 1초 안에 모든 단어가 읽히고, 하나의 명확한 초점이 있으며, 회색조에서도 살아남을 만큼 충분한 대비가 있을 때만입니다. 그 이후에는 제목과 패키징이 약속을 얼마나 명확하게 전달하는지에 시간을 투자하는 것이, 영상이 옆 영상과 비교될 때 더 큰 영향을 미칠 가능성이 높습니다.
이 변경이 기존 썸네일 점수에 영향을 미쳤나요?
약간 영향을 미쳤습니다. 가독성 가중치를 줄이고 다른 클릭 요소 가중치를 올려 보상했기 때문에, 일반적인 전체 점수는 약 1점 감소합니다. 우리가 모든 변경을 대조하는 기준 썸네일 전체에서 등급은 변하지 않았고, 가장 큰 이동은 1점이었습니다.
이 내용이 작은 채널이나 신규 채널에도 적용되나요?
자동으로 적용되지 않습니다. 샘플에 포함된 모든 채널은 정착된 채널이었고, 이것이 바로 가독성이 변동이 거의 없었던 이유입니다. 신규 채널은 훨씬 더 읽기 어려운 썸네일을 가질 가능성이 높으며, 그런 경우 가독성은 먼저 고쳐야 할 가장 중요한 요소일 수 있습니다.