연구썸네일디자인

썸네일 가독성은 기본 조건, 승부수단이 아님

642개 실제 썸네일 분석 결과, 가독성 점수는 거의 변동 없었고, 이를 제거해도 점수 정확도는 그대로 유지됐습니다. 가독성은 기본 요건일 뿐, 성과 차이를 만드는 요소는 아닙니다.

September 14, 20268 min read
썸네일 가독성은 기본 조건, 승부수단이 아님

대부분의 썸네일 조언은 가독성에서 시작합니다: 큰 글씨, 높은 대비, 하나의 초점. 이 조언은 옳으며, 이미 정착된 채널들은 이 수준에 도달해 있습니다. 642개 실제 썸네일을 분석한 결과, 가독성 점수는 거의 변동이 없었고, 전체 점수에서 가독성을 제거해도 실제 영상 순위 정확도는 전혀 변하지 않았습니다.

핵심 요약

  • 정착된 채널의 642개 썸네일에서 가독성 하위 점수는 85~95 사이로만 변동했습니다. 우리가 측정한 다른 모든 요소는 더 넓게 변동했습니다.
  • 가독성을 점수에서 완전히 제거해도 순위 정확도는 그대로 유지됐습니다: 321개 동일 채널 쌍 중 62.0%.
  • 가독성은 여전히 기본 요건으로 중요합니다. 휴대폰 크기에서 아무도 읽을 수 없는 썸네일은 다른 요소를 평가받기 전에 이미 실패합니다. 다만, 좋은 영상과 훌륭한 영상을 구분하는 요소는 더 이상 아닙니다.
  • 우리는 가독성의 가중치를 크게 줄였지만, 완전히 0으로 만들지는 않았습니다. 샘플에 초보자 채널이 포함되지 않았기 때문입니다.
  • 텍스트가 가독성 확보된 후에는 제목과 약속의 명확성이 남은 차이를 만듭니다.

썸네일 가독성이 영상 성과에 영향을 미치나요?

가독성은 썸네일이 게임에 참여할 수 있는지를 결정하지만, 이기느냐를 결정하지는 않습니다. 정착된 채널들 사이에서, 우리 모델은 거의 모든 썸네일을 쉽게 읽을 수 있다고 평가했기 때문에, 가독성은 채널의 히트작과 실패작을 구분할 수 없었습니다. 가독성을 점수에서 삭제했을 때, 점수는 이전과 동일하게 실제 영상을 순위 매겼습니다: 321개 쌍 중 62.0%.

이 주장은 듣기보다 좁은 범위를 가집니다. 좁은 범위가 중요합니다. 가독성이 중요하지 않다는 말이 아닙니다. 충분히 오래 업로드해온 채널들 사이에서는 가독성 문제가 이미 해결되었고, 모두가 통과하는 요소는 누구를 순위 매길 수 없습니다.

실제 썸네일 간 가독성의 실제 변동 범위

연구에 포함된 모든 썸네일은 12개 요소로 점수를 매겼습니다. 다음은 642개 썸네일 전체에서 6개 요소의 변동 범위입니다 — 우리가 발표한 점수 테스트에 사용된 동일한 321개 쌍입니다. '범위' 열은 표준 편차입니다: 대략적으로, 일반적인 썸네일이 평균에서 얼마나 떨어져 있는지를 나타냅니다.

요소최저~최고 점수범위
가독성85~953.7
클릭베이트 위험3~445.4
호기심 유발29~686.8
제목 강도23~9310.3
약속 명확성8~9513.9
클리프행거17~9314.9

가독성은 단순히 가장 좁은 열이 아닙니다. 그 전체 범위(최저~최고)는 표 하단 요소들의 평균에서 일반적인 거리보다 작습니다. 전체 샘플에서 가장 약한 썸네일조차 85점을 받았습니다.

이것들은 우리 모델의 평가이며, 자를 사용한 측정이 아닙니다. 그러나 모델이 전반적으로 관대하게 평가한 것은 아닙니다: 약속 명확성은 8~95까지 거의 전체 범위에 걸쳐 점수를 분산시켰습니다. 모델은 가용 범위를 가지고 있었지만, 썸네일들이 그 요소에서 거의 차이가 없었기 때문에 가독성에는 사용하지 않았습니다.

좌우로 좁은 범위가 점수에 미치는 영향

점수에서 가중치는 그 요소가 얼마나 중요한지를 측정하지 않습니다. 그 요소가 변할 때 최종 점수가 얼마나 움직이는지를 결정합니다. 요소가 거의 변하지 않으면, 큰 가중치는 거의 모든 썸네일에 동일한 양을 추가합니다. 모든 사람의 점수를 올리지만, 누구를 구분하지는 않습니다.

가독성은 우리 점수의 클릭 측면에서 가장 큰 가중치 중 하나였지만, 우리가 측정한 요소 중 가장 적게 변동했습니다. 실제로는 거의 일정한 보너스처럼 작동했고, 일정한 보너스는 점수의 나머지 부분이 보여주려는 썸네일 간 차이를 압축시킵니다.

가독성을 점수에서 제거했을 때 일어난 일

우리는 추측할 필요가 없었습니다. 연구는 이미 모든 썸네일에 대한 모든 하위 점수를 포함하고 있으므로, 모델에 새로운 것을 요청하지 않고도 어떤 가중치 세트로든 전체 점수를 다시 계산할 수 있습니다. 우리는 원래 가중치, 여러 감소된 가중치, 그리고 0으로 가독성을 설정하여 모든 321개 쌍을 다시 순위 매겼고, 반올림된 정수보다 정밀한 점수를 비교했습니다 — 그래서 이 수치가 우리가 처음 발표한 59.5%보다 약간 높습니다.

원래 가중치에서 점수는 쌍의 62.0%에서 더 잘 수행된 영상을 선택했습니다. 0으로 설정했을 때, 가독성을 완전히 삭제했지만, 여전히 62.0%에서 더 나은 영상을 선택했습니다. 그 사이의 모든 값은 0.6포인트 이내에서 유지됐습니다. 우리 프롬프트 실험에 전혀 영향을 받지 않은 채널 절반에서도 결과는 유지됐습니다: 원래 가중치에서 59.4%, 0에서 59.4%.

왜 제거하지 않고 가중치를 줄였는가

데이터는 가독성을 완전히 삭제할 수 있게 했습니다. 그러나 우리는 샘플에 포함된 채널들 때문에 그렇게 하지 않았습니다. 연구에 포함된 모든 채널은 정착된 채널이었습니다: 긴 업로드 이력, 안정된 시청자, 텍스트를 가독성 있게 만들기 배운 사람들에 의해 제작된 썸네일. 이것이 바로 가독성이 비활성처럼 보인 이유입니다.

썸네일 체커를 사용하는 사람들은 아닙니다. 열 번째 영상을 업로드하면서 복잡한 배경 위에 작은 캡션을 넣는 창작자는 가독성이 잡아내야 할 대상이며, 그들에게는 가독성이 크게 변동합니다. 그런 썸네일이 전혀 포함되지 않은 샘플을 근거로 제거하는 것은 데이터가 결코 묻지 않은 질문에 답하는 것입니다. 그래서 가중치를 크게 줄였고, 그 차이를 기존 가중치에 비례하여 다른 클릭 요소들에 분배했습니다. 이는 순서를 그대로 유지합니다.

일반적인 썸네일의 전체 점수는 약 1점 감소합니다. 우리는 12개 요소 전체에 대한 완전한 통계적 재가중치도 테스트했으며, 1.9점이 증가했지만, 이 샘플 크기에서는 잡음 범위 내에 있어 나머지 가중치는 그대로 유지했습니다.

모든 썸네일이 통과해야 하는 가독성 기준

이 모든 것이 가독성을 무시해도 된다는 뜻은 아닙니다. 그것은 빠르게 통과해야 하는 통과/실패 체크이며, 그 후에는 더 이상 다듬지 않는다는 뜻입니다. 그 체크의 작동 방식:

  1. 썸네일을 추천 영상 목록에 나타나는 크기로 축소하고 1초 동안 보세요. 모든 단어를 읽을 수 없다면, 단어가 너무 많거나 너무 작습니다.
  2. 이미지의 단어 수를 세세요. 그 크기에서는 3~4개 단어도 이미 많으며, 짧은 구가 문장보다 일반적으로 더 잘 읽힙니다.
  3. 회색조에서 대비를 확인하세요. 색상만으로 배경과 구분되는 텍스트는 일부 시청자와 일부 화면에서는 사라집니다.
  4. 눈이 처음으로 머무는 단일 요소를 찾으세요. 두 개의 초점이 경쟁하면, 썸네일은 시청자가 클릭하기 전에 선택하게 만듭니다.
  5. 실제로 옆에 나타날 썸네일들과 함께 보세요. 빈 캔버스에서 가독성이 있다고 해서 혼잡한 피드에서 가독성이 있는 것은 아닙니다.

썸네일이 다섯 가지 모두를 통과하면, 가독성에 더 많은 노력을 기울여도 옆 영상과의 차이를 만들기 어렵습니다.

텍스트가 가독성 확보된 후에 어디에 노력을 쏟아야 하는가

원래 테스트에서, 채널의 과잉 수행 영상과 부진한 영상을 가장 명확히 구분한 요소는 약속 명확성: 패키징이 영상의 내용을 얼마나 명확하게 전달하는지였습니다. 그 다음은 놓칠까 봐 두려운 신호와 긴급성입니다. 이 세 요소는 대부분 제목에 있으며, 제목과 이미지가 어떻게 함께 작동하는지에 있습니다. 글자 가독성보다는요.

이것은 제목을 변경하고 이미지는 그대로 둔 연구의 유일한 실험과 일치합니다. 모든 썸네일을 다른 영상의 제목과 비교해 재점수를 매겼을 때, 점수는 평균 11점 이상 이동했습니다 — 가독성의 전체 범위의 약 3배입니다. 우리 모델의 관점에서, 단어는 글자보다 더 큰 차이를 만듭니다. 자신의 패키징이 어디에 있는지 확인하려면, 썸네일과 제목을 동일한 12개 요소로 점수 매기고 어떤 요소가 발목을 잡고 있는지 확인할 수 있습니다.

이 발견의 한계

여기 모든 내용은 정착된 영어권 채널, 하나의 모델에 의해 점수 매겨진 것입니다. 가독성이 비활성처럼 보인 이유는 그 채널들이 이미 이를 해결했기 때문이며, 이 발견은 그런 주의사항 없이 새 채널에 적용해서는 안 됩니다.

가독성 수치는 독립 측정이 아니라 모델의 평가이므로, 가독성을 체계적으로 과대평가하는 모델은 동일한 좁은 범위를 생성할 수 있습니다. 우리는 그럴 가능성이 낮다고 생각합니다. 왜냐하면 동일한 모델이 다른 요소에는 거의 전체 범위를 사용했기 때문입니다. 그러나 이 데이터만으로는 이를 배제할 수 없습니다. 그리고 원래 연구와 마찬가지로, 이 모든 것은 연관성일 뿐입니다: 어떤 썸네일도 변경 후 재게시되지 않았습니다.

자주 묻는 질문

유튜브에서 썸네일 텍스트 크기는 중요합니까?

네, 기본 요건으로서 중요합니다. 피드에 나타나는 크기에서 읽을 수 없는 텍스트는 그 공간을 낭비합니다. 우리의 데이터는 정착된 채널들이 거의 모두 이 기본 요건을 이미 통과했다는 것을 시사합니다. 텍스트가 가독성 확보된 후에는 더 크게 또는 더 굵게 만드는 것이 한 영상과 다른 영상을 구분하는 요소가 되기 어렵습니다.

왜 당신의 점수에서 가독성이 더 이상 중요하지 않게 됐나요?

중요하지 않게 된 것이 아니라, 구분하지 않게 된 것입니다. 정착된 채널의 642개 썸네일에서 가독성은 85~95 사이로만 변동했기 때문에, 거의 모든 점수에 동일한 양을 추가했습니다. 이를 제거해도 실제 영상 순위 매기기 능력은 변하지 않았고, 그래서 가중치를 줄였습니다.

썸네일 가독성 작업을 중단해야 하나요?

피드 크기에서 빠르게 확인할 수 있을 때만: 약 1초 안에 모든 단어가 읽히고, 하나의 명확한 초점이 있으며, 회색조에서도 살아남을 만큼 충분한 대비가 있을 때만입니다. 그 이후에는 제목과 패키징이 약속을 얼마나 명확하게 전달하는지에 시간을 투자하는 것이, 영상이 옆 영상과 비교될 때 더 큰 영향을 미칠 가능성이 높습니다.

이 변경이 기존 썸네일 점수에 영향을 미쳤나요?

약간 영향을 미쳤습니다. 가독성 가중치를 줄이고 다른 클릭 요소 가중치를 올려 보상했기 때문에, 일반적인 전체 점수는 약 1점 감소합니다. 우리가 모든 변경을 대조하는 기준 썸네일 전체에서 등급은 변하지 않았고, 가장 큰 이동은 1점이었습니다.

이 내용이 작은 채널이나 신규 채널에도 적용되나요?

자동으로 적용되지 않습니다. 샘플에 포함된 모든 채널은 정착된 채널이었고, 이것이 바로 가독성이 변동이 거의 없었던 이유입니다. 신규 채널은 훨씬 더 읽기 어려운 썸네일을 가질 가능성이 높으며, 그런 경우 가독성은 먼저 고쳐야 할 가장 중요한 요소일 수 있습니다.