연구썸네일YouTube-분석

321개 실제 영상으로 썸네일 점수 테스트해봤습니다

YouTube 썸네일과 제목 점수가 실제 성과를 예측하는지 사전 등록된 테스트 결과입니다. 321개 채널 내 영상 쌍, 4가지 통제 조건, 그리고 결과를 공개하기로 한 약속까지 모두 포함합니다.

September 4, 20269 min read
321개 실제 영상으로 썸네일 점수 테스트해봤습니다

썸네일 점수는 실제 YouTube에서 일어나는 일과 연관될 때만 의미가 있습니다. 그래서 우리는 우리를 당황하게 할 수도 있는 테스트를 실행했습니다: 321개의 실제 영상 쌍, 각 쌍은 동일 채널에서 나왔으며, 하나는 채널 자체 평균을 넘었고 다른 하나는 미달했습니다. 우리는 어떤 데이터도 보기 전에 방법을 미리 기록해두었습니다. 점수는 59.5%의 확률로 더 잘 성과를 낸 영상을 선택했고, 이는 50%의 동전 던지기 확률보다 높습니다.

핵심 요약

  • 321개 쌍 전체에서 점수는 더 잘 성과를 낸 영상을 59.5%의 확률로 더 높게 순위 지정했습니다(p = 0.00079). 우연의 확률은 50%입니다.
  • 다른 채널 간 영상을 비교하면 구독자 수를 측정할 뿐 패키징을 측정하지 않습니다 — 여기 모든 쌍은 하나의 채널에서 나왔으며, 중간 6일 간격으로 게시되었습니다.
  • 모든 썸네일이 동일한 템플릿을 따르는 채널에서는 정확도가 48.7%로 떨어졌습니다. 우리가 원했던 결과입니다: 읽을 수 있는 차이가 없고, 찾을 수 있는 신호도 없습니다.
  • 제목 길이, 단어 수, 파일 크기, 대비도 등 네 가지 간단한 휴리스틱은 모두 우연 수준에 머물렀습니다. 점수는 이들 중 어느 것도 대체하지 않습니다.
  • 모델이 두 영상 사이에 둔 점수 차이가 클수록, 더 자주 맞췄습니다: 1-3점 차이는 56%, 15점 이상 차이는 76.5%.

YouTube 썸네일 점수는 실제로 성과를 예측할 수 있나요?

이 테스트에서는 그렇습니다 — 소폭이지만 측정 가능한 수준으로요. 동일 채널에서 나온 두 영상 중 하나는 명백히 자체 기준을 초과했고, 다른 하나는 명백히 미달했을 때, 우리의 점수는 59.5%의 확률로 올바르게 순위를 매겼습니다. 우연의 확률은 50%입니다. 95% 신뢰 구간은 53.9%에서 64.9%까지이므로, 효과는 실제 존재하지만 작습니다.

작다는 것이 정직한 답변이며, 더 큰 효과를 주장하는 사람은 무언가를 팔고 있는 것입니다. 패키징은 여러 요인 중 하나일 뿐입니다. 주제, 업로드 시기, 그 주의 알고리즘의 기분, 오프플랫폼에서 영상이 주목받았는지 여부 — 이 모든 것이 썸네일보다 조회수에 더 큰 영향을 미칩니다. 90% 정확도를 주장하는 점수는 존재하지 않는 YouTube를 묘사하고 있을 뿐입니다.

실제에서 59.5%가 의미하는 바: 동일 영상에 대해 두 가지 옵션 중 선택할 때, 점수는 추측보다 낫고, 한 쪽을 더 강하게 선호할수록 더 유용합니다.

다른 채널 간 썸네일 비교가 아무것도 알려주지 않는 이유

이 테스트의 가장 명백한 버전은 일괄 썸네일을 점수 매기고 조회수와 상관관계를 분석하는 것입니다. 그러나 이는 채널 규모를 측정할 뿐입니다. 조회수는 구독자 수, 주제, 영상 연령에 의해 패키징보다 훨씬 더 크게 좌우되며, 혼란은 유리한 방향으로 작용합니다: 큰 채널은 좋은 디자이너를 고용할 수 있을 뿐만 아니라 큰 시청자층도 보유하고 있습니다.

이 테스트를 실행하면 의미 없는 좋은 양의 상관관계가 나옵니다. 단 한 명의 회의적인 독자도 이 결과를 통과시키지 못할 것입니다.

공정한 비교가 반드시 고정해야 할 요소

동일 채널에서 나온 두 영상을 비교하면 구독자 수, 시청자층, 예산, 디자인 역량을 한 번에 제거할 수 있습니다. 이 네 가지 요소는 쌍 내에서 모두 동일하기 때문입니다. 두 영상이 가까운 시기에 게시되도록 요구하면 채널의 성장 추세와 해당 기간의 알고리즘 체계도 함께 제거됩니다.

남는 것은 귀무가설 하에서 알려진 답을 가진 질문입니다: 채널의 자체 시청자들이 매우 다르게 반응한 두 영상이 주어졌을 때, 점수는 어느 것이 어느 것인지 구분할 수 있는가?

321개 매칭 쌍으로 공정한 테스트를 구축한 방법

우리는 기술, 교육, 요리, 게임, 피트니스, 라이프스타일 등 6개 카테고리에 걸쳐 60개 채널을 선정하고, 각 채널에서 최대 300개의 최근 업로드 영상을 추출했습니다. 제외 조건을 적용한 결과 17,250개 영상이 고려되었고, 321개의 사용 가능한 쌍이 남았습니다. 모든 쌍은 동일 채널에서 나왔으며, 중간 6일 간격으로 게시되었고, 성과 우수 영상은 성과 부족 영상보다 중간 4.7배 더 잘 성과를 냈습니다.

성과는 채널 전체 평균이 아닌 이동 평균 기준으로 측정됩니다. 각 영상에 대해 양쪽으로 각각 10개씩 인접한 업로드 영상의 중간 조회수를 계산하고, 그 자체 조회수를 그 배수로 표현합니다. 2년 동안 5배 성장한 채널이라면, 초기 영상은 모두 실패로, 최근 영상은 모두 성공으로 분류될 것이며, 이는 패키징이 아니라 달력을 측정하는 것입니다.

매칭 규칙은 사전에 고정되었습니다:

  1. 두 영상 모두 동일 채널에서 나와야 하며, 각 영상은 최대 한 쌍에만 포함될 수 있습니다.
  2. 두 영상은 120일 이내에 게시되어야 합니다.
  3. 성과 우수 영상은 성과 부족 영상보다 최소 2배 이상 더 잘 성과를 내야 하므로, “좋음”과 “나쁨”이 소음이 아니라 의미 있는 차이를 나타내야 합니다.
  4. 한 채널은 최대 8개 쌍만 기여할 수 있으므로, 한 명의 다작 업로더가 표본을 지배할 수 없습니다.

쇼츠, 라이브스트림, 45일 미만 또는 2년 이상 된 영상은 제외되었습니다. 점수는 썸네일과 제목만을 봤습니다 — 사용자가 도구에 제공하는 것과 정확히 동일한 정보 — 조회수나 쌍의 어느 쪽인지에 대한 정보는 전혀 보지 않았습니다.

점수가 맞춘 것과 그 빈도

모델은 321개 쌍 중 191개에서 더 잘 성과를 낸 영상을 선택했습니다: 59.5%, 50% 귀무가설에 대한 정확한 이항 분포 p값은 0.00079입니다. 17개 쌍은 정확히 동일한 점수로 나왔고, 이들은 모두 실패로 처리되었습니다. 점수가 두 입력을 구분할 수 없다면, 그들은 구분되지 않은 것이기 때문입니다.

동점은 실패로 처리함으로써 헤드라인 숫자는 보수적으로 나옵니다. 전혀 능력이 없는 모델은 이 규칙 하에서 약 47.4%를 기록할 것이며, 50%가 아닙니다. 따라서 테스트는 우리 모델에게 실제 우연 수준보다 약간 높은 기준을 요구했습니다. 실제로 구분한 304개 쌍 중에서 모델은 62.8%의 확률로 맞췄습니다.

신뢰도는 정확도와 함께 움직였습니다

결과가 우연이 아니라 측정처럼 작동하게 만든 패턴: 점수가 두 영상을 더 멀리 떨어뜨릴수록, 더 자주 맞췄습니다.

1-3점 차이에서는 정확도가 56.0%였고, 4-7점에서는 64.1%, 8-14점에서는 63.2%, 15점 이상에서는 76.5%였습니다. 잡음을 생성하는 모델은 이 구간들에서 평평한 선을 보일 것입니다. 이 모델은 확신이 커질수록 점점 더 잘 맞추며, 이는 원하는 행동이며 위조할 수 없습니다.

우리를 틀렸다고 증명할 수 있었던 네 가지 검증

실패할 수 없는 연구는 증거가 아닙니다. 우리는 사전에 네 가지 통제 조건을 명시했으며, 각각이 헤드라인을 무효화할 수 있도록 했고, 어떤 결과가 나오든 모두 공개하기로 약속했습니다. 모든 조건이 예상대로 작동했습니다.

통제실패가 의미하는 바결과
승자/패자 라벨을 1,000번 섞기파이프라인이 답을 유출함; 전체 결과 무효47.1%, 이론이 말하는 정확한 위치
썸네일이 하나의 고정 템플릿을 따르는 채널점수가 패키징 이외의 것을 읽고 있음48.7% — 예측된 우연 수준
간단한 휴리스틱: 제목 길이, 단어 수, 파일 크기, 대비도한 줄 규칙이 모델과 일치하므로 모델은 아무것도 추가하지 않음46.7%-54.5%, 모두 유의미하지 않음
모든 썸네일을 다른 영상의 제목과 함께 재점수 매기기제목은 아무 기여도 없고, 우리는 절반만 점수 매김점수는 평균 11.3점 이동

템플릿 검증이 가장 중요하며, 그 이유를 명확히 밝히는 것이 중요합니다. 모든 썸네일에 동일한 레이아웃을 재사용하는 채널에서는 시각 모델이 비교할 수 있는 것이 거의 없습니다. 만약 우리의 점수가 그런 채널에서 확신 있게 승자를 골랐다면, 패키징이 아니라 채널 정체성이나 업로드 시대를 읽고 있었을 것입니다. 이 채널에서는 48.7%, 나머지 채널에서는 61.0%를 기록했습니다. 이 차이는 우리가 측정하고자 하는 것이 우리가 주장하는 것이라는 가장 강력한 증거입니다.

어떤 점수 차원이 승자와 패자를 구분했나요?

이 부분은 확인보다 탐색적입니다. 이 샘플을 설명하며, 일반적인 YouTube를 설명하지는 않습니다. 12개 하위 점수를 두 그룹을 얼마나 멀리 분리했는지에 따라 순위 매기면, 가장 뚜렷한 분리는 약속 명확성에서 나왔고, 그 다음은 FOMO 신호와 긴급성입니다. 감정 강도는 거의 분리하지 못했습니다.

약속 명확성 — 패키징이 당신이 곧 볼 내용을 얼마나 명확하게 전달하는지 — 가 상위에 오는 것은 모델의 만족도 측면이 포착하려 했던 것과 일치합니다. 가장 약한 분리 요소가 원시 감정 강도인 것은 더 흥미로운 절반입니다: 이 샘플에서 썸네일의 강한 감정은 과성과와 저성과 영상을 구분하지 못했습니다. 이는 대부분의 썸네일 조언이 가정하는 것과 다릅니다.

당신의 패키징에 대해 이 차원들을 개별적으로 보고 싶다면, 이 연구에서 사용된 동일한 점수 매기기 파이프라인을 통해 썸네일과 제목을 테스트할 수 있습니다 — 데모 버전이 아니라 동일한 코드 경로입니다.

이 테스트가 증명하지 않는 것

네 가지 제한 사항 모두 데이터가 존재하기 전에 미리 작성되었습니다.

이 테스트는 점수를 테스트할 뿐 조언을 테스트하지 않습니다. 제안된 제목을 실제로 적용했을 때 실제 영상 성과가 향상되는지는 우리가 실행하지 않은 다른 실험입니다. 이는 인과관계가 아닌 관찰적입니다: 여기서는 썸네일을 바꾸면 조회수가 바뀐다는 것을 보여주지 않고, 점수가 이미 존재하는 차이와 연관되어 있다는 것만 보여줍니다.

샘플이 결과가 적용되는 대상을 결정합니다

쌍은 성과가 뚜렷하게 다른 경우에만 선택되었으므로, 59.5%는 그 인구집단 — 명백한 과성과 대 명백한 저성과 — 에 적용되며, 임의로 선택된 두 영상에 적용되지 않습니다. 모든 채널은 설립된 상태였고, 영어로 운영되었으며, 안정적인 기준선을 가질 만큼 충분히 컸습니다. 여기서의 결과는 12개 업로드만 있고 측정할 역사가 없는 채널에는 일반화되지 않습니다.

조회수는 단일 날짜에 캡처되었으며 계속 누적되고 있습니다. 전체적으로 이는 스냅샷이며, 스냅샷을 정직하게 다루는 방법은 나중에 또 다른 스냅샷을 찍는 것입니다.

자주 묻는 질문

썸네일 점수 정확도 59.5%는 좋은 수치인가요?

실제 결과에 대한 단일 패키징 신호로서는 그렇습니다. 조회수는 주로 주제, 시청자 규모, 시기, 알고리즘 운에 의해 좌우되므로, 썸네일과 제목 점수는 항상 일부만 설명할 수 있습니다. 90%에 가까운 수치는 더 나은 모델이 아니라 테스트 설계의 누출을 나타냅니다. 유용한 해석은 추측보다 낫고, 자신감이 클수록 더 확실하게 이긴다는 것입니다.

왜 썸네일 점수를 조회수와 직접 비교하지 않나요?

왜냐하면 그건 채널 규모를 측정하기 때문입니다. 구독자 수, 주제, 영상 연령이 패키징보다 훨씬 더 조회수에 영향을 미치며, 큰 채널은 더 나은 디자이너와 더 큰 시청자층을 모두 가질 경향이 있으므로, 상관관계는 썸네일과는 아무런 관련이 없는 이유로 양의 결과가 나옵니다. 동일 채널에서 나온 두 영상을 비교하면 이 모든 요소를 한 번에 제거할 수 있습니다.

동점은 실패로 처리한 것이 무엇을 의미하나요?

17개 쌍이 양쪽 모두 동일한 점수를 받았습니다. 이를 분할하거나 제거하는 대신, 각각을 실패로 기록했습니다. 점수가 두 입력을 구분할 수 없다면, 그들은 구분되지 않은 것이기 때문입니다. 이는 보고된 59.5%가 대안 처리 방식보다 낮게 나오도록 합니다.

더 높은 썸네일 점수는 더 많은 조회수를 의미하나요?

아니요. 이 연구는 많은 쌍 간의 연관성을 보여줄 뿐, 단일 영상에 대한 약속은 아닙니다. 약 40%의 쌍은 잘못된 순서로 순위 지정되었습니다. 패키징은 여러 레버 중 하나일 뿐이며, 아무도 보고 싶어하지 않는 영상에 높은 점수가 있어도 구원하지 못합니다.

60개 채널은 어떻게 선정했나요?

데이터 수집 전에 고정된 규칙에 따라: 오랜 업로드 이력을 가진 널리 알려진 채널, 6개 콘텐츠 카테고리 각각에서 10개씩, 썸네일에 대한 어떤 특성보다 카테고리 커버리지를 위해 선정되었습니다. 목록은 점수 매기기 시작 전에 고정되고 기록되었으므로, 결과가 나타나기 시작한 후에는 채널을 추가하거나 제거할 수 없습니다.

방법론을 직접 확인할 수 있나요?

전체 사전 등록 — 제외 조건, 매칭 규칙, 주요 테스트, 네 가지 통제 조건, 귀무 결과에 대한 사전 약속된 문구 — 는 영상 점수 매기기 전에 작성되고 타임스탬프가 찍혔습니다. 여기에서는 집계 결과만 보고되며, 기본 영상 데이터는 YouTube API 약관에 따라 재게시되지 않습니다.