исследованиепревьюаналитика YouTube

Мы протестировали наш рейтинг превью на 321 реальном видео

Предварительно зарегистрированный тест: отслеживает ли рейтинг превью и заголовка реальную эффективность. 321 пара видео с одного канала, четыре контроля и результат, который мы обязались опубликовать в любом случае.

September 4, 20269 min read
Мы протестировали наш рейтинг превью на 321 реальном видео

Рейтинг превью имеет ценность только в том случае, если он отражает реальные события на YouTube. Поэтому мы провели тест, который мог бы нас смутить: 321 пара реальных видео с одного канала — одно превзошло средний показатель канала, другое — нет. Мы зафиксировали методику до того, как посмотрели на данные. Рейтинг правильно выбрал более успешное видео в 59,5% случаев против 50% при случайном выборе.

Ключевые выводы

  • Среди 321 пары рейтинг правильно определил более успешное видео в 59,5% случаев (p = 0,00079). Шанс — 50%.
  • Сравнение видео с разных каналов измеряет количество подписчиков, а не упаковку — каждая пара здесь взята с одного канала, опубликована в среднем с разницей в шесть дней.
  • На каналах, где все превью следуют одному шаблону, точность упала до 48,7%. Это именно тот результат, который мы хотели: нет различий для анализа, нет сигнала для обнаружения.
  • Четыре простых эвристики — более длинный заголовок, больше слов, больший размер файла, более высокий контраст — все оказались на уровне случайного выбора. Рейтинг не является прокси для них.
  • Чем больше разница, которую модель ставила между двумя видео, тем чаще она была права: 56% при разнице 1–3 балла, 76,5% при 15 баллах и выше.

Действительно ли рейтинг превью YouTube предсказывает эффективность?

В этом тесте — да, скромно и измеримо. При выборе между двумя видео с одного канала, одно из которых явно превзошло собственный базовый показатель, а другое — явно уступило, наш рейтинг правильно их расставил в 59,5% случаев. Шанс — 50%. 95%-ный доверительный интервал — от 53,9% до 64,9%, так что эффект реален, но небольшой.

«Небольшой» — честный ответ, и любой, кто утверждает большее, что-то продает. Упаковка — лишь один из многих факторов. Тема, время публикации, настроение алгоритма на этой неделе, попала ли видео куда-то вне платформы — всё это влияет на просмотры сильнее, чем превью. Рейтинг, утверждающий 90% точности, описывал бы YouTube, которого не существует.

Что означает 59,5% на практике: если вы выбираете между двумя вариантами для одного видео, рейтинг лучше, чем случайный выбор, и полезнее, когда он явно предпочитает один вариант.

Почему сравнение превью с разных каналов ничего не показывает

Очевидная версия этого теста — оценить пачку превью и сопоставить оценки с количеством просмотров. Это измеряет размер канала. Просмотры определяются количеством подписчиков, темой и возрастом видео гораздо сильнее, чем упаковкой, и смещение работает в лестную сторону: крупные каналы могут позволить себе хороших дизайнеров и имеют большую аудиторию.

Проведите такой тест — и вы получите приятную положительную корреляцию, которая ничего не значит. Она выдержит ровно одного скептически настроенного читателя.

Что должно оставаться неизменным в честном сравнении

Сравнение двух видео с одного канала устраняет количество подписчиков, аудиторию, бюджет и компетенцию дизайнеров за один шаг, поскольку все четыре параметра идентичны в паре. Требование публикации в близкие сроки устраняет траекторию роста канала и режим алгоритма за этот период.

Остается вопрос с известным ответом при нулевой гипотезе: при двух видео, которые аудитория канала восприняла по-разному, может ли рейтинг определить, какое из них какое?

Как мы построили честный тест на 321 паре

Мы взяли 60 каналов из шести категорий — технологии, образование, кулинария, гейминг, фитнес и образ жизни — и извлекли до 300 недавних загрузок с каждого. После исключений осталось 17 250 рассмотренных видео и 321 полезная пара. Каждая пара — с одного канала, опубликована в среднем с разницей в шесть дней, при этом более успешное видео превзошло менее успешное в среднем в 4,7 раза.

Эффективность измеряется относительно скользящего локального базового показателя, а не среднего по каналу. Для каждого видео мы берем медианное количество просмотров его десяти соседних загрузок с каждой стороны, исключая само видео, и выражаем его просмотры как кратное этого значения. Канал, выросший в пять раз за два года, иначе бы пометил каждое раннее видео как провал, а каждое недавнее — как хит — измеряя календарь, а не упаковку.

Правила пары были зафиксированы заранее:

  1. Оба видео с одного канала, и каждое видео входит максимум в одну пару.
  2. Они были опубликованы в течение 120 дней друг от друга.
  3. Более успешное видео превзошло менее успешное как минимум в два раза, чтобы «лучше» и «хуже» означали нечто, а не описывали шум.
  4. Ни один канал не вносит более восьми пар, чтобы один продуктивный загрузчик не доминировал в выборке.

Шорты были исключены, как и стримы, видео младше 45 дней и старше двух лет. Рейтинг видел только превью и заголовок — ровно то, что инструмент получает от пользователя — и ничего о количестве просмотров или о том, какая сторона пары перед ним.

Что рейтинг определил правильно и как часто

Модель выбрала более успешное видео в 191 из 321 пары: 59,5%, с точным биномиальным p-значением 0,00079 против нулевой гипотезы 50%. Семнадцать пар вернулись как точные ничьи, и каждая из них была учтена как провал, а не разделена или исключена, поскольку рейтинг, не способный различить два входа, не разделил их.

Учет ничьих как провалов делает итоговое число консервативным. Модель, не обладающая никакой способностью, набрала бы около 47,4% по этому правилу, а не 50%, поэтому тест требовал от нашей модели преодолеть планку немного выше реального уровня случайности. Среди 304 пар, которые она действительно разделила, она была права в 62,8% случаев.

Уверенность коррелировала с правильностью

Шаблон, делающий результат похожим на измерение, а не на случайность: чем дальше модель ставила два видео друг от друга, тем чаще она была права.

При разнице в 1–3 балла точность составила 56,0%. При 4–7 баллах — 64,1%. При 8–14 баллах — 63,2%. При 15 баллах и выше — 76,5%. Модель, производящая шум, показала бы плоскую линию по этим категориям. Эта модель становится все лучше по мере роста уверенности — именно такое поведение вы хотите, и его нельзя подделать.

Четыре проверки, которые могли бы доказать нашу ошибку

Исследование, которое не может провалиться, не является доказательством. Мы заранее определили четыре контроля, каждый из которых мог бы опровергнуть основной вывод, и обязались опубликовать все четыре, независимо от результатов. Все они ведут себя так, как и должны.

КонтрольЧто означал бы провалРезультат
Перемешать метки победителя/проигравшего 1000 разПайплайн утечка ответа; весь результат недействителен47,1%, ровно там, где теория говорит, что он должен быть
Каналы, чьи превью следуют одному фиксированному шаблонуРейтинг читает что-то, кроме упаковки48,7% — случайность, как и предсказано
Тривиальные эвристики: длина заголовка, количество слов, размер файла, контрастОднострочное правило соответствует модели, поэтому модель ничего не добавляет46,7%–54,5%, ни одно не значимо
Переоценить каждое превью против заголовка другого видеоЗаголовок не вносит вклада, и мы оцениваем одну половину, а не двеРейтинг изменился в среднем на 11,3 балла

Проверка шаблона — самая важная, и стоит ясно объяснить, почему. На каналах, которые используют один и тот же макет превью для всего, визуальной модели почти нечего сравнивать. Если бы наш рейтинг уверенно выбирал победителей там, он бы читал идентичность канала или эпоху загрузки, а не упаковку. Он набрал 48,7% на этих каналах и 61,0% везде else. Эта разница — самое сильное доказательство в исследовании, что измеряется именно то, что мы утверждаем.

Какие измерения рейтинга разделяли победителей и проигравших

Эта часть носит исследовательский, а не подтверждающий характер и описывает эту выборку, а не YouTube в целом. Ранжируя двенадцать подрейтингов по тому, насколько далеко они разделяли две группы, наиболее четкое разделение дало ясность обещания, за ним — сигнал страха упустить и срочность. Эмоциональная интенсивность почти не разделяла их.

Ясность обещания — насколько однозначно упаковка говорит вам, что вы собираетесь посмотреть — ведет таблицу, что соответствует тому, что была построена для захвата удовлетворенности. Наиболее интересная половина — слабейший разделитель: сырая эмоциональная интенсивность — сильные чувства на превью не различали перформеров от неперформеров в этой выборке, что противоречит большинству советов по превью.

Если вы хотите увидеть эти измерения на своей собственной упаковке, а не в агрегате, вы можете пропустить превью и заголовок через ту же систему оценки, что использовалось в этом исследовании — это тот же код, а не демоверсия.

Что этот тест не доказывает

Четыре ограничения, все из которых были записаны до существования данных.

Он тестирует рейтинг, а не совет. Улучшает ли выполнение предложенного заголовка реальное видео — другой эксперимент, который мы не проводили. Это наблюдательное, а не причинно-следственное: здесь ничего не показывает, что изменение превью изменяет просмотры, только что рейтинг связан с уже существующей разницей.

Выборка определяет, к кому применим результат

Пары были выбраны именно потому, что они резко различались по эффективности, поэтому 59,5% описывает эту популяцию — явные перформеры против явных неперформеров — а не любые два видео, выбранные случайным образом. Каждый канал был устоявшимся, на английском языке и достаточно крупным, чтобы иметь стабильный базовый показатель. Ничто здесь не обобщается на канал с двенадцатью загрузками и без истории для измерения.

Количество просмотров было зафиксировано на одну дату и продолжает расти. Всё это — снимок, и честный способ обращения с ним — сделать еще один позже.

Часто задаваемые вопросы

Является ли 59,5% точности хорошим показателем для рейтинга превью?

Для одного сигнала упаковки против реальных результатов — да. Просмотры в основном зависят от темы, размера аудитории, времени и алгоритмической удачи, поэтому рейтинг превью и заголовка может объяснить лишь часть. Число, близкое к 90%, указывало бы на утечку в дизайне теста, а не на лучшую модель. Полезная формулировка: он лучше, чем случайный выбор, и тем лучше, чем увереннее он.

Почему бы просто не сравнить рейтинги превью с количеством просмотров напрямую?

Потому что это измеряет размер канала. Количество подписчиков, тема и возраст видео влияют на просмотры гораздо сильнее, чем упаковка, и крупные каналы, как правило, имеют как лучших дизайнеров, так и большую аудиторию — поэтому корреляция получается положительной по причинам, не имеющим отношения к превью. Сравнение двух видео с одного канала устраняет все это за один шаг.

Что означает, что ничьи считались провалами?

Семнадцать пар получили одинаковые оценки с обеих сторон. Вместо того чтобы делить их или удалять, что оба варианта льстили бы результату, каждая была записана как промах. Рейтинг, не способный различить два входа, не разделил их. Это делает заявленные 59,5% ниже, чем получили бы альтернативные подходы.

Означает ли более высокий рейтинг превью больше просмотров?

Нет. Исследование показывает ассоциацию по многим парам, а не обещание по любому отдельному видео. Примерно четыре из десяти пар были расставлены неправильно. Упаковка — один из нескольких рычагов, и сильный рейтинг на видео, которое никто не хочет смотреть, не спасет его.

Как были выбраны 60 каналов?

По правилу, зафиксированному до сбора данных: широко известные каналы с долгой историей загрузок, по десять в каждой из шести категорий контента, отобранные для охвата категорий, а не по чему-либо, связанному с их превью. Список был заморожен и зафиксирован до начала оценки, чтобы ни один канал не мог быть добавлен или удален после появления результатов.

Могу ли я увидеть методологию и проверить ее самостоятельно?

Полная предварительная регистрация — исключения, правила пар, основной тест, все четыре контроля и формулировка, зафиксированная заранее для нулевого результата — была написана и временно отмечена до оценки любого видео. Агрегированные результаты представлены здесь; исходные данные видео не публикуются повторно в соответствии с условиями API YouTube.