исследованиезаголовкиминиатюры

Заголовок YouTube или миниатюра: что важнее?

Мы поменяли заголовки местами у 321 пары видео и пересчитали оценки миниатюр. Рейтинг не просто ухудшился — он инвертировался, что доказывает: заголовок несёт больше сигнала.

September 4, 20268 min read
Заголовок YouTube или миниатюра: что важнее?

Каждый совет по YouTube говорит: клик зарабатывает миниатюра. Мы создали инструмент для оценки обеих частей, а затем провели эксперимент, изолировав их — и оказалось, что заголовок несёт больше сигнала. Поменяв заголовки местами, мы не просто ослабили способность нашей оценки выбирать лучшее видео — мы инвертировали её.

Ключевые выводы

  • Присвоение каждому видео заголовка соседнего видео в среднем сдвигало оценку на 11,3 балла из 100, с максимальным отклонением в 60 баллов.
  • Только 3,9% миниатюр получили одинаковую оценку с другим заголовком — значит, заголовок не является погрешностью в модели.
  • После замены оценка правильно выбирала лучшее видео в 42,7% случаев — ниже случайного уровня, что означает инверсию рейтинга, а не его деградацию.
  • Чисто миниатюрная оценка осталась бы на уровне 59,5%; чисто заголовочная упала бы до 35,2%. Наблюдаемые 42,7% гораздо ближе к заголовку.
  • Это не делает миниатюры бесполезными. Эксперимент изменял только заголовок, поэтому измерял его долю, а не напрямую говорил о вкладе изображения.

Что важнее на YouTube: заголовок или миниатюра?

Судя по результатам этого эксперимента, заголовок несёт больше сигнала, который разделяет видео, превзошедшие средний показатель канала, и те, что его не достигли. Это не тот ответ, который мы ожидали от инструмента, созданного в первую очередь для анализа миниатюр, и он появился в ходе контрольного теста, задуманного для проверки чего-то другого.

Это утверждение требует уточнения. Мы измеряем, что влияет на оценку, которая показала корреляцию с реальной эффективностью, — а не напрямую поведение зрителей. Кроме того, мы сравниваем упаковку внутри одного канала, где аудитория, тематика и бюджет на дизайн уже постоянны.

Тем не менее, направление ясно, а величина эффекта — несомненна.

Как мы изолировали вклад заголовка

Мы взяли 321 пару видео, каждая пара — с одного канала, опубликованная в среднем с разницей в шесть дней, одно явно превзошло средний показатель канала, другое — явно уступило. При обычной оценке наша модель правильно ранжировала их в 59,5% случаев против 50% при случайном выборе.

Затем мы пересчитали оценку каждой миниатюры — но с заголовком другого видео. Изображения были идентичны по байтам в обоих случаях. Ничто другое в цепочке не менялось. Поэтому каждый балл изменения оценки между первым и вторым чтением объясняется исключительно заголовком.

Два вопроса из одного эксперимента

Первый вопрос: влияет ли заголовок на оценку вообще? Инструмент, который заявляет, что оценивает и миниатюру, и заголовок, но почти не реагирует на замену заголовка, на самом деле оценивает только одну часть, а рекламирует две.

Второй вопрос острее: повторный запуск всего теста ранжирования на перемещённых входных данных показывает, какая часть несла дискриминацию. Три возможных результата были записаны заранее, вместе с их интерпретацией.

Если оценка определяетсяОжидаемая точность после заменыИнтерпретация
Только миниатюрой59,5% — без измененийЗамена заголовков не меняет ничего важного
Обеими частями поровнуОколо 50% — случайностьДва вклада взаимно нейтрализуются
Только заголовком35,2% — полностью инвертированоИнверсия заголовков инвертирует рейтинг
Что мы наблюдали42,7%Доминирует заголовок, но не исключительно

Что произошло, когда мы поменяли заголовки местами

Оценка сильно изменилась. Среднее абсолютное изменение — 11,3 балла по шкале 0–100, медиана — 8, 90-й перцентиль — 26, максимальный сдвиг — 60 баллов. Только 3,9% миниатюр получили одинаковую оценку с другим заголовком.

Для сравнения: средний сдвиг в 11,3 балла больше, чем типичный разрыв, который модель обычно ставит между двумя видео в паре. Изменение только заголовка может сдвинуть оценку сильнее, чем весь разрыв, который модель обычно видит между хитом и провалом канала.

Затем тест ранжирования. На перемещённых входных данных оценка выбрала лучшее видео в 137 из 321 пары — 42,7%, с 95%-м доверительным интервалом от 37,2% до 48,3% и p-значением 0,0101 против 50%. Это значительно ниже случайного уровня.

Почему инверсия не может быть артефактом измерения

Замена заголовка также нарушает соответствие между заголовком и изображением, а согласованность — один из двенадцати факторов, которые оценивает модель. Это реальная путаница, и её стоит прямо назвать, а не скрывать. Однако она не может объяснить этот результат.

Неупорядоченный штраф, применённый к обеим сторонам каждой пары, добавляет шум. Шум сдвигает точность к 50% — он заглушает сигнал, но не инвертирует его. Попадание на 42,7%, ниже как случайного уровня, так и 47,4% нижней границы, которую подразумевает обработка ничьих в этом тесте, требует, чтобы то, что указывало в одну сторону, было перевёрнуто. Именно это делает замена дискриминирующего признака, а шум несовпадения сам по себе этого не может вызвать.

Что заставило бы нас усомниться в выводе

Три результата поставили бы под сомнение это толкование — и ни один из них не произошёл:

  1. Оценки почти не меняются при новом заголовке — это означало бы, что модель игнорирует заголовок, а не учитывает его сильно.
  2. Точность после замены остаётся на уровне 59,5% или чуть ниже — это показало бы, что миниатюра сама по себе несёт рейтинг.
  3. Точность после замены точно на уровне 50% — это означало бы, что обе части вносят равный вклад и взаимно компенсируются.

Что это меняет в том, как вы пишете заголовок

Практический вывод: редактирование заголовка — самое дешёвое и эффективное изменение, доступное вам. Переделка миниатюры занимает час или дизайнера. Переписывание заголовка — две минуты, можно сделать после публикации, и — по этим данным — сдвигает сигнал упаковки как минимум так же сильно.

Это также переопределяет, для чего нужен заголовок. В разбивке по факторам из того же исследования, наиболее разделяющим перформеров и провалы был фактор ясности обещания: насколько однозначно упаковка говорит зрителю, что он увидит. Это в основном свойство заголовка. Сырая эмоциональная интенсивность — то, на чём фокусируется совет по миниатюрам — разделяла группы меньше всего.

Если вы хотите увидеть, как конкретная пара оценивается по всем двенадцати факторам, вы можете прогнать свой заголовок и миниатюру через ту же цепочку, что использовался в этом эксперименте и сравнить два варианта заголовка с одним изображением.

Где миниатюра всё ещё работает

Этот эксперимент изменял заголовок и оставлял изображение неизменным, что означает: он напрямую измерял долю заголовка, а долю миниатюры — только косвенно. Зеркальный эксперимент — замена миниатюр, заголовки не меняются — не проводился, и до тех пор, пока он не будет проведён, честная позиция — мы измерили одну часть правильно, а другую — вычитанием.

Также есть структурная причина не списывать миниатюры со счетов. То же исследование показало, что на каналах, использующих один и тот же шаблон миниатюры для всех загрузок, точность оценки падала до 48,7% против 61,0% в других случаях. Когда миниатюры перестают варьироваться, модель перестаёт различать — что является доказательством того, что изображение что-то делает, а не ничего.

Что мы не тестировали

Эксперимент показывает, что наша оценка сильнее реагирует на заголовки, чем на изображения, и что оценка отслеживает реальную эффективность. Он не показывает, что решение зрителя кликнуть определяется больше заголовком, чем миниатюрой. Это смежные утверждения, и здесь подтверждено только первое.

Каждая пара взята с устоявшегося англоязычного канала с достаточной историей загрузок для вычисления стабильного базового уровня. Заголовки на других языках и каналы, слишком новые для базового уровня, выходят за рамки того, о чём может говорить эта выборка. Здесь ничего не сказано о том, что применение предложенного заголовка улучшает реальное видео — это другой эксперимент, и он ещё не проведён.

Часто задаваемые вопросы

Что важнее на YouTube: заголовок или миниатюра?

В этом эксперименте заголовок несёт больше сигнала, который различает перформеры и провалы внутри одного канала. Замена заголовков между парами видео инвертировала рейтинг, а не просто ослабила его — именно так ведёт себя инверсия признака, который реально работает. Это измеряет поведение оценки, а не психологии зрителей напрямую.

Насколько изменение заголовка меняет оценку миниатюры?

В среднем на 11,3 балла по шкале 0–100, медиана — 8, максимальный наблюдаемый сдвиг — 60. Только 3,9% изображений получили одинаковую оценку с другим заголовком. Само изображение было идентично по байтам в обоих чтениях, поэтому каждый балл этого сдвига объясняется заголовком.

Стоит ли менять заголовок после публикации видео?

Это самое дешёвое изменение упаковки, и эти данные показывают, что оно не является второстепенным. Заголовок можно переписать за минуты, не переделывая ничего, и он сдвигает оценку упаковки как минимум так же сильно, как и изображение. Сравните два-три варианта, а не предполагайте, что первый — лучший.

Почему замена заголовков сделала оценку хуже случайной?

Потому что заголовки несли информацию о том, какое видео показало лучший результат. Присвоение каждому видео заголовка соседнего видео инвертировало эту информацию, а не удалило её, поэтому рейтинг инвертировался. Случайный шум сдвинул бы точность к 50%; падение ниже 50% требует реального сигнала, указывающего в неправильную сторону.

Значит ли это, что миниатюры не важны?

Нет. Эксперимент менял только заголовки, поэтому измерял их вклад напрямую, а вклад изображения — только косвенно. Отдельно, на каналах, где каждая миниатюра использует один фиксированный шаблон, точность оценки падала до случайного уровня — доказательство того, что когда изображение перестаёт варьироваться, модель теряет что-то реальное.

Что делает заголовок с высоким баллом по ясности обещания?

Ясность обещания измеряет, насколько однозначно упаковка говорит зрителю, что он увидит. Заголовки, называющие конкретную тему и соответствующие изображению, набирают больше баллов, чем заголовки, построенные на расплывчатой интриге. В ходе исследования это был фактор, который наиболее разделял перформеры и провалы.