Каждый совет по YouTube говорит: клик зарабатывает миниатюра. Мы создали инструмент для оценки обеих частей, а затем провели эксперимент, изолировав их — и оказалось, что заголовок несёт больше сигнала. Поменяв заголовки местами, мы не просто ослабили способность нашей оценки выбирать лучшее видео — мы инвертировали её.
Ключевые выводы
- Присвоение каждому видео заголовка соседнего видео в среднем сдвигало оценку на 11,3 балла из 100, с максимальным отклонением в 60 баллов.
- Только 3,9% миниатюр получили одинаковую оценку с другим заголовком — значит, заголовок не является погрешностью в модели.
- После замены оценка правильно выбирала лучшее видео в 42,7% случаев — ниже случайного уровня, что означает инверсию рейтинга, а не его деградацию.
- Чисто миниатюрная оценка осталась бы на уровне 59,5%; чисто заголовочная упала бы до 35,2%. Наблюдаемые 42,7% гораздо ближе к заголовку.
- Это не делает миниатюры бесполезными. Эксперимент изменял только заголовок, поэтому измерял его долю, а не напрямую говорил о вкладе изображения.
Что важнее на YouTube: заголовок или миниатюра?
Судя по результатам этого эксперимента, заголовок несёт больше сигнала, который разделяет видео, превзошедшие средний показатель канала, и те, что его не достигли. Это не тот ответ, который мы ожидали от инструмента, созданного в первую очередь для анализа миниатюр, и он появился в ходе контрольного теста, задуманного для проверки чего-то другого.
Это утверждение требует уточнения. Мы измеряем, что влияет на оценку, которая показала корреляцию с реальной эффективностью, — а не напрямую поведение зрителей. Кроме того, мы сравниваем упаковку внутри одного канала, где аудитория, тематика и бюджет на дизайн уже постоянны.
Тем не менее, направление ясно, а величина эффекта — несомненна.
Как мы изолировали вклад заголовка
Мы взяли 321 пару видео, каждая пара — с одного канала, опубликованная в среднем с разницей в шесть дней, одно явно превзошло средний показатель канала, другое — явно уступило. При обычной оценке наша модель правильно ранжировала их в 59,5% случаев против 50% при случайном выборе.
Затем мы пересчитали оценку каждой миниатюры — но с заголовком другого видео. Изображения были идентичны по байтам в обоих случаях. Ничто другое в цепочке не менялось. Поэтому каждый балл изменения оценки между первым и вторым чтением объясняется исключительно заголовком.
Два вопроса из одного эксперимента
Первый вопрос: влияет ли заголовок на оценку вообще? Инструмент, который заявляет, что оценивает и миниатюру, и заголовок, но почти не реагирует на замену заголовка, на самом деле оценивает только одну часть, а рекламирует две.
Второй вопрос острее: повторный запуск всего теста ранжирования на перемещённых входных данных показывает, какая часть несла дискриминацию. Три возможных результата были записаны заранее, вместе с их интерпретацией.
| Если оценка определяется | Ожидаемая точность после замены | Интерпретация |
|---|---|---|
| Только миниатюрой | 59,5% — без изменений | Замена заголовков не меняет ничего важного |
| Обеими частями поровну | Около 50% — случайность | Два вклада взаимно нейтрализуются |
| Только заголовком | 35,2% — полностью инвертировано | Инверсия заголовков инвертирует рейтинг |
| Что мы наблюдали | 42,7% | Доминирует заголовок, но не исключительно |
Что произошло, когда мы поменяли заголовки местами
Оценка сильно изменилась. Среднее абсолютное изменение — 11,3 балла по шкале 0–100, медиана — 8, 90-й перцентиль — 26, максимальный сдвиг — 60 баллов. Только 3,9% миниатюр получили одинаковую оценку с другим заголовком.
Для сравнения: средний сдвиг в 11,3 балла больше, чем типичный разрыв, который модель обычно ставит между двумя видео в паре. Изменение только заголовка может сдвинуть оценку сильнее, чем весь разрыв, который модель обычно видит между хитом и провалом канала.
Затем тест ранжирования. На перемещённых входных данных оценка выбрала лучшее видео в 137 из 321 пары — 42,7%, с 95%-м доверительным интервалом от 37,2% до 48,3% и p-значением 0,0101 против 50%. Это значительно ниже случайного уровня.
Почему инверсия не может быть артефактом измерения
Замена заголовка также нарушает соответствие между заголовком и изображением, а согласованность — один из двенадцати факторов, которые оценивает модель. Это реальная путаница, и её стоит прямо назвать, а не скрывать. Однако она не может объяснить этот результат.
Неупорядоченный штраф, применённый к обеим сторонам каждой пары, добавляет шум. Шум сдвигает точность к 50% — он заглушает сигнал, но не инвертирует его. Попадание на 42,7%, ниже как случайного уровня, так и 47,4% нижней границы, которую подразумевает обработка ничьих в этом тесте, требует, чтобы то, что указывало в одну сторону, было перевёрнуто. Именно это делает замена дискриминирующего признака, а шум несовпадения сам по себе этого не может вызвать.
Что заставило бы нас усомниться в выводе
Три результата поставили бы под сомнение это толкование — и ни один из них не произошёл:
- Оценки почти не меняются при новом заголовке — это означало бы, что модель игнорирует заголовок, а не учитывает его сильно.
- Точность после замены остаётся на уровне 59,5% или чуть ниже — это показало бы, что миниатюра сама по себе несёт рейтинг.
- Точность после замены точно на уровне 50% — это означало бы, что обе части вносят равный вклад и взаимно компенсируются.
Что это меняет в том, как вы пишете заголовок
Практический вывод: редактирование заголовка — самое дешёвое и эффективное изменение, доступное вам. Переделка миниатюры занимает час или дизайнера. Переписывание заголовка — две минуты, можно сделать после публикации, и — по этим данным — сдвигает сигнал упаковки как минимум так же сильно.
Это также переопределяет, для чего нужен заголовок. В разбивке по факторам из того же исследования, наиболее разделяющим перформеров и провалы был фактор ясности обещания: насколько однозначно упаковка говорит зрителю, что он увидит. Это в основном свойство заголовка. Сырая эмоциональная интенсивность — то, на чём фокусируется совет по миниатюрам — разделяла группы меньше всего.
Если вы хотите увидеть, как конкретная пара оценивается по всем двенадцати факторам, вы можете прогнать свой заголовок и миниатюру через ту же цепочку, что использовался в этом эксперименте и сравнить два варианта заголовка с одним изображением.
Где миниатюра всё ещё работает
Этот эксперимент изменял заголовок и оставлял изображение неизменным, что означает: он напрямую измерял долю заголовка, а долю миниатюры — только косвенно. Зеркальный эксперимент — замена миниатюр, заголовки не меняются — не проводился, и до тех пор, пока он не будет проведён, честная позиция — мы измерили одну часть правильно, а другую — вычитанием.
Также есть структурная причина не списывать миниатюры со счетов. То же исследование показало, что на каналах, использующих один и тот же шаблон миниатюры для всех загрузок, точность оценки падала до 48,7% против 61,0% в других случаях. Когда миниатюры перестают варьироваться, модель перестаёт различать — что является доказательством того, что изображение что-то делает, а не ничего.
Что мы не тестировали
Эксперимент показывает, что наша оценка сильнее реагирует на заголовки, чем на изображения, и что оценка отслеживает реальную эффективность. Он не показывает, что решение зрителя кликнуть определяется больше заголовком, чем миниатюрой. Это смежные утверждения, и здесь подтверждено только первое.
Каждая пара взята с устоявшегося англоязычного канала с достаточной историей загрузок для вычисления стабильного базового уровня. Заголовки на других языках и каналы, слишком новые для базового уровня, выходят за рамки того, о чём может говорить эта выборка. Здесь ничего не сказано о том, что применение предложенного заголовка улучшает реальное видео — это другой эксперимент, и он ещё не проведён.
Часто задаваемые вопросы
Что важнее на YouTube: заголовок или миниатюра?
В этом эксперименте заголовок несёт больше сигнала, который различает перформеры и провалы внутри одного канала. Замена заголовков между парами видео инвертировала рейтинг, а не просто ослабила его — именно так ведёт себя инверсия признака, который реально работает. Это измеряет поведение оценки, а не психологии зрителей напрямую.
Насколько изменение заголовка меняет оценку миниатюры?
В среднем на 11,3 балла по шкале 0–100, медиана — 8, максимальный наблюдаемый сдвиг — 60. Только 3,9% изображений получили одинаковую оценку с другим заголовком. Само изображение было идентично по байтам в обоих чтениях, поэтому каждый балл этого сдвига объясняется заголовком.
Стоит ли менять заголовок после публикации видео?
Это самое дешёвое изменение упаковки, и эти данные показывают, что оно не является второстепенным. Заголовок можно переписать за минуты, не переделывая ничего, и он сдвигает оценку упаковки как минимум так же сильно, как и изображение. Сравните два-три варианта, а не предполагайте, что первый — лучший.
Почему замена заголовков сделала оценку хуже случайной?
Потому что заголовки несли информацию о том, какое видео показало лучший результат. Присвоение каждому видео заголовка соседнего видео инвертировало эту информацию, а не удалило её, поэтому рейтинг инвертировался. Случайный шум сдвинул бы точность к 50%; падение ниже 50% требует реального сигнала, указывающего в неправильную сторону.
Значит ли это, что миниатюры не важны?
Нет. Эксперимент менял только заголовки, поэтому измерял их вклад напрямую, а вклад изображения — только косвенно. Отдельно, на каналах, где каждая миниатюра использует один фиксированный шаблон, точность оценки падала до случайного уровня — доказательство того, что когда изображение перестаёт варьироваться, модель теряет что-то реальное.
Что делает заголовок с высоким баллом по ясности обещания?
Ясность обещания измеряет, насколько однозначно упаковка говорит зрителю, что он увидит. Заголовки, называющие конкретную тему и соответствующие изображению, набирают больше баллов, чем заголовки, построенные на расплывчатой интриге. В ходе исследования это был фактор, который наиболее разделял перформеры и провалы.