После тестирования нашей оценки миниатюр на 321 паре реальных видео мы попытались сделать её точнее. Мы попробовали четыре подхода. Один из них изменил цифру, и при детальном анализе оказалось, что это более честное измерение, а не улучшенная модель. Остальные три не дали эффекта или сделали оценку менее надёжной. Ниже — каждый из них с цифрами.
Ключевые выводы
- Сравнение оценок с полной точностью, а не как округлённых целых чисел, повысило измеренную точность с 59,5% до 62,0%. Весь прирост пришёлся на 17 бывших ничьих, которые разрешились примерно поровну.
- Переписанные инструкции по оценке выглядели как прорыв на 30 миниатюрах, но ничего не изменили на 322: 64,6% до и 63,4% после, на 161 паре.
- Запрос к ИИ сравнить две миниатюры напрямую дал в среднем тот же результат, что и обычная оценка — 62,7% каждая, но ответ зависел от того, какая миниатюра показывалась первой.
- Настройка «обоснования» модели не изменила ничего, кроме самого высокого уровня, который никогда не возвращал ответ в европейском регионе, который мы используем для хранения загрузок в ЕС.
- Опубликованный, предварительно зарегистрированный результат остаётся на уровне 59,5%. Всё, что здесь описано, — это последующая работа, и она помечена как таковая.
Можно ли повысить точность оценки миниатюры после её тестирования?
В нашем случае — не так просто. Из четырёх изменений, протестированных на реальных видео, одно повысило измеренную точность — с 59,5% до 62,0% — за счёт исправления способа сравнения оценок, а не за счёт того, что модель стала видеть что-то новое. Остальные три не изменили точность. Похоже, оценка близка к тому, на что способна эта модель.
Это менее захватывающий ответ, чем новый рекорд, но более полезный. Он показывает, куда не стоит вкладывать усилия, и объясняет, почему каждая заманчивая идея провалилась. Это важно не только для этой оценки — те же ловушки подстерегают создателей, тестирующих свои собственные миниатюры.
Работающее исправление: перестать округлять перед сравнением
Оценка, которую вы видите, — целое число от 0 до 100. В нашем первоначальном тесте две миниатюры в паре иногда получали одинаковое целое число — это произошло 17 раз из 321 пары. Наши предварительно зарегистрированные правила считали каждую ничью провалом, поскольку оценка, не способная различить два видео, не смогла их разделить.
За целым числом стоит точное значение, и округление убирает разницу. Сравнение точных значений устраняет все ничьи, и измеренная точность растёт с 59,5% до 62,0%: 199 из 321 пар вместо 191. Ни одно видео не было переоценено, и веса не менялись — точное значение уже существовало.
Почему это более честное число, а не лучшая модель
Очевидный вопрос: как разрешились эти 17 ничьих? Если бы модель тихо угадывала их правильно, округление скрывало бы реальный навык. Но этого не было. Восемь из 17 ничьих достались лучшему видео, а девять — нет, что примерно соответствует результату подбрасывания монетки.
Таким образом, прирост происходит за счёт того, что мы больше не считаем монетку автоматическим провалом, а не за счёт того, что модель знает больше. Именно поэтому опубликованный результат остаётся на уровне 59,5%: это цифра, которую мы заранее зафиксировали по правилам, написанным до того, как увидели какие-либо данные. 62,0% публикуются как последующее измерение, чётко помеченное, и описывают ту же самую модель.
Настройка инструкций: небольшой пилот, который выглядел как прорыв
Оценки модели скучиваются. Несколько из двенадцати факторов, на которых основана оценка, находились в узких диапазонах по сотням реальных миниатюр, и наш первоначальный тест показал, что оценка наиболее надёжна, когда она ставит два видео далеко друг от друга. Поэтому мы переписали инструкции, чтобы дать шкале точку отсчёта: 50 — типичное видео в том же потоке, 90 и выше — для лучших 10%.
На пилоте из 30 миниатюр, оценённых по обеим версиям, казалось, что это сработало. Восемь из двенадцати факторов разошлись, и два из них почти удвоили свой разброс. Затем мы применили новые инструкции к 322 миниатюрам. Два фактора, которые почти удвоили разброс, выросли всего на 1,1 и 0,1 пункта. На 161 паре оригинальные инструкции выбрали лучшее видео в 64,6% случаев, а новые — в 63,4%, разница хорошо укладывается в пределы случайности. Новая версия также снизила почти все оценки на пять-семь пунктов, так что каждому создателю это стоило бы нескольких пунктов оценки ни за что.
Почему больший разброс не означал большей точности
Пилот был просто слишком мал. С 30 миниатюрами мера разброса оценок сильно колеблется случайно, и удвоение двух факторов укладывалось в эти колебания. Пилот следовало рассматривать как повод провести более крупный тест, а не как результат.
Более крупный тест дал второй урок. Два фактора — любопытство и риск кликбейта — действительно разошлись по 322 миниатюрам, но ранжирование всё равно не улучшилось. Более широкие оценки помогают только если дополнительная ширина отражает реальные различия между видео. Здесь она отражала шум, а шум, выглядящий как уверенность, хуже, чем его отсутствие.
Сравнение миниатюр напрямую вместо их оценки
Оценка каждой миниатюры по отдельности, а затем сравнение чисел — не то, как люди выбирают между миниатюрами; они смотрят на две миниатюры рядом. Поэтому мы попросили модель сделать то же самое: показав оба видео из пары, какое из них показало лучший результат? Каждая из 161 пар показывалась дважды — в каждом порядке.
В среднем по обоим порядкам прямой судья был прав в 62,7% случаев, точно совпадая с обычной оценкой на тех же 150 полностью ответивших парах. Но он выбирал ту миниатюру, которую видел первой, в 64,7% случаев, и почти в трети пар давал противоположные ответы в зависимости только от порядка. Равная точность при гораздо меньшей стабильности означала, что этот подход не был принят. Полные результаты — в нашем отдельном отчёте о том, как просить ИИ сравнивать миниатюры.
Включение режима обоснования модели
Модель предлагает настройку, которая заставляет её решать задачу пошагово перед ответом, на нескольких уровнях усилий. На трёх нижних уровнях полный анализ тестовой миниатюры возвращал те же двенадцать оценок, что и при выключенном режиме. Только самый высокий уровень хоть как-то изменил поведение модели.
В европейском дата-центре, который мы используем, чтобы загруженные миниатюры никогда не обрабатывались за пределами ЕС, этот самый высокий уровень никогда не возвращал ответ, даже при повторных попытках, длившихся до трёх минут. Мы подтвердили, что он работает в американском регионе, используя вымышленный арифметический вопрос без миниатюр, и обнаружили, что он пишет своё обоснование простым текстом перед ответом, а не хранит его отдельно. Перенос загрузок в США, чтобы выяснить, помогает ли это, — это компромисс, на который мы не готовы пойти.
Четыре результата рядом
Каждое изменение сравнивалось с оригиналом на тех же парах, поэтому каждая разница ниже — «яблоко с яблоком».
| Изменение | Что оно сделало с точностью ранжирования | Оставлено? |
|---|---|---|
| Сравнение неокруглённых оценок | 59,5% до 62,0% на 321 паре, полностью за счёт бывших ничьих, разрешившихся примерно поровну | Да, как более честное измерение |
| Калиброванные инструкции по оценке | 64,6% до 63,4% на 161 паре, никакой заметной разницы | Нет |
| Прямое сравнение миниатюр | 62,7% против 62,7% на 150 парах, с ответами, зависящими от порядка | Нет |
| Режим обоснования модели | Никаких изменений на уровнях, которые работали; самый высокий никогда не отвечал в нашем регионе | Нет |
Все цифры здесь получены из той же системы оценки, которая работает, когда вы анализируете миниатюру и заголовок. Тесты оценивали реальные видео через сам продукт, а не через отдельную исследовательскую копию.
Как мы сохранили честность этих последующих тестов
Последующие эксперименты — это то место, где исследования обычно идут не так, потому что исследователь уже знает, какой ответ он хотел бы получить. Пять правил помогли избежать этого:
- Опубликованный результат никогда не менялся. Предварительно зарегистрированные 59,5% остаются заголовком, и каждый последующий анализ помечается как последующая работа.
- Каналы были разделены пополам до того, как было протестировано какое-либо изменение. Эксперименты использовали одну половину, а другая была оставлена для финальной проверки.
- Каждое изменение сравнивалось с оригиналом на тех же парах, учитывая только пары, где они расходились, — это гораздо чувствительнее, чем сравнение двух общих процентов.
- Небольшой пилот рассматривался как повод провести более крупный тест, никогда не как результат сам по себе.
- Каждое прямое сравнение показывалось в обоих порядках, чтобы предпочтение позиции не могло сойти за навык.
Ни одно из этих правил не требует степени по статистике, и большинство напрямую применимо к создателю, тестирующему свои собственные миниатюры: решите, что считается победой, прежде чем смотреть, сравнивайте «яблоко с яблоком» и рассматривайте небольшой ранний результат как повод продолжать тестирование.
Ограничения этих последующих результатов
Все четыре эксперимента использовали те же самые устоявшиеся каналы на английском языке, что и оригинальный тест, и одну модель. Идеи были выбраны после того, как был известен оригинальный результат — именно в такой ситуации результаты обычно выглядят лучше, чем есть на самом деле, и ещё одна причина, почему заголовок остаётся на предварительно зарегистрированной цифре.
Каждое изменение пробовалось один раз, в одной форме. Другая формулировка инструкций могла бы сработать лучше, а результат режима обоснования описывает то, что было доступно в одном регионе в сентябре 2026 года. Ни один из этих результатов не говорит, что оценку нельзя улучшить; они говорят, что эти четыре пути не улучшили её.
Часто задаваемые вопросы
Почему не сообщать 62,0% как точность?
Потому что правила теста были зафиксированы до того, как существовали какие-либо данные, и они считали ничьи провалами. Изменение правила после просмотра результатов — это именно то, что предварительная регистрация призвана предотвратить, даже если изменение разумно. 62,0% публикуются как чётко помеченное последующее измерение, рядом с 59,5%, которые они не заменяют.
Смог бы более умный ИИ сделать оценку точнее?
Возможно, но это был бы новый эксперимент. Настройка обоснования нашей текущей модели не помогла в регионе, который мы используем, и другая модель потребовала бы тестирования на тех же парах, тем же способом, прежде чем можно было бы что-либо утверждать. Новое не означает автоматически лучшее для этой конкретной задачи.
Почему тест на 30 миниатюрах выглядел так убедительно?
Малые выборки дают большие колебания случайно, а большие колебания выглядят как открытие. С 30 миниатюрами удвоение разброса двух факторов укладывалось в нормальную вариацию; на 322 миниатюрах эффект почти исчез. Это та же ловушка, что и оценка нового стиля миниатюры по двум загрузкам.
Что это значит для тестирования моих собственных миниатюр?
Те же правила применимы. Решите, что считается успехом, прежде чем смотреть, сравнивайте с нормальным диапазоном вашего канала, а не с одним предыдущим видео, проводите достаточно примеров, чтобы случай не мог объяснить результат, и если вы просите любой инструмент сравнить два варианта, проверьте, выживает ли его ответ при их перестановке.
Стоит ли продолжать использовать оценку, если эти улучшения не сработали?
Оценка была протестирована на реальных результатах и превзошла случайность с явным отрывом. Эти последующие тесты показывают, что четыре заманчивых изменения не продвинули её дальше — это полезно знать, а не повод отбрасывать её. Рассматривайте её как один из нескольких информированных сигналов, а не как предсказание просмотров.