研究标题缩略图

YouTube标题 vs 缩略图:哪个更重要?

我们交换了321对视频的标题并重新评分每个缩略图,结果排名不仅未减弱,反而反转——证明标题承载了更多包装信号。

September 4, 20268 min read
YouTube标题 vs 缩略图:哪个更重要?

每一条YouTube建议都告诉你缩略图才是吸引点击的关键。我们开发了一款同时评分标题和缩略图的工具,然后进行了一项隔离两者的实验——结果发现标题承载了更多信号。交换两个视频的标题不仅削弱了我们评分预测表现更佳视频的能力,反而使其反转。

关键结论

  • 将每个视频的标题替换为其相邻视频的标题,平均使评分移动11.3分(满分100分),最大波动达60分。
  • 仅有3.9%的缩略图在更换标题后得分不变,说明标题在模型中绝非微不足道。
  • 交换标题后,评分仅在42.7%的情况下选中表现更好的视频——低于随机概率,意味着排名反转而非退化。
  • 纯缩略图驱动的评分应保持在59.5%;纯标题驱动的评分会降至35.2%。观测到的42.7%更接近标题驱动的结果。
  • 这并不意味着缩略图毫无价值。实验仅操作标题,因此仅能衡量标题的贡献,无法直接说明图像的作用。

在YouTube上,标题和缩略图哪个更重要?

根据本实验的证据,标题承载了更多区分“优于频道平均表现”与“低于平均表现”视频的信号。这并非我们预期的结果——我们的工具主要围绕缩略图分析构建,且该发现源于一个旨在验证其他内容的控制实验。

该结论需加限定。本实验测量的是影响一个已被证明能追踪真实表现的评分的因素,而非直接测量观众行为。且比较的是同一频道内的包装,观众、主题和设计预算已保持恒定。

尽管如此,方向明确,效应大小也非微不足道。

我们如何隔离标题的贡献

实验设置为321对视频,每对来自同一频道,发布时间中位数相隔6天,其中一者明显优于频道自身基线,另一者明显低于基线。正常评分下,我们的模型在59.5%的情况下正确排序,对比50%的随机概率。

随后我们对每个缩略图进行第二次评分——附加到另一个视频的标题上。两次评分中图像字节完全相同,管道中其他部分未变。因此,两次评分之间的任何变动均可归因于标题,别无他因。

一个实验回答两个问题

第一个问题是标题是否会影响评分。一款声称同时评分缩略图和标题的工具,若更换标题后输出几乎无变化,则实际仅在评分一半内容,却宣传评分两者。

第二个问题更尖锐:在交换输入后重新运行整个排序测试,可揭示哪一半承载了区分能力。三个可能结果在运行前已写下,并附带各自含义。

若评分由交换后预测准确率解释
仅缩略图驱动59.5% — 不变交换标题不影响关键因素
两部分均等贡献约50% — 随机两部分贡献相互抵消
仅标题驱动35.2% — 完全反转反转标题导致排名反转
我们观测到的结果42.7%以标题为主导,但非唯一

交换标题后发生了什么

评分变动极大。在0-100分制下,平均绝对变动为11.3分,中位数为8分,第90百分位为26分,单次最大波动达60分。仅3.9%的缩略图在更换标题后得分完全相同。

作为参照,该平均11.3分的偏移量大于模型通常在一对视频间设定的差距。仅更改标题即可使评分移动的距离,超过模型通常在频道“爆款”与“扑街”视频间看到的总距离。

接着是排序测试。在交换输入后,评分在321对视频中的137对(42.7%)中选中表现更好的视频,95%置信区间为37.2%至48.3%,p值为0.0101(对比50%)。该结果显著低于随机概率。

为何反转不可能是测量伪影

交换标题也会破坏标题与图像的匹配,而一致性本身正是模型评分的十二项因素之一。这是真实的混杂因素,值得明确说明而非隐藏。然而,它无法解释本结果。

对每对视频的双方施加非系统性惩罚会增加噪音。噪音会将准确率推向50%——它会淹没信号,而非反转信号。落在42.7%(低于随机概率及本测试处理平局隐含的47.4%下限),需要原本指向一个方向的信号被反转。这正是交换具有区分力的特征时会发生的情况,而仅凭不匹配噪音无法产生此效果。

什么情况会使我们怀疑该发现

三种结果会反驳此解读,但均未发生:

  1. 新标题下评分几乎不动,意味着模型忽略标题而非赋予其高权重。
  2. 交换后准确率落在或略低于59.5%,表明缩略图独自承载排序能力。
  3. 交换后准确率恰好为50%,表明两部分贡献相等并相互抵消。

这对撰写标题有何影响

实际意义是:标题修改是你可进行的最廉价且高杠杆的编辑。重设计缩略图需一小时或设计师,重写标题仅需两分钟,可在发布后进行,且——根据本证据——对包装信号的影响至少与图像相当。

这也重新定义了标题的作用。在同项研究的维度分解中,最能区分表现优异与欠佳视频的因素是“承诺清晰度”:包装在多大程度上明确告知观众即将观看的内容。这主要取决于标题。而缩略图建议所痴迷的“原始情绪强度”,对区分两组视频的作用最小。

若想查看特定组合在全部十二项因素上的评分,可将你的缩略图和标题通过本实验所用的相同流程进行评分,并比较两个标题选项对同一图像的效果。

缩略图仍发挥作用的场景

本实验操作标题并固定图像,因此直接测量标题的贡献,仅通过推断得出缩略图的贡献。镜像实验——交换缩略图、固定标题——尚未进行,因此诚实的说法是:我们已正确测量一半,另一半仅通过减法推断。

此外,结构上也不应完全否定缩略图。同项研究发现,在每个上传视频均使用单一固定缩略图模板的频道中,评分准确率从61.0%暴跌至48.7%。当缩略图停止变化时,模型也停止区分——这证明图像确实在发挥作用,而非毫无作用。

我们未测试的内容

实验表明我们的评分对标题的响应强于图像,且评分能追踪真实表现。但未证明观众点击决策更多由标题而非缩略图驱动。这是相邻主张,此处仅证实前者。

每对视频均来自拥有足够上传历史以计算稳定基线的成熟英文频道。其他语言的标题,以及尚无基线的新频道,超出了本样本的适用范围。此处未说明按建议修改标题能否提升真实视频表现——这是另一项实验,我们尚未进行。

常见问题

在YouTube上,标题是否比缩略图更重要?

在本实验中,标题承载了更多区分同一频道内表现优异与欠佳视频的信号。交换配对视频的标题导致排名反转而非仅削弱,这正是反转一个真正起作用的特征时会发生的情况。它测量的是评分行为,而非直接测量观众心理。

更改标题会使缩略图评分变化多少?

在0-100分制下平均变化11.3分,中位数为8分,最大观测波动为60分。仅3.9%的图像在更换标题后得分相同。图像本身在两次评分中字节完全一致,因此所有变动均可归因于标题。

视频发布后更改标题是否值得?

这是最廉价的包装编辑,且本证据表明其影响并非微不足道。标题可在数分钟内重写,无需重新设计任何内容,且其对包装评分的影响至少与图像相当。比较两到三个选项,而非假设第一个最佳。

为何交换标题会使评分低于随机水平?

因为标题承载了关于哪个视频表现更好的信息。将每个视频的标题替换为其邻居的标题,反转了该信息而非消除它,因此排名反转。随机噪音会使准确率趋向50%;低于50%则需要一个真实信号指向错误方向。

这是否意味着缩略图不重要?

否。实验仅更改标题,因此直接测量标题的贡献,仅间接推断图像的贡献。此外,在每个缩略图均使用单一固定模板的频道中,评分准确率降至随机水平——证明当图像停止变化时,模型确实失去了某些真实内容。

什么使标题在“承诺清晰度”上得分高?

“承诺清晰度”衡量包装在多大程度上明确告知观众即将观看的内容。明确命名所涵盖具体事项且与图像内容匹配的标题,比依赖模糊悬念的标题得分更高。在整项研究中,这是最能区分表现优异与欠佳视频的因素。