大多数缩略图建议都从可读性开始:大字体、高对比度、单一焦点。这些建议没错,但也是成熟频道早已达到的水平。在642个真实缩略图中,我们的可读性得分几乎没有波动,从总分中移除它后,对真实视频的排名准确性毫无影响。
关键要点
- 在642个来自成熟频道的缩略图中,我们的可读性子得分仅在85到95之间波动,其他所有因素的波动范围都更大。
- 完全移除可读性后,评分的排名准确性保持不变:321对同频道视频中,准确率为62.0%。
- 可读性仍作为基础门槛重要。在手机尺寸下无法阅读的缩略图,在其他任何评判前就已失败——它只是不再能区分“好视频”与“优秀视频”。
- 我们大幅降低了它在评分中的权重,但未归零,因为样本中不包含新手。
- 一旦文字清晰可读,标题和承诺的明确性才是剩余差异所在。
缩略图可读性是否影响视频表现?
可读性决定缩略图是否“入场”,而非是否“获胜”。在成熟频道中,我们的模型几乎将每个缩略图都评为“易读”,因此可读性无法区分频道的热门与冷门视频。当我们从评分中删除它时,对真实视频的排名准确性与之前完全一致:321对视频中准确率为62.0%。
这个结论比听起来更局限,而这种局限性很重要。它并非说可读性不重要,而是说在已上传足够久、拥有基础数据的频道中,可读性问题早已解决,一个所有人都能通过的因素无法再用于排名。
真实缩略图间可读性实际差异有多大?
研究中的每个缩略图都按十二个因素评分。以下是其中六个因素在全部642个缩略图中的波动范围——与我们已发表测试中使用的321对视频相同。"波动"列是标准差:大致表示典型缩略图与平均值的距离。
| 因素 | 最低至最高分 | 波动 |
|---|---|---|
| 可读性 | 85至95 | 3.7 |
| 标题党风险 | 3至44 | 5.4 |
| 好奇心 | 29至68 | 6.8 |
| 标题强度 | 23至93 | 10.3 |
| 承诺清晰度 | 8至95 | 13.9 |
| 悬念感 | 17至93 | 14.9 |
可读性不仅是波动最小的列,其整个范围(最低到最高)甚至小于表格底部因素的典型波动距离。样本中最差的缩略图得分仍为85。
这些是我们的模型评分,而非用尺子测量的结果。但模型并未普遍宽松:它将“承诺清晰度”评分分布在几乎整个量表(8至95)。它本可使用更广范围,但未用于可读性,因为面前的缩略图在该因素上差异极小。
狭窄范围对评分的影响
评分中的权重不衡量某因素的重要性,而是决定该因素变化时最终分数的变动幅度。若某因素几乎不变,即使赋予高权重,也只会给每个缩略图增加几乎相同的数值,提升所有人分数却无法区分优劣。
可读性在我们的点击侧评分中权重最大,但其波动却小于所有其他因素。实际上,它几乎成了一个恒定奖励,而恒定奖励会压缩评分其余部分本应展示的缩略图间差异。
移除可读性后发生了什么?
我们无需猜测。研究已包含每个缩略图的所有子评分,因此可在任意权重组合下重新计算总分,无需向模型提出新问题。我们再次对全部321对视频排序,分别使用原始权重、多个降低权重及零权重,并比较精确分数而非四舍五入的整数——因此这些数据略高于我们最初发布的59.5%。
在原始权重下,评分在62.0%的配对中选出了表现更好的视频。在零权重下(即完全删除可读性),它在62.0%的配对中仍选出了表现更好的视频。中间所有值均在0.6分内波动。在未受我们提示实验影响的频道中,结果同样成立:原始权重下为59.4%,零权重下也为59.4%。
为何我们降低而非移除它
数据本可支持完全删除可读性。我们未这样做,是因为样本中的频道构成。研究中的每个频道都是成熟的:上传历史长、观众稳定、缩略图由早已学会让文字清晰可读的人制作。这正是可读性看似“无效”的原因。
但这并非缩略图检查工具的用户画像。一个上传第十个视频、在杂乱背景上加小字标题的创作者,才是可读性设计要捕捉的对象,对他们而言,可读性差异极大。仅凭不含此类缩略图的样本就移除它,等于回答了一个数据从未提出的问题。因此我们大幅削减其权重,将差额按比例分配给其他点击因素,保持它们的相对顺序不变。
对典型缩略图,总分约下降1分。我们还测试了对全部十二个因素的完整统计重权,仅提升1.9分,对于该样本量而言属于噪音范围,因此其余权重保持不变。
每个缩略图必须跨越的可读性门槛
以上内容绝不意味着可读性可被跳过。它意味着可读性是一个快速通过的“及格/不及格”检查,之后无需再打磨。一个可行的检查清单:
- 将缩略图缩小至其在推荐视频列表中显示的大小,观察一秒。若无法读清所有文字,则文字过多或过小。
- 数图中文字数量。在该尺寸下,三到四个词已算多,一个短语通常比完整句子更易读。
- 检查灰度下的对比度。仅靠颜色与背景区分的文字,对部分观众或屏幕会消失。
- 找到眼睛首先落点的单一元素。若存在两个竞争焦点,缩略图会在观众决定点击前要求其选择。
- 将其与实际会并列出现的缩略图一起观察。在空白画布上清晰不等于在拥挤信息流中清晰。
若缩略图通过全部五项,再投入精力优化可读性,不太可能使其与邻近视频拉开差距。
文字清晰后应投入精力的方向
在我们最初的测试中,最能清晰区分频道“超常表现”与“表现不佳”视频的因素是“承诺清晰度”:包装如何明确传达视频内容。其次是“错失恐惧”信号和紧迫感。这三者主要存在于标题,以及标题与图像的协同作用中,而非文字本身的可读性。
这与研究中唯一改变标题而保持图像不变的实验相符。当每个缩略图重新用另一视频的标题评分时,其得分平均变动超过11分——约是可读性整个波动范围的三倍。在我们的模型看来,文字内容比字体本身更能体现差异。若想了解自己的包装处于何种水平,可用相同十二个因素为缩略图和标题评分,查看哪些因素拖了后腿。
本发现的局限性
以上内容均描述成熟、英文频道,由单一模型评分。可读性看似“无效”,是因为这些频道早已解决该问题,该发现不应无条件套用于新频道。
可读性数据是模型评分而非独立测量,因此若模型系统性高估可读性,也会得出同样狭窄范围。我们认为可能性低,因同一模型对其他因素使用了几乎整个量表,但仅凭本数据无法完全排除。与原始研究一样,所有结论均为关联性:未实际修改并重新发布任何缩略图以观察后续效果。
常见问题
YouTube缩略图文字大小重要吗?
重要,但仅作为基础门槛。在信息流中无法阅读的文字浪费了其占据的空间。我们的数据表明,成熟频道几乎都已跨越此门槛,因此一旦文字清晰,再增大或加粗字体,不太可能成为区分视频的关键。
为何可读性在你们的评分中不再重要?
它并未变得不重要,而是不再能区分优劣。在642个成熟频道缩略图中,其得分仅在85至95间波动,因此几乎给每个评分增加相同数值。移除后,评分对真实视频的排名能力未变,故我们降低了其权重。
我是否应停止优化缩略图可读性?
仅当它通过快速检查后:在信息流尺寸下约一秒内可读清所有文字、有单一清晰焦点、灰度下对比度足够。此后,投入精力优化标题及包装承诺的清晰度,更可能改变视频与邻近视频的对比效果。
这会改变我现有的缩略图评分吗?
略有改变。可读性权重降低,其他点击因素权重相应提升,典型总分约下降1分。在我们每次变更都对照的参考缩略图中,无等级变化,最大变动仅为1分。
这适用于小型或新频道吗?
不自动适用。样本中所有频道均为成熟频道,这正是可读性波动极小的原因。新频道更可能拥有真正难以阅读的缩略图,对它们而言,可读性可能是最需优先解决的问题。