研究缩略图设计

缩略图可读性是基本门槛,而非决胜因素

在642个真实缩略图中,可读性得分差异极小,移除后评分准确性未变。可读性是必须达标的基础,而非区分优劣的杠杆。

September 14, 20268 min read
缩略图可读性是基本门槛,而非决胜因素

大多数缩略图建议都从可读性开始:大字体、高对比度、单一焦点。这些建议没错,但也是成熟频道早已达到的水平。在642个真实缩略图中,我们的可读性得分几乎没有波动,从总分中移除它后,对真实视频的排名准确性毫无影响。

关键要点

  • 在642个来自成熟频道的缩略图中,我们的可读性子得分仅在85到95之间波动,其他所有因素的波动范围都更大。
  • 完全移除可读性后,评分的排名准确性保持不变:321对同频道视频中,准确率为62.0%。
  • 可读性仍作为基础门槛重要。在手机尺寸下无法阅读的缩略图,在其他任何评判前就已失败——它只是不再能区分“好视频”与“优秀视频”。
  • 我们大幅降低了它在评分中的权重,但未归零,因为样本中不包含新手。
  • 一旦文字清晰可读,标题和承诺的明确性才是剩余差异所在。

缩略图可读性是否影响视频表现?

可读性决定缩略图是否“入场”,而非是否“获胜”。在成熟频道中,我们的模型几乎将每个缩略图都评为“易读”,因此可读性无法区分频道的热门与冷门视频。当我们从评分中删除它时,对真实视频的排名准确性与之前完全一致:321对视频中准确率为62.0%。

这个结论比听起来更局限,而这种局限性很重要。它并非说可读性不重要,而是说在已上传足够久、拥有基础数据的频道中,可读性问题早已解决,一个所有人都能通过的因素无法再用于排名。

真实缩略图间可读性实际差异有多大?

研究中的每个缩略图都按十二个因素评分。以下是其中六个因素在全部642个缩略图中的波动范围——与我们已发表测试中使用的321对视频相同。"波动"列是标准差:大致表示典型缩略图与平均值的距离。

因素最低至最高分波动
可读性85至953.7
标题党风险3至445.4
好奇心29至686.8
标题强度23至9310.3
承诺清晰度8至9513.9
悬念感17至9314.9

可读性不仅是波动最小的列,其整个范围(最低到最高)甚至小于表格底部因素的典型波动距离。样本中最差的缩略图得分仍为85。

这些是我们的模型评分,而非用尺子测量的结果。但模型并未普遍宽松:它将“承诺清晰度”评分分布在几乎整个量表(8至95)。它本可使用更广范围,但未用于可读性,因为面前的缩略图在该因素上差异极小。

狭窄范围对评分的影响

评分中的权重不衡量某因素的重要性,而是决定该因素变化时最终分数的变动幅度。若某因素几乎不变,即使赋予高权重,也只会给每个缩略图增加几乎相同的数值,提升所有人分数却无法区分优劣。

可读性在我们的点击侧评分中权重最大,但其波动却小于所有其他因素。实际上,它几乎成了一个恒定奖励,而恒定奖励会压缩评分其余部分本应展示的缩略图间差异。

移除可读性后发生了什么?

我们无需猜测。研究已包含每个缩略图的所有子评分,因此可在任意权重组合下重新计算总分,无需向模型提出新问题。我们再次对全部321对视频排序,分别使用原始权重、多个降低权重及零权重,并比较精确分数而非四舍五入的整数——因此这些数据略高于我们最初发布的59.5%。

在原始权重下,评分在62.0%的配对中选出了表现更好的视频。在零权重下(即完全删除可读性),它在62.0%的配对中仍选出了表现更好的视频。中间所有值均在0.6分内波动。在未受我们提示实验影响的频道中,结果同样成立:原始权重下为59.4%,零权重下也为59.4%。

为何我们降低而非移除它

数据本可支持完全删除可读性。我们未这样做,是因为样本中的频道构成。研究中的每个频道都是成熟的:上传历史长、观众稳定、缩略图由早已学会让文字清晰可读的人制作。这正是可读性看似“无效”的原因。

但这并非缩略图检查工具的用户画像。一个上传第十个视频、在杂乱背景上加小字标题的创作者,才是可读性设计要捕捉的对象,对他们而言,可读性差异极大。仅凭不含此类缩略图的样本就移除它,等于回答了一个数据从未提出的问题。因此我们大幅削减其权重,将差额按比例分配给其他点击因素,保持它们的相对顺序不变。

对典型缩略图,总分约下降1分。我们还测试了对全部十二个因素的完整统计重权,仅提升1.9分,对于该样本量而言属于噪音范围,因此其余权重保持不变。

每个缩略图必须跨越的可读性门槛

以上内容绝不意味着可读性可被跳过。它意味着可读性是一个快速通过的“及格/不及格”检查,之后无需再打磨。一个可行的检查清单:

  1. 将缩略图缩小至其在推荐视频列表中显示的大小,观察一秒。若无法读清所有文字,则文字过多或过小。
  2. 数图中文字数量。在该尺寸下,三到四个词已算多,一个短语通常比完整句子更易读。
  3. 检查灰度下的对比度。仅靠颜色与背景区分的文字,对部分观众或屏幕会消失。
  4. 找到眼睛首先落点的单一元素。若存在两个竞争焦点,缩略图会在观众决定点击前要求其选择。
  5. 将其与实际会并列出现的缩略图一起观察。在空白画布上清晰不等于在拥挤信息流中清晰。

若缩略图通过全部五项,再投入精力优化可读性,不太可能使其与邻近视频拉开差距。

文字清晰后应投入精力的方向

在我们最初的测试中,最能清晰区分频道“超常表现”与“表现不佳”视频的因素是“承诺清晰度”:包装如何明确传达视频内容。其次是“错失恐惧”信号和紧迫感。这三者主要存在于标题,以及标题与图像的协同作用中,而非文字本身的可读性。

这与研究中唯一改变标题而保持图像不变的实验相符。当每个缩略图重新用另一视频的标题评分时,其得分平均变动超过11分——约是可读性整个波动范围的三倍。在我们的模型看来,文字内容比字体本身更能体现差异。若想了解自己的包装处于何种水平,可用相同十二个因素为缩略图和标题评分,查看哪些因素拖了后腿。

本发现的局限性

以上内容均描述成熟、英文频道,由单一模型评分。可读性看似“无效”,是因为这些频道早已解决该问题,该发现不应无条件套用于新频道。

可读性数据是模型评分而非独立测量,因此若模型系统性高估可读性,也会得出同样狭窄范围。我们认为可能性低,因同一模型对其他因素使用了几乎整个量表,但仅凭本数据无法完全排除。与原始研究一样,所有结论均为关联性:未实际修改并重新发布任何缩略图以观察后续效果。

常见问题

YouTube缩略图文字大小重要吗?

重要,但仅作为基础门槛。在信息流中无法阅读的文字浪费了其占据的空间。我们的数据表明,成熟频道几乎都已跨越此门槛,因此一旦文字清晰,再增大或加粗字体,不太可能成为区分视频的关键。

为何可读性在你们的评分中不再重要?

它并未变得不重要,而是不再能区分优劣。在642个成熟频道缩略图中,其得分仅在85至95间波动,因此几乎给每个评分增加相同数值。移除后,评分对真实视频的排名能力未变,故我们降低了其权重。

我是否应停止优化缩略图可读性?

仅当它通过快速检查后:在信息流尺寸下约一秒内可读清所有文字、有单一清晰焦点、灰度下对比度足够。此后,投入精力优化标题及包装承诺的清晰度,更可能改变视频与邻近视频的对比效果。

这会改变我现有的缩略图评分吗?

略有改变。可读性权重降低,其他点击因素权重相应提升,典型总分约下降1分。在我们每次变更都对照的参考缩略图中,无等级变化,最大变动仅为1分。

这适用于小型或新频道吗?

不自动适用。样本中所有频道均为成熟频道,这正是可读性波动极小的原因。新频道更可能拥有真正难以阅读的缩略图,对它们而言,可读性可能是最需优先解决的问题。