研究缩略图YouTube分析

我们用321个真实视频测试了缩略图评分

一项预注册测试,验证YouTube缩略图和标题评分是否能反映真实表现。321组同频道视频对,四项控制变量,结果无论好坏均公开发布。

September 4, 20269 min read
我们用321个真实视频测试了缩略图评分

缩略图评分只有在能反映YouTube真实表现时才有价值。因此我们进行了一项可能让我们难堪的测试:321组真实视频配对,每组来自同一频道,一组表现优于该频道平均值,另一组则低于平均值。我们在查看任何数据前就写下了方法。评分在59.5%的情况下选出了表现更好的视频,而随机猜测的正确率是50%。

关键要点

  • 在321组视频中,评分在59.5%的情况下将表现更好的视频排在更高位置(p = 0.00079)。随机概率为50%。
  • 跨频道比较视频衡量的是订阅者数量,而非包装效果——本研究中每组视频均来自同一频道,发布时间中位数相差6天。
  • 在所有缩略图使用相同模板的频道上,准确率降至48.7%。这正是我们期望的结果:无差异可读,无信号可寻。
  • 四个简单启发式规则——标题更长、字数更多、文件更大、对比度更高——结果均接近随机。评分并非这些规则的代理。
  • 模型对两视频评分差距越大,其正确率越高:1-3分差距时正确率为56%,15分或以上差距时正确率达76.5%。

YouTube缩略图评分真能预测表现吗?

在本测试中,是的——效果温和且可测量。给定同一频道的两个视频,一个明显优于其自身基线,另一个明显低于基线,我们的评分在59.5%的情况下正确排序。随机概率为50%。95%置信区间为53.9%至64.9%,因此效果真实但微小。

“微小”是诚实的答案,任何声称更高的人都在兜售东西。包装只是众多因素之一。主题、发布时间、算法当周的“心情”、视频是否在平台外被传播——所有这些对观看量的影响都超过缩略图。声称90%准确率的评分描述的是一个不存在的YouTube。

59.5%在实践中意味着:如果你在为同一视频选择两个方案,评分比猜更好,且它越强烈偏好某一方,就越有用。

为何跨频道比较缩略图毫无意义

这个测试最直观的版本是给一批缩略图打分,然后与观看量相关联。这实际上衡量的是频道规模。观看量主要由订阅者数量、主题和视频年龄驱动,远超包装效果,且混淆因素朝有利方向发展:大频道既能负担优秀设计师,又拥有庞大观众群。

进行该测试会得到一个漂亮的正相关,但毫无意义。它经不起任何一位持怀疑态度的读者检验。

公平比较必须控制哪些变量

比较同一频道的两个视频,一步即可消除订阅者数量、观众群、预算和设计能力的影响,因为这四者在配对内完全相同。要求两者发布时间接近,还可消除频道增长轨迹和该时期算法机制的影响。

剩下的问题是:在频道自身观众对两个视频反应截然不同的情况下,评分能否分辨出哪个是哪个?

我们如何在321组配对上构建公平测试

我们选取了六个类别(科技、教育、烹饪、游戏、健身和生活方式)的60个频道,从每个频道提取最多300个近期上传视频。经过筛选后,共考虑17,250个视频,最终获得321组可用配对。每组视频均来自同一频道,发布时间中位数相差6天,表现优异者观看量中位数是表现较差者的4.7倍。

表现是相对于滚动本地基线衡量的,而非频道整体平均值。对于每个视频,我们取其前后各10个邻近上传视频的观看量中位数(不包括自身),并将其自身观看量表示为该中位数的倍数。否则,一个两年内增长五倍的频道会将所有早期视频标记为失败,所有近期视频标记为成功——这衡量的是日历,而非包装。

配对规则预先固定:

  1. 两个视频来自同一频道,且每个视频最多只出现在一组配对中。
  2. 它们在120天内发布。
  3. 表现优异者观看量至少是表现较差者的两倍,以确保“更好”和“更差”有意义,而非描述噪音。
  4. 每个频道最多贡献8组配对,以防某个高产上传者主导样本。

排除了Shorts、直播、45天内和超过两年的视频。评分仅看到缩略图和标题——与工具从用户处接收的内容完全一致——未看到任何观看量数据或配对中的哪一方。

评分正确识别了哪些内容,以及频率如何

模型在321组配对中的191组选出了表现更好的视频:59.5%,相对于50%的零假设,精确二项式p值为0.00079。17组配对评分完全相同,每组均计为失败而非拆分或剔除,因为无法区分两个输入的评分并未实现区分。

将平局计为失败使头条数字保守。一个完全无能力的模型在该规则下得分约为47.4%,而非50%,因此测试要求我们的模型略高于真实随机水平。在实际区分的304组配对中,正确率为62.8%。

置信度与正确性相关

使结果表现为测量而非偶然的模式是:评分对两个视频的差距越大,其正确率越高。

1-3分差距时,准确率为56.0%;4-7分差距时为64.1%;8-14分差距时为63.2%;15分或以上差距时为76.5%。产生噪音的模型在这些区间会显示一条平线。而本模型随着置信度增加而稳步提升,这正是你想要且无法伪造的行为。

四个可能证明我们错误的检查

无法失败的研究不是证据。我们预先指定了四个控制变量,每个都可能使头条结果无效,并承诺无论结果如何均公开发布。每个控制变量均按预期表现。

控制失败意味着什么结果
将胜者/败者标签随机打乱1,000次流程泄露答案;整个结果无效47.1%,恰好落在理论应处位置
缩略图遵循单一固定模板的频道评分读取的不是包装内容48.7%——如预测般为随机
简单启发式:标题长度、字数、文件大小、对比度单行规则与模型匹配,因此模型无新增价值46.7%-54.5%,均不显著
用另一视频的标题重新评分每个缩略图标题无贡献,我们仅评分一半而非两半评分平均移动11.3分

模板检查最重要,值得明确说明原因。在所有缩略图复用单一布局的频道上,视觉模型几乎无内容可比较。若我们的评分在此类频道上自信地选出胜者,说明它读取的是频道身份或上传时代,而非包装。这些频道上评分为48.7%,其他频道为61.0%。这一差距是本研究最强有力的证据,证明所测量的正是我们声称的内容。

哪些评分维度区分了胜者与败者

这部分是探索性而非确认性的,描述的是本样本而非YouTube整体。按各子评分对两组视频的区分度排序,最清晰的区分来自“承诺清晰度”,其次是“错失恐惧信号”和“紧迫感”。情绪强度几乎无法区分。

“承诺清晰度”——包装如何明确告知你即将观看的内容——领先榜单,符合模型满意度部分的设计目标。最弱的区分维度是原始情绪强度,这更有趣:在本样本中,缩略图中的强烈情绪并未区分表现优异者与表现较差者,这与大多数缩略图建议的假设不同。

如果你想在自己的包装上查看这些维度而非汇总数据,可以将缩略图和标题通过本研究使用的相同评分流程运行——这是完全相同的代码路径,而非演示版本。

本测试未证明的内容

四个限制,均在数据存在前写明。

它测试的是评分,而非建议。根据建议修改标题是否真能提升真实视频表现,是另一个我们尚未进行的实验。这是观察性而非因果性的:此处未显示更改缩略图会改变观看量,仅显示评分与已存在的差异相关。

样本决定结果适用对象

配对被精确选择是因为它们表现差异显著,因此59.5%描述的是该群体——明显表现优异者与明显表现较差者——而非任意两个随机视频。每个频道均为已建立、英语频道,且规模足够大以拥有稳定基线。此处结果不适用于仅有12个上传且无历史数据可衡量的频道。

观看量在单一日期捕获并持续累积。整个研究是一个快照,诚实对待快照的方式是稍后拍摄另一张。

常见问题

59.5%的准确率对缩略图评分来说好吗?

对于单一包装信号对抗现实结果,是的。观看量主要取决于主题、观众规模、时机和算法运气,因此缩略图和标题评分只能解释一小部分。接近90%的数字表明测试设计存在漏洞,而非模型更好。有用的框架是它优于猜测,且越自信时优势越明显。

为何不直接比较缩略图评分与观看量?

因为这衡量的是频道规模。订阅者数量、主题和视频年龄对观看量的影响远超包装,且较大频道往往既有更好设计师又有更大观众群——因此相关性为正,但与缩略图无关。比较同一频道的两个视频一步即可消除所有这些因素。

为何将平局计为失败?

17组配对两侧评分完全相同。我们未拆分或移除它们(这会美化结果),而是将每组记录为错误。无法区分两个输入的评分并未实现区分。这使报告的59.5%低于其他处理方式会产生的结果。

更高的缩略图评分是否意味着更多观看量?

不。研究显示的是多组配对中的关联,而非对任何单个视频的承诺。约四成配对被错误排序。包装只是多个杠杆之一,对无人想看的视频给出高评分也无法挽救它。

60个频道如何选择?

在收集任何数据前固定规则:广泛知名的频道,拥有长期上传历史,每个六类内容中选十个,选择标准为类别覆盖而非缩略图特征。列表在评分开始前冻结并记录,因此结果出现后无法增删频道。

我能查看方法论并自行验证吗?

完整的预注册——排除标准、配对规则、主要测试、所有四个控制变量,以及预先承诺的零结果措辞——在任何视频评分前已撰写并加时间戳。此处报告汇总结果;底层视频数据未重新发布,以符合YouTube的API条款。