研究YouTube分析测试

我们尝试了四种方法提升缩略图评分准确性

一项调整使准确率从59.5%升至62.0%,但实为更公平的测量而非模型改进。其余三项无效。数据与陷阱详解。

September 14, 20269 min read
我们尝试了四种方法提升缩略图评分准确性

在对321对真实视频测试我们的缩略图评分后,我们尝试了四种方法提升其准确性。其中一项改变了数值,经检查发现是更公平的测量方式,而非更好的模型。其余三项未产生任何效果,或使评分更难被信任。以下是每项尝试及其数据。

关键要点

  • 将评分比较从四舍五入的整数改为完整精度,使测量准确率从59.5%提升至62.0%,所有提升均来自17个原平局案例,这些案例大致均分。
  • 重写评分说明在30个缩略图上看似突破,但在322个缩略图上毫无效果:161对视频中,准确率从64.6%降至63.4%。
  • 让AI直接比较两张缩略图,平均准确率与普通评分相同,均为62.7%,但其答案取决于图片先后顺序。
  • 模型推理设置在除最高级别外均无变化,而最高级别在我们使用的欧洲区域从未返回答案。
  • 已发布的预注册结果仍为59.5%。此处所有内容均为后续工作并明确标注。

缩略图评分在测试后能否变得更准确?

在我们的情况下,不容易。在四项针对真实视频的测试中,仅一项提升了测量准确率(从59.5%升至62.0%),且是通过修正评分比较方式而非让模型看到新内容实现的。其余三项未改变准确率。该评分似乎已接近当前模型的能力极限。

这虽不如新纪录令人兴奋,却更实用。它指明了不应投入精力的方向,并解释了每个诱人想法为何失败。这不仅关乎此评分,也适用于创作者测试自身缩略图时遇到的相同陷阱。

有效的修正:比较前停止四舍五入

您看到的评分是0到100的整数。在原始测试中,成对视频有时落在相同整数上,321对中有17次出现这种情况。我们预注册的规则将每次平局计为失败,理由是无法区分两视频的评分未实现区分。

整数背后是精确值,四舍五入会丢弃差异。比较精确值后无任何平局,测量准确率从59.5%升至62.0%:321对中有199对而非191对。未重新评分或调整权重;精确值本已存在。

为何这是更公平的数字,而非更好的模型

显而易见的问题是这17个平局如何打破。若模型已悄然正确判断,四舍五入会掩盖真实能力。但事实并非如此:17个中有8个指向表现更好的视频,9个未指向,与抛硬币结果相近。

因此,提升源于不再将抛硬币结果自动计为失败,而非模型更聪明。这就是为何发布结果仍为59.5%:这是我们提前承诺的数字,规则在看到任何数据前已写定。62.0%作为后续测量明确标注,描述的是同一模型。

调整说明:看似突破的小型试点

模型评分集中。评分所基于的十二个因素中,多个在数百个真实缩略图中分布狭窄,原始测试显示当评分将两视频拉开较大差距时最可靠。因此我们重写说明,为量表设定参考点:50代表同信息流中的典型视频,90及以上保留给前10%。

在30个缩略图的试点中,两种版本评分下看似有效。十二个因素中有八个分散开,其中两个几乎翻倍。随后我们在322个缩略图上运行新说明。那两个几乎翻倍的因素仅增长1.1和0.1分。在161对视频中,原说明选中更好视频的准确率为64.6%,新说明为63.4%,差异在偶然范围内。新版本还几乎将所有评分降低5至7分,意味着创作者将无端损失数分。

为何更分散未带来更高准确率

试点规模过小。30个缩略图下,评分分散度的测量值因偶然性大幅波动,两个因素翻倍在此波动范围内。试点应被视为进行更大测试的理由,而非结果。

更大规模测试带来第二课。两个因素——好奇心和标题党风险——确实在322个缩略图中分散开,但排名未改善。更宽的评分仅在额外宽度反映视频真实差异时才有用。此处它反映的是噪音,而看似自信的噪音比无噪音更糟。

直接比较缩略图而非单独评分

单独评分再比较数字并非人们选择缩略图的方式;他们并排查看两张。因此我们让模型如此操作:展示一对视频中的两个,哪个表现更好?每对161个视频展示两次,每次顺序不同。

平均两种顺序下,直接比较的判断正确率为62.7%,与相同150对完整回答视频的普通评分完全匹配。但模型在64.7%的情况下选择先看到的缩略图,近三分之一的对中仅因顺序不同给出相反答案。准确率相同但稳定性差得多,故未采用。完整结果见我们关于让AI比较缩略图的独立报告。

开启模型推理模式

模型提供一种设置,可在回答前逐步分析问题,有多个努力级别。在三个较低级别,完整分析测试缩略图返回的十二个评分与关闭设置时相同。仅最高级别改变了模型行为。

在我们使用的欧洲数据中心(确保上传缩略图永不处理于欧盟外),最高级别在多次尝试(最长三分钟)中从未返回答案。我们确认其在美国区域可用(使用无缩略图的虚构算术题),发现其将推理写在答案前的纯文本中,而非单独保存。为验证其是否有用而将上传移至美国,我们不愿做此权衡。

四项结果并列对比

每项变更均与原始版本在相同对上比较,故下表所有差异均为同类比较。

变更对排名准确率的影响保留?
比较未四舍五入的评分321对中从59.5%升至62.0%,完全来自原平局大致均分是,作为更公平的测量
校准评分说明161对中从64.6%降至63.4%,无明显差异
直接比较缩略图150对中62.7%对62.7%,但答案依赖顺序
模型推理模式运行级别无变化;最高级别在我们区域从未回答

此处所有数据均来自您分析缩略图和标题时运行的相同评分流程。测试通过产品本身对真实视频评分,而非独立研究副本。

我们如何确保这些后续测试的诚实性

后续实验通常是研究出错之处,因研究者已知自己希望得到的答案。五条规则防止了这一点:

  1. 已发布结果从未改动。预注册的59.5%仍为头条,所有后续分析均标注为后续工作。
  2. 在测试任何变更前,频道已分为两半。实验使用一半,另一半保留用于最终检查。
  3. 每项变更均与原始版本在相同对上比较,仅计算两者分歧的对,这比比较两个总体百分比敏感得多。
  4. 小型试点仅视为进行更大测试的理由,从不视为独立结果。
  5. 每次直接比较均以两种顺序展示,以防位置偏好被误认为能力。

这些无需统计学学位,且大多直接适用于创作者测试自身缩略图:在查看前决定何为成功,同类比较,并将小型早期结果视为继续测试的理由。

这些后续结果的局限性

四项实验均使用与原始测试相同的既定英文频道和一个模型。这些想法在原始结果已知后选择,这正是容易美化发现的情况,也是头条仍保留预注册数字的另一原因。

每项变更仅尝试一次,一种形式。说明的不同措辞可能效果更好,推理模式结果描述的是2026年9月一个区域可用的情况。这些结果未说明评分无法改进;它们仅说明这四条路径未改进它。

常见问题

为何不报告62.0%为准确率?

因测试规则在任何数据存在前已固定,且将平局计为失败。在看到结果后更改规则正是预注册旨在防止的,即使更改合理。62.0%作为明确标注的后续测量发布,与未被取代的59.5%并列。

更智能的AI模型能否提升评分准确率?

可能,但那将是新实验。我们当前模型的推理设置在我们使用的区域未起作用,不同模型需以相同方式对相同对进行测试后才能提出任何主张。更新并不自动意味着在此特定任务上更好。

为何30个缩略图的测试看起来如此有说服力?

小样本因偶然性产生大幅波动,大幅波动看似发现。30个缩略图下,两个因素看似翻倍分散在正常变异范围内;322个缩略图时效果几乎消失。这与仅凭两次上传判断新缩略图风格相同陷阱。

这对测试我自己的缩略图意味着什么?

相同规则适用。在查看前决定何为成功,与频道正常范围而非单个先前视频比较,运行足够多示例使偶然性无法解释结果,若要求任何工具比较两个选项,检查其答案在交换后是否仍成立。

若这些改进失败,评分仍值得使用吗?

评分已针对真实结果测试,且明显优于偶然性。这些后续结果表明四项诱人变更未进一步提升它,这比丢弃它更有用。将其视为多个信息输入之一,而非观看量预测。