在对321对真实视频测试我们的缩略图评分后,我们尝试了四种方法提升其准确性。其中一项改变了数值,经检查发现是更公平的测量方式,而非更好的模型。其余三项未产生任何效果,或使评分更难被信任。以下是每项尝试及其数据。
关键要点
- 将评分比较从四舍五入的整数改为完整精度,使测量准确率从59.5%提升至62.0%,所有提升均来自17个原平局案例,这些案例大致均分。
- 重写评分说明在30个缩略图上看似突破,但在322个缩略图上毫无效果:161对视频中,准确率从64.6%降至63.4%。
- 让AI直接比较两张缩略图,平均准确率与普通评分相同,均为62.7%,但其答案取决于图片先后顺序。
- 模型推理设置在除最高级别外均无变化,而最高级别在我们使用的欧洲区域从未返回答案。
- 已发布的预注册结果仍为59.5%。此处所有内容均为后续工作并明确标注。
缩略图评分在测试后能否变得更准确?
在我们的情况下,不容易。在四项针对真实视频的测试中,仅一项提升了测量准确率(从59.5%升至62.0%),且是通过修正评分比较方式而非让模型看到新内容实现的。其余三项未改变准确率。该评分似乎已接近当前模型的能力极限。
这虽不如新纪录令人兴奋,却更实用。它指明了不应投入精力的方向,并解释了每个诱人想法为何失败。这不仅关乎此评分,也适用于创作者测试自身缩略图时遇到的相同陷阱。
有效的修正:比较前停止四舍五入
您看到的评分是0到100的整数。在原始测试中,成对视频有时落在相同整数上,321对中有17次出现这种情况。我们预注册的规则将每次平局计为失败,理由是无法区分两视频的评分未实现区分。
整数背后是精确值,四舍五入会丢弃差异。比较精确值后无任何平局,测量准确率从59.5%升至62.0%:321对中有199对而非191对。未重新评分或调整权重;精确值本已存在。
为何这是更公平的数字,而非更好的模型
显而易见的问题是这17个平局如何打破。若模型已悄然正确判断,四舍五入会掩盖真实能力。但事实并非如此:17个中有8个指向表现更好的视频,9个未指向,与抛硬币结果相近。
因此,提升源于不再将抛硬币结果自动计为失败,而非模型更聪明。这就是为何发布结果仍为59.5%:这是我们提前承诺的数字,规则在看到任何数据前已写定。62.0%作为后续测量明确标注,描述的是同一模型。
调整说明:看似突破的小型试点
模型评分集中。评分所基于的十二个因素中,多个在数百个真实缩略图中分布狭窄,原始测试显示当评分将两视频拉开较大差距时最可靠。因此我们重写说明,为量表设定参考点:50代表同信息流中的典型视频,90及以上保留给前10%。
在30个缩略图的试点中,两种版本评分下看似有效。十二个因素中有八个分散开,其中两个几乎翻倍。随后我们在322个缩略图上运行新说明。那两个几乎翻倍的因素仅增长1.1和0.1分。在161对视频中,原说明选中更好视频的准确率为64.6%,新说明为63.4%,差异在偶然范围内。新版本还几乎将所有评分降低5至7分,意味着创作者将无端损失数分。
为何更分散未带来更高准确率
试点规模过小。30个缩略图下,评分分散度的测量值因偶然性大幅波动,两个因素翻倍在此波动范围内。试点应被视为进行更大测试的理由,而非结果。
更大规模测试带来第二课。两个因素——好奇心和标题党风险——确实在322个缩略图中分散开,但排名未改善。更宽的评分仅在额外宽度反映视频真实差异时才有用。此处它反映的是噪音,而看似自信的噪音比无噪音更糟。
直接比较缩略图而非单独评分
单独评分再比较数字并非人们选择缩略图的方式;他们并排查看两张。因此我们让模型如此操作:展示一对视频中的两个,哪个表现更好?每对161个视频展示两次,每次顺序不同。
平均两种顺序下,直接比较的判断正确率为62.7%,与相同150对完整回答视频的普通评分完全匹配。但模型在64.7%的情况下选择先看到的缩略图,近三分之一的对中仅因顺序不同给出相反答案。准确率相同但稳定性差得多,故未采用。完整结果见我们关于让AI比较缩略图的独立报告。
开启模型推理模式
模型提供一种设置,可在回答前逐步分析问题,有多个努力级别。在三个较低级别,完整分析测试缩略图返回的十二个评分与关闭设置时相同。仅最高级别改变了模型行为。
在我们使用的欧洲数据中心(确保上传缩略图永不处理于欧盟外),最高级别在多次尝试(最长三分钟)中从未返回答案。我们确认其在美国区域可用(使用无缩略图的虚构算术题),发现其将推理写在答案前的纯文本中,而非单独保存。为验证其是否有用而将上传移至美国,我们不愿做此权衡。
四项结果并列对比
每项变更均与原始版本在相同对上比较,故下表所有差异均为同类比较。
| 变更 | 对排名准确率的影响 | 保留? |
|---|---|---|
| 比较未四舍五入的评分 | 321对中从59.5%升至62.0%,完全来自原平局大致均分 | 是,作为更公平的测量 |
| 校准评分说明 | 161对中从64.6%降至63.4%,无明显差异 | 否 |
| 直接比较缩略图 | 150对中62.7%对62.7%,但答案依赖顺序 | 否 |
| 模型推理模式 | 运行级别无变化;最高级别在我们区域从未回答 | 否 |
此处所有数据均来自您分析缩略图和标题时运行的相同评分流程。测试通过产品本身对真实视频评分,而非独立研究副本。
我们如何确保这些后续测试的诚实性
后续实验通常是研究出错之处,因研究者已知自己希望得到的答案。五条规则防止了这一点:
- 已发布结果从未改动。预注册的59.5%仍为头条,所有后续分析均标注为后续工作。
- 在测试任何变更前,频道已分为两半。实验使用一半,另一半保留用于最终检查。
- 每项变更均与原始版本在相同对上比较,仅计算两者分歧的对,这比比较两个总体百分比敏感得多。
- 小型试点仅视为进行更大测试的理由,从不视为独立结果。
- 每次直接比较均以两种顺序展示,以防位置偏好被误认为能力。
这些无需统计学学位,且大多直接适用于创作者测试自身缩略图:在查看前决定何为成功,同类比较,并将小型早期结果视为继续测试的理由。
这些后续结果的局限性
四项实验均使用与原始测试相同的既定英文频道和一个模型。这些想法在原始结果已知后选择,这正是容易美化发现的情况,也是头条仍保留预注册数字的另一原因。
每项变更仅尝试一次,一种形式。说明的不同措辞可能效果更好,推理模式结果描述的是2026年9月一个区域可用的情况。这些结果未说明评分无法改进;它们仅说明这四条路径未改进它。
常见问题
为何不报告62.0%为准确率?
因测试规则在任何数据存在前已固定,且将平局计为失败。在看到结果后更改规则正是预注册旨在防止的,即使更改合理。62.0%作为明确标注的后续测量发布,与未被取代的59.5%并列。
更智能的AI模型能否提升评分准确率?
可能,但那将是新实验。我们当前模型的推理设置在我们使用的区域未起作用,不同模型需以相同方式对相同对进行测试后才能提出任何主张。更新并不自动意味着在此特定任务上更好。
为何30个缩略图的测试看起来如此有说服力?
小样本因偶然性产生大幅波动,大幅波动看似发现。30个缩略图下,两个因素看似翻倍分散在正常变异范围内;322个缩略图时效果几乎消失。这与仅凭两次上传判断新缩略图风格相同陷阱。
这对测试我自己的缩略图意味着什么?
相同规则适用。在查看前决定何为成功,与频道正常范围而非单个先前视频比较,运行足够多示例使偶然性无法解释结果,若要求任何工具比较两个选项,检查其答案在交换后是否仍成立。
若这些改进失败,评分仍值得使用吗?
评分已针对真实结果测试,且明显优于偶然性。这些后续结果表明四项诱人变更未进一步提升它,这比丢弃它更有用。将其视为多个信息输入之一,而非观看量预测。