テストYouTubeアナリティクスサムネイル

サムネイルテストの結果が本物かどうかを判断する方法

チャンネル成長ではなくパッケージングを測るための基準、有意差の目安、そしてテストを誤って確実な結果と見なす5つの間違いを解説。

September 4, 20268 min read
サムネイルテストの結果が本物かどうかを判断する方法

サムネイルを変更し、次の動画の成績が良くなったからといって、新しいスタイルが効果的だと結論づけるのは、ほぼ間違いです。サムネイルが何もしなかったからではなく、比較方法ではその効果を検出できなかったからです。ここでは、私たちが自社のスコアリングモデルを321組の動画でテストした際に用いたのと同じルールを使って、本物のパッケージング効果と偶然を見分ける方法を紹介します。

主要なポイント

  • 動画をチャンネルの全期間平均と比較すると、パッケージングの良し悪しではなく、チャンネルの成長度合いが測られます。
  • 代わりに、前後10本の動画の中央値(動画自身を除く)と比較してください。
  • 2本の動画では不十分です。単一動画間の小さな差異は、週ごとの通常の変動と区別できません。
  • 「勝ち」とみなす基準は、データを見る前に決めておいてください。そうでないと、必ずどこかに「勝ち」が見つかります。
  • 負ける結果が出ないテストはテストではありません。何が出てきたらそのアイデアを諦めるか、事前に書き留めておいてください。

なぜほとんどのサムネイルテスト結果が本物ではないのか

一般的なクリエイターのテストは、1本の動画を直前の動画と比較します。この比較には、2本のアップロードの間に変化したすべての要素が含まれます:トピック、曜日、動画の長さ、アルゴリズムの推奨、そしてパッケージング。その差異のすべてをサムネイルに帰属させるのは、他の変数が一定だったと仮定することであり、それは決して起こりません。

その結果、視聴数は自ら大きく変動するため、ほぼどんな変更でも「効果があった」ように見えます。健全なチャンネルでは、連続アップロード間の変動が、デザイン決定の影響をはるかに上回ることが日常的です。

これはテストをやめる理由ではありません。ノイズを信号と誤認するのではなく、ノイズを考慮した比較方法を構築する理由です。

動画と比較すべき基準とは

各動画は、チャンネルの歴史ではなく、直近の隣接動画と比較してください。動画の前後10本ずつ、合計20本の視聴数の中央値を求め、その動画の視聴数をその中央値の何倍かで表します。1.0なら周囲と同程度、2.5なら2.5倍のパフォーマンスです。

2つの重要な点があります。どちらも誤りやすいです。まず、平均ではなく中央値を使用してください。なぜなら、期間内に1本のバズ動画があれば、その20本の隣接動画の基準が歪められてしまうからです。そして、動画自身を基準から除外してください。そうでないと、すべての動画が1.0に引き寄せられ、重要な極端な値が平準化されます。

比較方法制御できる要素失敗する場面
直前の動画と比較ほとんど何も制御できない1つのノイジーなデータポイント同士の比較
全期間平均と比較タイミングに関する要素は一切制御できない成長中のチャンネルでは、最近の動画がすべてヒットのように見える
過去30日間と比較おおむねチャンネル規模を制御季節性、および1本のバズ動画が平均を歪める
隣接動画の移動中央値と比較チャンネル規模、成長、時代トピックとパッケージングを分離できない

なぜ隣接動画の窓が有効なのか

18か月で規模が3倍になったチャンネルでは、最近のアップロードはすべて生涯平均を上回り、古い動画はすべて下回る結果になります。このように並べると、パッケージングに関する結論は、実際には動画の公開時期に関する声明になります。

移動窓はこれを排除します。なぜなら、動画の隣接動画はほぼ同じチャンネル規模、同じ視聴者数、同じアルゴリズム環境で公開されたからです。残った差異は、動画自体の違いである可能性が高くなります。

どの程度の差が「本物の差」として扱えるか

有用な下限は2倍です。私たちが自社の研究でペアを選定する際、優れた動画は劣る動画の2倍以上の視聴倍率を持つことを条件としました。それより狭い差異では、チャンネルのノイズが単独で生み出した差異と区別できません。

1.3未満の比率は、結果なしとみなすべきです。これは厳密な普遍的閾値ではありません(チャンネルの変動性に依存します)が、10%の差異を証拠とみなすよりはるかに現実的です。

もう一方の問いは、何組の比較が必要かです。1組ではほぼ何もわかりません。不快な算数ですが、控えめなパッケージング効果を確実に検出するには数百組の比較が必要です。そのため、個人クリエイターは自チャンネルについて何かを証明するのが難しく、正直な対応は単一の結果を証拠ではなく弱い手がかりとみなすことです。

自チャンネルでパッケージングをテストするためのチェックリスト

この5つのステップで、印象をより測定に近いものに変えられます。いずれもスプレッドシート以外のツールは不要です。

  1. 開始前に、変更が効果がなかったと判断する結果を書き留めておいてください。失敗の結果がないテストはテストではありません。
  2. 各動画の視聴倍率は、生涯データではなく、隣接アップロードの中央値と比較して計算してください。
  3. 結論を出す前に、各条件で少なくとも10本の動画を収集し、途中で累計を確認しないでください。
  4. ショート動画、ライブ配信、コラボ動画、6週間未満の動画は除外してください。これらはすべてパッケージングとは無関係なパフォーマンス要因を持っています。
  5. より単純な説明が当てはまるか確認してください——これまでカバーしたことのないトピック、どこかで共有された動画、季節的な急上昇など。

ステップ3は多くの人が飛ばす部分であり、結果が好ましく見えるとすぐにテストを止めることは、自分自身を誤った結論に導く最も効果的な方法です。

動画公開前にパッケージングの評価を得たい場合は、サムネイルとタイトルを12のパッケージング要素でスコアリングし、2つのオプションを並べて比較できます。その後、動画が成熟した時点でその予測を実際の結果と照合できます。

テストが確実な結果のように見えるが実際にはそうではない間違い

4つの失敗モードが、ほとんどの誤った結論の原因であり、それぞれに簡単な対処法があります。

結果が良さそうになった時点で止める

結果を蓄積しながら確認し、最初の好ましいタイミングで止める行為は、十分な忍耐があれば純粋なノイズからも肯定的な結果を生み出します。サンプルサイズを事前に固定し、一度だけ分析してください。私たちの研究では、停止の判断を意図的に完全に排除しました:サンプルは事前設定されたルールで生成されたものであり、400組の目標に対して321組でした。

この不足を「検出力不足」として報告し、結果を見ながら誰でも適用できる停止ルールで静かに収集を延長することは避けました。なぜなら、そのようなルールは、無効な結果を「発見」に変えてしまうからです。

何かがうまくいくまで再分割する

全体の結果が平坦なら、長編動画では効果があったか、特定のカテゴリーでは効果があったか、火曜日に公開した動画では効果があったか、と確認したくなります。十分なサブグループをテストすれば、偶然で有意に見えるものが1つは必ず出ます。比較対象を事前に決めておき、報告時にはそれ以外の結果は「探索的」とラベル付けしてください。

私たちが321組の動画ペアにこれらのルールを適用した方法

私たちの研究もまったく同じ構造に従いました。6つのカテゴリーに分かれた60チャンネル、各チャンネル最大300本のアップロード、除外後の検討対象動画17,250本。動画は隣接動画の移動中央値に対してスコアリングされ、ペアは同一チャンネル内で、中央値で6日間隔で公開され、優れた動画は劣る動画を中央値で4.7倍上回る条件で形成されました。

除外条件、ペアリング制約、主要テスト、4つのコントロール、結果が無効だった場合の公表文言——すべてのルールは、動画のスコアリング前に書かれ、タイムスタンプが押されました。スコアは50%の基準に対して、59.5%のペアで優れた動画を正しく選出しました。

真似すべき部分はサンプルサイズではありません。データが到着した時点で分析に残された判断が一切なかったことです。

よくある質問

サムネイルスタイルをテストするには何本の動画が必要ですか?

ほとんどのチャンネルが短期間で生産できる本数を超えています。控えめなパッケージング効果を確実に検出するには数百組の比較が必要です。そのため、単一動画の結果は弱い証拠にすぎません。各条件で10本の動画があれば大きな効果は検出できますが、微妙な効果は検出できません。そのサンプルサイズで小さな差異を証拠とみなすのは、最も一般的なテストの間違いです。

動画の視聴数と比較すべき基準は何ですか?

動画の前後10本ずつの視聴数の中央値(動画自身を除く)です。これにより、チャンネルの規模、成長、時代をほぼ一定に保ち、残った差異は動画自体の違いである可能性が高くなります。生涯平均と比較すると、チャンネルの成長度合いが測られてしまいます。

なぜ平均ではなく中央値を使うのですか?

期間内に1本の異常に成功した動画があると、平均の基準が上昇し、その20本の隣接動画がすべてパフォーマンス不足のように見えてしまうからです。中央値は1つの外れ値の影響をほとんど受けないため、基準はその期間の典型的な動画を示し続けます。

動画のパフォーマンスを判断するまでどのくらい待つべきですか?

少なくとも6週間です。視聴数は不均等に蓄積し、動画の隣接動画に対する順位は最初の1か月で大きく変化します。私たちの研究では、この理由から測定日から45日以内に公開された動画と、2年以上前の動画を除外しました。

2本の動画だけを比較したサムネイルテストを信頼できますか?

結果ではなく手がかりとして扱ってください。2本の動画はトピック、タイミング、長さなど数十の点で異なります。その差異のすべてをパッケージングに帰属させるのは、他のすべてが一定だったと仮定することです。注目し、繰り返す価値はありますが、チャンネル全体のアプローチを変える根拠にはなりません。

視聴倍率とは何ですか?どう計算しますか?

動画の視聴数を、隣接アップロードの中央値(動画自身を除く)で割ります。1.0なら周囲と同程度、2.0なら2倍、0.5なら半分です。これは、公開時期に大きく依存する生の視聴数を、チャンネルの歴史全体で比較可能な数値に変換します。