研究テストサムネイル

AIにサムネイルの良し悪しを尋ね、順序を入れ替えてみる

161組の実際の動画ペアをAIに提示し、順序を変えて比較。最初に提示されたサムネイルを64.7%の確率で選んでおり、約3分の1のペアで回答が逆転した。

September 14, 20268 min read
AIにサムネイルの良し悪しを尋ね、順序を入れ替えてみる

これまでに、2つのサムネイルをAIチャットに貼り付けて「どちらがクリックされやすいか」を尋ねた経験があるなら、あなたはコントロールのない実験を行ったことになります。私たちはコントロール付きで実験を行いました:事前にどちらがよりパフォーマンスが良かったかわかっている161組の実際の動画ペアを、AIにそれぞれ2回ずつ提示しました(順序を逆にして)。AIが最初に見たサムネイルが、その回答の多くを決定していたのです。

主要なポイント

  • 同じチャンネルの2つのサムネイルを提示した場合、AIは最初に提示された方を64.7%の確率で選択しました。位置に偏りのない判断者なら約50%になるはずです。
  • 実際の勝者が最初に提示された場合、AIは77.3%の確率で正解しました。同じ勝者が2番目に提示された場合、正解率は48.0%でした。
  • 両方の順序を平均すると正解率は62.7%で、それぞれのサムネイルを個別に評価するスコアと完全に一致しました。並べて比較しても精度は向上しませんでした。
  • 順序以外何も変えずに、30.7%のペアでAIは逆の回答を出しました。
  • AIはほとんど疑いを示しませんでした:典型的な回答では85%の自信を主張していましたが、実際の正解率は約63%でした。

AIは2つのサムネイルのどちらがよりパフォーマンスが良いかを判断できるか?

時々はできますが、単一の回答から信頼できるほどではありません。両方の順序を平均すると、私たちがテストしたモデルは62.7%の確率でよりパフォーマンスの良いサムネイルを選択しました — これは、それぞれのサムネイルを個別に評価するスコアとまったく同じ頻度です。しかし、その選択は最初に見た画像に依存していました:勝者が最初に提示された場合は77.3%、2番目に提示された場合は48.0%でした。

単純に言えば、単一の回答は、最初の選択肢に偏って出るコインのようなものです。情報は確かに含まれています — モデルが両方の順序で同じ回答を出す場合、それは偶然よりも正解率が高い — しかし、それを知るには2回尋ねる必要があります。

私たちのテスト方法:既知の正解を持つ実際のペアを両方の順序で提示

ペアは私たちが公開したスコアテストから得ました:同じチャンネルの2つの動画で、ほぼ同時に公開され、片方はチャンネルの直近の平均を明らかに上回り、もう片方は明らかに下回るものです。同じチャンネルを使用することで、登録者数、視聴者層、制作予算などの要因が相殺され、主にパッケージングの違いが残ります。

私たちは研究の半分のチャンネルから得た161組のペアを使用し、残りの半分は untouched にしました。AI — 私たちのスコアを支える同じビジョンモデル — には、実際のタイトルと共に両方のサムネイルが提示され、「片方はチャンネルの通常の視聴回数を上回り、もう片方は下回る」と説明され、「どちらがどちらか」を尋ねました。322件の回答のうち11件が使用不能だったため、両方の順序で回答された150組が残りました。

なぜ各ペアを2回提示する必要があったか

2つのオプションを比較するAIは、内容に関係なく特定の位置を好む傾向があります。これは、リストの最初の項目を好む人々と同様です。もしそのような傾向が存在し、各ペアを常に1つの順序でしか提示しない場合、それはスキルと区別できません:常に最初の画像を選ぶ判断者は、より良いサムネイルが最初にリストされている場合に「優れている」ように見えます。

各ペアを2回、順序を逆にして提示することで、両者を分離できます。スキルは順序の入れ替えに耐えます。位置の好みはそれに合わせて反転します。

最初に提示されたサムネイルが大多数の議論に勝った

300件の回答全体で、AIは最初に提示されたサムネイルを64.7%の確率で選びました。この好みは、単一の回答の価値を変化させます:

ペアの提示方法AIが実際の勝者を選んだ頻度
勝者が最初に提示された場合77.3%
勝者が2番目に提示された場合48.0%
両方の順序の平均62.7%
各サムネイルを個別に評価した私たちのスコア62.7%
両方の順序で同じ正解を出した場合47.3%(ランダム推測:約25%)

平均行は、各サムネイルを個別に評価するスコアとの公平な比較です。なぜなら、どちらも1ペアにつき1つの回答を出すからです。この基準では、両方の方法は62.7%で同率でした。並べて比較しても精度は向上せず、順序への依存が加わっただけです。

最後の行はより厳格なテストです:AIが両方の順序で同じ、正しいサムネイルを選んだ場合のみ正解とします。ランダムに推測する判断者は約4分の1の確率でこれを通過し、常に最初の画像を選ぶ判断者は決して通過しません。AIは47.3%のペアでこれを通過したため、信号は本物ですが、位置と絡み合っています。

約3分の1のペアでAIは考えを変えた

150組のうち46組(30.7%)で、AIは順序のみの違いで逆の回答を出しました。どちらのサムネイルやタイトルも2つの質問の間で変更されていませんでした。

残りの104組では一貫性があり、その中でAIは68.3%の確率で正解しました。同じ104組に対して私たちのスコアは63.5%の正解率でした。この差はこのペア数では確実とは言えませんが、有用な示唆を含んでいます:順序を入れ替えても変わらない回答は、テストされていない回答よりも価値があります。

その自信度の数値は確率ではない

各回答に対して自信度の数値を求め、AIに「50はコインの裏表と同じ」と説明しました。AIはスケールの下半分をほとんど使いませんでした。300件の回答全体で最も低い自信度は65で、典型的な回答は85を主張し、70未満の回答はわずか4件でした。

一方で、正解率は約63%でした。80〜89の自信度を示した回答は61.6%の確率で正解し、70〜79の自信度を示した回答は63.5%の確率で正解しました。AIの回答がほとんど集中するこの範囲では、数値はどの回答を信じるべきかを示していませんでした。

90以上と評価された17件の回答は82.4%の確率で正解しており、示唆的ですが、17件は信頼できる数ではありません。実用的な読み方は単純です:AI比較の自信に満ちたトーンはデフォルトの表現であり、証拠ではありません。

5分で任意のAIサムネイル判断ツールをチェックする方法

私たちは1つのモデルをテストしましたが、他のツールは異なる動作をする可能性があります。私たちの言葉を信じる必要はありません。自分で簡単にチェックできます:

  1. すでに答えがわかっている2つのサムネイルを選択します:自分のチャンネルの過去の動画2本で、ほぼ同時に公開され、片方は通常の視聴回数を明らかに上回り、もう片方は明らかに下回るものです。
  2. AIに「どちらがよりパフォーマンスが良かったか」を尋ね、より強い方を最初に提示します。その回答と自信度をメモします。
  3. 新しい会話で、AIが最初の回答を覚えていないようにして、順序を逆にして再び尋ねます。
  4. 少なくとも10組で繰り返します。最初に提示された画像を選ぶ頻度と、順序を入れ替えても回答が変わらない頻度を数えます。
  5. 順序を入れ替えても変わらない回答のみを信頼し、自信度の数値は完全に無視します。

提示順序にまったく依存しない数値が欲しい場合は、各サムネイルとタイトルを個別にスコアリングできます。各オプションに個別のスコアを付け、後で比較すれば、最初の位置を好むことはありません。

この実験が示していないこと

1つのモデルと1つの指示セットでテストされました。異なるモデル、または同じモデルでも異なる質問の仕方では、最初の位置をより強くまたは弱く好む可能性があります。ポイントは、すべてのAIがこのように振る舞うということではなく、あなたが使っているAIがそう振る舞っているかどうかを、単一の比較では判断できないということです。

ペアはパフォーマンスに明確な差があるように選ばれたため、これらの精度数値は明確な成功と明確な失敗を比較したものであり、ほぼ同じパフォーマンスの2つのサムネイルを比較したものではありません。すべてのチャンネルは確立されており、英語圏のチャンネルでした。

そして、これは実際のA/Bテストとは無関係です。実際の視聴者に実施するテストは、その視聴者が実際に何をしたかを測定します。この実験は、AIがその結果を事前に予測しようとする場合に限られます。

よくある質問

AIチャットボットは最適なYouTubeサムネイルを選べるか?

一部はできます。私たちがテストしたモデルは、平均して約63%の確率でよりパフォーマンスの良いサムネイルを選択しました。これは偶然よりは優れていますが、各サムネイルを個別に評価するスコアと同等であり、それを上回るわけではありません。その回答は最初に見た画像に大きく依存するため、単一の回答は信頼できません。順序を入れ替えて2回尋ね、順序を入れ替えても変わらない回答のみを信頼してください。

AI比較における位置バイアスとは?

位置バイアスとは、内容ではなく表示位置のためオプションを好む傾向です。私たちのテストでは、AIは最初に提示されたサムネイルを64.7%の確率で選びました。対策は、すべての比較を両方の順序で提示し、回答が逆転する場合は「回答なし」とみなすことです。

サムネイルを個別に評価するのと並べて比較するの、どちらが良いか?

私たちのテストでは、平均的に両者は62.7%で同じ精度でした。違いは安定性にあります。各サムネイルを個別に評価すると、チェックする順序に関係なく同じ結果が得られますが、並べて比較すると約3分の1のペアで回答が順序に応じて変わりました。

なぜAIは自分の回答に自信満々に見えるのか?

自信に満ちた表現がデフォルトであり、測定値ではないからです。自分の確信度を評価するよう求められた私たちがテストしたモデルは、100点中70未満をほとんど使用せず、典型的には85を主張しましたが、実際の正解率は約63%でした。この範囲内では、より高い自信度の数値がより信頼できる回答を意味するわけではありませんでした。

これはサムネイルのA/Bテストが無意味だということか?

いいえ。実際のテストは、実際の視聴者にサムネイルを提示し、彼らが実際に何をしたかを測定するものであり、予測では代替できません。この実験は、AIに事前に勝者を予測させることだけに関係しています。実際のテストでは、より難しい質問は、あなたが見た差が、チャンネルの通常の動画間の変動よりも大きいかどうかです。