शोधथंबनेलयूट्यूब-विश्लेषण

हमने 321 असली वीडियो पर अपना थंबनेल स्कोर टेस्ट किया

एक पूर्व-पंजीकृत परीक्षण कि क्या YouTube थंबनेल और शीर्षक स्कोर वास्तविक प्रदर्शन का अनुसरण करता है। 321 समान चैनल वीडियो जोड़े, चार नियंत्रण, और वह परिणाम जिसे हमने प्रकाशित करने का वादा किया था।

September 4, 20269 min read
हमने 321 असली वीडियो पर अपना थंबनेल स्कोर टेस्ट किया

एक थंबनेल स्कोर तभी कुछ मूल्य रखता है जब वह YouTube पर वास्तव में क्या होता है उसका अनुसरण करता है। इसलिए हमने एक ऐसा टेस्ट किया जो हमें शर्मिंदा कर सकता था: 321 वास्तविक वीडियो के मिलते-जुलते जोड़े, प्रत्येक जोड़ा एक ही चैनल से, एक जो उस चैनल के अपने औसत से बेहतर था और एक जो पीछे रह गया था। हमने किसी भी डेटा को देखने से पहले विधि लिख ली थी। स्कोर ने 59.5% बार बेहतर प्रदर्शन करने वाले वीडियो को चुना, जबकि सिक्का उछालने पर 50% की संभावना होती है।

मुख्य बिंदु

  • 321 जोड़ों में से, स्कोर ने 59.5% बार (p = 0.00079) बेहतर प्रदर्शन करने वाले वीडियो को ऊपर रैंक किया। संयोग की संभावना 50% है।
  • अलग-अलग चैनलों के वीडियो की तुलना करना सदस्य संख्या को मापता है, पैकेजिंग नहीं — यहां हर जोड़ा एक ही चैनल से था, और औसतन छह दिन के अंतराल पर प्रकाशित किया गया था।
  • उन चैनलों पर जहां हर थंबनेल एक ही टेम्पलेट का पालन करता है, सटीकता घटकर 48.7% रह गई। यही वह परिणाम था जिसे हम चाहते थे: पढ़ने के लिए कोई अंतर नहीं, कोई संकेत नहीं मिलना।
  • चार सरल नियम — लंबा शीर्षक, अधिक शब्द, बड़ी फ़ाइल, उच्च विपरीतता — सभी संयोग के स्तर पर आए। स्कोर इनमें से किसी का भी प्रतिनिधित्व नहीं करता।
  • जितना बड़ा अंतर मॉडल ने दो वीडियो के बीच रखा, उतनी ही अधिक बार वह सही था: 1-3 अंक के अंतर पर 56%, 15 अंक या अधिक पर 76.5%।

क्या YouTube थंबनेल स्कोर वास्तव में प्रदर्शन की भविष्यवाणी करता है?

इस टेस्ट में, हां — मामूली और मापने योग्य रूप से। एक ही चैनल के दो वीडियो दिए गए, एक जो अपने अपने आधार रेखा से स्पष्ट रूप से बेहतर था और एक जो स्पष्ट रूप से कमजोर था, हमारे स्कोर ने उन्हें 59.5% बार सही तरीके से रैंक किया। संयोग 50% है। 95% विश्वास अंतराल 53.9% से 64.9% तक चलता है, इसलिए प्रभाव वास्तविक है लेकिन छोटा।

छोटा ही ईमानदार उत्तर है, और जो कोई भी अधिक दावा करता है वह कुछ बेच रहा है। पैकेजिंग कई इनपुट में से एक है। विषय, अपलोड समय, उस सप्ताह के एल्गोरिदम का मूड, यह कि क्या वीडियो को कहीं प्लेटफॉर्म के बाहर चुना गया — सभी थंबनेल से अधिक दृश्यों को प्रभावित करते हैं। 90% सटीकता का दावा करने वाला स्कोर एक YouTube का वर्णन करेगा जो मौजूद नहीं है।

59.5% का व्यावहारिक अर्थ: यदि आप एक ही वीडियो के लिए दो विकल्पों के बीच चुन रहे हैं, तो स्कोर अनुमान लगाने से बेहतर है, और जितना अधिक यह एक को पसंद करता है, उतना ही अधिक उपयोगी है।

चैनलों के बीच थंबनेल की तुलना करना आपको कुछ भी नहीं बताता

इस टेस्ट का स्पष्ट संस्करण थंबनेल का स्कोर लेना और उन स्कोरों को दृश्यों के साथ सहसंबंधित करना है। यह चैनल के आकार को मापता है। दृश्य ग्राहक संख्या, विषय और वीडियो की आयु द्वारा थंबनेल से कहीं अधिक प्रभावित होते हैं, और यह भ्रम अनुकूल दिशा में चलता है: बड़े चैनल अच्छे डिज़ाइनरों को वहन कर सकते हैं और बड़े दर्शकों का आधार रखते हैं।

इस टेस्ट को चलाएं और आपको एक अच्छा सकारात्मक सहसंबंध मिलेगा जिसका कोई अर्थ नहीं है। यह ठीक एक संदेहपूर्ण पाठक के लिए जीवित रहेगा।

एक निष्पक्ष तुलना के लिए क्या स्थिर रहना चाहिए

एक ही चैनल के दो वीडियो की तुलना करना ग्राहक संख्या, दर्शक, बजट और डिज़ाइन कौशल को एक ही कदम में रद्द कर देता है, क्योंकि चारों जोड़े के भीतर समान हैं। दोनों को एक दूसरे के करीब प्रकाशित करने की आवश्यकता चैनल के विकास पथ और उस अवधि के एल्गोरिदम शासन को भी रद्द कर देती है।

जो बचता है वह एक ऐसा प्रश्न है जिसका शून्य के तहत ज्ञात उत्तर है: दिए गए दो वीडियो जिन्हें चैनल के अपने दर्शकों ने बहुत अलग तरीके से व्यवहार किया, क्या स्कोर बता सकता है कि कौन सा कौन था?

हमने 321 मिलते-जुलते जोड़ों पर एक निष्पक्ष परीक्षण कैसे बनाया

हमने छह श्रेणियों — टेक, शिक्षा, कुकिंग, गेमिंग, फिटनेस और लाइफस्टाइल — में 60 चैनल लिए और प्रत्येक से 300 हाल के अपलोड निकाले। अपवादों के बाद 17,250 वीडियो विचार में लिए गए और 321 उपयोगी जोड़े बचे। प्रत्येक जोड़ा समान चैनल से है, औसतन छह दिन के अंतराल पर प्रकाशित किया गया है, और बेहतर प्रदर्शन करने वाले ने कमजोर प्रदर्शन करने वाले को औसतन 4.7 गुना से हराया।

प्रदर्शन को एक चैनल-व्यापी औसत के बजाय एक चलती स्थानीय आधार रेखा के खिलाफ मापा गया है। प्रत्येक वीडियो के लिए हम इसके दोनों ओर के दस पड़ोसी अपलोड के माध्य दृश्यों को लेते हैं, इसे छोड़कर, और इसके अपने दृश्यों को उसका गुणक के रूप में व्यक्त करते हैं। दो साल में पांच गुना बढ़ने वाले चैनल के लिए अन्यथा हर प्रारंभिक वीडियो को विफलता और हर हालिया वीडियो को हिट के रूप में चिह्नित किया जाएगा — पैकेजिंग नहीं, कैलेंडर को मापना।

जोड़े बनाने के नियम पहले से तय किए गए थे:

  1. दोनों वीडियो एक ही चैनल से आते हैं, और प्रत्येक वीडियो अधिकतम एक जोड़े में दिखाई देता है।
  2. वे एक दूसरे के 120 दिनों के भीतर प्रकाशित किए गए थे।
  3. बेहतर प्रदर्शन करने वाले ने कमजोर प्रदर्शन करने वाले को कम से कम दो गुना से हराया, ताकि "बेहतर" और "खराब" का कुछ अर्थ हो न कि शोर का वर्णन करें।
  4. कोई भी चैनल आठ से अधिक जोड़े नहीं देता, ताकि एक उत्पादक अपलोडर नमूने पर प्रभुत्व न जमा सके।

शॉर्ट्स को छोड़ दिया गया, लाइवस्ट्रीम, 45 दिन से कम उम्र के वीडियो और दो साल से अधिक पुराने कुछ भी। स्कोर ने एक थंबनेल और एक शीर्षक देखा — ठीक वही जो उपकरण उपयोगकर्ता से प्राप्त करता है — और दृश्यों या जोड़े के किस तरफ देख रहा है इसके बारे में कुछ भी नहीं।

स्कोर ने क्या सही किया, और कितनी बार

मॉडल ने 321 जोड़ों में से 191 में बेहतर प्रदर्शन करने वाले वीडियो को चुना: 59.5%, 50% शून्य के खिलाफ एक ठीक द्विपद p-मान 0.00079 के साथ। सत्रह जोड़े ठीक बराबर आए, और उनमें से प्रत्येक को विफलता के रूप में गिना गया, न कि विभाजित या छोड़ा गया, क्योंकि एक स्कोर जो दो इनपुट को अलग नहीं कर सकता है उसने उनके बीच भेदभाव नहीं किया है।

बराबरी को हार के रूप में गिनना शीर्षक संख्या को संरक्षक बनाता है। एक ऐसा मॉडल जिसमें कोई क्षमता नहीं है उसका स्कोर उस नियम के तहत लगभग 47.4% होगा, 50% नहीं, इसलिए परीक्षण ने हमारे से वास्तविक संयोग स्तर से थोड़ा ऊपर की बार तक पहुंचने का आग्रह किया। 304 जोड़ों में से जिन्हें यह वास्तव में अलग कर सका, वह 62.8% बार सही था।

आत्मविश्वास ने सही तरीके से अनुसरण किया

वह पैटर्न जो परिणाम को एक माप की तरह व्यवहार करने देता है न कि एक दुर्घटना: जितना अधिक स्कोर ने दो वीडियो को अलग किया, उतनी ही अधिक बार वह सही था।

1-3 अंक के अंतर पर, सटीकता 56.0% थी। 4-7 अंक पर, 64.1%। 8-14 अंक पर, 63.2%। 15 अंक या अधिक पर, 76.5%। एक शोर उत्पन्न करने वाला मॉडल उन बाल्टियों में एक सपाट रेखा दिखाएगा। यह एक धीरे-धीरे बेहतर होता जाता है जैसे यह अधिक निश्चित होता जाता है, जो वह व्यवहार है जो आप चाहते हैं और नकल नहीं कर सकते।

चार जांचें जो हमें गलत साबित कर सकती थीं

एक ऐसा अध्ययन जो विफल नहीं हो सकता वह साक्ष्य नहीं है। हमने चार नियंत्रण पहले से निर्दिष्ट किए, प्रत्येक शीर्षक को अमान्य करने में सक्षम, और उन सभी को प्रकाशित करने का वादा किया जो भी वे दिखाते। प्रत्येक ने उसी तरह व्यवहार किया जैसा यह चाहिए था।

नियंत्रणविफलता का अर्थ क्या होतापरिणाम
विजेता/हारने वाले लेबल को 1,000 बार शफल करेंपाइपलाइन उत्तर लीक करता है; पूरा परिणाम शून्य है47.1%, ठीक वही जहां सिद्धांत कहता है कि यह आना चाहिए
चैनल जिनके थंबनेल एक निश्चित टेम्पलेट का पालन करते हैंस्कोर पैकेजिंग के अलावा कुछ और पढ़ रहा है48.7% — संयोग, जैसा कि भविष्यवाणी की गई थी
सरल नियम: शीर्षक लंबाई, शब्द गिनती, फ़ाइल आकार, विपरीतताएक लाइन का नियम मॉडल से मेल खाता है, इसलिए मॉडल कुछ भी नहीं जोड़ता46.7%-54.5%, कोई भी महत्वपूर्ण नहीं
हर थंबनेल को दूसरे वीडियो के शीर्षक के खिलाफ फिर से स्कोर करेंशीर्षक में कोई योगदान नहीं है और हम एक आधा स्कोर करते हैं, दो नहींस्कोर औसतन 11.3 अंक बदल गया

टेम्पलेट जांच सबसे महत्वपूर्ण है, और यह स्पष्ट करने के लिए लायक है कि क्यों। उन चैनलों पर जो सब कुछ के लिए एक ही थंबनेल लेआउट का पुनर्उपयोग करते हैं, एक दृश्य मॉडल के लिए तुलना के लिए लगभग कुछ भी नहीं है। यदि हमारे स्कोर ने वहां विजेताओं को आत्मविश्वास से चुना होता, तो यह चैनल पहचान या अपलोड युग को पढ़ रहा होता न कि पैकेजिंग। उन चैनलों पर इसने 48.7% स्कोर किया और बाकी सभी जगह 61.0%। वह अंतर अध्ययन का सबसे मजबूत सबूत है कि जो चीज मापी जा रही है वह वही है जिसका हम दावा करते हैं।

कौन से स्कोरिंग आयाम विजेताओं को हारने वालों से अलग करते हैं

यह भाग अन्वेषणात्मक है न कि पुष्टिकारक, और यह इस नमूने का वर्णन करता है न कि YouTube का सामान्य रूप से। दो समूहों को कितना अलग रखने के आधार पर बारह उप-स्कोर को रैंक करने पर, सबसे स्पष्ट अलगाव वादा स्पष्टता से आया, उसके बाद अनुपस्थिति के डर का संकेत और जल्दबाजी। भावनात्मक तीव्रता ने उन्हें बिल्कुल अलग नहीं किया।

वादा स्पष्टता — यह कि पैकेजिंग आपको बताती है कि आप क्या देखने वाले हैं उसकी अस्पष्टता — तालिका के शीर्ष पर आना मॉडल के संतुष्टि पक्ष को पकड़ने के लिए बनाए गए अनुरूप है। सबसे कमजोर अलगाव शुद्ध भावनात्मक तीव्रता है, जो अधिक रोचक आधा है: इस नमूने में थंबनेल में मजबूत भावना ने अधिक या कम प्रदर्शन करने वालों के बीच भेद नहीं किया, जो अधिकांश थंबनेल सलाह नहीं मानती है।

यदि आप अपने अपने पैकेजिंग पर इन आयामों को देखना चाहते हैं न कि समूह में, तो आप एक थंबनेल और शीर्षक को इस अध्ययन द्वारा उपयोग किए गए समान स्कोरिंग पाइपलाइन से गुजार सकते हैं — यह समान कोड पथ है, इसका एक डेमो संस्करण नहीं।

यह परीक्षण क्या साबित नहीं करता

चार सीमाएं, जिनमें से सभी डेटा मौजूद होने से पहले लिखी गई थीं।

यह स्कोर का परीक्षण करता है, सलाह का नहीं। एक सुझाए गए शीर्षक पर कार्य करने से एक वास्तविक वीडियो में सुधार होता है या नहीं यह एक अलग प्रयोग है जो हमने नहीं किया है। यह अवलोकनात्मक है न कि कारणात्मक: यहां कुछ भी नहीं दिखाता कि थंबनेल बदलने से दृश्य बदलते हैं, केवल यह कि स्कोर एक अंतर से संबंधित है जो पहले से मौजूद था।

नमूना तय करता है कि परिणाम किस पर लागू होता है

जोड़े ठीक इसलिए चुने गए थे क्योंकि वे प्रदर्शन में तीव्र रूप से भिन्न थे, इसलिए 59.5% उस जनसंख्या का वर्णन करता है — स्पष्ट रूप से अधिक बनाम स्पष्ट रूप से कम प्रदर्शन करने वाले — और यादृच्छिक रूप से चुने गए किन्हीं दो वीडियो का नहीं। हर चैनल स्थापित, अंग्रेजी भाषा और पर्याप्त बड़ा था जिसमें एक स्थिर आधार रेखा थी। यहां कुछ भी उन चैनलों पर सामान्यीकृत नहीं होता जिनके पास बारह अपलोड और मापने के लिए कोई इतिहास नहीं है।

दृश्य गिनती एक ही तारीख पर पकड़ी गई थी और जमा होती रहती है। पूरी चीज एक स्नैपशॉट है, और एक स्नैपशॉट को संभालने का ईमानदार तरीका बाद में एक और लेना है।

अक्सर पूछे जाने वाले प्रश्न

थंबनेल स्कोर के लिए 59.5% सटीकता अच्छी है?

एक एकल पैकेजिंग संकेत के लिए वास्तविक दुनिया के परिणामों के खिलाफ, हां। दृश्य मुख्य रूप से विषय, दर्शक आकार, समय और एल्गोरिदमिक भाग्य पर निर्भर करते हैं, इसलिए थंबनेल-और-शीर्षक स्कोर केवल एक छोटा हिस्सा ही समझा सकता है। 90% के करीब की संख्या टेस्ट डिज़ाइन में एक लीक का संकेत देगी न कि एक बेहतर मॉडल। उपयोगी ढांचा यह है कि यह अनुमान लगाने से बेहतर है, और जब यह आत्मविश्वास से भरा होता है तो और अधिक निर्णायक रूप से बेहतर होता है।

थंबनेल स्कोर की दृश्य गिनती से सीधे तुलना क्यों नहीं की जाती?

क्योंकि वह चैनल के आकार को मापता है। ग्राहक संख्या, विषय और वीडियो की आयु दृश्यों को पैकेजिंग से कहीं अधिक प्रभावित करती है, और बड़े चैनलों के पास अच्छे डिज़ाइनर और बड़े दर्शकों दोनों होते हैं — इसलिए सहसंबंध सकारात्मक निकलता है जिसका थंबनेल से कोई लेना-देना नहीं है। एक ही चैनल के दो वीडियो की तुलना करना उन सभी को एक कदम में हटा देता है।

यह क्या मतलब है कि बराबरी को विफलता के रूप में गिना गया?

सत्रह जोड़ों को दोनों तरफ समान स्कोर मिले। उन्हें विभाजित करने या हटाने के बजाय, जो दोनों ही परिणाम को फ्लैटर करते, प्रत्येक को एक चूक के रूप में दर्ज किया गया। एक स्कोर जो दो इनपुट को अलग नहीं कर सकता है उसने उनके बीच भेदभाव नहीं किया है। इससे रिपोर्ट किया गया 59.5% वैकल्पिक उपचारों से उत्पन्न होने वाले से कम है।

क्या उच्च थंबनेल स्कोर का अर्थ अधिक दृश्य है?

नहीं। अध्ययन ने कई जोड़ों के बीच एक संबंध दिखाया है, किसी एक वीडियो के बारे में कोई वादा नहीं। लगभग चार में से दस जोड़े गलत तरीके से रैंक किए गए थे। पैकेजिंग कई लीवर में से एक है, और एक मजबूत स्कोर एक वीडियो पर नहीं बचाएगा जिसे कोई देखना नहीं चाहता।

60 चैनल कैसे चुने गए?

एक नियम द्वारा जो किसी भी डेटा के एकत्रित होने से पहले तय किया गया था: व्यापक रूप से जाने जाने वाले चैनल जिनके पास लंबा अपलोड इतिहास है, छह सामग्री श्रेणियों में से प्रत्येक में दस, श्रेणी कवरेज के लिए चुने गए न कि उनके थंबनेल के बारे में कुछ भी। सूची फ्रीज कर दी गई और रिकॉर्ड कर दी गई थी ताकि कोई चैनल परिणाम दिखने लगने के बाद जोड़ा या हटाया न जा सके।

क्या मैं पद्धति देख सकता हूं और खुद जांच सकता हूं?

पूर्ण पूर्व-पंजीकरण — अपवाद, जोड़े बनाने के नियम, प्राथमिक परीक्षण, सभी चार नियंत्रण, और शून्य परिणाम के लिए पहले से लिखे गए शब्दावली — सभी वीडियो स्कोर करने से पहले लिखे गए और समय-स्टैम्प किए गए थे। समग्र परिणाम यहां रिपोर्ट किए गए हैं; मूल वीडियो डेटा YouTube के API शर्तों के अनुसार पुनर्प्रकाशित नहीं किया गया है।