एक थंबनेल स्कोर तभी कुछ मूल्य रखता है जब वह YouTube पर वास्तव में क्या होता है उसका अनुसरण करता है। इसलिए हमने एक ऐसा टेस्ट किया जो हमें शर्मिंदा कर सकता था: 321 वास्तविक वीडियो के मिलते-जुलते जोड़े, प्रत्येक जोड़ा एक ही चैनल से, एक जो उस चैनल के अपने औसत से बेहतर था और एक जो पीछे रह गया था। हमने किसी भी डेटा को देखने से पहले विधि लिख ली थी। स्कोर ने 59.5% बार बेहतर प्रदर्शन करने वाले वीडियो को चुना, जबकि सिक्का उछालने पर 50% की संभावना होती है।
मुख्य बिंदु
- 321 जोड़ों में से, स्कोर ने 59.5% बार (p = 0.00079) बेहतर प्रदर्शन करने वाले वीडियो को ऊपर रैंक किया। संयोग की संभावना 50% है।
- अलग-अलग चैनलों के वीडियो की तुलना करना सदस्य संख्या को मापता है, पैकेजिंग नहीं — यहां हर जोड़ा एक ही चैनल से था, और औसतन छह दिन के अंतराल पर प्रकाशित किया गया था।
- उन चैनलों पर जहां हर थंबनेल एक ही टेम्पलेट का पालन करता है, सटीकता घटकर 48.7% रह गई। यही वह परिणाम था जिसे हम चाहते थे: पढ़ने के लिए कोई अंतर नहीं, कोई संकेत नहीं मिलना।
- चार सरल नियम — लंबा शीर्षक, अधिक शब्द, बड़ी फ़ाइल, उच्च विपरीतता — सभी संयोग के स्तर पर आए। स्कोर इनमें से किसी का भी प्रतिनिधित्व नहीं करता।
- जितना बड़ा अंतर मॉडल ने दो वीडियो के बीच रखा, उतनी ही अधिक बार वह सही था: 1-3 अंक के अंतर पर 56%, 15 अंक या अधिक पर 76.5%।
क्या YouTube थंबनेल स्कोर वास्तव में प्रदर्शन की भविष्यवाणी करता है?
इस टेस्ट में, हां — मामूली और मापने योग्य रूप से। एक ही चैनल के दो वीडियो दिए गए, एक जो अपने अपने आधार रेखा से स्पष्ट रूप से बेहतर था और एक जो स्पष्ट रूप से कमजोर था, हमारे स्कोर ने उन्हें 59.5% बार सही तरीके से रैंक किया। संयोग 50% है। 95% विश्वास अंतराल 53.9% से 64.9% तक चलता है, इसलिए प्रभाव वास्तविक है लेकिन छोटा।
छोटा ही ईमानदार उत्तर है, और जो कोई भी अधिक दावा करता है वह कुछ बेच रहा है। पैकेजिंग कई इनपुट में से एक है। विषय, अपलोड समय, उस सप्ताह के एल्गोरिदम का मूड, यह कि क्या वीडियो को कहीं प्लेटफॉर्म के बाहर चुना गया — सभी थंबनेल से अधिक दृश्यों को प्रभावित करते हैं। 90% सटीकता का दावा करने वाला स्कोर एक YouTube का वर्णन करेगा जो मौजूद नहीं है।
59.5% का व्यावहारिक अर्थ: यदि आप एक ही वीडियो के लिए दो विकल्पों के बीच चुन रहे हैं, तो स्कोर अनुमान लगाने से बेहतर है, और जितना अधिक यह एक को पसंद करता है, उतना ही अधिक उपयोगी है।
चैनलों के बीच थंबनेल की तुलना करना आपको कुछ भी नहीं बताता
इस टेस्ट का स्पष्ट संस्करण थंबनेल का स्कोर लेना और उन स्कोरों को दृश्यों के साथ सहसंबंधित करना है। यह चैनल के आकार को मापता है। दृश्य ग्राहक संख्या, विषय और वीडियो की आयु द्वारा थंबनेल से कहीं अधिक प्रभावित होते हैं, और यह भ्रम अनुकूल दिशा में चलता है: बड़े चैनल अच्छे डिज़ाइनरों को वहन कर सकते हैं और बड़े दर्शकों का आधार रखते हैं।
इस टेस्ट को चलाएं और आपको एक अच्छा सकारात्मक सहसंबंध मिलेगा जिसका कोई अर्थ नहीं है। यह ठीक एक संदेहपूर्ण पाठक के लिए जीवित रहेगा।
एक निष्पक्ष तुलना के लिए क्या स्थिर रहना चाहिए
एक ही चैनल के दो वीडियो की तुलना करना ग्राहक संख्या, दर्शक, बजट और डिज़ाइन कौशल को एक ही कदम में रद्द कर देता है, क्योंकि चारों जोड़े के भीतर समान हैं। दोनों को एक दूसरे के करीब प्रकाशित करने की आवश्यकता चैनल के विकास पथ और उस अवधि के एल्गोरिदम शासन को भी रद्द कर देती है।
जो बचता है वह एक ऐसा प्रश्न है जिसका शून्य के तहत ज्ञात उत्तर है: दिए गए दो वीडियो जिन्हें चैनल के अपने दर्शकों ने बहुत अलग तरीके से व्यवहार किया, क्या स्कोर बता सकता है कि कौन सा कौन था?
हमने 321 मिलते-जुलते जोड़ों पर एक निष्पक्ष परीक्षण कैसे बनाया
हमने छह श्रेणियों — टेक, शिक्षा, कुकिंग, गेमिंग, फिटनेस और लाइफस्टाइल — में 60 चैनल लिए और प्रत्येक से 300 हाल के अपलोड निकाले। अपवादों के बाद 17,250 वीडियो विचार में लिए गए और 321 उपयोगी जोड़े बचे। प्रत्येक जोड़ा समान चैनल से है, औसतन छह दिन के अंतराल पर प्रकाशित किया गया है, और बेहतर प्रदर्शन करने वाले ने कमजोर प्रदर्शन करने वाले को औसतन 4.7 गुना से हराया।
प्रदर्शन को एक चैनल-व्यापी औसत के बजाय एक चलती स्थानीय आधार रेखा के खिलाफ मापा गया है। प्रत्येक वीडियो के लिए हम इसके दोनों ओर के दस पड़ोसी अपलोड के माध्य दृश्यों को लेते हैं, इसे छोड़कर, और इसके अपने दृश्यों को उसका गुणक के रूप में व्यक्त करते हैं। दो साल में पांच गुना बढ़ने वाले चैनल के लिए अन्यथा हर प्रारंभिक वीडियो को विफलता और हर हालिया वीडियो को हिट के रूप में चिह्नित किया जाएगा — पैकेजिंग नहीं, कैलेंडर को मापना।
जोड़े बनाने के नियम पहले से तय किए गए थे:
- दोनों वीडियो एक ही चैनल से आते हैं, और प्रत्येक वीडियो अधिकतम एक जोड़े में दिखाई देता है।
- वे एक दूसरे के 120 दिनों के भीतर प्रकाशित किए गए थे।
- बेहतर प्रदर्शन करने वाले ने कमजोर प्रदर्शन करने वाले को कम से कम दो गुना से हराया, ताकि "बेहतर" और "खराब" का कुछ अर्थ हो न कि शोर का वर्णन करें।
- कोई भी चैनल आठ से अधिक जोड़े नहीं देता, ताकि एक उत्पादक अपलोडर नमूने पर प्रभुत्व न जमा सके।
शॉर्ट्स को छोड़ दिया गया, लाइवस्ट्रीम, 45 दिन से कम उम्र के वीडियो और दो साल से अधिक पुराने कुछ भी। स्कोर ने एक थंबनेल और एक शीर्षक देखा — ठीक वही जो उपकरण उपयोगकर्ता से प्राप्त करता है — और दृश्यों या जोड़े के किस तरफ देख रहा है इसके बारे में कुछ भी नहीं।
स्कोर ने क्या सही किया, और कितनी बार
मॉडल ने 321 जोड़ों में से 191 में बेहतर प्रदर्शन करने वाले वीडियो को चुना: 59.5%, 50% शून्य के खिलाफ एक ठीक द्विपद p-मान 0.00079 के साथ। सत्रह जोड़े ठीक बराबर आए, और उनमें से प्रत्येक को विफलता के रूप में गिना गया, न कि विभाजित या छोड़ा गया, क्योंकि एक स्कोर जो दो इनपुट को अलग नहीं कर सकता है उसने उनके बीच भेदभाव नहीं किया है।
बराबरी को हार के रूप में गिनना शीर्षक संख्या को संरक्षक बनाता है। एक ऐसा मॉडल जिसमें कोई क्षमता नहीं है उसका स्कोर उस नियम के तहत लगभग 47.4% होगा, 50% नहीं, इसलिए परीक्षण ने हमारे से वास्तविक संयोग स्तर से थोड़ा ऊपर की बार तक पहुंचने का आग्रह किया। 304 जोड़ों में से जिन्हें यह वास्तव में अलग कर सका, वह 62.8% बार सही था।
आत्मविश्वास ने सही तरीके से अनुसरण किया
वह पैटर्न जो परिणाम को एक माप की तरह व्यवहार करने देता है न कि एक दुर्घटना: जितना अधिक स्कोर ने दो वीडियो को अलग किया, उतनी ही अधिक बार वह सही था।
1-3 अंक के अंतर पर, सटीकता 56.0% थी। 4-7 अंक पर, 64.1%। 8-14 अंक पर, 63.2%। 15 अंक या अधिक पर, 76.5%। एक शोर उत्पन्न करने वाला मॉडल उन बाल्टियों में एक सपाट रेखा दिखाएगा। यह एक धीरे-धीरे बेहतर होता जाता है जैसे यह अधिक निश्चित होता जाता है, जो वह व्यवहार है जो आप चाहते हैं और नकल नहीं कर सकते।
चार जांचें जो हमें गलत साबित कर सकती थीं
एक ऐसा अध्ययन जो विफल नहीं हो सकता वह साक्ष्य नहीं है। हमने चार नियंत्रण पहले से निर्दिष्ट किए, प्रत्येक शीर्षक को अमान्य करने में सक्षम, और उन सभी को प्रकाशित करने का वादा किया जो भी वे दिखाते। प्रत्येक ने उसी तरह व्यवहार किया जैसा यह चाहिए था।
| नियंत्रण | विफलता का अर्थ क्या होता | परिणाम |
|---|---|---|
| विजेता/हारने वाले लेबल को 1,000 बार शफल करें | पाइपलाइन उत्तर लीक करता है; पूरा परिणाम शून्य है | 47.1%, ठीक वही जहां सिद्धांत कहता है कि यह आना चाहिए |
| चैनल जिनके थंबनेल एक निश्चित टेम्पलेट का पालन करते हैं | स्कोर पैकेजिंग के अलावा कुछ और पढ़ रहा है | 48.7% — संयोग, जैसा कि भविष्यवाणी की गई थी |
| सरल नियम: शीर्षक लंबाई, शब्द गिनती, फ़ाइल आकार, विपरीतता | एक लाइन का नियम मॉडल से मेल खाता है, इसलिए मॉडल कुछ भी नहीं जोड़ता | 46.7%-54.5%, कोई भी महत्वपूर्ण नहीं |
| हर थंबनेल को दूसरे वीडियो के शीर्षक के खिलाफ फिर से स्कोर करें | शीर्षक में कोई योगदान नहीं है और हम एक आधा स्कोर करते हैं, दो नहीं | स्कोर औसतन 11.3 अंक बदल गया |
टेम्पलेट जांच सबसे महत्वपूर्ण है, और यह स्पष्ट करने के लिए लायक है कि क्यों। उन चैनलों पर जो सब कुछ के लिए एक ही थंबनेल लेआउट का पुनर्उपयोग करते हैं, एक दृश्य मॉडल के लिए तुलना के लिए लगभग कुछ भी नहीं है। यदि हमारे स्कोर ने वहां विजेताओं को आत्मविश्वास से चुना होता, तो यह चैनल पहचान या अपलोड युग को पढ़ रहा होता न कि पैकेजिंग। उन चैनलों पर इसने 48.7% स्कोर किया और बाकी सभी जगह 61.0%। वह अंतर अध्ययन का सबसे मजबूत सबूत है कि जो चीज मापी जा रही है वह वही है जिसका हम दावा करते हैं।
कौन से स्कोरिंग आयाम विजेताओं को हारने वालों से अलग करते हैं
यह भाग अन्वेषणात्मक है न कि पुष्टिकारक, और यह इस नमूने का वर्णन करता है न कि YouTube का सामान्य रूप से। दो समूहों को कितना अलग रखने के आधार पर बारह उप-स्कोर को रैंक करने पर, सबसे स्पष्ट अलगाव वादा स्पष्टता से आया, उसके बाद अनुपस्थिति के डर का संकेत और जल्दबाजी। भावनात्मक तीव्रता ने उन्हें बिल्कुल अलग नहीं किया।
वादा स्पष्टता — यह कि पैकेजिंग आपको बताती है कि आप क्या देखने वाले हैं उसकी अस्पष्टता — तालिका के शीर्ष पर आना मॉडल के संतुष्टि पक्ष को पकड़ने के लिए बनाए गए अनुरूप है। सबसे कमजोर अलगाव शुद्ध भावनात्मक तीव्रता है, जो अधिक रोचक आधा है: इस नमूने में थंबनेल में मजबूत भावना ने अधिक या कम प्रदर्शन करने वालों के बीच भेद नहीं किया, जो अधिकांश थंबनेल सलाह नहीं मानती है।
यदि आप अपने अपने पैकेजिंग पर इन आयामों को देखना चाहते हैं न कि समूह में, तो आप एक थंबनेल और शीर्षक को इस अध्ययन द्वारा उपयोग किए गए समान स्कोरिंग पाइपलाइन से गुजार सकते हैं — यह समान कोड पथ है, इसका एक डेमो संस्करण नहीं।
यह परीक्षण क्या साबित नहीं करता
चार सीमाएं, जिनमें से सभी डेटा मौजूद होने से पहले लिखी गई थीं।
यह स्कोर का परीक्षण करता है, सलाह का नहीं। एक सुझाए गए शीर्षक पर कार्य करने से एक वास्तविक वीडियो में सुधार होता है या नहीं यह एक अलग प्रयोग है जो हमने नहीं किया है। यह अवलोकनात्मक है न कि कारणात्मक: यहां कुछ भी नहीं दिखाता कि थंबनेल बदलने से दृश्य बदलते हैं, केवल यह कि स्कोर एक अंतर से संबंधित है जो पहले से मौजूद था।
नमूना तय करता है कि परिणाम किस पर लागू होता है
जोड़े ठीक इसलिए चुने गए थे क्योंकि वे प्रदर्शन में तीव्र रूप से भिन्न थे, इसलिए 59.5% उस जनसंख्या का वर्णन करता है — स्पष्ट रूप से अधिक बनाम स्पष्ट रूप से कम प्रदर्शन करने वाले — और यादृच्छिक रूप से चुने गए किन्हीं दो वीडियो का नहीं। हर चैनल स्थापित, अंग्रेजी भाषा और पर्याप्त बड़ा था जिसमें एक स्थिर आधार रेखा थी। यहां कुछ भी उन चैनलों पर सामान्यीकृत नहीं होता जिनके पास बारह अपलोड और मापने के लिए कोई इतिहास नहीं है।
दृश्य गिनती एक ही तारीख पर पकड़ी गई थी और जमा होती रहती है। पूरी चीज एक स्नैपशॉट है, और एक स्नैपशॉट को संभालने का ईमानदार तरीका बाद में एक और लेना है।
अक्सर पूछे जाने वाले प्रश्न
थंबनेल स्कोर के लिए 59.5% सटीकता अच्छी है?
एक एकल पैकेजिंग संकेत के लिए वास्तविक दुनिया के परिणामों के खिलाफ, हां। दृश्य मुख्य रूप से विषय, दर्शक आकार, समय और एल्गोरिदमिक भाग्य पर निर्भर करते हैं, इसलिए थंबनेल-और-शीर्षक स्कोर केवल एक छोटा हिस्सा ही समझा सकता है। 90% के करीब की संख्या टेस्ट डिज़ाइन में एक लीक का संकेत देगी न कि एक बेहतर मॉडल। उपयोगी ढांचा यह है कि यह अनुमान लगाने से बेहतर है, और जब यह आत्मविश्वास से भरा होता है तो और अधिक निर्णायक रूप से बेहतर होता है।
थंबनेल स्कोर की दृश्य गिनती से सीधे तुलना क्यों नहीं की जाती?
क्योंकि वह चैनल के आकार को मापता है। ग्राहक संख्या, विषय और वीडियो की आयु दृश्यों को पैकेजिंग से कहीं अधिक प्रभावित करती है, और बड़े चैनलों के पास अच्छे डिज़ाइनर और बड़े दर्शकों दोनों होते हैं — इसलिए सहसंबंध सकारात्मक निकलता है जिसका थंबनेल से कोई लेना-देना नहीं है। एक ही चैनल के दो वीडियो की तुलना करना उन सभी को एक कदम में हटा देता है।
यह क्या मतलब है कि बराबरी को विफलता के रूप में गिना गया?
सत्रह जोड़ों को दोनों तरफ समान स्कोर मिले। उन्हें विभाजित करने या हटाने के बजाय, जो दोनों ही परिणाम को फ्लैटर करते, प्रत्येक को एक चूक के रूप में दर्ज किया गया। एक स्कोर जो दो इनपुट को अलग नहीं कर सकता है उसने उनके बीच भेदभाव नहीं किया है। इससे रिपोर्ट किया गया 59.5% वैकल्पिक उपचारों से उत्पन्न होने वाले से कम है।
क्या उच्च थंबनेल स्कोर का अर्थ अधिक दृश्य है?
नहीं। अध्ययन ने कई जोड़ों के बीच एक संबंध दिखाया है, किसी एक वीडियो के बारे में कोई वादा नहीं। लगभग चार में से दस जोड़े गलत तरीके से रैंक किए गए थे। पैकेजिंग कई लीवर में से एक है, और एक मजबूत स्कोर एक वीडियो पर नहीं बचाएगा जिसे कोई देखना नहीं चाहता।
60 चैनल कैसे चुने गए?
एक नियम द्वारा जो किसी भी डेटा के एकत्रित होने से पहले तय किया गया था: व्यापक रूप से जाने जाने वाले चैनल जिनके पास लंबा अपलोड इतिहास है, छह सामग्री श्रेणियों में से प्रत्येक में दस, श्रेणी कवरेज के लिए चुने गए न कि उनके थंबनेल के बारे में कुछ भी। सूची फ्रीज कर दी गई और रिकॉर्ड कर दी गई थी ताकि कोई चैनल परिणाम दिखने लगने के बाद जोड़ा या हटाया न जा सके।
क्या मैं पद्धति देख सकता हूं और खुद जांच सकता हूं?
पूर्ण पूर्व-पंजीकरण — अपवाद, जोड़े बनाने के नियम, प्राथमिक परीक्षण, सभी चार नियंत्रण, और शून्य परिणाम के लिए पहले से लिखे गए शब्दावली — सभी वीडियो स्कोर करने से पहले लिखे गए और समय-स्टैम्प किए गए थे। समग्र परिणाम यहां रिपोर्ट किए गए हैं; मूल वीडियो डेटा YouTube के API शर्तों के अनुसार पुनर्प्रकाशित नहीं किया गया है।