टेस्टिंगयूट्यूब-एनालिटिक्सथंबनेल

थंबनेल टेस्ट के परिणाम वास्तविक हैं या नहीं, यह कैसे पता करें

अधिकांश थंबनेल टेस्ट पैकेजिंग के बजाय चैनल वृद्धि को मापते हैं। तुलना के लिए आधार, कितना अंतर मायने रखता है, और पांच गलतियां जो टेस्ट को निर्णायक लगने देती हैं।

September 4, 20268 min read
थंबनेल टेस्ट के परिणाम वास्तविक हैं या नहीं, यह कैसे पता करें

आप एक थंबनेल बदलते हैं, अगला वीडियो बेहतर प्रदर्शन करता है, और आप निष्कर्ष निकालते हैं कि नया स्टाइल काम करता है। यह निष्कर्ष आमतौर पर गलत होता है — न कि इसलिए कि थंबनेल ने कुछ नहीं किया, बल्कि इसलिए कि तुलना यह पता लगाने में असमर्थ थी कि इसने कुछ किया या नहीं। यहां बताया गया है कि एक वास्तविक पैकेजिंग परिणाम और एक संयोग में अंतर कैसे करें, उन्हीं नियमों का उपयोग करके जिनका हमने अपने स्कोरिंग मॉडल को 321 वीडियो जोड़ियों के खिलाफ परीक्षण करते समय उपयोग किया था।

मुख्य बिंदु

  • एक वीडियो की तुलना अपने चैनल के सभी समय के औसत से करना यह मापता है कि आपका चैनल कितना बढ़ा है, न कि पैकेजिंग कितनी अच्छी थी।
  • इसके बजाय, उसके दोनों ओर के दस अपलोड के माध्य के खिलाफ तुलना करें, वीडियो स्वयं को छोड़कर।
  • दो वीडियो कभी भी पर्याप्त नहीं होते। एकल वीडियो के बीच छोटे अंतर आम सप्ताह-दर-सप्ताह भिन्नता से अलग नहीं किए जा सकते।
  • एक जीत क्या है, यह तय करें पहले आप डेटा देखें, अन्यथा आप हर बार डेटा में कहीं न कहीं एक जीत ढूंढ लेंगे।
  • एक टेस्ट जो नकारात्मक नहीं आ सकता, वह टेस्ट नहीं है। लिख लें कि कौन सा परिणाम आपको इस विचार को छोड़ने के लिए मजबूर करेगा।

अधिकांश थंबनेल टेस्ट परिणाम वास्तविक क्यों नहीं होते

सामान्य निर्माता टेस्ट एक वीडियो की तुलना उससे पहले वाले वीडियो से करता है। उस तुलना में दो अपलोड के बीच बदले गए सभी कुछ शामिल होते हैं: विषय, सप्ताह का दिन, लंबाई, क्या एल्गोरिदम ने उसे धकेला, और पैकेजिंग। पूरे अंतर को थंबनेल के लिए जिम्मेदार ठहराना यह मानता है कि अन्य चर स्थिर रहे, और वे कभी नहीं रहते।

परिणाम यह है कि लगभग कोई भी बदलाव ऐसा लगता है जैसे यह काम कर गया, क्योंकि व्यू काउंट अपने आप में बहुत बदलते हैं। एक स्वस्थ चैनल पर लगातार अपलोड के बीच भिन्नता आमतौर पर एक डिज़ाइन निर्णय के प्रभाव से अधिक होती है।

यह टेस्टिंग बंद करने का कारण नहीं है। यह एक कारण है कि तुलना इस तरह से बनाई जाए कि शोर को संकेत के रूप में गलत न समझा जाए बल्कि इसकी गणना की जाए।

आपको एक वीडियो की तुलना किसके साथ करनी चाहिए

प्रत्येक वीडियो की तुलना उसके तुरंत पड़ोसियों के साथ करें, अपने चैनल के इतिहास के साथ नहीं। उससे पहले के दस अपलोड और उसके बाद के दस अपलोड लें, उन बीस के माध्य व्यू काउंट का पता लगाएं, और वीडियो के अपने व्यू को उस माध्य के गुणक के रूप में व्यक्त करें। 1.0 पर एक वीडियो ने अपने पड़ोस की तरह प्रदर्शन किया। 2.5 पर यह ढाई गुना बेहतर प्रदर्शन किया।

दो विवरण महत्वपूर्ण हैं और दोनों गलत होने की संभावना है। माध्य के बजाय माध्यिका का उपयोग करें, क्योंकि विंडो में एक वायरल अपलोड अन्य बीस पड़ोसियों के लिए आधार को पुनर्परिभाषित कर देगा। और वीडियो स्वयं को अपने आधार से बाहर रखें, अन्यथा हर वीडियो 1.0 की ओर खींचा जाएगा और आपके लिए महत्वपूर्ण चरम मान चपटे हो जाएंगे।

तुलना विधिक्या नियंत्रित करता हैकहां विफल होता है
पिछले वीडियो के खिलाफलगभग कुछ नहींएक शोर युक्त डेटा बिंदु की दूसरे के खिलाफ तुलना
अपने सभी समय के औसत के खिलाफसमय के बारे में कुछ नहींएक बढ़ता चैनल हर हालिया वीडियो को हिट लगने देता है
पिछले 30 दिनों के खिलाफलगभग चैनल का आकारमौसमीता, और एक वायरल वीडियो जो माध्य को विकृत करता है
पड़ोसियों की चलती माध्यिका के खिलाफचैनल का आकार, वृद्धि, युगअभी भी विषय को पैकेजिंग से अलग नहीं कर सकता

पड़ोसी विंडो क्यों काम करता है

एक चैनल जो अठारह महीने में तीन गुना हो गया है, हर हालिया अपलोड को अपने जीवनकाल के औसत से बेहतर और हर पुराने वीडियो को कम प्रदर्शन करते दिखाएगा। इस तरह रैंक किया गया, आपका पैकेजिंग निष्कर्ष वास्तव में यह बताता है कि प्रत्येक वीडियो कब प्रकाशित किया गया था।

चलती विंडो इसे हटा देती है, क्योंकि एक वीडियो के पड़ोसी लगभग एक ही चैनल, एक ही दर्शक आकार और एक ही एल्गोरिदमिक परिस्थितियों में प्रकाशित किए गए थे। जो कुछ बचता है, वह अधिक संभावना से वीडियो के बारे में होता है।

कितना बड़ा अंतर एक वास्तविक अंतर के रूप में गिना जाता है

एक उपयोगी न्यूनतम दो गुना का गुणक है। जब हमने अपने अध्ययन के लिए जोड़ियां चुनीं, तो हमने आवश्यकता रखी कि बेहतर प्रदर्शन करने वाले वीडियो का दूसरे की तुलना में कम से कम दो गुना व्यू गुणक हो। इससे कम कुछ भी एक टेस्ट से ऐसे दो वीडियो के बीच अंतर करने की मांग करता है जिन्हें चैनल का अपना शोर आसानी से अलग कर सकता है।

लगभग 1.3 से कम अनुपात को बिल्कुल कोई परिणाम नहीं माना जाना चाहिए। यह एक कठोर सार्वभौमिक थ्रेशोल्ड नहीं है — यह आपके चैनल की भिन्नता पर निर्भर करता है — लेकिन यह 10% अंतर को सबूत मानने की तुलना में बहुत अधिक सही है।

प्रश्न का दूसरा आधा हिस्सा यह है कि आपको कितनी तुलनाओं की आवश्यकता है। एक जोड़ी आपको अनुमान लगाने के लिए कुछ भी नहीं बताती। असुविधाजनक गणित यह है कि एक मामूली पैकेजिंग प्रभाव का विश्वसनीय रूप से पता लगाने के लिए सैकड़ों तुलनाओं की आवश्यकता होती है, जिसके कारण व्यक्तिगत निर्माता अपने अपने चैनल के बारे में कुछ भी साबित करने में संघर्ष करते हैं और ईमानदार चाल यह है कि एकल परिणामों को सबूत के बजाय कमजोर सबूत के रूप में माना जाए।

अपने अपने चैनल पर पैकेजिंग परीक्षण के लिए एक चेकलिस्ट

ये पांच चरण एक अनुभूति को कुछ मापने के करीब बदल देते हैं। उनमें से किसी के लिए भी स्प्रेडशीट से अधिक कोई उपकरण आवश्यक नहीं है।

  1. शुरू करने से पहले लिख लें कि कौन सा परिणाम आपको यह मानने के लिए राजी करेगा कि बदलाव ने नहीं काम किया। एक ऐसा टेस्ट जिसका कोई विफल परिणाम न हो, वह टेस्ट नहीं है।
  2. प्रत्येक वीडियो के व्यू गुणक की गणना उसके पड़ोसी अपलोड की माध्यिका के खिलाफ करें, किसी जीवनकाल के आंकड़े के खिलाफ नहीं।
  3. कोई निष्कर्ष निकालने से पहले प्रत्येक स्थिति में कम से कम दस वीडियो एकत्र करें, और बीच में चल रहे कुल योग को देखने से बचें।
  4. शॉर्ट्स, लाइवस्ट्रीम, सहयोग और छह सप्ताह से कम पुराने किसी भी वीडियो को बाहर रखें, क्योंकि चारों के प्रदर्शन के ड्राइवर पैकेजिंग से संबंधित नहीं हैं।
  5. जांचें कि क्या एक सरल स्पष्टीकरण फिट बैठता है — एक विषय जिस पर आपने कभी नहीं लिखा, एक अपलोड जो कहीं साझा किया गया, एक मौसमी उछाल।

तीसरा चरण वह है जिसे लोग छोड़ देते हैं, और एक टेस्ट को तभी रोकना जब यह अनुकूल लगता है, यह एक असत्य के बारे में खुद को राजी करने का सबसे प्रभावी तरीका है।

यदि आप वीडियो जारी होने से पहले बजाय हफ्तों बाद पैकेजिंग के बारे में एक अनुमान चाहते हैं, तो आप एक थंबनेल और शीर्षक का बारह पैकेजिंग कारकों के खिलाफ स्कोर कर सकते हैं और दो विकल्पों की तुलना आमने-सामने कर सकते हैं — एक भविष्यवाणी जिसे आप बाद में वीडियो के परिपक्व होने पर परिणाम के खिलाफ जांच सकते हैं।

गलतियां जो एक टेस्ट को निर्णायक लगने देती हैं जब वह नहीं है

चार विफलता मोड अधिकांश गलत निष्कर्षों के लिए जिम्मेदार हैं, और प्रत्येक का एक सरल समाधान है।

जब उत्तर अच्छा लगता है तब रुक जाना

परिणामों की जांच करना जैसे ही वे जमा होते हैं और पहले अनुकूल क्षण पर रुक जाना, शुद्ध शोर से एक सकारात्मक परिणाम उत्पन्न करेगा यदि पर्याप्त धैर्य हो। नमूना आकार पहले से तय करें और एक बार विश्लेषण करें। हमारे अपने अध्ययन में हमने जानबूझकर रुकने का निर्णय पूरी तरह से हटा दिया: नमूना वह था जो पूर्व-निर्धारित नियमों द्वारा उत्पन्न हुआ, जो 400 के लक्ष्य के खिलाफ 321 जोड़ियों पर आया।

हमने उस कमी को अंडरपावर्ड के रूप में रिपोर्ट किया बजाय इसे चुपचाप बढ़ाने के, क्योंकि एक रुकने का नियम जिसे कोई भी परिणाम देखते हुए लागू कर सकता है, वही है जिससे एक शून्य परिणाम एक खोज बन जाता है।

जब तक कुछ काम न करे तब तक फिर से विभाजित करना

यदि समग्र परिणाम सपाट है, तो यह लुभावना है कि जांच करें कि क्या यह लंबे फॉर्म के लिए काम किया, या एक श्रेणी के लिए, या मंगलवार को प्रकाशित वीडियो के लिए। पर्याप्त उपसमूहों का परीक्षण करें और एक दुर्घटना से महत्वपूर्ण लगेगा। जांचने से पहले तय करें कि कौन सी तुलनाएं महत्वपूर्ण हैं, और जब आप रिपोर्ट करें तो बाकी सभी को अन्वेषणात्मक लेबल दें।

हमने इन नियमों को 321 वीडियो जोड़ियों पर कैसे लागू किया

हमारा अपना अध्ययन ठीक इसी संरचना का अनुसरण करता था। छह श्रेणियों में 60 चैनल, प्रत्येक में अधिकतम 300 अपलोड, बाहर करने के बाद 17,250 वीडियो विचार किए गए। वीडियो को उनके पड़ोसियों की चलती माध्यिका के खिलाफ स्कोर किया गया, और जोड़ियां केवल एक ही चैनल के भीतर बनाई गईं, माध्य रूप से छह दिन के अंतराल पर प्रकाशित, जिसमें बेहतर प्रदर्शन करने वाले ने खराब प्रदर्शन करने वाले को माध्य रूप से 4.7 गुना बेहतर प्रदर्शन किया।

हर नियम — बाहर करना, जोड़ी बनाने की बाधाएं, प्राथमिक परीक्षण, चार नियंत्रण और शून्य परिणाम आने पर प्रकाशित करने के लिए शब्दावली — पहले से लिखे गए और टाइमस्टैम्प किए गए थे, जब तक कि कोई वीडियो स्कोर नहीं किया गया था। स्कोर ने 59.5% जोड़ियों में बेहतर प्रदर्शन करने वाले वीडियो को चुना, 50% आधार के खिलाफ।

जिस भाग की नकल करने योग्य है, वह नमूना आकार नहीं है। यह है कि डेटा आने के समय विश्लेषण में कोई निर्णय नहीं बचा था।

अक्सर पूछे जाने वाले प्रश्न

एक थंबनेल स्टाइल का परीक्षण करने के लिए मुझे कितने वीडियो की आवश्यकता है?

अधिकांश चैनल जल्दी उत्पादन कर सकते हैं से अधिक। एक मामूली पैकेजिंग प्रभाव का विश्वसनीय रूप से पता लगाने के लिए सैकड़ों तुलनाओं की आवश्यकता होती है, जिसके कारण एकल-वीडियो परिणाम कमजोर सबूत हैं। दस वीडियो प्रति स्थिति के साथ आप एक बड़े प्रभाव को देख सकते हैं; आप एक सूक्ष्म प्रभाव को नहीं देख सकते, और उस नमूना आकार पर एक छोटे अंतर को सबूत मानना सबसे आम परीक्षण गलती है।

मुझे एक वीडियो के व्यू की तुलना किसके साथ करनी चाहिए?

उससे पहले के दस अपलोड और उसके बाद के दस अपलोड की माध्यिका व्यू काउंट के साथ, वीडियो स्वयं को छोड़कर। यह आपके चैनल के आकार, वृद्धि और युग को लगभग स्थिर रखता है, इसलिए जो बचता है वह अधिक संभावना से वीडियो के बारे में होता है। जीवनकाल के औसत के खिलाफ तुलना करना यह मापता है कि आपका चैनल कितना बढ़ा है।

औसत के बजाय माध्यिका का उपयोग क्यों करें?

क्योंकि विंडो के भीतर एक असामान्य रूप से सफल अपलोड माध्य आधार को ऊपर खींच लेगा और उसके बीस पड़ोसियों को सभी अंडरपरफॉर्मर लगने देगा। माध्यिका एक एकल आउटलायर से बहुत कम प्रभावित होती है, इसलिए आधार उस अवधि के एक सामान्य वीडियो का वर्णन करता रहता है बजाय एक असामान्य वीडियो के।

एक वीडियो के प्रदर्शन का निर्णय लेने से पहले मुझे कितना इंतजार करना चाहिए?

कम से कम छह सप्ताह। व्यू असमान रूप से जमा होते हैं, और एक वीडियो की अपने पड़ोसियों के खिलाफ रैंकिंग पहले महीने में काफी बदल सकती है। हमारे अध्ययन में हमने इसी कारण से मापन की तारीख से 45 दिनों के भीतर प्रकाशित किसी भी चीज़ को बाहर रखा, साथ ही दो साल से अधिक पुरानी किसी भी चीज़ को भी।

क्या मैं एक थंबनेल टेस्ट पर भरोसा कर सकता हूं जो केवल दो वीडियो की तुलना करता है?

इसे एक संकेत के रूप में मानें बजाय एक परिणाम के। दो वीडियो विषय, समय, लंबाई और दर्जनों अन्य तरीकों में भिन्न होते हैं, इसलिए पूरे अंतर को पैकेजिंग के लिए जिम्मेदार ठहराना यह मानता है कि बाकी सभी स्थिर रहे। यह देखने और दोहराने के लायक है, लेकिन यह चैनल-व्यापी दृष्टिकोण बदलने का आधार नहीं है।

व्यू गुणक क्या है और मैं इसकी गणना कैसे करूं?

एक वीडियो के व्यू काउंट को उसके पड़ोसी अपलोड के माध्य व्यू से विभाजित करें, खुद को छोड़कर। 1.0 का परिणाम इसका अर्थ है कि यह अपने पड़ोस की तरह प्रदर्शन किया, 2.0 का अर्थ है दो गुना बेहतर, 0.5 का अर्थ है आधा। यह कच्चे व्यू काउंट को बदल देता है, जो वीडियो के प्रकाशन के समय पर भारी निर्भर करते हैं, एक ऐसी आंकड़े में जिसकी तुलना आपके चैनल के इतिहास के अनुरूप की जा सकती है।