अनुसंधानयूट्यूब-विश्लेषणपरीक्षण

हमने थंबनेल स्कोर की सटीकता बढ़ाने के चार तरीके आजमाए

एक बदलाव ने सटीकता 59.5% से 62.0% तक बढ़ा दी, लेकिन यह बेहतर मॉडल नहीं, बल्कि निष्पक्ष मापन था। बाकी तीन बिल्कुल असरदार नहीं थे।

September 14, 20269 min read
हमने थंबनेल स्कोर की सटीकता बढ़ाने के चार तरीके आजमाए

321 वास्तविक वीडियो जोड़ियों के खिलाफ हमारे थंबनेल स्कोर का परीक्षण करने के बाद, हमने इसे अधिक सटीक बनाने की कोशिश की। हमने चार चीजें आजमाईं। एक ने संख्या बदल दी, और जांच में पता चला कि यह बेहतर मॉडल नहीं, बल्कि निष्पक्ष मापन था। बाकी तीन ने कुछ नहीं बदला, या स्कोर पर भरोसा करना मुश्किल बना दिया। यहां प्रत्येक एक के साथ संख्याएं हैं।

मुख्य बिंदु

  • पूर्ण परिशुद्धता पर स्कोर की तुलना करना, गोल भाग के रूप में नहीं, सटीकता को 59.5% से 62.0% तक बढ़ा देता है, और यह सभी 17 पूर्व टाई से आता है, जो लगभग समान रूप से टूटते हैं।
  • पुनर्लिखित स्कोरिंग निर्देश 30 थंबनेल पर एक ब्रेकथ्रू की तरह लगे, लेकिन 322 पर कुछ नहीं किया: 161 जोड़ियों पर 64.6% से 63.4%।
  • AI से दो थंबनेल की सीधी तुलना करने के लिए कहने पर, औसतन सामान्य स्कोर के समान 62.7% प्रत्येक, लेकिन इसका उत्तर यह निर्भर करता था कि कौन सी छवि पहले आई।
  • मॉडल की तर्क सेटिंग ने उच्चतम स्तर के अलावा कुछ नहीं बदला, और वह स्तर हमारे यूरोपीय क्षेत्र में कभी उत्तर नहीं देता जहां हम अपलोड को यूरोप में रखते हैं।
  • प्रकाशित, पूर्व-पंजीकृत परिणाम 59.5% पर बना रहता है। यहां का सब कुछ अनुवर्ती कार्य है और उसी रूप में चिह्नित है।

क्या एक थंबनेल स्कोर को परीक्षण के बाद अधिक सटीक बनाया जा सकता है?

हमारे मामले में, आसानी से नहीं। चार बदलावों में से, एक ने मापी गई सटीकता को 59.5% से 62.0% तक बढ़ा दिया, और यह इसलिए किया क्योंकि स्कोर की तुलना करने के तरीके में सुधार किया गया, न कि मॉडल को कुछ नया दिखाया गया। बाकी तीन ने सटीकता को वहीं छोड़ दिया। स्कोर इस मॉडल के लिए लगभग अधिकतम सीमा पर पहुंच गया है।

यह एक नए रिकॉर्ड से कम रोमांचक उत्तर है, लेकिन अधिक उपयोगी है। यह बताता है कि प्रयास कहां नहीं जाना चाहिए, और यह समझाता है कि प्रत्येक आकर्षक विचार क्यों विफल रहा। यह इस एक स्कोर से आगे महत्वपूर्ण है, क्योंकि वही फंदे उन निर्माताओं को फंसाते हैं जो अपने अपने थंबनेल का परीक्षण करते हैं।

जो ठीक हुआ: तुलना से पहले गोल करना बंद करें

आप जो स्कोर देखते हैं, वह 0 से 100 तक का एक पूर्ण संख्या है। हमारे मूल परीक्षण में, एक जोड़ी के दो वीडियो कभी-कभी एक ही पूर्ण संख्या पर आते थे, और यह 321 जोड़ियों में 17 बार हुआ। हमारे पूर्व-पंजीकृत नियमों ने हर टाई को विफलता के रूप में गिना, इस तर्क पर कि एक स्कोर जो दो वीडियो को अलग नहीं कर सकता, उनके बीच भेदभाव नहीं करता।

पूर्ण संख्या के पीछे एक सटीक मान होता है, और गोल करने से अंतर खो जाता है। सटीक मानों की तुलना करने से कोई टाई नहीं रहती, और मापी गई सटीकता 59.5% से 62.0% तक बढ़ जाती है: 321 जोड़ियों में से 199 बजाय 191। कोई वीडियो को फिर से स्कोर नहीं किया गया और कोई वजन नहीं बदला गया; सटीक मान पहले से ही वहां था।

यह एक निष्पक्ष संख्या क्यों है, बेहतर मॉडल नहीं

स्पष्ट सवाल यह है कि वे 17 टाई किस तरफ टूटे। यदि मॉडल चुपचाप उन्हें सही कर रहा होता, तो गोल करना वास्तविक कौशल छिपा रहा होता। ऐसा नहीं था। 17 में से आठ बेहतर प्रदर्शन करने वाले वीडियो के लिए गए और नौ नहीं गए, जो एक सिक्के के उछाल के द्वारा उत्पन्न होने वाले लगभग बराबर है।

इसलिए लाभ यह है कि अब सिक्के के उछाल को स्वचालित विफलता के रूप में नहीं माना जाता, न कि मॉडल को अधिक ज्ञान होने के कारण। इसलिए प्रकाशित परिणाम 59.5% पर बना रहता है: यह वह आंकड़ा है जिसे हमने डेटा देखने से पहले लिखे गए नियमों के तहत पहले से अपनाया था। 62.0% को एक स्पष्ट रूप से चिह्नित अनुवर्ती माप के रूप में रिपोर्ट किया गया है, और यह उसी मॉडल का वर्णन करता है।

निर्देशों को ट्यून करना: एक छोटा पायलट जो एक ब्रेकथ्रू की तरह लगा

मॉडल के रेटिंग एक साथ जुटे हुए हैं। स्कोर के निर्माण में शामिल बारह कारकों में से कई सैकड़ों वास्तविक थंबनेल के लिए संकीर्ण बैंड में थे, और हमारे मूल परीक्षण ने दिखाया कि स्कोर तब सबसे विश्वसनीय होता है जब यह दो वीडियो को दूर रखता है। इसलिए हमने निर्देशों को फिर से लिखा ताकि पैमाने को एक संदर्भ बिंदु मिले: 50 का अर्थ उसी फीड में औसत वीडियो, 90 और उससे ऊपर शीर्ष दसवें के लिए आरक्षित।

30 थंबनेल के एक पायलट पर, दोनों संस्करणों के तहत स्कोर किए गए, यह लग रहा था कि यह काम कर रहा है। बारह कारकों में से आठ फैल गए, और दो का फैलाव लगभग दोगुना हो गया। हमने फिर 322 थंबनेल पर नए निर्देश चलाए। जिन दो कारकों का फैलाव लगभग दोगुना हुआ था, वे केवल 1.1 और 0.1 अंक के फैलाव से बढ़े। 161 जोड़ियों पर, मूल निर्देश 64.6% समय में बेहतर वीडियो चुनते थे और नए 63.4%, जो मौके के भीतर एक अंतर है। नए संस्करण ने लगभग हर रेटिंग को पांच से सात अंक तक कम कर दिया, इसलिए यह हर निर्माता के लिए कुछ भी नहीं करके कई अंक की लागत लाता।

क्यों अधिक फैलाव ने अधिक सटीकता का अर्थ नहीं दिया

पायलट बस बहुत छोटा था। 30 थंबनेल के साथ, रेटिंग के फैलाव का माप मौके से बहुत दूर तक झूलता है, और दो कारकों का दोगुना होना उस झूलने के भीतर था। पायलट को एक बड़े परीक्षण चलाने का कारण के रूप में पढ़ा जाना चाहिए था, न कि एक परिणाम के रूप में।

बड़े रन ने दूसरा सबक दिया। दो कारक, जिज्ञासा और क्लिकबेट जोखिम, वास्तव में 322 थंबनेल के लिए फैल गए, और रैंकिंग में अभी भी सुधार नहीं हुआ। चौड़ी रेटिंग केवल तभी मदद करती है जब अतिरिक्त चौड़ाई वीडियो के बीच वास्तविक अंतर का अनुसरण करती है। यहां यह शोर का अनुसरण करती थी, और शोर जो आत्मविश्वास की तरह दिखता है, कोई नहीं होने से भी बदतर है।

थंबनेल को स्कोर करने के बजाय सीधे तुलना करना

प्रत्येक थंबनेल को अलग से स्कोर करना और फिर संख्याओं की तुलना करना लोगों के लिए थंबनेल के बीच चुनाव करने का तरीका नहीं है; वे दोनों को आसपास देखते हैं। इसलिए हमने मॉडल से ऐसा करने के लिए कहा: एक जोड़ी के दोनों वीडियो दिखाए गए, कौन सा बेहतर प्रदर्शन करता है? 161 जोड़ियों में से प्रत्येक को दो बार दिखाया गया, प्रत्येक क्रम में एक बार।

दोनों क्रमों के औसत पर, सीधे तुलना करने वाला 62.7% समय सही था, ठीक उसी 150 पूर्ण उत्तर वाले जोड़ियों पर सामान्य स्कोर के बराबर। लेकिन यह जो थंबनेल पहले देखा गया उसे 64.7% समय चुनता था, और लगभग एक तिहाई जोड़ियों के लिए यह केवल क्रम पर निर्भर करके विपरीत उत्तर देता था। समान सटीकता के साथ बहुत कम स्थिरता का अर्थ था कि इसे अपनाया नहीं गया। पूर्ण परिणाम हमारे अलग लेख में हैं, जहां AI से थंबनेल की तुलना करने के लिए कहा गया है।

मॉडल के तर्क मोड को स्विच करना

मॉडल एक सेटिंग प्रदान करता है जो उत्तर देने से पहले एक समस्या को चरण दर चरण हल करने के लिए काम करता है, कई प्रयास स्तरों पर। तीन निचले स्तरों पर, एक परीक्षण थंबनेल का पूर्ण विश्लेषण उसी बारह रेटिंग के साथ वापस आया जैसे सेटिंग बंद थी। केवल उच्चतम स्तर ने मॉडल के व्यवहार में कोई बदलाव किया।

हमारे यूरोपीय डेटा केंद्र में, जहां अपलोड किए गए थंबनेल कभी भी यूरोप के बाहर प्रसंस्कृत नहीं होते, वह उच्चतम स्तर कभी उत्तर नहीं देता, तीन मिनट तक के दोहराए गए प्रयासों के बाद भी। हमने पुष्टि की कि यह एक अमेरिकी क्षेत्र में काम करता है, जहां कोई थंबनेल शामिल नहीं है, और पाया कि यह उत्तर के सामने सादे पाठ के रूप में अपना तर्क लिखता है, न कि इसे अलग रखता है। यह जानने के लिए अपलोड को अमेरिका में ले जाना, जो यह मदद करता है, हम तैयार नहीं थे।

चार परिणाम एक साथ

प्रत्येक बदलाव की तुलना उसी जोड़ियों पर मूल से की गई थी, इसलिए नीचे दिए गए हर अंतर समान है।

बदलावरैंकिंग सटीकता पर क्या प्रभाव पड़ारखा गया?
अनराउंडेड स्कोर की तुलना करें321 जोड़ियों पर 59.5% से 62.0%, पूरी तरह से पूर्व टाई से जो लगभग समान रूप से टूटेहां, एक निष्पक्ष मापन के रूप में
कैलिब्रेटेड स्कोरिंग निर्देश161 जोड़ियों पर 64.6% से 63.4%, कोई पता चलने योग्य अंतर नहींनहीं
थंबनेल की सीधी तुलना करें150 जोड़ियों पर 62.7% बनाम 62.7%, जिसके उत्तर क्रम पर निर्भर करते थेनहीं
मॉडल तर्क मोडचलने वाले स्तरों पर कोई बदलाव नहीं; उच्चतम स्तर ने हमारे क्षेत्र में कभी उत्तर नहीं दियानहीं

यहां की हर आंकड़ा उसी स्कोरिंग पाइपलाइन से आता है जो चलता है जब आप एक थंबनेल और शीर्षक का विश्लेषण करते हैं। परीक्षणों ने उत्पाद के माध्यम से वास्तविक वीडियो का स्कोर किया, एक अलग शोध प्रति के माध्यम से नहीं।

हमने इन अनुवर्ती परीक्षणों को कैसे ईमानदार रखा

अनुवर्ती प्रयोग वह जगह है जहां अध्ययन आमतौर पर गलत हो जाते हैं, क्योंकि शोधकर्ता पहले से जानता है कि वह कौन सा उत्तर चाहता है। पांच नियमों ने इसे नियंत्रित रखा:

  1. प्रकाशित परिणाम को कभी नहीं छुआ गया। पूर्व-पंजीकृत 59.5% हेडलाइन बना रहता है, और हर बाद का विश्लेषण अनुवर्ती कार्य के रूप में चिह्नित है।
  2. चैनलों को किसी भी बदलाव के परीक्षण से पहले आधे में विभाजित किया गया था। प्रयोगों ने एक आधा का उपयोग किया, और दूसरा आधा अंतिम जांच के लिए रखा गया था।
  3. प्रत्येक बदलाव की तुलना उसी जोड़ियों पर मूल से की गई थी, केवल उन जोड़ियों की गिनती की गई जहां दोनों असहमत थे, जो दो समग्र प्रतिशतों की तुलना से बहुत अधिक संवेदनशील है।
  4. एक छोटा पायलट को एक बड़े परीक्षण चलाने का कारण के रूप में माना गया, कभी भी एक परिणाम के रूप में नहीं।
  5. हर सीधी तुलना दोनों क्रमों में दिखाई गई, ताकि स्थिति की पसंद कौशल के रूप में न गुजर सके।

इनमें से किसी के लिए सांख्यिकी की डिग्री की आवश्यकता नहीं है, और अधिकांश सीधे एक निर्माता पर लागू होते हैं जो अपने अपने थंबनेल का परीक्षण करता है: देखने से पहले तय करें कि क्या जीत माना जाएगा, समान की तुलना करें, और एक छोटा प्रारंभिक परिणाम को जारी रखने के लिए परीक्षण का कारण मानें।

इन अनुवर्ती परिणामों की सीमाएं

चारों प्रयोगों ने मूल परीक्षण के समान स्थापित, अंग्रेजी भाषा वाले चैनलों और एक मॉडल का उपयोग किया। विचारों का चयन मूल परिणाम ज्ञात होने के बाद किया गया था, जो ठीक वह स्थिति है जो आमतौर पर एक खोज को फूलाती है, और एक और कारण है कि हेडलाइन 59.5% पर रहती है।

प्रत्येक बदलाव एक बार, एक रूप में आजमाया गया। निर्देशों के लिए अलग शब्दावली बेहतर हो सकती थी, और तर्क-मोड परिणाम सितंबर 2026 में एक क्षेत्र में उपलब्ध था। इनमें से कोई भी परिणाम यह नहीं कहता कि स्कोर में सुधार नहीं किया जा सकता; वे कहते हैं कि ये चार मार्ग इसमें सुधार नहीं कर पाए।

अक्सर पूछे जाने वाले प्रश्न

62.0% को सटीकता के रूप में क्यों नहीं रिपोर्ट किया जाता?

क्योंकि परीक्षण के नियम पहले से तय किए गए थे, और उन्होंने टाई को विफलता के रूप में गिना था। परिणाम देखने के बाद नियम बदलना ठीक वह है जिसे पूर्व-पंजीकरण रोकने के लिए मौजूद है, भले ही बदलाव उचित हो। 62.0% को स्पष्ट रूप से चिह्नित अनुवर्ती माप के रूप में प्रकाशित किया गया है, 59.5% के बगल में जिसे यह बदलता नहीं है।

क्या एक बुद्धिमान AI मॉडल स्कोर को अधिक सटीक बना सकता है?

संभवतः, लेकिन यह एक नया प्रयोग होगा। हमारे वर्तमान मॉडल की तर्क सेटिंग ने हमारे उपयोग किए गए क्षेत्र में मदद नहीं की, और एक अलग मॉडल को उसी जोड़ियों के खिलाफ, उसी तरह से परीक्षण करने की आवश्यकता होगी, इससे पहले कि कोई दावा किया जा सके। नया होना इस विशिष्ट कार्य में बेहतर होने का स्वचालित अर्थ नहीं है।

30 थंबनेल पर एक परीक्षण इतना आश्वस्त क्यों लगा?

छोटे नमूने मौके से बड़े झटके उत्पन्न करते हैं, और एक बड़ा झटका एक खोज की तरह दिखता है। 30 थंबनेल के साथ, दो कारकों का फैलाव दोगुना होना सामान्य भिन्नता के भीतर था; 322 थंबनेल पर प्रभाव लगभग गायब हो गया। यह वही फंदा है जैसे दो अपलोड पर एक नए थंबनेल शैली का निर्णय करना।

मेरे अपने थंबनेल का परीक्षण करने के लिए इसका क्या अर्थ है?

वही नियम लागू होते हैं। देखने से पहले तय करें कि सफलता क्या है, अपने चैनल की सामान्य सीमा के खिलाफ तुलना करें बजाय एक एकल पिछले वीडियो के, पर्याप्त उदाहरण चलाएं ताकि मौका परिणाम की व्याख्या न कर सके, और यदि आप किसी भी उपकरण से दो विकल्पों की तुलना करने के लिए कहते हैं, तो जांचें कि क्या इसका उत्तर उन्हें बदलने से बचता है।

यदि ये सुधार विफल रहे, तो क्या स्कोर का उपयोग करना अभी भी मूल्यवान है?

स्कोर का परीक्षण वास्तविक परिणामों के खिलाफ किया गया था और यह मौके से स्पष्ट रूप से आगे निकल गया। ये अनुवर्ती परिणाम दिखाते हैं कि चार आकर्षक बदलाव इसे आगे नहीं बढ़ा सके, जो जानना उपयोगी है बजाय इसे त्यागने का कारण। इसे कई में से एक सूचित इनपुट के रूप में मानें, दृश्यों की भविष्यवाणी नहीं।