การทดสอบวิเคราะห์ YouTubethumbnail

วิธีตรวจสอบว่าผลการทดสอบ thumbnail นั้นจริงหรือไม่

ผลการทดสอบ thumbnail ส่วนใหญ่วัดการเติบโตของช่อง ไม่ใช่คุณภาพของ packaging วิธีเปรียบเทียบ ความแตกต่างที่นับว่ามีนัยสำคัญ และข้อผิดพลาด 5 ประการที่ทำให้ผลทดสอบดูน่าเชื่อถือ

September 4, 20268 min read
วิธีตรวจสอบว่าผลการทดสอบ thumbnail นั้นจริงหรือไม่

คุณเปลี่ยน thumbnail วิดีโอถัดไปทำได้ดีขึ้น แล้วสรุปว่าสไตล์ใหม่เวิร์ก ข้อสรุปนี้มักผิด — ไม่ใช่เพราะ thumbnail ไม่มีผล แต่เพราะการเปรียบเทียบไม่สามารถตรวจจับได้ว่ามีผลจริงหรือไม่ นี่คือวิธีแยกแยะผลลัพธ์จาก packaging ที่แท้จริงกับความบังเอิญ โดยใช้กฎเดียวกับที่เราใช้ทดสอบโมเดลคะแนนของเราเองกับคู่วิดีโอ 321 คู่

ประเด็นสำคัญ

  • การเปรียบเทียบวิดีโอหนึ่งกับค่าเฉลี่ยตลอดชีพของช่อง วัดว่าช่องของคุณเติบโตมากแค่ไหน ไม่ใช่ว่า packaging ดีแค่ไหน
  • ให้เปรียบเทียบกับค่ามัธยฐานของอัปโหลด 10 คลิปก่อนและหลัง ยกเว้นตัววิดีโอเอง
  • สองวิดีโอไม่เพียงพอ ความแตกต่างเล็กน้อยระหว่างวิดีโอเดี่ยวๆ แยกไม่ออกจากรูปแบบปกติที่เปลี่ยนไปทุกสัปดาห์
  • ตัดสินว่าอะไรถือว่า “ชนะ” ก่อน ดูผล ไม่งั้นคุณจะเจอ “ชนะ” อยู่ในข้อมูลทุกครั้ง
  • การทดสอบที่ไม่มีทางออกมาเป็นลบ ไม่ใช่การทดสอบ เขียนสิ่งที่จะทำให้คุณเลิกแนวคิดนั้นไว้ล่วงหน้า

ทำไมผลการทดสอบ thumbnail ส่วนใหญ่จึงไม่จริง

การทดสอบทั่วไปของครีเอเตอร์จะเปรียบเทียบวิดีโอหนึ่งกับวิดีโอที่อัปโหลดก่อนหน้า ซึ่งการเปรียบเทียบนี้รวมทุกสิ่งที่เปลี่ยนไประหว่างสองอัปโหลด: หัวข้อ วันที่อัปโหลด ความยาว ว่าอัลกอริทึมดันหรือไม่ และ packaging การให้เหตุผลว่าความแตกต่างทั้งหมดเกิดจาก thumbnail ถือว่าตัวแปรอื่นคงที่ ซึ่งไม่เคยเป็นเช่นนั้น

ผลลัพธ์คือ แทบทุกการเปลี่ยนแปลงดูเหมือนจะเวิร์ก เพราะยอดวิวเปลี่ยนแปลงมากอยู่แล้ว ความแปรปรวนระหว่างอัปโหลดติดกันในช่องที่แข็งแรงมักจะกลบผลของทางเลือกเชิงการออกแบบ

นี่ไม่ใช่เหตุผลให้หยุดการทดสอบ แต่เป็นเหตุผลให้สร้างการเปรียบเทียบให้สามารถแยกสัญญาณจากเสียงรบกวนได้

คุณควรเปรียบเทียบวิดีโอแต่ละคลิปกับอะไร

เปรียบเทียบแต่ละวิดีโอกับเพื่อนบ้านโดยตรง ไม่ใช่กับประวัติของช่อง ให้เอาอัปโหลด 10 คลิปก่อนและ 10 คลิปหลัง หาค่ามัธยฐานของยอดวิวทั้ง 20 คลิป แล้วแสดงยอดวิวของวิดีโอตัวเองเป็นเท่าของค่ามัธยฐานนั้น วิดีโอที่ 1.0 แสดงว่าทำได้เท่ากับเพื่อนบ้าน ที่ 2.5 แสดงว่าดีกว่า 2.5 เท่า

มีรายละเอียดสองข้อที่สำคัญและมักจะทำผิดง่ายๆ ใช้ ค่ามัธยฐาน แทนค่าเฉลี่ย เพราะวิดีโอที่ไวรัลหนึ่งคลิปจะเปลี่ยนค่าฐานของเพื่อนบ้าน 20 คลิป และ ต้องไม่นับวิดีโอตัวเอง ในการคำนวณค่าฐาน ไม่งั้นวิดีโอทุกคลิปจะถูกดึงให้ใกล้ 1.0 และค่าสุดขั้วที่คุณสนใจจะถูกบีบให้แบน

วิธีการเปรียบเทียบสิ่งที่ควบคุมได้จุดที่ล้มเหลว
เปรียบเทียบกับวิดีโอที่อัปโหลดก่อนหน้าแทบไม่มีอะไรจุดข้อมูลรบกวนหนึ่งจุดเทียบกับอีกจุดหนึ่ง
เปรียบเทียบกับค่าเฉลี่ยตลอดชีพไม่มีอะไรเกี่ยวกับเวลาช่องที่เติบโตจะทำให้วิดีโอใหม่ดูเหมือนฮิตเสมอ
เปรียบเทียบกับ 30 วันล่าสุดขนาดช่องโดยประมาณฤดูกาล และวิดีโอไวรัลหนึ่งคลิปที่เบี่ยงค่าเฉลี่ย
เปรียบเทียบกับค่ามัธยฐานแบบเลื่อนของเพื่อนบ้านขนาดช่อง การเติบโต ยุคสมัยยังแยกหัวข้อออกจาก packaging ไม่ได้

ทำไมหน้าต่างเพื่อนบ้านถึงใช้ได้

ช่องที่โตขึ้นสามเท่าใน 18 เดือน จะแสดงว่าวิดีโอใหม่ทุกคลิปทำได้ดีกว่าค่าเฉลี่ยตลอดชีพ และวิดีโอเก่าทุกคลิปทำได้แย่กว่า เมื่อจัดอันดับแบบนี้ ข้อสรุปเกี่ยวกับ packaging ที่คุณได้ จริงๆ แล้วเป็นข้อความเกี่ยวกับว่าแต่ละวิดีโอถูกเผยแพร่เมื่อไหร่

หน้าต่างแบบเลื่อนจะลบสิ่งนี้ออก เพราะเพื่อนบ้านของวิดีโอถูกเผยแพร่ในช่องที่ใกล้เคียงกัน ขนาดผู้ชมใกล้เคียงกัน และเงื่อนไขอัลกอริทึมใกล้เคียงกัน สิ่งที่เหลืออยู่จึงมีแนวโน้มว่าเกี่ยวกับตัววิดีโอมากกว่า

ความแตกต่างขนาดไหนถึงนับว่าเป็นความแตกต่างจริง

ระดับขั้นต่ำที่ใช้งานได้คือ 2 เท่า เมื่อเราเลือกคู่สำหรับการศึกษาของเราเอง เราต้องการให้วิดีโอที่ทำได้ดีกว่ามีค่ามัลติเพิลของยอดวิวอย่างน้อยสองเท่าของอีกอัน อะไรที่แคบกว่านั้นคือการขอให้การทดสอบแยกแยะระหว่างวิดีโอสองคลิปที่เสียงรบกวนของช่องเองก็สามารถแยกได้อยู่แล้ว

อัตราส่วนต่ำกว่าประมาณ 1.3 ควร treated ว่าไม่มีผลเลย นี่ไม่ใช่เกณฑ์สากลที่เข้มงวด — ขึ้นอยู่กับว่าช่องของคุณแปรปรวนแค่ไหน — แต่ใกล้เคียงความจริงมากกว่าการถือว่าความแตกต่าง 10% เป็นหลักฐาน

อีกครึ่งหนึ่งของคำถามคือ คุณต้องการการเปรียบเทียบกี่ครั้ง คู่เดียวบอกคุณแทบไม่ได้อะไรเลย คณิตศาสตร์ที่ไม่สบายใจคือ การตรวจจับผลของ packaging ที่เล็กน้อยอย่างน่าเชื่อถือ ต้องใช้การเปรียบเทียบหลายร้อยครั้ง นี่คือเหตุผลว่าทำไมครีเอเตอร์รายบุคคลจึงยากที่จะพิสูจน์อะไรเกี่ยวกับช่องของตัวเอง และเหตุผลที่ถูกต้องคือการถือว่าผลลัพธ์เดี่ยวๆ เป็นหลักฐานอ่อน ไม่ใช่หลักฐานที่แน่นอน

รายการตรวจสอบสำหรับการทดสอบ packaging ในช่องของคุณเอง

ขั้นตอนห้าข้อนี้จะเปลี่ยนความรู้สึกให้ใกล้เคียงกับการวัดผลมากขึ้น ไม่มีข้อใดต้องใช้เครื่องมือเกินกว่าสเปรดชีต

  1. เขียนไว้ล่วงหน้าก่อนเริ่ม ว่าผลลัพธ์แบบไหนจะทำให้คุณเชื่อว่าการเปลี่ยนแปลงนั้น ไม่ ได้ผล การทดสอบที่ไม่มีผลลัพธ์ที่ล้มเหลว ไม่ใช่การทดสอบ
  2. คำนวณค่ามัลติเพิลของยอดวิวแต่ละวิดีโอเทียบกับค่ามัธยฐานของอัปโหลดเพื่อนบ้าน แทนที่จะเทียบกับตัวเลขตลอดชีพ
  3. รวบรวมอย่างน้อยสิบวิดีโอในแต่ละเงื่อนไขก่อนสรุปผล และห้ามดูผลรวมระหว่างทาง
  4. ตัด Shorts, ไลฟ์สตรีม, ความร่วมมือ และวิดีโอที่อายุน้อยกว่าหกสัปดาห์ เพราะทั้งสี่อย่างมีปัจจัยที่ส่งผลต่อผลลัพธ์ที่ไม่เกี่ยวกับ packaging
  5. ตรวจสอบว่ามีคำอธิบายที่ง่ายกว่าหรือไม่ — หัวข้อที่คุณไม่เคยทำมาก่อน อัปโหลดที่ถูกแชร์ที่ไหนสักแห่ง หรือยอดพุ่งขึ้นตามฤดูกาล

ขั้นตอนที่สามคือสิ่งที่คนมักข้าม และหยุดการทดสอบทันทีที่ดูดีคือวิธีที่มีประสิทธิภาพที่สุดในการหลอกตัวเองให้เชื่อสิ่งที่ไม่จริง

ถ้าคุณอยากประเมิน packaging ก่อนที่วิดีโอจะเผยแพร่ แทนที่จะรอหลายสัปดาห์หลังจากนั้น คุณสามารถ ให้คะแนน thumbnail และชื่อตามปัจจัย packaging 12 ข้อ และเปรียบเทียบตัวเลือกสองแบบข้างเคียงกัน — การทำนายที่คุณสามารถตรวจสอบกับผลลัพธ์ได้เมื่อวิดีโอสุกแล้ว

ข้อผิดพลาดที่ทำให้การทดสอบดูเหมือนมีนัยสำคัญเมื่อจริงๆ แล้วไม่มี

สี่รูปแบบความล้มเหลวอธิบายผลสรุปที่ผิดพลาดส่วนใหญ่ และแต่ละข้อมีวิธีแก้ที่ตรงไปตรงมา

หยุดเมื่อคำตอบดูดี

การตรวจสอบผลลัพธ์ขณะที่สะสมและหยุดทันทีที่ดูดี จะให้ผลลัพธ์บวกจากเสียงรบกวนบริสุทธิ์ หากมีความอดทนพอ ตั้งขนาดตัวอย่างล่วงหน้าและวิเคราะห์ครั้งเดียว ในงานศึกษาของเราเอง เราตั้งใจลบการตัดสินใจหยุดออกทั้งหมด: ตัวอย่างคือสิ่งที่กฎที่ตั้งไว้ล่วงหน้าสร้างขึ้น ซึ่งได้ 321 คู่ จากเป้าหมาย 400 คู่

เราแจ้งว่าผลลัพธ์นี้ “ไม่เพียงพอ” แทนที่จะขยายการเก็บข้อมูลเงียบๆ เพราะกฎการหยุดที่ใครก็สามารถใช้ได้ขณะดูผลลัพธ์ คือวิธีที่ผลลัพธ์ศูนย์กลายเป็นการค้นพบ

ตัดสไลซ์ใหม่จนกว่าจะเจอสิ่งที่เวิร์ก

ถ้าผลลัพธ์รวมเป็นศูนย์ มันน่าดึงดูดใจที่จะตรวจสอบว่ามันเวิร์กสำหรับวิดีโอแบบยาว หรือหมวดหมู่หนึ่ง หรือวิดีโอที่อัปโหลดวันอังคาร ทดสอบกลุ่มย่อยมากพอ และหนึ่งในนั้นจะดูมีนัยสำคัญโดยบังเอิญ ตัดสินใจก่อนว่าการเปรียบเทียบใดที่สำคัญ และติดป้ายสิ่งอื่นว่าเป็นการสำรวจเมื่อคุณรายงาน

เราใช้กฎเหล่านี้กับคู่วิดีโอ 321 คู่อย่างไร

งานศึกษาของเราเองตามโครงสร้างนี้อย่างแม่นยำ หกช่องในหกหมวดหมู่ แต่ละช่องอัปโหลดได้ถึง 300 คลิป วิดีโอ 17,250 คลิปที่พิจารณาหลังจากตัดออก วิดีโอถูกให้คะแนนเทียบกับค่ามัธยฐานแบบเลื่อนของเพื่อนบ้าน และคู่ถูกสร้างขึ้นเฉพาะภายในช่องเดียวกัน ที่เผยแพร่ห่างกันเฉลี่ย 6 วัน โดยวิดีโอที่ทำได้ดีกว่าเอาชนะวิดีโอที่ทำได้แย่กว่าด้วยค่ามัธยฐาน 4.7 เท่า

กฎทุกข้อ — การตัดออก ข้อจำกัดในการจับคู่ การทดสอบหลัก ตัวควบคุมสี่ตัว และคำพูดที่จะเผยแพร่หากผลลัพธ์เป็นศูนย์ — ถูกเขียนและบันทึกเวลาไว้ก่อนที่จะให้คะแนนวิดีโอใดๆ คะแนนเลือกวิดีโอที่ทำได้ดีกว่าใน 59.5% ของคู่ เทียบกับค่าฐาน 50%

ส่วนที่ควรลอกเลียนไม่ใช่ขนาดตัวอย่าง แต่คือการวิเคราะห์ไม่มีการตัดสินใจเหลืออยู่เมื่อข้อมูลมาถึง

คำถามที่พบบ่อย

ฉันต้องการวิดีโอจำนวนเท่าไหร่เพื่อทดสอบสไตล์ thumbnail?

มากกว่าที่ช่องส่วนใหญ่สามารถผลิตได้เร็วๆ นี้ การตรวจจับผลของ packaging ที่เล็กน้อยอย่างน่าเชื่อถือ ต้องใช้การเปรียบเทียบหลายร้อยครั้ง นี่คือเหตุผลว่าทำไมผลลัพธ์จากวิดีโอเดียวจึงเป็นหลักฐานอ่อน ด้วยวิดีโอสิบคลิปต่อเงื่อนไข คุณสามารถสังเกตผลที่ใหญ่ได้ แต่คุณไม่สามารถสังเกตผลที่ละเอียดอ่อนได้ และการถือว่าความแตกต่างเล็กน้อยเป็นหลักฐานที่ขนาดตัวอย่างนั้น คือข้อผิดพลาดการทดสอบที่พบบ่อยที่สุด

ฉันควรเปรียบเทียบยอดวิวของวิดีโอกับอะไร?

ค่ามัธยฐานของยอดวิวของอัปโหลด 10 คลิปก่อนและ 10 คลิปหลัง ยกเว้นตัววิดีโอเอง สิ่งนี้ทำให้ขนาด ความเติบโต และยุคสมัยของช่องของคุณคงที่โดยประมาณ ดังนั้นสิ่งที่เหลืออยู่จึงมีแนวโน้มว่าเกี่ยวกับวิดีโอมากกว่า การเปรียบเทียบกับค่าเฉลี่ยตลอดชีพ วัดว่าช่องของคุณเติบโตมากแค่ไหนแทน

ทำไมต้องใช้ค่ามัธยฐานแทนค่าเฉลี่ย?

เพราะวิดีโอที่ประสบความสำเร็จผิดปกติหนึ่งคลิปภายในหน้าต่างจะดึงค่าฐานแบบเฉลี่ยขึ้นไป และทำให้เพื่อนบ้าน 20 คลิปดูเหมือนทำได้แย่ ค่ามัธยฐานแทบไม่ได้รับผลกระทบจากค่าผิดปกติเพียงค่าเดียว ดังนั้นค่าฐานจึงยังอธิบายวิดีโอทั่วไปจากช่วงเวลานั้น แทนที่จะเป็นวิดีโอที่พิเศษ

ฉันควรรอ多久ก่อนตัดสินผลลัพธ์ของวิดีโอ?

อย่างน้อยหกสัปดาห์ ยอดวิวสะสมไม่สม่ำเสมอ และอันดับของวิดีโอเทียบกับเพื่อนบ้านสามารถเปลี่ยนแปลงได้มากในเดือนแรก ในงานศึกษาของเรา เราตัดวิดีโอที่เผยแพร่ภายใน 45 วันก่อนวันวัดผล และวิดีโอที่อายุเกินสองปี ด้วยเหตุผลนี้

ฉันสามารถเชื่อผลการทดสอบ thumbnail ที่เปรียบเทียบแค่วิดีโอสองคลิปได้ไหม?

ถือว่าเป็นคำใบ้ ไม่ใช่ผลลัพธ์ วิดีโอสองคลิปแตกต่างกันในหัวข้อ เวลา ความยาว และอีกหลายสิ่ง ดังนั้นการให้เหตุผลว่าช่องว่างทั้งหมดเกิดจาก packaging ถือว่าสิ่งอื่นคงที่ มันคุ้มค่าที่จะสังเกตและคุ้มค่าที่จะทำซ้ำ แต่มันไม่ใช่พื้นฐานในการเปลี่ยนแนวทางทั่วช่อง

ค่ามัลติเพิลของยอดวิวคืออะไร และฉันคำนวณมันอย่างไร?

หารยอดวิวของวิดีโอโดยค่ามัธยฐานของยอดวิวของอัปโหลดเพื่อนบ้าน ยกเว้นตัววิดีโอเอง ผลลัพธ์ที่ 1.0 หมายความว่ามันทำได้เหมือนเพื่อนบ้าน 2.0 หมายความว่าดีกว่าสองเท่า 0.5 หมายความว่าครึ่งหนึ่ง มันแปลงยอดวิวดิบ ซึ่งขึ้นอยู่กับว่าอัปโหลดเมื่อไหร่ ให้เป็นตัวเลขที่สามารถเปรียบเทียบข้ามประวัติของช่องคุณได้