Bạn thay đổi một thumbnail, video tiếp theo có hiệu suất tốt hơn, và bạn kết luận phong cách mới hoạt động. Kết luận này thường sai — không phải vì thumbnail không có tác dụng, mà vì phép so sánh không thể phát hiện được nó có tác dụng hay không. Dưới đây là cách phân biệt kết quả thiết kế thực sự với sự trùng hợp, sử dụng cùng các quy tắc chúng tôi áp dụng khi thử nghiệm mô hình chấm điểm của chính mình trên 321 cặp video.
Điểm chính
- So sánh một video với trung bình mọi thời điểm của kênh đo lường mức độ phát triển của kênh, chứ không phải chất lượng thiết kế.
- Thay vào đó, hãy so sánh với trung vị của mười video trước và sau nó, loại trừ chính video đó.
- Hai video là chưa đủ. Sự khác biệt nhỏ giữa các video đơn lẻ không thể phân biệt được với sự biến động thông thường theo tuần.
- Hãy quyết định trước khi xem dữ liệu, điều gì được coi là chiến thắng — nếu không, bạn sẽ luôn tìm thấy một “chiến thắng” nào đó trong dữ liệu.
- Một thử nghiệm không thể cho ra kết quả tiêu cực thì không phải là thử nghiệm. Hãy ghi lại điều gì sẽ khiến bạn từ bỏ ý tưởng đó.
Tại sao hầu hết kết quả thử nghiệm thumbnail không phải là thật
Thử nghiệm điển hình của người sáng tạo so sánh một video với video trước đó. Phép so sánh này chứa mọi thứ đã thay đổi giữa hai lần đăng tải: chủ đề, ngày trong tuần, độ dài, liệu thuật toán có tình cờ đẩy video đó hay không, và thiết kế. Việc quy toàn bộ sự khác biệt cho thumbnail giả định rằng các biến số khác không thay đổi — và chúng luôn thay đổi.
Kết quả là gần như bất kỳ thay đổi nào cũng trông như có hiệu quả, vì số lượt xem tự thân đã biến động rất nhiều. Sự chênh lệch giữa các video liên tiếp trên một kênh khỏe mạnh thường lớn hơn hẳn tác động của một quyết định thiết kế.
Đây không phải lý do để ngừng thử nghiệm. Đây là lý do để xây dựng phép so sánh sao cho tiếng ồn được tính đến thay vì bị nhầm lẫn với tín hiệu.
Bạn nên so sánh một video với cái gì
Hãy so sánh mỗi video với các video lân cận, chứ không phải với lịch sử kênh của bạn. Lấy mười video trước và mười video sau, tìm trung vị số lượt xem của hai mươi video đó, và biểu thị lượt xem của video đó dưới dạng bội số của trung vị đó. Một video ở mức 1.0 có hiệu suất giống hệt khu vực lân cận. Ở mức 2.5 nghĩa là tốt hơn hai rưỡi lần.
Hai chi tiết quan trọng và cả hai đều dễ bị sai. Hãy dùng trung vị thay vì trung bình, vì một video viral đơn lẻ trong cửa sổ sẽ làm thay đổi mốc chuẩn cho hai mươi video lân cận. Và loại trừ chính video đó khỏi mốc chuẩn của nó, nếu không mọi video sẽ bị kéo về mức 1.0 và các cực trị bạn quan tâm sẽ bị làm phẳng.
| Phương pháp so sánh | Điều gì được kiểm soát | Nơi nó thất bại |
|---|---|---|
| So sánh với video trước đó | Gần như không gì | Một điểm dữ liệu nhiễu so với điểm khác |
| So sánh với trung bình mọi thời điểm | Không gì liên quan đến thời gian | Kênh đang phát triển khiến mọi video gần đây trông như thành công |
| So sánh với 30 ngày gần nhất | Kích thước kênh, một cách khái quát | Theo mùa, và một video viral đơn lẻ làm lệch trung bình |
| So sánh với trung vị lăn của các video lân cận | Kích thước kênh, sự phát triển, thời kỳ | Vẫn không thể tách biệt chủ đề khỏi thiết kế |
Tại sao cửa sổ lân cận lại hiệu quả
Một kênh tăng gấp ba kích thước trong mười tám tháng sẽ cho thấy mọi video gần đây đều vượt trội hơn trung bình mọi thời điểm, và mọi video cũ hơn đều kém hơn. Khi xếp hạng theo cách đó, kết luận về thiết kế bạn đưa ra thực ra là một tuyên bố về thời điểm mỗi video được đăng.
Cửa sổ lăn loại bỏ điều đó, vì các video lân cận của một video được đăng tải trong cùng một kênh, cùng quy mô khán giả và cùng điều kiện thuật toán. Những gì còn lại nhiều khả năng liên quan đến chính video đó.
Mức chênh lệch bao nhiêu được coi là khác biệt thực sự
Một ngưỡng hữu ích là hệ số hai. Khi chúng tôi chọn các cặp video cho nghiên cứu của mình, chúng tôi yêu cầu video có hiệu suất tốt hơn phải có bội số lượt xem ít nhất gấp đôi video kém hơn. Bất cứ điều gì nhỏ hơn là yêu cầu một thử nghiệm phân biệt giữa hai video mà chính tiếng ồn của kênh có thể dễ dàng tạo ra sự khác biệt.
Tỷ lệ dưới khoảng 1.3 nên được coi là không có kết quả. Đây không phải ngưỡng tuyệt đối — nó phụ thuộc vào mức độ biến động của kênh bạn — nhưng nó gần đúng hơn nhiều so với việc coi sự khác biệt 10% là bằng chứng.
Nửa còn lại của câu hỏi là bạn cần bao nhiêu phép so sánh. Một cặp video không nói lên điều gì. Con số khó chịu là để phát hiện một hiệu ứng thiết kế khiêm tốn một cách đáng tin cậy cần hàng trăm phép so sánh, đó là lý do tại sao các người sáng tạo cá nhân gặp khó khăn trong việc chứng minh bất cứ điều gì về kênh của họ và lý do trung thực là coi kết quả đơn lẻ là bằng chứng yếu chứ không phải bằng chứng chắc chắn.
Kiểm tra danh sách để thử nghiệm thiết kế trên kênh của bạn
Năm bước này biến một ấn tượng thành thứ gần với một phép đo. Không bước nào yêu cầu công cụ vượt quá bảng tính.
- Viết ra, trước khi bắt đầu, điều gì sẽ thuyết phục bạn rằng thay đổi đó không hiệu quả. Một thử nghiệm không có kết quả thất bại thì không phải là thử nghiệm.
- Tính bội số lượt xem của mỗi video so với trung vị của các video lân cận, thay vì so với bất kỳ con số nào trong toàn bộ lịch sử.
- Thu thập ít nhất mười video trong mỗi điều kiện trước khi đưa ra bất kỳ kết luận nào, và đừng nhìn vào tổng cộng đang chạy giữa chừng.
- Loại trừ Shorts, livestream, hợp tác và bất cứ thứ gì dưới sáu tuần tuổi, vì cả bốn đều có các yếu tố thúc đẩy hiệu suất không liên quan đến thiết kế.
- Kiểm tra xem có giải thích đơn giản hơn nào phù hợp không — một chủ đề bạn chưa từng đề cập, một video được chia sẻ ở đâu đó, một đợt tăng đột biến theo mùa.
Bước ba là bước mọi người thường bỏ qua, và dừng thử nghiệm ngay khi nó trông có vẻ thuận lợi là cách hiệu quả nhất để tự thuyết phục mình về điều gì đó không đúng sự thật.
Nếu bạn muốn đánh giá thiết kế trước khi video được đăng thay vì vài tuần sau đó, bạn có thể chấm điểm thumbnail và tiêu đề dựa trên mười hai yếu tố thiết kế và so sánh hai lựa chọn cạnh nhau — một dự đoán bạn sau đó có thể kiểm tra với kết quả thực tế khi video đã trưởng thành.
Những sai lầm khiến một thử nghiệm trông có vẻ kết luận khi thực tế không phải vậy
Bốn kiểu thất bại giải thích phần lớn các kết luận sai lầm, và mỗi kiểu đều có cách khắc phục đơn giản.
Dừng lại khi kết quả trông tốt
Kiểm tra kết quả khi chúng tích lũy và dừng lại ở thời điểm thuận lợi đầu tiên sẽ tạo ra kết quả tích cực từ tiếng ồn thuần túy nếu bạn đủ kiên nhẫn. Hãy cố định kích thước mẫu trước và phân tích một lần. Trong nghiên cứu của chúng tôi, chúng tôi cố ý loại bỏ hoàn toàn quyết định dừng: mẫu là bất cứ điều gì các quy tắc đã đặt trước tạo ra, tổng cộng 321 cặp so với mục tiêu 400.
Chúng tôi báo cáo sự thiếu hụt đó là thiếu sức mạnh thay vì lặng lẽ kéo dài việc thu thập, vì một quy tắc dừng mà bất kỳ ai cũng có thể áp dụng trong khi theo dõi kết quả là cách một kết quả rỗng trở thành một phát hiện.
Cắt lại dữ liệu cho đến khi có điều gì đó hoạt động
Nếu kết quả tổng thể bằng phẳng, bạn có thể bị cám dỗ kiểm tra xem nó có hoạt động với video dài, hoặc với một danh mục, hoặc với video đăng vào thứ Ba hay không. Thử nghiệm đủ nhiều nhóm con và một trong số đó sẽ trông có ý nghĩa chỉ do ngẫu nhiên. Hãy quyết định trước khi xem, phép so sánh nào quan trọng, và gán nhãn mọi thứ khác là khám phá khi bạn báo cáo.
Chúng tôi đã áp dụng các quy tắc này cho 321 cặp video như thế nào
Nghiên cứu của chúng tôi tuân theo đúng cấu trúc này. Sáu mươi kênh trong sáu danh mục, mỗi kênh lên đến 300 video, 17.250 video được xem xét sau khi loại trừ. Các video được chấm điểm so với trung vị lăn của các video lân cận, và các cặp chỉ được tạo trong cùng một kênh, được đăng trung bình cách nhau sáu ngày, với video vượt trội hơn video kém hơn với hệ số trung vị là 4,7.
Mọi quy tắc — loại trừ, ràng buộc ghép cặp, thử nghiệm chính, bốn kiểm soát và cách diễn đạt để công bố nếu kết quả là rỗng — đều được viết và đánh dấu thời gian trước khi bất kỳ video nào được chấm điểm. Điểm số chọn đúng video có hiệu suất tốt hơn trong 59,5% các cặp so với mốc chuẩn 50%.
Phần đáng sao chép không phải là kích thước mẫu. Đó là việc phân tích không còn bất kỳ quyết định nào khi dữ liệu đến.
Câu hỏi thường gặp
Tôi cần bao nhiêu video để thử nghiệm một phong cách thumbnail?
Nhiều hơn hầu hết các kênh có thể sản xuất nhanh chóng. Để phát hiện một hiệu ứng thiết kế khiêm tốn một cách đáng tin cậy cần hàng trăm phép so sánh, đó là lý do tại sao kết quả từ một video là bằng chứng yếu. Với mười video mỗi điều kiện, bạn có thể nhận ra một hiệu ứng lớn; bạn không thể nhận ra một hiệu ứng tinh vi, và coi sự khác biệt nhỏ là bằng chứng ở kích thước mẫu đó là sai lầm thử nghiệm phổ biến nhất.
Tôi nên so sánh lượt xem của một video với cái gì?
Trung vị số lượt xem của mười video trước và mười video sau, loại trừ chính video đó. Điều này giữ cho kích thước, sự phát triển và thời kỳ của kênh bạn gần như không đổi, nên những gì còn lại nhiều khả năng liên quan đến video đó. So sánh với trung bình mọi thời điểm đo lường mức độ phát triển của kênh bạn thay vì thế.
Tại sao dùng trung vị thay vì trung bình?
Vì một video thành công bất thường trong cửa sổ sẽ kéo mốc chuẩn trung bình lên cao và khiến hai mươi video lân cận đều trông như dưới mức. Trung vị hầu như không bị ảnh hưởng bởi một điểm ngoại lệ, nên mốc chuẩn tiếp tục mô tả một video điển hình trong giai đoạn đó thay vì một video đặc biệt.
Tôi nên đợi bao lâu trước khi đánh giá hiệu suất của một video?
Ít nhất sáu tuần. Lượt xem tích lũy không đều, và xếp hạng của một video so với các video lân cận có thể thay đổi đáng kể trong tháng đầu tiên. Trong nghiên cứu của chúng tôi, chúng tôi loại trừ bất cứ thứ gì được đăng trong vòng 45 ngày tính đến ngày đo lường vì chính lý do này, cùng với bất cứ thứ gì trên hai năm tuổi.
Tôi có thể tin tưởng một thử nghiệm thumbnail chỉ so sánh hai video không?
Hãy coi đó là một gợi ý thay vì kết quả. Hai video khác nhau về chủ đề, thời điểm, độ dài và hàng chục yếu tố khác, nên quy toàn bộ khoảng cách cho thiết kế giả định rằng mọi thứ khác đều không thay đổi. Việc nhận ra và lặp lại thử nghiệm này là đáng giá, nhưng không phải là cơ sở để thay đổi cách tiếp cận toàn kênh.
Bội số lượt xem là gì và tôi tính nó như thế nào?
Chia số lượt xem của một video cho trung vị lượt xem của các video lân cận, loại trừ chính nó. Kết quả 1.0 nghĩa là nó hoạt động như khu vực lân cận, 2.0 nghĩa là tốt gấp đôi, 0.5 nghĩa là bằng một nửa. Nó chuyển đổi số lượt xem thô, vốn phụ thuộc nhiều vào thời điểm video được đăng, thành một con số có thể so sánh qua toàn bộ lịch sử kênh của bạn.