nghiên cứuthumbnailphân tích youtube

Chúng tôi đã kiểm tra Điểm Thumbnail trên 321 video thực tế

Một bài kiểm tra đã đăng ký trước để xem liệu điểm thumbnail và tiêu đề YouTube có phản ánh hiệu suất thực tế hay không. 321 cặp video cùng kênh, 4 kiểm soát, và kết quả chúng tôi cam kết công bố bất kể ra sao.

September 4, 20269 min read
Chúng tôi đã kiểm tra Điểm Thumbnail trên 321 video thực tế

Một điểm thumbnail chỉ có giá trị nếu nó phản ánh điều thực sự xảy ra trên YouTube. Vì vậy, chúng tôi đã thực hiện một bài kiểm tra có thể khiến chúng tôi xấu hổ: 321 cặp video thực tế được ghép đôi, mỗi cặp đến từ cùng một kênh, một video vượt trội hơn mức trung bình của kênh đó và một video không đạt. Chúng tôi đã ghi lại phương pháp trước khi xem bất kỳ dữ liệu nào. Điểm số đã chọn đúng video có hiệu suất tốt hơn 59,5% thời gian, so với 50% nếu tung đồng xu.

Điểm chính

  • Trong 321 cặp, điểm số xếp video có hiệu suất tốt hơn cao hơn 59,5% thời gian (p = 0,00079). Cơ hội ngẫu nhiên là 50%.
  • So sánh video giữa các kênh khác nhau đo lường số lượng người đăng ký, không phải bao bì — mỗi cặp ở đây đều đến từ một kênh, được đăng trung bình cách nhau sáu ngày.
  • Trên các kênh mà mọi thumbnail đều theo cùng một mẫu, độ chính xác giảm xuống 48,7%. Đó là kết quả chúng tôi mong muốn: không có sự khác biệt để đọc, không có tín hiệu để tìm.
  • Bốn quy tắc đơn giản — tiêu đề dài hơn, nhiều từ hơn, tệp lớn hơn, độ tương phản cao hơn — đều ở mức ngẫu nhiên. Điểm số không phải là đại diện cho bất kỳ yếu tố nào trong số đó.
  • Khoảng cách càng lớn mà mô hình đặt giữa hai video, thì càng thường xuyên đúng: 56% ở khoảng cách 1-3 điểm, 76,5% ở 15 điểm trở lên.

Điểm thumbnail YouTube có thực sự dự đoán hiệu suất không?

Trong bài kiểm tra này, có — một cách khiêm tốn và có thể đo lường. Khi cho hai video từ cùng một kênh, một video rõ ràng vượt trội hơn mức cơ sở của nó và một video rõ ràng dưới mức, điểm số của chúng tôi xếp đúng 59,5% thời gian. Cơ hội ngẫu nhiên là 50%. Khoảng tin cậy 95% dao động từ 53,9% đến 64,9%, nên hiệu ứng là có thật nhưng nhỏ.

Nhỏ là câu trả lời trung thực, và bất kỳ ai tuyên bố nhiều hơn đang bán thứ gì đó. Bao bì chỉ là một yếu tố trong nhiều yếu tố. Chủ đề, thời điểm đăng tải, tâm trạng của thuật toán trong tuần đó, liệu video có được chia sẻ ở đâu đó ngoài nền tảng hay không — tất cả đều ảnh hưởng đến lượt xem nhiều hơn thumbnail. Một điểm số tuyên bố độ chính xác 90% sẽ mô tả một YouTube không tồn tại.

59,5% có nghĩa gì trong thực tế: nếu bạn đang chọn giữa hai lựa chọn cho cùng một video, điểm số tốt hơn việc đoán mò, và nó hữu ích hơn khi nó mạnh mẽ ưu tiên một lựa chọn.

Tại sao so sánh thumbnail giữa các kênh không cho bạn thông tin gì

Bản rõ ràng nhất của bài kiểm tra này là chấm điểm một loạt thumbnail và tương quan điểm số với số lượt xem. Điều đó đo lường quy mô kênh. Lượt xem được thúc đẩy bởi số lượng người đăng ký, chủ đề và tuổi của video nhiều hơn nhiều so với bao bì, và yếu tố gây nhiễu chạy theo hướng tích cực: các kênh lớn có thể chi trả cho nhà thiết kế giỏi có lượng khán giả lớn.

Thực hiện bài kiểm tra đó và bạn sẽ nhận được một tương quan dương đẹp mắt nhưng không có ý nghĩa gì. Nó sẽ tồn tại chính xác một độc giả hoài nghi.

So sánh công bằng phải giữ nguyên những gì

So sánh hai video từ cùng một kênh loại bỏ số lượng người đăng ký, khán giả, ngân sách và năng lực thiết kế trong một bước, vì cả bốn yếu tố này đều giống nhau trong cặp. Yêu cầu hai video được đăng gần nhau cũng loại bỏ đường cong tăng trưởng của kênh và chế độ thuật toán trong giai đoạn đó.

Điều còn lại là một câu hỏi có câu trả lời đã biết dưới giả thuyết không: cho hai video mà khán giả của kênh đó xử lý rất khác nhau, điểm số có thể nói được đâu là video nào không?

Chúng tôi đã xây dựng một bài kiểm tra công bằng trên 321 cặp được ghép đôi như thế nào

Chúng tôi lấy 60 kênh từ sáu danh mục — công nghệ, giáo dục, nấu ăn, game, thể dục và lối sống — và kéo tối đa 300 video tải lên gần đây từ mỗi kênh. Sau khi loại trừ, còn lại 17.250 video được xem xét và 321 cặp có thể sử dụng. Mỗi cặp đều cùng kênh, được đăng trung bình cách nhau sáu ngày, với video vượt trội hơn video dưới mức trung bình với hệ số trung vị là 4,7.

Hiệu suất được đo lường so với mức cơ sở cục bộ trượt, không phải mức trung bình toàn kênh. Đối với mỗi video, chúng tôi lấy trung vị lượt xem của mười video tải lên lân cận ở cả hai bên, loại trừ chính nó, và biểu thị lượt xem của nó dưới dạng bội số của mức đó. Một kênh tăng gấp năm lần trong hai năm sẽ khiến mọi video sớm bị gắn nhãn là thất bại và mọi video gần đây là thành công — đo lường lịch, không phải bao bì.

Các quy tắc ghép cặp đã được cố định trước:

  1. Cả hai video đều đến từ cùng một kênh, và mỗi video xuất hiện trong tối đa một cặp.
  2. Chúng được đăng trong vòng 120 ngày kể từ nhau.
  3. Video vượt trội hơn video dưới mức ít nhất gấp đôi, để “tốt hơn” và “kém hơn” có ý nghĩa thay vì mô tả nhiễu.
  4. Không có kênh nào đóng góp quá tám cặp, để một người tải lên năng suất cao không thể thống trị mẫu.

Shorts bị loại trừ, cùng với livestream, video dưới 45 ngày tuổi và bất cứ thứ gì trên hai năm tuổi. Điểm số chỉ nhìn thấy thumbnail và tiêu đề — chính xác những gì công cụ nhận được từ người dùng — và không có thông tin gì về lượt xem hoặc bên nào của cặp nó đang xem.

Điểm số đã đúng điều gì, và bao lâu một lần

Mô hình đã chọn đúng video có hiệu suất tốt hơn trong 191/321 cặp: 59,5%, với giá trị p nhị thức chính xác là 0,00079 so với giả thuyết không 50%. Mười bảy cặp trả về kết quả hòa hoàn toàn, và mỗi cặp đó đều được tính là thất bại thay vì chia đôi hoặc loại bỏ, vì một điểm số không thể phân biệt hai đầu vào đã không phân biệt giữa chúng.

Việc tính các trường hợp hòa là thất bại khiến con số chính thức mang tính bảo thủ. Một mô hình hoàn toàn không có khả năng sẽ đạt khoảng 47,4% theo quy tắc đó, không phải 50%, nên bài kiểm tra yêu cầu mô hình của chúng tôi vượt qua một ngưỡng hơi cao hơn mức ngẫu nhiên thực tế. Trong 304 cặp mà nó thực sự phân biệt được, nó đúng 62,8% thời gian.

Độ tin cậy đi kèm với độ chính xác

Mẫu hình khiến kết quả hành xử như một phép đo thay vì một sự trùng hợp: khoảng cách càng lớn mà điểm số đặt giữa hai video, thì càng thường xuyên đúng.

Ở khoảng cách 1-3 điểm, độ chính xác là 56,0%. Ở 4-7 điểm, 64,1%. Ở 8-14 điểm, 63,2%. Ở 15 điểm trở lên, 76,5%. Một mô hình tạo ra nhiễu sẽ cho thấy một đường thẳng ngang qua các nhóm đó. Mô hình này ngày càng tốt hơn khi nó trở nên chắc chắn hơn, đó là hành vi bạn muốn và không thể giả mạo.

Bốn kiểm tra có thể chứng minh chúng tôi sai

Một nghiên cứu không thể thất bại thì không phải bằng chứng. Chúng tôi đã xác định trước bốn kiểm soát, mỗi kiểm soát có khả năng vô hiệu hóa tiêu đề, và cam kết công bố cả bốn bất kể chúng cho thấy điều gì. Tất cả đều hành xử như dự kiến.

Kiểm soátĐiều một thất bại sẽ có nghĩaKết quả
Xáo trộn nhãn người chiến thắng/người thua 1.000 lầnQuy trình rò rỉ câu trả lời; toàn bộ kết quả vô hiệu47,1%, chính xác nơi lý thuyết nói nó phải rơi vào
Các kênh có thumbnail theo một mẫu cố địnhĐiểm số đang đọc thứ gì đó khác ngoài bao bì48,7% — ngẫu nhiên, như dự đoán
Các quy tắc đơn giản: độ dài tiêu đề, số từ, kích thước tệp, độ tương phảnMột quy tắc một dòng khớp với mô hình, nên mô hình không thêm gì mới46,7%-54,5%, không có cái nào có ý nghĩa thống kê
Chấm điểm lại mọi thumbnail so với tiêu đề của video kiaTiêu đề không đóng góp gì và chúng tôi chỉ chấm điểm một nửa, không phải haiĐiểm số thay đổi trung bình 11,3 điểm

Kiểm soát mẫu là điều quan trọng nhất, và đáng để làm rõ lý do tại sao. Trên các kênh tái sử dụng một bố cục thumbnail duy nhất cho mọi thứ, gần như không có gì để mô hình thị giác so sánh. Nếu điểm số của chúng tôi tự tin chọn người chiến thắng ở đó, nó sẽ đang đọc danh tính kênh hoặc thời kỳ đăng tải thay vì bao bì. Nó đạt 48,7% trên những kênh đó và 61,0% ở mọi nơi khác. Khoảng cách đó là bằng chứng mạnh nhất của nghiên cứu cho thấy điều đang được đo lường là điều chúng tôi tuyên bố.

Chiều nào trong điểm số phân biệt người chiến thắng khỏi người thua

Phần này mang tính khám phá hơn là xác nhận, và mô tả mẫu này thay vì YouTube nói chung. Xếp hạng mười hai điểm con theo mức độ phân tách hai nhóm, sự phân tách rõ ràng nhất đến từ độ rõ ràng của lời hứa, tiếp theo là tín hiệu sợ bỏ lỡ và sự cấp bách. Cường độ cảm xúc gần như không phân tách chúng.

Độ rõ ràng của lời hứa — mức độ rõ ràng mà bao bì nói cho bạn biết bạn sắp xem gì — dẫn đầu bảng phù hợp với điều mà phần hài lòng của mô hình được xây dựng để nắm bắt. Nửa thú vị hơn là cường độ cảm xúc thô: cảm xúc mạnh trong thumbnail không phân biệt được video vượt trội và dưới mức trong mẫu này, điều mà hầu hết lời khuyên về thumbnail đều giả định.

Nếu bạn muốn xem các chiều này trên bao bì của riêng mình thay vì tổng hợp, bạn có thể chạy một thumbnail và tiêu đề qua cùng quy trình chấm điểm mà nghiên cứu này sử dụng — đó là cùng đường dẫn mã, không phải phiên bản demo.

Bài kiểm tra này không chứng minh điều gì

Bốn giới hạn, tất cả đều được ghi lại trước khi dữ liệu tồn tại.

Nó kiểm tra điểm số, không phải lời khuyên. Việc thực hiện một tiêu đề được đề xuất có thực sự cải thiện một video thực tế hay không là một thí nghiệm khác mà chúng tôi chưa thực hiện. Nó mang tính quan sát thay vì nhân quả: không có gì ở đây cho thấy thay đổi thumbnail sẽ thay đổi lượt xem, chỉ có rằng điểm số liên quan đến sự khác biệt đã tồn tại.

Mẫu quyết định đối tượng mà kết quả áp dụng

Các cặp được chọn chính xác vì chúng khác biệt rõ rệt về hiệu suất, nên 59,5% mô tả dân số đó — rõ ràng vượt trội so với rõ ràng dưới mức — chứ không phải bất kỳ hai video nào được chọn ngẫu nhiên. Mỗi kênh đều đã thiết lập, sử dụng tiếng Anh và đủ lớn để có mức cơ sở ổn định. Không có gì ở đây có thể khái quát hóa cho một kênh có mười hai video tải lên và không có lịch sử để đo lường.

Lượt xem được ghi lại vào một ngày duy nhất và tiếp tục tăng. Toàn bộ thứ này là một bức ảnh chụp nhanh, và cách trung thực để đối xử với một bức ảnh chụp nhanh là chụp thêm một bức ảnh khác sau này.

Câu hỏi thường gặp

Độ chính xác 59,5% có tốt cho một điểm thumbnail không?

Đối với một tín hiệu bao bì đơn lẻ so với kết quả thực tế, có. Lượt xem chủ yếu phụ thuộc vào chủ đề, quy mô khán giả, thời điểm và may mắn thuật toán, nên điểm số thumbnail và tiêu đề chỉ có thể giải thích một phần. Một con số gần 90% sẽ cho thấy lỗ hổng trong thiết kế bài kiểm tra thay vì một mô hình tốt hơn. Cách tiếp cận hữu ích là nó vượt trội hơn việc đoán mò, và vượt trội hơn khi nó tự tin hơn.

Tại sao không chỉ so sánh điểm thumbnail với lượt xem trực tiếp?

Vì điều đó đo lường quy mô kênh. Số lượng người đăng ký, chủ đề và tuổi của video ảnh hưởng đến lượt xem nhiều hơn nhiều so với bao bì, và các kênh lớn thường có cả nhà thiết kế giỏi và khán giả lớn — nên tương quan ra dương vì những lý do không liên quan đến thumbnail. So sánh hai video từ cùng một kênh loại bỏ tất cả những yếu tố đó trong một bước.

Việc tính các trường hợp hòa là thất bại có nghĩa gì?

Mười bảy cặp nhận được điểm số giống nhau ở cả hai bên. Thay vì chia đôi hoặc loại bỏ chúng, cả hai đều được ghi lại là sai. Một điểm số không thể phân biệt hai đầu vào đã không phân biệt giữa chúng. Điều này khiến 59,5% được báo cáo thấp hơn so với các cách xử lý thay thế.

Điểm thumbnail cao hơn có nghĩa là nhiều lượt xem hơn không?

Không. Nghiên cứu cho thấy sự liên kết qua nhiều cặp, không phải lời hứa về bất kỳ video đơn lẻ nào. Khoảng bốn trong mười cặp được xếp sai thứ tự. Bao bì chỉ là một đòn bẩy trong nhiều đòn bẩy, và một điểm số mạnh trên video mà không ai muốn xem sẽ không cứu được nó.

60 kênh được chọn như thế nào?

Theo một quy tắc được cố định trước khi bất kỳ dữ liệu nào được thu thập: các kênh được biết đến rộng rãi với lịch sử tải lên dài, mười kênh trong mỗi sáu danh mục nội dung, được chọn để đảm bảo phạm vi danh mục thay vì bất cứ điều gì về thumbnail của chúng. Danh sách đã được đóng băng và ghi lại trước khi bắt đầu chấm điểm, nên không có kênh nào có thể được thêm hoặc loại bỏ sau khi kết quả bắt đầu xuất hiện.

Tôi có thể xem phương pháp và tự kiểm tra không?

Toàn bộ đăng ký trước — loại trừ, quy tắc ghép cặp, bài kiểm tra chính, cả bốn kiểm soát, và cách diễn đạt đã cam kết trước cho kết quả không — đã được viết và đánh dấu thời gian trước khi bất kỳ video nào được chấm điểm. Kết quả tổng hợp được báo cáo ở đây; dữ liệu video cơ bản không được xuất bản lại, phù hợp với điều khoản API của YouTube.