Nếu bạn từng dán hai thumbnail vào chat AI và hỏi cái nào sẽ có nhiều lượt nhấp hơn, bạn đã thực hiện một thí nghiệm không có nhóm đối chứng. Chúng tôi đã thực hiện nó với nhóm đối chứng: 161 cặp video thực tế mà chúng tôi đã biết cái nào hoạt động tốt hơn, mỗi cặp được hiển thị cho AI hai lần, mỗi lần theo một thứ tự. Thumbnail mà nó thấy đầu tiên hóa ra quyết định phần lớn câu trả lời của nó.
Điểm chính
- Khi được hiển thị hai thumbnail từ cùng một kênh, AI chọn cái nào xuất hiện trước 64,7% thời gian. Một người đánh giá không có thiên hướng về vị trí sẽ ở mức gần 50%.
- Khi người chiến thắng thực sự được hiển thị đầu tiên, AI đúng 77,3% thời gian. Khi cùng người chiến thắng đó được hiển thị thứ hai, chỉ 48,0%.
- Trung bình theo cả hai thứ tự, nó đúng 62,7% thời gian — chính xác bằng điểm số đánh giá từng thumbnail riêng lẻ. So sánh cạnh nhau không thêm độ chính xác.
- Nó đưa ra câu trả lời ngược nhau khi chỉ có thứ tự thay đổi ở 30,7% cặp.
- Nó hầu như không bao giờ thừa nhận sự nghi ngờ: một câu trả lời điển hình tuyên bố 85% độ tin cậy trong khi mô hình đúng khoảng 63% thời gian.
AI có thể nói cho bạn biết thumbnail nào sẽ hoạt động tốt hơn không?
Đôi khi, nhưng không theo cách bạn có thể tin tưởng từ một câu trả lời duy nhất. Trung bình theo cả hai thứ tự, mô hình chúng tôi kiểm tra chọn được thumbnail hoạt động tốt hơn 62,7% thời gian — chính xác bằng số điểm mà chúng tôi đạt được khi đánh giá từng thumbnail riêng lẻ. Nhưng lựa chọn của nó phụ thuộc vào hình ảnh nào nó thấy trước: 77,3% đúng khi người chiến thắng xuất hiện trước, 48,0% khi nó xuất hiện sau.
Nói đơn giản, một câu trả lời duy nhất hành xử như một đồng xu thường rơi vào lựa chọn đầu tiên. Thông tin có ở đó — khi mô hình đưa ra cùng câu trả lời cả hai chiều, nó đúng thường xuyên hơn ngẫu nhiên — nhưng bạn chỉ tìm thấy nó bằng cách hỏi hai lần.
Chúng tôi kiểm tra như thế nào: các cặp thực tế với câu trả lời đã biết, hiển thị cả hai chiều
Các cặp này đến từ bài kiểm tra đã công bố của điểm số chúng tôi: hai video từ cùng một kênh, được đăng gần nhau, một cái rõ ràng vượt trội hơn mức trung bình gần đây của kênh và một cái rõ ràng kém hơn. Sử dụng cùng một kênh loại bỏ số lượng người đăng ký, đối tượng và ngân sách sản xuất, nên điều khác biệt giữa hai cái chủ yếu là cách trình bày.
Chúng tôi sử dụng 161 cặp từ một nửa số kênh trong nghiên cứu và giữ nửa còn lại không thay đổi. AI — cùng mô hình thị giác hỗ trợ điểm số của chúng tôi — được hiển thị cả hai thumbnail cùng tiêu đề thực tế, được thông báo rằng một cái đã vượt trội hơn mức xem thông thường của kênh và một cái đã dưới mức, và được hỏi cái nào là cái nào. Mười một trong 322 câu trả lời không thể sử dụng, để lại 150 cặp được trả lời theo cả hai thứ tự.
Tại sao mỗi cặp phải được hiển thị hai lần
Một AI so sánh hai lựa chọn có thể thích một vị trí bất kể nội dung, giống như một số người thích mục đầu tiên trong danh sách. Nếu thiên hướng đó tồn tại và bạn chỉ hiển thị mỗi cặp một cách, bạn không thể phân biệt nó với kỹ năng: một người đánh giá luôn chọn hình ảnh đầu tiên sẽ trông xuất sắc mỗi khi thumbnail tốt hơn tình cờ được liệt kê đầu tiên.
Hiển thị mỗi cặp hai lần, với thứ tự đảo ngược, tách biệt hai yếu tố này. Kỹ năng nên tồn tại sau khi hoán đổi. Thiên hướng về vị trí nên đảo ngược theo nó.
Thumbnail được hiển thị đầu tiên thắng phần lớn các tranh luận
Trong 300 câu trả lời, AI chọn thumbnail nào được hiển thị trước 64,7% thời gian. Thiên hướng này thay đổi giá trị của bất kỳ câu trả lời đơn lẻ nào:
| Cách hiển thị cặp | Tỷ lệ AI chọn người chiến thắng thực tế |
|---|---|
| Người chiến thắng được hiển thị đầu tiên | 77,3% |
| Người chiến thắng được hiển thị thứ hai | 48,0% |
| Trung bình theo cả hai thứ tự | 62,7% |
| Điểm số của chúng tôi, đánh giá từng thumbnail riêng lẻ | 62,7% |
| Cùng câu trả lời đúng theo cả hai thứ tự | 47,3% (đoán ngẫu nhiên: khoảng 25%) |
Dòng trung bình là so sánh công bằng với điểm số đánh giá từng thumbnail riêng lẻ, vì cả hai đều đưa ra một câu trả lời mỗi cặp. Trên cơ sở đó, hai phương pháp hòa nhau ở 62,7%. So sánh cạnh nhau không thêm độ chính xác; nó thêm sự phụ thuộc vào thứ tự.
Dòng cuối cùng là bài kiểm tra khắt khe hơn: một câu trả lời chỉ được tính nếu AI chọn cùng thumbnail đúng cả hai lần. Một người đánh giá đoán ngẫu nhiên sẽ vượt qua nó khoảng một phần tư số lần, và một người luôn chọn hình ảnh đầu tiên sẽ không bao giờ vượt qua nó. AI vượt qua 47,3% cặp, nên tín hiệu là có thật — chỉ là nó bị rối với vị trí.
Nó thay đổi ý kiến ở gần một phần ba cặp
Ở 46 trong 150 cặp, 30,7%, AI đưa ra câu trả lời ngược nhau chỉ vì thứ tự. Không có gì thay đổi về bất kỳ thumbnail hay tiêu đề nào giữa hai câu hỏi.
Ở 104 cặp còn lại, nó nhất quán, và ở đó nó đúng 68,3% thời gian. Điểm số của chúng tôi, trên cùng 104 cặp đó, đúng 63,5% thời gian. Khoảng cách này quá nhỏ để chắc chắn với số cặp này, nhưng nó chỉ ra điều gì đó hữu ích: một câu trả lời vượt qua bài kiểm tra hoán đổi có giá trị hơn một câu trả lời chưa bao giờ được kiểm tra.
Số độ tin cậy của nó không phải là xác suất
Chúng tôi yêu cầu một con số độ tin cậy với mỗi câu trả lời và nói với AI rằng 50 có nghĩa là tung đồng xu. Nó hầu như không dùng nửa dưới của thang điểm. Độ tin cậy thấp nhất mà nó tuyên bố trong tất cả 300 câu trả lời là 65, một câu trả lời điển hình tuyên bố 85, và chỉ có 4 câu trả lời dưới 70.
Trong khi đó, nó đúng khoảng 63% thời gian. Những câu trả lời nó đánh giá từ 80 đến 89 đúng 61,6% thời gian; những câu trả lời từ 70 đến 79 đúng 63,5% thời gian. Trong phạm vi nơi hầu hết câu trả lời của nó rơi vào, con số đó không nói gì về việc nên tin câu trả lời nào.
17 câu trả lời nó đánh giá 90 trở lên đúng 82,4% thời gian, điều này gợi ý, nhưng 17 quá ít để dựa vào. Cách hiểu thực tế đơn giản: giọng điệu tự tin từ một so sánh AI là mặc định của nó, không phải bằng chứng.
Cách kiểm tra bất kỳ AI đánh giá thumbnail nào trong năm phút
Chúng tôi kiểm tra một mô hình, và các công cụ khác có thể hành xử khác nhau. Bạn không cần phải tin lời chúng tôi, vì việc kiểm tra này nhanh chóng để bạn tự thực hiện:
- Chọn hai thumbnail mà bạn đã biết câu trả lời: hai video cũ từ kênh của bạn, được đăng gần nhau, một cái rõ ràng trên mức xem thông thường và một cái rõ ràng dưới mức.
- Hỏi AI cái nào hoạt động tốt hơn, với cái mạnh hơn được hiển thị đầu tiên. Ghi lại câu trả lời và bất kỳ độ tin cậy nào nó đưa ra.
- Bắt đầu một cuộc trò chuyện mới, để nó không nhớ câu trả lời đầu tiên, và hỏi lại với thứ tự đảo ngược.
- Lặp lại với ít nhất mười cặp. Đếm số lần nó chọn hình ảnh nào xuất hiện trước, và số lần câu trả lời của nó tồn tại sau khi hoán đổi.
- Chỉ tin những câu trả lời tồn tại sau khi hoán đổi, và hoàn toàn bỏ qua con số độ tin cậy.
Nếu bạn muốn một con số không phụ thuộc vào thứ tự trình bày, bạn có thể đánh giá từng thumbnail và tiêu đề riêng lẻ. Một điểm số riêng cho mỗi lựa chọn, so sánh sau đó, không có vị trí đầu tiên để ưu tiên.
Thí nghiệm này không cho thấy điều gì
Nó kiểm tra một mô hình với một bộ hướng dẫn. Một mô hình khác, hoặc cùng mô hình nhưng được hỏi khác, có thể có thiên hướng về vị trí mạnh hơn hoặc yếu hơn. Điểm không phải là mọi AI đều hành xử như cái này; mà là một so sánh đơn lẻ không thể cho bạn biết liệu cái bạn đang dùng có như vậy hay không.
Các cặp được chọn vì chúng khác biệt rõ rệt về hiệu suất, nên các con số độ chính xác này mô tả những cú đánh rõ ràng so với những cú trượt rõ ràng, không phải hai thumbnail hoạt động gần như giống nhau. Mỗi kênh đều đã thiết lập và sử dụng tiếng Anh.
Và không có gì trong này liên quan đến kiểm tra chia đôi thực tế. Một bài kiểm tra chạy trên người xem thực tế đo lường những gì người xem thực sự làm. Thí nghiệm này chỉ liên quan đến AI cố gắng dự đoán kết quả đó trước.
Câu hỏi thường gặp
AI chatbot có thể chọn thumbnail YouTube tốt nhất không?
Một phần. Mô hình chúng tôi kiểm tra chọn được thumbnail hoạt động tốt hơn khoảng 63% thời gian trung bình, vượt trội hơn ngẫu nhiên nhưng bằng chứ không vượt trội hơn việc đánh giá từng thumbnail riêng lẻ. Câu trả lời của nó phụ thuộc nhiều vào hình ảnh nào nó thấy trước, nên một câu trả lời duy nhất không đáng tin cậy. Hỏi hai lần với thứ tự đảo ngược, và chỉ tin những câu trả lời tồn tại sau khi hoán đổi.
Thiên hướng vị trí trong so sánh AI là gì?
Thiên hướng vị trí là xu hướng thích một lựa chọn vì vị trí nó xuất hiện chứ không phải vì nội dung. Trong bài kiểm tra của chúng tôi, AI chọn thumbnail nào được hiển thị trước 64,7% thời gian. Cách khắc phục là trình bày mọi so sánh theo cả hai thứ tự và coi câu trả lời thay đổi là không có câu trả lời.
Đánh giá thumbnail riêng lẻ hay so sánh cạnh nhau tốt hơn?
Trong bài kiểm tra của chúng tôi, cả hai đều có độ chính xác như nhau trung bình, ở 62,7%. Sự khác biệt là sự ổn định. Đánh giá từng thumbnail riêng lẻ cho kết quả giống nhau bất kể thứ tự bạn kiểm tra, trong khi so sánh cạnh nhau tạo ra những câu trả lời thay đổi theo thứ tự ở gần một phần ba cặp.
Tại sao AI lại nghe có vẻ rất chắc chắn về câu trả lời của nó?
Vì cách diễn đạt tự tin là mặc định của nó, không phải là phép đo. Khi được yêu cầu đánh giá độ chắc chắn của chính mình, mô hình chúng tôi kiểm tra hầu như không bao giờ xuống dưới 70 trên 100 và thường tuyên bố 85, trong khi đúng khoảng 63% thời gian. Trong phạm vi đó, độ tin cậy được tuyên bố cao hơn không có nghĩa là câu trả lời đáng tin cậy hơn.
Điều này có nghĩa là kiểm tra A/B thumbnail là vô ích không?
Không. Một bài kiểm tra thực tế hiển thị thumbnail của bạn cho người xem thực tế và đo lường những gì họ làm, điều mà không có dự đoán nào thay thế được. Thí nghiệm này chỉ liên quan đến việc hỏi AI đoán người chiến thắng trước. Đối với một bài kiểm tra thực tế, câu hỏi khó hơn là liệu sự khác biệt bạn thấy có lớn hơn sự biến động bình thường của kênh bạn từ lần đăng tải này sang lần khác hay không.