بعد اختبار تقييم الصور المصغرة لدينا مقابل 321 زوجًا من مقاطع الفيديو الحقيقية، حاولنا جعله أكثر دقة. جربنا أربع أشياء. واحدة منها غيرت الرقم، وتبين أنها قياس أدق وليس نموذجًا أفضل. الثلاثة الأخرى لم تُغير شيئًا، أو جعلت التقييم أقل موثوقية. إليكم كل منها مع الأرقام.
النقاط الرئيسية
- مقارنة التقييمات بدقة كاملة بدلًا من تقريبها لأعداد صحيحة رفعت الدقة المقاسة من 59.5% إلى 62.0%، وكل ذلك جاء من 17 تعادلًا سابقًا، التي انقسمت بشكل متساوٍ تقريبًا.
- إعادة صياغة تعليمات التقييم بدت كاختراق على 30 صورة مصغرة، لكنها لم تُحدث أي فرق على 322: 64.6% قبل، و63.4% بعدها، على 161 زوجًا.
- طلب من الذكاء الاصطناعي مقارنة صورتين مصغرتين مباشرةً أعطى نفس التقييم العادي في المتوسط، 62.7% لكل منهما، لكن إجابته اعتمدت على أي صورة ظهرت أولًا.
- إعداد نموذج التفكير لم يُغير شيئًا إلا عند أعلى مستوى، وهذا المستوى لم يُرجع إجابة أبدًا في المنطقة الأوروبية التي نستخدمها للحفاظ على عمليات الرفع داخل الاتحاد الأوروبي.
- النتيجة المنشورة والمسبقة التسجيل تبقى عند 59.5%. كل ما هنا هو عمل متابعة وتم تسميته كمثل ذلك.
هل يمكن جعل تقييم الصورة المصغرة أكثر دقة بعد اختباره؟
ليس بسهولة، في حالتنا. من بين أربع تغييرات اختبرناها مقابل مقاطع فيديو حقيقية، رفعت واحدة الدقة المقاسة من 59.5% إلى 62.0%، وفعلت ذلك عن طريق إصلاح طريقة مقارنة التقييمات بدلًا من جعل النموذج يرى شيئًا جديدًا. الثلاثة الأخرى تركت الدقة كما هي. يبدو أن التقييم قريب مما يستطيع هذا النموذج فعله.
هذا إجابة أقل إثارة من رقم قياسي جديد، وأكثر فائدة. إنه يوضح أين لا ينبغي بذل الجهد، ويشرح لماذا فشلت كل فكرة جذابة. هذا مهم خارج هذا التقييم وحده، لأن نفس الأخطاء تصيب المبدعين عند اختبار صورهم المصغرة.
الإصلاح الذي نجح: توقف عن التقريب قبل المقارنة
التقييم الذي تراه هو عدد صحيح من 0 إلى 100. في اختبارنا الأصلي، انتهت مقاطع الفيديو في الزوج أحيانًا إلى نفس العدد الصحيح، وحدث هذا 17 مرة في 321 زوجًا. قواعدنا المسبقة التسجيل اعتبرت كل تعادل فشلًا، بناءً على أن تقييمًا لا يستطيع التمييز بين مقطعي فيديو لم يُفرّق بينهما.
وراء العدد الصحيح يوجد قيمة دقيقة، والتقريب يلغي الفرق. مقارنة القيم الدقيقة لا تترك أي تعادل على الإطلاق، وترتفع الدقة المقاسة من 59.5% إلى 62.0%: 199 من 321 زوجًا بدلًا من 191. لم يتم إعادة تقييم أي فيديو ولم يتغير أي وزن؛ القيمة الدقيقة كانت موجودة بالفعل.
لماذا هذا رقم أدق، وليس نموذجًا أفضل
السؤال الواضح هو كيف انقسمت تلك الـ17 تعادلًا. إذا كان النموذج يحصل عليها بشكل خفي، لكان التقريب يخفي مهارة حقيقية. لم يكن كذلك. ثمانية من الـ17 ذهبت إلى الفيديو الأداء الأفضل، وتسعة لم يفعلوا، وهذا ما ينتجه رمي عملة.
لذلك، المكسب يأتي من عدم اعتبار رميات العملات فشلًا تلقائيًا، وليس من معرفة النموذج أكثر. لهذا السبب تبقى النتيجة المنشورة عند 59.5%: كانت الرقم الذي التزمنا به مسبقًا، تحت قواعد كُتبت قبل رؤية أي بيانات. 62.0% تم الإبلاغ عنها كقياس متابعة، مُسمى بوضوح، ويصف نفس النموذج.
ضبط التعليمات: تجربة صغيرة بدت كاختراق
تصنّف تقييمات النموذج معًا. عدة عوامل من العوامل الاثني عشر التي يُبنى عليها التقييم تجمعت في نطاقات ضيقة عبر مئات الصور المصغرة الحقيقية، وأظهر اختبارنا الأصلي أن التقييم أكثر موثوقية عندما يضع مقطعي فيديو بعيدًا عن بعضهما. لذلك أعدنا صياغة التعليمات لإعطاء المقياس نقطة مرجعية: 50 تعني الفيديو النموذجي في نفس التغذية، و90 فأكثر محفوظة للعشرة الأوائل.
في تجربة أولية على 30 صورة مصغرة، تم تقييمها تحت الإصدارين، بدت وكأنها نجحت. ثمانية من العوامل الاثني عشر انتشرت، واثنان منها ضاعفوا تقريبًا انتشارهم. ثم قمنا بتشغيل التعليمات الجديدة على 322 صورة مصغرة. العاملان اللذان ضاعفا تقريبًا انتشارهما نما فقط بمقدار 1.1 و0.1 نقطة انتشار. على 161 زوجًا، اختار التعليمات الأصلية الفيديو الأفضل 64.6% من الوقت، والجديدة 63.4%، فرق داخل نطاق الصدفة. الإصدار الجديد خفض أيضًا تقريبًا كل تقييم بمقدار خمس إلى سبع نقاط، لذا كان سيكلف كل مبدع عدة نقاط من التقييم بلا فائدة.
لماذا لم يعني الانتشار الأكبر دقة أكبر
التجربة الأولية كانت صغيرة جدًا. مع 30 صورة مصغرة، يتقلب مقياس مدى انتشار التقييمات كثيرًا بالصدفة، وكان مضاعفة عاملين داخل هذا التقلب. كان ينبغي قراءة التجربة الأولية كسبب لإجراء اختبار أكبر، وليس كنتيجة.
التجربة الأكبر احتوت درسًا ثانيًا. عاملان، الفضول وخطر النقر، انتشرتا فعلاً عبر 322 صورة مصغرة، ومع ذلك لم يتحسن الترتيب. الانتشار الأكبر يساعد فقط إذا تبع الفروق الحقيقية بين مقاطع الفيديو. هنا تبع الضوضاء، والضوضاء التي تبدو واثقة أسوأ من عدم وجودها.
مقارنة الصور المصغرة مباشرةً بدلًا من تقييمها
تقييم كل صورة مصغرة بمفردها ثم مقارنة الأرقام ليس الطريقة التي يختار بها الناس بين الصور المصغرة؛ فهم ينظرون إلى اثنتين جنبًا إلى جنب. لذلك طلبنا من النموذج فعل ذلك: عند عرض مقطعي فيديو من زوج، أيهما تفوق؟ عُرض كل من الـ161 زوجًا مرتين، مرة في كل ترتيب.
بالمتوسط على كلا الترتيبين، كان القاضي المباشر صحيحًا 62.7% من الوقت، مطابقًا تمامًا للتقييم العادي على نفس الـ150 زوجًا التي تم الإجابة عليها بالكامل. لكنه اختار الصورة التي رآها أولًا 64.7% من الوقت، ولما يقرب من ثلث الأزواج أعطى إجابات متعارضة فقط بسبب الترتيب. دقة متساوية مع استقرار أقل يعني أنه لم يتم اعتماده. النتائج الكاملة في مقالنا المنفصل حول طلب الذكاء الاصطناعي مقارنة الصور المصغرة.
تشغيل وضع التفكير في النموذج
يقدم النموذج إعدادًا يجعله يعمل من خلال مشكلة خطوة بخطوة قبل الإجابة، على عدة مستويات من الجهد. عند المستويات الثلاثة الأدنى، عاد تحليل كامل لصورة مصغرة اختبارية بنفس التقييمات الاثني عشر كما مع إيقاف الإعداد. فقط المستوى الأعلى غير سلوك النموذج على الإطلاق.
في مركز البيانات الأوروبي الذي نستخدمه، حتى لا تُعالج الصور المصغرة المرفوعة خارج الاتحاد الأوروبي، لم يُرجع هذا المستوى الأعلى إجابة أبدًا، عبر محاولات متكررة استمرت حتى ثلاث دقائق. أكدنا أنه يعمل في منطقة أمريكية باستخدام سؤال حسابي مختلق دون صور مصغرة، ووجدنا أنه يكتب تفكيره كنص عادي أمام الإجابة بدلًا من الاحتفاظ به منفصلًا. نقل الرفع إلى الولايات المتحدة لمعرفة ما إذا كان يساعد لم يكن تبادلًا كنا مستعدين لفعله.
النتائج الأربعة جنبًا إلى جنب
تم مقارنة كل تغيير مع الأصلي على نفس الأزواج، لذا فإن كل فرق أدناه متساوٍ.
| التغيير | ما فعله لدقة الترتيب | تم الاحتفاظ به؟ |
|---|---|---|
| مقارنة التقييمات غير المقربة | 59.5% إلى 62.0% على 321 زوجًا، بالكامل من تعادلات سابقة انقسمت بشكل متساوٍ تقريبًا | نعم، كقياس أدق |
| تعليمات التقييم المُعايرة | 64.6% إلى 63.4% على 161 زوجًا، لا فرق قابل للكشف | لا |
| مقارنة الصور المصغرة مباشرةً | 62.7% مقابل 62.7% على 150 زوجًا، بإجابات تعتمد على الترتيب | لا |
| وضع تفكير النموذج | لا تغيير عند المستويات التي تعمل؛ الأعلى لم يُرجع إجابة أبدًا في منطقتنا | لا |
كل رقم هنا يأتي من نفس خط أنابيب التقييم الذي يعمل عندما تحلل صورة مصغرة وعنوانًا. اختبرت الاختبارات مقاطع فيديو حقيقية عبر المنتج نفسه، وليس عبر نسخة بحثية منفصلة.
كيف حافظنا على صدق هذه الاختبارات المتابعة
تجارب المتابعة هي المكان الذي تفشل فيه الدراسات عادةً، لأن الباحث يعرف بالفعل الإجابة التي يرغب فيها. خمس قواعد حافظت على ذلك:
- لم يتم لمس النتيجة المنشورة أبدًا. تبقى 59.5% المسجلة مسبقًا كعنوان رئيسي، وكل تحليل لاحق مُسمى كعمل متابعة.
- تم تقسيم القنوات إلى نصفين قبل اختبار أي تغيير. استخدمت التجارب نصفًا، وتم الاحتفاظ بالنصف الآخر لفحص نهائي.
- تم مقارنة كل تغيير مع الأصلي على نفس الأزواج، وعُدّت فقط الأزواج التي اختلف فيها الاثنين، وهو ما يكون أكثر حساسية من مقارنة نسبتين إجماليتين.
- اعتُبرت التجربة الصغيرة سببًا لإجراء اختبار أكبر، وليس نتيجة بحد ذاتها.
- عُرضت كل مقارنة مباشرةً في كلا الترتيبين، حتى لا يمكن اعتبار التفضيل للوضع مهارة.
لا يحتاج أي من هذه إلى شهادة في الإحصاء، ومعظمها ينطبق مباشرة على مبدع يختبر صوره المصغرة: قرر ما يُعد فوزًا قبل النظر، قارن المماثل مع المماثل، واعتبر نتيجة مبكرة صغيرة سببًا لمواصلة الاختبار.
حدود هذه النتائج المتابعة
استخدمت جميع التجارب الأربعة نفس القنوات المثبتة باللغة الإنجليزية كما في الاختبار الأصلي، ونموذجًا واحدًا. تم اختيار الأفكار بعد معرفة النتيجة الأصلية، وهو بالضبط الموقف الذي يميل لتمجيد النتائج، وسبب آخر لبقاء العنوان الرئيسي عند الرقم المسجل مسبقًا.
تم تجربة كل تغيير مرة واحدة، في شكل واحد. قد تكون صياغة مختلفة للتعليمات أفضل، وتصف نتيجة وضع التفكير ما كان متاحًا في منطقة واحدة في سبتمبر 2026. لا تقول أي من هذه النتائج إن التقييم لا يمكن تحسينه؛ إنها تقول إن هذه الطرق الأربعة لم تحسنه.
الأسئلة الشائعة
لماذا لا نُبلغ عن 62.0% كدقة؟
لأن قواعد الاختبار تم تثبيتها قبل وجود أي بيانات، واعتبرت التعادلات فشلًا. تغيير قاعدة بعد رؤية النتائج هو بالضبط ما تم إنشاء التسجيل المسبق لمنعه، حتى عندما يكون التغيير معقولًا. تم نشر 62.0% كقياس متابعة مسمى بوضوح، بجانب 59.5% التي لا يحل محلها.
هل سيجعل نموذج ذكاء اصطناعي أذكى التقييم أكثر دقة؟
ربما، لكن سيكون ذلك تجربة جديدة. لم يساعد إعداد التفكير في نموذجنا الحالي في المنطقة التي نستخدمها، وسوف يحتاج نموذج مختلف إلى اختبار مقابل نفس الأزواج، بنفس الطريقة، قبل أي ادعاء. الأحدث لا يعني تلقائيًا الأفضل في هذه المهمة بالتحديد.
لماذا بدت تجربة على 30 صورة مصغرة مقنعة جدًا؟
العينات الصغيرة تنتج تقلبات كبيرة بالصدفة، والتقلب الكبير يبدو كاكتشاف. مع 30 صورة مصغرة، كان ظهور عاملين وكأنهما ضاعفا انتشارهما داخل التباين الطبيعي؛ عند 322 صورة مصغرة تلاشى التأثير تقريبًا. إنها نفس الفخ كما الحكم على أسلوب صورة مصغرة جديد على مقطعي فيديو فقط.
ما الذي يعنيه هذا لاختبار صورك المصغرة الخاصة؟
تنطبق نفس القواعد. قرر ما يُعد نجاحًا قبل النظر، قارن مقابل النطاق الطبيعي لقناتك بدلًا من مقطع فيديو سابق واحد، أجرِ أمثلة كافية بحيث لا يمكن للصدفة تفسير النتيجة، وإذا طلبت من أي أداة مقارنة خيارين، تحقق مما إذا كانت إجابتها تبقى عند تبديلها.
هل لا يزال التقييم يستحق الاستخدام إذا فشلت هذه التحسينات؟
تم اختبار التقييم مقابل النتائج الحقيقية وفاز على الصدفة بفارق واضح. تُظهر هذه المتابعة أن أربع تغييرات جذابة لم تدفعه أكثر، وهو أمر مفيد لمعرفته بدلًا من سبب التخلص منه. عامله كمدخل مستنير من بين عدة مدخلات، وليس كتنبؤ بالمشاهدات.