بحث · DeepMind ·

DeepMind تجري أول تقييمات ذكاء اصطناعي مزدوجة التعمية للحد من التحيز

أطلقت DeepMind إطار تقييم مزدوج التعمية لنماذج الذكاء الاصطناعي، حيث لا يعرف المقيّمون ولا هويات النماذج أثناء الاختبار، بهدف إنتاج نتائج معايير أكثر موضوعية.

استناداً إلى تقرير DeepMind — تحليل وصياغة دليلي

نشرت Google DeepMind نتائج ما تسميه أول تجربة تقييم ذكاء اصطناعي مزدوجة التعمية في العالم، منهجية مستعارة من التجارب السريرية تهدف للحد من التحيز في تقييم نماذج الذكاء الاصطناعي.

في الإعداد مزدوج التعمية، لا يعرف المقيّمون البشريون أي نموذج أنتج المخرجات التي يقيّمونها، وتُحجب أسماء النماذج طوال عملية التقييم. يهدف النهج للقضاء على تحيز العلامة التجارية — ميل المقيّمين لتقييم مخرجات النماذج المعروفة بشكل أفضل.

اختبرت التجربة الإطار عبر فئات مهام متعددة ووجدت فروقاً قابلة للقياس في النتائج مقارنة بالتقييمات المفتوحة. في بعض الحالات، حصلت مخرجات من نماذج أصغر أو أقل شهرة على درجات أعلى عندما لم يتمكن المقيّمون من رؤية اسم النموذج.

تنشر DeepMind المنهجية بشكل مفتوح وتدعو المختبرات الأخرى لتبنيها، بحجة أن معايير تقييم أكثر صرامة أصبحت ضرورية مع تزايد تنافس نماذج الذكاء الاصطناعي.

أبرز النقاط

  • أول إطار تقييم ذكاء اصطناعي مزدوج التعمية
  • يحجب أسماء النماذج للقضاء على تحيز العلامة التجارية
  • فروق قابلة للقياس مقارنة بالتقييم المفتوح
  • المنهجية منشورة بشكل مفتوح لتبني الصناعة

ما أهمية ذلك

تحيز العلامة التجارية في تقييم الذكاء الاصطناعي مشكلة حقيقية لكنها ناقشة النقاش. إذا كان المقيّمون يقيّمون مخرجات GPT أو Claude أعلى لمجرد الاسم، تصبح المعايير غير موثوقة. التقييم مزدوج التعمية قد يصبح المعيار الذهبي للمقارنة العادلة بين النماذج.