نشرت Google DeepMind نتائج ما تسميه أول تجربة تقييم ذكاء اصطناعي مزدوجة التعمية في العالم، منهجية مستعارة من التجارب السريرية تهدف للحد من التحيز في تقييم نماذج الذكاء الاصطناعي.
في الإعداد مزدوج التعمية، لا يعرف المقيّمون البشريون أي نموذج أنتج المخرجات التي يقيّمونها، وتُحجب أسماء النماذج طوال عملية التقييم. يهدف النهج للقضاء على تحيز العلامة التجارية — ميل المقيّمين لتقييم مخرجات النماذج المعروفة بشكل أفضل.
اختبرت التجربة الإطار عبر فئات مهام متعددة ووجدت فروقاً قابلة للقياس في النتائج مقارنة بالتقييمات المفتوحة. في بعض الحالات، حصلت مخرجات من نماذج أصغر أو أقل شهرة على درجات أعلى عندما لم يتمكن المقيّمون من رؤية اسم النموذج.
تنشر DeepMind المنهجية بشكل مفتوح وتدعو المختبرات الأخرى لتبنيها، بحجة أن معايير تقييم أكثر صرامة أصبحت ضرورية مع تزايد تنافس نماذج الذكاء الاصطناعي.