أصبح تدريب نماذج الذكاء الاصطناعي باستخدام نماذج ذكاء اصطناعي أخرى هدفاً شائعاً لمختبرات الأبحاث — والآن، قدم باحث في برنامج الزملاء في Anthropic نظرة مبكرة عن كيف قد يبدو هذا في الممارسة العملية. نشرت Anthropic ورقة جديدة بعنوان 'الباحثون الآليون يمكنهم التخفيف بشكل موثوق من حالات فشل المحاذاة'، توضح كيف يمكن لأنظمة الذكاء الاصطناعي تحسين أداء النموذج بشكل موثوق في مجموعة من معايير المحاذاة.
مع إعطاء 10 معايير لسلوكيات محددة غير متوافقة، كانت الأنظمة الآلية قادرة على تحسين الأداء في كل منها دون تقليل الأداء العام. يمثل العمل خطوة مهمة نحو هدف استخدام الذكاء الاصطناعي لتحسين الذكاء الاصطناعي — وهي قدرة يمكن أن تسرع التقدم في المجال.
يتناول البحث أحد التحديات المركزية في سلامة الذكاء الاصطناعي: ضمان أنه مع becoming النماذج أكثر قدرة، تصبح أيضاً أكثر توافقاً مع القيم البشرية. من خلال إثبات أن الأنظمة الآلية يمكنها تحديد وإصلاح حالات فشل المحاذاة بشكل موثوق، يقترح العمل مساراً نحو ذكاء اصطناعي ذاتي التحسين يصبح أفضل ليس فقط في المهام، بل في كونها آمنة ومفيدة.
يعكس تركيز Anthropic على أبحاث المحاذاة تأكيد الشركة على سلامة الذكاء الاصطناعي. توفر الورقة دليلاً ملموساً على أن هدف التحسين الذاتي الموثوق قابل للتحقيق، على الأقل في البيئات الخاضعة للرقابة.