Anthropic تقيد تدريب نموذج الذكاء الاصطناعي على مواضيع خطرة
آخر نموذج Anthropic (Fable 5) يرفض التدريب على تصنيع الأسلحة والعقاقير.
استناداً إلى تقرير Ars Technica — تحليل وصياغة دليلي
أعلنت Anthropic أن آخر نموذج لها، Fable 5، يتضمن قيوداً قاسية على التدريب والاستدلال لفئات المعرفة الخطرة: تصنيع الأسلحة، تصنيع العقاقير، تصميم الأسلحة البيولوجية، وتوليد البرامج الضارة.
بخلاف نهج OpenAI (الترشيح اللاحق في الاستدلال)، بنت Anthropic السلامة في معمارية النموذج نفسه. لا يمكن للنموذج حرفياً أن يتم ضبطه بدقة على المواضيع المحظورة، بغض النظر عن الضغط اللاحق.
يثير هذا سؤالاً: هل السلامة المعمارية ميزة تنافسية أم عائق؟ إذا رفض Fable 5 أن يتم تدريبه على البحث الأمني المشروع، هل يتخلف عن النماذج بدون حماية السلامة؟
رهان Anthropic هو أن السلامة ميزة، وليست التزام. يطالب عملاء المؤسسات والحكومات بشكل متزايد بخصائص السلامة القابلة للتحقق. إذا ثبتت هذه الأطروحة، فإن قيود Fable 5 تصبح خندق استراتيجي.
أبرز النقاط
- يفرض Fabula 5 من Anthropic قيوداً صارمة على سلامة التدريب
- السلامة مدمجة في معمارية النموذج
- قد تجعل طلب المؤسسات والحكومات على السلامة القابلة للتحقق نهج Anthropic أخندقاً
ما أهمية ذلك
تنتقل سلامة الذكاء الاصطناعي من الترشيح اللاحق إلى القيد المعماري. إذا أصبحت السلامة المعتمدة متمايزة في السوق، فإن نماذج الأعمال تتحول.