طرحت أنثروبيك نموذج Claude Opus 5 هذا الأسبوع، وسجّل في معيار FrontierBench v0.1 نسبة 43.3% بأقصى جهد استدلال، متقدماً على GPT-5.6 Sol من OpenAI البالغ 37.5% في المعيار نفسه. وFrontierBench واحد من عدة مجموعات تقييم تتتبع قدرات نماذج الطليعة عبر مهام كثيفة الاستدلال، وتعكس الفجوة أداءً على هذا الاختبار المحدد لا تصنيفاً شاملاً عبر كل أحمال العمل.
تقيس نتائج المعايير القياسية من هذا النوع قدرات محدَّدة تحت ظروف مضبوطة، لذا يعتمد الأداء الفعلي على مهام فريق معين اعتماداً كبيراً على طبيعة حمل العمل وأسلوب الأوامر والأدوات المستخدمة. ويبقى الاختبار المستقل عبر نطاق أوسع من المهام الدليلَ الأكثر موثوقية للفرق التي تختار بين نماذج الطليعة، خصوصاً مع استمرار الشركتين في تطوير عروضهما الرئيسية.
وتأتي هذه المقارنة وسط موجة أوسع من نشاط نماذج الطليعة هذا الشهر، مع صدور أوزان Kimi K3 المفتوحة من Moonshot AI هذا الأسبوع أيضاً، متموضعةً كبديل مفتوح قريب من الطليعة. وتؤكد هذه الإصدارات مجتمعة مدى سرعة تغيّر المشهد التنافسي بين مختبرات الذكاء الاصطناعي الرائدة، مع تبدّل صدارة المعايير القياسية عبر إصدارات النماذج المتعاقبة.