طوّر الباحثون نهجاً مختلطاً يجمع بين التعلم العميق بالتعزيز (DRL) ونماذج المحولات لتحسين الأداء في مهام حل المشاكل المنظمة. تدرب الطريقة المحولات على تعلم إشارات المكافأة وتحسين تسلسلات الإجراءات في سيناريوهات التفكير متعدد الخطوات.
يعالج الابتكار قيداً معروفاً: تتفوق المحولات القياسية في مطابقة الأنماط في النصوص لكنها تكافح مع التفكير طويل المدى والتخطيط متعدد الخطوات. بإضافة التعلم بالتعزيز، يتعلم النموذج تقييم الخطوات الوسيطة والتكيف مع الاستراتيجية بناءً على النتائج.
تظهر النتائج الأولية أن النهج المختلط يقلل من الحمل الحسابي مع الحفاظ على الدقة. للتطبيقات العملية — الروبوتيات وتحسين التخطيط وتحليل المشاكل المعقدة — يمكن أن يقلل هذا بشكل كبير من تكلفة نشر أنظمة التفكير المتقدمة على نطاق واسع.