ديب مايند تطلق فهم الفيديو الذاتي في جيميني — 88% رموز أقل
أضافت جوجل ديب مايند فهم الفيديو الذاتي إلى نماذج جيميني فلاش. يفحص المقاطع المهمة فقط، ما يقلّل الرموز حتى 88% والتكلفة حتى 66% ويحسّن الدقة حتى 7%.
استناداً إلى تقرير Google DeepMind — تحليل وصياغة دليلي
أطلقت جوجل ديب مايند فهم الفيديو الذاتي عبر نماذج جيميني 3.7 فلاش و3.6 فلاش و3.5 فلاش لايت. هذه القدرة الجديدة تحسن الدقة مع تقليل استخدام الرموز والتكاليف بشكل كبير لتحليل الفيديو.
على عكس المعالجة 'الثابتة' الحالية، حيث يستهلك النموذج الفيديو بمعدل إطارات ثابت في الثانية، يجمع فهم الفيديو الذاتي بين استدلال النموذج الأساسي وأدوات الفيديو الأصلية للبحث ديناميكياً وفحص مقاطع الفيديو المستهدفة عبر الإطارات البصرية والصوت والنصوص.
عبر معايير تحليل الفيديو القياسية، تقلل نماذج جيميني مع فهم الفيديو الذاتي تكاليف التحليل بنسبة 66% واستهلاك الرموز بنسبة 88%، مع تحسين الدقة بنسبة 7%.
هذه المكاسب في الكفاءة واضحة بشكل خاص في الفيديو الطويل (من أدلة كيفية مدتها 10 دقائق إلى محاضرات مدتها 90 دقيقة وتسجيلات متعددة الساعات)، حيث تجبر المعالجة الثابتة المطورين على الاختيار بين تكاليف الرموز العالية أو التقنيات التي تسقط تفاصيل حرجة.
بدلاً من المعالجة الثابتة حيث يستهلك النموذج تدفقات الوسائط بمعدل إطارات ثابت، يمكّن فهم الفيديو الذاتي جيميني من اتخاذ دور نشط وموجه نحو الهدف في تحديد ما يجب مشاهدته وبأي سرعة ومن خلال أي وسيلة (إطارات أو صوت أو نص)، حيث يجلب فقط اللحظات والإشارات المطلوبة.
الميزة متاحة اليوم لتحميلات الفيديو ومقاطع يوتيوب عبر واجهة برمجة تطبيقات جيميني. جيميني 3.7 فلاش مع الفهم الذاتي يقدم أفضل جودة ممكنة بشكل عام وأفضل مزيج من الجودة وكفاءة التكلفة.
أبرز النقاط
- تخفيض 88% في استهلاك الرموز لتحليل الفيديو
- تخفيض 66% في التكاليف، تحسين 7% في الدقة
- متاح على جيميني 3.7 فلاش و3.6 فلاش و3.5 فلاش لايت
- يفحص الفيديو ديناميكياً — لا يعالج كل إطار
- يعمل مع تحميلات الفيديو ومقاطع يوتيوب عبر واجهة برمجة التطبيقات
- سيتم طرحه في تطبيق جيميني وميزة 'اسأل يوتيوب'
ما أهمية ذلك
تحليل الفيديو كان من أغلى عمليات الذكاء الاصطناعي. هذا التخفيض بنسبة 88% في الرموز يجعل تحليل الفيديو الطويل بالذكاء الاصطناعي مجدياً اقتصادياً لأول مرة على نطاق واسع.