QamoosTech
الذكاء الاصطناعي والبياناتمبتدئ

Multimodal

النطقمولتي-مودال

التعريف

يشير مصطلح Multimodal إلى نماذج الذكاء الاصطناعي القادرة على معالجة وإنشاء معلومات من أنواع مختلفة من الوسائط، مثل النصوص والصور والصوت والفيديو. بدلاً من الاقتصار على تنسيق واحد، تقوم هذه الأنظمة بدمج وفهم البيانات من مصادر متعددة في وقت واحد.

أين تسمعه؟

في النقاشات حول قدرات الذكاء الاصطناعي المتقدمة، والأوراق البحثية، والإعلانات عن نماذج الذكاء الاصطناعي الجديدة.

أمثلة

  • The new model is multimodal, allowing it to analyze both a user's uploaded image and their text prompt.النموذج الجديد هو Multimodal، مما يسمح له بتحليل الصورة التي رفعها المستخدم مع نص الطلب الخاص به.
  • We are testing a multimodal system that can generate audio descriptions from video input.نحن نختبر نظاماً من نوع Multimodal يمكنه إنشاء وصف صوتي من مدخلات الفيديو.

خطأ شائع

الاعتقاد بأن Multimodal يعني أن النموذج يقوم فقط بالتبديل بين نماذج متخصصة مختلفة؛ في الواقع، هو بنية نموذج واحدة تم تدريبها للتعامل مع أنواع متعددة من البيانات بشكل أصيل.