انتقل إلى المحتوى الرئيسي

ما هو الذكاء الاصطناعي متعدد الوسائط؟

الذكاء الاصطناعي متعدد الوسائط ذكاء اصطناعي يستقبل أو ينتج أكثر من نوع من البيانات، مثل النص والصور والصوت والفيديو، بدلًا من النص وحده.

بعض النماذج متعددة الوسائط بذاتها؛ وأنظمة أخرى تجمع عدة نماذج أحادية الغرض، واحدًا للكلام وآخر للنص وثالثًا للصور.

كيف تعمل

يحوّل النموذج متعدد الوسائط كل نوع من المدخلات إلى صيغة داخلية مشتركة، فيستطيع قراءة صورة وسؤال معًا. والنظام الذي لا يملك نموذجًا كهذا يمكن أن يكون متعدد الوسائط بربط النماذج في سلسلة: يُفرَّغ الكلام نصًا، ويُجاب عن النص، ثم تُقرأ الإجابة بصوت عالٍ.

أمثلة

  • السؤال عما هو خاطئ في لقطة شاشة لرسالة خطأ.
  • قراءة رسم بياني أو إيصال مصوَّر.
  • التحدث إلى مساعد وسماع إجابته.

الحدود

  • تسيء النماذج قراءة النصوص الصغيرة والكتابة اليدوية والصور المزدحمة.
  • تفقد الأنظمة المتسلسلة النبرة والتشديد حين يتحول الكلام إلى نص.
  • معالجة الصور والصوت تكلّف أكثر من النص.

كيف تستخدمه Venta

تُرسَل الصور التي تسحبها إلى المحادثة إلى نموذج يستطيع النظر فيها. والصوت يعمل في الاتجاهين: يُفرَّغ ما تقوله نصًا، ويمكن قراءة الردود بصوت عالٍ.

الأسئلة التي يطرحها الناس أولًا

هل يمكنني التحدث إلى Venta بدلًا من الكتابة؟
نعم. يعمل الصوت في المتصفح وعلى الهواتف وفي تطبيق Windows؛ وتشرح صفحة الصوت الطريقة.
هل تستطيع Venta قراءة لقطة شاشة؟
نعم. اسحب الصورة إلى المحادثة واسأل عنها.
هل الذكاء الاصطناعي متعدد الوسائط هو نفسه الذكاء الاصطناعي التوليدي؟
لا. الذكاء الاصطناعي التوليدي يعني إنشاء محتوى جديد؛ ومتعدد الوسائط يعني العمل مع أكثر من نوع من البيانات. قد يكون النظام أحدهما أو كليهما أو لا هذا ولا ذاك.