Перейти к основному содержимому

Что такое мультимодальный ИИ?

Мультимодальный ИИ — это ИИ, который принимает или создаёт больше одного вида данных, например текст, изображения, аудио или видео, а не только текст.

Некоторые модели мультимодальны сами по себе; другие системы объединяют несколько узкоспециализированных моделей — для речи, для текста, для изображений.

Как это работает

Мультимодальная модель переводит каждый вид входных данных в общее внутреннее представление, поэтому может прочитать фото и вопрос вместе. Система без такой модели всё равно может быть мультимодальной за счёт цепочки моделей: речь превращается в текст, на текст даётся ответ, а ответ зачитывается вслух.

Примеры

  • Спросить, что не так на снимке экрана с ошибкой.
  • Прочитать график или сфотографированный чек.
  • Поговорить с ассистентом и услышать ответ.

Ограничения

  • Модели неверно читают мелкий текст, рукописный текст и перегруженные изображения.
  • Цепочки моделей теряют интонацию и акценты, когда речь становится текстом.
  • Обработка изображений и аудио стоит дороже, чем текста.

Как это использует Venta

Изображения, которые вы перетаскиваете в разговор, отправляются модели, которая умеет их рассматривать. Голос работает в обе стороны: ваша речь распознаётся, а ответы можно прослушать вслух.

Вопросы, которые задают первыми

Можно ли говорить с Venta вместо того, чтобы печатать?
Да. Голос работает в браузере, на телефонах и в приложении для Windows; как именно — описано на странице о голосе.
Может ли Venta прочитать снимок экрана?
Да. Перетащите изображение в разговор и задайте вопрос о нём.
Мультимодальный ИИ — это то же самое, что генеративный ИИ?
Нет. Генеративный ИИ создаёт новый контент; мультимодальный работает с несколькими видами данных. Система может быть одним, другим, обоими или ни тем ни другим.