Что такое мультимодальный ИИ?
Мультимодальный ИИ — это ИИ, который принимает или создаёт больше одного вида данных, например текст, изображения, аудио или видео, а не только текст.
Некоторые модели мультимодальны сами по себе; другие системы объединяют несколько узкоспециализированных моделей — для речи, для текста, для изображений.
Как это работает
Мультимодальная модель переводит каждый вид входных данных в общее внутреннее представление, поэтому может прочитать фото и вопрос вместе. Система без такой модели всё равно может быть мультимодальной за счёт цепочки моделей: речь превращается в текст, на текст даётся ответ, а ответ зачитывается вслух.
Примеры
- Спросить, что не так на снимке экрана с ошибкой.
- Прочитать график или сфотографированный чек.
- Поговорить с ассистентом и услышать ответ.
Ограничения
- Модели неверно читают мелкий текст, рукописный текст и перегруженные изображения.
- Цепочки моделей теряют интонацию и акценты, когда речь становится текстом.
- Обработка изображений и аудио стоит дороже, чем текста.
Как это использует Venta
Изображения, которые вы перетаскиваете в разговор, отправляются модели, которая умеет их рассматривать. Голос работает в обе стороны: ваша речь распознаётся, а ответы можно прослушать вслух.
Вопросы, которые задают первыми
- Можно ли говорить с Venta вместо того, чтобы печатать?
- Да. Голос работает в браузере, на телефонах и в приложении для Windows; как именно — описано на странице о голосе.
- Может ли Venta прочитать снимок экрана?
- Да. Перетащите изображение в разговор и задайте вопрос о нём.
- Мультимодальный ИИ — это то же самое, что генеративный ИИ?
- Нет. Генеративный ИИ создаёт новый контент; мультимодальный работает с несколькими видами данных. Система может быть одним, другим, обоими или ни тем ни другим.