O que é IA multimodal?
IA multimodal é uma IA que recebe ou produz mais de um tipo de dado, como texto, imagens, áudio ou vídeo, em vez de só texto.
Alguns modelos são multimodais por si mesmos; outros sistemas juntam vários modelos de propósito único, um para voz, um para texto, um para imagens.
Como funciona
Um modelo multimodal transforma cada tipo de entrada em uma forma interna comum, então consegue ler uma foto e uma pergunta juntas. Um sistema sem esse modelo ainda pode ser multimodal encadeando modelos: a voz é transcrita em texto, o texto é respondido e a resposta é lida em voz alta.
Exemplos
- Perguntar o que está errado em uma captura de tela de um erro.
- Ler um gráfico ou um recibo fotografado.
- Falar com um assistente e ouvir a resposta.
Limitações
- Os modelos leem mal textos pequenos, letra cursiva e imagens carregadas.
- Sistemas encadeados perdem tom e ênfase quando a voz vira texto.
- Imagens e áudio custam mais para processar que texto.
Como a Venta usa isso
As imagens que você solta em uma conversa são enviadas a um modelo que consegue olhá-las. A voz funciona nos dois sentidos: o que você fala é transcrito, e as respostas podem ser lidas em voz alta.
As perguntas que as pessoas fazem primeiro
- Posso falar com a Venta em vez de digitar?
- Sim. A voz funciona no navegador, nos celulares e no app para Windows; a página de voz explica como.
- A Venta consegue ler uma captura de tela?
- Sim. Solte a imagem na conversa e pergunte sobre ela.
- IA multimodal é o mesmo que IA generativa?
- Não. IA generativa se refere a criar conteúdo novo; multimodal se refere a trabalhar com mais de um tipo de dado. Um sistema pode ser um, os dois ou nenhum.