Saltar al contenido principal

¿Qué es la IA multimodal?

La IA multimodal es una IA que recibe o produce más de un tipo de datos, como texto, imágenes, audio o vídeo, en lugar de solo texto.

Algunos modelos son multimodales en sí mismos; otros sistemas combinan varios modelos de un solo propósito, uno para la voz, otro para el texto, otro para las imágenes.

Cómo funciona

Un modelo multimodal convierte cada tipo de entrada en una forma interna común, de modo que puede leer una foto y una pregunta a la vez. Un sistema sin un modelo así puede ser multimodal encadenando modelos: la voz se transcribe a texto, se responde al texto y la respuesta se lee en voz alta.

Ejemplos

  • Preguntar qué falla en una captura de pantalla de un error.
  • Leer un gráfico o un ticket fotografiado.
  • Hablar con un asistente y oír su respuesta.

Limitaciones

  • Los modelos leen mal el texto pequeño, la letra manuscrita y las imágenes recargadas.
  • Los sistemas encadenados pierden el tono y el énfasis cuando la voz pasa a texto.
  • Procesar imágenes y audio cuesta más que procesar texto.

Cómo lo usa Venta

Las imágenes que sueltas en una conversación se envían a un modelo que puede verlas. La voz funciona en los dos sentidos: lo que dices se transcribe y las respuestas pueden leerse en voz alta.

Las preguntas que la gente hace primero

¿Puedo hablar con Venta en lugar de escribir?
Sí. La voz funciona en el navegador, en los teléfonos y en la app de Windows; la página de voz explica cómo.
¿Puede Venta leer una captura de pantalla?
Sí. Suelta la imagen en la conversación y pregunta por ella.
¿La IA multimodal es lo mismo que la IA generativa?
No. La IA generativa se refiere a crear contenido nuevo; multimodal se refiere a trabajar con más de un tipo de datos. Un sistema puede ser una cosa, las dos o ninguna.