Aller au contenu principal

Qu'est-ce que l'IA multimodale ?

L'IA multimodale est une IA qui reçoit ou produit plus d'un type de données, comme du texte, des images, de l'audio ou de la vidéo, au lieu du seul texte.

Certains modèles sont multimodaux en eux-mêmes ; d'autres systèmes assemblent plusieurs modèles spécialisés, un pour la voix, un pour le texte, un pour les images.

Comment ça marche

Un modèle multimodal convertit chaque type d'entrée en une forme interne commune, ce qui lui permet de lire une photo et une question ensemble. Un système qui n'en a pas peut quand même être multimodal en enchaînant des modèles : la voix est transcrite en texte, on répond au texte, et la réponse est lue à voix haute.

Exemples

  • Demander ce qui ne va pas sur une capture d'écran d'une erreur.
  • Lire un graphique ou un ticket de caisse photographié.
  • Parler à un assistant et l'entendre répondre.

Limites

  • Les modèles lisent mal les petits caractères, l'écriture manuscrite et les images chargées.
  • Les systèmes enchaînés perdent le ton et l'insistance quand la voix devient du texte.
  • Les images et l'audio coûtent plus cher à traiter que le texte.

Comment Venta l'utilise

Les images que vous déposez dans une conversation sont envoyées à un modèle capable de les regarder. La voix fonctionne dans les deux sens : ce que vous dites est transcrit, et les réponses peuvent être lues à voix haute.

Les questions qu'on pose en premier

Puis-je parler à Venta au lieu de taper ?
Oui. La voix fonctionne dans le navigateur, sur les téléphones et dans l'application Windows ; la page consacrée à la voix explique comment.
Venta peut-elle lire une capture d'écran ?
Oui. Déposez l'image dans la conversation et posez votre question.
L'IA multimodale est-elle la même chose que l'IA générative ?
Non. L'IA générative désigne la création de contenu nouveau ; multimodal désigne le travail avec plus d'un type de données. Un système peut être l'un, les deux ou aucun.