Qu'est-ce que l'IA multimodale ?
L'IA multimodale est une IA qui reçoit ou produit plus d'un type de données, comme du texte, des images, de l'audio ou de la vidéo, au lieu du seul texte.
Certains modèles sont multimodaux en eux-mêmes ; d'autres systèmes assemblent plusieurs modèles spécialisés, un pour la voix, un pour le texte, un pour les images.
Comment ça marche
Un modèle multimodal convertit chaque type d'entrée en une forme interne commune, ce qui lui permet de lire une photo et une question ensemble. Un système qui n'en a pas peut quand même être multimodal en enchaînant des modèles : la voix est transcrite en texte, on répond au texte, et la réponse est lue à voix haute.
Exemples
- Demander ce qui ne va pas sur une capture d'écran d'une erreur.
- Lire un graphique ou un ticket de caisse photographié.
- Parler à un assistant et l'entendre répondre.
Limites
- Les modèles lisent mal les petits caractères, l'écriture manuscrite et les images chargées.
- Les systèmes enchaînés perdent le ton et l'insistance quand la voix devient du texte.
- Les images et l'audio coûtent plus cher à traiter que le texte.
Comment Venta l'utilise
Les images que vous déposez dans une conversation sont envoyées à un modèle capable de les regarder. La voix fonctionne dans les deux sens : ce que vous dites est transcrit, et les réponses peuvent être lues à voix haute.
Les questions qu'on pose en premier
- Puis-je parler à Venta au lieu de taper ?
- Oui. La voix fonctionne dans le navigateur, sur les téléphones et dans l'application Windows ; la page consacrée à la voix explique comment.
- Venta peut-elle lire une capture d'écran ?
- Oui. Déposez l'image dans la conversation et posez votre question.
- L'IA multimodale est-elle la même chose que l'IA générative ?
- Non. L'IA générative désigne la création de contenu nouveau ; multimodal désigne le travail avec plus d'un type de données. Un système peut être l'un, les deux ou aucun.