Qu'est-ce qu'une fenêtre de contexte ?
Une fenêtre de contexte est la quantité de texte, mesurée en tokens, qu'un modèle d'IA peut prendre en compte d'un coup : les instructions, la conversation jusque-là, les éventuels documents et la place pour sa réponse.
Tout ce qu'un modèle sait de votre demande doit y tenir. Ce qui n'y tient pas n'existe pas, pour cette réponse.
Comment ça marche
Le texte est découpé en tokens, des morceaux de quelques caractères, et la fenêtre de contexte d'un modèle en compte un nombre fixe. Chaque demande renvoie l'historique utile, donc une longue conversation, un gros fichier ou un long résultat d'outil remplissent la fenêtre plus vite.
Quand la fenêtre est pleine, il faut céder quelque chose : les anciens messages sont abandonnés ou résumés, les longs résultats raccourcis, ou la demande est refusée.
Exemples
- Une longue conversation où le modèle semble oublier quelque chose dit au début.
- Un gros PDF qu'il faut interroger par morceaux au lieu de le lire en entier.
- Un résultat d'outil, comme une longue page web, qui chasse le reste de la conversation.
Limites
- Une fenêtre plus grande coûte plus cher par demande et peut être plus lente.
- Les modèles n'exploitent pas aussi bien toutes les parties d'une longue fenêtre ; des détails au milieu peuvent passer inaperçus.
- Une fenêtre n'est pas une mémoire : rien de ce qu'elle contient ne passe tout seul à la conversation suivante.
Comment Venta l'utilise
Quand une conversation s'allonge, Venta condense les anciens échanges en une courte note, pour que ce qui a été dit compte encore sans être renvoyé. Une demande encore trop grande pour le modèle inclus est renvoyée avec les longs résultats d'outils raccourcis, et Venta dit clairement si elle reste trop grande.
Pour vos documents, Venta cherche les passages qui correspondent à votre question et envoie ceux-là, plutôt que les fichiers entiers.
Les questions qu'on pose en premier
- Combien de tokens fait un mot ?
- En anglais, un token fait en moyenne environ quatre caractères, donc un mot fait généralement un ou deux tokens. D'autres langues et le code en demandent souvent davantage.
- Une fenêtre de contexte plus grande est-elle toujours meilleure ?
- Non. Elle permet à un modèle de lire davantage d'un coup, mais coûte plus cher et ne garantit pas qu'il l'exploite bien. Choisir les bons passages marche souvent mieux.
- Venta se souvient-elle de choses au-delà de la fenêtre de contexte ?
- Oui, grâce à la mémoire : ce qu'elle a enregistré sur vous, que vous pouvez voir, télécharger et désactiver pour un projet.