Перейти к основному содержимому

Что такое контекстное окно?

Контекстное окно — это объём текста в токенах, который модель ИИ может принять за один раз: инструкции, разговор до этого момента, документы и место для ответа.

Всё, что модель знает о вашем запросе, должно в нём поместиться. То, что не поместилось, для этого ответа не существует.

Как это работает

Текст делится на токены — фрагменты по несколько символов, а контекстное окно модели — это фиксированное их число. Каждый запрос снова отправляет нужную историю, поэтому долгий разговор, большой файл или объёмный результат инструмента быстрее заполняют окно.

Когда окно заполнено, чем-то приходится жертвовать: старые сообщения отбрасываются или сокращаются до сводки, длинные результаты обрезаются, или запрос отклоняется.

Примеры

  • Долгий чат, в котором модель словно забывает сказанное в начале.
  • Большой PDF, в котором приходится искать по частям, а не читать целиком.
  • Результат инструмента, например длинная веб-страница, который вытесняет остальной разговор.

Ограничения

  • Большее окно стоит дороже за запрос и может работать медленнее.
  • Модели неодинаково хорошо используют все части длинного окна; детали в середине могут ускользнуть.
  • Окно — это не память: ничего из него само по себе не переходит в следующий разговор.

Как это использует Venta

Когда разговор становится длинным, Venta сворачивает старые реплики в короткую заметку, чтобы сказанное раньше продолжало учитываться без повторной отправки. Запрос, который всё ещё слишком велик для встроенной модели, отправляется снова с обрезанными длинными результатами инструментов, и Venta прямо говорит, если он и так слишком велик.

Для ваших документов Venta ищет фрагменты, соответствующие вашему вопросу, и отправляет их, а не файлы целиком.

Вопросы, которые задают первыми

Сколько токенов в одном слове?
В английском токен в среднем занимает около четырёх символов, поэтому слово обычно составляет один-два токена. Другие языки и код часто занимают больше.
Всегда ли большее контекстное окно лучше?
Нет. Оно позволяет модели прочитать больше за раз, но стоит дороже и не гарантирует, что модель хорошо использует всё. Подбор нужных фрагментов часто работает лучше.
Помнит ли Venta что-то за пределами контекстного окна?
Да, благодаря памяти: тому, что она сохранила о вас, — это можно посмотреть, скачать и отключить для проекта.