跳到主要内容

什么是上下文窗口?

上下文窗口是 AI 模型一次能接收的文本量,以 token 计算,包括指令、此前的对话、任何文档,以及留给回复的空间。

模型对你的请求所知道的一切都必须装进其中。装不下的内容,对那次回答来说就不存在。

工作原理

文本被切分成 token,每个只有几个字符,模型的上下文窗口是固定数量的 token。每次请求都会重新发送相关历史,因此长对话、大文件或大量工具结果会更快填满窗口。

窗口满了就必须有所取舍:旧消息被丢弃或总结,长结果被截短,或者请求被拒绝。

示例

  • 长时间聊天中,模型似乎忘了开头说过的内容。
  • 一个大型 PDF 只能分段检索,而不能整体读完。
  • 工具结果(例如一个很长的网页)挤占了对话的其余部分。

局限

  • 更大的窗口每次请求成本更高,也可能更慢。
  • 模型对长窗口中各部分的利用并不均衡;中间的细节可能被忽略。
  • 窗口不是记忆:其中的内容不会自动带到下一次对话。

Venta 如何使用

当对话变长时,Venta 会把较早的轮次压缩成一段简短笔记,让之前说过的内容继续生效而无需重新发送。对自带模型来说仍然过大的请求,会在截短长工具结果后重新发送;如果仍然过大,Venta 会明确告诉你。

对于你的文档,Venta 会查找与问题匹配的段落并发送这些段落,而不是整份文件。

大家最先问的问题

一个单词有多少个 token?
在英语中,一个 token 平均约四个字符,所以一个单词通常是一到两个 token。其他语言和代码往往占用更多。
上下文窗口越大越好吗?
不一定。它能让模型一次读更多内容,但成本更高,也不能保证模型都用好。挑选合适的段落往往效果更好。
Venta 能记住上下文窗口之外的内容吗?
能,通过记忆:它保存的关于你的信息,你可以查看、下载,也可以在某个项目中关闭。