什么是上下文窗口?
上下文窗口是 AI 模型一次能接收的文本量,以 token 计算,包括指令、此前的对话、任何文档,以及留给回复的空间。
模型对你的请求所知道的一切都必须装进其中。装不下的内容,对那次回答来说就不存在。
工作原理
文本被切分成 token,每个只有几个字符,模型的上下文窗口是固定数量的 token。每次请求都会重新发送相关历史,因此长对话、大文件或大量工具结果会更快填满窗口。
窗口满了就必须有所取舍:旧消息被丢弃或总结,长结果被截短,或者请求被拒绝。
示例
- 长时间聊天中,模型似乎忘了开头说过的内容。
- 一个大型 PDF 只能分段检索,而不能整体读完。
- 工具结果(例如一个很长的网页)挤占了对话的其余部分。
局限
- 更大的窗口每次请求成本更高,也可能更慢。
- 模型对长窗口中各部分的利用并不均衡;中间的细节可能被忽略。
- 窗口不是记忆:其中的内容不会自动带到下一次对话。
Venta 如何使用
当对话变长时,Venta 会把较早的轮次压缩成一段简短笔记,让之前说过的内容继续生效而无需重新发送。对自带模型来说仍然过大的请求,会在截短长工具结果后重新发送;如果仍然过大,Venta 会明确告诉你。
对于你的文档,Venta 会查找与问题匹配的段落并发送这些段落,而不是整份文件。
大家最先问的问题
- 一个单词有多少个 token?
- 在英语中,一个 token 平均约四个字符,所以一个单词通常是一到两个 token。其他语言和代码往往占用更多。
- 上下文窗口越大越好吗?
- 不一定。它能让模型一次读更多内容,但成本更高,也不能保证模型都用好。挑选合适的段落往往效果更好。
- Venta 能记住上下文窗口之外的内容吗?
- 能,通过记忆:它保存的关于你的信息,你可以查看、下载,也可以在某个项目中关闭。