上下文窗口
上下文窗口是模型一次能同时考虑的最大 token 数,涵盖指令、对话,以及随问题一并发送的一切。
它是上限,不是额度。窗口二十万 token 的模型,并不会因为你塞给它二十万就答得更好;它只从你给它的内容里作答,而这些内容每次请求都要计费。
窗口被填满的过程中,有两件事在劣化。取回某个具体事实的准确率,会随着周围无关材料的增多而下降,其中位于长窗口中段的部分下降最快。同时矛盾也更可能出现:材料越多,其中两处彼此打架的机会就越多。
所以更大的窗口是容量上的进步,不是质量上的。它让“发送更多”成为可能,并没有让“发送更多”成为好主意。