$ capsul 术语表
术语表
决定一个编码代理成本的那些词,先用一句话定义,再展开解释。
- Token(词元)
- token 是语言模型读取并据以计费的单位:一个常用词、一个词的片段或一个标点,平均大致相当于三到四个英文字符。
- 上下文窗口
- 上下文窗口是模型一次能同时考虑的最大 token 数,涵盖指令、对话,以及随问题一并发送的一切。
- 输入 token 与输出 token
- 输入 token 是一次请求中发送给模型的一切,输出 token 是它写回来的内容;在代理工作里,输入端主导账单,通常高出一个数量级以上。
- token 预算
- token 预算是对一次请求可纳入多少上下文的硬性上限,它在请求发出之前生效,而不是与模型协商出来的。
- 提示缓存
- 提示缓存让服务方在多次请求之间复用重复前缀的已处理结果,并把这部分 token 按新鲜价的一小部分计费。
- 缓存命中率
- 缓存命中率是一次请求的输入 token 中,由提示缓存提供而非重新处理的那一部分所占的比例。
- 上下文腐化
- 上下文腐化是指模型的回答随着上下文膨胀而变差:相关材料被稀释、新旧内容互相矛盾、废弃的死路不断堆积。
- 代理循环
- 代理循环是指模型调用工具、读取结果、再决定下一步,如此反复直到给出答案的这个循环。
- 工具调用
- 工具调用是模型发出的结构化请求,用来执行自身之外的动作,比如读取文件或运行命令,其结果会被送回上下文。
- 仓库地图
- 仓库地图是一份压缩后的代码库提纲,列出其文件以及各文件定义的符号,好让模型不必通读全部就能定位到东西。
- 用量上限
- 用量上限限制你在一段时间窗口内能发送多少,其计量基于已处理的 token,而不是发出的消息条数。
- 命令行编码代理
- 命令行编码代理是一个终端程序,它让模型在一个工作目录里读取、运行和修改内容,并受你设定的审批规则约束。