输入 token 与输出 token
输入 token 是一次请求中发送给模型的一切,输出 token 是它写回来的内容;在代理工作里,输入端主导账单,通常高出一个数量级以上。
这种不对称正是关键所在。一段回答不过几百到几千 token,产生它的上下文却动辄数万,而且与回答不同,它会在下一轮、再下一轮继续被重发。
这也是为什么“让模型答得简短些”对成本几乎没有影响,而“注意发送了什么”影响巨大。
输入还会因为是新鲜的还是缓存的而按不同价格计费。缓存输入按新鲜价的一小部分收费,这意味着两次原始 token 数完全相同的会话,花费可能相差很多。任何诚实的比较都必须说明它量的是哪一种。