01 - 窗口里装了什么
前置:无。本篇是专题起点。
本篇回答:一次请求的 token 具体花在哪五个地方,它们各自怎么增长,以及在动手优化之前该先量什么。
本篇会用到的词:
| 词 | 意思 |
|---|---|
| 渲染顺序 | 一次请求拼成 token 序列时的固定顺序:tools → system → messages。它决定了什么在前缀里 |
| 增长阶 | 一项开销随轮次增长的方式:常数(每轮固定)、线性(每轮加一点)、或者更快 |
| 有效利用率 | 上下文里真正对当前这一步有用的 token 占比。它是这一层唯一值得优化 的目标 |
| 计数接口 | count_tokens,在不真正发起推理的前提下算出这次请求有多少输入 token |
一、上下文工程不是提示工程
两者的分界很清楚:
Anthropic 自己画过一张同题的图,正好补上上面那张缺的「形状」:

Tool result 送回候选池的回边 —— 上下文不再是你写好后就定型的一段文本,而是每一轮都要重新挑一遍的一个池子。图里两处剪刀标记的也正是本专题后面几篇的主题:压缩与裁剪。