模型、上下文与缓存
选择模型,理解 Codex 实际上下文窗口,并提高第三方 API 缓存命中。
1. 1M 上下文是什么意思,怎么设置?
- 上下文(Context Window)是模型单次对话中能"看到"的内容总量,包括你的提问、历史对话和代码文件等。上下文越大,模型能参考的信息越多,适合大型项目和长对话。
以下是 Codex 中使用时的上下文窗口口径:
gpt-5.4:支持 1M(100 万 token)上下文gpt-5.5:名义窗口为 272K,Codex 实际会话窗口约为 258Kgpt-5.6:名义窗口为 272K,Codex 实际会话窗口约为 258K,最好在 272K 之内使用,超出会造成长上下文的双倍计费
在 ~/.codex/config.toml 中配置:
model_context_window = 272000
model_auto_compact_token_limit = 258000
model_context_window:模型的上下文窗口大小model_auto_compact_token_limit:当对话达到这个 token 数时,自动压缩历史消息,避免超出上限
2. 如何提高 Claude Code 使用第三方 API 时的缓存命中?
- 在
~/.claude/settings.json的env字段里加上:"CLAUDE_CODE_ATTRIBUTION_HEADER": "0"。
{
"env": {
"CLAUDE_CODE_ATTRIBUTION_HEADER": "0"
}
}
这个配置会关闭 Claude Code 默认附加的归属头,减少请求特征差异,从而提升 prompt cache 的命中率,降低调用成本。