模型、上下文与缓存

选择模型,理解 Codex 实际上下文窗口,并提高第三方 API 缓存命中。

1. 1M 上下文是什么意思,怎么设置?

  • 上下文(Context Window)是模型单次对话中能"看到"的内容总量,包括你的提问、历史对话和代码文件等。上下文越大,模型能参考的信息越多,适合大型项目和长对话。

以下是 Codex 中使用时的上下文窗口口径:

  • gpt-5.4:支持 1M(100 万 token)上下文
  • gpt-5.5:名义窗口为 272K,Codex 实际会话窗口约为 258K
  • gpt-5.6:名义窗口为 272K,Codex 实际会话窗口约为 258K,最好在 272K 之内使用,超出会造成长上下文的双倍计费

在 ~/.codex/config.toml 中配置:

model_context_window = 272000
model_auto_compact_token_limit = 258000
  • model_context_window:模型的上下文窗口大小
  • model_auto_compact_token_limit:当对话达到这个 token 数时,自动压缩历史消息,避免超出上限

2. 如何提高 Claude Code 使用第三方 API 时的缓存命中?

  • 在 ~/.claude/settings.json 的 env 字段里加上:"CLAUDE_CODE_ATTRIBUTION_HEADER": "0"。
{
  "env": {
    "CLAUDE_CODE_ATTRIBUTION_HEADER": "0"
  }
}

这个配置会关闭 Claude Code 默认附加的归属头,减少请求特征差异,从而提升 prompt cache 的命中率,降低调用成本。