不少使用者反馈GPT5.6Sol存在额度消耗过快的难题,很多时候并非任务体量过大,而是模式选择、上下文管控不当引发隐性损耗。后台自动生成子智能体、长文本触发溢价计费、模型持续延伸输出,都会加速额度流失。想要合理控制消耗,需要从运行模式、参数配置、任务规划多方面调整,下面分享一套实用的控耗方案。

1、避开Ultra与Fast

Ultra模式会默认派发多个子智能体并行协作。目前框架存在缺陷,容易在后台无限生成子智能体(类似细胞分裂),短时间内就能烧光几小时的额度。

Fast模式虽然速度提升了 1.5 倍,但额度消耗却是正常模式的 2.5 倍,开 Fast 等于主动加速烧钱。

普通任务使用默认模式或Standard速度,Ultra仅留给极度复杂的架构项目,且尽量在提示词中限制子智能体的使用。

2、调整推理强度

单次请求输入超过272K tokens后,整次请求会按高价结算(输入×2、输出×1.5)。Codex跑长任务时上下文容易滚雪球,一旦越过这个阈值,后续每次请求都在高价区扣费。

日常复杂任务用“高”(High)即可,拉到“极高”成本会飙升2.4倍,但得分提升微乎其微。

3、在Prompt中设置“停止点”

5.5和5.6很大的一个区别是,5.5经常会在任务过程中停下来,比如“我完成了任务的第一部分,以及第二部分的一半,等待指示”,即使用户根本没要求。所以很多时候必须借助/goal来避免这种情况。5.6把这个问题解决了,最直接的结果就是,goal基本上没有意义了,因为每一条消息几乎都是被当成goal看待的。

这样就导致GPT-5.6非常“不爱停”,容易一直精修。务必在提示词中写明“做到这一步就停,等我确认”,强制控制上下文长度。

4、拆分长任务与复用缓存

感觉上下文快满时,主动使用 /compact 或新开会话,避免触碰272K的高价阈值。稳定前缀(如系统提示词、基础文档)尽量吃缓存。

5、修改AGENTS.md限制权限

在项目的AGENTS.md文件中添加“未经批准,禁止开启 Subagent”的指令,防止它在普通任务里偷偷开团队。