蛛网文化传播
用户9159
分享
GPT-6 Astra 推理档位怎么选,额度为什么没了
输入“/”快速插入内容
GPT-6 Astra 推理档位怎么选,额度为什么没了
写给用 Codex 跑 GPT-6 Astra、看着额度往下掉一脸懵的你。所有数字来自 OpenAI 官方文档、OpenAI 工程师的公开发言和 Artificial Analysis 的公开数据,截至 2026 年 9 月 9 日。文末附来源。
⚠️前排提醒:本文由 Claude Fable 5.1 撰写;理论内核来源——跳蛛先生(人类)。
先说结论
1.
推理档位确实影响额度,但它只是官方列出的
六个因子之一
。另外两个同量级的项,很多人一个字都没听过:
Fast 模式按 2.5 倍扣
,
上下文每一回合都要重发
。
2.
档位排序里真正不划算的是
Max
,不是 Extra High。两者在公开基准上分数持平,Max 贵四成。
3.
Ultra 不是「更聪明的档位」,是「Max 推理 + 自动拉子代理分工」。任务拆不开就别开,开了就是纯多付。
下面把每一条讲清楚。
一、推理档位到底是什么
先解释两个词。
•
Codex
:OpenAI 的编码代理,能在你的电脑里读文件、改代码、跑命令。它和网页版 ChatGPT 聊天是两个产品。
•
推理档位
(reasoning effort):你允许模型在给答案之前「想多久」。OpenAI 官方文档的原话是:
同一个模型,不同的推理 token 预算
。模型没换,换的是它被允许花多少思考量。
Codex 界面上的六个选项,对应关系如下。
界面上的名字
官方说明
Light(命令行里叫 Low)
快速回答,轻量推理
Medium(默认)
速度与深度平衡,日常任务
High
复杂问题用更深的推理
Extra High
比 High 更深
Max
给单个任务更多思考时间
Ultra
最大推理 + 自动把任务派给子代理
注意最后一行。前五个是同一个模型的不同思考预算,Ultra 是一个
模式
,后面单独讲。
另外两条官方细节:
•
推理过程你看不到,但
按输出 token 计费
。这是它贵的根本原因,下一节讲。
•
一个会话里可以中途改档位,上下文不丢。但只在普通单代理模式下可以,Ultra 模式下不能改。
二、额度是怎么扣的
OpenAI 在订阅套餐里按「积分」扣额度,积分按 token 数算。官方原话:
你的提示词、文件、聊天历史、工具结果、模型的回复,全都消耗 token。
GPT-6 Astra 的扣分率如下(单位:积分 / 每百万 token)。
类型
积分
输入
250
缓存输入(重复发送、命中缓存的部分)
25
输出,包括看不见的推理
1250
看这三个数的比例就明白了:
输出是输入的 5 倍,是缓存输入的 50 倍
。推理 token 走输出,所以档位越高越贵,这一点没错。
但官方紧接着说了一句很多科普文不引的话:
模型选择、上下文、推理、工具调用、检索、缓存,全都影响消耗,光看提示词长度估不准。
六个因子。
其中三个和你的日常操作直接相关:
1. Fast 模式,2.5 倍。
官方原文:Fast mode applies a 2.5x multiplier to Astra's Standard rate。它只让模型快 1.5 倍左右,代价是每一个 token 都按 2.5 倍扣。作为对比,在公开基准上从 Medium 升到 High 成本只多约一成。
一个 Fast 开关,抵三档推理。
2. 上下文,每一回合都重发。
Codex 这类代理每次调用工具都是一次完整请求,整段对话历史、读过的文件、工具输出都会随每一回合重新发送。命中缓存的部分按 1/10 计,但没缓存的新内容按全价。一个跑了两百回合、上下文几十万 token 的长会话,输入侧的累计消耗可以超过推理侧。
3. 推理档位。
就是上一节讲的。
再补三条你可能关心的:
•
网页版 ChatGPT 聊天和 Codex 的额度是分开的。
5 小时限额的范围是「ChatGPT Work 和 Codex」这两个代理类产品,普通聊天单独计量。所以查资料、问问题去网页版聊,别在 Codex 里聊。
•
Pro 的额度是 Plus 的 5 倍或 20 倍
,对应 100 美元和 200 美元两档。官方原话。
•
Plus 用 Astra 的额度,官方只给了一个估计区间:
每 5 小时约 5 到 45 条本地消息
,按任务重量浮动。周上限没公布。
三、各档位值不值:看数据
OpenAI 工程师 Tibo Sottiaux 在 2026 年 9 月 7 日的原话:
GPT-6 Astra 开 low 的表现,好于上一代 GPT-5.6 Sol 开 high。如果你之前在 Sol 上用 high 用得很满意,建议在 Astra 上降到 low 或 medium。