双 Pro 拼池的 GPT 中转,实测下来到底什么水平

1046 字
5 分钟
双 Pro 拼池的 GPT 中转,实测下来到底什么水平

号商把两个 ChatGPT Pro 账号拼成池子,套一层 OpenAI 兼容 API 卖中转。这种中转满大街都是,但水平参差。我花了一上午把它三款模型实测了一遍,顺便踩了几个坑,写下来给你省时间。

相关阅读:Best Codex 中转:三把钥匙、一个 Luna——那边偏分组钥匙与额度账本;这篇偏并发脾气。

并发不超过 3 的时候它非常好用,写个 HTML 静态页 9 到 10 秒出完,首包延迟 1.6 到 2 秒。但别拿它当高并发底座,并发过 10 延迟开始排队式恶化,高压流式还会 502。额度没有查询接口,你付的是号商服务费,不是 API 里能查的余额。

先看它是什么

OpenAI 兼容协议,Anthropic 的 /v1/messages 也通。模型白名单 7 个:gpt-5.6-sol / terra / luna、gpt-5.5、gpt-5.4、gpt-5.4-mini、codex-auto-review。注意它是明文 HTTP,这个后面单独说。

压测最怕各测各的,口径先定死

指标定义说明
TTFT首 token 延迟请求发出到收到第一个分片
纯生成 TPS生成速度输出 token ÷(总耗时 − TTFT)
稳定并发错误率可控的最大并发并发阶梯逐档试出来

两条硬规矩:TPS 必须扣掉 TTFT 再算;错误率要把流式中断算进去,HTTP 200 不代表响应拿全了。这类流式接口得自己解析分片,现成压测工具不太顺手。

三款模型,脾气各不相同

指标gpt-5.6-lunagpt-5.6-terragpt-5.6-sol
定位轻量快响应均衡旗舰重推理
空闲流式 TTFT~2s~1.6s1.72.2s
长输出 TPS~50~52~40
3 并发小任务~9s 出完 HTML~10s 出完 HTML短任务更快,长页 15~24s
  • luna 是快枪手。日常首选,首包最低,也最耐并发。长文档别指望它。
  • terra 是均衡款。数据点少,但 3 并发下 10 秒出完落地页,表现最平。
  • sol 是重炮。输出质量最高,但最慢,写长页要 15 到 24 秒。短任务反而结束得快,适合深度推理。

并发一上来,就露馅了

并发平均延迟长尾
55.9sP95 7.1s
1020.6sP95 31.6s
2029.2sP95 51.9s

延迟随并发线性恶化,稳定吞吐只有 QPS 0.4 到 0.7。两个账号的配额就那么多,并发再高只是排队。判定口诀:单请求快、并发就垮,基本就是账号拼池。

并发的代价:左边顺畅,右边排队
并发的代价:左边顺畅,右边排队

上下文倒是出奇地大

塞到 200k 字符(约 128k tokens)还能正常返回,120k 之后响应反而变快,疑似命中 prompt caching。两次独立测试都没摸到硬上限。

踩的坑,一个比一个值钱

短任务 TPS 是假的。 几十个 token 的短任务,生成段被连接建立和首包延迟盖住,TPS 能虚高到 15 甚至更高。TPS 只信长输出,短任务只看 TTFT。

高压流式会 502。 并发拉高后流式响应中途断流,网关直接 502,偶尔返回 200 但内容只有一半。客户端必须校验结束标记,压测要把「200 但没结束标记」算失败。

额度查不到。 常见余额接口全是 502,像是把请求原样转给 chatgpt.com。买的 120 到 130 刀是号商服务费,不是 API 余额,只能问卖家或用到报错。

额度是个谜:秤盘空着,仪表没刻度
额度是个谜:秤盘空着,仪表没刻度

明文 HTTP + key 已暴露。 传输是明文,key 又在多个会话里出现过。当已泄露处理,用完轮换。

TTFT 单次波动大。 1.9 到 6.9 秒都出现过,看中位数别被均值带偏,空闲串行重测最可信。

最后说下怎么选

场景选谁理由
日常对话、补全、小任务luna首包最快,最耐造
长文、分析terra上下文稳,性价比平衡
深度推理sol质量最稳,但慢,走离线批处理
并发控制在 3 到 5超过就开始排队

说到底,它是典型的「单请求快、上下文大、并发弱」中转,适合个人工具和日常 AI 编码辅助,不适合当高并发服务底座。这些坑记下来,下次就不用再踩一遍。☕( ̄▽ ̄)ノ

评论区

像发消息一样写就好:点工具栏插入表情 / 图片,表情会直接显示。插图 ≤5MB。