搭建了一个 sub2api来分发 gpt 订阅,之前一直使用正常,但是 gpt6 发布后,发现首字延迟爆高(20-120 秒)且 首字延迟 ≈ 整体用时
怀疑是 nginx 配置(排除,直连 sub2api 也一样)
怀疑是 sub2api BUG(排除, 社区其他人没有反馈)
怀疑是 落地 IP问题(排除,已换几个双 ISP,纯家宽,表现都一致)
于是直接拿 access_token 调用官方 api,也是一样。
求问下有没有遇到过这种场景的,是怎么解决的?
非常诡异的点在于
使用 gpt-5 系列的模型,是正常的
唯独使用 gpt-6 就出现这个问题
https://chatgpt.com/backend-api/codex/responses
上游直连复现了相同现象,6.1 的整段输出不是 nginx 或 sub2api 转发造成的。
| 模型 | HTTP | 首段正文 | 正文 delta 数 | 输出跨度 |
|---|---|---|---|---|
| gpt-5.6-sol | 200 | 5.26 秒 | 365 | 9.00 秒 |
| gpt-6.1-sol | 200 | 27.31 秒 | 1 | 一次性返回 398 字 |
两次均正常收到 response.completed,没有 Content-Encoding,返回 Transfer-Encoding: chunked。