排障与支持
延迟与超时
区分连接、首个流式事件、首段有效内容与总耗时,正确理解后台渠道测试。
“慢”可能发生在不同阶段#
| 阶段 | 你看到的现象 | 可能影响因素 |
|---|---|---|
| 连接阶段 | 请求难以建立,页面或客户端也连接不稳定 | 本地网络、DNS、代理、TLS 和网络线路。 |
| 等待第一段内容 | 已连接,但迟迟没有输出 | 服务排队、上游连接、输入长度、模型推理。 |
| 持续生成 | 开始输出后仍需等待很久 | 输出长度、模型生成速度、工具调用和中途网络波动。 |
首页打开快,不能证明模型请求快;简单网络请求的首字节时间,也不等于模型的首个有效内容时间。判断时应比较同一个模型、相近输入和相同客户端。
比较之前,先确认计时口径#
| 指标 | 实际表示什么 | 不能据此判断什么 |
|---|---|---|
| 连接建立耗时 | 请求建立连接所需时间,可进一步区分 DNS、TCP 与 TLS。 | 不包含完整模型生成过程;也不能直接当作一次网络往返 RTT。 |
| 服务端首个 SSE 事件 | 服务端向上游发起请求后,收到第一个流式事件的时间。 | 事件可能只是创建、状态或心跳信息,不一定含可展示的回复。 |
| 客户端首段有效内容 | 从客户端发起请求,到收到第一段可用文本或实际结果内容的时间。 | 不等于服务端首个 SSE 时间;还包括传输、客户端处理等环节。 |
| 请求总耗时 | 从请求开始到完整结果返回或请求结束的时间。 | 会随输出长度、推理、图片生成与工具流程变化,不能当作纯网络延迟。 |
| 后台渠道测试耗时 | 一次渠道测试从开始到完成的用时,可能包括连接、等待和生成。 | 后台显示的“响应时间”不是连接 RTT;不同测试模型与任务之间不能直接比较。 |
图片测试通常需要等到完整生成结果,因此渠道测试值可能明显长于短文本测试。排查时注明从哪里计时、何时开始和结束、是否流式,以及使用的模型和任务;不要把后台测试耗时、服务端首个事件和客户端首段内容放在同一列比较。
先做一次小范围对照#
- 使用一个短输入、较短预期输出,保持模型和分组不变。
- 记录请求时间、所在地区、网络类型、是否使用代理,以及大致多久看到首段内容。
- 在相近时段做少量重复观察,区分偶发波动与持续变慢。
- 如果只有长对话慢,新建短会话比较;不要同时更换网络、模型和参数。
你可以先做的调整#
需要边生成边显示的场景可以使用流式响应。减少与当前任务无关的历史消息,明确需要的输出长度,并控制同一时间的请求数。持续使用时复用客户端连接,也能减少重复建立连接的开销。
这些调整影响的环节不同。流式输出通常能更早展示内容,但不意味着模型总生成时间必然缩短;增大超时只会延长等待,不会让模型更快。
代理和线路如何选择#
使用正式接入地址 https://lensapi.top。如果本地配置了网络代理,可在允许的网络环境下对照其影响;不要把其他站点的“加速域名”当成 LensAPI 线路,也不要将密钥发送给不明测速站。
反馈持续变慢的问题#
提供同模型的快、慢两次记录最有帮助:时间及时区、模型、客户端版本、输入与输出大致长度、是否流式、客户端首段有效内容时间和总时长。如果附上后台渠道测试值或服务端指标,请单独注明指标名称与计时范围。若有请求 ID 一并附上;无需发送完整私密对话。可直接使用问题反馈模板。