文档/ 运维
运行时设置
这些参数在管理台里改,即时生效,不需要重启。和环境变量是两回事——那些改完要重启。
两层设置§
同一批参数存在于两个层级:
- 系统级——在设置页配置,作为全局默认值
- 分组级——在分组的设置标签页配置,填了就覆盖系统值,留空则继承
这样设计是因为不同上游的特性差异很大: 有的服务商响应慢但稳定,有的快但偶尔抽风, 用同一套超时和重试参数不合适。
分组里没有单独配置时,用的就是这里的值。
怎么确认生效值
分组的设置标签页会标出哪些是继承自系统、哪些是本分组单独覆盖的。 排查「为什么这个分组行为和别的不一样」时,先看这里。
三种超时§
三个超时管的是请求生命周期里的不同阶段,症状不同,别调错:
| 参数 | 管什么 | 该调它的症状 |
|---|---|---|
| 首字节超时 | 从发出请求到收到第一个字节 | 上游排队久,请求还没开始响应就被判失败 |
| 请求超时 | 整个请求的总时长上限 | 长输出任务被中途掐断 |
| 流空闲超时 | 流式响应中,两个数据块之间的最大间隔 | 流式输出中途卡住很久,但连接没断 |
推理模型要特别注意首字节超时—— 它们在开始输出前可能思考很久,默认值偏紧的话会误判为失败。
重试与拉黑§
- 重试次数——一个请求失败后最多换几个凭据重试。 调大能提高成功率,但失败请求的耗时也会变长
- 拉黑阈值——一个凭据连续失败多少次后被自动摘除。 调小能更快隔离坏凭据,但偶发抖动也可能误伤
两者的完整机制见 调度是怎么做的。
会话亲和§
开启后,网关会根据访问密钥、客户端协议以及请求中的指令或首个用户输入前缀 生成软亲和键,具有相同稳定前缀的请求会尽量落在同一个凭据上。 三个参数:
- 开关——是否启用
- TTL——一条亲和记录保留多久
- 容量——最多记住多少条会话(默认一万条)
它是软亲和,不是资源绑定
亲和机制不读取 previous_response_id、conversation或其他上游资源 ID。它适合让具有相同提示前缀的普通请求尽量复用凭据, 但不能保证有状态资源回到创建它的凭据。 这类资源请使用单凭据,或确认上游支持跨凭据共享。
日志留存§
请求日志保留天数决定日志留多久,默认 7 天,过期自动清理。
调大能查更久的历史,但数据库会持续增长—— 请求量大的话注意磁盘。用 SQLite 时尤其要留意。
其他§
- 校验间隔——多久对凭据做一次可用性校验
- 模型价格自动同步——是否从公开数据源同步价格, 见 模型管理。 注意这一项可以被环境变量
MODELS_DEV_AUTO_SYNC_ENABLED接管—— 一旦设了那个变量,这里就变成只读,见 环境变量 - 请求头规则与用量选项注入—— 非标场景用,见 代理与请求头
什么时候该调§
默认值适用于大多数情况,没有明确症状就别动。盲目调大超时和重试,只会让失败的请求失败得更慢。
按症状对号入座:
- 推理模型频繁超时 → 调大首字节超时(优先在该分组单独调)
- 长文本任务被截断 → 调大请求超时
- 流式输出中途断开 → 调大流空闲超时
- 好凭据被频繁拉黑 → 调大拉黑阈值
- 坏凭据隔离太慢 → 调小拉黑阈值
- 有状态请求报找不到上下文 → 使用单凭据,或确认上游支持跨凭据共享资源
调整前先用 监控与排障 确认症状,只改和症状相关的那一项,改完观察一段时间再动下一个。