文档/ 运维

运行时设置

这些参数在管理台里改,即时生效,不需要重启。和环境变量是两回事——那些改完要重启。

两层设置§

同一批参数存在于两个层级:

  • 系统级——在设置页配置,作为全局默认值
  • 分组级——在分组的设置标签页配置,填了就覆盖系统值,留空则继承

这样设计是因为不同上游的特性差异很大: 有的服务商响应慢但稳定,有的快但偶尔抽风, 用同一套超时和重试参数不合适。

FIG. 1 — 系统级设置全局默认值

分组里没有单独配置时,用的就是这里的值。

怎么确认生效值

分组的设置标签页会标出哪些是继承自系统、哪些是本分组单独覆盖的。 排查「为什么这个分组行为和别的不一样」时,先看这里。

三种超时§

三个超时管的是请求生命周期里的不同阶段,症状不同,别调错:

参数管什么该调它的症状
首字节超时从发出请求到收到第一个字节上游排队久,请求还没开始响应就被判失败
请求超时整个请求的总时长上限长输出任务被中途掐断
流空闲超时流式响应中,两个数据块之间的最大间隔流式输出中途卡住很久,但连接没断

推理模型要特别注意首字节超时—— 它们在开始输出前可能思考很久,默认值偏紧的话会误判为失败。

重试与拉黑§

  • 重试次数——一个请求失败后最多换几个凭据重试。 调大能提高成功率,但失败请求的耗时也会变长
  • 拉黑阈值——一个凭据连续失败多少次后被自动摘除。 调小能更快隔离坏凭据,但偶发抖动也可能误伤

两者的完整机制见 调度是怎么做的

会话亲和§

开启后,网关会根据访问密钥、客户端协议以及请求中的指令或首个用户输入前缀 生成软亲和键,具有相同稳定前缀的请求会尽量落在同一个凭据上。 三个参数:

  • 开关——是否启用
  • TTL——一条亲和记录保留多久
  • 容量——最多记住多少条会话(默认一万条)
它是软亲和,不是资源绑定

亲和机制不读取 previous_response_idconversation或其他上游资源 ID。它适合让具有相同提示前缀的普通请求尽量复用凭据, 但不能保证有状态资源回到创建它的凭据。 这类资源请使用单凭据,或确认上游支持跨凭据共享。

日志留存§

请求日志保留天数决定日志留多久,默认 7 天,过期自动清理。

调大能查更久的历史,但数据库会持续增长—— 请求量大的话注意磁盘。用 SQLite 时尤其要留意。

其他§

  • 校验间隔——多久对凭据做一次可用性校验
  • 模型价格自动同步——是否从公开数据源同步价格, 见 模型管理。 注意这一项可以被环境变量 MODELS_DEV_AUTO_SYNC_ENABLED 接管—— 一旦设了那个变量,这里就变成只读,见 环境变量
  • 请求头规则用量选项注入—— 非标场景用,见 代理与请求头

什么时候该调§

默认值适用于大多数情况,没有明确症状就别动。盲目调大超时和重试,只会让失败的请求失败得更慢。

按症状对号入座:

  • 推理模型频繁超时 → 调大首字节超时(优先在该分组单独调)
  • 长文本任务被截断 → 调大请求超时
  • 流式输出中途断开 → 调大流空闲超时
  • 好凭据被频繁拉黑 → 调大拉黑阈值
  • 坏凭据隔离太慢 → 调小拉黑阈值
  • 有状态请求报找不到上下文 → 使用单凭据,或确认上游支持跨凭据共享资源

调整前先用 监控与排障 确认症状,只改和症状相关的那一项,改完观察一段时间再动下一个。

运行时设置 - GPT-Load