智能路由方法
Router One 默认按 model_name 策略把精确模型请求路由到该模型;遇到可重试的上游错误时,可能改由提供同一模型的其他健康线路重试。只有 model="auto" 使用服务端候选集,按 EWMA 延迟(alpha 0.20、15 分钟过期)、公示成本与可靠性打分;路由权重不对用户开放配置。
最后更新:
路由信号
- 延迟(EWMA)
- 按模型和供应商维护指数加权移动平均,alpha=0.20。指标记录在 15 分钟后过期,避免陈旧观测持续影响决策;它不是固定的最近 50 个请求窗口。
- 可靠性
- 已观测到的成功与失败结果会形成候选路由的可靠性信号。我们不承诺一个可由用户配置的固定阈值,也不声称每个请求都会自适应打分。
- 成本
- 当受支持的候选路由路径生效时,公示的 token 级成本可与延迟、可靠性一起参与候选判断。
- 路由模式
- 生产环境默认使用 model_name 策略。精确模型请求按该选择执行;model="auto" 使用服务端候选集,不接受用户自定义权重或 router 对象。
故障转移行为
- 触发条件
- 当一次上游尝试属于可重试失败且仍有可用候选时,网关可按路由策略尝试下一个候选。
- 保持请求模型不变
- 对于精确模型请求,故障转移可尝试为同一模型提供服务的其他健康供应商线路,不会替换成其他模型变体;model="auto" 路径则在服务端候选集中重试。
- 回退延迟
- 端到端延迟包含失败尝试及后续候选尝试,会随上游失败类型和响应时间变化;Router One 不承诺统一的 200ms 故障转移时延。
- 重试次数有界
- 重试受可用候选集与网关策略限制。公开产品合同没有项目级重试上限配置。
Trace 里能看到什么
- 模型与请求 ID
- 记录的模型和请求 ID 用于核对用量以及向支持团队定位同一次调用。
- 状态与已记录延迟
- 客户日志展示请求状态、已记录延迟和已有的脱敏错误。上游供应商身份、服务线路和中间尝试链不对外公开。
- token 与花费
- 输入与输出 Token、可用的缓存读取 Token,以及已结算费用或待结算标记;有定价详情时一并展示。
配置边界
- 精确模型选择
- 在标准 OpenAI 兼容请求中指定所需模型。默认 model_name 策略不会把每个请求重新解释为自适应优化问题。
- 自适应候选路由
- 使用 model="auto" 时,Router One 管理候选集,可比较延迟、成本与可靠性,并在全局 auto-route 重试预算内处理符合条件的失败。
- 不隐含自定义控制
- 本方法说明不承诺项目级或 API Key 级权重、质量评分、请求体 router 对象、provider allowlist 或项目级故障转移开关。
常见问题
我能按项目或 API Key 配置路由权重吗?
当前公开产品合同不提供项目级或 API Key 级的延迟、成本、质量权重。受支持的候选路由使用网关管理的延迟、成本与可靠性信号。
Router One 会悄悄换模型吗?
不会。故障转移保持已请求模型不变;Trace 记录模型和请求 ID,公开合同不承诺切换到其他模型变体。
路由决策对线上变化的反应有多快?
受支持的候选路由按模型和供应商维护 alpha=0.20 的延迟 EWMA,记录在 15 分钟后过期。适应速度取决于新的观测量,不承诺固定秒数或请求数。