LLM 可观测:一次请求一条 Trace
Router One 是一个 OpenAI 兼容的 LLM API 网关,客户侧 Usage Trace 会记录每个请求的最终结果。对 30+ 支持模型(GPT、Claude、Gemini、Grok)的调用,每条 Trace 都带有最终模型与供应商、输入/输出 Token、端到端延迟、HTTP 状态与返回的报错,以及这次请求按公示费率计的花费。这里不展示失败供应商尝试或故障转移链;支持团队可通过 request_id 在运维日志中关联中间尝试。这是面向开发者和小团队的请求级可观测与花费管控,而不是企业审计、合规或 RBAC 系统。
每条 Trace 里有什么
| 信号 | Router One Trace | 直接调用供应商 |
|---|---|---|
| 使用的模型与供应商 | 逐请求记录,含解析出的实际路由 | 取决于你那一次 SDK 调用指向哪里 |
| 输入 / 输出 Token | 逐请求统计并保存 | 在响应里,得你自己记录 |
| 每请求成本 | 按各模型公示单价逐笔计费 | 事后自己对账单 |
| 延迟 | 端到端测量并保存 | 得你自己埋点 |
| 最终解析路由 | Trace 展示最终模型与供应商,不展示尝试链 | 没有故障转移,5xx 就是一个错误 |
| 状态码与错误 | 逐请求记录,可在 Logs 中检索 | 在你自己的日志里(如果有) |
| 花费上限 | 按 Key 的 maxSpend 能拦住失控循环 | Key 上没有硬性上限 |
去哪里看
Dashboard -> Logs
每次请求是一行,展示最终模型与供应商、Token、成本、延迟和状态。按 API Key 或模型筛选,找到出问题的调用;如需支持团队检查中间供应商尝试,请复制其 request_id。
Dashboard -> Usage
按模型和按 API Key 拆分的请求量、Token 量与花费随时间的变化。看清是哪个模型、哪个 Key 在拉高成本——全部按公示费率从你的预付钱包计费。
预算与限流
每个 API Key 自带 maxSpend,以及 rateLimit 和 tokenLimitTpm。失控循环会先撞上自己的上限而停下,而不是把整个余额耗尽——无需治理套件即可管控花费。
一条 Trace 的样子
// 一次请求 -> 一行 Trace { "model": "anthropic/claude-sonnet-4.6", "provider": "<routed>", "input_tokens": 512, "output_tokens": 200, "cost_usd": 0.0042, "latency_ms": 1180, "status": 200, "request_id": "demo_req_7f3a" }
请求数据处理
客户侧 Trace 展示最终模型与供应商、Token 数、成本、延迟和状态等元数据,便于调试和核对预算。Router One 不留存直接 API 调用的 prompt 和模型回复正文,仅记录用于计费、用量统计与故障排查的请求元数据。Playground 会保存会话历史,方便用户回看和继续对话。
查看数据留存政策常见问题
一条 Trace 里到底有什么?
每条客户侧请求 Trace 会记录最终模型与供应商、输入与输出 Token 数、按公示费率计的成本、端到端延迟和状态。逐请求可在 Dashboard -> Logs 查看,聚合数据可在 Dashboard -> Usage 查看;这里不展示中间失败尝试或故障转移链。
Router One 会保存我的 prompt 和响应吗?
Router One 不留存直接 API 调用的 prompt 和模型回复正文,仅记录用于计费、用量统计与故障排查的请求元数据。Playground 会保存会话历史,方便用户回看和继续对话。
怎么防止失控循环把余额耗尽?
给 API Key 设置 maxSpend,以及 rateLimit 和 tokenLimitTpm。当循环撞到该 Key 的花费上限或限流时,这个 Key 上的请求会停止,而不会消耗整个钱包。预算是按 Key 设置的,不是按项目。
这是企业级审计或合规平台吗?
不是。这是面向开发者和小团队的请求级可观测与花费管控,不是审计日志、合规或 RBAC 系统。没有组织/角色结构——限额和预算挂在 API Key 上。
供应商出故障时 Trace 会显示什么?
如果符合条件的重试在另一个提供同一精确模型的供应商上成功,客户侧 Trace 只展示最终模型、供应商与请求指标,不展示失败尝试或故障转移链。支持团队可通过 request_id 在运维日志中排查中间尝试。
相关页面
看清每一次请求,管好每一块钱
立即接入