Router One
返回博客

2026 年 8 月 LLM 新模型指南:Claude Opus 5、GPT-5.6 家族与 Grok 4.6

发布Router One Team

2026 年 7 月底到 8 月中,Router One 这个 OpenAI 兼容端点背后的模型目录迎来了少见的密集上新:Claude Opus 5、GPT-5.6 三兄弟(Sol、Luna、Terra)、Grok 4.6、Kimi K3、DeepSeek V4 Flash 全部可调,顶配位置还有 Claude Fable 5。这篇指南讲清楚每个模型是干什么的、它们相互之间处在哪个价格档位——具体的每百万 token 单价一律以模型目录为准,本文刻意不转印任何价目表——以及如何用一把 Key、只改一个 model 参数就把任意两个模型拉出来 A/B。

上了什么、什么时候上的

这批模型里有三个带可核实的上架日期。先把口径说清楚:下面这些是模型上架 Router One 目录的日期,不是厂商自己的发布日期。

模型上架 Router One 目录
Claude Opus 52026-07-24
Kimi K32026-07-25
DeepSeek V4 Flash2026-08-04

GPT-5.6 家族、Grok 4.6 和 Claude Fable 5 同样已在目录中可调;这几个没有干净的上架日期可考,所以本文不写。

Claude Opus 5

Claude Opus 5 延续了大多数编码 agent 默认标配的 Opus 血统。最重要的规格是 1M token 上下文窗口——整个仓库切片、测试输出和会话历史可以塞进一次请求——最大输出与 Claude Opus 4.8 一样是 8K,而它实际上就是接替 Opus 4.8 的编码默认位。在两代 Anthropic 模型之间拿不准的话,那个对比页会从实时目录渲染两张规格表。跨厂商的话,Claude Opus 5 vs GPT-5.6 Sol 是最值得研究的一对,长上下文对手则看 Claude Opus 5 vs Gemini 3.1 Pro

Claude Fable 5

Fable 5 在 Anthropic 产品线和 Router One 订阅档位里都排在 Opus 5 之上——它是旗舰档模型。同样 1M 上下文,但最大输出大得多(32K),这对一轮就要吐出大 diff、长结构化文档或整文件重写的 agent 很关键:8K 的输出上限会造成一轮轮续写循环,32K 直接消化掉。视觉与工具调用都在。比 Opus 5 贵出来的部分值不值,取决于具体负载——Claude Fable 5 vs Claude Opus 5 把两张规格表摆在一起,Claude Fable 5 vs GPT-5.6 Sol 则是跨厂商旗舰对决。

GPT-5.6 家族:Sol、Luna、Terra

OpenAI 的 GPT-5.6 这一代是三个模型共用一副骨架——约 1M token 上下文、128K 最大输出、视觉、工具调用——摆在三个价位上:

  • GPT-5.6 Sol 是旗舰。把整个代码库塞给它之前有个规格值得知道:prompt 超过约 272K token 会按单独的长上下文档计费,所以模型页上是两行价格而不是一行。GPT-5.6 Sol vs GPT-5.5 展示代际变化。
  • GPT-5.6 Terra 是日常主力的中间档。Sol vs Terra 就是那道「我真的需要旗舰吗」的判断题。
  • GPT-5.6 Luna 是大批量的低价位变体,对位 Gemini 3.6 Flash 所在的档位。

家族结构本身就是卖点:先用 Sol 打样,再把同一批 prompt 降档到 Terra 或 Luna 跑一遍,量化便宜档到底损失多少质量——下面的 A/B 一节讲怎么做。

Grok 4.6

Grok 4.6 是目录里 xAI 的现役主线模型,接替 Grok 4.5——Grok 4.6 vs Grok 4.5 列出了变化。规格:500K 上下文(是 Claude 和 GPT 旗舰的一半,但对绝大多数负载仍然完全够用)、128K 最大输出,价格在中间档、明显低于旗舰。所以有意思的对比是纵向的:想知道旗舰溢价值不值,看 Grok 4.6 vs GPT-5.6 Sol;同档正面交锋看 Grok 4.6 vs GPT-5.6 Terra。国内如何稳定调用 Grok 系列,另见 Grok API 国内接入页

Kimi K3

Kimi K3 是月之暗面的旗舰推理模型,2026-07-25 上架,1M token 上下文。它在 agentic 编码社区带着实打实的热度,目录位置也很有辨识度:旗舰级上下文、中间档价格。能力标签和实时单价见模型页;最该先读的对比是 Kimi K3 vs DeepSeek V4 Flash——这两个国产模型正好卡住成本谱系的两端,K3 是推理位,V4 Flash 是走量位。

DeepSeek V4 Flash

先纠正一个框架性误解:DeepSeek V4 Flash 不是 8 月的新模型。V4 这一代——Pro 和 Flash——2026 年 4 月就发布了,把「接近前沿的质量」的价格下限整个往下拉了一截;我们的国内模型横评对那次剧变有完整展开。2026-08-04 变化的是可用性:V4 Flash 现在可以经 Router One 调用了。它的角色是低价大批量档的现任者:1M 上下文、工具调用、流式输出,价格在本文所有模型里处于最低档。分类、摘要、抽取、大规模聊天轮次——先用它试,错误率证明不够用了再升档。低价档的另一个选项见 豆包 Seed 2.0 Lite vs DeepSeek V4 Flash

它们各自在哪个价格档——但不转印价目表

博客里印一张按模型的价格表,几周内就会变成错的,所以本文不放;模型目录列着这里每个模型的实时单价、上下文窗口和能力标签,每个模型的详情页显示当前生效价格。部分模型最低官方价 1 折(up to 90% off)。

一篇文章能经得住时间的,是截至 2026 年 8 月中的相对分档:

  • 旗舰档: Claude Fable 5、Claude Opus 5、GPT-5.6 Sol——为「答错的代价远高于 token 费」的任务定价。
  • 中间档: GPT-5.6 Terra、Grok 4.6、Kimi K3——日常主力档。
  • 低价档: GPT-5.6 Luna、DeepSeek V4 Flash——为吞吐量定价。

按负载选型

编码。 Claude Opus 5 和 GPT-5.6 Sol 是两个够格的默认项,它们的对比页是起点;最难的任务升级到 Claude Fable 5,32K 输出上限也在这时候回本。选好之后把它接进编辑器或 CLI 只需配一次——Claude Code、Codex CLI、CursorZedContinue 指向的都是同一个网关端点,国内直连、无需翻墙。

长程 agent 任务。 跑上几个小时的会话会不断累积上下文,所以 1M 上下文的模型——Opus 5、Fable 5、GPT-5.6 家族、Kimi K3——是自然之选;500K 够用时 Grok 4.6 是省钱候选。比选型更重要的是两件网关侧的事:给每个 agent 配独立 Key 并设 maxSpend 消费上限,失控循环会停在你定的数字上(按 Key 成本追踪);可重试的上游故障让自动 fallback 在运行中消化,而不是留给你 agent 的错误处理。

低价批量。 DeepSeek V4 Flash 打头,GPT-5.6 Luna 做交叉验证——批量任务发现需要更多推理时,再看 Kimi K3 vs DeepSeek V4 Flash

一把 Key、一个端点、真 A/B

本文所有模型都在同一个 OpenAI 兼容端点背后,所以任意两个之间的 A/B 就是一行改动——不用第二个账号、第二套 SDK、第二段计费关系。充值方面,支付宝或银行卡在同一个托管收银台完成,也支持 6 条链上的 USDT/USDC,无需美国信用卡。

import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.router.one/v1",
    api_key=os.environ["ROUTER_ONE_API_KEY"],
)

PROMPT = "重构这个函数,并解释取舍:..."

for model in ["anthropic/claude-opus-5", "openai/gpt-5.6-sol"]:
    r = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": PROMPT}],
    )
    print(model, r.choices[0].message.content[:200])

同一批 prompt 跑完两个候选,去每请求 Trace 日志里读结果:每次调用都记录模型、token、费用、延迟和状态,「哪个模型每解决一个任务实际更便宜」就从表格考古变成了一个控制台筛选条件。改字符串、重跑、看账本——目录更新这么快的时候,这套循环就是统一 LLM API 网关最实际的回报。

常见问题

调这些模型需要分别注册各家厂商的账号吗? 不需要。本文所有模型都能用一把 Router One API Key 在同一个 OpenAI 兼容端点上调用——切换模型只是改 model 参数,不是开新账号。中国大陆可直连,无需 VPN。

DeepSeek V4 Flash 是 2026 年 8 月的新模型吗? 不是。DeepSeek V4 这一代 2026 年 4 月就发布了,V4 Flash 是其中的低价走量档。新的是可用性:它于 2026-08-04 上架 Router One 目录。本文所有日期都是目录上架日期,不是厂商发布日期。

这些模型经 Router One 调用是什么价格? 本文刻意不印任何单价,因为它们会过期。模型页列着每个模型的实时单价、上下文窗口和能力标签,部分模型最低官方价 1 折(up to 90% off)。

新模型里编码该默认用哪个? Claude Opus 5 和 GPT-5.6 Sol 是两个够格的默认项,答案取决于你的代码库和工作流——用一把 Key 把固定的 prompt 集在两边各跑一遍,在请求 Trace 里比较每解决一个任务的成本。需要旗舰级推理或 32K 大输出上限时,升级到 Claude Fable 5。

相关权威页面

这篇文章归入「LLM API 网关与路由」主题,以下页面作为商业页、配置文档、证据页和信任事实源。

商业主页面Router One API 网关承接统一模型调用、路由、fallback、预算和观测的产品首页。API 文档Router One API 文档OpenAI 兼容端点、CLI 配置和模型调用示例。证据页智能路由方法论路由信号、最终模型与 provider,以及客户侧 trace 的字段边界。对比页OpenRouter 替代方案专业对比全球模型目录与中国友好路由、支付能力的差异。信任页可引用事实表面向搜索爬虫、AI 答案引擎和客户的稳定事实源。数据留存数据留存政策prompt/completion 留存边界和请求元数据政策。网关页面统一 LLM API 网关一个 OpenAI 兼容端点接入整个模型目录,含路由、fallback 与预算控制。路由页面智能模型路由候选排序如何使用延迟、公示成本与可靠性信号。故障转移页面LLM 供应商故障转移什么样的请求才符合在另一条健康供应商路由上重试的条件。可观测页面逐请求 Trace 日志每个请求的最终模型与供应商、Token、延迟、状态与报错。兼容性页面OpenAI 兼容端点沿用 OpenAI SDK,只改 base URL 即可触达各个模型系列。成本追踪页面LLM 成本追踪按 Key、按模型、按请求的花费归因,配合硬性消费上限。转售方页面在 Router One 上搭你自己的 API 服务带消费上限的客户 Key、按 Key 的用量归因,以及明确的「不提供」清单。客户端接入SDK 与客户端配置指南把 OpenAI SDK、LangChain、Vercel AI SDK、Cline、Aider、Dify、Roo Code 指向同一个端点。模型对比模型价格与上下文两两对比每百万 token 单价、上下文窗口与能力,渲染自实时模型目录。

相关阅读