定价指南

以 Markdown 格式查看

OpenModels 展示模型价格,便于开发者在路由流量前比较成本。按令牌定价的路由会列出输入和输出令牌价格;其他路由可使用请求、图片或端点专用的计价单位。

如何阅读模型价格

“模型”页面展示以下列:

含义
模型 ID传入 model 字段的值
输入输入令牌价格;对于非令牌路由则为列出的请求/图片价格
输出生成的输出令牌价格;不适用时为 -
上下文可用时模型的最大上下文窗口
路由可用提供商路由数量和默认路由标签
供给列出的路由供给是否已验证
状态模型当前是否在线

按令牌定价的值使用 /1M。按请求和按图片定价的路由会在 Models 表中显示 /req/image

供应商路由

每个模型可以有一个或多个供应商路由。如果省略 route,OpenModels 会为所选模型使用默认可用路由。如果传入 route.provider,用量将按所选提供商路由计费。

请使用已在 Models 表或 OpenModels 控制台中确认的提供商名称:

{
"model": "qwen3.5-flash",
"route": { "provider": "<provider-for-this-model>" },
"route_mode": "balanced",
"messages": [{ "role": "user", "content": "Hello!" }]
}

成本公式

对于按令牌定价的对话模型,请求成本基于实际令牌用量:

cost = (input_tokens / 1,000,000 * input_price)
+ (output_tokens / 1,000,000 * output_price)

示例:

input_tokens = 10,000
output_tokens = 2,000
input_price = $0.029 / 1M tokens
output_price = $0.295 / 1M tokens
cost = 10,000 / 1,000,000 * 0.029
+ 2,000 / 1,000,000 * 0.295

最终积分扣除以该请求报告的实际用量为准。

输入与输出价格

输出令牌通常比输入令牌更贵。对于输入密集型工作负载看似便宜的模型,在长文本生成工作负载中可能成本更高。

比较模型时,请考虑:

  • 预期提示词长度
  • 预期输出长度
  • 模型是否需要推理能力
  • 模型是否需要工具调用或视觉能力
  • 上下文窗口要求
  • 可靠性和路由可用性

上下文不等于价格

上下文窗口是模型能够考虑的最大文本量。更大的上下文窗口本身并不意味着每个请求成本更高;成本取决于实际发送和生成的令牌。

分层定价

有些模型采用分层定价。在这种情况下,适用价格可能取决于用量阈值或模型专属定价规则。将分层模型用于生产环境前,请查看 Models 表和路由详情。

按成本选择模型

对于开发和高吞吐量分类任务,如适合该任务,可先使用 qwen3.5-flash 等低成本模型。

对于复杂推理、工具使用、长上下文或视觉任务,即使令牌价格更高,也应选择能力匹配任务的模型。若需要多次重试或产生不可用结果,较便宜的模型并不更便宜。

价格变更

模型可用性和价格会随供给、路由可用性和供应商定价变化而变化。启动新的生产工作负载前,请查看 Models 页面。