> For clean Markdown of any page, append .md to the page URL.
> For a complete documentation index, see https://docs.openmodels.market/llms.txt.
> For AI client integration (Claude Code, Cursor, etc.), connect to the MCP server at https://docs.openmodels.market/_mcp/server.

# 用量与消费

使用 OpenModels 控制台的用量和积分视图，了解请求如何消耗 token 和积分。

## 需要监控的指标

在开发和生产阶段监控以下信号：

| 指标           | 重要性              |
| ------------ | ---------------- |
| 请求量          | 显示流量增长和异常的请求峰值   |
| 输入 token     | 有助于估算提示词成本和上下文用量 |
| 输出 token     | 有助于估算生成成本        |
| 总消费额         | 显示积分随时间的消耗情况     |
| 按 API 密钥的消费额 | 确定哪个应用或环境正在消耗积分  |
| 按模型的消费额      | 确定哪些模型推动了成本      |
| 余额           | 显示是否需要添加更多积分     |
| 月度限额用量       | 显示密钥是否接近已配置的上限   |

## API 密钥维度

当您需要清晰归因用量时，请为不同环境和工作负载创建单独的 API 密钥。

示例：

* `development`
* `staging`
* `production`
* `support-agent`
* `batch-jobs`

这样可以更轻松地识别哪个工作负载消耗了积分，以及应调整哪个月度限额。

## 模型维度

使用模型维度的消费额比较成本和质量。如果某个工作负载成本较高，请检查是否存在以下情况：

* 提示词比预期更大
* 输出过长
* 在较低成本模型足以胜任的场景使用了高成本模型
* 重试增加了请求量
* 工具调用向对话增加了额外消息

## 成本排查流程

当消费额高于预期时：

1. 检查消费额增加的时间窗口。
2. 按 API 密钥细分用量。
3. 按模型细分用量。
4. 对比输入 token 和输出 token。
5. 检查重试或较长输出是否增加了 token 数量。
6. 调整模型选择、`max_tokens`、提示词或月度消费限额。

## 生产告警

对于生产工作负载，请同时使用月度消费限额和自动充值：

* 月度消费限额可防止单个密钥超额消费。
* 自动充值有助于避免余额中断。
* 用量监控可显示哪个密钥或模型推动了消费。

如果请求因余额不足或消费限额错误而失败，请一并检查积分、用量和消费限额。