流式传输
流式传输
当你想在模型生成内容时即时展示输出,而不是等待完整响应时,请使用 streaming。OpenModels 通过带有 stream: true 的 POST /chat/completions 支持兼容 OpenAI 的 streaming。
基础 URL:
端点:
请求
在请求 body 中将 stream 设置为 true:
cURL
使用 -N,让 cURL 不缓冲响应:
响应会作为 server-sent events 发送:
读取每个 data: event,在存在 choices[0].delta.content 时追加内容,并在收到 [DONE] 时停止。
Python
Node.js
处理流式输出
- 按顺序追加文本 deltas。
- 将缺少
delta.content视为正常情况。有些 chunks 只携带元数据。 - 如果需要保存最终答案,请维护一个本地 buffer。
- 如果连接在文本开始 streaming 后断开,请判断重试是否可能复制用户可见输出。
- 记录你的客户端请求 ID、模型 ID、端点,以及网关返回的任何
error.request_id。
计费
流式传输改变的是输出交付方式,而不是用量计费方式。积分基于实际输入和输出 token 用量消耗。