1 USD = 1,000,000 credits(微美元精度)。
按 token / 按次的费率在 价格表 中以美元报价,
每晚从生产网关刷新。
什么花什么钱
权威实时费率始终是 bytespike.ai/pricing。
失败不计费
任何非 2xx 响应都是免费的,无论失败的是哪个模型、失败发生在请求多深入的位置。这是一条硬契约 —— 非 2xx 时X-Quota-Remaining-Credits 不变。
唯一的窄例外:如果你在渲染已经开始(status running)之后 取消一个视频任务,已渲染的部分秒数可能按该模型自己的退款政策计费。Cancel 响应里的 credits_used 字段是权威。详见
tasks/cancel。
账目响应头
每次响应都带配额信封(成功和失败都带):
单次请求的实际成本不在响应头里 —— 通过
GET /api/v1/usage 查询,
每次调用返回一行,含 prompt_tokens、completion_tokens 和最终计费的 credits。
预估预算
对 “这次大概花 $X,确认吗?” 的流程:- 用 价格表 按
max_tokens× 输出费率 + prompt 大小 × 输入费率算个最坏情况。 - 与上次调用拿到的
X-Quota-Remaining-Credits对比(或直接调/v1/balance—— 免费)。 - 如果估算超出预算,就别发请求。
- 请求之后,通过
/api/v1/usage对账实际成本。
配额悬崖
任一 条件满足时,key 停止服务请求:X-Quota-Remaining-Credits = 0(触达 key 的quota上限)X-RateLimit-Remaining = 0(key 最紧的那条速率桶耗尽)- 组织钱包空了(组织持有的 key)
402 insufficient_balance(OpenAI 信封)或
permission_error(Anthropic 信封)。要抬上限,在
Console → API keys 编辑 key,
或者给组织钱包充值。