PuppyIP 资源中心
AI 工具动态 7 分钟 发布于 2026-09-27

Amazon Bedrock 跨模型每日 token 配额:700M 门槛如何理解

AWS 于 2026 年 9 月 21 日把 Bedrock Runtime 每日 token 配额改为跨模型、按账户和 Region 统计。并用多个模型的团队,先核对自己的 Service Quotas 与适用端点,再判断文档里的 700M 是否能用于容量规划。

Amazon Bedrock Service Quotas 跨模型配额 token 额度 推理容量

服务对象与地域限制

PuppyIP 仅面向海外合规企业及其授权人员提供服务,不面向中国大陆地区开放或提供代理服务。本服务仅限用于中国大陆境外的合法业务活动,严禁在中国大陆境内使用本服务。

代理 IP 或服务器位于境外,不改变上述限制。不得通过中转、转接、共享或转售向中国大陆境内的最终使用者提供本服务。使用前请阅读用户服务协议。

本文要点

  • AWS 文档历史明确:bedrock-runtime 的旧 per-model 每日上限被 Cross-Model Max Tokens Per Day 取代,范围是每账户、每 Region 的受支持模型;这不是每个模型各有一份日额度。
  • General Reference 当前列 Cross-Model Account-Level Tokens Per Day 为每个受支持 Region 700,000,000,Adjustable 为 No;这个公开参考值不是你的账户已获额度或可调用次数证明。
  • 消耗按 on-demand 推理价格估算的 billed tokens 计算,受模型价格、输入输出比例和缓存命中影响;不能把 700M 当作未经加权的输入加输出 token 总数。
  • 每日跨模型门槛与 per-model、per-Region 的每分钟 token/请求限制同时需要检查;bedrock-mantle、Batch 与 Provisioned Throughput 不应被这张 Runtime 表自动涵盖。
  • 官方未给出所有受支持模型、归一化公式、账户级实际执行值或本团队的剩余额度。PRODUCT_FIT=NONE:更换 IP 不能提高 AWS 账户的 Service Quotas。

直接答案:旧模型日限额改成一个跨模型门槛

AWS 的 Amazon Bedrock User Guide 文档历史把更新日期记为 2026 年 9 月 21 日,并明确 bedrock-runtime 端点以 Cross-Model Max Tokens Per Day 替代原来的每模型每日 token 配额。新指标按账户、Region 统计支持范围内的 Bedrock 模型;文档只给日期,没有精确启用时刻或时区。

这改变了多模型流量的容量判断:不能再把不同模型旧表中的每日额度相加,也不能把某个模型未用完的分钟配额当作账户全天仍有容量。团队应先确认请求是否走 bedrock-runtime,再核对账户和 Region。已有具体模型调用教程可参考<a href="/resources/aws-bedrock-grok-4-6-endpoint-pricing-guide">Bedrock Grok 4.6 的双端点说明</a>,其中 Mantle 与 Runtime 模型 ID 和认证路径并不相同。

700M 是公开参考值,不是 7 亿原始 token 保证

AWS General Reference 当前把 Cross-Model Account-Level Tokens Per Day 列为每个受支持 Region 700,000,000,Adjustable 栏为 No。描述强调这是跨模型的 estimated billed tokens 总门槛,依据 on-demand 推理价格估算;实际消耗随模型价格、输入/输出 token 比例和缓存命中率变化。

因此不能用 7 亿除以单次原始 token 来承诺可运行次数,也不能把公开参考值当成每个账户、每个模型、每个区域都已经生效的实测值。账户管理员应在所用 Region 的 Service Quotas 与当前请求记录中核对可见配额;如果控制台值或执行结果与公开表冲突,应以账户级证据联系 AWS 确认,不自行套用换算公式。

影响矩阵:日门槛与分钟限制如何同时作用

跨模型日门槛:适用于 bedrock-runtime 的每账户、每 Region 的受支持模型总量,计数口径为价格相关估算值。每模型分钟限制:按模型和 Region 分别约束 token 或请求速率,部分模型的 RPM 规则不同,应查 Service Quotas。即便日预算还有余量,突发流量也可能先撞到分钟门槛;反过来,短时请求正常也不证明全天跨模型容量足够。

bedrock-mantle 有独立配额说明;Batch inference、Provisioned Throughput 和自定义推理配置也不能因为同属 Bedrock 就按本页 Runtime 日指标推断。跨区域推理还涉及源 Region、推理配置与模型支持范围,不能把一个 Region 的剩余容量直接移到另一个 Region。

规划时先区分端点、账户与模型组合

一个团队同时在同一账户与 Region 用多个 Bedrock 模型处理客服、代码和检索任务时,应先列出实际端点、模型 ID、Region、已获配额、分钟峰值和按模型计费的实际用量。按当前公开规则给跨模型日门槛留余量,并把缓存命中和输入/输出结构变化纳入预算;在账户读数未确认前不要用 700M 作为上线承诺。

如果容量检查接近门槛,暂停扩大批量任务,保留 request ID、Region、模型和可见配额,再按 AWS 文档与 Support 流程确认可用容量和增额路径。General Reference 的 Adjustable=No 不等于所有组合限制均能直接在控制台自行调高;本文不声称已替任何账户申请或验证增额。涉及外部数据访问时,配额之外还需核对权限与数据边界,参见<a href="/resources/amazon-bedrock-web-search-external-access-guide">Bedrock 外部 Web Search 接入说明</a>。

哪些仍需要账户证据

AWS 公开页面尚不足以证明某个账户当前显示的额度、哪些具体模型计入跨模型集合、价格归一化公式、重置时区、实时执行结果或支持团队能否提高该账户门槛。这些字段保持未知。选用网络出口或固定 IP 不会授予模型访问、Region 资格或 Service Quotas;需要容量决策时应回到 AWS 账户和官方支持渠道。

资料来源

常见问题

Amazon Bedrock 的跨模型每日配额什么时候写入文档?

AWS 文档历史标记 2026 年 9 月 21 日,将 bedrock-runtime 的旧每模型每日 token 配额改为按账户、Region 汇总的 Cross-Model Max Tokens Per Day;精确切换时刻未公开。

700M 是每个模型各自的 7 亿 token 吗?

不是。AWS General Reference 列每个受支持 Region 的跨模型参考门槛为 700,000,000,计数依据 estimated billed tokens;不能当作每个模型各自的原始 token 额度。

为何 700M 不能直接换算成调用次数?

实际消耗会随模型价格、输入输出比例和缓存命中变化,AWS 没有在这些公开页面给出可用于所有账户的固定原始 token 换算公式。

有跨模型日额度,还需要看每模型分钟配额吗?

需要。每日跨模型门槛与每模型、每 Region 的 TPM/RPM 限制是不同维度,短时峰值可先受分钟限制。

bedrock-mantle 或 Batch 调用也按这张 Runtime 表判断吗?

不能直接套用。这次公开说明针对 bedrock-runtime;Mantle、Batch 和 Provisioned Throughput 应分别查对应的 AWS 配额文档及账户数据。

更换代理 IP 能提高 Bedrock 每日配额吗?

不能。配额由 AWS 账户、Region、端点和服务规则决定,网络出口不改变 Service Quotas。