服务对象与地域限制
PuppyIP 仅面向海外合规企业及其授权人员提供服务,不面向中国大陆地区开放或提供代理服务。本服务仅限用于中国大陆境外的合法业务活动,严禁在中国大陆境内使用本服务。
代理 IP 或服务器位于境外,不改变上述限制。不得通过中转、转接、共享或转售向中国大陆境内的最终使用者提供本服务。使用前请阅读用户服务协议。
本文要点
- AWS 于2026年10月5日公告支持 GLM 5.3;模型卡记录同日上线、当前 Active,并明确仅向符合资格的客户开放。
- 模型提供100万 token 上下文、最多128K输出;官方公告说明推理始终启用,可选择推理强度,并支持显式提示缓存。
- 只支持跨区域推理,使用 us.zai.glm-5.3 或 global.zai.glm-5.3;不支持 In-Region 按需推理。
- 当前 Standard 公示价按百万 token 计:Global 输入1.68美元、输出5.28美元;US 输入1.848美元、输出5.808美元。缓存、其他服务层级及账户实际账单需分别核对。
- 这条 Bedrock 新增能力不等于阿里云模型下架的自动迁移方案;旧平台的截止日、认证和调用规则仍需独立核对。
发生了什么:Bedrock 新增 GLM 5.3,先确认企业资格
AWS 在2026年10月5日公告 Amazon Bedrock 支持 Z.ai 的 GLM 5.3。当前模型卡把上线日期记为同日、生命周期记为 Active。这是 Bedrock 的新模型接入消息,面向希望在 AWS 环境中处理代码、长上下文与多步骤工程任务的团队。公告日期、本文发布日和你的账户实际开放时间是不同概念。
公告明确写的是符合资格的企业客户;模型卡进一步要求有需要的客户联系 AWS account team。公开页面没有给出适用于所有账户的资格判定表、逐账户开通时间或统一领取路径。看到模型名称、控制台入口或价格表,都不能证明自己的账户已取得访问权限。
为什么值得关注:长上下文、推理与工程任务
官方描述的主要用途包括代理式编程、较长周期的软件工程、仓库级代码生成和重构,以及跨多次工具调用的工程任务。100万 token 上下文与最多128K输出,给需要处理大量代码和持续任务上下文的团队提供了新选项;这两个上限不是每次请求都能用满、每个仓库都能正确理解或任务必定完成的承诺。
AWS 公告说明推理始终启用,并可选择推理强度,在延迟、token 消耗与任务表现之间作取舍。模型卡还明确支持函数调用、结构化 JSON 输出及流式响应,包括流式推理内容。生产评估仍要检查工具授权、输出结构、超时和失败处理;模型具有工具调用能力,不等于可以向它授予所有系统操作权限。
调用方式:US 与 Global 推理 ID 不能和基础 ID 混用
GLM 5.3 在 Bedrock 只通过跨区域推理提供。当前模型卡列出 US 推理 ID 为 us.zai.glm-5.3、Global 推理 ID 为 global.zai.glm-5.3,基础模型 ID 为 zai.glm-5.3;程序调用必须使用相应的 US 或 Global 推理 ID,而不能因为基础 ID 出现在表格里就用它发起单区域按需请求。官方明确不支持 In-Region on-demand inference。
模型卡的程序访问表列出 bedrock-runtime,示例分别展示 Chat Completions、Invoke 和 Converse。先按自己所用 API 的官方示例核对请求字段、认证方式和 endpoint;不要把其他平台的模型名、base URL、API Key 或 Responses 接口支持直接套到 Bedrock。本文没有执行真实推理请求,也没有验证某个账号的实际接入结果。
跨区域意味着什么:来源区域与数据路由要一起核对
US 与 Global 是不同的推理配置选择。官方区域说明把地理范围内跨区域路由与全球跨区域路由分开;Global 不代表请求始终留在发起区域,US 也不等于单个美国区域。存在数据驻留或内部合规约束的团队,应先确认允许的路由范围,再选择推理 ID。
当前模型卡与区域兼容页面列有来源区域及各推理模式的可用状态。应在实际使用的区域逐项查兼容表,再核账户权限与配额;不能由一个区域列有 Bedrock endpoint 推断所有模式都可用,也不能由其他团队成功调用推断自己已开通。具体账户资格、实际配额和审批进度仍以自己的 AWS 账户及 account team 为准。
当前公示费用:Standard 的 US 与 Global 价格分开
2026年10月6日核对 AWS 官方价格页,GLM 5.3 的 Standard 公示价格按每100万 token 计:Global CRIS 输入1.68美元、输出5.28美元;US CRIS 输入1.848美元、输出5.808美元。这是官方当时展示的模型及推理选项价格,不能当作所有地区、所有服务层级或所有企业合同的实际结算金额。
价格页还把缓存读取与30分钟缓存写入单独列价。预算不能只用提示词字数乘输入单价,还要分别记录输入、输出、缓存命中、缓存写入及实际服务层级。账户合同、税费、真实请求用量和最终账单本文未读取;使用前重新打开当前价格页及自己的授权账单口径,不从模型上限推算必然费用或承诺省钱。
缓存可以做什么:复用上下文,不是每次都自动省钱
AWS 公告确认可在系统提示及消息上设置显式缓存点。模型卡说明默认支持隐式缓存,并给出显式缓存检查点最少1024 token、保留时间至少30分钟。适合把重复使用的大段背景和稳定系统说明纳入缓存设计,但仍应以当前提示缓存文档和实际请求结果确认具体行为。
缓存读取、写入和普通输入在价格表中是不同项目。上下文发生变化、未达到检查点要求或未命中缓存时,成本和延迟可能不同。仅看到缓存支持或配置字段,不能认定某次请求已命中、已经降低延迟或已经减少账单;这些需要已有授权的实际用量证据。
现在可以做什么:先核资格,再做可回退的小规模评估
现有 Bedrock 用户可以先向 account team 确认资格,再记录拟使用的来源区域、US 或 Global 推理 ID、API、服务层级、配额和价格。把这些作为一套配置核对,避免只改 model 字符串,却沿用不匹配的区域、认证或数据路由假设。这里没有新增的通用免费额度、自动迁移或所有账号开通承诺。
获得实际访问权限后,再在自己的隔离环境用获授权且脱敏的固定样本评估代码质量、结构化输出、工具调用、响应结束、延迟和费用。多步骤任务应设置明确的停止条件、预算和回退方式。只有真实请求、业务验收与账单核对完成,才能记录接入或迁移成功;官方支持公告本身不代替这些结果。
已有 GLM 调用不要误判:Bedrock 新入口不是其他平台的迁移答案
站内《阿里云 Model Studio 11款模型下架》讨论的是阿里云旧 model ID、区域、协议与截止日。此次 Bedrock 支持 GLM 5.3,属于另一个平台的新接入能力;不能把同属 GLM 系列当成自动替换关系,也不能假定 API、价格、权限或输出行为等价。原有下架待办应继续按原平台的官方通知处理。
需要使用 GLM 5.3 的读者,下一步是核对 Bedrock 的资格、跨区域配置、兼容与成本。公开规则仍不完整的账户条件,应明确保留未知,等待 AWS 官方或自己的 account team 确认。
资料来源
常见问题
Amazon Bedrock 上的 GLM 5.3 已经可以用了吗?
AWS 已于2026年10月5日公告支持,模型卡记录当前 Active;但仅向符合资格的客户开放。是否可用还要核自己的账户资格、区域、权限和配额,不能理解为所有 AWS 账号已开通。
调用应该填写哪个模型 ID?
当前必须按所选跨区域配置使用 us.zai.glm-5.3 或 global.zai.glm-5.3。基础 ID zai.glm-5.3 不能替代这两种推理 ID 发起 In-Region 按需推理;官方明确不支持该模式。
百万 token 上下文是否意味着代码任务一定能完成?
不能。100万上下文和最多128K输出是模型能力上限说明,任务仍受实际配额、请求配置、工具权限、质量、超时和预算影响,需要用自己的固定样本验收。
GLM 5.3 在 Bedrock 的价格是多少?
2026年10月6日官方价格页展示 Standard 每百万 token:Global 输入1.68美元、输出5.28美元;US 输入1.848美元、输出5.808美元。缓存及其他层级另计,企业合同、税费与账户实际账单本文未知,使用前须重新核对。
US 或 Global 推理能保证请求只在一个区域处理吗?
不能。两者是跨区域推理配置,GLM 5.3 不支持 In-Region 按需推理。存在数据驻留要求时,应核官方路由和区域兼容说明,再结合自身合规条件选择,不能由发起 endpoint 推断全部处理位置。
这可以直接替代阿里云即将下架的 GLM 模型吗?
不能视为自动替代。Bedrock 与阿里云 Model Studio 的账号、认证、区域、API、价格和模型规则不同,原有下架与迁移待办仍需独立验证。