PuppyIP 资源中心
AI 开发与自动化 5 分钟 发布于 2026-10-08

Grok 4.7 已上 Microsoft Foundry:部署怎么选,长上下文多少钱?

Grok 4.7 已在 Microsoft Foundry 正式可用,但部署类型和上下文档位会改变单价。先核 Azure 项目资格,再选 Global Standard 或 US Data Zone Standard;调用时填自己的部署名。当前微软部署指南已列出 50 万 token 窗口,不能只沿用发布博客的计划措辞。

Grok 4.7 Microsoft Foundry Azure API 价格 长上下文 模型部署

服务对象与地域限制

PuppyIP 仅面向海外合规企业及其授权人员提供服务,不面向中国大陆地区开放或提供代理服务。本服务仅限用于中国大陆境外的合法业务活动,严禁在中国大陆境内使用本服务。

代理 IP 或服务器位于境外,不改变上述限制。不得通过中转、转接、共享或转售向中国大陆境内的最终使用者提供本服务。使用前请阅读用户服务协议。

本文要点

  • 微软 10 月 6 日宣布 Grok 4.7 GA,支持 Chat Completions、Responses、工具调用与流式输出;具体项目仍须具备部署权限和配额。
  • Global Standard 短上下文每百万输入、输出、缓存 token 为 2、6、0.50 美元,达到或超过 20 万 token 的长上下文档为 4、12、1 美元。
  • US Data Zone Standard 对应两档为 2.20、6.60、0.55 美元,以及 4.40、13.20、1.10 美元,不能直接套用其他渠道账单。
  • 模型目录选择 grok-4.7、版本 1;API 请求的 model 字段填写实际部署名,输入与输出合计须适配当前上下文上限。

Foundry 上线了,谁能部署?

微软产品博客作者 Mahesh Balachandran 于 2026 年 10 月 6 日宣布,Grok 4.7 在 Microsoft Foundry Models 正式可用。对已经使用 Azure 的团队,这提供了新的模型接入渠道;已有 xAI、Bedrock 或 Copilot 账号,并不等于完成了 Foundry 部署。

当前部署指南要求有有效付款方式的 Azure 订阅、位于受支持区域的 Foundry 项目,以及创建和管理资源的权限。部署模型还需要资源上的 Cognitive Services Contributor 角色;GA 公告本身不保证每个项目已有可用配额。

Global 和 US Data Zone 该怎么选?

公告列出 Global Standard 与 US Data Zone Standard 两种部署类型。创建部署时先按项目的数据处理要求核对对应类型、区域可用性和容量,再比较价格;不要因为名称中有 Global 或 US,就跳过实际部署条件。

在 Foundry 模型目录选择 grok-4.7,当前指南列出的模型版本为 1。区域表与配额是独立检查项:本文没有确认某个订阅在哪些区域一定能部署,也没有把旧 Grok 型号的地区和限额继承给 4.7。

20 万 token 前后,单价差多少?

微软公告以 20 万 token 区分短、长上下文档。Global Standard 低于这一门槛时,每百万输入、输出、缓存 token 分别为 2、6、0.50 美元;达到或超过门槛时,分别为 4、12、1 美元。

US Data Zone Standard 的短上下文单价分别为 2.20、6.60、0.55 美元,长上下文则为 4.40、13.20、1.10 美元。以上是微软 Grok 4.7 公告中的美元报价;具体请求的档位和计费口径还要与部署价格页及用量字段对照。

举个假设:一条短上下文请求包含 1 万输入 token、1000 输出 token,没有缓存用量。仅按公布的 token 单价计算,Global Standard 约为 0.026 美元,US Data Zone Standard 约为 0.0286 美元;这不是实际账单或整套应用成本。

请求里的 model 填模型名还是部署名?

模型目录里选 grok-4.7,发送请求时的 model 则填你创建的部署名,两者可能不同。当前指南支持 Chat Completions 和 Responses:使用 Foundry 资源的端点,再按所选接口组织请求,不直接搬用 xAI 或 Bedrock 的模型标识。

认证可以使用 Microsoft Entra ID 或该 Foundry 资源的 API key,微软推荐前者。工具调用与流式响应都已列为支持项;先让一条无敏感数据、无外部写入的简单请求正常返回,再加入业务工具,便于定位是哪一层出了问题。

50 万上下文,现在还只是计划吗?

10 月 6 日发布博客使用了 planned 的措辞,但当前 Microsoft Learn 部署指南已明确写出 Grok 4.7 的 500000 token 上下文窗口。因此不能继续仅凭旧公告把它写成尚未支持;实际接入仍应核对部署详情和当前文档。

这个窗口由输入与生成输出共同占用,包括推理输出。接近上限时要给输出留空间,并分别核对上下文价格档与每分钟配额;最大窗口不等于每次请求都应塞满,也不等于项目拥有相同大小的每分钟吞吐能力。

第一次接入,怎样确认配置正确?

先保存选定的部署类型、区域、部署名与认证方式,用简单请求核对返回结果和 usage,再记录输入、输出、缓存用量及延迟。要迁移现有应用,可用同一组获授权的代表任务对比质量与费用,不能用厂商基准代替自己的验收。

遇到 401 先查认证,403 查角色与模型访问,404 查端点和部署名,429 查容量与配额。不要为了解决一个权限或命名错误而直接切换渠道;确认错误阶段后再调整对应配置。本文没有执行真实 Azure 部署或账号操作。

资料来源

常见问题

现有 xAI API key 可以直接调用 Foundry 吗?

微软指南要求使用 Microsoft Entra ID,或 Foundry 资源自己的 API key。已有 xAI 直连接口的密钥,不能据此认定拥有 Foundry 资源访问权;应从所选 Foundry 部署获取正确的端点和认证配置。

Chat Completions 和 Responses 的推理参数完全一样吗?

不完全一样。当前指南中,Chat Completions 使用 reasoning_effort,列出 low、medium、high、xhigh;Responses 使用 reasoning.effort,列出 low、medium、high。迁移时按对应接口的参数表实施,不能只替换端点。