本文要点
- 本次事件影响 Mythos/Fable 5.1、Mythos/Fable 5、Opus 5、Opus 4.8 与 Opus 4.6;官方记录影响于北京时间 9 月 4 日 00:16 结束。
- 529 overloaded_error 表示 API 暂时过载,不等于 429 限速、401 密钥错误、400 参数错误,也不等于代理连接故障。
- 先记录北京时间与 UTC、模型 ID、错误类型、request-id、任务是否有外部写入,再暂停相同任务的并发与自动重试。
- 官方 SDK 默认会对瞬时连接错误、限速和 5xx 做两次指数退避重试;应用层再套无限循环会放大费用、重复写入和排队压力。
- 只有备用模型已经通过工具、上下文、格式和成本验收时才降级;否则等待恢复比临时换模型更安全。
- 恢复不能只看一次成功请求,应等官方状态收敛,再用最小无副作用请求验证并逐步恢复流量。
先看当前事件:哪些模型和入口受影响
Anthropic 于 2026 年 9 月 3 日 13:26 UTC(北京时间 21:26)开始调查多模型 elevated errors,13:50 UTC 给出的完整名单包括 Mythos/Fable 5.1、Mythos/Fable 5、Opus 5、Opus 4.8 和 Opus 4.6。事件页确认影响 claude.ai、Claude API、Claude Code 与 Claude Cowork;Claude Console 和 Claude for Government 是否受影响应继续以状态页当时显示为准。
官方在北京时间 9 月 4 日 00:06 更新为修复已部署并监控恢复,随后确认影响于 00:16 结束,并在 00:23 将事件标记为 resolved。这个时间线说明 monitoring 不等于 resolved;使用者应订阅或刷新<a href="https://status.claude.com/" target="_blank" rel="noopener noreferrer">Claude 官方状态页</a>,不要根据聊天窗口偶尔成功或社区猜测自行宣布恢复,也不要补写官方未披露的根因。
先分清 529、429、400 与网络失败
Claude API 文档把 529 定义为 overloaded_error,表示服务暂时过载;429 是组织速率、月度消费上限、工作区限额或加速限制,400 通常是请求格式、内容或配置错误。DNS 无法解析、TCP 超时、TLS 证书错误和 407 则属于连接或代理层,不能把所有失败都叫平台宕机。
最小证据应包含发生时间和时区、入口、模型 ID、HTTP 状态、error.type、request-id、是否流式、客户端与 SDK 版本,以及任务是否已经产生外部副作用。通用 4xx、5xx 与中转入口分层可对照<a href="/resources/ai-relay-error-troubleshooting-guide">AI 中转站报错排查指南</a>;只有出现明确 DNS、连接、TLS 或 407 证据时才进入<a href="/resources/proxy-connection-troubleshooting-checklist">代理连接排查清单</a>。
故障发生后的六步止损清单
第一,暂停同一任务的新并发和队列自动扩容。第二,保存原始错误与 request-id。第三,查看官方事件是否覆盖当前入口和模型。第四,确认失败请求有没有发出邮件、提交代码、更新工单或调用其他写接口。第五,把未完成、已完成、结果未知三类任务分开。第六,只对确认无副作用的最小请求做有限验证。
Claude Code 或 Cowork 中途断开时,不要立刻复制原提示新开多个会话。先检查工作区、Git 差异、外部工具日志和远端系统,判断上一次运行是否已经部分执行;结果未知的写操作应人工核对后再决定补跑。这样可以避免同一提交、工单、消息或部署被重复创建。
API 重试:限制次数、退避并保留请求 ID
Anthropic 官方 SDK 会对连接错误、限速和 5xx 等瞬时失败做指数退避,默认重试两次,并在存在 retry-after 时遵循该响应头。应用层若再包一层无限循环,会把一次过载扩成更多排队请求;应设置单任务最大尝试次数、总等待时间、并发上限与熔断窗口。
每次尝试都要记录新的 request-id 与最终状态,但不要在公开日志中保存 API key、完整提示或客户数据。连续有限次数仍返回 529、官方状态仍为 partial outage,或每次重试都可能触发外部写入时,应立即停手等待;不能通过提高并发、轮换密钥或频繁换出口绕过容量问题。
何时能切备用模型,何时只能等待
备用模型只有在平时已经验证过上下文长度、工具 schema、thinking block、输出格式、延迟和费用时才可以启用。不要因为状态页显示某个模型恢复,就假定它能无损接管 Opus 或 Fable 的长任务;先用无副作用样本验证,再按小比例切换。
如果任务依赖特定模型行为、已进入长对话、需要严格工具调用,或备用模型同属当前事件影响范围,应选择暂停。降级时把原模型、备用模型、切换时间和任务批次写入日志,并保留回切开关;模型列表与迁移配置不确定时先看<a href="/resources/claude-fable-5-1-migration-400-error-guide">Claude Fable 5.1 迁移与 400 报错指南</a>。
恢复验证:官方收敛、最小探针、逐步放量
恢复至少需要三类证据:官方事件进入 resolved 或受影响组件恢复正常;固定模型的最小无副作用请求连续成功;应用自己的错误率、延迟和队列深度回到基线。只看到一次成功或社区有人说“好了”不应直接恢复全部定时任务。
先关闭补偿性并发,清理重复队列,再以小流量恢复读取类任务;随后才恢复可能写外部系统的 Agent 工作流。对故障期间结果未知的任务逐条对账,确认没有重复提交、漏写或费用异常。若错误率再次上升,按同一熔断门槛停回等待状态。
什么时候停止排查并交给平台或内部 owner
官方状态页明确覆盖当前入口与模型时,不要继续改代理、证书、密钥或业务提示词。持续 529、请求 ID 可复现或官方已 resolved 但本组织仍异常时,把脱敏的时间、模型、入口、request-id、SDK 版本和最小请求交给 Anthropic 支持;涉及 Claude Platform on AWS 时同时保留 x-amzn-requestid。
代理只影响网络路径,无法修复上游过载、模型容量或官方组件故障。需要稳定访问官方控制台与文档时可以<a href="/" target="_blank" rel="noopener noreferrer">访问 PuppyIP 官网</a>了解固定网络出口,但必须遵守服务方的地区、账号、速率与使用规则,不能把网络产品描述为平台故障的解决方案。
资料来源
常见问题
Claude API 返回 529 是我的密钥失效吗?
通常不是。官方把 529 定义为 API 暂时过载;密钥问题更常见为 401,权限问题常见为 403。仍应保存 request-id 并核对状态页。
529 和 429 有什么区别?
529 指平台暂时过载;429 可能是组织速率、消费上限、工作区限额或加速限制。两者都要读错误类型和响应头,不能只看客户端提示。
官方 SDK 会自动重试多少次?
Claude API 文档说明官方 SDK 对瞬时失败默认做两次指数退避重试,并在存在 retry-after 时遵循它;应用仍应设置自己的总次数、超时和熔断边界。
Claude Code 报 529 时可以直接重开任务吗?
先不要。应检查 Git、文件和外部工具,确认上一次任务有没有部分执行;结果未知的写操作直接重开可能造成重复提交或重复外部动作。
可以临时切到未受影响的 Claude 模型吗?
可以,但前提是备用模型已通过工具、上下文、格式和成本验收,并且状态页当时显示健康。无法确认兼容性时应暂停而不是盲切。
换代理或 IP 能解决 Claude 529 吗?
不能。529 是服务端过载语义;只有 DNS、连接、TLS 或 407 等网络层证据明确时才应排查代理路径。