服务对象与地域限制
PuppyIP 仅面向海外合规企业及其授权人员提供服务,不面向中国大陆地区开放或提供代理服务。本服务仅限用于中国大陆境外的合法业务活动,严禁在中国大陆境内使用本服务。
代理 IP 或服务器位于境外,不改变上述限制。不得通过中转、转接、共享或转售向中国大陆境内的最终使用者提供本服务。使用前请阅读用户服务协议。
本文要点
- gemini-3.8-flash 已是 GA,面向长时软件工程、自治 Agent 和复杂企业工作流;3.7 Flash 仍完全支持,官方没有公布 shutdown date。
- 3.8 Flash 在 2026 年 12 月 31 日前按每百万输入 token 0.75 美元、输出 token 3.75 美元计费;2027 年 1 月 1 日起为 1.50 美元和 7.50 美元。
- 模型支持 1,048,576 输入 token、65,536 输出 token,以及 low、medium、high 三档 thinking level;minimal 会返回验证错误。
- 迁移不能只改 model ID:还要移除 temperature、top_p、top_k、candidate_count 与预填 model turn,并把 thinking_budget 改为 thinking_level。
- 先让 3.7 与 3.8 跑同一批真实任务,比较质量、延迟、token、工具失败与单任务成本;没有明确收益就保留 3.7,不用版本号代替验收。
先说结论:3.8 已 GA,但 3.7 不必立即下线
如果你的主要任务是复杂代码修改、多步工具调用或长上下文 Agent,gemini-3.8-flash 值得进入灰度测试。Google 已将它标记为 GA,并定位到长时软件工程、自治 Agent 与复杂企业工作流;这证明发布阶段,不证明它在你的代码库、地区、配额和延迟目标上一定优于 3.7。
Google 的弃用页显示 3.7 Flash 仍完全支持,且没有 shutdown date。简单分类、固定格式抽取或极端延迟敏感任务不应只因版本号升级;先用同一批真实样本对照,若收益不足以覆盖 token、思考时间和迁移成本,就继续保留 3.7。
3.8 临时价格与 2027 年成本怎么理解
3.8 Flash 的官方临时价格持续到 2026 年 12 月 31 日:每百万输入 token 0.75 美元、输出 token 3.75 美元。自 2027 年 1 月 1 日起,标准价格变为输入 1.50 美元、输出 7.50 美元;两项都是翻倍,因此不能用临时价直接做长期预算。
预算时至少分开记录输入、缓存、输出、工具调用和失败重试。高 thinking level 可能增加思考与输出消耗;长上下文也会放大单次失败成本。采购或扩容决策应同时计算当前临时价与 2027 标准价。
能力边界:1M 上下文不等于都该塞进去
3.8 模型页列出的输入上限是 1,048,576 token,输出上限是 65,536 token;支持文本、图像、视频、音频和 PDF 输入,输出为文本。它支持缓存、代码执行、函数调用、搜索、结构化输出和思考,Computer Use 仍是 Preview,Live API、图像生成和音频生成不受支持。
接近上限的请求会增加延迟、费用和定位难度。对代码仓库先做文件筛选与检索,对文档先分层摘要;把真正相关的证据放进上下文,并记录截断、缓存命中和工具结果。
从 3.7 或旧模型迁移时要改什么
把模型标识改为 gemini-3.8-flash 只是第一步。Google 的迁移清单要求从旧配置移除 temperature、top_p、top_k 和 candidate_count,用 thinking_level 替代 thinking_budget,并删除预填的 model turn;最后一个 user turn 还必须包含非空文本。
工具调用要核对 call_id、name、function response 和 thought signature 的对应关系。先在测试环境让 3.7 与 3.8 同时跑同一输入,记录实际发送的参数;禁止把不兼容参数静默丢弃后直接切全量。
三档 thinking level 怎么选
3.8 Flash 的 medium 是默认值,适合作为复杂代码和 Agent 任务的起点;low 更适合事故响应、实时聊天、草稿和快速分析;high 面向困难推理、数学和长工具链,但通常会增加 token 与耗时。minimal 不受支持,传入会报验证错误。
不要为整个产品固定一档。按任务路由:低风险快速任务用 low,默认工作流用 medium,只有基准证明收益明显的困难任务才升到 high,并为高成本请求设置预算与超时。
上线前的灰度与回滚检查表
选择一批包含成功、失败和边界情况的真实样本,记录 3.7 基线;然后比较正确率、人工返工、首字延迟、总耗时、输入输出 token、工具调用成功率、格式合规率和单任务成本。不要用一次演示、模型自报版本或官方 benchmark 代替自己的验收。
先给少量请求启用 3.8,按任务和模型 ID 打日志,保留按请求回到 3.7 的开关。出现格式错误、工具循环、成本超线、延迟超线或关键质量退化时立即回滚;稳定后再逐步扩量。
遇到报错先分模型配置与网络
3.8 未出现或返回模型不存在时,先核对调用的是 API、AI Studio 还是 Gemini 应用,再检查 model ID、SDK 版本、项目与地区权限;不要根据模型回答“我是什么版本”判断实际路由。429、503、403 应按配额、容量和权限区分,可参考<a href="/resources/gemini-api-429-503-rate-limit-guide">Gemini API 429、503 排查指南</a>。只有 DNS、连接超时、TLS 或代理认证证据明确时,才转到<a href="/resources/proxy-connection-troubleshooting-checklist">代理连接失败排查清单</a>。
团队需要稳定访问海外 API 文档和控制台时,可以 <a href="/" target="_blank" rel="noopener noreferrer">访问 PuppyIP 官网</a>了解固定网络出口。网络环境只能改善连接路径,不能改变官方价格、配额、模型权限或地区限制。
资料来源
常见问题
Gemini 3.8 Flash 已经 GA 了吗?
是。Google 于 2026 年 9 月 2 日将 gemini-3.8-flash 标记为 GA;具体项目能否调用仍应以 API 模型列表、AI Studio、项目权限和地区可用性为准。
Gemini 3.8 Flash 的 API 价格是多少?
临时价截至 2026 年 12 月 31 日为每百万输入 token 0.75 美元、输出 token 3.75 美元;2027 年 1 月 1 日起标准价为 1.50 美元和 7.50 美元。
3.7 Flash 会因为 3.8 GA 立即停用吗?
不会。Google 弃用页目前把 3.7 Flash 标记为完全支持,且没有 shutdown date;应根据真实任务验收决定迁移,而不是把新版本发布误写成旧版本停服。
迁移只需要把模型名改成 gemini-3.8-flash 吗?
不够。还要移除旧采样参数、candidate_count 和预填 model turn,改用 thinking_level,并检查 user turn、思考签名与工具调用字段。
thinking_level 应该选 low、medium 还是 high?
以 medium 为默认基线;延迟敏感且简单的任务测试 low,只有困难任务证明质量收益覆盖额外成本时才用 high。minimal 不受支持。
1M 上下文是不是应该把整个代码库都放进去?
不是。上下文上限不是推荐用量;应先检索和筛选相关文件,避免无关内容增加延迟、费用和模型判断噪声。
代理可以解决 Gemini 3.8 不显示或 429 吗?
不能。代理只影响网络路径,不能改变 model ID、项目配额、订阅资格、灰度开放或地区限制;应先按产品入口与错误证据确定故障层。