PuppyIP 资源中心
AI 工具动态 10 分钟 发布于 2026-08-28

Gemini 3.5 Transcribe 怎么选?Live 10 分钟与说话人时间戳限制

如果你准备用 Gemini 3.5 Transcribe 做直播字幕、会议纪要或客服录音,不要先按“实时或非实时”随便选模型。Google 8 月 26 日发布了文件与 Live 两个端点:Live 每次会话最多 10 分钟且不支持说话人分离和词级时间戳;文件端点启用这两项后单次上限会从 1 小时降到 30 分钟。第一步是先写清是否必须实时、是否必须认人和定位到词。

Gemini 3.5 Transcribe Gemini API 实时字幕 说话人分离 语音转写

本文要点

  • Google 于 2026 年 8 月 26 日发布 gemini-3.5-transcribe 与 gemini-3.5-transcribe-live,官方模型页将其列为稳定语音转文字模型。
  • Live 端点通过 Live API 做低延迟流式转写,每个 session 最多 10 分钟,不支持说话人分离和词级时间戳。
  • 文件端点单次音频最长 1 小时;启用 speaker diarization 或 word-level timestamps 时最长 30 分钟。
  • Smart transcription 会清理口头停顿和格式,但与时间戳及说话人模式不兼容;需要审计原话时优先 Verbatim。
  • 先用代表性音频验收语言、术语、角色、延迟和成本;边界功能缺失、时间轴漂移或分段上下文断裂时应停手。

直播字幕能跑,会议验收却缺人名和时间轴

具体场景是:开发者看到 Live 字样,直接把十几分钟直播或会议音频接入 WebSocket。前几分钟有字幕,随后 session 到达 10 分钟边界;导出的文字又没有说话人标签和词级时间戳。可见症状是连接重建、字幕断档、角色混在一起或无法回到原音频定位。失败成本包括直播漏字、人工重排、客服质检不可复核和会议责任归属错误。

错误直觉是继续延长 Live 会话、给提示词要求模型输出它不支持的字段,或把所有音频都切成 10 分钟。正确第一步是列出三个硬要求:必须实时吗、必须区分说话人吗、必须定位到每个词吗。后两项任一为是,就先评估文件端点。

两个端点解决的是不同任务

gemini-3.5-transcribe-live 面向麦克风、直播和语音代理等低延迟输入,通过 Live API 进行流式转写;官方限制是每个 session 最多 10 分钟,不支持 word-level timestamps 和 speaker diarization。它适合即时可读字幕,但不能冒充具备完整角色与词级审计轨迹。

gemini-3.5-transcribe 面向预录文件,通过 Files API 与 Interactions API 处理。它支持说话人分离、词级时间戳、最多 1,000 个自定义词汇和 Smart transcription。普通单次音频最长 1 小时;只要启用说话人分离或词级时间戳,上限就降为 30 分钟。

按交付物选择,而不是按模型名字选择

直播字幕、通话中的即时提示或语音代理输入,优先 Live,并提前实现 10 分钟前的受控续接。会议纪要、访谈、客服质检和法律或合规复核需要角色与时间轴,优先文件端点,把每段控制在 30 分钟以内并保留原音频。只需要离线逐字稿但不需要角色和词级时间戳时,文件端点可以使用最长 1 小时边界。

官方称模型自动检测 85 个以上语言区域并支持会话内语言切换,但这不等于每种中文口音、行业术语和噪声条件都达到你的验收线。公开文档没有给出中文准确率或地区质量排名,必须用自己的代表性样本验证,不能伪造 WER 或体验结论。

Smart、Verbatim、时间戳与说话人的选择矩阵

需要可直接阅读的字幕或纪要,可测试 Smart transcription,它会处理填充词、重复和格式。需要保存原话、逐字核对、时间戳或说话人标签时,使用 Verbatim 路径;官方说明 Smart 模式与 timestamp_granularities、diarization_mode 不兼容,不要在同一请求里强行组合。

文件端点最多区分 8 位说话人,3 位及以上的归属仍标为 experimental。专业词汇可提供最多 1,000 个短语,但官方提示通常 100 个以内效果最佳。先放真正容易识别错的产品名、姓名和缩写,不要把整份词典塞入提示。

上线前的七步验收

第一,按真实任务准备安静、噪声、口音、多人和代码切换样本。第二,确定 Live 或文件端点。第三,按功能限制切段并保留原始时间偏移。第四,只加入必要术语。第五,对照人工参考稿检查漏字、数字、专名、说话人与时间轴。第六,记录首字延迟、总耗时、输入输出 token 和失败重试。第七,验证分段合并、10 分钟续接和故障恢复。

不要拿官方描述或单段演示替代验收。对直播要模拟 session 重连和网络抖动,对文件要测试 30 分钟边界、多人重叠与空白段;输出用于审计或对外发布时,必须保留人工复核和原音频回链。

价格、数据使用与能力边界

Google 定价页显示,文件端点付费层音频输入为每百万 token 2 美元、文本输出 12 美元,官方估算约每分钟 0.005 美元;Live 为输入 3.50 美元、输出 21 美元,估算约每分钟 0.009 美元。免费层可用,但免费层数据可用于改进产品,付费层标为不用于改进产品。价格与资格可能变化,上线前应再次核对项目账单。

Transcribe 不是通用音频理解、语音合成或实时翻译。文件模型不支持 caching、function calling、file search、thinking,也不支持 Batch、Flex 或 Priority;Live 不支持 Google Search grounding。不要因为同属 Gemini 就假设其他模型能力自动存在。

停止、回滚与排错条件

出现连续 session 断档、说话人归属不可接受、关键数字或专名频繁错误、时间戳漂移、分段合并丢上下文、成本或延迟超线时,停止扩量并回到上一条稳定转写链路。先保存 model ID、模式、语言提示、音频时长、功能开关、request ID 和脱敏失败片段,再逐项减少变量。

401、403、429、503 应分别核对密钥、地区权限、配额和容量,可参考<a href="/resources/gemini-api-429-503-rate-limit-guide">Gemini API 429、503 排查指南</a>。只有 DNS、TLS、连接超时或代理认证证据明确时,才转到<a href="/resources/proxy-connection-troubleshooting-checklist">代理连接排查清单</a>;需要稳定访问 API 文档与控制台时,可<a href="/" target="_blank" rel="noopener noreferrer">访问 PuppyIP 官网</a>了解网络环境,但网络不能改变模型能力、配额或地区资格。

常见误区:实时不等于功能更多

误区一是认为 Live 也能输出说话人与词级时间戳;官方明确不支持。误区二是看到文件上限 1 小时,就给开启 diarization 的 60 分钟录音;此时上限是 30 分钟。误区三是把 Smart 输出当作逐字证据;它会清理口头停顿和格式。误区四是把 85+ 语言区域写成所有语言质量一致。

误区五是把连接断开都归因于代理。Live 有明确 10 分钟 session 边界,文件也有功能相关时长限制;先核产品边界和请求配置,再根据错误证据处理网络,避免无意义重试。

资料来源

常见问题

Gemini 3.5 Transcribe Live 每次能运行多久?

Google 模型页写明每个 Live session 最多 10 分钟。长时间字幕需要设计受控续接,并验证重连处是否丢字或重复。

Live 支持说话人分离和词级时间戳吗?

不支持。这两项只在文件端点提供;需要角色和词级时间轴时,应评估 gemini-3.5-transcribe。

文件端点一次可以处理 1 小时音频吗?

普通文件转写最长 1 小时;启用 speaker diarization 或 word-level timestamps 时最长 30 分钟。

Smart transcription 可以和时间戳一起用吗?

不可以。官方说明 Smart 模式与 timestamp_granularities、diarization_mode 不兼容;需要审计原话时应使用 Verbatim 路径。

最多可以区分几位说话人?

文件端点最多支持 8 位说话人,但 3 位及以上的归属仍标为 experimental,必须用真实多人样本验收。

10 分钟断开是不是代理问题?

不一定。先核对是否到达 Live 的 10 分钟 session 上限,再看错误码和连接证据;代理无法改变官方时长和功能限制。