谷歌推出 Gemini 3.5 Transcribe 预览版:在它自己引用的独立榜单上排第五
语音识别重新回到了模型供应商竞争的中心,它本就是助手与语音智能体的天然入口。在这样的背景下,2026年8月26日,谷歌在官方博客上宣布 Gemini 3.5 Transcribe 进入公开预览。这个意在取代 Chirp 系列的模型,不只是把音频逐字转成文字,而是当场清理并排好版。用公司自己的话说:"Unlike conventional speech recognition models that struggle with background noise, complex jargon, and disfluency cleanup, Gemini 3.5 Transcribe converts raw audio directly into accurate, polished, formatted text"(「与那些在背景噪声、复杂行话和口头停顿清理上吃力的传统语音识别模型不同,Gemini 3.5 Transcribe 直接把原始音频转换成准确、精炼、已排版的文本」)。该技术以公开预览形式提供,入口是 Google AI Studio 中的 Gemini API 以及 Gemini Enterprise Agent Platform,分为面向录制音频的 `gemini-3.5-transcribe`(Interactions API)和面向实时交互的 `gemini-3.5-transcribe-live`(Live API)。
尽管谷歌把它称作自家迄今最准确的语音转文字工具,独立测量给出的画面要更复杂一些。谷歌援引 Artificial Analysis 的测量结果:非流式错误率 2.6%,流式 4.0%。而在同一机构的公开 AA-WER 榜单上(2026年8月29日查阅),该模型以 2.6% 的词错误率(WER)位居第五,与另外两个模型并列,排在 Fun-Realtime-ASR-preview(1.7%)、ElevenLabs 的 Scribe v2(2.2%)、微软 Azure 的 MAI-Transcribe-1.5(2.4%)和 Smallest AI Pulse Pro(2.4%)之后。Artificial Analysis 在方法说明中指出,AA-WER 越低意味着转写越准确,其数值是在约 8 小时测试音频上按时长加权求得的平均值。在多语言基准 FLEURS 上,谷歌称非流式 WER 为 5.04%、流式为 5.50%,但这些测量所覆盖的语言和地区变体并未完全说明,因此无法直接横向比较。此外,公司声称处理时间较 Chirp 3 提升 70%,却没有独立验证,也未公布比较的细节。
已公布的功能包括:支持 85 种以上语言并自动识别语种,去除「嗯」「啊」之类的语气填充词,以及带时间戳的最多三人说话者归属(超过这一门槛属实验性功能)。价格方面,异步版本为每百万音频输入 token 2.00 美元、每百万文本输出 token 12.00 美元;实时版本分别为 3.50 美元和 21.00 美元,两者都设有免费额度。在集成层面,该模型驱动 Android 上 Gboard 键盘的 Rambler 功能以及 macOS 版 Gemini 应用,并计划推向 Chrome。不过仍有一些信息空白:谷歌只说 Rambler 的可用范围限于「部分国家和语言」,未给出官方名单;而 Engadget 在其 2026年8月26日的报道中称,该功能已在 Pixel 11 系列设备上启用,未来还会用于 Search Live、Google Antigravity 等服务。由于处于预览阶段,它不附带服务级别协议(SLA),意大利语及其地区变体上的具体表现也没有公开数据。
在源头就把文本清理干净是个务实的选择:语音智能体需要的是清晰的意图,而不是我们人类的犹疑。但在不公开比较细节的情况下打出 70% 的相对提升,而独立榜单把它的准确度排在第五位,这说明追赶行业领先者的过程仍在继续。 — Olya
Come Olya ha verificato questa notizia
- Verificato
- 我读了谷歌官方博客的发布文章(2026年8月26日),从中取得端点名称、语言数量、公布的 WER、预览状态以及说话者分离的上限。价格是在 Gemini API 官方定价页(ai.google.dev)上直接核对的,而不是通过聚合站点。随后我打开了 Artificial Analysis 的语音转文字榜单——正是谷歌自己引用的第三方来源——看到 2.6% 的第五名和排在前面的四个模型,以及关于 AA-WER 的方法说明。作为独立佐证,我读了 9to5Google 与 Engadget 8月26日的报道,数字和产品集成部分互相吻合。我舍弃了一个把端点写成「gemini-3.5-transcribe-livestreams」的二手来源,它与官方名称 `gemini-3.5-transcribe-live` 相矛盾。
- Incertezze
- 相较 Chirp 3 提升 70% 处理时间这一说法没有独立验证,谷歌也未公布比较细节。FLEURS 的数字是谷歌自测结果,覆盖的语言范围未完全说明,无法与其他模型直接对比。关于 Rambler,谷歌只说「部分国家和语言」且未给名单,Engadget 则将其对应到 Pixel 11,两种说法并不一致。因处于预览阶段,没有 SLA。Artificial Analysis 上的排名是 2026年8月29日的快照,新模型加入后可能变化。意大利语及方言上的表现没有已知数据。
- Perché pubblicarla
- 这是一次有官方文档、公开定价和可核对数字的近期发布,涉及的组件正在成为语音智能体的入口。更重要的是,它让我们能做本站声称要做的那件事:把宣传语(「迄今最准确」)和谷歌自己引用的独立榜单摆在一起——在那份榜单上,这个模型排第五。读者由此拿到可操作的信息(成本、预览状态、三名说话者的上限),也拿到一把读后续发布的尺子。