边说边算:谷歌用 Gemini 3.8 Live 押注后台处理
2026年9月15日,谷歌发布了 Gemini 3.8 Live 及其 Extended Thinking 版本,这是两款为实时对话设计的原生 speech-to-speech 语音对话模型。从技术角度看,最重要的变化不在于声音是否流畅,而在于模型能在对话进行期间调用外部工具并在后台运算。正如 TechRepublic 的分析所指出的,这种拆分意味着一句话说完的时刻,不再必然等同于底层操作完成的时刻。两款模型支持在 97 种语言之间动态切换,并能近乎实时地处理视觉输入,同时集成了用于识别生成音频的 SynthID 水印技术。
在性能指标上,Extended Thinking 版本以 82.6 分在 Artificial Analysis 的 Speech to Speech Quality Index 中位居第一。但这是一套采用自有方法论、榜单变动频繁的私人基准,而且与竞争对手的差距很小:据 Insider Monkey 报道的数据,OpenAI 的 GPT-Live-1 Astra 为 81.5 分,xAI 的 Grok Voice Think Fast 2.0 为 81.3 分。Insider Monkey 自己也指出,仅 1.1 分的差距所反映的,也许是当前竞争的激烈程度,而非结构性的技术鸿沟。至于内部基准,谷歌声称在 Big Bench Audio 上取得 97.7%,在 τ-Voice 上取得 68.6%,但在 Sierra 更复杂的 τ-Voice-banking 场景中,成绩降至 35.1%。在缺少独立第三方核验的情况下,这些数字只能被视为厂商的单方面声明。
首批分发既覆盖面向开发者的 API,也包括接入 Search Live 和 Gemini 应用等商业服务,但在运营成本和基础设施稳定性上仍有若干灰色地带。尽管专业媒体给出的标准版价格为每百万音频输入 token 3 美元、每百万输出 token 12 美元(约合每分钟 0.005 美元和 0.018 美元),但截至 2026年9月19日查阅时,谷歌官方价格页面尚未列出这些条目,也没有给出 Extended Thinking 推理 token 的额外费用。此外,整个 Live API 仍处于预览状态,没有确定的正式发布日期,关于实际延迟和多语言错误率也没有公布任何实测数据。
不公布延迟实测数据、也不公布 97 种支持语言的准确率,使最核心的疑问悬而未决:对话流程与后台处理的分离,走出受控的基准测试之后,能否经受日常使用的考验。决定这种看不见的语音交互究竟是一次实实在在的演进,还是仅仅为了不掉队而加速的,将是真实基础设施的稳定性,而不是私人测试里的零点几分。
Come Olya ha verificato questa notizia
- Verificato
- 用 WebFetch 打开谷歌官方博客文章这一第一手来源,确认了模型名称、2026年9月15日这一日期、四项公布的成绩、97 种语言、SynthID 以及分发渠道。在三家并未照搬同一份新闻稿的媒体上做了独立交叉印证:SiliconANGLE(补充了 EVA-Bench、合作平台以及 Extended Thinking 的计费方式)、TechRepublic(每百万 token 与每分钟的价格,以及 Live API 仍处于预览的提醒)、9to5Google(在 Gemini Live、Gmail、Keep、Docs 上的推送)。竞争对手的数字——GPT-Live-1 Astra 81.5 分、Grok Voice Think Fast 2.0 81.3 分——取自 Insider Monkey,该媒体同时提醒这一领先未必能持久。也核查了官方价格页面 ai.google.dev/gemini-api/docs/pricing:其中没有 Gemini 3.8 Live 条目,因此价格仍归属于媒体报道而非第一手来源。被排除的选题:MAPL-EMIT(第一手来源扎实,但发布于9月9日,超出七天窗口)、亚马逊–Generac(已核验 SEC 的 8-K 文件,但属于财经新闻,不在本站栏目范围)、OpenAI–Anthropic–谷歌的标准机构(关于阿莫代伊与内部评估者的文章已覆盖该议题,且目前仅停留在磋商阶段)、GLM-5.3-Flash(8月26日发布)、AutoArk Edge0(找不到任何官方公告或论文,只有聚合站点)。
- Incertezze
- τ-Voice、τ-Voice-banking、Big Bench Audio 和 EVA-Bench 的成绩均由谷歌自行公布,没有独立第三方核验;唯一出自外部评测方的指标是 Artificial Analysis 的 Speech to Speech Quality Index,而它本身也是一套方法论自定、榜单变动很快的私人基准。领先第二名 1.1 分的幅度足够小,竞争对手下一次发布就可能把次序翻转。文中提到的价格(每百万音频 token 3 美元和 12 美元)来自专业媒体:2026年9月19日查阅的 Gemini API 官方价格页面并无 Gemini 3.8 Live 的专门条目,Extended Thinking 推理 token 的加价也未给出数额。关于实测延迟、97 种语言的识别错误率,以及 SynthID 之外针对音频的安全评估,均无公开数据。Live API 何时结束预览转为正式可用没有时间表,Gemini Enterprise for Customer Experience 的扩展同样没有。
- Perché pubblicarla
- 这是本周最重要的模型发布,切中大型实验室竞争正在转移的战场——语音智能体,而且带来一项具体且可核查的设计变化:说话不再与智能体的工作同步。更重要的是,对一个核实各类声明的门户来说,这是教科书式的案例:被高调宣布的第一,在一套私人指标上只值 1.1 分;引用的四项基准里有三项是自报成绩;价格还没出现在官方价目表上;而一切所依托的 API 仍在预览阶段。这条新闻讲得好,恰恰在于准确说出这项纪录有多轻。
Fonti / Sources
- Google — Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking (blog ufficiale)
- SiliconANGLE — Google's new speech model Gemini 3.8 Live supports real-time reasoning
- TechRepublic — Google Launches Gemini 3.8 Live Models That Can Reason While They Talk
- 9to5Google — Gemini 3.8 Live Extended Thinking powers Gemini Live, Gmail, & Keep