2026年9月15日,Google正式对外发布两款新一代实时语音对话AI模型,分别为Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking。作为谷歌现阶段综合能力最强的实时对话模型体系,两款产品在智能推理、并行运算、实时响应等核心维度完成跨越式升级,补齐了传统语音交互模型的多项短板。

此次发布的两款模型均采用原生语音到语音技术架构,彻底颠覆了行业沿用多年的交互逻辑。区别于常规语音AI分段转换的模式,新模型无需经过语音识别、大模型推理、语音合成的串联流程,直接在音频层面完成信息理解、逻辑处理与语音生成,大幅简化交互链路。

架构革新:打破传统三段式语音交互瓶颈

长期以来,市面上绝大多数语音对话模型,都依赖ASR→LLM→TTS的串联工作模式。这种分层处理架构技术成熟,但存在天然缺陷,多层链路转换会产生累积延迟、信息损耗和语义偏差,很难支撑自然流畅的实时对话体验。

Gemini 3.8 Live系列摒弃了这套传统方案,搭建端到端的音频处理体系。模型可以直接读取音频信号、解析用户语义、实时生成语音回复,全程减少多环节数据转译带来的误差与延迟,让人机对话节奏更贴合真人交流状态。

依托全新架构优势,两款新模型实现了并行推理能力突破。系统可以在持续对话的同时,后台同步完成工具调用、数据检索与逻辑运算,不会出现对话卡顿、响应中断、思考留白等常见问题。

双版本精准定位,适配不同交互场景需求

Google针对不同使用场景,对两款模型进行了清晰的功能定位,满足轻量化日常交互与高难度复杂任务需求。其中Gemini 3.8 Live主打极致低延迟,是通用实时语音交互的首选模型,适配日常对话、实时问答、轻量化语音操控等场景,全程保持流畅无卡顿的响应效果。

Gemini 3.8 Live Extended Thinking则侧重深度推理能力,主打复杂任务处理。该版本支持边实时对话、边后台深度思考,能够应对多步骤、高逻辑难度的复杂指令,在保持对话连贯性的同时,完成高精度推理运算,兼顾交互流畅度与内容专业性。

多重能力升级,夯实实时语音交互优势

除核心架构革新外,新模型在实用功能层面完成全面升级。两款模型均支持近实时视觉联动理解,可同步识别画面信息与语音指令,实现多模态实时交互。同时模型兼容97种语言的实时切换,对话过程中可自动识别语种并无缝适配,适配全球化交互场景。

在运行机制上,新模型支持后台异步工具调用与API调度,所有功能性运算均在后台静默完成,不会打断当前对话流程。这套机制解决了传统AI执行任务时需要暂停对话、等待运算完成的痛点,真正实现人机自然流式交互。

重塑行业标准,开启实时AI交互新赛道

此次Gemini 3.8 Live双模型的落地,不只是单一产品的迭代升级,更是对实时语音AI行业技术范式的重构。端到端音频直出架构、并行实时推理、低延迟高智能的特性,解决了长期困扰行业的体验痛点。

随着实时交互技术不断成熟,AI人机交互将彻底摆脱机械、生硬的指令式对话模式。Google此次技术突破,也为智能终端、实时客服、语音办公、智能助手等场景提供了全新的技术底座,推动AI语音交互从“可用”向“自然可用、高效好用”全面进阶。

标签:Google AI模型

本文由智算芯能前沿网编辑整理,转载请注明出处。