语音大模型正在经历一轮密集的升级潮
过去一个月,全球主要AI公司在语音模型领域密集发布新品。9月23日,阿里巴巴千问发布Qwen-Audio-3.1系列,谷歌同日推出Gemini 3.8 Flash TTS和Flash-Lite TTS。此前的7月至9月间,OpenAI、xAI、Anthropic、字节跳动和阶跃星辰也先后更新了各自的语音模型。
这些发布不再是简单的版本迭代。从语音识别到语音合成,从实时交互到音频创作,各家正在沿着不同的技术路线展开竞争,评判标准也从单一的“识别准不准”演变为首音延迟、推理能力、表现力控制和成本效率的多维比拼。
千问Qwen-Audio-3.1:从“生成”迈向“创作”
千问此次发布的Qwen-Audio-3.1系列包含五款模型,覆盖语音识别、音频理解、语音合成、音频创作和实时交互,形成了一套从“理解—生成—交互—创作”的完整能力栈。
语音识别方面,Qwen-Audio-3.1-ASR增强了多语种、方言识别与上下文理解能力,并新增原生转写润色功能,可自动去除语气词与重复表达。更值得关注的是基于下代架构的Qwen-Audio-3.1-ASR-Next,它能理解人物情绪、环境声与机械声,完成声音描述、事件定位和音频问答。
语音合成方面,Qwen-Audio-3.1-TTS-Next采用了语言模型与扩散模型协同的统一生成框架,将单一的人声合成扩展为通用音频生成系统,可一次生成人声、音效和背景声,直接服务于有声书、影视剧、播客和游戏等专业创作场景。
实时交互方面,Qwen-Audio-3.1-Realtime增强了共情能力,当识别到用户语气低落时,不再机械回复“我理解你的感受”,而是放慢语速以更贴合语境的方式回应,并可主动调用智能体工具完成任务。
价格是千问此次发布的另一张牌。Qwen-Audio全线模型价格下调,其中TTS降价约70%,Realtime降幅约85%,ASR降幅达95%。

谷歌Gemini 3.8 TTS:把语音变成“创意工作室”
谷歌同日发布的两款TTS模型,定位与千问形成明显差异。
Gemini 3.8 Flash TTS面向深度创意方向和角色设计,可通过自然语言提示从头创建全新语音,对表演提示、节奏、方言转换进行逐行精细控制。用户可从30种预设录音室语音扩展到2000多种现成语音库,覆盖100多种语言和方言。仅需30秒音频样本即可进行语音复制,并内置同意验证、SynthID水印和C2PA凭据。
Gemini 3.8 Flash-Lite TTS则面向高容量、高性价比的配音和内容创作场景。
在Artificial Analysis的Provider Voice Arena中,Gemini 3.8 Flash TTS排名第2,Elo为1260,较前代Gemini 3.1 Flash TTS的1199提升61点。在Hume AI的语音设计基准中,它以71.4分位居第一,口音建模方面以60.8分领先。
其他厂商的差异化路线
OpenAI走的是全双工实时交互路线。7月发布的GPT-Live-1移除了传统语音管线中的轮次检测器,采用全双工模式实现“边听边说”,让对话更即时自然。9月,OpenAI将GPT-Live-1上线API并新增12种语音选项。
xAI的核心竞争力在延迟。7月发布的Grok Voice Think Fast 2.0将首音延迟压至0.70秒,在Vapi Humanness Index的TTS延迟实测中,流式模式首音延迟已降至285毫秒。xAI将传统ASR→LLM→TTS的三级流水线压缩为一个端到端模型,每绕过一层中间件就省掉一层延迟和一层错误概率。9月发布的Grok Voice Transcribe 2.0在保持价格不变的前提下将错误率降低约一半。
Anthropic在7月对Claude语音模式进行了重大升级,语音推理不再局限于Haiku轻量模型,Opus和Sonnet开始驱动语音推理,并接入了Gmail、Calendar、Slack等应用。不过,Claude Voice目前支持11种语言,尚未包含中文。
字节跳动的Seeduplex是全双工语音大模型,已在豆包App全量上线,实现了“边听边说”的规模化落地。其后续版本SeedRealtime进一步将全双工能力从音频扩展到音视频。
阶跃星辰9月发布的StepAudio 3系列包含Realtime、ASR、TTS、Gen和Music五款模型,多款模型在Artificial Analysis榜单中位列全球第一。

性能对比:各有所长
在Artificial Analysis的语音竞技场中,各家模型的表现呈现胶着态势。在Provider Voice Arena中,Cartesia Sonic 3.6以Elo 1273排名第一,Gemini 3.8 Flash TTS以1260排名第二,Qwen-Audio-3.0-TTS-Plus以1259排名第三,前三名差距在统计上几乎无法区分。
在Big Bench Audio语音推理基准中,阿里Qwen Audio 3.0 Realtime Plus以99.2%的成绩登顶,超过了Grok Voice Think Fast 2.0的97.2%和GPT-Realtime-2.1 High的96.0%,但其平均首音延迟高达4.02秒,远高于Grok的0.70秒。
这一对比揭示了语音大模型竞争的核心矛盾:推理精度与响应速度之间存在显著权衡。阿里在语音理解能力上领先,但在交互实时性上落后;xAI则牺牲部分推理深度换取了极低的延迟。
路线分野与竞争格局
综合来看,各家的语音模型路线已经形成清晰的分野。
阿里千问走的是“全能力栈+极致降价”路线,五款模型覆盖理解、生成、交互和创作全链条,以价格优势降低开发者使用门槛。谷歌选择的是“创意控制”路线,将语音合成从工具升级为创作平台,强调逐行导演、语音设计和多角色编排。OpenAI聚焦全双工实时对话,以自然交互体验为核心。xAI押注端到端一体化架构,将延迟压缩到物理极限。Anthropic将语音与工具生态深度绑定,强调“语音调用Agent”的实用性。字节跳动则将全双工技术率先在消费级产品中规模化落地。
对于开发者和企业而言,选择哪家语音模型,越来越取决于具体场景:需要大规模语音转写和低成本的,阿里和xAI提供了极具竞争力的选项;需要高质量语音合成和角色设计的,谷歌的创意工作室路径更为成熟;需要实时语音Agent的,OpenAI和字节跳动的全双工方案值得关注。
语音大模型的竞争已不再是单一指标的比拼,而是理解能力、生成质量、交互延迟和成本效率的综合较量。各家选择的路线不同,但方向一致:让机器不仅能听懂人话,还能像人一样对话、创作和共情。
(素材来自:千问/谷歌 智算芯能前沿网综合)
本文由智算芯能前沿网编辑整理,转载请注明出处。
