当地时间9月18日,SpaceXAI官宣推出Grok Voice Transcribe 2.0语音转文本模型,完成旗下语音AI工具的重要版本迭代。本次升级聚焦核心性能优化,在完全保留原有定价体系的基础上,将模型整体错误率降低约50%,实现了不加价、强提质的产品升级,大幅提升各类场景下的语音识别与转录精准度。

据官方介绍,全新的Grok Voice Transcribe 2.0依托成熟的Grok Voice底层音频基础模型搭建而成,继承了前代模型的技术积淀,同时通过算法优化与数据迭代,适配更多复杂真实语音场景,有效解决传统语音转录识别偏差、场景适配性弱等行业常见问题。

落地多类真实场景,赋能终端与产业智能化应用

经过长期落地打磨,Grok Voice底层技术已深度融入各类实际业务场景,形成成熟的商业化应用体系。目前该技术每日可承接数万通客服电话的实时转录工作,完成数百万小时视频旁白的文本转化任务,为内容生产、客服办公等场景提供高效助力。

除了线上服务场景,这套语音技术还广泛赋能实体硬件设备,支撑各类终端语音智能体稳定运行。其中,特斯拉车载Grok助手的语音交互功能,正是依托Grok Voice技术实现,为车主提供精准、流畅的车内语音控制与交互服务,打通AI语音技术从云端服务到终端硬件的落地链路。

权威榜单登顶,综合准确率领跑行业流式模型

在专业人工智能评测机构Artificial Analysis的公开排名中,Grok Voice Transcribe 2.0展现出极强的技术竞争力。本次参评范围涵盖行业主流32款流式语音转录模型,新版模型凭借优异的识别精度与稳定性,综合准确率成功登顶榜单首位,展现出行业领先的技术水准。

为全方位验证模型实战能力,SpaceXAI并未局限于公开基准测试,而是基于线上真实业务场景,搭建了四类专属内部测试数据集,针对性评测模型的词错误率与场景适配能力。这四类测试场景覆盖日常高频使用场景,分别为客服通话音频、英文日常对话、地址手机号等口述信息、多语种简短语音指令,全面贴合大众与企业的真实使用需求。

多维度实测结果显示,Grok Voice Transcribe 2.0在全部测试场景中,表现均显著优于1.0版本。无论是专业客服场景的精准识别,还是日常口语、多语种指令的快速解析,新版模型都实现了全方位升级,抗干扰能力与识别稳定性大幅提升。

定价保持不变,全功能免费开放性价比拉满

本次版本升级最大的亮点之一,就是性能大幅提升的同时,定价策略与前代1.0版本完全保持一致,最大限度降低企业与开发者的使用成本。具体收费标准分为两类场景,计费规则清晰透明。

其中,批量音频转录服务收费标准为0.10美元/小时,实时流式语音转录收费为0.20美元/小时。值得注意的是,说话人区分、高精度时间戳标注、自定义关键词适配等实用增值功能,全部免费包含在基础服务中,无需额外付费解锁。相较于行业同类产品,该模式在保证顶尖性能的同时,大幅降低了多场景语音AI开发与应用门槛。

性价比优势凸显,夯实语音AI落地基础

此次Grok Voice Transcribe 2.0的迭代升级,精准平衡了技术性能与使用成本。减半的错误率意味着模型能够适配更多复杂、嘈杂、多场景的语音环境,有效减少人工校对成本,提升工作效率。不变的定价与全功能开放模式,进一步放大了产品的市场竞争力。

依托车载、客服、视频内容处理等多场景落地经验,叠加权威评测榜首的技术实力,新版模型将持续为个人用户、开发者、企业机构提供低成本、高精度、高稳定的语音转录服务,持续拓展AI语音技术的商业化应用边界。

本文由智算芯能前沿网编辑整理,转载请注明出处。