9 月 7 日,援引彭博社消息,字节跳动正在推进一款面向实时空间视频生成的 AI 模型研发工作,项目由创始人张一鸣直接参与督导,按照现有规划,产品最快有望在下个月对外亮相,但多位知情人士也提到,目前各项安排尚未敲定,后续发布时间依旧存在调整的可能性。

为保障项目推进效率,张一鸣正在推动内部多个业务板块开展协同,协调调配对应的 AI 研发人力与算力资源,集中力量完成这套模型的落地研发。字节跳动方面并未针对这一市场传闻给出官方回应,暂未对外披露更多项目细节。

这套新模型的技术底座来自字节已经对外亮相的电影级视频生成模型 Seedance,研发团队希望依托原有视频生成能力,拓展出可以搭建交互式虚拟空间的全新能力。未来这套技术的落地场景覆盖直播、短剧、游戏等多个内容赛道,能够直接服务字节旗下 XR 硬件业务 Pico 头显设备,用户的语音指令、肢体动作都可以触发虚拟环境画面的实时变化,技术定位与谷歌 Genie 存在相似之处。

从已经流出的技术参数来看,该模型可以做到 20fps 的生成帧率,视频流响应延迟控制在 0.05s,适配空间计算场景下的各类人机交互操作。项目的核心设计思路,是把空间场景生成这种高算力消耗的任务全部交由云端处理,不再依赖 VR 头显本地硬件的计算性能。

这种云端集中运算的架构,可以大幅降低终端设备的算力硬性条件,未来有机会推动成本更低、硬件配置更加精简的 XR 硬件产品走向市场。

行业分析认为,如果该模型能够顺利落地,整个 XR 赛道的竞争格局也会随之改变。过去行业比拼的重点大多集中在硬件参数指标,后续竞争重心会逐步转移到大模型能力、算力基础设施建设,以及内容分发生态的综合较量之上。字节也希望把自研 AI 模型、云计算资源、内容平台、Pico 硬件串联成完整的业务飞轮,实现各个业务板块之间的相互赋能。

本文由智算芯能前沿网编辑整理,转载请注明出处。