MiniMax发布了H3,一款高清视频生成模型,接受多种输入媒体。但该模型的许可证要求美国、英国、欧盟和韩国的用户向MiniMax提交申请,才能以与世界其他地区相同的条款使用它。该模型的关键组件也仍为专有,至少目前如此。
输入/输出:最多12个文件,包括文本(7000字符)、图像(30MB/文件)、音频(15MB)和视频(50MB)输入,输出带音频和文本字幕的视频(最宽2000像素,最长15秒)。
架构:Transformer,330亿参数;独立的文本、音频和视频编码器,预处理器,2K视频升频器。
特性:视频和音频编辑,多镜头输出,六种宽高比。
性能:在Artificial Analysis的视频编辑排行榜上排名第一,在文本转视频和图像转视频中排名第二(或在误差范围内并列第一)。
可用性/价格:在MiniMax H3许可证下,授权可免费用于非商业和商业用途;通过MiniMax的API,2K分辨率每秒$0.13,768p分辨率输出每秒$0.08,输入费用从音频免费到每张图像$0.04和高清视频每秒$0.13不等;提示重新生成模块每百万输入token收费$0.90,每百万输出token收费$3.60。
未公开:确切参数数量、训练数据、技术报告。
工作原理:H3的架构由三个模块组成——一个上下文处理系统、一个视频/音频生成基础模型和一个高清升频器。只有基础模型可免费下载,且带有使用限制。

MiniMax表示,他们使用“真实、自然的数据”训练了H3,以确保数据质量和可扩展性。与MiniMax早期的视频模型不同,所有音频类型(语音、音乐和音效)被一起训练,并通过单一编码器建模。团队使用自然语言而非固定预设训练了模型的参考和编辑功能。团队寻求在过程中更早地组合不同媒体类型(声音、视频等)。
支持的生成模式包括文本转视频、首帧或末帧图像转视频,以及图像、音频和视频参考,再加上任意组合。例如,用户提示可以指示模型从单个静态图像开始,参考两个视频中的摄像机运动,以及第三个视频中的音频配乐,并附上场景应如何展开的文本指令。
输入首先由H3-Context-IR处理。这个推理模块解释提示和输入媒体,并生成新的文本提示,指示基础模型如何将它们融合在一起。仅使用基础模型的用户需要对每种媒体类型给出明确的指令,或使用自己的预处理系统;使用完整API流程的用户受益于Context-IR模块完成大部分工作。
基础模块生成768p视频,即1792像素乘768像素(给定最大21:9宽高比)。三个编码器分别处理文本、视频和音频;一个单独的可变自编码器也对视频进行编码。
第三个模块H3-Regenerate-2K指示基础模块以原生2K分辨率(宽2000像素,最长4667像素)重新生成768p视频。优化后的提示还包括原始媒体参考和用户提示作为上下文,使重新生成的视频能够添加缺失的细节,而不仅仅是外推源视频。
授权的许可证要求商业用户在任何使用H3的产品上显著显示模型名称,并禁止所有用户基于H3的输出蒸馏另一个模型。它还禁止可能伤害未成年人、干涉选举或违反当地法律的使用。许可证还将美国、英国、欧盟和韩国列为“排除地区”,并要求这些地区的授权用户申请许可证,“以确保[其]使用合法、负责且不侵犯任何权利。”

模型背景与授权争议
MiniMax H3的“直接对比人类偏好ELO评分”将其与Google的Gemini Omni Flash和字节跳动的Dreamina Seedance 2.0并列为前三名。Black Forest Labs的FLUX模型通常为开发者提供开放授权发布,但其最近的FLUX 3模型是专有的且仅限API。它尚未经过独立测试,但Black Forest Labs的测试表明它将成为第四个争夺最先进地位的模型。Dreamina Seedance 2.5也在等待测试。
尽管许可证具有限制性和不寻常的地域限制,MiniMax H3显然是一个顶级的视频生成模型,为商业用户提供了一套强大且多功能的视频生成工具,可与Google价格高得多的竞品相媲美。我们也能一窥顶级视频模型在内部是如何工作的。看来MiniMax放弃使用合成数据——尤其是在难以获得良好视频转录本的情况下——并将提示优化整合到流程中的策略正在见效。
即使在这个AI发展的多疑时期,以国家为基础限制授权使用,除非使用会违反该国家或地区的法律,否则毫无意义。这违背了开放的根本含义:即任何人都可以下载模型、了解其工作原理并使用它。希望这些限制不会成为一种趋势。
(素材来自:MiniMax 智算芯能前沿网综合)
本文由智算芯能前沿网编辑整理,转载请注明出处。
