MiniMax H3:打破任务和模态之间界限的开放模型


2026-07-31 1
AI资讯

今天,我们正式发布 MiniMax H3,一款通用型全模态生成模型。H3 能够同时理解文本、图像、视频和音频等多模态内容,并生成分辨率高达 2K、时长 15 秒的原生立体声音效视频。

早期测试表明,MiniMax H3 可在各种应用场景下生成可用于生产的内容。它在指令执行、精准的文本和品牌展示以及 V2V 动态传输方面表现出色。凭借精准可控的多模态生成和编辑功能,H3 专为广告、品牌推广、电子商务、产品设计、UI/UX 设计、游戏等领域而打造。

H3 采用包括上下文全向表示 (Contextual Omni Representation)、H3-VAE、H3-Omni Transformer 和上下文内重现 (In-Context Regeneration) 在内的多项技术,提供业界领先的性价比。我们默认提供 2K 分辨率。在 2K 分辨率下,H3 的每秒价格不到主流机型的三分之一;在 768p 分辨率下,其价格不到主流机型 720p 分辨率价格的一半。

长期以来,闭源模型在视频生成领域占据主导地位,其迭代速度较慢,生态系统开放程度也低于大型语言模型等领域。为了支持开源社区,加快与更广泛的AI硬件的兼容性,并方便用户构建自定义版本,我们计划在未来几天内开放模型权重,但需遵守相关法律法规。硬件兼容性自H3设计之初就一直是关键考量因素。

多模态情境理解

真正的创意工作需要融合跨模态的复杂信息,将图像、音频、视频等多种素材作为输入源。例如,以下镜头的提示是:“参考视频 1 中的希区柯克式镜头运动,让图像 2 中的角色唱歌,歌声与音频 3 相匹配。” 只需用文字描述上下文与目标视频之间的关系即可。H3 能够独立处理这种复杂的全模态信息理解。

H3的设计理念

打破任务之间的界限:从专业化到通用

我们之前开发了两代模型:海洛01是从零开始构建系统的,而海洛02则专注于改进架构效率、数据质量和规模等核心组件。

在设计 H3 时,我们认识到先前的生成模型在任务边界方面的局限性:图像生成通常被拆分为单独的专家模型,用于 T2I、编辑、主题参考、运动参考和风格参考;音频生成中的声音、音效和音乐大多被作为独立的领域进行研究;视频生成进一步细分为文本到视频、图像到视频、首帧和末帧、主题参考、运动参考、语音参考、视频编辑等等,图像、视频和音频之间也有着清晰的界限。

这些各自独立的任务、能力和模式限制了实践中的创造性自由。而且,在训练方面,也限制了模型的泛化能力。这两方面都表明,无论在应用范式还是训练范式方面,都存在巨大的变革空间。因此,H3 开发的首要原则是跨任务的统一和泛化。

基于此,以下是对 H3 预训练范式的简要概述:

  • 数据和任务
  • 文本转图像
  • 文字转视频
  • 所有音频输出均为原生立体声,并采用联合生成的音频格式。
  • 原生多镜头建模
  • 文本转音频
  • 语音、音效和音乐之间没有分离——全部联合建模
  • 通用参考和编辑
  • 图像到图像的参照和编辑
  • 图像转视频参考和编辑
  • 音频到音频的参考和编辑
  • 音视频到音视频的参考和编辑
  • 在我们的设计中,“通用参考和编辑”是指:
  • 完全基于真实、自然的数据构建,使其具有强大的数据可扩展性
  • 指称和编辑关系通过自然语言表达,而不是局限于固定的任务集;语言(或者广义上的智能结构)是实现概括的桥梁。
  • 建筑学
  • 尽早融合不同类型的数据和任务——合适的混合比例至关重要。
  • 训练策略
  • 在训练过程中尽早融合各种数据类型和任务——合适的混合比例至关重要。

这些选择都指向同一个目标:从预训练阶段开始,赋予 H3 广泛的多模态上下文理解和生成能力。

我们之前讨论了训练范式的转变,那么视频模型的应用领域也在发生怎样的变化呢?

我们看到创作者们开始直接用自然语言描述他们的意图,而不仅仅是输入简单的视觉提示。随着多模态理解、指令遵循和复杂任务执行能力的不断提升,视频模型将能够更全面地理解创作意图,处理更复杂的内容需求,并逐步从“生成视频片段”转变为真正参与到整个内容制作过程中。

H3的技术选择

H3的设计理念虽然简单,但其实现过程却极其复杂。从海洛01、海洛02到H3,每一代车型的制造复杂度都比上一代高出一个数量级。

简要介绍H3的一些核心技术:

  • H3-上下文全方位表征

我们在 H3 工程中最重要的工作之一就是增强其字幕功能。

  • 引入多模态上下文进一步拓宽了“字幕”需要涵盖的内容,我们不再只是描述目标视频,而是描述上下文与目标视频之间的关系,甚至是上下文内部元素之间的关系。
  • 我们需要共同描述视频和音频,而这种视听关系在多个镜头中会变得更加复杂。
  • 从根本上讲,这是一种情境全能表征,其中语言充当可通用的桥梁和解释器,将“任务”统一成一种开放的描述性形式。这正是H3具备广泛指令执行能力的根源所在。
  • 为了实现这一目标,我们构建了专用模型和全模态理解流程。大多数源材料需要大约 10 万个词元进行推理,最终精简到平均约 4 千个词元。
  • H3-VAE:建筑效率的重大提升
  • H系列一直在不断推进分词器技术的发展。H3彻底革新了之前的分词器,在重建质量和学习能力方面实现了全面提升,使其在效率方面更具竞争力。其高压缩比也使有效序列长度提升了4倍,大幅降低了训练和推理成本,并且是我们原生支持2K分辨率的关键技术。
  • H3-Omni变压器

H3-Omni Transformer:一种为任务泛化而构建的架构

  • 秉承 H3 “架构应服务于任务”的设计理念,通用性和效率是我们仅有的两个目标。值得注意的是,尽管 Hailuo-02 架构曾经为我们带来显著的架构优势,但我们最终放弃了它,因为它会为围绕任务泛化构建的模型引入不必要的复杂性。我们认为任务泛化是不可逆转的趋势,架构技巧应该让位于模型的定义方式。
  • 在H3中,多模态上下文的引入使序列长度的方差增加了两倍,理解和生成的计算工作负载也变得更加多样化。我们采用了一种训练架构,将理解和生成的工作负载分离,分别针对每个工作负载微调硬件利用率,同时兼顾样本间的异构计算和跨样本的负载均衡。最终,这种架构使训练吞吐量提升了近30%。
  • H3-上下文再生
  • 对于 H3 的 2K 输出,我们没有使用传统的专用超分辨率模块,而是让 H3 基础模型在上下文中重新生成其自身的低分辨率输出。这带来了两个优势:首先,重新生成过程最大限度地复用了 H3 基础模型中已有的生成能力;其次,这种上下文方法使其能够再次利用原始的多模态上下文来生成高分辨率输出,从而恢复传统超分辨率只能“猜测”而通常无法恢复的细节,例如小文本和精细纹理。

我们将很快发布完整的H3技术报告。期待您的反馈。

我们的愿景与未来展望

语言、图像、视频和音频是人类经验的基本模态。它们紧密相连,是我们与世界的主要交互界面。它们共同构成多模态语境,能够高效地传递海量信息,而表达和分享信息的能力本身就是一种生产力

对于多模态理解和生成,我们将语言视为一个可通用、可扩展的计算系统。因此,我们认为多模态智能应该深深植根于语言之中。

H3仍有发展空间,以下是我们未来版本的优先事项:

  • 强大的多模态理解能力是高质量图像生成的基础,而这方面仍有很大的提升空间。在下一代H系列产品中,我们计划整合M系列机型的各项功能。
  • H3 目前的模型规模在多个方面仍有提升空间。扩展性是明确的发展方向,我们相信更强的任务泛化能力将使我们能够充分释放其潜力。
  • 在某些情况下,视觉细节仍有提升空间。我们将继续努力提高分辨率和视觉保真度。

人人皆可拥有智慧。