MiniMax H3发布 通用全模态生成模型支持2K视频

IT时代网7月31日消息,MiniMax正式发布H3通用全模态生成模型。这是一款支持对文本、图像、视频、声音组成的多模态上下文进行统一理解的开放模型,最高可输出15秒2K分辨率的原生双声道音视频内容。

MiniMax H3

在内容生成能力方面,MiniMax H3在指令遵循、文字与品牌信息呈现、视频到视频动作迁移等方面表现出色,可实现精准可控的多模态内容编辑与生成,广泛适用于广告、品牌、电商、产品设计、UI/UX、游戏等商业场景。

性价比是H3的一大亮点。得益于Contextual Omni Representation、H3-VAE、H3-Omni Transformer等多项技术,该模型在2K分辨率下每秒价格不到主流模型的三分之一,768P分辨率下不到二分之一,默认即提供2K分辨率输出。

在任务泛化方面,H3打破了传统生成模型在任务和模态上的隔离。过往模型往往将图片生成、视频生成、声音生成分割为独立功能,而H3通过统一架构实现了任务泛化。用户可通过自然语言描述清楚上下文和目标视频的关系,复杂的全模态理解工作由模型自行完成。

此外,MiniMax计划在未来几天内,在符合相关法律法规的前提下,开放H3模型权重。该模型设计初期即考虑了多款现有国产芯片的兼容性,以推动开源社区发展和国产芯片适配。

THE END