2026年7月31日,MiniMax宣布正式发布新一代通用的全模态生成模型H3。该模型支持对文本、图像、视频、声音等多模态上下文的统一理解,能够输出原生双声道音视频,最高支持15秒2K分辨率。MiniMax计划在未来几天内,在符合相关法律法规的前提下,开放H3的模型权重。