通用视频模型 MiniMax H3 正式开源,支持多模态上下文、2K 分辨率
最新 8 月 3 日消息,今日 MiniMax 正式开源新一代通用视频模型 MiniMax H3。
据介绍,MiniMax H3 是一个通用型全模态生成系统。它能够统一理解由文本、图像、视频和音频构成的多模态上下文,并可生成最高 2K 分辨率、最长 15 秒、带有原生立体声音频的视频。得益于以任务泛化为导向的系统设计,H3 在预训练阶段便已具备广泛的多模态上下文理解与生成能力,因此能够出色地遵循复杂的多模态指令。
最新注意到,H3 支持以下输入与输出规格:
输出时长:4–15 秒
输出宽高比:支持多种宽高比,包括但不限于 21:9、16:9、4:3、1:1、3:4 和 9:16
输出分辨率:支持多种分辨率尺寸,默认将较短边设置为 768 像素。使用 H3-Regenerate-2K 可实现 2K 分辨率生成
输出帧率:24 FPS
输出音频:32 kHz 立体声
支持的对话语言:稳定支持 11 种语言:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。对于其他语言,也提供不同程度的支持。
模型版本与输入规格:
① H3-Base-FL2VA
首尾帧模式:支持输入 0 张、1 张或 2 张图像:
不输入图像时,为文生视频模式;
输入首帧图像时,为首帧生视频模式;
输入尾帧图像时,为尾帧生视频模式;
同时输入首帧和尾帧图像时,为首尾帧生视频模式
② H3-Base-Ref2VA
全模态参考模式:
图像:最多 9 张;
视频:最多 3 段;每段时长须为 2–15 秒,总时长不超过 15 秒;
音频:最多 3 段。音频必须与图像或视频一同输入,不能作为唯一输入;每段时长须为 2–15 秒,总时长不超过 15 秒;
混合输入: 所有类型输入文件合计最多 12 个

完整的 H3 系统由以下三个模块组成:
H3-Context-IR:随着输入日益复杂,我们构建了一套专门的系统,用于深入理解和提炼输入的多模态指令,并将其转换为 H3 更易于理解、可直接用于生成的形式,即 Context Intermediate Representation(上下文中间表示)。H3-Context-IR 对最终输出质量非常重要。因此我们强烈建议将 H3-Context-IR API 接入生成流程。或者,可参考提示词指南搭建自己的上下文处理系统。
H3-Base:根据 H3-Context-IR 的输出生成音频和视频,并输出 768p 分辨率的结果。
H3-Regenerate-2K:将 768p 的生成结果连同原始上下文一并送回 H3,以 2K 分辨率重新生成输出。这既发挥了 H3 强大的生成能力,又充分利用了原始上下文中蕴含的丰富信息,从而生成细节更准确、视觉保真度更高的高分辨率结果。
MiniMax H3 基于 MiniMax H3 Community License 发布。
开源地址:huggingface.co/MiniMaxAI/MiniMax-H3
《通用视频模型 MiniMax H3 正式开源,支持多模态上下文、2K 分辨率》转载自互联网,如有侵权,联系我们删除,QQ:369-8522。
相关图文
-
通用视频模型 MiniMax H3 正式开源,支持多模态上下文、2K 分辨率
MiniMax H3 正式开源,这是一个通用型全模态生成系统,可理解文本、图像、视频、音频,并生成最高 2K 分辨率、15 秒视频及立体声音频。支持 11 种语言,多种输入模式。#AI开源# #MiniMax#... -
阿里企业级 Agent 产品“千问办公”开启公测,集成最新旗舰模型 Qwen3.8
阿里“千问办公”今日开启公测,支持网页版和 PC 客户端,集成 Qwen3.8 模型。提供免费版、个人版及企业版订阅,原价 98 元起等。该产品由 QoderWork、MuleRun、悟空整合而来,主打桌面端和云端协同办公。#阿里千问办公# 助力企业办公效率提升。... -
荣耀手环 11 系列预售:新品价 229 元起,提供独立 GPS 版本
荣耀手环 11 系列已开启预售,包括标准版、Pro 版及 Pro GPS 版。Pro 版搭载独立 GPS 与铝合金机身,续航长达 26 天。新品首发价 229 元起。#荣耀手环11# 你心动了吗?... -
联发科:第二款 AI ASIC 加速器有望 2028 年量产,英特尔代工 EMIB 进展良好
联发科技 448G SerDes IP 开发顺利,继续在台积电 COUPE 平台上开发 CPO 光互联系统解决方案,亦提供端到端的 3.5D 高阶芯片平台。... -
自变量机器人发布 HOST 框架并开源,让机器人看视频学会新技能
自变量机器人今日发布并开源 HOST 框架,机器人仅需观察一段数十秒的人类视频即可学会新技能,成功率高达 62%。该框架采用“按任务进度对齐”方法,相比传统方案数据量减少 50 倍,速度提升 500 倍,未来有望推动家庭机器人无需专业训练即可学习。#机器人技术#...












