英特尔:为开源多模态视频模型 MiniMax H3 提供 Day 0 支持,实现基于多卡 GPU 的部署方案
最新 8 月 3 日消息,英特尔今日宣布,为新一代开源多模态视频模型 MiniMax H3 提供 Day 0 首发支持。
据介绍,英特尔锐炫 Pro B70 第一时间完成对 MiniMax H3 的适配,英特尔团队实现了一种基于多卡 GPU 的部署方案。该方案采用 Encoder 8 卡张量并行(8TP)、DiT 8 卡 USP(Ulysses Sequence Parallel,并结合 Layer-wise Offloading),以及 VAE 部署于 B70 GPU 的整体架构,实现了视频生成全流程的 GPU 加速。
其中,Encoder 采用 8 卡张量并行完成文本编码;作为推理过程中计算量最大的模块,DiT 采用 8 卡 USP 并结合 Layer-wise Offloading 技术,使模型参数按层动态加载到 GPU,在突破单卡显存限制、降低模型常驻显存需求的同时,支持更大规模 DiT 模型的部署;VAE 则部署于 B70 GPU 上完成最终的视频解码。该方案兼顾了模型容量与计算效率,为大规模视频生成模型提供了更具扩展性的部署方式。
在此基础上,团队进一步结合张量并行(Tensor Parallel,TP)与 USP 的优势,开发了 2TP×4USP 的混合并行方案。相较于纯 8 卡 USP,该方案将 USP 并行度由 8 降至 4,并引入 2 路张量并行对计算进行协同加速,在保持模型扩展能力的同时,减少 USP 带来的通信开销,实现计算负载与通信开销之间更优的平衡,从而进一步提升整体推理性能。
最新获悉,团队还结合 llm-scaler-omni 项目的 XPU Kernel 优化,对矩阵乘法、注意力等关键算子进行了持续优化,进一步提升 GPU 的计算效率,持续降低端到端推理时延,取得了良好的优化效果。
相关阅读:
《通用视频模型 MiniMax H3 正式开源,支持多模态上下文、2K 分辨率》
《英特尔:为开源多模态视频模型 MiniMax H3 提供 Day 0 支持,实现基于多卡 GPU 的部署方案》转载自互联网,如有侵权,联系我们删除,QQ:369-8522。
相关图文
-
通用视频模型 MiniMax H3 正式开源,支持多模态上下文、2K 分辨率
MiniMax H3 正式开源,这是一个通用型全模态生成系统,可理解文本、图像、视频、音频,并生成最高 2K 分辨率、15 秒视频及立体声音频。支持 11 种语言,多种输入模式。#AI开源# #MiniMax#... -
阿里企业级 Agent 产品“千问办公”开启公测,集成最新旗舰模型 Qwen3.8
阿里“千问办公”今日开启公测,支持网页版和 PC 客户端,集成 Qwen3.8 模型。提供免费版、个人版及企业版订阅,原价 98 元起等。该产品由 QoderWork、MuleRun、悟空整合而来,主打桌面端和云端协同办公。#阿里千问办公# 助力企业办公效率提升。... -
荣耀手环 11 系列预售:新品价 229 元起,提供独立 GPS 版本
荣耀手环 11 系列已开启预售,包括标准版、Pro 版及 Pro GPS 版。Pro 版搭载独立 GPS 与铝合金机身,续航长达 26 天。新品首发价 229 元起。#荣耀手环11# 你心动了吗?... -
联发科:第二款 AI ASIC 加速器有望 2028 年量产,英特尔代工 EMIB 进展良好
联发科技 448G SerDes IP 开发顺利,继续在台积电 COUPE 平台上开发 CPO 光互联系统解决方案,亦提供端到端的 3.5D 高阶芯片平台。... -
自变量机器人发布 HOST 框架并开源,让机器人看视频学会新技能
自变量机器人今日发布并开源 HOST 框架,机器人仅需观察一段数十秒的人类视频即可学会新技能,成功率高达 62%。该框架采用“按任务进度对齐”方法,相比传统方案数据量减少 50 倍,速度提升 500 倍,未来有望推动家庭机器人无需专业训练即可学习。#机器人技术#...












