17173 > 游戏资讯 > 科技新闻 > 正文

英特尔:为开源多模态视频模型 MiniMax H3 提供 Day 0 支持,实现基于多卡 GPU 的部署方案

2026-08-03 16:03:12 神评论
17173 新闻导语

英特尔锐炫Pro B70首发支持开源多模态视频模型MiniMax H3,实现8卡GPU混合并行部署,性能大幅提升,快来了解最新技术突破!

8 月 3 日消息,英特尔今日宣布,为新一代开源多模态视频模型 MiniMax H3 提供 Day 0 首发支持。

据介绍,英特尔锐炫 Pro B70 第一时间完成对 MiniMax H3 的适配,英特尔团队实现了一种基于多卡 GPU 的部署方案。该方案采用 Encoder 8 卡张量并行(8TP)、DiT 8 卡 USP(Ulysses Sequence Parallel,并结合 Layer-wise Offloading),以及 VAE 部署于 B70 GPU 的整体架构,实现了视频生成全流程的 GPU 加速。

其中,Encoder 采用 8 卡张量并行完成文本编码;作为推理过程中计算量最大的模块,DiT 采用 8 卡 USP 并结合 Layer-wise Offloading 技术,使模型参数按层动态加载到 GPU,在突破单卡显存限制、降低模型常驻显存需求的同时,支持更大规模 DiT 模型的部署;VAE 则部署于 B70 GPU 上完成最终的视频解码。该方案兼顾了模型容量与计算效率,为大规模视频生成模型提供了更具扩展性的部署方式。

在此基础上,团队进一步结合张量并行(Tensor Parallel,TP)与 USP 的优势,开发了 2TP×4USP 的混合并行方案。相较于纯 8 卡 USP,该方案将 USP 并行度由 8 降至 4,并引入 2 路张量并行对计算进行协同加速,在保持模型扩展能力的同时,减少 USP 带来的通信开销,实现计算负载与通信开销之间更优的平衡,从而进一步提升整体推理性能。

获悉,团队还结合 llm-scaler-omni 项目的 XPU Kernel 优化,对矩阵乘法、注意力等关键算子进行了持续优化,进一步提升 GPU 的计算效率,持续降低端到端推理时延,取得了良好的优化效果。

【来源:IT之家】
关于英特尔,MiniMax H3,开源多模态视频模型,锐炫Pro B70,GPU部署,张量并行,USP,视频生成,混合并行,XPU Kernel的新闻