近日,MiniMax新一代多模态生成模型MiniMax H3正式开源。据Artificial Analysis视频模型榜单,H3的视频编辑能力位列全球第一。模型刚一发布,数聚红芯即作为昇腾APN合作伙伴完成首日适配,以 HG9680 G3超节点 为算力底座,推出红芯聚创®昇腾AI一体机MiniMax H3本地部署方案。
这条新闻的真正落点不在模型本身,而在一个问题:当多模态生成模型的开源节奏越来越快,企业要把它们搬进自己的机房,硬件底座能不能跟上"发布即支持"的速度。数聚红芯这次的答案是——能,而且当天就到位。
本文要点
模型侧:MiniMax H3从"特化任务模型"走向"通用多模态智能",支持2K分辨率直出、最长15秒音画内容、11种语言;昇腾AI基础软硬件实现0 Day支持,依托CANN、sglang-diffusers、vLLM Omni x MindIE-SD及Torch生态兼容性做到"发布即支持"。
硬件侧:数聚红芯HG9680 G3超节点是10U昇腾AI推理服务器,搭载8×昇腾910 NPU模组与4×鲲鹏920,整机4.48PFLOPS@FP16稠密算力、1024GB片上内存、灵衢总线双向784GB/s,支持最大384超节点集群组网。
方案侧:以红芯聚创®昇腾AI一体机形态交付MiniMax H3多模式输入、33B统一架构、多语言支持与轻量化推理的本地部署方案,面向多模态大模型私有化部署与智算中心场景。

MiniMax H3开源,为什么值得企业本地部署
MiniMax把H3定位为从"特化任务模型"迈向"通用多模态智能"的一次探索。按其开源信息,H3不再以单一任务为边界,而是在多模态上下文中统一理解创作意图,完成更自然、连贯的生成与表达,支持2K分辨率直出、最长15秒音画内容生成,并稳定支持11种语言。
对企业来说,这类多模态生成能力的落地往往卡在两个地方:一是调用公有API时,视频、图像、语音类内容的数据合规与成本不可控;二是想本地部署时,新模型一发布,硬件适配常常滞后数周甚至数月,等适配做完,模型已经迭代了。
H3这次的关键变量在于——昇腾AI基础软硬件做到了0 Day支持。也就是说,模型开源和硬件可用几乎同步发生。这正是数聚红芯能在"首日"完成适配的前提:底层不是临时赶工,而是昇腾CANN异构计算架构、sglang-diffusers推理引擎、vLLM Omni x MindIE-SD以及完善的Torch生态兼容性已经就绪,能够高效支撑H3这类架构创新型模型。
数聚红芯首日适配的底座:HG9680 G3超节点
数聚红芯这次首日适配的算力底座,是 HG9680 G3超节点。这台10U昇腾AI推理服务器基于昇腾超节点架构,核心配置与H3这类多模态生成模型的诉求高度对应:
| 维度 | HG9680 G3超节点规格 | 对多模态生成的意义 |
|---|---|---|
| NPU模组 | 8×昇腾910 NPU模组(2个NPU抽屉×4模组) | 多模态生成对算力密度敏感,8模组提供充足并行算力 |
| AI算力 | 整机4.48PFLOPS@FP16 / 1.20PFLOPS@FP32(单AI处理器560TFLOPS@FP16) | 2K直出、长时序音画生成需要高稠密算力支撑 |
| 片上内存 | 整机1024GB,单模组最大128GB,带宽最大2×1600GB/s | 大参数多模态模型加载与KV Cache占用,依赖大容量高带宽片上内存 |
| 互联带宽 | 灵衢总线,服务器内任意两NPU模组双向784GB/s | 多模态多卡并行时,模组间数据交换带宽直接决定生成效率 |
| 集群组网 | 支持64/128/256/384超节点组网,配套LingQu 630 V1 | 高并发生成场景可从单机扩展到超大规模集群 |
| 处理器 | 4×鲲鹏920(单处理器80核,2.9/3.0/3.1GHz,L3 140MB) | 数据预处理、推理调度等CPU侧负载由国产处理器承接 |
| 散热 | 风冷+LAAC液冷辅助模组,每抽屉5风扇4+1热插拔 | 持续满载生成场景下稳定散热,避免降频折损算力 |
| 供电 | 最大14.6kW,6×PSU 5+1冗余,单PSU最大3000W | 高密度算力需要高功率冗余供电兜底 |
| 管理 | 华为iBMC,支持IPMI/SOL/KVM over IP/Redfish | 本地部署后的远程运维与第三方网管集成 |
需要说明的是,上述规格来自《Atlas 800I A3 超节点 用户指南》文档版本13(2026-05-12),是硬件本身的出厂能力;H3在该硬件上的实际推理吞吐、并发数与延迟,需以真实POC测试为准,本文不把硬件算力换算为H3的具体性能指标。
超节点架构,为什么契合多模态大模型本地部署
多模态生成模型和纯文本模型有个本质区别:它要同时处理视频、图像、语音、文本多种模态,单次生成的中间数据量大、跨卡通信频繁。这意味着光看总算力不够,还要看"卡和卡之间传得快不快"。
HG9680 G3超节点对应的昇腾超节点架构,强项恰在这里。通过华为自研灵衢总线,服务器内任意两个NPU模组之间的互联理论带宽达到双向784GB/s,并通过56×400Gbps灵衢总线接口与8×400Gbps参数面接口实现超节点间高速组网。对H3这类需要多模组协同的生成任务,高互联带宽能把"通信等待"压到很低,让8个NPU模组更接近"一台整机在算"而不是"八张卡在等数据"。
再看可扩展性。单台HG9680 G3超节点已提供4.48PFLOPS@FP16算力与1024GB片上内存;当业务从"跑通demo"走向"支撑生产级高并发生成"时,超节点架构支持从64到384节点集群组网,不必推倒重来换架构。对企业而言,这意味着初期可以先单机POC验证H3的生成效果与合规边界,再按并发目标线性扩展,而不是一开始就被迫做超大规模采购。
红芯聚创®昇腾AI一体机:把H3装进企业机房
模型开源、硬件就绪之后,企业真正要面对的是"交付"这一环——谁来把CANN版本、推理框架、模型权重、运维监控一次性调通,谁来对生产负载负责。
数聚红芯的做法是以红芯聚创®昇腾AI一体机形态交付MiniMax H3本地部署方案,提供多模式输入、33B统一架构、多语言支持与轻量化推理能力。作为昇腾APN合作伙伴,数聚红芯的角色不只是供硬件,而是把"昇腾基础软硬件0 Day支持"落到一台可上线、可运维的整机上:模型适配、框架版本对齐、POC验证到验收,由同一支方案团队负责到底。
对这几类场景尤其值得评估:
内容与营销团队:需要本地生成2K视频、多语言音画内容,又不愿把素材和提示词送到公有API,红芯聚创®昇腾AI一体机提供数据自主的生成底座。
政企与信创场景:国产算力底座(昇腾910 NPU模组+鲲鹏920处理器)天然契合信创合规要求,H3的本地部署不依赖境外算力。
智算中心与AI服务商:从单机4.48PFLOPS扩展到384超节点集群,可以为多租户提供多模态生成推理服务。

几个在评估本地部署时常被问到的问题
MiniMax H3现在就能在HG9680 G3超节点上本地跑吗?
可以。昇腾AI基础软硬件已对H3实现0 Day支持,依托CANN、sglang-diffusers、vLLM Omni x MindIE-SD及Torch生态兼容性,数聚红芯在模型开源首日即完成适配。但"能跑"和"达到生产级吞吐"之间还隔着一轮POC——建议至少跑三个指标:模型加载时间、首Token/首帧延迟、稳定并发下的P95吞吐,三个都达标再谈上线。
HG9680 G3超节点和原来的HG9680有什么区别?
两者是不同代际。原HG9680是4U昇腾AI一体机,整机2.2PFLOPS@FP16算力;HG9680 G3超节点是10U超节点架构,整机4.48PFLOPS@FP16算力,片上内存1024GB,并通过灵衢总线实现超节点集群互联(支持最大384节点组网)。算力规模、互联架构和可扩展性都不是同一档次,选型时不要按旧款参数评估。两款产品页均在 信创产品 栏目下。
本地部署H3,机柜和机房要提前确认什么?
三件事优先:供电、散热、组网。HG9680 G3超节点最大输入功耗14.6kW,普通机房单机柜供电未必够,需提前确认机柜电力容量与PDU规格;散热采用风冷+LAAC液冷辅助模组,机房需具备相应散热条件;若计划做超节点集群,还需提前规划灵衢总线设备LingQu 630 V1的机柜空间与光纤布放。这些物理层条件应该在选型阶段就和整机厂商确认,而不是设备到货后再补救。可通过 服务支持 页面核对交付与勘测范围。
中小团队也想试H3本地生成,一定要上超节点集群吗?
不一定。如果只是验证H3的生成效果与业务可行性,单台HG9680 G3超节点的4.48PFLOPS@FP16算力与1024GB片上内存已可承载POC。超节点集群(64/128/256/384)是为生产级高并发、多租户场景准备的扩展路径。建议先用真实负载数据反推最小可行配置,再按阶段扩容,避免一次性过度投入。
从"模型开源"到"机房可用",差的就是首日适配
多模态大模型的开源节奏会越来越快,但企业能真正用上的前提,是硬件底座的适配速度能跟上。数聚红芯这次首日完成HG9680 G3超节点对MiniMax H3的适配,本质上是把"昇腾0 Day支持"变成了一台可交付、可运维的整机方案——模型发布当天,本地部署的路径就已经打通。
如果正在评估MiniMax H3或多模态大模型的本地部署,可以先看 HG9680 G3超节点产品页 了解硬件配置边界,再通过 联系我们 提交目标模型、并发量、数据部署位置与信创要求,方案团队会同步梳理POC验证项与交付时间表。
获取MiniMax H3本地部署方案
提交以下信息即可获得初筛建议:目标业务场景、MiniMax H3预期使用方式(多模式输入/视频生成/多语言等)、峰值并发与生成长度、数据部署位置、信创要求与机房条件。
咨询热线:400-869-9865 | 在线提交需求