地址: 池州市养数州75号 邮箱: tart@yahoo.com 工作时间:上午9点-下午8点

资讯中心

  • 首页
  • Our Portfolio
  • 7.8倍吞吐量,MiniMax M3跑上英伟达新芯片

7.8倍吞吐量,MiniMax M3跑上英伟达新芯片

2026-10-11

vLLM 现在支持 NVIDIA Vera Rubin。早期结果显示,在 AgentX 上运行 MiniMax M3 时,吞吐量达到 GB200 的 7.8 倍以上 。 MiniMax M3 已在 NVIDIA Vera Rubin NVL72 上通过 vLLM 运行。相关方对 vLLM 项目、inferact、NVIDIA AI、Red Hat AI 表示感谢,称他们共同把 MiniMax M3 带到了 Rubin 平台。 从发布就开始的适配 据相关消息,自 Rubin 发布以来,inferact、NVIDIA AI、Red Hat AI 以及 vLLM 社区就一直在推进 vLLM 在 Rubin 上的适配工作。目前公布的是这一工作的阶段性进展。 这次适配的核心信息集中在两点:一是 MiniMax M3 已经能在 Vera Rubin NVL72 上跑起来,二是跑起来之后的性能表现——7.8 倍这个数字,对比的基准是 GB200。 7.8 倍意味着什么 吞吐量是衡量推理效率的关键指标。在 AgentX 这一测试场景下,同样的 MiniMax M3 模型,跑在 Vera Rubin 上的吞吐量是跑在 GB200 上的 7.8 倍以上。 需要说明的是,这是早期结果,测试场景为 AgentX,对比对象为 GB200。素材没有披露更多测试细节,包括具体的批次配置、序列长度等参数。 从参与方来看,这次适配是多方协作的结果:vLLM 项目提供推理框架,inferact、NVIDIA AI、Red Hat AI 以及 vLLM 社区共同参与。MiniMax M3 作为模型方,成为这一适配的首批受益者之一。 特别

about image

订阅我们的时事通讯并获取最新消息