近日,摩尔线程与国产高性能大模型推理引擎xLLM完成深度协同优化。双方团队基于摩尔线程旗舰级训推一体智算卡MTT S5000,围绕MUSA统一系统架构进行底层调优,在多种典型推理负载下实现显著性能跃升。这不仅是国产AI算力生态的又一关键里程碑,更为开发者提供了“国产芯片+国产推理引擎”的高性能组合新选择。

xLLM:为国产加速器从零构建的高性能推理引擎

xLLM是一款开源的大模型推理引擎,专为国产AI加速芯片深度优化,已在某电商零售核心业务中完成大规模生产环境验证。不同于vLLM、SGLang等基于Python生态的主流框架,xLLM选择了一条从零构建的技术路线——以C++重构推理引擎核心,从系统层面突破性能瓶颈,而非在现有Python框架上做增量优化。

随着大模型推理进入毫秒级、微秒级响应竞争阶段,性能瓶颈不再仅取决于算力峰值,而更多暴露在任务调度、显存管理及内核并发等系统层级。xLLM采用服务层与引擎层解耦的架构设计,服务层实现了弹性调度、动态PD分离、混合EPD多模态调度及高可用容错;引擎层则通过多流并行计算、图融合优化、投机推理、动态负载均衡和全局KV缓存管理等技术,实现对底层硬件算力的极致释放。

目前,xLLM已在多家主流国产芯片上完成深度适配,其对摩尔线程MUSA后端的支持通过--device musa构建参数实现。摩尔线程MTT S5000作为xLLM官方支持的MUSA硬件平台之一,双方已在底层展开了深度协同。

MTT S5000 + xLLM:协同优化下的性能跃升

摩尔线程MTT S5000是专为大模型训练、推理及高性能计算而设计的全功能GPU智算卡,基于第四代MUSA架构“平湖”打造,完整支持从FP8到FP64的全精度计算,配备大容量显存与高带宽。目前已实现对PyTorch、Megatron-LM、vLLM及SGLang等主流AI框架的深度兼容。

本次性能测试基于MTT S5000单卡环境,在三种典型输入/输出长度配置(2.5k-1k、3.5k-1.5k、9k-1k)下,分别测试Batch Size为1、2、4、8、16、32时的推理性能。

图片

结果显示,随着并发数的提升,各场景的吞吐量均表现出良好的扩展性。特别是在2.5k与3.5k这两个场景,单卡并发32路时,每Token输出时间(TPOT)可保持在40ms以内,Decode吞吐超过2500 tokens/s(tgs)。

在SLA约束(Mean TTFT<1s,Mean TPOT<50ms)下,进一步对比MTT S5000在xLLM与SGLang上的推理性能。得益于xLLM在C++后端、多流并行计算及图融合等方面的框架特性,在相同并发数下,xLLM可降低TPOT 10%以上,综合性能增益超过10%。若在SLA约束下选择对应最优并发配置,在2.5k-1.5k场景中,xLLM相比SGLang可获得53.9%的Decode吞吐性能收益。

图片

共建国产AI算力生态

xLLM目前已支持Qwen、DeepSeek、GLM、MiniMax等主流大模型系列。摩尔线程与xLLM团队将持续深化合作,重点推进以下工作。

模型适配加速

 Qwen系列

即将完成对Qwen全系列模型的深度适配与性能优化,充分发挥MTT S5000在长序列处理中的硬件优势。

 DeepSeek系列

将MTT S5000在DeepSeek-V4上积累的算子能力迁移至xLLM并完成适配优化。

 GLM系列

延续xLLM已实现的GLM-5 Day0支持能力,持续跟进GLM最新版本的极速适配。

性能持续优化

协同xLLM团队,针对MUSA后端进行平台特定的Kernel实现优化,结合MTT S5000硬件特性,在算子融合、内存管理、通信并行等维度持续挖掘性能潜力。

生态共建

双方将共同推动国产AI基础设施的生态建设,为开发者提供“国产芯片 + 国产推理引擎”的一站式高性能解决方案,助力企业以更低成本、更高效率落地AI大模型应用。欢迎广大开发者关注摩尔线程及xLLM官方动态,共同参与国产AI技术生态的构建与完善。

*以上测试数据来自摩尔线程实验室。

Logo

电商企业物流数字化转型必备!快递鸟 API 接口,72 小时快速完成物流系统集成。全流程实战1V1指导,营造开放的API技术生态圈。

更多推荐