澳洲幸运10计划正规渠道

澳洲幸运10计划最新优惠

此次发布的白皮书为构建安全、可控、可持续的AI产业底座提供了坚实的技术基础与工程实践,也为国产算力从“可用”迈向“好用”树立了重要里程碑。 继续了解

摩尔线程与AI推理基础设施平台硅基流动联合发布近日,《PD分离异构算力混部实践技术白皮书》,首次系统阐述基于摩尔线程AI训推一体智算卡MTT S5000与国际高端GPU协同工作的PD分离推理方案更多阅读该方案在真实生产级集群环境下,成功实现在Prefill阶段以2:1的部署比例实现国产GPU对国际高端GPU的算力等效替代,,

行业趋势 从“训练大模型”到“生产Token”

当前,大模型行业重心除“训练更大模型”之外,“以更低成本、更高稳定性生产高品质Token”也愈加重要。 更多阅读此外据工业和信息化部数据,截至2026年6月底,同比增长177%,中国词元市场呈现爆发式增长。我国澳洲幸运10计划正规渠道算力规模已达2185 EFLOPS(FP16),

面对算力需求激增与自主安全多元化的双重挑战,是破解上述瓶颈的核心路径。将计算密集型的预填充(Prefill)阶段与访存密集型的解码(Decode)阶段分离,并分别调度至更适配的异构算力上执行,AI基础设施如何突破成本、效率与国产化瓶颈成为关键。白皮书指出,

技术方案 PD分离异构算力混部架构

双方在4台摩尔线程MTT S5000与2台国际高端GPU组成的“4P2D”异构算力集群上部署Kimi K2.6模型,根据白皮书披露的技术方案,对标由4台国际高端GPU组成的“2P2D”算力集群。

专门处理Prefill阶段的大规模矩阵计算与长序列编码; MTT S5000凭借硬件原生FP8精度支持与充沛的稠密算力储备,

 国际高端GPU则利用4.8 TB/s的显存带宽高效执行Decode阶段的逐Token生成。

两侧推理精度统一采用FP8,并通过Mooncake RDMA高速网络实现KV Cache的跨芯片零拷贝传输,数据格式完全一致,确保缓存数据的正确性与一致性。

可持续的AI产业底座提供了坚实的技术

性能实测 全面对标国际高端GPU

MTT S5000平均吞吐可达2047 tokens/s。通过2:1(4台MTT S5000 vs 2台国际高端GPU)的集群部署比例,Prefill侧总算力得到有效补足,使异构集群在算力总量维度与纯国际高端GPU集群实现全面对标。摩尔线程MTT S5000单卡在Prefill阶段的吞吐量达到国际高端GPU的46%至54%。在128K上下文、16并发的极限场景下,性能测试结果显示,

也为国产算力从“可用”迈向“好用”树

依托KV Cache FP8压缩存储,在全链路服务质量方面,每Token输出时延(TPOT)稳定在0.011至0.020秒之间,系统吞吐随并发增加呈线性平缓下降,全链路指标与纯国际高端GPU集群表现一致,异构集群的首Token时延(TTFT)为1至6秒(常规并发),满足在线服务严苛的SLA要求。在长上下文场景中,该方案可有力支撑1M超长上下文推理。

继续了解

可有效对标由4台国际高端GPU组成的2P2D算力集群使用。本方案验证了由 4台MTT S5000 + 2台国际高端GPU组成的4P2D异构算力集群,在处理长序列大模型推理任务时,

推理引擎与生态支持 统一框架消除异构壁垒,迁移成本趋零

双方在以下核心技术层面形成合力:方案的推理加速能力由硅基流动自研的SiliconLLM推理加速框架与摩尔线程MUSA全栈平台协同提供。针对PD分离场景,

并可为Prefill与Decode两侧分别定制并行策略, SiliconLLM通过统一硬件抽象层(HAL)消除MTT S5000与国际高端GPU间的异构壁垒,使两侧模型代码与配置完全一致,最大化异构资源利用率;

 Prefill节点与Decode节点之间通过Mooncake RDMA高速网络实现KV Cache的零拷贝传输。确保端到端推理时延稳定;

 摩尔线程自研MATE高性能算子库深度适配芯片硬件指令,让FP8精度在异构芯片上获得与原生FP16对齐的推理性能与精度表现。使计算效率逼近理论峰值。配合自适应无损模型量化技术,

配备大容量显存与高带宽。其实其核心芯片PH100已首批通过中国信息安全测评中心的国家《安全可靠测评》(2026年第2号),摩尔线程MTT S5000是专为大模型训练、推理及高性能计算而设计的全功能GPU智算卡,安全可靠等级为I级。基于第四代MUSA架构“平湖”打造,完整支持从FP8到FP64的全精度计算,

开发者可实现代码的平滑迁移。在确保模型收敛的同时显著降低显存占用。依托第四代MUSA全栈平台,MTT S5000原生适配PyTorch、Megatron-LM、vLLM及SGLang等主流AI框架,MTT S5000率先实现硬件级原生FP8计算精度支持,

工程化落地 打造高品质“词元生产工厂”

白皮书指出,可支撑大规模生产部署。该方案以2:1比例实现MTT S5000对国际高端GPU的等效替代,显著降低了推理成本与供应链风险,该方案已具备规模化生产落地条件——全链路时延与极限抗压能力满足在线服务SLA要求,RDMA通信兼容性验证通过,构建了模型、算力、平台、运营协同的新型基础设施体系。

《PD分离异构算力混部实践技术白皮书》的发布为行业带来了深远意义:

 为国产算力规模化部署提供可行路径,国产算力可在不牺牲用户体验的前提下逐步替代国际高端产品;通过异构混部,

本方案在KV Cache通信、精度对齐、仿真调度等方面形成了可复用的技术规范, 推动异构算力标准建设。为行业提供了可量化的容量规划标准与部署参考;

异构算力的高效协同是实现算力互联互通、资源灵活调度的关键技术基础; 支撑全国一体化算力网建设,

 构建安全可控的AI产业底座,形成模型、算力、平台、运营协同的新型基础设施体系。推动AI应用从试点走向规模化生产。

构筑起面向未来的AI基础设施。本次白皮书发布的PD分离异构算力混部技术方案,全功能GPU正加速AI变革。面对词元时代爆发式的算力需求,在以代理式AI、物理AI等为代表的创新浪潮中,凭借全场景通用优势,正是“词元生产工厂”实现高品质Token大规模、高性价比生产的关键技术支撑。支撑从训练到推理、从数字世界到物理世界的多元算力需求,摩尔线程基于夸娥(KUAE)智算集群建设三大“AI工厂”——“模型训练工厂”“词元生产工厂”“澳洲幸运10计划正规渠道体生产工厂”,

AI基础设施的竞争,不只是算力规模的竞争,更是Token生产效率、系统工程能力与产业协同能力的竞争。此次公布的白皮书为构建安全、可控、可持续的AI产业底座提供了坚实的技术基础与工程实践。也为国产算力从“可用”迈向“好用”树立了重要里程碑。

请访问以下链接或点击下方“阅读原文”:了解《PD分离异构算力混部实践技术白皮书》详情,

https://developer-hscdn.mthreads.com/public/PD分离异构算力混部实践技术白皮书.pdf

* 以上测试数据来自摩尔线程实验室及合作伙伴实测。一般来说


本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

赞 ()

相关推荐

发表回复

评论列表

点击查看更多

    联系澳洲幸运10计划正规渠道

    微信:百易小助手

    邮件:contact@澳洲幸运10计划正规渠道

    工作时间:周一至周五,9:30-18:30,节假日休息

    数据格式完全一致