点击右上角
微信好友
朋友圈

请使用浏览器分享功能进行分享

日前,趋境科技与摩尔线程签署战略合作协议。双方以趋境科技自研国产PD异构技术、摩尔线程MTT S500智算卡及MUSA软件平台为核心底座,共同推进基于ATaaS平台的国产化高品质AI Token工厂建设,推出以Token Pod(Token超节点)为载体的软硬一体化联合解决方案。目前该方案已正式投产,承接头部模型厂商官方业务流量,在同等生产服务标准下,兼具生产级性能与单位Token成本优势,整体性价比超越国际先进算力方案,标志着国产PD异构推理率先进入规模化生产应用阶段。
随着大模型进入规模化商业落地期,算力基础设施的竞争已从单卡性能指标转向系统级Token生产效率,单位高品质AI Token的综合生产成本,成为衡量算力方案商业价值的核心标准。此次联合方案的性价比优势并非源于单纯的硬件价格差异,而是来自推理全流程的架构级优化。AI推理分为Prefill(输入预处理)与Decode(令牌生成)两大核心阶段,摩尔线程MTT S500承担Prefill阶段的输入计算与KVCache生成任务,与负责Decode阶段Token生成的高带宽GPU形成异构协同。
依托MTT S500的高密度AI算力、原生FP8精度,以及MUSA完善的软件栈与生态适配能力,Prefill环节从传统推理链路中解耦,构建为可独立供给、独立计费、独立优化的算力资源池;趋境科技通过自研PD异构技术完成模型深度优化与跨设备协同,将不同类型算力资源整合为统一、稳定的端到端推理服务。这种配置既减少了Prefill阶段对高成本资源的占用,也避免了按单一阶段峰值需求配置基础设施的浪费。实测显示,由4至5台MTT S500组成的Prefill资源池,输入Token处理性价比超过国际先进算力方案。
性能优势已通过真实生产场景完成验证。面对高并发、超长上下文、持续流量波动等复杂工况,该联合方案在国产头部大模型业务场景中,实现平均超50TPS生成速度、90%以上KV Cache命中率、99.9%服务稳定性,同时保障生产级低首Token时延(TTFT),真正将国产算力转化为规模化、高品质的AI Token生产能力。这也意味着国产算力的竞争力已从单卡参数比拼,延伸至系统级Token生产效率的全链路比拼,为万亿参数大模型的规模化推理提供了兼顾性能与成本的国产技术路径。
这一生产成果,也是趋境科技“少模型、深优化”技术路线的集中体现。该路线聚焦具备明确规模化需求的重点模型,围绕模型、芯片、推理系统与真实业务负载开展持续深度优化,以实际运行中的时延、吞吐、稳定性、精度、长上下文处理能力与综合成本为核心衡量标准。双方针对不同推理阶段的任务特征完成异构方案设计,通过线上真实流量持续迭代优化,使性能提升从实验室参数转化为稳定的Token产出,相关经验已沉淀至ATaaS平台,形成可复用的生产级能力。
根据合作框架,双方核心目标是打造可持续产出高品质AI Token的国产化Token工厂。摩尔线程提供硬件与软件平台支撑,趋境科技以TokenPod为交付载体,整合自研推理系统、ATaaS平台与运营服务,形成覆盖全链路的专属推理集群。双方还将项目适配经验沉淀至TokenPod,依托共享KVCache、弹性扩展等能力,支持多类硬件组合,形成可按需配置的Token生产单元。
截至2026年8月,趋境科技已建成日均万亿级Token生产项目,多个项目具备日均千亿级产能,为后续规模化建设积累了成熟经验。未来双方将深化技术与生态协作,拓展多行业应用场景。(柯岩)
