2026年9月11日星期五
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

趋境科技与 Moore Threads 达成战略合作,推出国产异构计算方案,在国际先进硅片之外实现了更具性价比的生产级 AI Token 性能。

该合作加速了替代型 AI 加速器在推理密集型负载中的采用,降低对高端 GPU 进口的依赖,并为 AI 应用提供商优化了单位经济模型。
行业媒体Slicast · 2026年9月5日 · 中国 · 来源: 量子位
重要度 75

9月3日,曲景科技与摩尔线程签署战略合作协议。双方合作基于曲景科技自主研发的国产PD异构技术与摩尔线程MTT S5000 AI计算卡及MUSA软件平台的深度融合。两家公司将继续推进基于曲景科技ATaaS平台的国产高质量AI Token工厂建设,并共同开发推广以Token Pod(Token超级节点)为核心的集成解决方案。

该联合解决方案已进入生产阶段,正在处理领先模型开发商官方工作负载的真实Token流量。在同等生产服务标准下,该方案平衡了生产级性能与单位AI Token成本优势,整体性价比超越国际先进计算解决方案。这一里程碑标志着由曲景科技和摩尔线程主导的国产PD异构推理首次部署至真实生产环境。

曲景科技Token业务部总经理刘宪河与摩尔线程战略销售部副总经理费敬然代表各自公司签署协议。清华大学教授、曲景科技首席科学家吴永伟,曲景科技创始人兼CEO艾志远,曲景科技总裁兼CFO吴文杰,曲景科技首席架构师谢维宇,摩尔线程创始人、董事长兼CEO张建中,以及摩尔线程高级副总裁董龙飞、罗文勇出席签约仪式。

随着大语言模型应用进入规模化商业部署阶段,基础设施竞争正从单卡性能转向系统级Token生产效率。衡量解决方案商业价值的关键指标不再仅仅是硬件能否运行模型,而是在既定服务目标下生产每个高质量AI Token的成本。

联合解决方案的成本优势不仅源于硬件定价差异,更在于针对Prefill(预填充)和Decode(解码)阶段的资源优化。摩尔线程MTT S5000负责Prefill阶段的输入计算和KV缓存生成,与专为Decode阶段Token生成优化的高带宽GPU协同工作。

凭借密集的AI算力、原生FP8精度以及具备强大生态兼容性的全面MUSA软件栈,MTT S5000使Prefill工作负载得以与传统推理流水线解耦。这使得Prefill资源能够作为独立配置、计费和优化计算的资源池运行。曲景科技利用其专有的国产PD异构技术深度优化模型并协调跨设备工作流程,最终将多样化的计算资源整合为统一、稳定且极具成本效益的端到端推理服务。

该架构降低了Prefill阶段对高成本资源的消耗,消除了仅基于单一阶段峰值需求配置整个基础设施集群的需要。根据当前项目标准,由四到五张MTT S5000组成的Prefill资源池,其输入Token处理性价比已超过国际先进计算解决方案。

这表明国产算力的竞争力已从单卡基准测试扩展到涵盖系统级Token生产效率。通过国产硬件与PD异构技术的深度协同,曲景科技与摩尔线程建立了一条用于万亿参数模型规模化推理的国产算力路径,成功实现了生产级性能与成本效率的平衡。

最终,性价比必须通过实际运营来验证。生产环境要求具备应对高并发、超长上下文窗口和持续流量波动的韧性,这对国产GPU内存管理、跨设备协调和服务稳定性提出了更高要求。

生产数据证实,摩尔线程MTT S5000与曲景科技国产PD异构解决方案的协同运行满足了国内领先大模型的复杂业务场景需求。系统平均生成速度超过50 TPS,KV缓存命中率高于90%,运营稳定性达到99.9%,并实现了生产级的低首Token延迟(TTFT),有效将国产算力转化为可扩展的高质量AI Token生产能力。

经过多轮性能迭代和专项优化,MTT S5000已成功跨越模型兼容性和测试阶段,正式加入高质量AI Token生产流水线。

这些生产成果体现了曲景科技“少模型、深优化”的技术策略。通过不断打磨核心模型,曲景科技将国产GPU的硬件能力转化为稳定、可交付的AI Token生产能力,创建了可复用的制造框架。

“少模型、深优化”方法将工程精力集中在具有明确扩展需求的关键模型上,推动模型、芯片、推理系统和真实工作负载模式的持续完善。成功的衡量标准在于能否同时保持延迟、吞吐量、稳定性、精度、长上下文处理能力以及成本效率,并持续输出高质量的AI Token。

这一理念指导了国产PD异构解决方案的设计与部署。曲景科技根据Prefill和Decode阶段不同的任务特征构建了PD拆分异构推理架构,并与摩尔线程合作,针对目标模型、推理系统和运行时环境深度优化MTT S5000。通过对实时流量的持续验证,双方团队迭代了模型配置和服务策略,将实验性参数增益转化为稳定的高质量Token输出,进一步证明了“少模型、深优化”在国产异构生产场景中的可行性。

由此产生的模型配置、流量特征和运营策略被系统地整合到ATaaS平台中,建立了可复用的生产能力框架。

此次战略合作的核心目标是利用双方在推理系统、生产运营以及国产GPU软硬件平台方面的优势,共同构建能够处理真实业务工作负载并持续产出高质量AI Token的国产AI Token工厂。

为实现这一目标,双方将推出基于Token Pod(Token超级节点)的软硬一体化Token生产解决方案。摩尔线程将提供MTT S5000 AI计算卡和MUSA软件平台,而曲景科技将以Token Pod为载体,将这些组件与其专有的国产PD异构推理系统、ATaaS平台及运营服务深度融合,形成覆盖基础设施、推理优化、平台管理和持续运营的专用推理集群。

为了将联合解决方案从试点部署过渡到标准化交付,两家公司将从国产PD异构项目中吸取经验教训——包括模型适配、跨设备协调和生产运营——直接融入Token Pod。Token Pod具备共享KV缓存、流量感知配置、弹性伸缩和故障隔离功能,能够容纳混合国内外硬件组合。它形成了一个可根据特定业务需求配置的、可扩展的Token生产单元,加速了联合解决方案在具体项目中的部署。

这些解决方案的持续复制依赖于曲景科技现有的生产基础。截至2026年8月,曲景科技已完成多个合作项目,实现每日生产数万亿个高质量AI Token,多个项目已建立每日数千亿的生产能力。这为建设与管理更大规模的国产高质量AI Token工厂提供了宝贵的运营经验。

作为国内异构混合推理的先驱,曲景科技已按照生产级标准推进国产PD异构解决方案的部署。在确保功能可靠性和精度准确性的同时,该公司继续推动引擎级别的深度性能优化,确保国产GPU硬件能力真正转化为高质量的AI Token输出。

展望未来,曲景科技与摩尔线程将进一步深化技术合作、标准制定和生态系统伙伴关系。他们计划将合作扩展到互联网企业、前沿基础模型公司和电信运营商等关键国家领域,推动国产PD异构推理进入更广泛的生产应用场景。

阅读原文