中国电信推出国产AI模型套件,支持在单块RTX 3090 GPU上部署本地企业级AI推理服务。
中国电信或许将首次在AI办公自动化市场中分得一杯羹。
今年夏天,科技巨头们集体加大了在AI办公工具上的投入。他们在争夺智能体能力、工作入口和企业工作流——继编码之后,办公工作已成为智能体的下一个战场。
但当所有人都在争夺入口时,有整个一类企业还没有踏入这个领域。
原因很现实。他们的数据无法离开企业边界。模型必须本地部署。计算资源有限。但他们仍然需要阅读长文档、处理复杂业务流程、完成工作——就像其他人一样。
中国电信新近开源的Xing4.0-29B-A4B正是针对这一空白。
它还带来了更多:一个完全国产化的、轻量级的代码智能体LLM。整个技术栈——从国产芯片和国产训练框架,到模型训练和推理部署——都已经系统地适配了。
为了最大化本地部署能力,Xing4.0-29B-A4B采用了专家混合(MoE)架构。拥有290亿总参数,但每次推理仅激活约40亿参数。经过4比特量化后,单个RTX 3090就能运行它。
但运行只是第一步。企业真正关心的是:这个模型在那个显卡上实际能做什么?
例如,在处理关键文档时,模型可以完全在本地完成内容理解、指标提取和信息组织——数据从不离开企业环境。
或者以一份200页的采购招标文件为例。模型可以在约20分钟内在本地完成初步的技术、商务和价格评审,并提供逐行的评分依据。
更进一步,本地部署的考虑不仅限于消费级GPU。
Xing4.0-29B-A4B完全在华为昇腾910C计算芯片上训练,使用国产MindSpore/MindFormers训练框架和开发工具包——真正实现了"国产芯片训练国产模型"。
在推理部署方面,它已完成昇腾适配和验证。从训练到生产,国产计算路径是可行的。
该模型目前在GitHub、Hugging Face、Gitee、ModelScope和ModelsHub上开源,并提供并发API支持。
值得注意的是,截至发布时,Xing4.0-29B-A4B已登上Hugging Face热门模型榜单第4名。
感兴趣的各方可以立即开始使用它。
**性能与能力兼备**
坦诚地说,将模型装进一个GPU并让它可靠地处理日常企业工作涉及很多基础工作。
企业任务很少像单一的问答交互那样简单。
文档被阅读,然后必须提取信息、调用工具、验证结果,并将一切组织成可交付的材料。
这项工作每天都在进行——稳定性和成本效益很重要。
满足这些要求意味着继续降低部署和运营成本,同时建立真正的能力。后者是Xing4.0-29B-A4B专注于加强编码和智能体能力的原因。
从编码开始。
从历史上看,百亿参数模型擅长编写小代码片段或增加几行。
但交给它整个代码仓库并要求解决真实的工程问题——事情会变得困难。它需要理解项目结构、跟踪跨文件的接口调用、使用文档、日志和历史上下文定位问题。解决问题后,它必须验证更改有效且不会破坏其他任何东西。
代码只是最终输出。前面有很长的工作链。
为了应对这一持久的挑战,Xing4.0-29B-A4B将编码能力从"编写片段"提升到"进行工程"。
它原生支持256K上下文,可扩展到512K,允许单个任务包含更长的代码、文档、日志和历史——提供了理解整个项目的空间。
例如,将分散的合同账簿从Excel转换为治理仪表板需要的不仅仅是图表功能。
模型必须理解表格中的业务数据,将合同摘要、预算分配、风险识别和合规警告组织到一个页面。
这涉及数据理解、代码生成和功能组织——从多个角度综合信息以完成开发。
Xing4.0-29B-A4B可以将这些合同账簿完全在本地转换为可视化治理仪表板,数据从不离开企业环境。
智能体能力需要另一个层级。
在理解需求后,模型必须分解任务、排序执行、调用工具,并根据中间结果决定下一步。
完整地执行任务链直到交付可验证的结果——Xing4.0-29B-A4B为这些扩展任务接受了有针对性的强化。
例如,用户清楚地陈述一次需求后,模型可以确定先执行哪些步骤,哪些可以并行运行,然后调用不同的工具或智能体处理天气、日历、提醒、旅游——推动任务前进。
但如果模型可以自己处理工作,企业可以直接插入吗?
还有一步:与现有工作流集成。
已在使用的开发工具、智能体框架和部署平台必须无缝连接。否则,简单地切换环境可能会产生大量额外工作。
为了解决这个问题,Xing4.0-29B-A4B已完成对主流智能体框架和工具的有针对性适配——OpenCode、Claude Code、OpenClaw、Hermes——同时与LLaMA-Factory、MindFormers、SGLang、vLLM和KTransformers等常见工具链保持兼容,降低与现有开发环境集成的门槛。
当然,对于前面提到的那些企业,一个真实的约束保持不变:
数据无法离开边界,计算资源确实有限。
因此,除了能力升级外,Xing4.0-29B-A4B继续降低部署障碍。
在传统FP16精度下,29B模型每个GPU消耗约60GB显存,通常需要多GPU设置或昂贵的A系列卡。
经过4比特量化后,这缩小到约15GB——减少75%——允许消费级RTX 3090和4090处理。
这种轻量级私有部署解决方案已经进入实际生产环境。
在智能客服中,Xing4.0-29B-A4B已完成私有部署,其中用户呼叫、身份信息和业务记录从不离开场所。
面对复杂请求,模型必须完成意图理解、任务分解、工具调用、结果合成和全程合规验证。
据报道,该解决方案的复杂业务处理成功率超过90%。
在这里,那些企业终于有了答案:
消费级显卡可以运行它。复杂任务可以完成。工具和业务系统无缝连接。
那么它是如何工作的呢?
**跨架构、数据、训练和部署的全面优化**
前面提到的MoE是答案的一部分。
该模型有290亿总参数,但每次推理仅激活40亿参数。这意味着每个任务不会动员所有参数——计算开销相应下降。
但阅读长文档、编写工程代码和维持多步任务需要不仅仅是MoE。
架构、数据、训练和工程优化协同工作。
首先考虑架构。
更长的上下文意味着更多内容可以容纳。但内容占用空间。
处理长文档时,模型缓存较早内容的计算结果以在生成过程中重用——熟悉的KV缓存。
随着上下文长度增加,缓存积累,消耗显存并可能减缓推理。
对于真正可用的长上下文,缓存必须缩小。
Xing4.0-29B-A4B使用多头潜在注意力(MLA),将缓存信息压缩成更紧凑的形式,减少长上下文推理的显存开销。
此外,随着读取开销降低,生成速度必须跟上。这里Xing4.0-29B-A4B采用多令牌预测(MTP)。
与专注于预测下一令牌的标准训练不同,MTP训练模型预测多个后续令牌,在这个过程中学习更长的依赖关系。
这些预测服务于推理:提前生成候选内容,然后由主模型验证,加速生成。
此外,该模型结合了DeepSeek的流形双曲连接(mHC)约束,规范化跨层的信息流,以减少重复信号放大导致的训练不稳定性。
架构就位后,训练数据至关重要。
中国电信构建了一个包含数十万亿令牌的数据系统。
预训练数据经过PB级多源清洗,不仅包含通用内容,还包括复杂表格、结构化知识图谱和智能体行为轨迹。
这些轨迹与智能体能力直接相关——它们精确捕捉任务如何从开始到结束流动:
目标是什么?调用了哪些工具?它们返回了什么?给定结果,下一步是什么?
链接在一起,模型学会如何将一个步骤的输出馈送到下一个操作。
在后期训练中,团队构建了支持代码执行、在线搜索和工具调用的高并发沙箱,在其中构建扩展智能体任务。
代码是否运行、工具是否正常工作、最终结果是否满足要求——所有这些都通过测试用例和自动化进行验证。
训练材料的保留现在以实际执行结果作为证据。
在训练期间,Xing4.0-29B-A4B随着任务难度的增加而展开。
预训练从4K序列长度开始,建立通用知识和基本推理,然后逐步提高代码和复杂推理数据的比例。
在中间训练中,序列长度依次延伸到32K、128K和256K,添加仓库级代码、复杂推理和智能体数据。
在后期训练中,团队在三个方向——编码、智能体、推理——上追求多专家强化学习,然后通过MOPD融合方向特定的能力。
值得注意的是,训练采用了Muon和QK-Clip。前者优化参数更新;后者控制注意力计算量级,防止数值爆炸。
最后,在工程优化阶段,电信启用了国产计算上的高效训练。
这是"完全国产化"变成具体技术细节的地方。
基于带有MindSpore/MindFormers的昇腾910C集群,Xing4.0-29B-A4B完成了mHC特征适配、跨框架精度对齐和自定义算子开发,协调了模型架构、国产训练框架和国产芯片。
对于计算调度和显存压力,团队应用了DVM图融合、细粒度重计算和昇腾C自定义融合算子,减少调度和数据移动开销,节省显存,提高效率。
据团队介绍,在跨模型架构、编译、算子和硬件的多层协调优化后,完整训练吞吐量相比基准提高了约96%——几乎翻倍。
后期训练中使用的Slime强化学习框架也完成了昇腾适配。从训练框架到算子再到强化学习,团队在每个层级应用了有针对性的优化。
换句话说,"国产芯片训练国产模型"依赖于芯片、框架、模型和训练过程的协调工作。从架构到数据、训练和部署,这项全面的努力最终落在堆积在办公桌上的企业任务上。
**让AI办公工作对企业成为现实**
最后,为了让企业真正无缝地使用AI进行办公工作,电信打包了一个全面的支持套件。
想要快速部署的公司可以将Xing4.0-29B-A4B预集成到统一的计算网络设备中,减少环境设置和安装开销,缩短部署周期。
当本地计算紧张时,企业可以通过专用智能计算线路调用云计算,在其数据治理要求范围内,实现弹性扩展。
对于采用国产计算的企业,该模型基于志愿FlagOS统一开源AI软件栈,已解锁跨多个国产芯片的适配路径,降低了跨硬件平台的迁移和部署成本。
不同规模、不同技术能力——企业有相应的部署路径:从消费级GPU,到统一计算设备,再到云弹性计算。
最后一个问题:为什么中国电信特别构建这个更轻量的模型?
将29B放在更宽泛的星辰系列中,答案就清楚了。
以前,中国电信部署了十亿、百亿和万亿参数模型,在万亿级参数以及语音、语义和多模态方向上进行了探索。
Xing4.0-29B-A4B填补了一个特定的空白:
本地计算有限,但仍需处理复杂任务。
中国电信对这种需求不陌生。老实说,也许只有电信看到并解决这个问题。
从政府服务和客户支持到网络运营,电信长期以来处理过大规模的私有部署场景。数据可以放在哪里、现有设备能承载多少计算、工作流有多复杂——这些是企业在部署模型前必须解决的问题。
这奠定了轻量模型设计的基础。
从企业现场约束开始——计算成本、数据边界、业务需求——确定模型大小、确定基本能力并提供相应的交付选项。
这条从模型到企业的路径与电信的"云转型、数字演进、智能繁荣"战略及其五支柱智能云系统相匹配:计算、平台、数据、模型、应用。
模型处理理解和任务执行。平台管理集成和编排。计算和网络启用操作。行业应用将这些能力连接到具体业务。
Xing4.0-29B-A4B是这个组合朝着轻量级私有部署迈出的一步。
在国产芯片上训练,然后适配到企业设备和实际工作流,"国产芯片训练国产模型"的价值归结为:企业能使用它吗?他们会喜欢吗?
这就是为什么星辰系列路线图看起来更具体:更大的模型能处理多复杂的任务?不同的模态能覆盖什么工作?多少企业以前受设备和部署约束的限制现在可以使用更轻量的模型?
回到开始:AI办公竞争仍在继续。
那些数据无法离开边界、计算受限的企业——它们继续阅读文档、提交材料、开展业务。
现在他们有了另一种使用AI的方式。
下一步可能从办公桌上已有的GPU开始。