
推理成为算力主场,算力基础设施走向系统级交付。
作者|黄琪丹
客户已经不怎么问芯片跑分了。
这是近两年不少算力供应商的共同感受。过去,客户首先关注芯片算力和硬件参数;现在,他们更关心一套系统能不能支撑Agent业务稳定运行。
变化发生在推理侧。IDC相关预测显示,到2027年,推理将占智能算力需求的70%以上,全球加速计算服务器市场将在2029年突破1万亿美元。Gartner也指出,2027年中国云上AI推理负载占比将从当前的20%跃升至80%。
这些判断指向同一个趋势:AI算力的主场正在从训练走向推理。
训练更像阶段性工程,推理则更像持续性服务。一个Agent完成一次任务,可能要拆解目标、读取文件、调用工具、生成代码、反复校验。每一步都在产生和消耗Token。一次任务,正在变成一条持续运行的Token链。
Token也因此不再只是模型公司的计费单位,而开始变成AI业务运转过程中的基础流量。它越多、越连续,背后的算力系统就越需要保证响应效率、资源效率和运行质量。
所以,AI基础设施的竞争也变了。未来行业不只是比谁有更多芯片、谁的峰值算力更高,而是比谁能把算力更稳定、更高效、更低成本地送到真实业务里,算力基础设施正在从产品交付走向系统交付。
1.从训练到推理,算力基础设施遇到新问题
训练时代,行业很容易把焦点放在芯片和集群规模上。谁能造出更强的芯片,谁能堆出更大的算力,往往就是最直接的竞争语言。
但推理时代的问题没有这么简单。当AI应用进入真实业务,算力不再只服务于一次训练任务,而是要面对持续请求、实时响应、高并发调用和长期运行。
问题一:算力要先变成可用的系统。
推理规模扩大后,单机能力的天花板已经越来越清楚。成千上万张加速卡如果只是被连接在一起,并不会天然形成一个高效集群。真正难的是让它们像一台计算机一样协同工作,而不是各自为战。
在大型集群里,任务调度、负载均衡、故障隔离、弹性扩展和能效管理必须被放到同一个系统里解决。一个节点的网络抖动,可能拖慢一批请求;一张卡异常退出,如果没有自动恢复机制,就可能让任务中断。到了万卡级规模,如果继续依赖人工逐台配置、逐层调优,交付周期和运维成本都会失控。
客户真正想要的不是一堆硬件,而是开机即用的集群能力:像调用一台服务器一样调用一个集群,按需扩展,自动容错,统一运维。
与此同时,芯片性能也不会自动变成业务能力。底层计算资源要真正上线,还要经过整机设计、系统软件、模型适配、开发环境和运维调优等环节。
换句话说,芯片只是起点,客户最终需要的是可部署、可运行、可持续产出的计算系统方案。
问题二:数据流动开始成为瓶颈。
大模型推理运行起来以后,模型权重、KV Cache、中间状态和并发请求,需要在多卡、多机之间频繁传输。系统如果无法高效组织数据流,即便单点计算能力再强,也可能因为“等数据”而空转。
这在实时业务里会直接变成响应变慢、成本上升和用户体验下降。对一个正在运行的AI服务来说,数据不仅要传得更多,还要传得更快、更近。
传统三层数据中心集群架构下,跨机数据交换依赖多级交换机链路。传输距离增加、通信路径变长,都会带来额外延迟与带宽损耗,影响不同计算单元之间的协同效率。更隐蔽的是,长上下文、MoE大模型推理下,单个请求对互连带宽的要求正在变高,传统电互联在距离和带宽密度上都在逼近极限。一旦集群规模突破阈值后,通信延迟可能出现非线性上升。
这两个问题最后指向同一个结论:推理时代需要的不是更好的“零件”,而是更强的“系统”。在规模化推理场景下,打通互联、调度、内存协同的全栈系统架构优化,对吞吐、延迟、成本的提升收益更大。
2.燧原的答案:把算力组织成系统
面对这些变化,燧原科技这次在WAIC展示的重点,不是一款孤立产品,而是一组围绕系统级交付展开的能力组合。
首先从超节点开始,回答大规模集群怎么建。
在大模型训练和高并行推理场景里,超节点正在成为高性能AI算力基础设施的关键系统架构。
「甲子光年」了解到,燧原此次展示的高性能超节点有两条实现路径:一条是与中兴通讯联合打造的正交架构方案——“云燧ESL64-O”;另一条是Cable-tray方案,走更标准化的部署路线。
正交架构超节点中,单个整机柜支持16个计算节点和4个交换节点,可以通过Scale-up接口搭建大带宽域,也可以通过传统Scale-out扩展方式构建更大规模、更高效的算力集群。单计算节点可实现8个计算芯片,单机柜最大可支持128卡HBD域。同时,该方案采用全国产CPU、AI芯片、交换芯片、国产DPU、国产网卡芯片等,满足信创要求。
正交架构超节点的意义,不只是把更多卡放进一个机柜。它一方面通过芯片、模组、整机柜和互联架构的协同设计,突破单机能力上限;另一方面通过计算软件平台,让硬件能力能够被模型和应用真正调用起来,提升了软硬协同的系统效率。

“云燧ESL64-O”超节点,图片来源:燧原科技
另一条Cable-tray方案,则对应燧原此次展出的“云燧ESL64-C”。单个整机柜支持16个计算节点和12个交换节点,兼容国内信创生态与国际主流X86平台。此类方案更接近当前算力集群的主流部署形态,有助于降低部署复杂度与扩容成本,让集群扩展更灵活、稳定。

“云燧ESL64-C”超节点,图片来源:燧原科技
无论是哪条路径,超节点要解决的都不是简单增加卡数,而是通过计算节点、交换节点、互联架构、计算软件平台和生态适配的协同,把分散的计算资源组织成统一、可调度、可交付、稳定的算力系统。
OGX和服务器,则是把芯片变成可交付节点。
如果说超节点回答的是集群如何组织,那么OGX模块和AI服务器回答的是另一个更靠近客户的问题:芯片能力如何变成可以上架、可以部署、可以交付的计算节点。
云燧OGX面向标准化部署需求,是燧原科技基于自研第四代训推一体加速模组打造的单机8卡标准化AI系统产品。它采用OAM2.0,并通过高性能互联形成整机方案。作为标准化高密度加速节点底座,OGX支持快速上线和标准化交付,整机系统生态丰富,可为中小规模训练和推理场景提供灵活、具备性价比的算力部署。
对客户来说,这类产品的价值在于减少中间环节——从芯片、板卡到服务器集成,需要经历复杂的适配、调优和交付流程。OGX把这些能力封装到标准化AI系统产品里,让底层计算能力更快服务于业务。
在整机生态里,中兴通讯、超聚变等合作伙伴的服务器产品也已全面适配燧原加速卡,把燧原算力接入主流整机体系,双方联合打造的R6930G3、G8600V7等服务器产品,分别面向大模型训练、推理等典型AI应用场景,让算力更贴近业务需求。
支撑这些整机形态持续演进的,是燧原计算加速卡的迭代。截至目前,燧原已经完成从第一代到第四代AI加速产品,S60是其主力推理产品的代表。截至2026年6月,燧原S60已在互联网客户和各地智算中心累计出货16万卡,支撑Coding Agent、图像编辑、视频生成、AI搜索、语音生成、深度思考等十余类应用。
正交架构和NPO光互联解决的是数据怎么流动的问题。
当算力从单机走向集群,数据流动会变成另一道门槛。
燧原的思路,一方面是在超节点内部优化节点之间的数据交换效率,另一方面自研NPO光互联突破互联限制。
在正交架构里,计算节点和交换节点之间通过正交连接器与单级交换拓扑实现垂直交叉互连。相比传统集群中更复杂的连接链路,这种方式能够降低通信损耗,并保障信号完整性。工程部署上,超节点采用无背板、零线缆设计,计算节点之间、计算节点与交换节点之间连接实现零线缆。这样做的直接好处是降低互联成本、减少故障点、提升部署和运维效率,并将安装时间从天级缩短至分钟级。
此外,燧原自研NPO的Scale Up光互连原型系统方案,能够同时支持SiPh和VCSEL两种形态,突破面板IO布局瓶颈,提升带宽密度,并满足KV Cache对超大带宽的需求。该方案可采用线性直驱架构,取消DSP信号处理芯片,在降低时延的同时降低互联功耗,并突破铜互联的距离限制,可应用于512卡及以上超节点,支持弹性灵活扩展,兼具性能和成本。

燧原NPO解决方案,图片来源:燧原科技
3.把算力送到业务现场
检验系统级交付能力最直接的方式,是看它能不能进入真实业务,并持续支撑实际应用。
基于S60推理算力,燧原与行业伙伴展开合作,将AI基础设施能力融入工业、政务、教育等领域,推动AI从计算资源走向行业应用。
在工业领域,北京工业软件产业创新中心基于燧原算力解决方案打造“杨梅工业”平台,将AI能力融入化工、汽车、电子等复杂工业场景,支撑工业设计、生产制造等环节的智能化升级。
在政务领域,方寸科技采用燧原算力构建了智慧公文平台,通过私有化部署满足政务场景对数据安全和业务可靠性的要求,推动AI能力进入公文检索、写作、审校等流程。
在教育领域,行者AI联合燧原打造AI音乐与美术教育平台,将AI能力应用于教学辅助、创作生成和个性化学习等环节,目前已覆盖全国1000余所学校。
这些案例背后,是同一套算力基础设施能力在不同场景中的延展。当算力基础设施完成从芯片、整机到集群的系统化演进,AI应用才有可能真正进入持续运行阶段。
4.结语
燧原此次方案的升级,是在尝试把硬件产品、系统架构、计算软件平台和生态适配组织成一条完整链路。从这个意义上看,燧原做的不是单品堆叠,而是系统级交付能力的构建。
一套AI算力真正的价值,从来不体现在单卡参数上,而在于能够帮助多少算力走出芯片,走进业务运行的每一个环节。
(封面图来源:AI生成)