在算力需求从训练主导加速迈向推理主导的产业转折点,一家国产算力厂商正试图重新定义AI基础设施的交付逻辑。近日,该公司首次系统性地提出“五层协同”的AI推理交付新范式,将业务版图从算力硬件拓展至Token生产、柔性电子乃至具身智能领域,引发市场广泛关注。

从“卖服务器”到“卖Token”:推理时代的价值迁移

随着大模型应用进入爆发期,业界普遍认为,AI产业的算力重心正从训练侧向推理侧迁移。OpenAI o1系列等模型对多步逻辑推理的需要,让“推理Token”成为新时代的稀缺资源。在此背景下,这家厂商提出了“Token工厂”的概念——不再仅仅交付裸金属服务器,而是构建能够高效生产高质量Token的专用基础设施。

公司负责人表示,AI推理不应再被视为简单的“算力堆砌”,而是一个包含算力调度、框架优化、模型适配、算法协同的复杂系统工程。单个元件或单台服务器的性能指标,在真实业务场景中往往会被系统瓶颈大幅稀释。正因如此,该公司选择以系统级方案切入,力争在单位成本下产出更多可用Token,真正降低大模型应用的边际成本。

“五层协同”架构:从底层芯片到顶层算法的全栈贯通

本次发布的“五层协同”架构,具体涵盖芯片层、硬件层、框架层、模型层与应用层的纵向协同。在芯片层面,公司推进国产算力芯片的深度适配与性能调优;硬件层上,其AI服务器产品已形成从风冷到液冷、从PCIe到全互联的完整矩阵,并率先针对长序列推理场景优化卡间通信带宽;框架层通过自研推理引擎与主流开源框架的深度嫁接,显著提升算子执行效率;模型层则与多家头部大模型厂商合作,开展联合调优。

这五层并非各自为政,而是一套自上而下、可动态感知的联动机制。例如,当应用层请求的并发压力骤增时,平台能够通过跨层感知,自动调整模型并行策略及KV Cache分配方案。这种“全局最优”的解决思路,避免了单点技术过硬但系统整体哑火的行业通病。

前瞻布局:柔性电子与算力,叩响物理AI的大门

值得关注的是,该公司的战略视野并未止步于服务器与Token交付。在本次对外沟通中,“物理AI”概念被多次提及。据悉,公司正探索如何将柔性电子技术与AI算力底座融合,从而为具身智能机器人提供更强的感知与决策支持。

目前人形机器人受限于刚性电路板与固定形态,难以适应复杂多变的物理交互环境。柔性电子技术的突破,有望让机器人的“皮肤”拥有高密度传感能力。而要实现这一设想,设备端必须拥有实时处理多模态数据的边缘算力。这恰好是该厂商AI服务器与推理平台的用武之地。从“云端智能”走向“具身智能”,算力正在从机房走向物理世界,赋予机器感知与行动的能力。

产业语境下的新叙事

从商业逻辑来看,这家公司试图讲述的,是一个从基础设施供应商向智能生产力平台跃迁的故事。在国产算力替代的大背景下,单纯依赖芯片性能硬拼已非最佳路径;通过系统协同创新,以更优的能效比和单位Token成本赢得市场,正在成为行业共识。

Token是AI时代的新货币,服务器是算力的物理载体,物理AI则是智能落地的终极场景。这家厂商的“五层协同”叙事,能否在更加务实的产业验证中站稳脚跟,仍需观察。但毫无疑问,在AI推理需求指数级增长的前夜,中国算力厂商正从“跟随者”向“定义者”的角色悄然转变。