国产算力从单点性能走向系统协同:星流计算 NovuWing 跑通多 Agent 新架构

2026年8月7日,企业级全栈AI基础设施公司星流计算(NovuInfra)正式发布《Agent Native Compute:面向企业Agent时代的新一代AI计算基础设施》白皮…

2026年8月7日,企业级全栈AI基础设施公司星流计算(NovuInfra)正式发布《Agent Native Compute:面向企业Agent时代的新一代AI计算基础设施》白皮书,系统披露NovuWing™技术架构。目前,ShareKV双组件已跑通:KV Cache命中率超80%,中位TTFT降至基线20%以下。

它关注的不是如何再提升一次模型推理的峰值性能,而是一个更现实的问题:当企业同时运行几十个、上百个Agent,如何让它们长期保持上下文、频繁唤醒与协同,又不让GPU、HBM和整体成本失控?

从“计算墙”走向“内存墙”

Agent在Active、Idle、Deep-Idle和Recovering等状态之间不断切换,并持续保存上下文、KV Cache与可恢复运行状态。若这些数据长期驻留HBM,昂贵的高带宽资源会被低活跃状态占用;若直接释放,Agent再次唤醒时又要重新计算。为此,NovuWing™构建三级智能内存:L0 HBM承载活跃KV Cache;L1 DDR保存短期闲置、可能快速复用的状态;L1.5 CXL.mem / NVMe承载低活跃KV Cache、上下文快照与暂停Agent状态。数据随生命周期分层流动,Agent激活时再按需预取和恢复。

关键不只是分层,而是理解Agent

传统缓存调度通常依据访问热度或显存压力。NovuWing™进一步引入Agent语义:系统判断数据属于哪个Agent与Session、当前处于什么状态,以及迁移、加载或重算的恢复成本。Agent Runtime通过agent-id、session-id与tier hint把策略传递给推理框架和内存体系,使缓存管理从”显存不够再换出”转向”依据Agent状态主动迁移与预取”。

为把这套机制落到工程系统,星流计算自主开发ShareKVConnector与ShareKVSidecar。前者运行在vLLM推理实例侧,衔接GPU/HBM与L1+L1.5共享内存,并执行KV Cache迁移、预取与恢复;后者作为宿主机共享服务,统一管理DDR共享内存池与CXL.mem(或NVMe)池,为多个推理实例提供共享KV服务。两者通过共享内存和异步I/O建立HBM、DDR、CXL.mem(或NVMe)之间的数据通路,减少额外拷贝与迁移开销。

阶段性基线结果进一步验证了这条技术路径:在当前企业Agent场景测试中,KV Cache命中率超过80%,中位首Token时延(TTFT)降至基线的20%以下。前者减少了可复用上下文的重复计算,后者直接缩短首Token等待时间,表明Agent语义调度与ShareKV分层机制已开始转化为可感知的效率收益。

从白皮书到产品:关键链路跑通,效率收益开始显现

目前,相关能力已在玄矩™A1与SerpMind™产品体系中完成贯通。玄矩A1提供计算与三级内存底座,Agent Runtime负责生命周期和资源调度,SerpMind Enterprise Agent OS提供Agent的创建、运行与治理。围绕核心机制,星流计算已提交发明专利申请《基于Agent语义的三级分层KV缓存智能调度方法及系统》,申请号:202611065591.X。

让算力从“可用”走向“经济可用”

星流计算将这一逻辑称为算力经济学:企业不应只比较峰值FLOPS和采购价格,还要考察Agent Throughput、KV Cache效率、Cost per Agent、Cost per Task与TCO。把带宽留给HBM、把容量放到更合适的层级,再由Agent语义决定数据何时流动,本质上是让每一份昂贵算力投入承载更多有效智能。

对国产算力而言,这意味着创新正从芯片、板卡和服务器的单点性能,扩展到CPU、GPU、内存、推理框架与Runtime的系统级协同。只有“算得起、跑得久、管得住”,多Agent才能真正进入企业生产。上述两项数据为当前企业Agent场景的阶段性基线结果;完整模型、上下文长度、并发规模、硬件配置及标准化Benchmark与TCO数据,将在完成可重复验证后独立发布。

 

免责声明: 本文为广告商业稿件,内容仅供参考,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,并请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时联系我们。