中国日报7月21日电(马思)2026世界人工智能大会的展馆里,一个显著的变化是:聚光灯不再只打在单颗芯片上,而是投向那些由成百上千颗GPU构成的超节点机柜和一体化算力集群。业界清晰地感受到——国产算力正从“器件级”比拼走向“系统级”竞速,并由此迈入“更快、更高、更强”的全新阶段。
面对AI浪潮将“词元”从概念推向千行百业,摩尔线程创始人张建中提出建设三大“AI工厂”,其中“词元生产工厂”直指Token产出效率。基于旗舰级AI训推一体智算卡MTT S5000,摩尔线程推出PD异构分离方案——将高算力需求的Prefill计算池与高带宽的Decode生成池分池部署,并独家支持KV Cache FP8与1M超长上下文,在大模型推理中实现更快的吞吐与响应。
“更高”体现在支撑超大规模模型的能力跃升上。摩尔线程在“模型训练工厂”展区深度解密支撑万卡万亿参数训练的“夸娥”底座,并现场首秀多项“国芯训国模”成果——包括从零起步完整训练的MoE-236B基础模型,以及全球首个5D世界模型“北大EvoPhys-World”的全栈原生训练。这些实例充分验证了国产芯片在超大规模、超长连续稳定训练上的全链路闭环能力。
与此同时,阡视科技从系统架构端为“更快”提供支撑。其自主研发的wylon超节点系统敏锐捕捉到,随着AI向递归自我改进演进,KV Cache的频繁读写使存力成为新瓶颈。为此,wylon不仅在横向算力互联上实现全域无阻塞的卡间全互联通信,更独创纵向存力贯通平面,打通百TB级GPU近存、系统内存与PB级大带宽闪存层级结构。结合HitenOS大模型操作系统的软硬件深度协同,在国产GPU平台上实现“同一速度下更高吞吐,同一吞吐下更快响应”的帕累托改进,性能提升达10倍以上。从算法部署到系统存算协同,国产算力的“快”正被重新定义。
阡视科技则将“更高”推向系统级新高度。其发布的wylon Q72/288超节点,单机柜集成72颗国产GPU,四机柜横向互联域扩展至288卡规模,GPU高带宽显存达18TB,互联总带宽72TB/s,专为KV Cache设计的统一DRAM缓存可达上百TB。这一规格不仅刷新了国产超节点的容量纪录,更通过全域互联与异构存力贯通,确保大模型在超长上下文场景下高效运转。两家企业从核心芯片到系统集成,共同抬升了国产算力的规模天花板。
算力的“强”最终要转化为易用、高效的生产力。摩尔线程以三大“AI工厂”为主线,打通“训、推、用”闭环。在“智能体生产工厂”,其展示了全栈国产化具身智能仿真平台MT Lambda及面向工业场景的解决方案,同时端侧产品如家庭AI中枢MTT AICUBE和“为智能体而生”的AIBOOK算力本,凭借端云协同和内存等效扩容技术,可流畅运行80B超大MoE模型与智能体协作,让国产算力从云端延伸至边端。
阡视科技则以系统级基础设施赋能这一生态。wylon超节点系统通过KV分层管理、算力亲和调度、硬件拓扑感知等底层能力,确保模型负载直达硬件,避免中间层性能损耗,为Agent时代提供大算力、大带宽、大存储的一体化高效算存空间。值得一提的是,wylon系统已深度联合寒武纪、壁仞、沐曦、曦望、海光、摩尔线程等国内GPU芯片翘楚,构建起从芯片到系统、从算力到生态全栈贯通的国产AI基础设施。基于该架构的wylon新云Token工厂已在华东集群上线并开放测试,持续降低Token成本,不断拓展国产超节点系统的性能前沿。
从单点芯片到超节点集群,从模型训练到词元生产,从数字智能体到物理仿真——WAIC 2026的展台生动表明,国产算力正以“更快、更高、更强”的系统级姿态加速迈进,为万物智能的爆发筑牢坚实底座。