我国算力基础设施再跑出世界级应用成果-伯乐网络传媒

我国算力基础设施再跑出世界级应用成果

中国算力基建的宏大叙事,迎来新一轮价值兑现周期。

9月15日,位于郑州的国家超算互联网核心节点传出重磅消息——我国自主研发的数值模式与国产计算系统协同攻关,在全球公里级数值预报领域取得突破性成果,模拟精度超越当前国际主流全球业务预报系统,正式迈入全球第一梯队。

面对高精度全球气象数值模拟带来的海量计算、通信、存储和数据交换压力,曙光8000基于异构计算和系统工程能力,携手中国气象局地球系统数值预报中心成功完成MCV全模式异构移植与规模化运行,为该成果从科研验证走向业务应用提供了有力支撑。

超大规模算力新基建方兴未艾,国产大算力再次在科学应用最前沿交出价值答卷。从“建”到“用”,当国产大算力挺进国家级业务系统,算力供需两侧的叙事逻辑正在全面升维。

大算力基建,迎来成果兑现期

自2020年以来,算力基础设施被正式纳入新型基础设施范畴,随后全国一口气设立了8大算力枢纽节点和10个国家数据中心集群,中国大算力基建正式进入体系化布局阶段。

近几年,AI时代大幕彻底拉开,需求驱动力暴涨,超大规模算力基建步伐一再提速。根据最新公布的《信息通信行业发展“十五五”规划》,未来要构建“枢纽-区域-边缘”多层次算力设施体系,有序部署万卡、十万卡及以上智算集群,面向场景按需部署推理算力设施。

数据显示,截至今年7月,全国算力总规模已达到277万PFLOPS(FP16),稳居全球前列。算力规模持续扩大的同时,算力基建也正在从“铺摊子、上规模”向“提质量、增效能”加速转变,其整体能效水平、利用效率、服务能力和成果转化展现出量质齐升的新趋势。

在此过程中,以中科曙光为代表的国产大算力玩家,在算力集成规模和应用价值转化上跑出双重加速度。其中,曙光8000作为国内首套采用原生超智融合路线的全国产十万卡AI超集群,不仅具备全链路全自研AI基础设施能力,更在算力应用层曝出多项世界级成果——蛋白质折叠模拟、万亿原子级水分子动力学模拟百万亿网格湍流模拟等。

此次曙光8000助力自主研发的MCV数值模式实现1小时内完成全球5公里分辨率、未来10天的预报计算,达到国际主流业务时效标准,一方面标志着我国自主高精度数值模式的天气预报能力赶超欧美日等国际一线水平,另一方面也预示着曙光8000等国产大算力系统正在加速成果兑现,进一步拉近算力与先进生产力的距离。

最难的考题,交出最亮眼答卷

在算力规模扩张与实际应用中,并非简单的算力越大、越强、越好用的正向关系。尽管近年来大规模算力集群并不鲜见,部分单一计算架构路线跑分成绩亮眼,但在纷繁复杂的异构计算场景压测下,国产算力精度、计算能效以及兼容适配度等实战能力,仍然面临着严峻考验。

比如在气象领域,数值预报的每一次代际跃迁,本质都是“算法范式+计算机性能”双轮驱动的产物。尤其极端天气背景下,精细化预报需求提升,数值预报必须在更高分辨率、更短时效、更强稳定性间寻求平衡,单纯堆砌CPU资源已经难以满足算力、能效与时效要求。

今年,《全国气象发展“十五五”规划》提出要建成新一代地球系统数值预报模式,实现天气-次季节-季节-年际-年代际尺度无缝隙全覆盖,全球模式分辨率达到5公里、可用预报时效延长至9天,区域模式实现全国1公里、重点区域500米分辨率,气候尺度25公里分辨率。

随着考题越来越难,我国自主研发的MCV数值模式向通用、可扩展和高性能方向加速演进,并对底层算力规模、软硬件协同与超智融合的异构计算能力提出了系统性要求。

在此背景下,中国气象局地球系统数值预报中心基于MCV的下一代大气模式,在曙光8000的十万卡超智融合算力支持下成功完成GPU全模式异构并行移植。测试结果显示,系统优化后的计算资源利用率有效提升10%,通信模块算法加速3.7倍,I/O性能大幅提升约30倍。

在全球5公里计算时效达标后,双方进一步完成了全球3公里分辨率模拟试验,为更高分辨率的研究奠定基础。

此外曙光8000不仅完成MCV模式动力、物理、插值的异构化改造与代码整合,还成功实现“一套代码、两种运行”,在异构计算高难赛道交出一份满分答卷。

系统化跃迁,撬动规模化应用

面向气象领域尖端应用需求,国产大算力正跑进国家级业务系统,用同一套底座承载起传统HPC数值预报与气象AI大模型核心负载,推动先进计算在重大科研场景中的规模化应用。

显然,这依靠的绝非单纯的卡数堆叠。业内人士指出,曙光8000能够率先成为下一代数值预报的算力底座,主要在于其软硬件全栈的系统性优化和工程落地能力。

在硬件层,该系统具备全精度CPU+DCU原生超智融合算力,采用6款国产芯片支撑全系统运行,并实现芯片、计算、存储、网络、散热全链路国产化。

其中,ParaStor分布式存储支撑大模型训练和科学计算中的海量数据读写,并在全球IO500生产型榜单中获得双榜第一;自研400G无损网络scaleFabric端到端时延低至0.9微秒,单子网可支持超11万卡部署;浸没相变液冷技术则将PUE降至1.04业界极值,可支撑单机柜MW级高功率密度部署。

更关键在于,曙光8000基于AI计算开放架构,在软件层实现了广泛兼容和全场景覆盖,将算力价值直抵用户核心需求场景。比如,该集群系统完整兼容主流AI软件生态,用户原有GPU命令参数可直接复用,一套代码平滑迁移,大幅压缩了部署成本和项目周期。

此外,曙光8000与PyTorch、TensorFlow、飞桨等AI框架、科学计算库完成了全面适配,并成功移植了180多个行业应用、500多个大模型,覆盖30多个应用领域。这也意味着,这套算力底座仍在不断强化其场景通用性,进而有效撬动国产大算力的规模化普及。

据介绍,曙光8000目前已接入国家超算互联网平台,面向全国科研和产业用户提供服务。平台现已汇聚超350万CPU核、25万张加速卡,累计用户超过140万。包括大模型、机器人、创新药、新材料、量子计算、天文气象等领域,超过70项应用实现了万卡规模扩展。

从产业界到科学界,从系统化跃迁到规模化应用,随着先进算力的价值边界持续扩张,中国算力基础设施兑现的可能不止是应用成果,更是站稳全球算力产业价值链的核心竞争力。

作者:方昶

本文仅代表作者观点,不代表本刊立场。

在线客服
在线客服
热线电话
QQ客服