站在成排机柜与算力系统前,“超级计算机”不再只是一个表示速度的名词。它的“超级”,既体现在大量 CPU、GPU 或其他加速器提供的并行计算能力,也体现在高速网络、分布式存储、系统软件和统一调度共同构成的整体系统能力。
在何老师的介绍下,我们了解到,单个计算芯片很强,并不等于系统就能高效运行;只有计算、通信、存储和调度相互匹配,海量硬件才能形成真正可用的算力。目前,深圳超算搭载全国产的操作系统和软件,已经用于物理科学,地理科学,生命科学等多个领域的模型模拟和科研辅助,为国产科研提供算力支撑。此外,与传统超算相比,深圳超算除了提供高性能计算服务,也支持本地部署大规模计算任务,为国产大模型的训练和性能测试提供高质量算力。
随后,我们步入机房,参观了初代面世便荣获世界Top500超级计算机第一名的灵晟超级计算机,和传统印象中管线交错,风扇轰鸣的机房不同,深圳超算的机房显得安静而整洁。通过讲解我们了解到,这得益于深圳超算先进的液冷系统和多方面的精妙设计:高效的液冷冷却系统避免了风冷带来的噪音,而精巧的“三明治”式刀片设计,与正交式的走线设计,则进一步优化了设备运行效率,减少了能耗。
除却硬件设计,超算平台的软件设计同样精妙。我们了解到,平台采取统一调度方式,减少等待、空转和重复搬运造成的浪费。无论是用户按需申请,还是Slurm等调度器将短作业回填到大作业等待间隙,以及一些更复杂的软硬件协同优化的复杂逻辑,都是提高效率、避免过度浪费的手段。
最后,在与老师的交谈中,我们了解了超级计算机在AI方面的应用前景。
与单机或零散服务器相比,超算部署 AI 拥有独特优势:海量异构节点可支撑更大模型、更大数据集和更高吞吐;统一调度使传统模拟任务与 AI 任务共享算力,并通过队列、配额和编排提高利用率。当然,大规模部署也必须面对并行效率、通信拥塞、能耗、软件兼容和资源公平等挑战,只有在算法、系统与硬件三个层面协同设计,规模优势才能真正转化为效率和产出。这进一步深化了我们对软硬件协同发展的应用与理解。
离开超算时天色尚亮,据说,这里的楼宇如同一只向天展望的巨眼,在晚上灯光璀璨,照亮前路。