从东海之滨到云贵高原:一家金融企业的算力迁徙记

2023年深秋,上海张江某金融科技公司的CTO陈明远做了一个大胆决定:将核心交易系统的灾备机房从昆山迁至贵阳,并在当地托管2000组高性能GPU服务器,用于大模型训练。这个决定背后,是长三角企业应对“算力焦虑”的典型缩影——当东部沿海的数据洪流遭遇土地与电力瓶颈,一场静默的“算力西迁”正在发生。

一、上海之困:机柜里的“寸土寸金”

陈明远的困境颇具代表性。公司位于上海漕河泾的机房,单机柜月租已涨至8000元,且因能耗指标限制,新增机柜需排队18个月。更棘手的是,大模型训练所需的A100显卡集群,单机柜功率密度要求达到30kW,而上海多数存量机房的设计上限仅为8kW。“即便有钱,也找不到能‘喂饱’GPU的机柜。”他苦笑。

与此同时,贵阳却在另一端蓄势待发。作为“东数西算”国家枢纽节点,贵安新区规划了超100万个标准机架,电价仅为上海的60%,且气候凉爽,PUE(能耗效率)可低至1.2。更重要的是,当地政府为吸引算力需求方,推出了“算力券”补贴政策——每使用1P·Flops算力,补贴30元。

二、贵阳实践:从“冷数据仓库”到“热训练场”

陈明远的团队最初对贵阳的认知停留在“存储冷数据的仓库”,但实地考察后改变了看法。在贵安华为云数据中心,他们看到了一排排液冷机柜:服务器浸泡在特殊冷却液中,芯片温度稳定在45℃以下,满载运行时的噪音仅相当于图书馆翻书声。这正是大模型训练的理想环境——GPU集群需要7×24小时满负荷运转,任何散热波动都可能导致训练中断。

项目落地时,团队面临一个关键抉择:是采用传统风冷方案,还是冒险尝试液冷?贵阳当地服务商“云上贵州”给出了一个折中方案:混合冷却架构。即核心训练区使用液冷,边缘存储区沿用风冷,整体PUE控制在1.25以内。这个设计让陈明远眼前一亮——“这既满足了GPU的散热需求,又避免了对老旧机房的过度改造。”

三、高防之盾:当“算力”遇上“攻击”

迁移并非一帆风顺。上线第三周,公司遭遇了一次流量高达2.4Tbps的DDoS攻击,攻击源IP分散在37个国家。若是放在上海,这足以让业务瘫痪数小时。但贵阳的高防机房展现了不同韧性:依托本地骨干网节点的流量清洗能力,攻击流量被实时分流至黑洞路由,仅用47秒便完成清洗,业务零中断。

“贵阳的高防优势常被忽视。”陈明远在复盘会上指出,“这里虽然远离国际出口,但国内骨干网带宽充裕,且攻击流量多来自境内僵尸网络,贵阳的清洗节点反而更近。”此外,机房配备的异构防火墙集群(基于FPGA和ASIC芯片)能识别加密流量中的恶意载荷,这在金融行业尤为重要。

四、成本账背后的“隐性红利”

一年后,陈明远算了一笔总账:整体运维成本较上海下降38%,其中电费节省52%,人工成本下降20%(贵阳本地工程师薪资约为上海的一半)。但真正的惊喜来自业务层面——大模型训练周期从原来的45天缩短至32天,因为GPU集群可以持续稳定运行,不再受限于上海的“峰谷电价”和“限电通知”。

更深远的影响在于人才结构。公司贵阳分部招聘了12名本地算法工程师,他们毕业于贵州大学、贵州理工学院,虽然缺乏一线大厂经验,但学习速度极快。“上海团队负责模型架构,贵阳团队负责数据清洗和调参,两地协同开发效率反而更高。”陈明远说。

五、启示:算力迁徙不是“搬家”

如今,陈明远常被同行问及“迁移是否值得”。他的回答是:“这不是把服务器从A搬到B,而是重新思考算力与地理的关系。”上海的价值在于金融生态、人才密度和低延迟交易通道,贵阳的价值在于能源、气候和成本。两者并非替代关系,而是各司其职——上海保留实时交易系统,贵阳承载训练和灾备。

在贵阳的机房里,那些曾属于黄浦江畔的GPU集群,正安静地吞吐着数据。而陈明远的手机里,实时监控大屏显示着两地机房的延迟曲线:上海到贵阳的专线时延稳定在9毫秒,足够支撑异步训练任务。这9毫秒,丈量着中国算力版图的重新布局,也丈量着企业从“成本焦虑”走向“价值重构”的勇气。

在线客服