
人工智能技术的不断发展,数据中心运营商正面临着保持设施温度适宜的挑战。这是一场伴随冷却后果的战斗。数据中心是最耗能的建筑结构之一,单位面积的能耗是普通商业办公楼的10到50倍,约占美国总电力消耗的2%。
预测,快速转向AI工作负载正在推动数据中心能源需求达到创纪录的高水平,AI任务的功耗是传统IT操作的10倍。高性能计算机架在不久的将来将需要每个机架100到120千瓦(kW)的功率。
专门设计用于处理AI工作负载的数据中心通常依赖于使用图形处理单元(GPU)的服务器,这种设备最初是为数字图像处理和加速计算机图形而设计的。这些系统的一个主要缺点是它们产生高热设计功率(TDP),意味着每个处理器、每台服务器和每个机架都会产生大量的热量。
人工智能的热影响
在运行AI过程时,GPU的功耗可能超过1千瓦,远高于传统的CPU,后者通常最多需要约400瓦,纯空气冷却对大多数AI服务器不起作用,因此需要液冷,液体比空气更好,因为它具有更好的特性,包括更高的热导率和热容。然而,液冷也存在成本较高、可靠性降低和实施复杂度增加等缺点。
基于GPU的服务器专为高性能计算设计,能够快速处理大量数据,AI集群在减少延迟、利用高带宽光纤连接、战略性部署服务器以及优化网络拓扑以减少数据传输距离时,会发挥最大的效率。大多数未来的数据中心将具有密集的机架,产生大量热量,并堆叠在多层设施中。
数据中心运营商面临的真正问题
数据中心运营商面临的真正问题不是冷却,而是能源管理,行业在有效冷却和管理大规模数据中心的冷却系统方面有着丰富的操作经验,AI数据中心运营商面临的主要挑战是GPU机架集群在服务器机架内的功率密度增加。冷却负荷多样化要求不仅要管理新的GPU机架,还要管理基于CPU的机架、存储和网络机架。因此,工程和规划必须考虑每种类型机架的冷却负荷特性。
追求可持续性
需求的增加,越来越多的数据中心运营商正在从传统的空气冷却转向结合液冷和空气冷却技术的混合冷却系统。这一变化是由于对大型AI GPU机架的需求增加,这些机架需要液冷才能有效地从其高核心数的处理器中去除热量。
为了推动可持续发展,建议将数据中心建设在可再生能源源附近。例如,靠近核电厂,那里电力丰富,安全性良好。
太阳能和风能通常被绿色倡导者提议作为解决方案,但由于新建数据中心的电力消耗通常超过500兆瓦,并且经常超过1千兆瓦,通常不被认为是可行的。更实用的方法是利用数据中心产生的热量。如果冷却液温度允许较高,则可以将数据中心产生的所有热量用于区供热,而液冷可以做到这一点。
其他替代方案
越来越多的AI数据中心正在设计成类似于电厂的形式。有些实际上正在废弃的电厂场址上建设,利用河流、湖泊和水库进行冷却,这些设施必须仔细设计和操作,但它们具有巨大的冷却能力,并且不消耗水。
当地气候也在数据中心冷却中发挥着重要作用。寒冷的地区越来越受到新建数据中心的青睐。较低的环境温度减少了所需的冷却量,因此也减少了AI数据中心所需的水或其他冷却液的需求,或者,可以使用闭环系统来节约水资源,因为它们减少了对外部水源的依赖。数据中心热回收系统还可以通过提供冬季供暖来减少整体电力需求。
AI驱动的冷却优化技术
AI驱动的冷却优化技术也开始在可持续数据中心运营中发挥至关重要的作用。通过部署机器学习算法来监控和管理冷却系统,数据中心可以根据实时热数据动态调整气流、液流和压缩机活动。这种自适应方法不仅防止了能源浪费,还通过保持一致和高效的冷却条件,延长了硬件的使用寿命,这样的系统甚至可以预测潜在的设备过热,采取预防措施,减少停机时间和额外的能源支出。
芯片尺寸和密度的限制最终将迫使数据中心运营商探索新的设计和材料,包括那些可能完全改变数据中心运营方式的设施。这将是多种因素和新技术的结合,帮助我们迈出计算能力的下一步,整个行业都非常有动力将这一目标变为现实——这也是为什么参与这个行业如此令人兴奋。
考虑到正在测试和评估的多种冷却方法,唯一可以确定的就是持续的不确定性。这有点像西部拓荒时代,充满了不确定性,但也充满了创新的机会。











