能源受限时代:重塑AI基础设施的战略思考
在能源受限时代,电力已成为AI发展的核心瓶颈。企业需将“每瓦性能”作为关键指标,通过优化基础设施设计与部署,才能有效驱动AI规模化增长并保持竞争力。
亚太地区人工智能领域的头条新闻,往往聚焦于那些宏大的数字:更庞大、更强劲的数据中心、更巨额的投资承诺,以及区域在追逐AI雄心上不断攀升的支出预测。
然而,在这些令人瞩目的数据之下,一个更为根本的问题浮现出来:该区域能否产生并供应足够的电力,以支撑其宏伟的AI抱负?
随着人工智能规模的不断扩张,电力正迅速超越资本和芯片,成为一个核心制约因素,这正在重新定义基础设施领域的领导力。
需求本身并非症结所在。有分析预测,到2029年,亚太地区(不含日本)数据中心的电力容量将达到约142,600兆瓦;同时,另有行业机构预计,到2030年,全球数据中心的用电需求将翻倍。
真正的瓶颈已不再是需求,而是供应。在主要市场中,电网连接的等待时间已超过四年,因此,获取可靠的电力正迅速演变为一项战略性的竞争优势。对于企业领导者而言,这使得原本属于设施运营层面的问题,上升到了企业战略的高度。
过去十年间,当人工智能需要更大规模的扩展时,解决方案往往是简单地增加资源:更多的加速器、更多的机架和更高的容量。
然而,面对电力供应的限制,这种做法反而会阻碍组织的发展。此时,更关键的问题在于每单位电力能够产生多少价值,而非仅仅关注可以部署多少计算能力。
换言之,“每瓦性能”正成为衡量AI基础设施最重要的指标之一。效率不再是可持续发展报告中的一个附注,而是决定组织在现有资源下能扩展多远的一个实实在在的因素。
这要求思维模式发生切实的转变,并带来真实的商业影响。面对日益上涨的能源成本,电力已然是许多数据中心最大的运营开支。因此,每一台服务器、每一个机架以及每一种散热方案的效率选择,都应该在董事会层面进行考量,而不仅仅局限于服务器机房。
那些能够从每一瓦电力中提取更多有效工作的组织,将拥有更广阔的增长空间。而将效率视为次要考量的企业,其发展选择可能比预期更快地受限。
政策导向与效率驱动
政策制定者已然划定了界线。2025年末,新加坡相关管理机构启动了第二轮数据中心申请(DC-CFA2),明确将至少200兆瓦的新增容量分配给那些能够满足区域内最严苛的能耗开销、设备效率和绿色能源标准的运营商。
与此同时,马来西亚已将其数据中心税收激励政策与能源效率和排放目标挂钩,作为其到2050年实现70%可再生能源和净零排放更广泛推动的一部分。
联想(Lenovo)也设定了到2050年实现温室气体净零排放的目标,该目标已通过科学方法验证。这使得本文所讨论的效率提升,与一个可衡量的承诺而非泛泛的愿景紧密相连。
优化工作负载:从训练到推理的战略转变
领导者可能犯下的最大设计错误之一,便是仅仅针对眼前的单一工作负载进行优化。
围绕人工智能的许多公共讨论,大多集中在大型模型训练上,尽管这任务计算密集,但通常以脉冲式爆发。然而,当组织从实验阶段转向实际部署时,推理工作负载将变为持续性的:例如模型响应客户咨询、验证支付交易,或指导工厂生产线上的流程。
虽然每个任务的耗电量可能较小,但其持续不断,日复一日地累积。以每次提示假设耗费一美分为例,一个拥有1000万用户、每天产生10次请求的服务,每日将在电力和计算上花费约100万美元。
有行业报告预计,到2027年左右,推理工作负载将超越训练,成为数据中心AI的主导型任务。这意味着,随着AI部署的日趋成熟,这项运营成本将持续攀升。
应对之道在于,将架构视为一项战略性决策,并针对工作负载的整个生命周期进行设计。
实践中,这意味着根据“每瓦性能”而非宣传的峰值速度来选择基础设施;根据持续的实际需求而非最繁忙的可能情况来规划系统规模;并让每项工作负载与其最适宜的运行环境相匹配。
工作负载的运行位置是领导者在成本、性能和能源使用方面最直接的控制杠杆之一。这预示着一种混合式策略的兴起。
大规模的训练任务应部署在具备密集计算能力和必要散热条件的场所。相反,推理任务则通常更靠近数据生成和决策制定的位置,包括边缘侧。
这种部署方式能够降低延迟、带宽使用量和电力消耗。同时,将工作负载更贴近数据源,也有助于组织应对区域内日益严格的数据主权和合规性要求。
没有唯一的正确环境,只有针对每项工作负载最适宜的环境。
正因如此,混合AI,即涵盖本地系统、边缘计算和公共云的架构,正成为企业默认的选择。将工作负载的部署位置视为一项深思熟虑的设计决策,而非默认选项,有助于在AI规模扩张的同时,有效控制能源成本和响应时间。
技术栈协同与创新散热方案
单一组件无法独立实现如此全面的效率提升。
真正的效率提升,源于芯片、系统设计、软件和散热方案的协同工程,每一环节都能缓解其他环节的限制。有意义的进展,依赖于芯片制造商、基础设施供应商以及AI部署组织之间在整个技术栈上的紧密协作。
散热已从数据机房的后端转移到基础设施战略的核心。企业希望将更多的可用电力和预算,用于支持AI业务增长,而非仅仅是为设备散热。
随着AI机架运行温度升高,传统风冷技术逐渐触及极限。利用风冷保持高密度机架的凉爽,需要更多的风扇并更依赖冷却器。这些辅助设备会增加计算设备本身功耗之外的额外能耗。
因此,降低散热开销是提高数据中心效率最快速的方法之一。
海王星温水冷却技术(Neptune warm-water cooling)展示了这一实践方案。通过将温水直接循环至最热的组件,该技术减少了传统风冷数据机房所依赖的、高能耗风扇和冷却器的需求。
联想(Lenovo)方面的数据显示,这项技术与同类风冷系统相比,可将数据中心功耗降低高达40%。这些节约的能耗主要来源于散热环节——即更少的风扇和无需冷却器,而非服务器在执行相同工作时消耗的电力减少。
在某些系统中,这能将电源使用效率(PUE)降至1.1,低于传统设计的典型水平。亚太地区的许多气象机构、大学和研究机构已经采用了这类系统。
当整个技术栈都以效率为核心进行设计时,所带来的节能效果将是可观的累积。
效率:AI时代的核心竞争力
这种转变还带来了环境红利。更低的能耗意味着更少的排放,这有助于组织应对区域内日益严格的信息披露要求。
然而,效率之所以在企业议程中日益凸显,其更直接的原因在于:当电力供应受限时,无论当地的能源结构如何,效率是确保增长得以持续的关键。
商业考量和环境效益在此方向上殊途同归。
亚太地区还拥有一个关键优势:该区域大量具备AI能力的容量正在新建之中,这使得效率可以在基础设施建设之初就被融入设计。
那些能够脱颖而出的领导者,将是善于精明投资而非仅仅增加支出的企业。他们将把基础设施视为一系列关于效率和工作负载部署的决策,而非单纯的产能竞赛。
在人工智能应用的下一阶段,竞争优势将不再来源于部署最多的基础设施。它将源于从每一瓦电力中榨取最大价值的能力。
当电力而非雄心成为稀缺资源时,那些能最大化利用每一瓦电力的组织,将最有能力实现规模化发展。