top of page

AI 推理正取代训练,成为数据中心基础设施的主要考验

Google 基础设施负责人 Anahita Mouro 指出,最新 Google 新闻背后出现了一场新的冲突:AI 基础设施正从模型训练转向持续推理。这一变化听起来很技术化,却颠覆了近期数据中心投资背后的许多假设。训练适合运行计划性任务的超大规模集群;推理则必须以可靠、快速的方式应对不可预测的用户需求量。

Mouro 专注于 Google 超大规模基础设施的现场性能与流程卓越管理。她以个人身份对 W.Media 表示,基础设施已成为 AI 的发展节奏制约因素。更快的芯片无法解决电网接入延迟、冷却能力不足、故障切换系统薄弱或运营不可靠等问题。

这一警示之所以重要,是因为推理正成为 AI 的商业核心。Gartner 预计,全球 AI 优化基础设施服务支出将在 2026 年达到 423 亿美元。该机构还预测,推理支出将达 233 亿美元,超过训练所获分配的 190 亿美元。

这一转变构成了本文的核心张力。AI 公司希望更快部署、更迅速响应的产品,但物理基础设施仍遵循公用事业、建设和审批的时间表。澳大利亚拥有具吸引力的土地、能源资源、技术人才,以及进入亚太市场的条件。然而,只有当项目能够接入电力并作为可靠的生产服务运行时,这些优势才真正有意义。

Google 新闻背后发生了什么变化

AI 基础设施的主要工作负载正从一系列孤立的训练项目,转变为全天候运行的服务。

训练利用大量数据创建或更新模型。运营商可以为这些工作负载安排计划、暂停运行,或在故障后从保存的检查点重新启动。这个过程消耗大量算力,但大多数训练故障不会被终端用户察觉。

推理则不同。每当训练完成的模型生成答案、分类信息、创建图像、推荐行动或操作软件时,推理便会发生。推理请求延迟或失败,会立即演变为产品问题。

Mouro 在她的基础设施访谈中,将这一转变描述为从训练园区走向现实世界部署。她认为,推理需要具备关键性面向消费者服务所要求的生产级运营纪律。

市场数据支持这一方向。Gartner 的推理支出预测称,推理将在 2026 年占 AI 优化基础设施服务支出的 55%。预计到 2027 年,这一比例将升至 59%。

这些数字比 Mouro 引述的一项预测更为保守,后者预计到 2028 年推理将占 AI 基础设施支出的 80% 以上。由于预测口径不同,这些百分比不应被视为可直接互换。尽管如此,两者都表明,生产环境的使用正在改变基础设施优先级。

这一转变也改变了需求的表现方式。训练集群可在计划运行期间以较高且相对稳定的负载工作。面向消费者的 AI 服务则要应对白天高峰、突发流量、区域差异,以及热门功能带来的意外需求。

同一个模型在一次训练后可产生数十亿次推理操作。每个聊天机器人的回答都可能需要多次模型调用,包括检索、推理、安全检查和响应生成。一个 agentic AI 系统在完成一次用户请求时,可能会产生更多调用。

Agentic AI 指能够规划并执行多个相互依赖行动的系统。一个 agent 可能会搜索数据库、调用应用程序、检查结果,再调整下一步行动。每一项行动都会引入新的延迟与可靠性依赖。

这使总响应时间更难控制。被称为尾部延迟的最慢请求变得更重要,因为延迟会沿着链路不断累积。一个由多个可接受步骤组成的工作流,仍可能因最慢响应叠加而让人感觉无法使用。

因此,最新 Google 新闻并不只是关于建设更多服务器容量。它标志着从提供算力,转向将 AI 作为可靠、互动式服务来运营。这一区别决定了哪些设施、网络和运营模式能保持竞争力。

推理将可靠性置于原始集群规模之上

训练奖励集中式算力,而推理奖励系统每一层都能提供稳定服务。

近期的基础设施竞争一直聚焦于加速器、机架密度和训练集群规模。这些指标依然重要,但它们无法反映 AI 产品能否在真实客户流量下实现可预测响应。

推理服务所依赖的不只是加速器。请求还需穿过网络设备、存储系统、模型服务器、负载均衡器、安全服务和外部应用。冷却、配电、监控和故障切换系统必须支撑整条链路。

Mouro 将生产级推理描述为:负载均衡器后方的冗余服务器,并配套健康检查、监控、经过测试的故障切换与灾难恢复。这些都是常见的 Web 服务实践,但 AI 为其带来了新的运行条件。

AI 加速器会产生集中的热量,并可能造成电力需求快速波动。在高机架密度下,液冷比许多传统风冷系统更高效地转移热量。但它也增加了泵、分配设备、控制系统和潜在故障点。

波动的推理流量进一步复杂化了设施规划。运营商必须为峰值需求配置足够的电力和热容量,同时避免在较为平静的时段浪费过多能源。动态电力管理不再是可选的效率项目,而成为运营要求。

网络同样变得重要。训练通常依赖于单一紧密连接集群内部的超高速通信。推理则需要在用户、区域设施、数据库、云服务和外部工具之间实现快速响应的连接。

面向客户的助手可能因延迟或数据驻留原因而需要本地处理。模型可能运行在一个区域,而业务信息仍留存在另一个环境中。这种架构会在速度、主权、成本和运营控制之间形成权衡。

Uptime Institute 的 2025 年运营商调查说明,当前策略仍相当未定型。近三分之一的受访运营商表示同时支持 AI 训练和推理。在 95 名受访者中,64% 使用同一套基础设施处理两类工作负载。

共享基础设施提供了灵活性,但也可能掩盖相互冲突的需求。训练强调加速器利用率和集群吞吐量;推理则更重视可用性、可预测的延迟、地理覆盖范围和处理不规则需求的能力。

该调查还发现,韧性实践存在差异。在报告拥有推理基础设施的组织中,48% 使用具备冗余组件、可同时维护的系统。仅 23% 表示采用了具有 2N+1 冗余的完全容错配置。

这些结果并不能证明现有设施不足。不同工作负载有不同的服务要求,而额外冗余会增加成本和能源开销。但它们确实表明,行业尚未就单一推理架构达成共识。

运营商面临艰难平衡。过度冗余可能让 AI 服务变得不必要地昂贵;韧性不足则会使用户暴露于中断风险,并将基础设施故障变成可见的产品故障。

这正是 Mouro 的警示改变竞争衡量标准的原因。胜出的设施未必拥有最新的加速器或最大的机房,而是能够将可用硬件、电力、冷却和网络转化为可靠的面向用户输出。

真正的冲突是芯片速度与基础设施时间

芯片性能按产品周期进步,而电网、变电站、审批和数据中心建筑则按实体开发进度推进。

Mouro 的核心观点是,基础设施已成为 AI 的发展节奏制约因素。每一代加速器都能提高吞吐量或每瓦性能。然而,当设施缺乏电力、冷却能力或及时的电网接入时,这些提升的价值有限。

电力需求已在改变国家层面的规划。美国能源部在其电力需求展望中估计,数据中心在 2023 年消耗了 176 太瓦时电力,约占美国总用电量的 4.4%。

该部门预计,到 2028 年,用电量将介于 325 至 580 太瓦时之间。在这一范围内,数据中心将消耗约占美国电力的 6.7% 至 12%。这一宽泛区间也揭示了部署和效率方面存在的重大不确定性。

全球预测也指向同一方向。国际能源署的能源分析研究了扩大 AI 部署相关的电力需求、电网影响、能源安全和排放问题。其核心观察很简单:AI 服务需要实体电力基础设施。

发电只是挑战的一部分。一个地区可能拥有丰富的可再生能源资源,却缺乏某一特定地点所需的输电线路、变电站和接入容量。可用能源并不自动等于可交付电力。

大型客户往往需要在运营前数年就与公用事业公司协调。开发商还需要土地、许可、水资源或替代冷却系统、变压器、备用设备和高容量光纤。任何一个环节延误,都可能推迟整个项目。

AI 不断变化的硬件周期带来了另一项风险。围绕某一代加速器设计的建筑,可能在客户需求已经变化后才投入使用。因此,冷却和电力系统需要具备适应性,同时避免变得不必要地昂贵。

这种冲突有利于模块化电力系统、灵活的冷却设计,以及能够支持不同加速器类型的设施。它也强化了软件的必要性:软件应能根据电力、温度、容量和服务要求分配工作负载。

硬件采购已开始按工作负载分化。领先的加速器对模型训练仍然很有价值。推理则可使用更广泛的组合,包括新一代 GPU、上一代硬件,以及专用集成电路,即 ASIC。

ASIC 是为较窄范围任务设计的芯片。对于适合的模型,专用推理硬件可以提供有吸引力的每瓦性能。然而,当软件要求或模型架构发生变化时,它也可能降低灵活性。

因此,基础设施挑战并不能通过选择某一种芯片来解决。运营商需要能够吸收硬件多样性的设施,同时维持一致的供电、制冷、网络、监控和可靠性标准。

这正是这则 Google 新闻更深层的含义。Google 的硬件专长很重要,但 Mouro 的论点将关注点从任何单一处理器上移开。更艰巨的任务,是跨越数代技术协调数百个相互依赖的系统。

芯片进步可以降低每次运算的能耗。但当更低成本鼓励更多 AI 活动时,使用量增长仍可能推高总用电需求。基础设施规划必须同时考虑效率提升和请求量增长。

效率提升并不能消除容量风险

更高效的推理可以缓解每次请求的压力,但并不保证总需求下降,也不意味着运营会变得更简单。

Google 已发布证据表明,软件、硬件和设施改进可以显著降低单次 AI 交互的环境成本。其 2025 年的单提示词研究称,12 个月内,Gemini Apps 文本提示词中位数的单次能耗下降了 33 倍。

该公司将大部分改进归因于模型效率提升和更好的机器利用率。Google 还报告称,其全机群电源使用效率为 1.09。电源使用效率用于比较设施总能耗与输送至计算设备的能耗。

这些数据为“效率并非静态不变”提供了有用证据。不过,它们仍是公司自行报告的测量结果,并不代表每一种模型、工作负载或数据中心。单提示词结果在缺少使用量数据时,也无法揭示总需求。

更高效的服务可能吸引更多客户,并支持更复杂的任务。智能体工作流可能会进行多次模型调用,而传统聊天机器人只会调用一次。更长的上下文、多模态输入以及反复使用工具,也会增加计算量。

这会产生反弹效应:每次运算的成本下降,但运算次数上升。即便每次响应变得更高效,总需求仍可能持续增长。

这种效应也使基础设施预测更加复杂。开发者必须估算采用率、模型效率、流量模式以及每项任务的模型调用次数。这些假设中的微小变化,都可能导致截然不同的容量需求。

政府电力预测范围之所以很广,正反映了这种不确定性。若效率提升快于预期,为激进需求规划的设施可能利用不足;若计划过于保守,当智能体采用加速时,客户可能面临容量不足。

运营复杂性也带来另一层不确定性。Mouro 表示,数字孪生可以帮助运营商在调整实际设施前,模拟电气、热力和网络行为。数字孪生是对物理系统及其运行条件的软件化表示。

数字孪生可测试制冷调整或负载突然上升将如何影响相连设备。预测性监控则可在事故发生前识别热失衡和故障切换风险。这些能力可以改善决策,但无法消除物理限制。

模型依赖准确的遥测数据和经过验证的假设。若模拟遗漏了异常设备行为,可能造成虚假的信心。运营商仍需进行调试、维护、事故分析、经过测试的恢复流程,并配备经验丰富的人员。

劳动力问题同样需要谨慎看待。高密度 AI 设施需要电气、热力、土木、网络、软件、安全和运营专家。快速建设可能压缩测试周期,而系统复杂性恰恰要求更严谨的验证。

Mouro 认为,随着部署加速,运营纪律必须保持完整。这一观点挑战了业内一种常见假设:更多自动化天然意味着可以更快交付。只有团队了解自动化的边界,并保留人类问责机制,自动化才能发挥作用。

因此,应以审慎的视角解读这则 Google 新闻。推理增长是可信的,但具体工作负载构成和容量需求仍不确定。投资者不应将每一个拟议的吉瓦项目都视为确定无疑的需求。

澳大利亚拥有机会,但电网接入决定条件

只有当开发商能够获得及时的电力、连接、许可和可预测的运营条件时,澳大利亚的战略优势才具备投资价值。

Mouro 指出,澳大利亚具备多项优势。该国拥有稳定的治理环境、技术人才、毗邻不断增长的亚太市场、适宜的土地,以及可观的可再生能源发展。这些条件能够支持区域推理服务和大型基础设施项目。

推理可进一步强化本地容量的商业理由。面向客户的应用受益于低延迟,而受监管机构往往需要更强的数据位置控制。澳大利亚设施可以服务国内用户,无需将每次交互都路由至遥远地区。

主权对于政府、医疗、金融和关键基础设施工作负载同样重要。本地处理可以简化部分数据驻留要求,并降低国际网络中断带来的风险。但这并不自动保证安全性、合规性或运营独立性。

约束首先来自电网接入。Mouro 表示,当一个项目面临长达数年的并网排队时,发电容量本身几乎没有商业价值。开发商既需要充足的电力,也需要一个可信的供电日期。

这种区别会改变选址决策。地图上最理想的地点,可能不如一个更不起眼、但拥有更快并网、现有变电站、合适光纤和更清晰规划规则的地点。通电时间成为竞争指标。

表后发电是一种可能的应对方案。这种安排将部分发电设施部署在客户侧的电表之后。它可以减少对延迟并网的依赖,但燃料、许可、排放、可靠性和融资问题依然存在。

灵活负载架构提供了另一种选择。当电网条件变化时,一些工作负载可以在不同时间或地点之间转移。训练任务通常比必须在客户需要时立即响应的面向用户推理拥有更大的调度灵活性。

这种差异限制了需求响应能够解决的问题范围。推理服务无法在电网受限时经常性地消失,否则将影响用户。运营商需要进行工作负载分类、配置备用容量,并通过合同区分灵活计算和关键服务。

澳大利亚的规划挑战也不止于单个项目。数据中心的集中增长可能影响输电投资、当地电力市场、土地使用、水资源政策和社区接受度。清晰的规则有助于开发商、公用事业单位和居民了解各项成本由谁承担。

稳定的政策很重要,因为基础设施资本会持续投入多年。短期激励无法弥补不可预测的许可流程或不确定的接入条件。投资者需要确信,设施能够跨越多个硬件和政治周期持续运营。

机会是真实存在的,但并非澳大利亚独有。其他亚太市场同样希望获得云区域、主权 AI 容量和基础设施投资。它们通过能源可用性、开发速度、连接能力、激励措施和监管确定性展开竞争。

因此,澳大利亚的优势将取决于执行力。已宣布的发电项目、可用土地和雄心勃勃的园区规划,并不等于可运营容量。已接入的兆瓦、完成的调试以及持续的服务可靠性,才是更有力的证据。

对于企业买家而言,这一区别会影响供应商评估。当交付日期取决于尚未解决的供电或建设工作时,供应商的加速器库存就没那么重要。买家应询问容量在哪里运行、如何接入,以及适用哪些韧性标准。

这则 Google 新闻将澳大利亚置于全球竞赛之中,同时也收窄了成功的定义。该国并非通过批准规模最大的项目集合而取胜,而是要将能源和工程资源转化为可靠、可投入生产的基础设施。

三项信号将显示推理转变是否真实发生

下一阶段应依据支出、已接入容量和可测量的服务表现来评判,而非仅凭基础设施公告。

第一个信号是分配给推理的 AI 基础设施支出占比。Gartner 预计,到 2026 年,推理将在 AI 优化基础设施服务中超过训练。更新后的预测和云公司披露将显示,这一交叉趋势是否持续。

推理占比上升将强化 Mouro 的论点,即生产工作负载如今决定投资优先级。若出现逆转,则表明前沿模型训练仍比当前预测所暗示的更加占据主导地位。

应谨慎衡量这种区别。云服务商可能以不同方式分类混合型集群,同一硬件也可以同时支持两类工作负载。在可能的情况下,有价值的披露应区分训练、微调、批量推理和交互式推理。

第二个信号是获得运营性电网接入的新容量规模。项目公告通常会引用未来的兆瓦或吉瓦数字。这些数字展现了雄心,但无法说明客户何时真正能够使用这些容量。

投资者和买家应关注公用事业接入协议、已完成的变电站、调试日期和已通电建筑。延误将强化“物理基础设施正在制约 AI 部署”的观点;更快的接入则会削弱近期瓶颈的论点。

澳大利亚项目提供了一个特别有用的测试样本。该市场既拥有显著的开发兴趣,也面临电网、许可和输电方面的问题。从拟议容量到已接入容量的进展,将显示其战略优势是否正在转化为执行成果。

第三个信号是智能体工作负载下的生产可靠性。供应商越来越多地讨论 token、加速器性能和模型基准测试。但这些指标无法完整反映多步骤智能体的使用体验。

更有用的指标包括端到端延迟、尾延迟、可用性、失败的工具调用、恢复时间以及流量峰值期间的表现。客户还应考察供应商是否为完整工作流公布服务级目标。

服务级目标定义了可衡量的可靠性或性能目标。对于智能体而言,该目标应覆盖完整任务,而不是单次模型响应。否则,单个组件可能各自达标,但用户的工作流仍然失败。

大规模稳定智能体服务的证据,将支持对分布式、生产级推理容量的投资。若持续出现延迟和不可靠的工作流,即使模型能力仍在提升,也会削弱对即时需求的预期。

这些信号也有助于区分结构性变化与宣传语言。支出表明客户购买了什么;电网接入表明开发商能交付什么;可靠性则表明基础设施能否产出可用服务。

更大的启示并不局限于数据中心运营商。开发者需要围绕多项依赖关系中的延迟和故障来设计应用。企业买家则需要在评估模型质量的同时,审视位置、韧性和工作负载经济性。

知识工作者应当关注这一点,因为基础设施决策会影响 AI 的可用性、速度、隐私与环境影响。一项在演示中运行良好的功能,当成千上万用户全天依赖它时,表现可能截然不同。

最新的 google news 为行业对硬件的执着提供了一个有益的纠偏。训练能力造就了当前这一代模型,但推理能力决定这些模型能否成为可靠的服务。

未来几个月,请关注支出结构、接入电力以及端到端可靠性。如果这三项都转向生产级推理,Mouro 的警告看起来将不再像预测,而更像一项运营要求。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page