×
首页 首页 IT数码 产业 查看内容
发表文章
分享

谷歌 TPU AI 基建规模迈入 100 万级,核心瓶颈从“缺芯”转向“缺电”

发布者: IT007编辑01| 2026-9-16 08:31| 查看: 175| 评论: 0|原作者: 故渊|来自: IT之家

摘要: 在 SEMICON Taiwan 2026 活动中,谷歌宣布其 TPU 系统已扩展至 100 万芯片级规模,而电力供应成为 AI 基础设施扩张的核心瓶颈。

9 月 16 日消息,在 SEMICON Taiwan 2026 活动中,谷歌宣布其 TPU 系统已扩展至 100 万芯片级规模,而电力供应成为 AI 基础设施扩张的核心瓶颈。


注:这里的“100 万芯片级规模”是指谷歌的 TPU 互联架构(包括网络拓扑、通信协议、软件栈等)已经能够支持将最多 100 万颗 TPU 芯片连接成一个统一的计算集群,实现协同工作。


该技术能力的突破,意味着超大规模 AI 模型训练可以跨越多个数据中心、多个 Pod 进行分布式训练,而电力供应(而非芯片数量)已成为限制进一步扩张的核心瓶颈。


在题为“思维的物理学和智能的架构”活动演讲中,谷歌首席技术官阿明 · 瓦赫达特(Amin Vahdat)指出,随着 AI 模型规模不断扩大,制约扩张的核心瓶颈已从芯片本身转移至电力供给,AI 算力的天花板正在从“造不出芯片”变成“找不到电”。


瓦赫达特还称 AI 已经进入“智能体人工智能”时代,交互模型正在从人机交互转向“智能体与智能体”的自动化对话,这将推动人工智能应用呈指数级增长,并创造几乎无限的全球计算需求。


他将工业革命描述为一场“肌肉倍增器”革命,而人工智能则是一场“大脑倍增器”。人工智能不仅仅是自动化现有工作,更是让以前不可能完成的任务成为可能。未来,每个病人都能拥有医生,每个学生都能拥有老师,过去需要十年才能取得的科学进步,一年之内就能完成。


谷歌和 Anthropic 达成的合作协议涉及高达 100 万颗 TPU 芯片,总计算功率超过 1 吉瓦。根据协议,从 2027 年开始,谷歌将为 Anthropic 提供 3.5 至 5 吉瓦的 TPU 算力容量,这笔交易价值高达 400 亿美元。


除了谷歌之外,其他科技巨头也面临类似的电力瓶颈问题。报道指出亚马逊正在购买额外 200 万颗 Nvidia 芯片用于其 AI 基础设施建设,但电力供应短缺正成为全球 AI 数据中心扩张的共同挑战。


在技术规格方面,谷歌的 Ironwood TPU(TPU v7)每芯片提供 4,614 TFLOPS 的 FP8 计算能力,9,216 芯片 Pod 可提供高达 42.5 Exaflops 的计算性能。该芯片配备 192 GB 高带宽内存,带宽达 7.37 TB/s,功耗效率比前代 Trillium 提升 2 倍。


在今年 4 月召开的 Cloud Next 大会上,谷歌发布第八代 TPU,分为 TPU 8t(训练专用)和 TPU 8i(推理专用)两种架构。TPU 8t 超级 Pod 可扩展至 9,600 芯片,共享 2 PB 高带宽内存,提供 121 ExaFLOPS 的 FP4 计算能力。

AI 解读

AI扩张卡在电上

  • 谷歌TPU互联架构能连100万颗芯片,但电力成了新瓶颈。
  • Anthropic协议用100万颗TPU,总功率超1吉瓦,2027年起供3.5至5吉瓦。
  • Ironwood TPU每芯片4614 TFLOPS,9216芯片Pod算力42.5 Exaflops。
  • 第八代TPU分训练和推理,TPU 8t超级Pod可扩至9600芯片。


以前大家担心买不到芯片,现在更愁的是电不够用。谷歌TPU能连100万颗,说明芯片互联技术不是问题,但这么多芯片一起跑,耗电量巨大。


Anthropic那笔交易里,100万颗TPU总功率超过1吉瓦,相当于一座大型发电站的输出。2027年起还要供3.5到5吉瓦,这已经是一个中型城市的用电规模。


对普通人来说,AI服务可能因为电力紧张而涨价或限流,但长期看,电的问题解决后,AI应用会更普及,比如医疗、教育这些领域。


AI算力竞争,下一步看谁有电。

以上内容由 AI 依据原文补充生成,不代表本站观点,仅供参考。

本文导航

最新评论(0)