抢电、圈地、对赌,深聊科技巨头的千亿美元AI能源大战

首页 > 科技

抢电、圈地、对赌,深聊科技巨头的千亿美元AI能源大战

来源:海底探探 发布时间:2024-05-15 16:32

文 | 硅谷101

听说,OpenAI训练GPT-6的时候,把微软电网给搞崩了?小伙伴们,你们有没有想过,生成式AI军备竞赛持续之际,AI会有多耗电吗?

OpenAI训练GPT-3大概消耗了1300兆瓦的电力,如果将这些电用来看网络流媒体视频,可以播放1625000小时,也就是185.5年

我们再换一个方式呈现,研究人员发现,将大模型用于AI文生图,平均下来天天生一张图片的耗电量,就能把一个手机充满。

再来一个宏观点的例子,我们做这期视频的2024年,全美AI数据中心的耗电量将占据全美总用电量的2.5%。

但这,只是开始。硅谷的科技的大厂们:英伟达、谷歌、微软、亚马逊、Meta、特斯拉、甲骨文等一众巨头开始搭建大型数据中心之际,OpenAI直接联手微软打造了耗资1000亿美元的数据中心“星际之门”(Stargate)。

随着上万张GPU显卡集群成为训练生成式AI的标配,硅谷开始卷多模态大模型,Scaling law(规模法则)依然是万能解药,可想而知,耗电量会指数级上涨。

欢迎大家来到硅谷101,这期内容我们就来聊聊,AI发展将会带来的能源挑战。首先我们来回答一个问题:为什么训练大模型会如此耗电。

01 为何生成式AI如此耗电?

1961年,为IBM效力的物理学家Rolf Landauer提出了Landauer"s Principle(兰道尔原理)

指出计算机中存储的信息发生不可逆的变化时,系统的熵会增加,且伴随着能量的耗散。简单来说,处理信息是有能量成本的。

1.1 AI训练与推理:处理信息能量成本

自从生成式AI确立使用Transformer架构并遵循“Scaling law”用巨量参数以来,AI大模型和“大量计算”就绑定在了一起。这就意味着,大模型运作中的“训练”(Training)和“推理”(Inference)都会涉及大量计算和信息处理,或者说,巨大的能量成本。

前者,在训练阶段,AI大模型需要收集和预处理大量的文本数据,然后初始化参数,处理数据,生成输出,调整,优化等等,而且随着模型的迭代,需要处理的参数是指数级别的增长:GPT3是1750亿个参数,GPT4是1.8万亿个,GPT5可能会突破10万亿参数,而传说正在训练的GPT6则可能数百万亿甚至千万亿参数的量级。

而硅谷顶级孵化器YC的前总监Kyle Corbitt在他的推特上爆料说,他在跟一个微软工程师聊天时,对方告诉他GPT-6的训练曾经让微软电网超负荷崩溃,所以无法在同一个州部署超过10万颗H100的GPU。

电网为什么会崩溃我们稍后会解释,但这里想跟大家说的是,可见训练GPT-6的耗电有多么可怕。而在训练完毕之后,“推理”同样需要非常大的算力和电力支持。

徐熠兴(Ethan)

微软能源战略部资深项目经理

我的理解是现在我们还处在就是AI训练大模型的一个阶段,这些模型训练出来之后,它之后的应用,它的推理应用等等,那才是最大消耗能源的地方,那用电量的话可能要比你训练那几个月AI模型的用电量要大的多的。

我们知道,Transformer是自回归模型,这意味着推理过程中涉及多轮重复计算;而在之后的生成阶段,天天生一个token,都需要与显存进行数据交互。

我们在开头说了,一张AI文生图的平均耗电量是能把手机充满电的电量。而聊天应用ChatGPT每天响应约2亿个需求,消耗超过50万度电力,相当于1.7万个美国家庭平均一天的用电量。

所以,无论是训练仍是推理阶段,模型的参数目越大,需要处理的数据越多,所需的计算量就越大,消耗的能量也就越大,释放的热量也越多。而反过来,这又需要更强大的芯片,这样的追求是无止尽的

John Yue

Inference.ai创始人兼首席执行官

我个人感觉他这对这芯片的要求应该是没有尽头的,就比如我training(训练)一个东西我6个月,那我竞品可能说OK,那我多买几个GPU吧?我三个月,那他三个月,我现在就要两个月,那我两个月,他就要一个月,那这个东西其实是没有尽头的,因为大家总想要更快。

更快,更大,更强。

这对AI芯片提出了更高的要求。为了支撑起如斯巨大的计算量,科技巨头们纷纷建起了自己的数据中心Data Center(数据中心),将上万GPU互联互通,来支持AI大算力。

如果说AI训练和推理产生的能量是冰山一角的话,那么数据中心本身的耗电才是埋在海中的巨大冰山

而再往深一步说,更大的能耗还来自于芯片上的电流,以及整个数据中心配套举措措施。

1.2 万卡Data Center:焦耳定律和冷却系统的吞电狂魔

我们都知道,AI算力靠的是GPU芯片的并行计算。在每个芯片中,如今有着以亿为单位的晶体管,比如说,英伟达最近发布的Blackwell架构GPU就拥有2080亿个晶体管。这些晶体管在运转时,就会产生电流。回顾一下物理学的焦耳定律,电流通过这些晶体管产生的热量跟电流的二次方成正比,跟导体的电阻成正比,跟通电的时间成正比(公式:Q=I²Rt)。

所以,万亿参数的AI大模型训练与推理,运行在上万GPU芯片上的千亿晶体管上,所产生的耗电和热量,可想而知。

除了芯片上本身的能耗之外,数据中心还涉及到冷却系统的大量能耗。在数据中心的能耗上,有一个评估的衡量指标叫“电力使用效率”(Power Usage Effectiveness),简称PUE,也就是消耗的所有能源除以IT设备能耗的比值。PUE这个指标越接近1,数据中心浪费的能源越少。

根据数据中心标准组织Uptime Institute的报告,2020年全球大型数据中心的平均PUE大约是在1.59。也就是说,数据中心的IT设备每消耗1度电,配套设备就会消耗0.59度电。其中,大部分的这些配套能耗是被用于冷却系统,在很多数据中心,冷却系统能耗可以达到总能耗的40%

因此,最近几年,随着生成式AI赛道的起飞,科技大厂们迅速圈地大兴修建新AI数据中心。巨头们并不在乎电价,而“哪里有电”,成了它们在乎的问题。

John Yue

Inference.ai创始人兼首席执行官

就是因为我们原来设计Data Center(数据中心)的时候,大家其实没有考虑数据中心需要用到这么多电,它都是考虑到我的这个带宽什么的,它会建在离这种ISP(网络业务提供商)近一点的地方,这样保证它这个带宽有优势。但是现在就发现我们其实是这个需要离电近一点,不是需要离带宽近一点,就是如果你要建这个,就是这种accelerate compute(加速计算)的这种数据中心,像他这种32,000张GPU的话,那其实对带宽要求远远不如对电的这个要求啊。

陈茜: 所以建在电便宜的地方?

John Yue

Inference.ai创始人兼首席执行官

不是,现在已经不是考虑电便宜不便宜了?现在就没有电。嗯,现在是你要看Data Center这一层人,大家在干的事都是shopping for power(购电)。就是你哪块开一个很大的电站,立马就有人赶紧去把那块地先给建个Data Center(数据中心)。

Bank of America最近发布给机构客户的一份研报上认为,2023年到2028年期间,全球数据中心的能耗会以每年百分之25到33的复合增长率快速飙升。

徐熠兴(Ethan)

微软能源战略部资深项目经理

AI其实它对一个国家的经济也是非常重要的,就比如说一个很粗略的一个评估了,就是每一兆瓦的AI的这个数据中心的这个负荷,大概能够带来1000万美元左右的年收入,如果是一兆瓦时的话,它的成本可能只有30美元到50美元左右。所以这是非常高的一个经济效益。所以这也是为什么,所有的科技公司都不管这个电价有多高,只要有电,那我就愿意去建(数据中心)。

如斯有利润潜力的高回报生意,巨头们如何不押注?国际能源署(IEA)发布的一份报告显示,2022年全球数据中心、人工智能和加密货币的耗电量达到460TWh,占全球能耗的近2%。IEA预测,在最糟糕的情况下,到2026年这些领域的用电量将达1000TWh,与整个日本的用电量相当

上一篇:个人消费贷款... 下一篇:谷歌I/O开发...
猜你喜欢
热门阅读
同类推荐