作 者丨倪雨晴
编 辑丨张伟贤
在大家都对英伟达究竟还存有多少增长潜力怀有猜测之际, 于美东时间7月13日, 英伟达的股价再次大幅上涨了4.73%, 其市值达到了11356亿美元, 也就是大约合人民币81071亿元, 并且再创历史新高这事发生了。
最近, 一家 AI 企业员工向 21 世纪经济报道记者描绘了芯片供应的紧张之势, 他说, 现在公司大部分资源都集中在大模型建设, 近期采购的一批英伟达 GPU 马上就要到货, 并且在内部早已分配完毕。
此时, 算力产业链正遭遇新一轮“缺芯”境况, 产业链里的企业们, 若要迈进超高算力的领域, 若要于 AI 行业中站稳脚跟, 英伟达 GPU 乃是难得的入场凭证。
由于美国禁令致使A100和H100停供, 英伟达重新定制的800系列在国内遭厂商疯狂抢购, 100系列库存GPU价格亦一路攀升。有产业链人士告知记者、“今年A100价格上涨了一倍左右, 一台配备NVLink的八卡服务器, 去年价格不到100万元, 如今或许需170万元。”。
更让人发愁的是, 价格涨得很高的情况下芯片却依旧难以买到, 另外有一位身处产业链的人士跟记者讲, 英伟达在今年对于GPU芯片的需求或许是以往年份的7、8倍, 这种火热的状况由此可见一斑。
在GPT将人工智能彻底引爆之后, AMD参与到竞赛之中, Intel也参与到竞赛之中, 一众GPU企业同样参与到竞赛之中, 然而, 从短期的视角来看, 英伟达当前所处的地位是不可以被其他替代的。
从多位从事AI工作的人员角度看, 眼下大模型训练的需求急切到了极点, 对于性能所提出的要求也是极高的, 然而GPU的适配以及生态转移都要耗费很长的时段, 所以当下大家全都优先选取英伟达, 并且和其他厂商的测试验证也正在开展当中。
一场全新的算力之战已然拉开了帷幕, 要是把算力看作是一个江湖的话, 那么现如今英伟达便是一名绝世高手, 它拥有身怀加速计算的绝技, 特别是在AI战场上一骑绝尘, 好像每一回都能够精准地踏在浪潮的节奏之上, 从游戏PC市场出发, 历经深度学习开始崛起, 再到云计算走上普及, 一直到生成式AI降临, 英伟达的技术所向披靡。
然而, 英伟达的创始人黄仁勋, 在2017年的时候接受了媒体的采访, 当时他说道: “15年以来, 我讲述的都是同一个故事。我几乎都不需要去修改我的幻灯片。”他还说, 他没办法预测到人工智能会在什么时候来临, 但是他无比坚定地相信图形计算具有优越性。
反向瞧, 英伟达早就跨越了GPU自身的理念范畴, 人工智能变成极大的标识, 运算能力登峰造极的本领构筑起全新的数万亿规模的庞大国度。
起步
1993年, 黄仁勋常年身披黑夹克, 却不顾分析师劝阻, 毅然决然同伙伴创立英伟达, 正好那年他30岁, 当时他所面对的市场环境并非乐观, 在九十年代, 图形处理器也就是图形加速卡领域呈现群雄混战局面, 有上百家企业在那里短兵相接。
不但如此, 那个时候图形加速卡并没有被予以重视, 所有的关注焦点都集中在CPU上面。大概在1993年的时候, 斗志昂扬的CPU竞争领域, 具备强大运算能力的核心角色是有着悠久历史的传奇品牌英特尔以及AMD, 这两者正在展开激烈的对抗。
当年的1991年, 全球最大半导体企业是英特尔, 1993年时, 英特尔推出80586芯片, 因要与AMD区别开就命名为奔腾, 1991年AMD推出Am386微处理器系列, 打破英特尔市场垄断, 1993年AMD又推出Am486微处理器。
然而, 在以英特尔及AMD作为代表的x86架构的CPU之外, 苹果与Arm已然携手进入芯片领域。1993年, 苹果推出Newton MessagePad(牛顿机, PAD鼻祖), 它首次搭载了Arm架构处理器。与此同时, 苹果还同IBM、摩托罗拉结成联盟, 以此对抗“Wintel”, 三者联合研发出芯片PowerPC, 该芯片在1994年被应用于苹果的台式机上。
就如同黄仁勋于近期的一次采访里讲述的这样: “30年之前, 个人电脑革命方才开始起步, 微处理器CPU开始呈现上升态势, 那时大家觉得CPU是去解决计算问题的最为合适的办法。”然而, 黄仁勋却始终觉得应当要有加速计算。
接着看, 众人都渐渐清楚图像处理, 图像类的视频处理, 相关的游戏处理, 以及计算处理等等这些方面均是需要GPU的, 然而在那时英伟达依旧在艰辛地寻觅技术的应用市场句号。
幸运的是, 英伟达迅速找到了计算机图像与电子游戏相融合的场景。在开展研发工作期间, 一家名为世嘉的日本游戏公司向英伟达抛出了橄榄枝, 该公司愿意给予700万美元的资金。
看样子, 视频游戏的风口好像就近在眼跟前儿了, 那时, PC跟游戏是最为主要的消费电子市场, 英伟达恰巧搭上了这趟班次。然而呢, 好景不长, 英伟达在3D图像技术方面选了条错误的路线, 没办法兼容微软所制定的新主流标准, 初代产品NV1最后销量惨不忍睹, 眼看着给世嘉研发的芯片也快要面临被淘汰的状况了。
要是没办法达成芯片开发, 公司就会陷入绝境。黄仁勋在日前的那次演讲里也提及了创业初始阶段的此次危机, 最终他向世嘉讲了实际情况, 而世嘉居然同意支付研发费用, 挽救了处于倒闭边缘彷徨的英伟达。
在经历了此番那么多波折之后, 黄仁勋于1997年提出了在业界相当知名的“黄式定律”, 该定律所预测的是显卡性能每到六个月就会提升一倍之多, 其提升速度远超摩尔定律的速度。在当年的时候, 这更像是黄仁勋面向外界所做出的一次宣言, 这是为他自己所定下的标准以及目标, 然而现如今这已然变成了现实。这同样也是黄仁勋在演讲当中多次提及的“跑得快”之事, 他讲当道路很长的时候, 跑得快乃是唯一的策咯。
时运
很快,英伟达迎来更大的转机。
1997年, 英伟达推出新款图形加速芯片RIVA 129, 此芯片成功实现逆袭, 开售后四个月内出货量便超过100万台。1998年, 英伟达与台积电展开牵手合作, 在图形加速领域更进一步, 在竞争异常激烈的PC与游戏市场上, 英伟达快速跑进入了决赛圈。
在1999年那会儿, 英伟达十分顺利地实现了上市一事呢 , 并且还领了先头提出了GPU这个概念呀 , 而后推出了全球范围内首款GPU哦 , 那就是Geforce256。这可是一款具有关键性质的产品哟 , 从这时候往后呢 , GPU已经不再仅仅只是起辅助CPU的那个角色啦 , 它那具备出色表现的并行计算能力将会给出更为强劲有力的算力。
2000年, 微软Xbox搭载了由英伟达提供的GPU, 2002年底, 英伟达和索尼达成合作, 为游戏主机PlayStation3提供显示芯片, 接下来, 英伟达在游戏界历经兼并收购、大鱼吃小鱼, 起起落落, 最终才实现大杀四方, 杀出重围。
英伟达在游戏、PC市场成就登顶之历程当中, 始终寻觅全新场景, 于蓬勃发展的手机市场尝过铩羽不振之滋味, 且直面PC市场缺乏足够吸引力之实际状况。然而, 二零一零年以后, 人工智能、云计算的发展趋势如同浪潮缓缓临近, 从自动驾驶领域直至神经网络深度学习范畴, GPU呈现出强大且具备针对性的加速计算能力。
在深度学习兴起的进程里, GPU 所具备的卷积运算、并行运等特性, 刚好能够契合 AI 计算的需要;面对世界范围云化的趋向, 数据中心计算的背后都离不开 GPU 给予的算力支撑。
英伟达再度于新领域内崛起, 仿若它恰巧拥有超凡的武功, 武林江湖环境更迭, 它却一直能够凭借独门秘籍开拓新途。谁能预料, 随后的事实表明, GPU 不但可用于 AI, 还能够用于挖矿。需知, AI 的概念在 AlphaGo 热潮过后陷入低潮, 恰在此时区块链登上风口, GPU 因矿机需求一路攀升。
众人皆知, 于此之后区块链的热度开始下降, 那疯狂肆虐的矿机需求逐渐回落, 英伟达的股价也随之应声而跌落, 然而到了2022年年末的时候, 人工智能返回科技舞台的中心位置, 生成式AI变成英伟达市值的新的推动力量, 英伟达的产品同样也是生成式AI的主要引擎。
潮水起起落落之际, 黄仁勋于外界眼中作为“游戏小子”的身份也摇身一变成为了“AI教主”, 一路走来, 英伟达精准捕捉住了计算设备需求的关键契机, 在从图形渲染起始、延伸至人工智能范畴、甚至拓展到区块链领域的计算方面均展现得极为卓越突出, 其应用场景更是涵盖了PC、数据中心、汽车等各市场, 直至2023财年, 英伟达数据中心的营收占比首度超越了游戏, 达到了55.6%。
谈到数据中心业务时, 黄仁勋讲, 虽说我们需求更多算力, 然而数据中心消费的增长并非那般迅速, 原因在于摩尔定律至今已然出现改变, 已然终结了, 要是我们期望获取更多算力, 那么所有数据中心都得加速, 不同于用于特定程序的 ASIC 芯片, 英伟达属于通用加速计算平台。
超越
英伟达一开始设定的标签是GPU, 然而只是在图像范畴的运用, 那般并不能承担起英伟达后续高涨起来的市值。于练就独特技能的进程里, 英伟达早就跨越了起初GPU的概念, 进而踏入到更为宽泛的产业当中。
当中, 被业内人士提及次数最多的两大内功是GPGPU和CUDA, 它们处于为人所熟知的芯片之上 , 为产业制订了一整套软硬件标准 , 强大的软件生态也使得英伟达目前处于不败的境地。
首先, 回到GPU与CPU的区别方面, GPU究竟具备怎样的特色, 为何它能够从处于次要地位转变成为占据主要地位?
计算机中的CPU和GPU, 是现代计算机里不可缺少的两个部分, 然而, 它们于运算方式、功能等方面, 有着显著的差别, 简单来讲, CPU主要承担执行指令集中算术逻辑操作的工作, 而GPU更善于进行并行计算, 这是由于, GPU有大量核心, 每个核心都能够独立开展计算任务, 进而达成高效计算。
来做一个不那么精准细致的比方, 当在电脑之上进行一幅图的绘制操作时, CPU的运算模式更侧重逻辑层面, 它得依照一定顺序去完成像素的绘制工作, 然而GPU却能够在同一时间对多个像素展开绘制行动。并且, 该绘制行为背后主要是由GPU在开展矩阵运算, 其宛如矩阵运算领域中一位处于顶尖水平的高手。
早在起始阶段, GPU就如同它那被称为“Graphic Processing Unit”的名称一样, 专门是用于图像显示的。一个意义重大的跨越发生在2007年, 也就是英伟达提出了GPGPU架构, 这一架构指的是用于通用计算的GPU, 它把GPU从传统的图像处理器转变, 广泛地普及并应用到计算训练当中了。
在图像处理、视频编码等领域, GPU有着优秀的表现, 然而于某些特定应用场景当中, 像科学计算、工程仿真等, 因需更高的计算能力与更大的内存带宽, 所以此时就得运用更为强大的GPGPU去开展更大规模的并行运算。
处在英伟达拓展市场范围的关键时刻, 尤为关键的是, 英伟达于2006年推出了自身的CUDA平台, 打造了强有力的AI算力生态园。
CUDA是英伟达所拥有的并行计算平台以及编程模型, 它能够借助发挥GPU的处理能力显著提高计算性能, 使得GPU具备解决复杂计算难题的能力, 借助CUDA平台, 开发者们在进行编程期间能够更便利地调度底层的GPU算力。
能够这么讲, CUDA平台是英伟达构建的那一系列并行运算的关于软硬件的生态层面的标准, 英伟达的全部GPU都对CUDA存在兼容性, 同时多数AI芯片也都和它相匹配具备兼容性, 特别是训练端的芯片。所以, 即便GPU或者AI领域的创业公司不断涌现, 其中大多都兼容英伟达的CUDA平台, 然而想要再去创建属于自己的生态方面的那种壁垒以及所需投入的成本都相当高。
有产业链方面涉及的人士对21世纪经济报道其记者讲, CUDA有400多万名开发者, 软件生态所具备的护城河特别高, 当下要转移至国内相对成熟的AI芯片这个平台之上, 或许得花费两三年的时长。
在当下全球的GPU市场之中, 主要的玩家是英伟达与AMD, 英特尔近些年来也在对GPU产品线投入力量, 然而英伟达当前依旧占据主要的市场份额, 对照CUDA而言, AMD正在打造开放的ROCm平台, ROCm平台在2016年被推出, AMD也持续在对ROCm套件进行优化。
曾在一次访谈中, 亚马逊创始人杰夫·贝索斯这么讲道: “要是产品做得极为出色, 且自身有着足够的幸运的话, 通常来讲会持有长达两年之久的领先优势, 于AWS业务范畴内, 亚马逊保持领先状态达七年之多, 有七年的时段都是不存在实力相当的竞争对手的。”。
重新审视英伟达以及AMD, CUDA相较于ROCm, 整整提前了十年, CUDA历经十年磨砺, 打造出一把利剑, 而那些挑战者们, 依旧处于追赶的进程之中。
“通吃”
回顾GPU以及AI的发展历程, 黄仁勋讲道: “在2012年的时候, 计算机视觉模型AlexNet借助GeForce GTX 580来开展训练, 利用1400万张图像对AlexNet予以训练, 它每秒能够处理262 PetaFLOPS, 也就是千万亿次浮点运算。经过训练的该模型凭借压倒性优势在ImagNet挑战赛中夺冠, 并进而引发了AI方面的大爆炸。”。
这时, GPU与AI的相拥已然埋下种子, 在十年之后, Transformer模型出现了, OpenAI依据Transformer开发了GPT - 3。
在之前的演讲里头, 黄仁勋讲了, GPT - 3做训练, 需要323 ZettaFLOPS这么多的算力, 这相当于AlexNet的100万倍, 靠着这些就创造出了那个震惊全球的GPT这个人工智能。按他的观点, 全新的计算平台已然诞生了, AI的“iPhone时刻”已然来到了, 加速计算以及AI技术已然走入现实了。
在今年举办的GTC大会期间, 黄仁勋公布了好多跟生成式AI有联系的进展, 之后呢, 又于台北国际电脑展COMPUTEX上接着抛出重磅消息, 他宣称GH200 Grace Hopper超级芯片正式开启投产流程, 并且公布了一款由256个GH200来驱动的新型DGX GH200 AI超级计算机。
而在此之前, 英伟达早就已经把功课做得十分充足了。在2022年的时候, 英伟达推出了多款具有重大影响力的产品, 其中包括基于全新Hopper架构的H100 GPU, 还有一种CPU和GPU相融合的Grace Hopper, 以及由两个CPU组合而成的Grace CPU Superchip, 并且CPU的产品是在2023年上市的。
其中, 在设计GPU新架构Hopper之际, 英伟达增添了一个Transformer引擎,此引擎专门针对Transformer算法开展了硬件优化, 进而加快了AI计算的效率。
一名身处国内芯片领域的从业者, 面向21世纪经济报道的记者, 直接了当地讲, “H100问世, 实际上已然是一回新兴的时代了, Grace - Hopper再有一回组合, 再加上具备高配置的互联状态, 完全就不给同行留活路, 英伟达呈现赢家通吃的态势, AMD、Intel持续苦苦追赶。”。
与此同时, 他还说道: “当下在我国, 有一些企业依旧是瞅准了CNN去做优化, 英伟达那儿已然拥有了Transformer引擎, 随后AIGC呈现出热火朝天的态势, 刚好这能够给予支持。这样的眼光啊, 真的只能去钦佩他们企业里的科学家们对于这个领域所具备的那种深刻的认知了。”。
一位身处学术界的人士, 还向21世纪经济报道的记者剖析指出, “于H100之上, 涵盖专用的Transformer引擎以及对FP8格式给予支持,从中能够察觉到计算硬件正朝着应用定制的方向大踏步迈进。Grace CPU诠释阐述了整合异构计算系统所具备的重要意义。仅仅是单纯的加速器优化与设计, 已然无法契合当下针对计算系统的算力以及能效比所提出的要求, 而是需要各个部分展开协同优化以及设计。”。
他还表明, Grace CPU凭借提升通信带宽, 以及在CPU与GPU之间构建一致内存模型的方式, 去处理运算里的瓶颈, 这同样跟学界近几一直在留意注视并且关注存内计算、近存计算这两个方向, 还有业界一直予以关心关注的CXL、CCI等等系统互联协议所涉及的方向是保持一致相符的。
一句话来说, 于GPU以及CPU的各类排列组合里头, 英伟达再度把算力提升至新的高度。就如同黄仁勋所讲的那样: “我们正在对计算机进行重新发明, 计算正在经加速计算与人工智能呈现出被重新定义的性质。”。
黄仁勋于采访当中还表达了这样的意思, 即数据中心所需用到的CPU正变得越来越少, 并非像传统那样去采购数百万个CPU, 而是转变为采购数百万个GPU。也就是说, 按照他的观点, AI算力领域已然是GPU占据主导优势的局面。
野心
英伟达的布局还不止于此。
一个实际存在的问题是, 具备高水准性能的算力, 同样意味着需要承担高昂的价格。大型模型进行训练时, 其成本动不动就达到成千上万美元, 并非是所有的公司都有能力承受的。
英伟达提出了云服务解决方案NVIDIA AI foundations, 英伟达要做代工厂角色, 英伟达要通过和大模型厂商、云厂商合作提供高性价比的云服务。与此同时, 台积电大大降低了芯片设计公司生产门槛, 黄仁勋表示要做“AI界的台积电”。
那已提到的芯片相关从业者, 对着记者剖析说: “售卖云服务, 就是跟大模型方面一道, 去提供先行训练的模型,小的企业直接进行精细调整后, 便拥有属于自身的(模型)了。”。
英伟达在助力下游企业削减大模型训练方面的成本之际, 还接连不断地逐步投身于上游的产业链升级进程之中, 就在今年年份里, 英伟达与台积电、ASML、新思携手合作, 并且公开发布了计算光刻库cuLitho。
有学术界人士向记者介绍, 计算光刻在芯片设计与制造领域是关键步骤, 还是最大计算负载之一。计算光刻库又有技术突破, 即能借部署大量 GPU 的 DGX AI 计算系统, 加快计算光刻速度, 让其达原有基于 CPU 计算速度的几十倍, 还可降低计算总能耗。这有助于晶圆厂缩短原型周期时间, 提高产量, 减少碳排放。为2nm及更先进工艺奠定基础, 为曲线掩模所需的新型解决方案提供更多可能性。为高数值孔径极紫外所需的创新技术提供更多可能性。为亚原子级光刻胶模型所需的新型解决方案和创新技术提供更多可能性。
新思方面朝着21世纪经济报道记者述说, 于此次研发合作当中, cuLitho把新思科技Proteus全芯片掩膜合成解决方案以及新思科技Proteus ILT反向光刻图形技术给集成起来了, 并且做了优化, 目的是能够在最新一代NVIDIA Hopper架构GPU上开展运行。现今, 在cuLitho平台上运行Proteus解决方案只要500个NVIDIA DGX H100 GPU, 取代了之前用于计算光刻的40000台CPU服务。对光刻过程进行计算, 其所有部分能够并行运行, 令电力能耗需求降低, 把运行时间从几周缩减为几天。
在好些产业界相关人士眼中, 虽说短期内不会对下游的应用层面造成影响, 然而这些上游的研发以及升级, 会在长期对产业的发展起到作用, 逐渐积攒形成代际差别。
芯片行业专家姚嘉洋向21世纪经济报道记者说道, 英伟达在GPU架构的迭代进程当中, 始终存在着专属自身而言的发展途径, 最近这几年时间里的发展态势, 促使英伟达攀升至AI算力芯片领域领导者的位置, 又由于处于领先地位, 因而英伟达会思索怎样去进行更为多元的布局以及与行业内部展开深度合作, 如此一来便能于更大程度上知悉行业中的需求, 就好比与台积电等实行合作就是极为典型的实例。
在二零零八年的电视采访当中, 黄仁勋讲道: “期望有朝一日所有人都知晓英伟达, 如同所有人都知晓微软、英特尔那般。”如今, 英伟达差不多是尽人皆知, 身怀超凡绝世的本领, 比宏大梦想更为重要。
在2023年, 于英伟达迎来30周年之际的时候 , 黄仁勋在接受采访时讲了这样一番话: “(公司)到如今这个时候才算是真正地开始腾飞起来。”生成式AI对英伟达成为算力这方面新的王者提供了助力句号。
在7月的时候, 英特尔针对中国市场推出了AI芯片Habana Gaudi 2, 当然, 英特尔和AMD都已吹响反攻的号角。6月, AMD推出了AI芯片Instinct MI 300X, 二者都直接对标英伟达100系列。围绕着算力、纳米的权力游戏还会持续下去。
SFC
本期编辑 江佩佩 实习生 章宝怡
21君荐读
英伟达放大招!市值飙涨至近万亿美元
英伟达“炸场”后,这些A股公司也宣布出手!
英伟达最失意收购落幕,孙正义官宣Arm寻求重新上市






