< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

Agent时代,CPU的价值该重估了

CPU与GPU趋近1∶1

金磊 发自 苏州

量子位 | 公众号 QbitAI

CPU的价值,在Agent时代,真的需要被重估了。

为什么这么说?

因为Agent正在改变AI计算的配比——

从一颗CPU搭配四颗GPU(1:4),到现在的一颗CPU搭配一颗GPU(1:1)。

这便是芯片巨头英特尔刚刚在苏州举办的技术创新与产业生态大会(Intel Connection)中给出的判断——

随着AI开始调用工具、执行任务,CPU需要承担更多的调度、数据处理和执行工作,其在整套AI系统中的价值也需要重新衡量。

不仅如此,英特尔CEO陈立武在视频致辞中还坦言:

作为现代计算的基石,x86持续驱动计算向智能化应用发展。

而从昨天英特尔的股价暴涨12%来看,也从侧面印证了市场对于CPU在Agent时代重要性的认可。

既然趋势已然如此,那么CPU在整套系统中的价值,又该如何重新计算?

为什么需要更多CPU?

在回答价值如何被重估之前,我们且需要了解一下,为什么Agent时代CPU成了紧缺货。

其实英特尔数据中心事业部副总裁、中国区总经理陈葆立在今天的演讲中,就用我们每天都可能交给Agent的任务做了例子——整理新闻

在这个任务中,用户需要给Agent设定任务,每天早上8点,帮自己搜集前一天的AI新闻,并完成总结。

虽然我们下达的需求只有一句话,但其实Agent背后的工作量远没有看着那么简单。

因为它要上网找资料,拿回来的内容可能是网页,也可能是PDF报告或视频。各种格式的信息,需要先提取、处理,才能交给大模型分析。

在陈葆立看来,这些预处理工作,恰恰有不少适合由CPU承担。

而且,一次模型调用往往还不够。Agent要拆解任务、调用工具,再根据结果决定下一步怎么做。前一步没完成,依赖它的后续工作就得等着。

对于这一点,中国工程院外籍院士、清华大学智能产业研究院(AIR)创始院长张亚勤,在会上对Agent做解释的时候也有所提及:

它能围绕目标进行规划、行动、试错和迭代,直到完成任务。模型给出的回答,会成为后续行动的依据,行动结果又会进入下一轮处理。

这么一来,CPU需要处理的事情就多了。模型计算之外的执行、调度和数据处理,都得跟上Agent干活的节奏。

为了解释这种变化,陈葆立把数据中心简化成三个相互配合的部分:

  • CPU服务器或集群,负责智能体的执行和工作编排;
  • GPU等加速计算资源,承担模型计算;
  • 存储系统,则保存任务涉及的数据、对话以及新生成的文档等内容。

除此之外,CPU的工作还会贯穿这些环节。加速计算需要数据预处理,存储系统需要数据调度,Agent执行任务也需要不同资源及时配合。

所以,一套系统里GPU性能再强,也得有数据及时送来、有后续任务接上。处理和搬运数据的环节出了瓶颈,昂贵的计算资源就可能闲着,整项任务的完成速度也会受影响。

这也是英特尔反复强调CPU的原因,Agent需要的计算量在增加,系统要有效利用这些算力,还得把执行和调度能力一起补上。

而落到企业采购这个层面上,问题也就更具体了。

过去几个月,陈葆立和团队与国内的软件合作伙伴、互联网厂商交流,得到的反馈是,客户既关心能运行多少个智能体,也看重每个智能体的能力和可靠性。

比如,某些业务需要在短时间内启动大量沙箱,为智能体提供运行环境。系统得及时响应,已经运行的任务也要继续处理。

再比如,同一套设备上同时运行多个Agent,数量增加以后,每个Agent还能不能在要求的时间内得到响应?这个数字,才关系到服务到底能不能用。

所以能启动多少个Agent,与能让多少个Agent稳定干活,实则是两回事。

陈葆立在现场介绍的测试和优化,正是在同时考察数量与单个智能体的表现。CPU的评价因此有了更具体的参照,包括并发能力、响应时间,以及对真实任务的支撑能力。

至此,我们刚才提到的1:1这个比例趋势,也就不难理解了,它对应的是英特尔所强调的智能体推理部署趋势,具体配比仍要看任务和系统配置。

但企业需要多少CPU,最终要由这些工作来决定。而英特尔能拿到多少业务,还得看它交出的方案。

CPU的机会,英特尔能拿到多少?

对于这个问题,英特尔给出的办法,是把CPU和配套软件放进实际任务里,一起优化。

数据中心里的一个切入口,就是刚才我们提到的数据预处理。陈葆立介绍,英特尔希望利用至强处理器内置的加速能力,加快相关工作,帮助客户减少等待。

另一个切入口则是在存储。大模型的上下文越来越长,Agent又需要反复处理任务信息,KV Cache的容量和调度就成了需要考虑的问题。这类缓存保留了模型计算中可复用的中间数据,可以减少重复计算,但本身也会占用存储空间。

缓存规模增大以后,只靠GPU上的高带宽内存未必装得下,还需要借助系统内存、SSD等资源。数据放在哪里、怎样压缩、如何搬运,都会影响使用效率。

针对这些问题,陈葆立介绍了英特尔的KV Cache优化方案,包括利用处理器内置能力进行无损压缩,以及加快数据传输。

这些工作看起来没有模型参数那么抢眼,却关系到设备能否有效运转。数据少占一些空间、传输少花一些时间,都可能减少系统里的等待和浪费。

他还提到,英特尔正在和国内的软件合作伙伴合作,打造高性能存储系统。目标很直接,让数据更快送到需要它的计算资源手里,减少CPU、GPU闲置。

CPU能带来多少价值,要放到整套系统的效率里衡量。这也解释了英特尔为什么在现场反复提及软件与合作伙伴,包括Linux、PyTorch等开源项目,以及英特尔在其中的投入。毕竟硬件能力要在客户业务里发挥作用,还需要软件支持和适配。

当然,类似的分工,在个人设备上也存在。英特尔副总裁兼端侧计算和物理AI事业部中国区总经理高嵩,便在演讲中介绍了CPU、GPU、NPU的协同方式:

CPU承担智能体的计划、决策等需要及时响应的工作;GPU发挥矩阵计算方面的能力,处理相应的AI计算任务;NPU则以较低功耗,支持需要长时间运行的音视频处理、计算机视觉等任务。

这背后的一个很实际的要求,是Agent既要及时回应,也可能需要持续感知环境,不同任务对性能和功耗的要求并不一样,需要软件把工作分配给合适的计算单元。

因此,英特尔想争取的业务,也不只在大家熟悉的PC里。

高嵩提到了家庭AI、车载AI、围绕私人数据运行的AI等设备形态。它们对应不同的使用需求,也为英特尔的处理器和软件平台提供了新的应用场景。

机器人就是其中一个例子。据高嵩介绍,机器人既需要感知环境、规划任务,也需要实时控制运动,多个机器人之间还可能涉及协同调度。这些工作对计算系统的及时响应提出了更高要求,也给CPU留下了用武之地。

这里的商业逻辑其实也并不复杂,合作伙伴把产品做出来、交付给客户,英特尔的平台才有机会进入更多设备。

北京大学新结构经济学研究院院长林毅夫在会上谈到,人工智能对经济的影响,要通过各个产业利用AI提高效率来体现。放到英特尔身上,这个判断同样具体,更多的应用需求,最终需要变成客户愿意付钱的产品和服务。

对英特尔来说,这些应用也意味着新的业务机会。

数据中心里的Agent,需要CPU处理数据、编排任务,协调计算和存储资源;个人设备和机器人中的Agent,同样需要及时响应、执行指令,并与其他计算单元配合。英特尔希望把至强、酷睿及配套软件用到这些具体工作中,让合作伙伴更容易开发和部署自己的产品。

这也是本次大会上,英特尔反复强调CPU的原因。Agent每完成一项任务,背后都可能包含多轮模型调用、工具执行和数据处理。模型算得快,还需要其他环节跟得上,用户才能更快拿到结果。

因此,衡量CPU的作用,也需要把这些工作算进去。它能支撑多少个Agent同时运行,能否及时完成调度,能让计算资源少等多久,都影响着整套系统的实际表现。

总而言之,现在Agent表现的好坏,CPU是有绝对的“话语权”的。

版权所有,未经授权不得以任何形式转载及使用,违者必究。