在生成式AI浪潮下,AMD正以软硬协同的全栈战略强势突围!AMD的CTO在专访中详解了公司的AI核心布局:依托CPU、GPU技术积淀,打造开放软硬件生态,深耕数据中心GPU市场,实现从近乎零份额到快速破局的逆袭。

在采访中,AMD的执行副总裁兼CTO Mark Papermaster阐释了公司的AI战略:打造一个开放的全栈硬件产品组合,并辅以快速扩展的AI软件生态系统。AMD希望赋能企业和云服务提供商,高效部署大规模AI解决方案。
Papermaster详细介绍了AMD与大语言模型开发者的合作伙伴关系、供应链地缘政治对半导体战略的影响,以及公司为降低AI基础设施日益增长的功耗和散热需求所做的努力,他还分享了AMD的技术路线图、数十亿美元架构级投资背后的决策框架,以及面向采用下一代AI的企业买家的实用指导。
主要话题:
• 构建全栈AI平台——AMD为何要将硬件、软件和解决方案整合在一起
• 争夺数据中心AI市场——AMD在GPU加速领域抢占份额的战略
• 面向推理模型的设计——超长上下文窗口如何塑造芯片架构
• 规模化可持续发展——应对AI部署中的能耗与散热挑战
• 平衡研发与产品周期——在推动创新的同时确保按时交付
• 高管要点——领导者现在应做什么,为AI下一波浪潮做好准备
AMD的发展历程与AI演进
Michael Krigsman:AI基础设施是AI版图中至关重要且快速演进的组成部分。我是Michael Krigsman,今天在节目中,我们邀请到了AMD的CTO兼执行副总裁Mark Papermaster,共同探讨这一话题,Mark负责一个庞大的硬件和软件产品组合,让我们开始吧。
Mark Papermaster:我非常幸运,在过去13年半里,我有幸担任AMD的CTO,亲历了行业一个令人难以置信的转折点。当时我和Lisa Su被招入公司,因为AMD是一家久负盛名的硅谷企业,公司已有超过55年的历史,充满潜力,但当时正面临诸多挑战。
那正是一个绝佳的切入点,恰逢AI开始崭露头角。想想2012年,那时我们刚开始让自然语言处理达到比其他技术高得多的准确率。那是神经网络引擎的有效应用,也是未来一切的最初曙光。
时机堪称完美,AMD拥有出色的基础模块:CPU技术、GPU技术、其他加速器,以及将它们组合起来面向特定市场的专业能力,这涵盖了从超级计算机到PC和嵌入式设备的一切,这是一个绝佳的机会。AMD人才济济,这份工作就像梦想成真。
Michael Krigsman:当今科技界正经历生成式AI带来的又一个转折点,这对AMD意味着什么?
Mark Papermaster:真正的转折点确实是生成式AI,我们看到了未来的曙光,这也是我们开始投资确保软硬件技术到位的原因。
但生成式AI是一个根本性的转折,Michael,因为它让AI变得人人可用。当然,这一切始于ChatGPT。想想2022年11月ChatGPT问世时,突然之间,一切变成了对话。你输入token或问题,ChatGPT就会调用超级计算资源来给你答案——你以前从未想过能从计算机中获得这种程度的智能,它真正向大众和其背后的超级计算敞开了大门。
我们看到了什么?很难相信距今才短短几年,能力已经爆炸式增长,ChatGPT、Grok等大语言模型的准确性越来越高,但你也看到了向推理的转变,人们开始真正意识到如何部署AI,从根本上改变几乎所有我们曾梦寐以求的流程。
AI时代的AMD战略
Michael Krigsman:这种向推理的转变,以及你刚才描述的对准确性的期待,对AMD的技术和战略带来了什么影响?
Mark Papermaster:对更高准确性的需求,以及推理的转移——意味着数以百万计的新增用户——这是惊人的,ChatGPT目前每周已有4亿到5亿次用户交互。
对我们和业内同行来说,这意味着支撑这些交互所需的算力正在指数级增长,我称之为对更多计算的无尽需求,而且必须高效,因为你不能无限制地堆更多引擎——那样会消耗超过我们可用的电力。
Michael,要以智能的方式推动这种计算能力,需要大量创新,这需要真正理解那些软件算法如何与硬件协同工作,否则你无法实现真正的优化。
Michael Krigsman:所以你的战略涉及硬件与软件的协同,可以说,你的产品组合已经从传统上更聚焦于处理器的业务扩展了?
Mark Papermaster:我们一直是一家硬件和软件公司,但多年来我们是大写的Hardware和小写的software。软件一直很重要,但始终是赋能者。如今在AI时代,软件与硬件同等重要甚至更加重要,因为硬件绝不能有丝毫松懈。正如我所说,每一代引擎都必须越来越高效。
要释放这种能力,你必须理解AI算法的发展方向。有哪些技术可以让AI更高效?我们能否使用不同的矩阵数学方法来提升效率?有哪些算法?想想transformer被引入AI模型时带来的变革,还有flash attention,这些都是算法层面的技术,让AI更准确、更高效,而硬件必须与之匹配。
这需要硬件和软件极其紧密的协作,这也是为什么在AI市场中引入竞争如此困难。Michael,我告诉你,对于AMD来说,我们必须凭实力赢得与那些打造最前沿大语言模型和AI新突破的顶尖公司同桌的机会,我们必须证明自己是那个有竞争力的玩家。我们能带来竞争,这让我们获得了与其开发者合作的机会,这使我们能够确保我们的路线图在AI领域具有绝对竞争力。
Michael Krigsman:在你所描述的这个市场中,AMD的胜利意味着什么?
Mark Papermaster:我们与CEO领导层的沟通非常紧密,她的沟通始终驱动我们做到最好。当我们进入一个市场时,我们的目标是快速抢占份额,我们要成为那个市场的领导者。
Michael,我给你打个比方,就像我们在CPU服务器市场所做的那样。当Lisa和我加入时,我们不得不退出服务器市场,因为我们没有足够有竞争力的x86 CPU,我们的策略是打造一款领先的CPU。让我们去赢下那个市场,因为很明显大量工作负载正在向云端和数据中心迁移。
我们确实做到了,芯片设计不是一夜之间的事,我们花了整整五年才打造出那款新的领先CPU,它就是我们的Zen系列处理器,但看看发生了什么,在服务器市场,我们从2017年发布时几乎零份额,到现在大约40%的市场份额,而曾经的霸主英特尔则拥有主导份额。
这正是我们想在GPU领域做的,CPU和GPU紧密协作,这就是我们在AI领域要做的,而且我们已经开始了。当我们在2023年12月推出首款面向AI的处理器——一款AI优化处理器Instinct MI300时,在其第一年量产的2024年,我们从数据中心GPU几乎零营收,一举达到50亿美元,这是AMD有史以来最快的产品爬坡,从零份额到大约5%,这是一个巨大的市场,但我们不会松懈。
我描述的那段CPU历程,经历了一代又一代倾听客户、推出产品、获取反馈、占据一席之地,然后每一代都改进软硬件产品,这正是我们在数据中心GPU领域所做的,这也是我们在整个产品组合中所做的,因为从PC到嵌入式设备到游戏显卡,我们的全部产品组合都已实现AI加速。
构建专业能力,与AI领导者协作
Michael Krigsman:你们如何与模型开发者——OpenAI等公司合作,优化你们的产品以匹配他们的最终需求?
Mark Papermaster:我们不得不在这一领域大幅加强能力,你不能空着手去OpenAI或Meta,那些团队对从基础原理到创建优化大语言模型所需的所有细节都了如指掌,还要处理生成式AI承担的海量任务。想想那些大语言模型中数十亿到数万亿的参数,Michael。
我们所做的,也确实做到了的,就是能力匹配,我们派出了最优秀的软件负责人参与其中。你不是带着营销团队去的,不是空手比划的,你带着最资深、最顶尖的技术专家去,然后我们通过内部招聘和收购来扩充软件专业能力。
如今,我们拥有非常熟练的团队,能够坐下来真正梳理并找出瓶颈所在。我们提供的软硬件如何在CPU、GPU以及现在的机架层面实现赋能?你必须构建机架级扩展能力,才能处理这些最大LLM的训练和推理。
这是我们在过去两年中建立起来的能力,我们必须做得非常快,而且必须极其敏捷。如果说与OpenAI、Meta等公司合作有一个不变的特点,那就是变化。我们坐下来和他们开会,他们会说:"你猜怎么着?"
AMD的敏捷性与文化转型
Mark Papermaster:"我们要走这条路。我们找到了更好的方法。有更好的算法,我们需要换一种做法。"我们一直是一家敏捷的公司,始终能快速应变,这是AMD文化的基石之一。在与那些AI模型公司合作时,我们经受住了这一考验。幸运的是,我们很擅长这个。我们反应迅速、适应力强,满足他们的需求。
Mark,这种变化是否也有文化层面的维度?你提到要培养一套新的能力。经历这种转折点时,是否也需要文化上的转变?
Mark Papermaster:我们首先在AMD内部经历了一场文化变革,这是整个转型的燃料。如果你看看AMD过去10年的发展,Michael,我们实现了巨大的增长,我认为文化是其中很大的一部分,文化变革的核心首先是聚焦执行力。
当你发布产品路线图、与客户交谈并倾听他们的意见时,你构建的功能是你知道他们需要的,是你知道能让你的产品脱颖而出、优于竞争对手的。你必须在承诺的时间交付,保证质量,成为那个值得信赖的供应商,这是一种近乎偏执的专注。我到这里后,开始与工程团队一起重构我们的工程流程,使我们能够成为一个可重复输出领先创新技术的引擎,一代又一代。
当Lisa上任时,她负责AMD的所有业务,并在2014年底成为CEO。她在全公司范围内带来了令人惊叹的专注——倾听客户,交付真正有影响力的产品,这就是那个执行力引擎。
第三,就是简洁。我们不要成为一家被复杂性缠住的公司,而是真正简化我们的做事方式,确保效率最大化,这是公司层面的转变,然后是AI,正如你所说,AI的爆发——从首个生成式AI发布到现在,我们看到的是行业中一个如此巨大的转折,而且仍在持续,这又一次在公司内部催生了新的能力。
这种新能力,第一,正如我之前所说,在软件公司的定位上,我们甚至比硬件公司更加重视软件,这是一个转变,第二,就是我们的速度,我在这个行业已经超过四十年了,从未以现在这样的速度前进。放眼整个公司,我们的移动速度比以往任何时候都快,放眼整个行业,我看到每家公司都在加速,AI正在加速创新交付市场的速度和节奏。
应对AI基础设施挑战
Michael Krigsman:我们收到了一个来自LinkedIn的问题,这个问题来自Preethi Narayan,她说:"随着在公有云环境中运行大规模AI模型的成本持续上升,许多企业正在重新评估高性能本地部署或混合基础设施方案,然而裸金属部署在复杂性和维护方面也有其自身的挑战。从AMD的角度来看,CIO和CTO应如何权衡这一取舍?我们是否正在接近混合AI基础设施成为战略常态的节点?"
Mark Papermaster:没有一刀切的方案,我们在产品组合中就考虑到了这一点,我们会提供选择,我们提供广泛的生态系统,让客户真正拥有选择权,而不是定制化的'这是你唯一的AI方案,这是我们竞争对手推出的机架,不给你按需定制的能力'。我们与OEM合作,也与超大规模云服务商合作。
你开始看到的是一种两极分化,超大规模云服务商正在构建支持最大语言模型的大规模机架级设计。如果你有大量训练需求或大规模推理需求,你可能会继续在云端运行。顺便说一句,由于我们在行业中推动的效率提升,每个token的成本在下降。算力成本在上升,因为我们在增加更多能力,但每个token的实际成本在下降。
账单仍然很贵,因为整个行业随着人们开始部署AI,正在吸引越来越多的用户,他们几乎在每个流程中都在运行AI推理。消费者在日常生活中使用越来越多的AI,因此需求在上升。
企业如何看待这个问题?我确实看到他们正在转向混合模式。正如我刚才所说,他们用云端处理那些大型任务,但同时开始针对自己的业务定制和微调模型,他们在利用自己拥有的数据,你不需要一个什么都能问的LLM。你在创建自己的大语言模型,在某些情况下还有针对特定任务的小语言模型,这让企业能够在本地以更经济的方式、更低的延迟来开发和支持这些模型,它更快,因为它就在工厂车间或用户需要即时答案的现场。
我确实看到了混合方法,一种两极分化,还有第三条腿,那就是嵌入式设备。你有本地部署、云端运行,第三,边缘AI正在真正崛起,这就是你在数据采集点嵌入AI引擎,立即为被控制的流程提供智能。
AI的未来:定制化与高效模型
Michael Krigsman:其他嘉宾也表示,他们认为未来是针对特定领域和应用的更小但更聚焦的模型。
Mark Papermaster:这很明显,对吧?当你退一步思考,当你开始部署AI时,它会被定制化。它会变得更加高效。
AMD的AI与产品创新
Mark Papermaster:人们必须为特定应用降低成本,AMD很久以前就预见到了这一点,我们利用了我们在从超级计算机到各领域的广泛产品组合优势。全球排名第一和第二的超级计算机都运行在AMD的CPU和GPU上。我们在数据中心领域通过CPU和GPU双线增长,同时也在智能PC领域,Michael。
我们是第一个在PC上为copilot引入深度AI加速的公司,这已成为我们产品组合中一个真正在增长的部分。我们还在最新版本的游戏显卡中引入了AI,利用AI实现精美的图形升频,并利用嵌入式AI。再想想我们在2022年收购的Xilinx——嵌入式设备和可编程门阵列的领导者,加上我们拥有的嵌入式x86业务,全部实现了AI加速。我们绝对预见到了这一点,并期待随着人们学会利用自己的数据并部署有效的推理应用,AI部署将持续增长。
AMD内部AI采用与开发流程
Michael Krigsman:有个来自Twitter/X的问题,这是Ricardo De Anda的,他说:"AMD的内部IT组织如何充当你们AI解决方案的零号客户?能否分享一些内部采用直接影响产品开发的例子?"
Mark Papermaster:我们是一家技术公司,如果我们不把自己当作零号客户,那就太丢脸了,但我们确实已经这样做了好几年。大约从四年前开始,我们大幅提升了IT作为零号客户的可见度,我们的CIO Hasmukh直接参与其中,他会与客户交流,了解他们的需求,并与他们分享我们如何部署AI,他同时也在支持我们的工程团队运行计算系统。我们不会在IT尚未演练或部署之前,就把新的数据中心GPU、新的数据中心CPU或新的PC推向市场——它们首先会在AMD内部的计算用户中使用。
我们首先构建数据中心计算集群,在推向市场之前,我们会部署数百台PC,嵌入式应用也是如此。嵌入式应用稍微困难一些,但PC和数据中心计算产品作为零号客户一点都不难,这正是我们所做的。
我再补充一点,我们加快了芯片设计流程,这就是我们所做的。我们开发芯片设计,软硬件必须有效协同。我们怎么做?在芯片设计过程中,我们使用AI,想想看,有数十亿个晶体管,我们最新的AI芯片有1540亿个晶体管,我们最新款现在有超过1800亿个晶体管,你如何把所有这些晶体管布局在硅片上,还要处理海量的互连?一切都必须完美,不能有一个晶体管或一个连接出问题。
事实证明,AI在确保我们不仅实现最优实现方面非常有效,它还帮助了我们的测试流程,提高了覆盖率,确保没有缺陷能逃过我们的制造测试线,它不仅在工程方面,甚至在我们的业务实践中都非常有效。作为零号客户也带来了直接的好处,因为你能加速内部AI应用的成功和效率。
AMD的技术战略与可持续发展目标
Michael Krigsman:你可以看到观众非常出色、非常聪明,所以我总是把他们的问题放在我自己的问题前面,这是Lisbeth Shaw的问题,她说:"技术战略是什么?是把所有产品线或产品家族视为分布在不同领域的一个系统吗?"
Mark Papermaster:当你思考像AMD这样的产品组合时,你在规划方向时必须灵活,每个产品本身必须在自己的品类中独立称王,我们的x86 Zen系列CPU必须是市面上最好的x86 CPU,GPU也一样,必须是最好的引擎,游戏显卡和嵌入式设备也是如此,你必须考虑所有的基础模块。
我们的路线图必须确保我们的硬件和软件——软件赋能——都是最优秀的,然后,当你把它们组合在一起时,我们有一套部署策略,并根据满足客户需求的产品进行定制,他们需要多少CPU核心?当用于数据库处理时,与同一颗CPU用作控制大量GPU的头节点时,定制方式有何不同?两种完全不同的用例,这适用于我们每个产品组合,你必须思考用例、客户的主要用例,并确保优化到位。
然后还有第三步,那就是我们必须通盘考虑整个产品组合,如何实现协同?对于AI,我们有一个统一的软件赋能栈——ROCm,这是我们软件赋能的名称,它将成为在数据中心GPU、CPU、游戏显卡设备或嵌入式设备上轻松部署AI的顶层方案,这是我们在2025年极度聚焦的领域,真正向用户开放这一能力,你现在可以在基于AMD的Windows PC上运行ROCm,你可以在最新的Radeon显卡上运行ROCm并获得优化,甚至CPU也是AI处理的重要组成部分,我们也对其进行了充分赋能。
Michael Krigsman:这是Chris Peterson的问题,他问:"在技术层面,AMD如何看待GPU间互连的发展方向?在业务层面,如果AI行业在算法设计上发生重大转变,或者电力、水资源和可持续性无法跟上需求,AMD的应对计划是什么?"两个问题。快速回答一下,GPU间互连,然后是更宏观的业务问题。
Mark Papermaster:我们此前一直使用自有的Infinity Architecture,它已在我们历代CPU和GPU中得到验证,但AMD致力于开放生态系统,我们认为极其重要的一点是,不能只有少数定制化产品,因为那是围墙花园的做法,我们支持并作为创始成员加入了Ultra Acceleration Link。
Ultra Acceleration Link是什么?我们捐赠了用于连接GPU的协议。现在它已经开源,不在AMD控制之下,而是由运行UA-Link联盟的多家公司共同控制,他们确保其他交换机厂商也能参与,我们的竞争对手,那些正在创建自己加速器的公司,可以使用这个Ultra Acceleration Link标准,使用相同的交换机和连接方案,我们致力于开放生态系统,这就是我们在GPU间互连方面的战略。
第二个问题当然至关重要,当能源消耗需求不断上升以满足我们对更多AI算力的无尽需求时,我们该怎么办?我的简短回答是创新,需求实在太高了,看看未来几年数百亿美元的市场机会。到2028年,市场规模将达到那么大,这对创新是一个巨大的拉动。
当你拥有这么大的市场时,意味着我们将持续创新。如何让这些GPU更高效?如何让GPU和CPU更高效地协同工作?但更重要的是,如何支持那些变化不那么快的算法,这样你就不需要GPU和CPU的全部可编程性?我们也支持定制设备和专用设备,客户可以与我们合作开发,我认为我们会看到整个谱系。
我只想说,为了展示我们的承诺,我们刚刚在CPU和GPU计算方面,针对最苛刻的AI和超级计算工作负载,达成了一个里程碑,我们在2020年设定了到2025年实现30倍提升的目标。在五年时间里,从2020年到2025年,我们要实现能效比30倍的提升。就在几周前,随着新一代MI350系列的推出,我们不仅达到了30倍的能效提升,实际上达到了38倍。
能效与技术里程碑
Mark Papermaster:我们设定了可衡量的里程碑来激励团队追求效率,我们与教授和大学合作,确保这不是营销噱头,这是最终将交付的真实效率,现在我们正朝着下一个里程碑前进。负责此事的Sam Naffziger刚刚再次与社区和教授合作,制定了一个机架级效率提升目标。正如我所说,现在这些都在机架层面扩展,即如何将这些AI计算集群组合在一起,我们承诺到2030年在机架层面实现20倍提升,这是我们下一个聚焦的能效里程碑。
Michael Krigsman:你谈到了算法可能发生重大变化所需的创新潜力,你也谈到了可持续性的需求,目前你还关注哪些其他重大问题?
AI技术的整体设计与竞争
Mark Papermaster:我们别无选择,Michael,我们必须审视整个格局,我们每天都在担心,首先是即将到来的颠覆性技术,我们有一支出色的研究团队,他们不断展望未来的计算技术,以及如何互联这些计算以提高效率,我们的网络技术,通过收购Xilinx和Pensando,拥有非常创新的网络方案,这是用于互联这些AI计算的超棒技术,现在随着我们收购ZT Systems,格局还包括机架设计并推动该领域的创新。
我们称之为整体设计,它必须是跨学科的,所有这些团队——硬件和软件——协同工作,不仅设计下一代,还要展望未来一到两代。什么是颠覆性的?什么即将到来?我们正在与他人合作开展量子计算,我不想陷入量子何时主流化的争论,量子最初将作为加速器出现,它将是那些真正能从量子中受益的定制化应用,但我们会在那里,我们产品组合中基于Xilinx的FPGA目前已被用作几乎所有量子计算机的控制器,我们也在利用产品组合的其他部分,成为能与那些量子加速器协同工作的CPU和GPU组合,这只是一个例子,但Michael,我们必须关注的是整个格局,不仅是今天的产品,还有下一代和下下一代。
Michael Krigsman:还是Chris Peterson的问题:"AMD、NVIDIA等公司似乎在AI整体设计方面正面竞争,那与Cerebras等利基玩家竞争的计划呢?他们有截然不同的方案。"我对你与NVIDIA的竞争以及Chris Peterson提到的其他利基玩家的竞争都很感兴趣。
Mark Papermaster:我们是计算技术的大规模生产商,在利基应用中争当第一对我们并无好处。Cerebras,我非常认可那个团队,Andrew Feldman和团队在晶圆级集成方面做得非常出色。有些任务非常适合那种模型,能够利用晶圆级的数据流处理,确实会有优势,但那是特定工作负载才能真正受益。
他们在那方面做得很好,我们会关注,如果适合那类应用的工作负载在增长——我对其他专注于特定领域的初创公司也可以这么说——我们会密切关注。如果客户告诉我们那正在获得关注,越来越多的模型可以利用那种方案,我们会把那些方法纳入我们的计划,但考虑到AMD在行业中的角色,我们也必须确保在倾听。我们确实在关注,并确保在大规模AI计算方面领先一到两步。
领导力、沟通与AI整合
Michael Krigsman:你提到的两个核心主题是执行力,以及简化来说,就是保持对行业动态和发展方向的敏锐感知,我理解得对吗?
Mark Papermaster:完全正确,我的日常管理方式与我在AMD担任CTO以来的做法没有任何不同,那就是优先保持对行业的敏锐感知。我优先安排客户拜访,飞去见客户或像今天这样安排虚拟会议,我确保自己处于倾听模式,我不会一上来就自吹自擂说'你应该用AMD,我们能给你更好的总体拥有成本,我们能帮你省钱,我确实会提到这些,我肯定会融入这些内容,但那不是我去拜访的原因。我首先要了解他们面临什么挑战,并确保我们的产品组合能应对,然后我才能教育他们,展示我们能在哪些方面为来优势。
同样,我们关注竞争,我在AMD内部有一个定期流程——竞争评审,我们关注竞争对手的任何公告,因为我们永远不能傲慢。AMD绝不能有‘哦,我们就是比所有人都好,我们的路是对的,别人做的都是错的'这种态度。恰恰相反,我们看,并且不断自问,我们有没有那个最佳实践?如果别人有更好的方法,那就再次超越,用它来激发我们的创新,确保我们不会在任何方面处于劣势。
Michael Krigsman:关于这个话题,LinkedIn上的Christine Lofgren问到了使你能够快速响应、创新并做到你所描述的那些事情的领导力实践。
Mark Papermaster:我们常常低估基本沟通技能的重要性,你可能觉得这听起来很老套。当然,你必须善于沟通。我告诉你,这是最重要的。我花了四十年来打磨我的沟通技能,沟通是双向的,你以为你在听,你真的在听吗?你有没有把对方说的话复述一遍,确认你理解对了?
这适用于外部和内部,同时也是你如何向团队传达北极星目标的方式,整个工程团队是否在优先事项和实现目标的方式上保持一致?这需要投入和出色的沟通,对客户,我们是否真正阐明了我们的价值主张、AMD的定位,以及我们如何为他们创造价值?无论对内还是对外,我认为沟通都至关重要。
它必须与致胜战略相结合,如果你花时间真正制定一个战略,让我们所有投资的差异化、我们如何创造价值、我们如何获胜都清晰明了,再将其与出色的沟通相结合,这就是你获胜的方式。
Michael Krigsman:对于企业高管的良好沟通,你有什么快速建议吗?这似乎是个显而易见的话题,但你刚刚强调了它的深层重要性。
Mark Papermaster:你必须投入时间,对我来说现在已经很自然了,因为我已经做了几十年,但并非一直如此,我投入时间来打磨技能,这意味着你必须让自己处于不舒适的环境中,强迫自己去不舒适的地方,那可以是内部沟通或外部沟通,走出你一直待的舒适区,拓展自己,获取反馈。
Lisa Su总说:"反馈是礼物。"确实如此,放下面子,从那些你知道会说真话的人那里获取反馈,而不是从那些会讨好你、说'哦,是的,太棒了'的人那里,获取未经过滤的反馈。
最后,在AI时代,使用AI。我每天都在使用AI来帮助我获取信息以做出更好的决策,也用于沟通,它帮我校对写的内容,指出不清楚的地方,分析我刚写的沟通内容的语气,它就像那个越来越好的得力助手,每一代都在进步,随时为你服务。
Michael Krigsman:你作为AMD的CTO,刚才把它称为"他们",这难道不令人惊叹吗?
Mark Papermaster:为什么?因为你就是那样用的。当你部署AI时,你会想'我需要帮助。我是找这个人帮忙,还是那个人帮忙?还是我想让AI帮我?'这就是我的想法。
推理模型与计算挑战
Mark Papermaster:我想大多数人现在都开始这样想了。
Michael Krigsman:我每天使用无数个模型,绝对是的,我确实是这样想的。
Mark Papermaster:Michael,你用过一些新的推理方法和研究推理能力吗?你试过那些能力吗?你用过?
Michael Krigsman:哦,是的,一直在用,现在我面临的最大挑战之一是弄清楚什么任务该用什么模型。如果你用错了推理模型,你会坐在那里等20分钟,最后得到一个错误的答案。
Mark Papermaster:完全正确,如何部署、如何提示、如何迭代非常重要,你之前问我算法变化对AMD有什么影响。现在我们进入推理阶段,以及衍生出大量任务的自主流程,我可以告诉你,这对我们计算引擎的部署方式产生了巨大影响。
当你进行推理时,意味着你要经过多轮推理循环。你一遍又一遍地进行机器学习处理的前向链,以获得更高的准确性,但主要也是为了更大的上下文窗口,你在之前推理循环得到的答案基础上继续构建。你想记住那些,但想在此基础上发展,可能想用不同的专家模型或不同类型的模型,结果就像你必须管理一个包含所有上下文的数据库,它需要强大的CPU,而这正是AMD所拥有的,我们看到越来越多的场景需要强大的CPU与GPU配对,才能在推理和研究这些新推理模式下有效运行。
同样,对于自主式AI,你可以编程让它处理多项任务,它可以去调用API——应用程序编程接口——并衍生出其他任务,我们发现这些通常在CPU上运行,这确实在驱动AI计算的不同组合。
Michael Krigsman:你们是否在指导软件技术合作伙伴——模型开发者——在何时将特定任务卸载到CPU或GPU、何时来回切换等方面的最佳实践?
Mark Papermaster:当你思考我们与模型开发者的互动时,他们是模型本身的深度专家,我们是跨不同计算设备的通信调优以及如何将其与算法能力匹配的深度专家,这非常像是一种双向交流,一种令人惊叹的头脑风暴。
AMD的全球扩张与AI战略
Michael Krigsman:我们有一个来inkedIn的问题,完全换个话题,来自Dr. Ankur Upadhyay,他说:"AMD未来的扩张计划是什么?在东南亚有什么计划吗?"
Mark Papermaster:我们在持续扩张,我们在亚洲已经有了增长,我们在马来西亚和新加坡已经运营了很多很多年,我想我们在马来西亚已经有50年了,我们继续在全球扩张,包括东南亚。在印度,我们今天有8000名员工,8000名工程师,我们正朝着2028年达到10000人的目标前进。在台湾、中国,我们也在看其他地区,不仅如此,我们在欧洲也在同等力度地扩张,我们是一家全球化跨国公司的典范,我们服务全球市场,我们的工程力量和销售团队都是真正全球化的。
Michael Krigsman:这是LinkedIn上Vishal Bhargava的问题,他说:"我们说的是哪些研究和推理产品?能否分享具体名称?"
Mark Papermaster:当我说研究产品时,我说的就是字面上的OpenAI Research,你可以订阅OpenAI的研究服务,它更贵,但你确实拥有我描述的那种研究能力,你也可以从Anthropic和其他模型那里获得类似功能。
Michael Krigsman:Ricardo de Anda在Twitter/X上又提出了一个问题,他说:"AMD在管理混合和多云环境中的机器身份方面面临的最大挑战是什么,尤其是在AI驱动自动化兴起的背景下?"
Mark Papermaster:身份认证是整个计算领域的一大重点,每次我们与其他计算机通信时,都会进行身份验证,以确保我们知道那是一个有效的、可信的计算设备。要最好地回答你的问题,我可能需要更多的上下文。
Michael Krigsman:地缘政治考量和供应链韧性的推动如何直接影响AMD的AI产品战略、研发投资和全球制造合作伙伴关系?我不想让这变成一个政治话题。
Mark Papermaster:我们的供应链,和业内所有公司一样,必须变得非常敏捷。由于关税适用于某些产品和某些采购地,我们需要有足够的灵活性来尽可能缓解这些影响。否则,我们的产品成本就会上升,我们确实在这样做,我们有一支出色的供应链团队,Keyvan和他的团队非常灵活。再说一次,我们是一家全球化公司,拥有全球制造能力,我们一直很敏捷。正如我所说,我们必须敏捷地调整产品、倾听客户并优化计算。事实证明,在当前的地缘政治环境下,我们的供应链也必须同样敏捷。
Michael Krigsman:LinkedIn上Christine Lofgren又提出了一个问题,她说:"在AMD内部和更广泛的科技行业中,你预计哪些关键趋势或发展将在未来12个月内塑造AI的走向?"
AI与自主式AI应用的未来趋势
Mark Papermaster:一个趋势是推理越来越多。模型创新层出不穷,我已经对一些能够创建针对特定任务的小语言模型的初创公司或企业印象深刻。我认为我们才刚刚开始,只是定制化模型冰山的一角,这些模型为独特任务带来创新,可以极其高效。我认为模型开发——包括定制化模型和小语言模型——将随着超大规模云服务商推动通用AI而提升大语言模型的准确性。我认为我们将在整个谱系上看到持续创新。
同样,基础技术本身——我们如何将其组合在一起——你将看到从超级计算到最小设备的巨大创新,以提高能效,这个领域有巨大的创新正在发生,从材料到新型晶体管,从内存如何更紧密、更高效地连接到计算设备,到网络等等。
Michael Krigsman:Mark,你提到了通用AI,你与这些模型开发者合作,处于非常独特的位置。你对模型未来的走向有什么想法,比如说未来一年?你认为一年后或九个月后,世界会走向何方?
Mark Papermaster:我们能看到九个月,我不确定能看到更远,九个月到一年,但当你看那个时间框架,你会看到这些模型的准确性持续提升,能处理更大的上下文,答案更加深思熟虑,特别是像我之前谈到的那些推理技术的应用,这一趋势在未来一年绝对会继续,同时需要越来越多的算力来支撑。
难回答的问题是五年后,五年后我们在哪里?AGI的定义到底是什么?五年后我们能实现吗?外界有很多争论,我把这个留给别人去预测AGI的定义和我们实现它的确切日期。
Michael Krigsman:你多次提到的自主式AI,它似乎是一种非常重要的架构——如果我们可以这样称呼它的话——而且短期内不会消失,你对此有什么看法?
Mark Papermaster:我和一家大银行的CIO交谈过,她向我描述了他们在自主式AI方面取得的进展,他们几乎让整个公司都参与了AI部署,每周他们都在发现可以通过创建agentic AI来加速的特定应用,想想看。
自主式AI在提升效率中的角色
Mark Papermaster:这是一个成熟的领域,银行处理交易,他们大量的时间花在定义明确的任务和定义明确的数据上,如果你能创建一个具有明确目标、明确数据集和明确定义的API来连接不同任务的自主式AI,它将带来非常快速的效率提升,我确实认为我们会越来越多地看到这种情况,我们当然也在AMD内部这样做,寻找自主式AI可以加速我们活动的流程。
Michael,这引出了你的问题,我简短地说,我想呼吁大家思考的是自主式AI。你在哪里能真正让人们更高效?人们是否愿意把时间花在自主式AI可以替他们完成的流程上?拥抱它,让自主式AI完成那些任务,释放时间用于创新、创造力,以及我们作为社会面临的真正由人驱动的机会。
Michael Krigsman:这种知识和分解流程的能力需要时间来普及,对于像你这样真正先进的技术专家来说,理解技术与业务流程之间的联系并能够分解,这是一回事,但整个行业需要经历一个成熟过程。
Mark Papermaster:完全正确,这既是文化层面的,也是技术层面的,因此确实需要时间,人们需要理解它,他们需要建立技术能力才能部署,但我认为它的发生速度会比我们预期的快得多。
给企业CIO和CTO的AI时代的建议
Michael Krigsman:Mark,在我们结束之前,基于你与大量客户的交流,你对当今大型企业中的CIO和CTO有什么建议?他们应该真正关注什么?
Mark Papermaster:第一,我会说,如果你没有比以往任何时候都更快地行动,那就有问题了。变革的节奏在过去几年中确实发生了转折,并且在我们任何人能预测的时期内都会继续。第一,如果你不适应变化,你就必须适应,我不是说不加管理地冒险,我们在AMD文化中推动的一点是承担风险但管理风险,确保你有制衡机制,不要在没有绳索保护的情况下走下悬崖边缘,以免坠入深渊。
我认为这是第一点,对变化保持开放,但要管理它以确保你在控制风险,第二点,与此相关的是退一步审视你的核心价值主张是什么,对吧?你在做的关键事情是什么?在AI时代,你能否真正重新架构你的做事方式?你运营业务的基本流程和方法中,有哪些可以在AI时代重新架构?
这是我想与CIO和基础设施负责人分享的两个最重要的建议,我还想说,帮助AMD实现创造一个有开放生态系统和竞争的环境,而不是一个主导供应商独大的环境,我认为那对所有人都不好。
结束语与未来展望
Michael Krigsman:就我个人而言,我想要更快的芯片,这样我就能更快更快地渲染视频、做各种事情,而且不要那么热。
Mark Papermaster:这是一个永无止境的追求,这就是像我这样的技术人员必须做的,我们别无选择,我们必须每天都专注于此。
Michael Krigsman:Mark Papermaster,AMD CTO兼执行副总裁,非常感谢你抽出时间与我们交流,我非常感激你,Mark。
Mark Papermaster:我的荣幸,Michael,谢谢你。
©本文为清一色官方代发,观点仅代表作者本人,与清一色无关。清一色对文中陈述、观点判断保持中立,不对所包含内容的准确性、可靠性或完整性提供任何明示或暗示的保证。本文不作为投资理财建议,请读者仅作参考,并请自行承担全部责任。文中部分文字/图片/视频/音频等来源于网络,如侵犯到著作权人的权利,请与我们联系(微信/QQ:1074760229)。转载请注明出处:清一色财经

微信扫码打赏
支付宝扫码打赏
