科技资讯网 4小时前
从EPYC到Helios,AMD携手Meta开拓AI未来
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

需要了解的三大要点

Meta 和 AMD 正在携手开展全栈 AI 基础设施的联合开发 – 涵盖 AMD Helios 机架级解决方案、AMD EPYC CPU、AMD Instinct GPU、AMD Pensando 网络和 ROCm 软件,其所有均针对 Meta 的 AI 工作负载进行了优化。

两家公司正在针对吉瓦级部署进行设计,共同开发集成了计算、内存、网络、功耗、散热和软件的完整 AI 系统,以加速大规模 AI 训练和推理。

Meta 正在扩大跨多代 AMD 产品的部署,作为第六代 AMD EPYC "Venice" 的主要客户,其同时还将 AMD Instinct MI300X 升级至 MI350X,并进一步采用基于定制 MI450 的 GPU。

AI 正在改变的不仅是数据中心所承担的任务,也改变了其设计方式。在 Meta,无论从训练、推理、推荐和排序、内容达到为数十亿人提供全新的 AI 体验,AI 基础设施的需求都在飞速增长,满足这一需求不仅仅是增加 GPU 或服务器,它还需要以业界前所未有的速度,在整个数据中心内加强 AI 处理能力。

Advancing AI 2026 峰会上,在 Meta 基础设施负责人 Santosh Janardhan 与 AMD 董事会主席及首席执行官苏姿丰博士(Dr. Lisa Su)的对话中阐述了 Meta 是如何应对这一增长的新阶段,以及为什么与 AMD 等合作伙伴之间的深度合作正在变得日益重要。

设计吉瓦级AI基础设施

传统数据中心架构通常侧重于优化单个服务器或组件,但 AI 已经改变了这种模式。如今 AI 平台的性能取决于计算、网络、内存、功耗、散热和软件能否高效协同运作。而对于 Meta 这样的规模而言,这些要素无法被独立设计。

整个基础设施必须作为一个集成式 AI 系统设计,在吉瓦级规模下高效可靠地运行。

这种转变正在推动基础设施运营方与技术合作伙伴之间开展更深入的协作。Meta 和 AMD 不再是在开发周期结束时选择成品组件,而是从硅芯片到软件在需求和工程决策上就保持一致。灵活性与规模同样重要:训练、推理、推荐系统以及新兴的智能体应用各自对基础设施提出不同要求。

携手AMD EPYC共同推动AI

一个开放的、异构的架构能够帮助 Meta 为每项工作负载匹配适当的硬件,同时在整个集群中保持高利用率。这正是 Meta 与 AMD 不断深化合作的基础:联合开发支持多样化且快速演进的 AI 工作负载组合所需的硅芯片、系统和软件。

双方的合作涵盖多个世代的 AMD EPYC 处理器 - 包括 Milan、Bergamo、Turin 和现在的 Venice。Meta 已在其基础设施中部署了数百万颗 EPYC CPU,并作为 "Venice" 的主要客户与 AMD 保持密切合作,该 CPU 预计将提供更多核心、更高性能、更佳能效,并在对 Meta 工作负载尤为重要的领域实现定制化。Meta 目前正在其实验室中对基于 "Venice" 的平台进行验证,早期结果令人鼓舞,双方团队正在为大规模部署做准备。

随着 AI 系统变得更加具备智能体特性,CPU 的角色也越来越重要。GPU 仍然是训练和推理的核心,但 CPU 在协调智能体、执行工具、运行代码、管理数据以及统筹围绕 AI 模型的更广泛系统方面承担着越来越多的职责。随着这些工作负载的增长,CPU 与 GPU 性能之间的平衡变得更加关键。Meta 计划在 "Venice" 的部署基础上继续推进,并与 AMD 在 "Verano" 以及未来的 EPYC 代际路线图上保持合作。

基于 Instinct GPU 共同设计 AI 基础设施

双方在 GPU 和机架级系统领域的合作也取得了显著进展。今年早些时候,Meta 通过开放计算项目(Open Compute Project)推出了 Open Rack Wide(ORW)规范,定义了一种专为 AI 规模基础设施打造的开放式机架架构。

AMD Helios 机架级解决方案基于 ORW 标准构建,将 AMD 对开放性的承诺从芯片和软件延伸至系统、机架以及大规模集群。Helios 将 AMD Instinct GPU、EPYC 处理器、AMD Pensando 网络以及 ROCm 软件集成于一个经过完整工程设计的机架级平台中,旨在满足吉瓦级规模部署所需的性能、能效和可维护性需求。

这一共同的架构理念使双方能够随着每一代 Instinct 加速器的演进开展更深入的合作。双方合作始于 MI300X,该产品让双方积累了在超大规模环境中运行 AMD Instinct 的经验,同时针对基于 AMD ROCm 软件的生产工作负载进行优化。MI350 系列进一步将双方合作拓展至 AI 训练领域,包括支撑 Meta 平台的推荐和排序模型。

如今,Meta 计划部署基于定制化 Instinct MI450 的 GPU,这体现了双方合作已从产品部署进一步发展到深度端到端平台联合设计。

Meta 已获得 Helios 的早起使用权限,并正在对该平台进行测试。双方工程团队正围绕硬件、软件、系统集成以及面向工作负载的构建开展协同工作。

这项工作将支持 Meta 基于 AMD GPU 部署最高达 6 吉瓦基础设施的计划。在这一规模下,提前开展合作至关重要,因为有关功耗、散热、网络、内存和软件的决策无法等到最终认证阶段才进行,而必须从一开始就进行综合考虑。

共同构建下一代AI基础设施

下一代 AI 基础设施将通过把数据中心视为一个完整系统来构建,并在设计过程的更早阶段对工作负载、硅芯片、网络、系统和软件进行协同对齐。

这种合作已经在影响未来的 AMD 平台,包括 AMD Instinct MI500 加速器以及下一代机架级系统。借助 Meta 在为数十亿用户运营基础设施方面的经验,与 AMD 的 CPU、GPU 和系统路线图相结合,双方旨在更快速、更高效地部署 AI 能力,并具备满足未来工作负载所需的灵活性。

关于AMD

AMD(纳斯达克代码:AMD)致力于推动高性能和人工智能计算创新,助力应对全球重大挑战。如今,AMD 的技术驱动数十亿应用体验,广泛用于云和人工智能基础设施、嵌入式系统、AI PC 及游戏领域。凭借一系列面向人工智能优化的 CPU、GPU、网络技术及软件的丰富产品组合,AMD 提供全栈式人工智能解决方案,为智能计算新时代带来所需的卓越性能与可扩展性。更多信息,敬请访问 AMD 公司官网 www.amd.com。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai amd 数据中心 基础设施 首席执行官
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论