
Cloudera 宣布,通过与 NVIDIA 合作,已在 Cloudera Data Engineering 中为 Apache Spark 4.1 引入原生 GPU 加速功能。该功能将作为 Cloudera Anywhere Cloud 的一部分提供,旨在利用基于 CUDA-X 软件库的 NVIDIA cuDF 插件,帮助企业在不重写 PySpark 或 SQL 代码的前提下,显著提升 Spark 作业处理速度。
Apache Spark 广泛应用于提取、转换和加载(ETL)流程及各类分析工作负载。在传统 CPU 基础设施上,此类作业往往耗时数小时,不仅推高计算成本,还延缓了从原始数据到机器学习及报告就绪数据集的转化进程。Cloudera 表示,采用新配置的客户在 NVIDIA GPU 上获得的加速效果可达传统 CPU 系统的 4 倍。此外,该方案设计为无需手动配置驱动程序即可运行,并保留了 Cloudera 数据平台现有的治理与安全控制措施。
混合云环境与数据瓶颈
此次发布的核心亮点在于对混合环境的支持。组织可在公有云、私有云、主权云和本地系统之间运行加速后的 Spark 工作负载,同时保持一致的操作模式。这一策略特别吸引那些受法规、数据驻留要求或既有本地投资限制,无法将所有数据迁移至单一环境的大型企业。Cloudera 希望通过将 GPU 加速与其数据工程服务绑定,减少跨不同环境的定制调优需求。
Cloudera 首席产品官 Leo Brunnick 指出,许多组织在 AI 领域的瓶颈并非模型质量,而是数据处理的效率。"AI 的限制往往在于将原始数据转化为可信、可用洞察的速度。"Brunnick 表示," 加速 Spark 有助于消除这一瓶颈,使客户能更快从数据准备转向分析和 AI,同时将治理、安全和运营一致性置于战略中心。"
缓解云支出压力
随着 AI 部署从试点走向常规业务应用,云计算支出成为企业关注焦点。Spark 工作负载通常是数据资产中最大的经常性作业之一,即使运行时间适度缩短,也能显著降低每月基础设施账单。对于拥有大量 PySpark 和 SQL 代码库的公司而言,无需重写代码即可实现加速,比单纯的速度提升更具价值,因为它消除了迁移工作并降低了运营风险。
NVIDIA 战略合作伙伴关系副总裁 Pat Lee 强调,加速 AI 部署的最快路径是与企业现有运作方式相一致。" 随着 NVIDIA AI 基础设施和 CUDA-X 库成为 Cloudera Data Engineering 的原生部分,企业可以在不更改一行代码的情况下降低成本并大幅加快 Apache Spark 管道。"
此次更新不仅为 Cloudera 服务于混合云和本地资产客户增加了新功能,也将 NVIDIA 软件库的应用场景从 AI 模型训练和推理扩展至主流数据工程工作流中,使通过减少运行时间和降低计算使用来量化加速商业案例变得更加容易。
【星途科讯 图文丨伊贝 首发于 ZAKER 科技,转载请注明出处】


