【CNMO 科技消息】AI 数据基础设施公司 Weka 与高性能计算平台 Andromeda 近日宣布达成战略合作,Weka 的 NeuralMesh 平台将作为 Andromeda 管理型 GPU 集群的核心 AI 数据存储层。通过专用 NeuralMesh 或 GPU 原生方式的 NeuralMesh Axon 部署,Andromeda 的客户可在不同超大规模计算服务商和 AI 云环境中获得一致的存储性能。

图源网络
Andromeda 致力于让开发前沿技术的所有团队都能获取高性能计算资源,使创新由想法本身而非硬件可及性驱动。该公司与主要 AI 研究机构、数据中心和云服务提供商合作,在全球供应链中分配训练和推理工作负载。目前 Andromeda 已与全球 50 余家计算提供商建立合作,通过不断增长的管理型集群网络路由训练和推理工作负载。
Andromeda 平台上的所有集群无论由哪家运营商管理,都必须满足相同的质量标准。公司在向客户提供服务前,会对每个集群的 GPU、存储、网络架构和安全进行认证。在此过程中,不同供应商的存储环境差异导致集群间性能参差不齐的问题逐渐显现。
通过与 Weka 合作,Andromeda 在现有硬件上实现了显著的性能提升,可在几分钟内完成部署,确保所有供应商的一致性,同时降低存储成本。Andromeda 首席执行官威尔 · 穆谢表示,公司的目标是实现计算的全球流动,这意味着提供的每个集群无论容量来自何处都必须正常运行。通过 Weka NeuralMesh 实现标准化后,客户在决定性能的存储和内存层同时获得了超大规模服务商级别的一致性和开放市场的灵活性。他补充道,闲置的 GPU 正在阻碍 AI 创新的速度,Weka 帮助 Andromeda 管理的所有 GPU 都能充分发挥作用。
NeuralMesh Axon 是 NeuralMesh 软件平台的 GPU 原生部署方式,将存储直接集成到 Andromeda 的 GPU 服务器中,通过将集群现有的 NVMe 转换为统一的高性能数据层,以最高速度为训练和推理供应数据。由于该基础设施已安装在机架中并通电运行,成本也已支付,因此可在不增加额外空间、电力消耗和费用的情况下仅提升性能。
借助 NeuralMesh Kubernetes Operator,Andromeda 可在几分钟内构建完整的 NeuralMesh 集群,并通过管理堆栈其他所有层的相同工作流管理整个集群网络。Andromeda 的 NeuralMesh 部署中约一半采用 NeuralMesh Axon 方式运营,另一半则为需要将所有 GPU 核心和每 GB 内存专用于自身工作负载的客户提供专用 NeuralMesh 部署。无论部署位置如何,NeuralMesh 都能为底层任何供应商的硬件提供相同的性能标准。这种可靠性使 Andromeda 能够将客户接入此前没有共享存储的集群。
合作带来的实际效果已经显现。新的 NeuralMesh Axon 集群可在最短 10 分钟内完成部署,AI 团队从集群上线当天即可运行工作负载。环境启动加载时间从 3 分钟缩短至 30 秒,使 AI 团队每天能够进行更多实验。采用 NeuralMesh Axon 运营的 Andromeda 集群实现了每集群每秒超过 400GB 的持续吞吐量和实际运营环境中每秒超过 600 万 IOPS 的性能。得益于此,Andromeda 的一家生物技术客户可在几分钟而非几小时内完成涉及每目录 10 亿文件的元数据密集型传输任务。当集群存在故障扩散风险时,NeuralMesh 能够阻断故障传播,维持集群可用性,保护所有客户的工作负载。
版权所有,未经许可不得转载


登录后才可以发布评论哦
打开小程序可以发布评论哦