固件更新中 4小时前
途虎养车自建统一AI存储平台:小文件写入速度提升5.5倍,管理超1亿文件
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

当一家公司的存储架构里同时跑着 NFS、Alluxio、MinIO、Ceph 和 SeaweedFS 时,运维团队每天面对的不是技术创新,而是碎片化带来的无尽痛苦。途虎养车在业务规模扩张到 1.629 亿注册用户、全国 8008 家服务中心之后,彻底被逼到了存储架构的拐点。

起初为了追求开发速度,各个应用各自为战、独立搭建存储系统。这种打法在公司早期确实爽,需求来了直接怼一套独立方案,谁也不耽误谁。但随着云原生、大规模 AI 训练和推理的铺开,代价开始反噬——数据在不同系统间搬来搬去成本极高,每种存储都有自己的部署模型、接入协议和排障逻辑,运维复杂度和性能瓶颈同时爆发。

途虎最终选择在现有 Ceph 私有云基础设施上建一个统一平台,技术栈锁定 JuiceFS 加 TiKV 再加 Ceph RADOS 对象存储集群。这套架构用一个数据访问层把 AI 训练、AI 推理和大数据处理全部收拢进来,不再需要为每个场景单独维护一套存储。目前平台上管理的小文件数量已经超过 1 亿个。

性能提升直接体现在测试数据上。在低并发基准测试中,小文件顺序写入性能最高提升了 5.5 倍,小文件读取性能提升了 3.2 倍。这套方案还专门针对 Ceph RADOS 数据路径做了生产优化,包括纠删码池配置、降低小文件写放大、以及提升容器化部署的稳定性。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 技术创新 云原生 拐点 基础设施
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论