快科技 9 月 30 日消息,海外用户 Future_Fuel_8425 分享了一段自己本地跑大模型的经历,其在一台搭载 128GB DDR4 ECC 内存的工作站上运行 35B 参数大模型 Ornith-1.5-35B-A3B,仅 90 分钟后就烧坏了一根 DDR4 内存条,8 至 9 天后第二根也开始报错。
该用户使用的是 2019 年款 ThinkStation P920,配备双路至强处理器和 128GB DDR4 ECC 内存(16 根 8GB 内存条),显卡为 RTX 5070 Ti 16GB。
此前半年该用户一直运行 20B 及以下的小模型,全部装在显存中,即使长时间高负载运行也没出过问题。
这次因数据库任务需要更大模型,切换到 35B 的 Ornith-1.5 后,模型部分溢出到系统内存,90 分钟后系统崩溃,日志显示第 8 插槽的内存条 ECC 错误堆积,拔掉该内存条后恢复正常。
没想到继续重度使用 8 至 9 天后,日志显示另一根内存条也即将失效。
用户强调温度不是问题,CPU 从未超过 80 ° C,GPU 很少超过 65 ° C,还配备了辅助散热,所有内存条均为同一批次匹配条,推测只是老化严重,经不住长时间高强度的连续读取。
不过用户只提到了 CPU 和 GPU 温度,并未展示内存温度数据,DDR4 内存老化和长时间连续顺序读取高负载叠加,加上内存条本身散热条件有限,很可能是内存损坏的真实原因。

【本文结束】如需转载请务必注明出处:快科技
责任编辑:黑白


登录后才可以发布评论哦
打开小程序可以发布评论哦