驱动之家 昨天
128GB DDR4跑35B大模型!90分钟就烧坏一根、9天后第二根又告急
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

快科技 9 月 30 日消息,海外用户 Future_Fuel_8425 分享了一段自己本地跑大模型的经历,其在一台搭载 128GB DDR4 ECC 内存的工作站上运行 35B 参数大模型 Ornith-1.5-35B-A3B,仅 90 分钟后就烧坏了一根 DDR4 内存条,8 至 9 天后第二根也开始报错。

该用户使用的是 2019 年款 ThinkStation P920,配备双路至强处理器和 128GB DDR4 ECC 内存(16 根 8GB 内存条),显卡为 RTX 5070 Ti 16GB。

此前半年该用户一直运行 20B 及以下的小模型,全部装在显存中,即使长时间高负载运行也没出过问题。

这次因数据库任务需要更大模型,切换到 35B 的 Ornith-1.5 后,模型部分溢出到系统内存,90 分钟后系统崩溃,日志显示第 8 插槽的内存条 ECC 错误堆积,拔掉该内存条后恢复正常。

没想到继续重度使用 8 至 9 天后,日志显示另一根内存条也即将失效。

用户强调温度不是问题,CPU 从未超过 80 ° C,GPU 很少超过 65 ° C,还配备了辅助散热,所有内存条均为同一批次匹配条,推测只是老化严重,经不住长时间高强度的连续读取。

不过用户只提到了 CPU 和 GPU 温度,并未展示内存温度数据,DDR4 内存老化和长时间连续顺序读取高负载叠加,加上内存条本身散热条件有限,很可能是内存损坏的真实原因。

【本文结束】如需转载请务必注明出处:快科技

责任编辑:黑白

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

gpu 数据库 举报
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论