驱动之家 23小时前
稳定性翻车!RTX PRO 6000曝Linux驱动Bug:FP32训练频发GPU锁死
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

快科技 9 月 2 日消息,在 NVIDIA 开发者官方论坛,有用户反馈 RTX PRO 6000 Blackwell(GB202,96GB)专业工作站显卡在 Linux 系统持续 AI 计算负载下会反复触发 Xid-8 RC 看门狗报错,GPU 出现锁死现象,该问题同时复现于 595.84、610.43.02 两个开源内核驱动版本。

测试硬件平台为 Raptor Lake 桌面主机,系统 Ubuntu 24.04,内核 7.0.0-30-generic,开启 Secure Boot,使用 Canonical 签名的 NVIDIA 开源 GSP 内核模块。

测试显卡为 RTX PRO 6000 Blackwell,同时主机还搭载一块 RTX 4090 作为对照组,显卡功耗墙分别测试默认 600W 以及 450W 限制,两种功耗设置均会触发故障。

故障日志特征固定,RC 看门狗检测 GPU 疑似锁死,超时 7 秒,抛出 Xid 8 错误,关联进程为 llama-server 或 python3 AI 计算进程,上层应用收到 CUDA 报错:launch timed out and was terminated。

比较幸运的是,该故障无需重启整机,显卡大约 15 秒就可以自动恢复,没有出现硬件损坏、数据损坏情况。

该故障最早在 8 月 18 日开始出现,累计复现 13 次,主要两类工作负载会触发,一是 llama.cpp 长上下文多 Token 推理,启用 CUDA Graph。二是 PyTorch FP32 精度 4B/9B 大 Transformer 模型纯 Eager 模式训练。

在 GPU 满载持续压测的条件下,大约每 20-45 分钟就会复现一次,FP32 稠密训练是复现概率最高的场景。

与此同时用户做了大量隔离排查,排除多项诱因:

1、关闭 CUDA Graph 可以缓解 llama.cpp 推理场景的报错,但 PyTorch 训练场景本身没有使用 CUDA Graph 依旧会锁死,说明 CUDA Graph 只是放大问题的诱因,并非根源。

2、升级 / 降级驱动版本:595.84、610.43.02 开源驱动,报错特征、故障频率没有变化。

3、ECC 纠错全部归零,没有行重映射报错。

4、排除温度因素:故障发生时最高温度仅 87 ℃,甚至从空闲升温到 51 ℃就会触发故障。

5、排除显存不足:故障发生时剩余显存大于 55GB。

6、功耗墙无关,450W、600W 两种功耗限制均复现。

7、故障具备随机性,相同输入、干净重启后,崩溃发生位置不固定。

对比测试数据显示,同一台主机、完全相同驱动版本,RTX 4090(AD102)跑完全一样的 FP32 训练任务,连续 26912 步、合计 5.35 小时零报错。

而同机的 RTX PRO 6000 Blackwell 在相近负载下一晚上锁死 5 次,可以确定问题根源出在 GB202 这一代 GPU 上。

而且补充测试发现,BF16 精度 27B 大模型训练、推理,连续 8 小时 GPU 满载没有复现故障。结合现象,该 Bug 和内核提交密度、单个 Kernel 执行时长存在关联,FP32 高负载更容易触发。

发帖用户向 NVIDIA 反馈,怀疑是 GB202 平台 GSP-RM 内核、通道调度逻辑在高密度 Kernel 提交下存在已知缺陷,已经抓取故障发生一分钟内的完整 nvidia-bug-report 日志,可在一小时内稳定复现该问题。

【本文结束】如需转载请务必注明出处:快科技

责任编辑:青山

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

gpu linux 开源 ai nvidia
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论