快科技 9 月 2 日消息,在 NVIDIA 开发者官方论坛,有用户反馈 RTX PRO 6000 Blackwell(GB202,96GB)专业工作站显卡在 Linux 系统持续 AI 计算负载下会反复触发 Xid-8 RC 看门狗报错,GPU 出现锁死现象,该问题同时复现于 595.84、610.43.02 两个开源内核驱动版本。
测试硬件平台为 Raptor Lake 桌面主机,系统 Ubuntu 24.04,内核 7.0.0-30-generic,开启 Secure Boot,使用 Canonical 签名的 NVIDIA 开源 GSP 内核模块。
测试显卡为 RTX PRO 6000 Blackwell,同时主机还搭载一块 RTX 4090 作为对照组,显卡功耗墙分别测试默认 600W 以及 450W 限制,两种功耗设置均会触发故障。

故障日志特征固定,RC 看门狗检测 GPU 疑似锁死,超时 7 秒,抛出 Xid 8 错误,关联进程为 llama-server 或 python3 AI 计算进程,上层应用收到 CUDA 报错:launch timed out and was terminated。
比较幸运的是,该故障无需重启整机,显卡大约 15 秒就可以自动恢复,没有出现硬件损坏、数据损坏情况。
该故障最早在 8 月 18 日开始出现,累计复现 13 次,主要两类工作负载会触发,一是 llama.cpp 长上下文多 Token 推理,启用 CUDA Graph。二是 PyTorch FP32 精度 4B/9B 大 Transformer 模型纯 Eager 模式训练。
在 GPU 满载持续压测的条件下,大约每 20-45 分钟就会复现一次,FP32 稠密训练是复现概率最高的场景。

与此同时用户做了大量隔离排查,排除多项诱因:
1、关闭 CUDA Graph 可以缓解 llama.cpp 推理场景的报错,但 PyTorch 训练场景本身没有使用 CUDA Graph 依旧会锁死,说明 CUDA Graph 只是放大问题的诱因,并非根源。
2、升级 / 降级驱动版本:595.84、610.43.02 开源驱动,报错特征、故障频率没有变化。
3、ECC 纠错全部归零,没有行重映射报错。
4、排除温度因素:故障发生时最高温度仅 87 ℃,甚至从空闲升温到 51 ℃就会触发故障。
5、排除显存不足:故障发生时剩余显存大于 55GB。
6、功耗墙无关,450W、600W 两种功耗限制均复现。
7、故障具备随机性,相同输入、干净重启后,崩溃发生位置不固定。
对比测试数据显示,同一台主机、完全相同驱动版本,RTX 4090(AD102)跑完全一样的 FP32 训练任务,连续 26912 步、合计 5.35 小时零报错。
而同机的 RTX PRO 6000 Blackwell 在相近负载下一晚上锁死 5 次,可以确定问题根源出在 GB202 这一代 GPU 上。

而且补充测试发现,BF16 精度 27B 大模型训练、推理,连续 8 小时 GPU 满载没有复现故障。结合现象,该 Bug 和内核提交密度、单个 Kernel 执行时长存在关联,FP32 高负载更容易触发。
发帖用户向 NVIDIA 反馈,怀疑是 GB202 平台 GSP-RM 内核、通道调度逻辑在高密度 Kernel 提交下存在已知缺陷,已经抓取故障发生一分钟内的完整 nvidia-bug-report 日志,可在一小时内稳定复现该问题。
【本文结束】如需转载请务必注明出处:快科技
责任编辑:青山


登录后才可以发布评论哦
打开小程序可以发布评论哦