稳定性翻车!RTX PRO 6000曝Linux驱动Bug:FP32训练频发GPU锁死
RTX PRO 6000显卡在Linux下FP32训练频繁GPU锁死!驱动Bug导致Xid-8报错,RTX 4090却稳如磐石,快来了解故障原因与排查方法。
在NVIDIA开发者官方论坛,有用户反馈RTX PRO 6000 Blackwell(GB202,96GB)专业工作站显卡在Linux系统持续AI计算负载下会反复触发Xid-8 RC看门狗报错,GPU出现锁死现象,该问题同时复现于595.84、610.43.02两个开源内核驱动版本。
测试硬件平台为Raptor Lake桌面主机,系统Ubuntu 24.04,内核7.0.0-30-generic,开启Secure Boot,使用Canonical签名的NVIDIA开源GSP内核模块。
测试显卡为RTX PRO 6000 Blackwell,同时主机还搭载一块RTX 4090作为对照组,显卡功耗墙分别测试默认600W以及450W限制,两种功耗设置均会触发故障。

故障日志特征固定,RC看门狗检测GPU疑似锁死,超时7秒,抛出Xid 8错误,关联进程为llama-server或python3 AI计算进程,上层应用收到CUDA报错:launch timed out and was terminated。
比较幸运的是,该故障无需重启整机,显卡大约15秒就可以自动恢复,没有出现硬件损坏、数据损坏情况。
该故障最早在8月18日开始出现,累计复现13次,主要两类工作负载会触发,一是llama.cpp长上下文多Token推理,启用CUDA Graph。二是PyTorch FP32精度4B/9B大Transformer模型纯Eager模式训练。
在GPU满载持续压测的条件下,大约每20-45分钟就会复现一次,FP32稠密训练是复现概率最高的场景。

与此同时用户做了大量隔离排查,排除多项诱因:
1、关闭CUDA Graph可以缓解llama.cpp推理场景的报错,但PyTorch训练场景本身没有使用CUDA Graph依旧会锁死,说明CUDA Graph只是放大问题的诱因,并非根源。
2、升级/降级驱动版本:595.84、610.43.02开源驱动,报错特征、故障频率没有变化。
3、ECC纠错全部归零,没有行重映射报错。
4、排除温度因素:故障发生时最高温度仅87℃,甚至从空闲升温到51℃就会触发故障。
5、排除显存不足:故障发生时剩余显存大于55GB。
6、功耗墙无关,450W、600W两种功耗限制均复现。
7、故障具备随机性,相同输入、干净重启后,崩溃发生位置不固定。
对比测试数据显示,同一台主机、完全相同驱动版本,RTX 4090(AD102)跑完全一样的FP32训练任务,连续26912步、合计5.35小时零报错。
而同机的RTX PRO 6000 Blackwell在相近负载下一晚上锁死5次,可以确定问题根源出在GB202这一代GPU上。

而且补充测试发现,BF16精度27B大模型训练、推理,连续8小时GPU满载没有复现故障。结合现象,该Bug和内核提交密度、单个Kernel执行时长存在关联,FP32高负载更容易触发。
发帖用户向NVIDIA反馈,怀疑是GB202平台GSP-RM内核、通道调度逻辑在高密度Kernel提交下存在已知缺陷,已经抓取故障发生一分钟内的完整nvidia-bug-report日志,可在一小时内稳定复现该问题。

