快科技 7 月 21 日消息,英特尔工程师近日向 Linux 内核提交了冷重置恢复补丁,专门针对 Xe 显卡驱动的硬件错误处理,该补丁已历经近十二个版本迭代。
此前遇到电源管理单元(PUNIT)错误时,显卡在热重置或驱动重新加载后仍无法恢复,用户只能重启整台电脑。
补丁在 DRM 核心代码中引入了一种新的恢复方法:DRM_WEDGE_RECOVERY_COLD_RESET。当显卡因不可恢复错误被标记为失效时,驱动将请求冷重置而非系统重启。
这意味着显卡可以从硬件层面彻底断电再通电,无需牵连整台电脑。
DRM 核心会通过 uevent 向用户空间发出冷重置通知。随后,udev 等系统服务可根据配置自动执行相应操作。整个过程无需用户手动干预,系统在显卡发生严重错误时能完成自我修复,大大降低了运维复杂度。
该功能对数据中心和服务器场景意义重大。在大规模部署英特尔 Xe 显卡的 AI 推理和云游戏环境中,GPU 错误导致的整机重启会严重影响服务可用性。冷重置恢复机制可将停机时间从分钟级缩短至秒级。
目前补丁已发布在 dri-devel 邮件列表上供社区审查。未来英特尔 GPU 在 Linux 上遇到特定 PUNIT 硬件错误时,系统可自动执行设备级冷重置,无需重启整机。



登录后才可以发布评论哦
打开小程序可以发布评论哦