驱动之家 17小时前
显卡坏显存不用扔!Intel新驱动自动屏蔽故障区域:带病也能跑
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

快科技 9 月 19 日消息,据报道,Intel Xe 内核显卡驱动本周为 Linux 7.4 提交了新一轮更新,核心是显存健康监测与故障页面离线处理。

这意味着,一块仅有少量显存颗粒故障的 Intel 显卡,不必直接报废。驱动可以自动检测并屏蔽故障区域,把坏块拉黑,让显卡带病继续运行。

第一项更新是基础 vRAM 健康检查。Intel 工程师 Matthew Auld 解释,驱动在早期探测阶段将显存的最后一页作为金丝雀进行压力测试。BAR 映射、CCS 尺寸计算和恒等映射设置都会对最后一页发起检验,如果哪里算错了,最后一页就是最可能暴露问题的地方。

这一检查的直接动机来自部分 Battlemage 显卡的 CCS 偏移错误。Linus Torvalds 此前亲自发现,部分 BMG 显卡的 CCS 偏移被错误编程,导致本该保留的压缩存储被拉入正常显存分配器,引发黑屏和合成器反复重启。

更新是内存页离线支持,经过 21 轮评审后终于落地。当驱动收到 GPU 本地内存某地址存在故障的报告时,能够识别持有该页面的分配对象,清除或回收相应内存,并永久禁止该物理区域被后续分配使用。

故障页面通过 DebugFS 暴露给用户空间,系统管理员可在 /sys/bus/pci/devices/bdf/vram_bad_pages 路径下查看 GPU 本地内存的健康状态与页面退役情况,格式包含页面编号、GPU 页大小和状态标记。

这一特性的实际意义是带病运行。一块仅有少量 vRAM 页面故障的显卡,虽然可用显存略有减少,但仍可正常使用,避免反复将损坏页面分配给应用程序,从而防止花屏、死机和黑屏反复出现。

需要说明的是,vRAM 健康检查目前受 CONFIG_DRM_XE_DEBUG_MEM 内核构建标志控制,仅面向开发者与回归测试,普通用户不会在启动时看到探测过程。

内存页离线功能支持用户配置,但目前主要面向 Intel Crescent Island 平台。

【本文结束】如需转载请务必注明出处:快科技

责任编辑:红茶

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

intel gpu 物理 linux 编程
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论