【天极网 DIY 硬件频道】过去几年,DLSS 技术在玩家群体中的印象相当固定:从最早的超分到后来的帧生成,它一直在做减法,把渲染分辨率压下去,再通过 Tensor 核心与 AI 算法把画面 " 脑补 " 回来,在尽量减少画质损失的同时让帧率更加好看,但 DLSS 5 改变了这种印象。它引入 3D 引导神经网络渲染,不再放大像素,而是由生成式模型在整张画面上重绘光影与材质。NVIDIA 也明确表示,这项技术平均产生多达 50%-60% 的性能损失,旗舰卡也不例外。

麻烦还不止于此。传统超分按渲染分辨率计算负载,原生画面越小越轻松 ; 神经渲染负载却与最终输出的完整像素总量强相关。哪怕内部渲染压到 720p,只要输出是 4K,模型照样要在 830 万个像素上跑完运算。对玩家而言,熟悉的 DLSS 性能档位减负效果,在面对新一代 DLSS 5 神经渲染时更加捉襟见肘,超分能换回的收益只剩三分之一左右。
我们很容易想到,既然一张显卡既运算游戏、又跑神经渲染模型会忙不过来,那何不将相对独立的负载拆成两部分。9 月 7 日,开发者 maohgad-web 在 GitHub 开源了项目 Neural Coprocessor,核心是一个叫 MGPU Bridge 的 ReShade 插件。思路很直接:一张显卡运行游戏本身的计算与光栅渲染,另一张全权负责神经渲染,以分工方式把负载解耦。
这条路走得通,是因为神经渲染恰好是渲染管线的最后一个环节。它接收一张画完的帧、返回一张完工的帧,中间不参与几何与光栅 ;NVIDIA 也确认它跑在 Blackwell 第五代 Tensor Core 上,与帧生成不同,不需要等待下一帧。既然它不挑设备,又没有上下文依赖,就机会被拿到另一套硬件上执行。

具体做法分五步:先从交换链识别游戏在哪块适配器上渲染,再在另一块适配器上建立自己的 D3D12 设备,然后把每张完成的帧通过跨适配器共享堆复制,由副卡执行神经渲染,最后在副卡自己的窗口里输出。最后一步同样关键:结果不回传主卡,这是因为画面的数据量来回传输只会挤占 PCIe 带宽,并进一步提升延迟。
不过这套流程也有它的问题:神经渲染依赖游戏引擎给出的运动矢量与深度,而游戏不一定在任何场景下都支持这一点。项目作者在文档里描述称,引擎级运动矢量只在游戏本身启用 DLSS 或 DLAA 时才可用 ; 如果游戏用的是 TAA 等传统抗锯齿,模型就只能退回到从画面颜色反推运动,也就是早期版本的做法。作者在《战地 6》上实测,开启 DLSS 或 DLAA 时 96% 到 98% 的帧能拿到可用运动矢量,切到 TAA 则一帧都拿不到。也就是说,这套方案的适配性更多取决于游戏对相关技术的支持。
作者用两张 RTX 5060 Ti 16GB 做了实测演示,游戏是以 1080p 运行的《黎明行者之血》。DLAA 档运行时的 67 至 70 帧,开启神经渲染后掉到 44 帧,将负载挪到副卡后可重回约 70 帧 ;DLSS 性能档 127 至 131 帧开启神经渲染后掉到 59 帧,借助副卡可跑到 106 至 107 帧,同时主卡核心温度可下降约 21 摄氏度。

项目作者认为:比起帧率,不同档位下 DLSS 5 超分性能与神经渲染之间此消彼长的关系更值得观察。由于神经渲染会把运行它的设备吃满,永远按输出分辨率运行,开销几乎不随档位下降,而渲染负载却不断被挤占,于是性能档超分相比原生 ( DLAA ) 不再能带来理想的性能提升结果,单卡只能带来 39% 的增益,而将神经渲染负载搬到副卡则能保住 86%。
测试结果显示,对比单卡跑神经渲染状态,游戏的整体性能提升可达 127%,但如果对比关掉神经渲染的原生性能,副卡方案仍然损失 8% 到 17%,证明了这套方案本身的额外损耗。另外,这个项目已经迭代到 0.2.3,修复搭载 NVIDIA Streamline 的游戏里启动崩溃的问题,以及《赛博朋克 2077》开启光线重建时的深度绑定失败,还改进了核显检测功能。据称 RTX 40 系显卡配合改版模型文件,作者也确认已经可用。
双卡方案虽然从性能角度让 DLSS 5 神经渲染变得更加可用,但也存在不少实际限制。它只支持 DirectX 12,需要两张较高规格的新一代 RTX 显卡和两台显示器,需要特定版本的 ReShade 构建且不能再装其他插件,模型文件还要自备。帧生成作者未测试也不推荐,多数游戏中 UI 的运动矢量仍然缺失,色彩处理没有完全实现,画面可能发灰,需要手动调节。作者本人在演示中明确标注:端到端延迟未测量,画质也未做过评估,0.1.0 版本的项目测试只覆盖两台机器和有限几款游戏。

小结
官方在 GTC 上第一次演示 DLSS 5 时,用的就是两张 RTX 5090,社区做的事,是把接近官方演示使用的架构复现并开源。但这一社区项目目前不受官方支持,也不会有相关技术适配。同时因为它靠 ReShade 注入工作,在带反作弊的在线游戏里运行无疑产生封号风险。此外物理分工也带来不可避免的代价,帧要跨卡传递,图形管线被整体拉长,延迟的提升不会因为帧率好看就消失。
这不像是很多人想的 SLI 复活:主卡独立计算和渲染游戏帧,副卡只是以神经渲染处理图像收尾,不会带来性能叠加或者说帧率翻倍。比起 SLI 它更像是十几年前那张专门跑 PhysX 物理计算的加速卡。这也不意味着以后人人都得插两张显卡,而是指向了一个点:当重度负载的 AI 应用进入日常的生活、工作与娱乐,我们可能比以往任何时候都更需要一种独立的加速硬件。
社区甚至在探索一种有趣的可能:先使用 A 卡计算渲染游戏帧,再使用 N 卡进行神经渲染处理。这种跨生态的混合架构能否真正成为现实,我们也将继续关注。


登录后才可以发布评论哦
打开小程序可以发布评论哦