快科技 9 月 15 日消息,独立开发者 Speedstu 近日开源了名为 "CUDA-for-AMD-Windows" 的项目,在 Windows 上实现了 AMD 显卡运行 CUDA 专属工作负载,无需借助虚拟机或双系统。
实测环节该项目在 RX 9060 XT 上成功训练了一个 220 万参数的 PPO 强化学习网络,全程使用未经修改的 CUDA 库。
这个项目是一套高度自动化的 PowerShell 脚本,将 ZLUDA 翻译层与 AMD 原生的 HIP/ROCm SDK for Windows 对接。
脚本会自动检测 GPU 架构,拉取特定版本的 ZLUDA(v6-preview.69),映射到 Windows 上已有的 ROCm 数学库。开发者成功拦截并映射了 CUDA 驱动 API 以及 cuBLAS、cuSPARSE、cuFFT 三个核心库,直接转接到 AMD 的等效实现上。

AMD 近期通过 ROCm 更新为 Windows 消费级 GPU 带来了正式的 PyTorch 和 HIP SDK 支持,RX 7000 和 RX 9000 系列全面覆盖。
但大量专有应用、老旧代码库和专用 AI 工具仍然只认 CUDA,AMD 用户想跑这些工具只能靠 WSL2 穿透或等原作者写 HIP 移植版,这个项目就是填这个空,相当于给只认 NVIDIA 的软件装了一个转接头。
基准测试显示,在 RX 9060 XT 上跑 220 万参数强化学习工作负载,走官方 ZLUDA 加 AMD HIP SDK 6.4 的路径,吞吐量中位数 13278 steps/ 秒;走从旧版 ZLUDA 二进制文件中 salvaged 出来的自定义覆盖层,12876 steps/ 秒,慢约 3%。

开发者也坦言,后续重写去掉 LibTorch/ZLUDA 后吞吐量大幅提升,说明这层翻译栈仍有性能损耗。
不过现在还远不到 CUDA 护城河被填平的时候,关键 AI 库 cuDNN、TensorRT 和 NCCL 目前均无法解析,如果工具重度依赖 cuDNN,这套方案就会直接失效。
但这个项目证明了一件事:在 AMD 显卡上跑 CUDA 专属软件的障碍不是硬件层面的硬伤,而是可以解决的翻译工具问题,项目完全开源,社区贡献有望扩展更多硬件支持和 CUDA 库兼容。



登录后才可以发布评论哦
打开小程序可以发布评论哦