中关村在线 5小时前
32GB、128GB对阵192GB:算算NVIDIA RTX Spark与AMD Gorgon Halo的内存账
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

【ZOL 中关村在线原创】随着 10 月上市时间临近,倍受行业以及用户关注的 NVIDIA RTX Spark(代号 N1X)平台的完整参数规格,此前在英伟达官网被正式放出,首有两款型号:旗舰版规格为 20 核 Grace CPU+6144 个 CUDA 核心的 Blackwell GPU,统一内存容量从 24GB 起步、最高支持到 128GB;而另一款主流版本的 N1X 则采用 18 核 Grace GPU+5120 个 CUDA 核心的 Blackwell GPU,统一内存容量则被锁定在 24GB-32GB。

其中,RTX Spark N1X 旗舰版平台覆盖笔记本和紧凑型台式机(迷你机),而主流版平台则只对应笔记本产品线。

目前,在正式对 RTX Spark N1X 电脑进行评测之前,我们很难从核心规模上去判断其 CPU 和 GPU 性能的实际表现到底如何。不过,从对本地运行 AI 大模型最为关键的内存配置上,我们却可以窥见其实现其满足本地 AI 运行这一设计初衷的能力,以及大概的本地 AI 性能表现。毕竟对于超大统一内存而言,此前我们有同为 128GB 统一内存的 AMD Strix Halo 测试数据,现在又有了 AMD 第二代 Halo 系列的 Gorgon Halo 做参考。

所以在 10 月 8 日 RTX Spark N1X 正式上市之前,我们不妨通过内存配置,算一算 Spark N1X 的本地 AI 能力。

现在我们知道,RTX Spark N1X 最小内存为 24GB,最大为 128GB;而旗舰版 N1X 和主流版 N1X 的最大内存容量差异高达 4 倍,旗舰型号最高 128GB,而主流型号最高却只有 32GB。此前英伟达对外宣传的 " 可在本地运行 1200 亿参数模型 ",所说的自然是 128GB 的旗舰版了,而主流版 RTX Spark N1X 是无法支持到如此高参数量的大模型的。

128GB 统一内存如果放在两、三年前,那确实是足够能打,但是放在今天,随着支持高达 192GB 统一内存的 AMD Gorgon Halo 已经抢先发布,RTX Spark N1X 就给人一种发售就有点过时的感觉。而且笔记本平台对应的次级型号 RTX Spark N1X 最高统一内存只有 32GB,这很可能意味着 " 大家都能买得起的 RTX Spark N1X 笔记本 ",实际上是阉割掉了绝大部分的本地 AI 模型能力的低配版。

反观 AMD 在 2025 年初发布的 Strix Halo,也就是大家熟悉的锐龙 AIMax 家族,最高统一内存容量就已经达到 128GB。而现在已经上市的新一代 Gorgon Halo,其统一内存容量直接从 128GB 推高到了 192GB,用户可以将其中 160GB 划分给 GPU 做显存,从而直接支持 3000 亿参数量大模型在 x86 本地终端设备上运行。

而且,特别需要指出的是,Gorgon Halo 家族首发的三款型号处理器虽然在 CPU 核心线程数量、频率、缓存、NPU 算力以及 GPU 规格上有所差异,但关系到 AI 大模型本地性能的统一内存却都给到了 192GB,没做任何阉割。它并没有笔记本专属限定版本,一个平台可以直接跨各种终端设备使用,而且都拥有同样的统一内存规格。能做到这一点是因为其 45W-120W 的可灵活配置功耗,要比 N1X 桌面版的 140W 固定功耗低很多。

现在来看,最终上市的很多 RTX Spark 笔记本产品应该会搭配主流版的型号,而非旗舰型号。我们就以 " 大家都能买得起的 RTX Spark N1X 笔记本 " 的最高 32GB 内存为例,来看看当一台 32GB 统一内存和一台 192GB 统一内存笔记本放在一起,在本地大模型应用上的差距究竟有多大?我们不妨来算一笔账。

· 第一层账:容量决定 " 能不能跑 ",这是硬门槛

经过近三年的验证,本地 AI 大模型推理有一条硬性门槛,那就是内存与显存容量,容量上不去,加载和推理生成速度就会断崖式下跌,甚至到不可用的程度。

我们选择了一些主流开源模型,在 Q4_K_M(当前公认的甜点量化位宽)量化下,其实际体积摊开之后,大致的内存对应规则如下:

当然在实际运行时,还要扣掉系统本身的开销。所以在 32GB 的机器里,RTX Spark N1X 平台所对应的 Windows on Arm 系统本身的负载,加上生成上下文的话就要吃掉不少容量,实际能分给模型的通常在 24 – 28GB 这个区间。这直接决定了主流版 RTX Spark N1X 平台比较流畅的模型参数区间大概是在 8B – 24B 之间,而 32B 参数量多半就是能启动但推理生成速度达不到正常使用的临界状态了。

再看 Gorgon Halo,最高 160GB 统一内存分配给显存之后,70B 模型只占去四分之一,系统本身负载剔除之后,依然有上百 GB 的冗余空间留给上下文、多模型常驻和并发请求。例如 Llama3.3-70B 大模型,其在 32GB 统一内存平台上别说用了,就是加载都无法完成,但是在 Gorgon Halo 上却只是起步。所以单看二者在 32B 模型上的差异就可以看出,二者之间是面对大参数量模型的可用与不可用之分。

· 第二层账:KV Cache 与长上下文,32GB 最致命的地方

当然,真正让小容量内存寸步难行的,归根到底还是 KV Cache。

在推理过程中,上下文里每一个 token 的 Key/Value 张量都要常驻显存。它随上下文长度线性增长,尤其是智能体 AI 应用、代码库理解、长文档检索、多轮复杂对话等等这些应用,恰恰都是吃上下文的大户,而想要拥有更长的上下文,KV Cache 的冗余就非常重要。

以 FP16 模型的 KV Cache 为例,我们看看不同参数量模型对应的大致占用量:

把表格中的数据映射到 32GB 统一内存上的话,如果装 Qwen3-32B(~22GB)之后,大概只剩 2 – 4GB 余量,因此上下文会被死死卡在 8K 以内,这意味着一个中等规模的代码仓库都读不完。

而想要跑 32K 长上下文,那就只能退回到 8B – 14B 的小模型上来跑,精度又远远不够。这种一根筋两头堵的体验,恐怕谁都不喜欢。

如果放在 Gorgon Halo 上,超长上下文瓶颈就会被直接冲垮。

例如 70B 权重(模型容量 42GB)+32K 上下文(16GB)的合计用量也只有 58GB,128K 上下文(64GB)的合计用量 106GB,前者占掉 160GB 的三分之一出头,后者大概占到三分之二,依然有非常大的冗余空间。

因此 Gorgon Halo 可以支撑的是 " 大模型 + 超长上下文 + 多任务并发 " 的多重负载,而 RTX Spark N1X 的 32GB 版本却只能支撑起小模型 + 短对话的基础应用需求。这种差异在智能体 AI 为核心的当下,更显得有些不够看了。毕竟智能体 AI 需要长上下文做支持,而且背后就是 KV Cache,小内存、小显存显然无法满足本地智能体 AI 应用的基础需求。

· 第三层账:精度与生态,NVIDIA 的两张对冲牌

如果只比内存和显存的话,NVIDIA RTX SPark N1X 在与 AMD Gorgon Halo 的对决中无疑是输掉比赛的那一方,所以 NVIDIA 也采用了一些对冲手段去应对。

首先其手里的第一张牌是低精度。N1X 基于第五代 Tensor Core,支持 FP4/NVFP4 规格,把权重量化到 4-bit 甚至更低,等效于把内存容量 " 放大 "。同样的 32GB,理论上能塞进更大的模型。这是 NVIDIA 用计算精度换内存空间的策略。但它有两个问题:一是量化到 4-bit 以下的质量损失在复杂推理任务上会变得更可感知;二是这个算法栈要能被推理框架完整支持才可以。而 AMD Gorgon Halo 最高支持的 300B 模型,虽说也会取决于量化方式、模型架构和负载配置,但其对 32B 以上模型的支持却是实打实的,超大统一内存,而且三款发布型号都给足 192GB 容量,就意味着 AMD 手里的底牌更厚。

NVIDIA 的第二张牌无疑是 CUDA。这是 NVIDIA 真正的护城河。Gorgon Halo 在纸面上的内存优势要落到真实性能,必然要依赖 ROCm 以及 llama.cpp/vLLM/Ollama 等框架对 Radeon 的调度质量。AMD 非常清楚这一点,所以近年来一直在大力发展 ROCm,并且推进了 ROCm.AI 的落地,同时与微软合作推出预配置开发环境的 Project Zenith,而且 " 最低 64GB 统一内存 " 成为了硬性门槛。这个数字表明,AMD 和微软共同认定的本地 AI 开发标准里,32GB 是连入场线都没够到的。

而且客观地说,CUDA 在 Windows on Arm 上的成熟度,在未拿到真机之前还是个未知数。N1X 跑的是 Arm 指令集,x86 生态要靠模拟层转译过渡,而本地 AI 工具链里大量依赖(包括部分推理后端、编译工具、驱动)在 WoA 上的适配进度并不乐观。反观 Gorgon Halo,它是标准的原生 x86 生态体系,而且 Python、ROCm、各类推理框架开箱即用,所以在软件兼容性方面,AMD 反倒是更省心的那一方。

· 结语

回到最初的问题:32GB 和 192GB 的本地 AI 差距有多大?

首先,可用模型的上限差了一个数量级。32GB 的适配区间是 8B – 24B,32B 甚至都有些吃力,70B 以上则是完全装不下;而 192GB(160GB 可变显存)则能比较轻松地容纳 70B、120B 大模型,甚至 235B、300B 级别的模型也能跑得动。

其次,我认为也是最重要的一点,就是 KV Cache 和长上下文,它是 32GB 统一内存平台最先崩塌的地方。上下文长度很可能被压到 8K 以内,这在智能体 AI 时代几乎等于不可在本地使用。

虽然 NVIDIA 的对冲手段是通过 FP4 低精度和 CUDA 生态来解决,但 AMD Gorgon Halo 的 x86 兼容性以及开箱即用显然对绝大多数开发者、用户而言更为友好。另外 RTX Spark N1X 在 Windows on Arm 上的成熟度也存疑,到底好不好用还需要市场和用户的双重验证。

目前搭载 Gorgon Halo 旗舰版本锐龙 AI Max+ Pro 495 的新品已经陆续上市,而 RTX Spark N1X 产品预计也将于 2026 年 10 月 8 号起开售,两家几乎选择了相同的新品上市周期,所以今年接下来的时间注定会是一个非常热闹的窗口期。具体表现如何,让我们拭目以待。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai gpu 紧凑型 英伟达 中关村在线
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论