【ZOL 中关村在线原创】随着 10 月上市时间临近,倍受行业以及用户关注的 NVIDIA RTX Spark(代号 N1X)平台的完整参数规格,此前在英伟达官网被正式放出,首有两款型号:旗舰版规格为 20 核 Grace CPU+6144 个 CUDA 核心的 Blackwell GPU,统一内存容量从 24GB 起步、最高支持到 128GB;而另一款主流版本的 N1X 则采用 18 核 Grace GPU+5120 个 CUDA 核心的 Blackwell GPU,统一内存容量则被锁定在 24GB-32GB。
其中,RTX Spark N1X 旗舰版平台覆盖笔记本和紧凑型台式机(迷你机),而主流版平台则只对应笔记本产品线。

所以在 10 月 8 日 RTX Spark N1X 正式上市之前,我们不妨通过内存配置,算一算 Spark N1X 的本地 AI 能力。


反观 AMD 在 2025 年初发布的 Strix Halo,也就是大家熟悉的锐龙 AIMax 家族,最高统一内存容量就已经达到 128GB。而现在已经上市的新一代 Gorgon Halo,其统一内存容量直接从 128GB 推高到了 192GB,用户可以将其中 160GB 划分给 GPU 做显存,从而直接支持 3000 亿参数量大模型在 x86 本地终端设备上运行。
而且,特别需要指出的是,Gorgon Halo 家族首发的三款型号处理器虽然在 CPU 核心线程数量、频率、缓存、NPU 算力以及 GPU 规格上有所差异,但关系到 AI 大模型本地性能的统一内存却都给到了 192GB,没做任何阉割。它并没有笔记本专属限定版本,一个平台可以直接跨各种终端设备使用,而且都拥有同样的统一内存规格。能做到这一点是因为其 45W-120W 的可灵活配置功耗,要比 N1X 桌面版的 140W 固定功耗低很多。

· 第一层账:容量决定 " 能不能跑 ",这是硬门槛
经过近三年的验证,本地 AI 大模型推理有一条硬性门槛,那就是内存与显存容量,容量上不去,加载和推理生成速度就会断崖式下跌,甚至到不可用的程度。
我们选择了一些主流开源模型,在 Q4_K_M(当前公认的甜点量化位宽)量化下,其实际体积摊开之后,大致的内存对应规则如下:



当然,真正让小容量内存寸步难行的,归根到底还是 KV Cache。

以 FP16 模型的 KV Cache 为例,我们看看不同参数量模型对应的大致占用量:

而想要跑 32K 长上下文,那就只能退回到 8B – 14B 的小模型上来跑,精度又远远不够。这种一根筋两头堵的体验,恐怕谁都不喜欢。
如果放在 Gorgon Halo 上,超长上下文瓶颈就会被直接冲垮。
例如 70B 权重(模型容量 42GB)+32K 上下文(16GB)的合计用量也只有 58GB,128K 上下文(64GB)的合计用量 106GB,前者占掉 160GB 的三分之一出头,后者大概占到三分之二,依然有非常大的冗余空间。
因此 Gorgon Halo 可以支撑的是 " 大模型 + 超长上下文 + 多任务并发 " 的多重负载,而 RTX Spark N1X 的 32GB 版本却只能支撑起小模型 + 短对话的基础应用需求。这种差异在智能体 AI 为核心的当下,更显得有些不够看了。毕竟智能体 AI 需要长上下文做支持,而且背后就是 KV Cache,小内存、小显存显然无法满足本地智能体 AI 应用的基础需求。
· 第三层账:精度与生态,NVIDIA 的两张对冲牌
如果只比内存和显存的话,NVIDIA RTX SPark N1X 在与 AMD Gorgon Halo 的对决中无疑是输掉比赛的那一方,所以 NVIDIA 也采用了一些对冲手段去应对。
首先其手里的第一张牌是低精度。N1X 基于第五代 Tensor Core,支持 FP4/NVFP4 规格,把权重量化到 4-bit 甚至更低,等效于把内存容量 " 放大 "。同样的 32GB,理论上能塞进更大的模型。这是 NVIDIA 用计算精度换内存空间的策略。但它有两个问题:一是量化到 4-bit 以下的质量损失在复杂推理任务上会变得更可感知;二是这个算法栈要能被推理框架完整支持才可以。而 AMD Gorgon Halo 最高支持的 300B 模型,虽说也会取决于量化方式、模型架构和负载配置,但其对 32B 以上模型的支持却是实打实的,超大统一内存,而且三款发布型号都给足 192GB 容量,就意味着 AMD 手里的底牌更厚。



回到最初的问题:32GB 和 192GB 的本地 AI 差距有多大?
首先,可用模型的上限差了一个数量级。32GB 的适配区间是 8B – 24B,32B 甚至都有些吃力,70B 以上则是完全装不下;而 192GB(160GB 可变显存)则能比较轻松地容纳 70B、120B 大模型,甚至 235B、300B 级别的模型也能跑得动。
其次,我认为也是最重要的一点,就是 KV Cache 和长上下文,它是 32GB 统一内存平台最先崩塌的地方。上下文长度很可能被压到 8K 以内,这在智能体 AI 时代几乎等于不可在本地使用。
虽然 NVIDIA 的对冲手段是通过 FP4 低精度和 CUDA 生态来解决,但 AMD Gorgon Halo 的 x86 兼容性以及开箱即用显然对绝大多数开发者、用户而言更为友好。另外 RTX Spark N1X 在 Windows on Arm 上的成熟度也存疑,到底好不好用还需要市场和用户的双重验证。
目前搭载 Gorgon Halo 旗舰版本锐龙 AI Max+ Pro 495 的新品已经陆续上市,而 RTX Spark N1X 产品预计也将于 2026 年 10 月 8 号起开售,两家几乎选择了相同的新品上市周期,所以今年接下来的时间注定会是一个非常热闹的窗口期。具体表现如何,让我们拭目以待。



登录后才可以发布评论哦
打开小程序可以发布评论哦