GMIF创新观察 昨天
Arm“边缘AI架构观”:计算、内存与存储实现高效协同
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

过去三年,AI 产业的注意力几乎全部集中在 GPU 算力上。TOPS 数字年年翻新,芯片制程不断逼近物理极限。然而,当大模型从数据中心走向手机、PC、机器人和工业传感器,一个更为棘手的矛盾开始浮出水面:限制边缘 AI 落地的核心瓶颈,从 " 算得快不快 " 转向 " 存得下、搬得动、喂得饱 "。

正如 Arm 全球存储业务负责人 John Xavier Lionel 在 GMIF 2026 提出的核心判断:"边缘 AI 的机遇最终不是一个 TOPS 问题,而是一个系统设计挑战。" 这不是一句口号,而是一个被产业数据反复验证的结构性事实。

01

Token 的 " 隐性账单 ",推理吞吐的天花板

要理解这场存储觉醒,首先需要看清 AI 推理的真实成本结构。

当一台设备每天执行 20 次 AI 交互,每次生成 500 个输出 token,一百万台设备每天将产生 100 亿个 token。按照当前主流商业 API 定价,如果以每百万 token 10 美元计算,仅输出 token 的日成本就达到 10 万美元,年化运营支出高达 3650 万美元。这还只是输出端——尚未计入输入 token、缓存上下文效应、重试开销、网络传输和编排成本。

数字背后是一个朴素的商业逻辑:当 AI 使用量从 " 试用 " 走向 " 日常 ",token 生成就从一次性研发投入变成了一项持续性的运营支出。 而任何持续性支出,都会自动寻找最经济的承接方式。

这正是边缘 AI 从 " 技术可能性 " 变为 " 经济必然性 " 的底层驱动力。Arm 演示文稿中给出的对比框架清晰地揭示了两种路径的成本差异:纯云端路径需要经过 " 本地数据→网络传输→云端推理→返回 token" 四个环节,每个环节都在消耗带宽、延迟和金钱;而边缘优先路径则将数据和模型留在本地,仅在能力不足时才向云端升级。

研究数据支持这一判断。Deloitte 的分析显示,采用边缘、云混合策略的组织相比纯云架构可实现 15% 至 30% 的总成本节约。更激进的数据来自实际部署,某 AI 主机方案相比纯云端可降低词元成本 80% 以上,对工厂质检、门店客服等高频场景," 边侧省词元 " 已经从概念变成了每月成本表上可直接核对的一栏。

成本之外,还有一个更根本的技术约束在重塑边缘 AI 的架构逻辑。

大模型推理的瓶颈不在计算,而在内存访问。自回归解码阶段,模型需要逐 token 生成输出,每生成一个 token,都要重新读取全部模型权重和 KV 缓存。这意味着推理吞吐量本质上由内存带宽决定,而非算力峰值决定。

Arm 对此有精准概括,即预填充阶段是计算密集型的,但逐 token 解码阶段反复访问 KV 缓存;随着并发用户增加,聚合缓存容量可能先于 GPU 算力成为限制因素。换句话说,不是 GPU 不够快,而是内存系统 " 喂 " 不上。

这一矛盾在边缘端更加尖锐。边缘设备的 DRAM 容量通常在 4GB 到 16GB 之间,而一个经过量化的 10B 参数模型,仅权重就需要约 1.25GB 存储空间(按 4-bit 量化计算)。加上 KV 缓存、运行时激活值、RAG 检索到的文档嵌入和向量索引,工作集轻松突破边缘设备的内存预算。

一个具体的参照是:Phi Silica 本地小语言模型在 Windows 11 系统中占用超过 2.59GB 硬盘空间,而 Copilot + PC 的最低硬件门槛已被推高到 16GB 内存和 256GB 存储。" 小 " 模型尚且如此,更大规模的多模态模型对存储系统的压力可想而知。

Arm 自身的硬件演进也在回应这一挑战。Ethos-U85 NPU 性能较前代提升四倍,支持基于 Transformer 架构的模型,其架构设计的一个关键取向就是 " 最小化外部数据移动、将活跃张量保持在计算单元附近 "。Armv9 边缘 AI 计算平台搭载的 Cortex-A320 CPU 与 Ethos-U85 组合,可支持参数量超过 10 亿的端侧 AI 模型,同时集成了指针验证、分支目标识别和内存标记扩展等安全技术。

02

量化止于边界,存储始为中枢

量化是缓解内存压力的主要手段,但它的作用被广泛误解。

从 FP32 降至 INT4,模型大小最多可缩减至原来的八分之一,10GB 的模型可缩减至 1.25GB。腾讯混元推出的 HY-1.8B-2Bit 模型通过 2-bit 量化实现等效约 0.3B 参数规模,实际存储占用仅约 600MB。这些数字令人振奋,但量化并非没有代价。研究指出,量化 LLM 面临三个核心挑战:数值敏感度(微小的精度误差可能在注意力机制等敏感组件中被放大)、分布与缩放问题(难以预测的激活值和离群值会让一致性量化变得困难),以及不同层之间的差异。

更关键的是,量化降低的是模型权重的存储需求,却无法消除推理过程中产生的动态数据—— KV 缓存随序列长度线性增长,RAG 检索的向量索引随知识库规模扩大,多轮对话的上下文状态需要持续保留。Arm 明确指出:" 即使经过量化,服务更大模型在内存层次结构中仍可能消耗数十到数百 GB。"

这引出一个重要的认知转变:存储不再是被动的数据仓库,而是 AI 推理架构中的主动参与者。  在传统的 " 存储→ DRAM →缓存→ CPU/NPU →输出 " 数据路径中,每一步移动都消耗时间和能量。Arm 提出的优化方向包括,模型放置(将常用模型保留在本地)、压缩(量化权重和 AI 资产)、本地检索(仅检索相关 RAG 上下文)、缓存 / 暂存(将热 AI 资产暂存在更快的内存中)。这些策略的共同目标,是在存储层级中实现 " 每一字节移动都产生最大智能价值 "。

边缘 AI 的终局不是 " 把所有东西搬到边缘 ",而是一个基于经济性和技术约束的工作负载放置问题。

Arm 提出的 " 云—边—端 " 连续体框架将部署点划分为四个层级:云端(前沿 / 大型模型、数据中心存储)、边缘基础设施(区域 / 企业 AI、本地存储)、高性能边缘(PC/ 手机 /XR/ 机器人、LPDDR+UFS/NVMe)、低功耗边缘(工业 / 摄像头 / 可穿戴设备、SRAM+Flash)。每个层级有不同的功耗、容量、带宽、延迟、安全和成本约束。

选择哪个层级,取决于工作负载的特征。一个实时的工业视觉质检任务,延迟要求在毫秒级,数据量巨大且敏感,适合在高性能边缘甚至低功耗边缘执行。一个需要复杂推理的科研分析任务,模型规模远超边缘设备的承载能力,则应留在云端。而大多数日常交互——语音助手、本地文档 RAG、个人化推荐——介于两者之间,最适合在边缘设备上本地执行,仅在能力不足时向上游升级。

这种 " 边缘优先、按需升级 " 的模式已经在实际部署中显示出效果。企业报告称,采用该架构后运营响应速度提升 40%,云成本降低 30% 至 50%。

03

系统协同设计,超越 TOPS 竞赛

Arm 给出的公式值得深思:Compute × Memory × Storage × Data Movement。这不是加法,是乘法。任何一个维度的短板都会将整体系统效能拉低到该维度的水平。

其意义在于否定了 " 堆算力就能解决边缘 AI 问题 " 的线性思维,一个拥有 100 TOPS 算力但只有 4GB DRAM 的设备,在运行 10B 参数模型时,瓶颈不在 NPU,而在内存容量;一个拥有充足内存但存储带宽不足的设备,在加载模型和 RAG 检索时会被 I/O 拖垮;一个各方面均衡但数据搬运路径冗余的设备,会在功耗和延迟上付出不必要的代价。

Arm 的应对策略是系统级的。在硬件层面,从 Cortex-M 到 Cortex-A 的 CPU 谱系覆盖了从微瓦级到数瓦级的功耗范围,Ethos-U85 NPU 在 128 到 2048 个 MAC 单元之间灵活扩展,同时保持 20% 的能效提升。在软件层面,KleidiAI 与 LiteRT、PyTorch ExecuTorch、ONNX Runtime 和阿里巴巴 MNN 等主流框架深度集成,实现 SME2 的自动启用,让开发者无需额外工作即可获得 AI 性能提升。

Arm 还将 KleidiAI 延伸应用到物联网领域,可实现高达 70% 的性能提升,并帮助超过 2000 万开发者无缝集成主流 AI 框架。在 Llama.cpp 上运行微软 Tiny Stories 数据集时,KleidiAI 为新的 Cortex-A320 带来高达 70% 的性能提升。这种 " 零代码改动 " 的自动加速机制,是 Arm 区别于其他边缘 AI 方案的核心软件竞争力。

在工具层面,Arm AI Portal 提供了模型浏览、量化筛选和设备兼容性匹配的能力,降低了从模型到部署的工程摩擦。

这些举措的共同指向是:边缘 AI 的竞争,正在从单点芯片性能的比拼,转向计算、内存、存储和数据搬运四者协同的系统能力较量。

从数据到 Token 的转变,表面上是 AI 输出形态的变化,深层是计算架构重心的迁移。当 Token 成为衡量 AI 价值的核心单位,系统的每一个环节,从存储介质的选择,到内存层级的划分,到数据搬运路径的优化,都必须围绕 " 以最低的系统成本生成最多有用 Token" 这一目标来重新设计。

今天,Arm 本质上在为这场系统重构提供一个框架:不是问 " 云端还是边缘 ",而是问 " 每个 AI 工作负载在哪里能最高效地交付 "。这个问题的答案,不在某一块芯片的规格表里,而在计算、内存、存储与数据搬运的协同设计之中。

近期回顾

AI 存储 驱动未来|第五届 GMIF2026 创新峰会在深圳成功举办

GMIF2026|北京大学集成电路学院院长蔡一茂:高带宽存储及存算一体技术

GMIF2026|摩根士丹利颜志天:AI 下一波,从算力到记忆体创新

GMIF2026 年度大奖重磅揭晓,三星半导体、闪迪、联想、慧荣、佰维存储等多家企业上榜!

  ---   END   ---

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai arm 物理 浮出水面 芯片
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论