伴随 AI 大模型迭代发展,行业算力与内存需求激增,内存芯片采购成本大幅攀升。业内指出,为控制开支,各大科技巨头正通过软件与系统优化,降低 AI 数据处理过程中的内存占用以实现降本。
据媒体近日报道,谷歌、英伟达、微软等头部科技企业接连推出数据压缩、内存负载分流等技术,以此应对 AI 业务带来的内存压力。
谷歌研究院于今年三月推出的TurboQuant 算法是代表性技术。该技术将 AI 推理过程中产生的键值(KV)缓存压缩至 3-4 比特,降低 DRAM 的计算压力。
可大致理解为借助特殊量化算法,用更小空间存放 AI 推理临时数据,不用改动原有模型即可减少内存消耗。
业内指出,在无需对 AI 模型重新训练的前提下,相较现有方案,其最高可将内存使用量降至原有水平的六分之一。
英伟达于 3 月正式公布上下文记忆存储平台(CMX)平台方案,通过增设独立存储层减轻内存压力。
业内指出,其依托数据处理单元(DPU)搭建共享 CMX 平台,将原本集中于高带宽内存(HBM)中的计算数据进行分流,此举旨在避免 HBM 过载,同时提升能效。
微软近期披露了IndexMem 技术,该技术会在推理阶段筛选优先级相对较低的数据并对其压缩。
据称学术界也推出EVICPRESS 系统作为主流备选方案,该系统将键值缓存分散存储至 HBM、普通 DRAM、固态硬盘(SSD)等多层存储介质,再依据上下文重要性对数据执行压缩或删除操作。
可以理解为把 AI 临时缓存分流到快慢不同的存储设备,优先保障关键数据,以此缓解 HBM 的压力。
上述技术均于今年上半年陆续公布,目前尚无消息表明已实现大规模商业化落地。
内存价格持续上升,促使大型科技企业着手削减内存消耗。
摩根士丹利最新预测显示,2026 年第三季度 DDR4 等成熟 DRAM 价格预计将环比大涨 50%,第四季度将进一步上涨 10%。
该机构表示,成熟的 DRAM 芯片的供应紧张局面,即将进一步恶化。
据韩国券商 iM 证券测算,今年全球前十五大科技巨头的资本开支总预算中,存储芯片采购占比达到 37%,较去年 15% 的占比高出 2.5 倍左右。
有媒体指出,内存成本上涨也对大型科技企业的自由现金流形成拖累。
谷歌母公司 Alphabet,受 AI 基础设施投入影响,今年第二季度录得史上首次负自由现金流。为应对该局面,Alphabet 本月初发行约 250 亿美元公司债完成融资。
英伟达同样于 6 月发行至少 200 亿美元公司债,这是其五年以来首次发行债券,用于覆盖基础设施建设开支。
一位业内人士表示:" 大型科技企业已经走到仅靠经营活动产生的现金不足以覆盖 AI 基础设施投入的阶段。能够提升有限芯片资源利用效率的内存优化技术,未来将成为决定企业盈利水平的关键变量。"


