量子位 昨天
紫东太初推出GMC核心集剪枝方法,少80%Token仍满血保真多模态能力
index.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

随着视觉语言模型分辨率与图文理解能力持续升级,图像会被编码为数百至上万个视觉 Token。

大量 Token 持续参与解码计算、长期占用 KV Cache,带来显存开销大、推理速度慢、部署成本高等一系列问题,视觉 Token 冗余已成为多模态模型高效推理与规模化落地的核心瓶颈。

当前行业通用方案为传统 Top ‑ K Token 筛选:对每个 Token 独立打分,仅保留得分最高的部分样本。

但该方法存在明显缺陷:高分 Token 高度集中在画面显著区域,反复保留同质化冗余信息,极易遗漏文字、数字、坐标轴、目标空间关系等分散但关键的互补证据;

同时低分 Token 被直接删除,携带细节信息永久丢失,导致模型推理失真、事实判断偏差、视觉幻觉增多,普遍存在「压缩必掉精度」的行业难题。

传统 Top-K Token 筛选方法与 GMC 的对比

针对以上痛点,中国科学院自动化研究所紫东太初大模型团队,提出核心集剪枝方法 GMC(Grounded Message Coreset Pruning),实现了技术跨越式创新。

GMC 彻底跳出「筛选单个最优 Token」的传统思路,基于模型真实推理逻辑,认为视觉语言模型依赖的是全体 Token 构成的集体消息,而非孤立图像块。因此压缩不仅要确定「信息保留位置」,更要解决「保留 Token 的信息承载方式」。

核心集剪枝方法 GMC 整体框架核心创新:双阶段架构,从根源化解 Token 冗余与信息丢失矛盾

GMC 整体分为互补证据自适应筛选群体互补信息传输两大核心阶段,在不训练、无额外模型依赖的前提下,实现高保真、高效率的视觉序列压缩。

1. 互补证据自适应筛选

GMC 同时从问题语义、视觉外观和空间位置三个角度构建证据。

首先,利用视觉语言模型内部原生的视觉-文本注意力,识别与当前问题直接相关的区域;

其次,根据视觉特征之间的相似性保护图像中的不同外观结构,避免模型只关注当前已经被问题激活的内容;

最后,通过原始图像坐标构建空间证据,保留图表、文档以及关系推理任务中重要的位置和几何信息。

在选择关键性 Token 时,GMC 根据其对 " 尚未覆盖证据 " 的新增贡献进行选择。

当某一区域已经得到充分表示后,附近相似 Token 的价值会随之降低,系统会转而选择能够补充文字、目标、数字或空间关系的其他区域。

由此,有限的 Token 预算可以被分配给多种互补信息,而不是反复集中在同一显著位置。

2. 群体互补信息传输

仅仅选出具有代表性的位置并不能完全解决信息丢失问题,因为未被选中的 Token 仍然携带着细节信息。

GMC 因此进一步提出 Population Transport 群体互补信息传输机制,将所有待删除 Token 的隐藏状态传输到最合适的代表 Token 中。

该过程综合考虑视觉特征相似性和空间邻近关系,将大量视觉 Token 聚合为少量紧凑表示。

语义匹配清晰的内容可以被传输到相似代表,而容易混淆的局部细节则更倾向于保留在附近位置。

聚合完成后,未选中的视觉 Token 被删除,模型随后在压缩后的 Token 序列上继续执行注意力计算。

与需要重新训练模型或引入外部工具的方法不同,GMC 不需要任务标签、参数更新、辅助检测器、OCR 模型或额外模型,可以直接应用于已有视觉语言多模态大模型中。

同时,GMC 实现的是真实序列压缩,而不是简单地通过掩码隐藏 Token,因此能够实际减少后续解码层计算和 KV Cache 占用。

方案核心优势:零成本适配各类图文大模型

1、全程免训练,无额外依赖

无需模型微调、任务标签、外部 OCR / 检测器、辅助模型,开箱即用,直接兼容 Qwen、LLaVA 等主流视觉语言大模型;

2、压缩不降质,自带去噪增益

过滤无效冗余 Token 的同时完整留存推理所需视觉证据,多项基准测试中性能持平甚至优于原始完整模型;

3、抑制视觉幻觉,事实一致性更强

在 POPE、HallusionBench 等幻觉评测集表现突出,大幅减少压缩后模型错描述、信息缺失问题;

4、跨模型通用,全场景适配

可迁移至不同架构 7B 级多模态模型,覆盖通用图文问答、图表解析、长文档识别全业务场景。

权威实验结果:超高压缩率,完美解决 Token 冗余痛点

团队基于 TextVQA、ChartQA、MME、POPE、MMBench、GQA 等多项主流视觉理解基准,在 Qwen2.5-VL-7B-Instruct、LLaVA-1.5-7B 模型上完成全量验证。

GMC 在 Qwen2.5-VL-7B 和 LLaVA-1.5-7B 上的性能与效率表现

1、在 Qwen2.5-VL-7B 上,完整模型包含 1296 个视觉 Token。

当视觉 Token 数量减少 80.2%、仅保留 256 个时,GMC-H2 保留了完整模型 97.78% 的平均能力,当进一步减少 90.1%、仅保留 128 个视觉 Token 时,GMC-L16 仍保持 99.11% 的平均能力。

2、在 LLaVA-1.5-7B 上,GMC-L16 在分别保留 128 个和 64 个视觉 Token 时,平均性能达到完整模型的 99.76% 和 99.82%,表明该方法能够迁移到不同视觉语言模型架构。

GMC 方法性能与基线模型性能一致甚至略高于基线模型,表明 GMC 不仅可以减少计算量,甚至可以通过移除无关信息达到去噪效果,进而能够轻微提升模型的多模态理解能力。

除了常规视觉问答能力,研究团队还在 POPE、AMBER、HallusionBench 和 CHAIR 等基准上评估了模型的视觉幻觉。

实验结果表明,在相同 Token 预算下,GMC 能够更加完整地保留事实判断所需的视觉证据,在显著压缩视觉序列的同时减少错误描述和信息遗漏。结果如下表所示:

在相同视觉 Token 预算下,GMC 在多类视觉幻觉评测中保持更好的事实一致性

在长文档问答场景中,面对包含 15876 个原始视觉 Token 的输入,GMC 在保持完整模型 98.87% 问答质量的情况下,实现了 1.258 倍端到端推理加速,并减少 73.94% 的提示 KV Cache,验证了该方法在实际部署中的效率优势。

随着多模态大模型向高分辨率、长上下文、复杂真实场景演进,Token 冗余带来的算力、显存成本问题,已经成为产业规模化落地的核心阻碍。

紫东太初 GMC 不仅是一款全新的核心集剪枝方法,更提供高效、可信的多模态部署新范式:

视觉压缩的核心不是减少 Token 数量,而是以更低的计算代价,完整支撑模型精准推理所需的全局视觉信息

未来紫东太初大模型团队将持续迭代 GMC 技术体系,适配更多大模型架构与复杂业务场景,持续破解多模态模型「算力成本与推理精度」的核心矛盾,推动国产多模态大模型高效、低成本、规模化落地。

论文地址:https://arxiv.org/abs/2608.02134v1

* 本文系量子位获授权刊载,观点仅为原作者所有。

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—    —

点亮星标

科技前沿进展每日见

评论
大家都在看