< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

紫东太初推出GMC核心集剪枝方法,少80%Token仍满血保真多模态能力

免训练、开箱即用!

允中 发自 凹非寺

量子位 | 公众号 QbitAI

随着视觉语言模型分辨率与图文理解能力持续升级,图像会被编码为数百至上万个视觉Token。

大量Token持续参与解码计算、长期占用KV Cache,带来显存开销大、推理速度慢、部署成本高等一系列问题,视觉Token冗余已成为多模态模型高效推理与规模化落地的核心瓶颈。

当前行业通用方案为传统Top‑K Token筛选:对每个Token独立打分,仅保留得分最高的部分样本。

但该方法存在明显缺陷:高分Token高度集中在画面显著区域,反复保留同质化冗余信息,极易遗漏文字、数字、坐标轴、目标空间关系等分散但关键的互补证据;

同时低分Token被直接删除,携带细节信息永久丢失,导致模型推理失真、事实判断偏差、视觉幻觉增多,普遍存在「压缩必掉精度」的行业难题。

△传统Top-K Token筛选方法与GMC的对比

针对以上痛点,中国科学院自动化研究所紫东太初大模型团队,提出核心集剪枝方法GMC(Grounded Message Coreset Pruning),实现了技术跨越式创新。

GMC彻底跳出「筛选单个最优Token」的传统思路,基于模型真实推理逻辑,认为视觉语言模型依赖的是全体Token构成的集体消息,而非孤立图像块。因此压缩不仅要确定「信息保留位置」,更要解决「保留Token的信息承载方式」。

△核心集剪枝方法GMC整体框架

核心创新:双阶段架构,从根源化解Token冗余与信息丢失矛盾

GMC整体分为互补证据自适应筛选群体互补信息传输两大核心阶段,在不训练、无额外模型依赖的前提下,实现高保真、高效率的视觉序列压缩。

1. 互补证据自适应筛选

GMC同时从问题语义、视觉外观和空间位置三个角度构建证据。

首先,利用视觉语言模型内部原生的视觉-文本注意力,识别与当前问题直接相关的区域;

其次,根据视觉特征之间的相似性保护图像中的不同外观结构,避免模型只关注当前已经被问题激活的内容;

最后,通过原始图像坐标构建空间证据,保留图表、文档以及关系推理任务中重要的位置和几何信息。

在选择关键性Token时,GMC根据其对“尚未覆盖证据”的新增贡献进行选择。

当某一区域已经得到充分表示后,附近相似Token的价值会随之降低,系统会转而选择能够补充文字、目标、数字或空间关系的其他区域。

由此,有限的Token预算可以被分配给多种互补信息,而不是反复集中在同一显著位置。

2. 群体互补信息传输

仅仅选出具有代表性的位置并不能完全解决信息丢失问题,因为未被选中的Token仍然携带着细节信息。

GMC因此进一步提出Population Transport群体互补信息传输机制,将所有待删除Token的隐藏状态传输到最合适的代表Token中。

该过程综合考虑视觉特征相似性和空间邻近关系,将大量视觉Token聚合为少量紧凑表示。

语义匹配清晰的内容可以被传输到相似代表,而容易混淆的局部细节则更倾向于保留在附近位置。

聚合完成后,未选中的视觉Token被删除,模型随后在压缩后的Token序列上继续执行注意力计算。

与需要重新训练模型或引入外部工具的方法不同,GMC不需要任务标签、参数更新、辅助检测器、OCR模型或额外模型,可以直接应用于已有视觉语言多模态大模型中。

同时,GMC实现的是真实序列压缩,而不是简单地通过掩码隐藏Token,因此能够实际减少后续解码层计算和KV Cache占用。

方案核心优势:零成本适配各类图文大模型

1、全程免训练,无额外依赖

无需模型微调、任务标签、外部OCR / 检测器、辅助模型,开箱即用,直接兼容Qwen、LLaVA等主流视觉语言大模型;

2、压缩不降质,自带去噪增益

过滤无效冗余Token的同时完整留存推理所需视觉证据,多项基准测试中性能持平甚至优于原始完整模型;

3、抑制视觉幻觉,事实一致性更强

在POPE、HallusionBench等幻觉评测集表现突出,大幅减少压缩后模型错描述、信息缺失问题;

4、跨模型通用,全场景适配

可迁移至不同架构7B级多模态模型,覆盖通用图文问答、图表解析、长文档识别全业务场景。

权威实验结果:超高压缩率,完美解决Token冗余痛点

团队基于TextVQA、ChartQA、MME、POPE、MMBench、GQA等多项主流视觉理解基准,在Qwen2.5-VL-7B-Instruct、LLaVA-1.5-7B模型上完成全量验证。

△GMC在Qwen2.5-VL-7B和LLaVA-1.5-7B上的性能与效率表现

1、在Qwen2.5-VL-7B上,完整模型包含1296个视觉Token。

当视觉Token数量减少80.2%、仅保留256个时,GMC-H2保留了完整模型97.78%的平均能力,当进一步减少90.1%、仅保留128个视觉Token时,GMC-L16仍保持99.11%的平均能力。

2、在LLaVA-1.5-7B上,GMC-L16在分别保留128个和64个视觉Token时,平均性能达到完整模型的99.76%和99.82%,表明该方法能够迁移到不同视觉语言模型架构。

GMC方法性能与基线模型性能一致甚至略高于基线模型,表明GMC不仅可以减少计算量,甚至可以通过移除无关信息达到去噪效果,进而能够轻微提升模型的多模态理解能力。

除了常规视觉问答能力,研究团队还在POPE、AMBER、HallusionBench和CHAIR等基准上评估了模型的视觉幻觉。

实验结果表明,在相同Token预算下,GMC能够更加完整地保留事实判断所需的视觉证据,在显著压缩视觉序列的同时减少错误描述和信息遗漏。结果如下表所示:

△在相同视觉Token预算下,GMC在多类视觉幻觉评测中保持更好的事实一致性

在长文档问答场景中,面对包含15876个原始视觉Token的输入,GMC在保持完整模型98.87%问答质量的情况下,实现了1.258倍端到端推理加速,并减少73.94%的提示KV Cache,验证了该方法在实际部署中的效率优势。

随着多模态大模型向高分辨率、长上下文、复杂真实场景演进,Token冗余带来的算力、显存成本问题,已经成为产业规模化落地的核心阻碍。

紫东太初GMC不仅是一款全新的核心集剪枝方法,更提供高效、可信的多模态部署新范式:

视觉压缩的核心不是减少Token数量,而是以更低的计算代价,完整支撑模型精准推理所需的全局视觉信息

未来紫东太初大模型团队将持续迭代GMC技术体系,适配更多大模型架构与复杂业务场景,持续破解多模态模型「算力成本与推理精度」的核心矛盾,推动国产多模态大模型高效、低成本、规模化落地。

论文地址:https://arxiv.org/abs/2608.02134v1

版权所有,未经授权不得以任何形式转载及使用,违者必究。