欧美一区二区三区视频免费_亚洲国产欧美一区二区丝袜黑人_一区二区三区资源_欧美一区二区视频免费观看

紫東太初推出GMC核心集剪枝方法,少80%Token仍滿血保真多模態能力

紫東太初推出GMC核心集剪枝方法,少80%Token仍滿血保真多模態能力,模態

隨著視覺語言模型分辨率與圖文理解能力持續升級,圖像會被編碼為數百至上萬個視覺Token。

大量Token持續參與解碼計算、長期占用KV Cache,帶來顯存開銷大、推理速度慢、部署成本高等一系列問題,視覺Token冗余已成為多模態模型高效推理與規模化落地的核心瓶頸。

當前行業通用方案為傳統Top?K Token篩選:對每個Token獨立打分,僅保留得分最高的部分樣本。


(資料圖片)

但該方法存在明顯缺陷:高分Token高度集中在畫面顯著區域,反復保留同質化冗余信息,極易遺漏文字、數字、坐標軸、目標空間關系等分散但關鍵的互補證據;

同時低分Token被直接刪除,攜帶細節信息永久丟失,導致模型推理失真、事實判斷偏差、視覺幻覺增多,普遍存在「壓縮必掉精度」的行業難題。

△傳統Top-K Token篩選方法與GMC的對比

針對以上痛點,中國科學院自動化研究所紫東太初大模型團隊,提出核心集剪枝方法GMC(Grounded Message Coreset Pruning),實現了技術跨越式創新。

GMC徹底跳出「篩選單個最優Token」的傳統思路,基于模型真實推理邏輯,認為視覺語言模型依賴的是全體Token構成的集體消息,而非孤立圖像塊。因此壓縮不僅要確定「信息保留位置」,更要解決「保留Token的信息承載方式」。

△核心集剪枝方法GMC整體框架

核心創新:雙階段架構,從根源化解Token冗余與信息丟失矛盾

GMC整體分為互補證據自適應篩選群體互補信息傳輸兩大核心階段,在不訓練、無額外模型依賴的前提下,實現高保真、高效率的視覺序列壓縮。

1. 互補證據自適應篩選

GMC同時從問題語義、視覺外觀和空間位置三個角度構建證據。

首先,利用視覺語言模型內部原生的視覺-文本注意力,識別與當前問題直接相關的區域;

其次,根據視覺特征之間的相似性保護圖像中的不同外觀結構,避免模型只關注當前已經被問題激活的內容;

最后,通過原始圖像坐標構建空間證據,保留圖表、文檔以及關系推理任務中重要的位置和幾何信息。

在選擇關鍵性Token時,GMC根據其對“尚未覆蓋證據”的新增貢獻進行選擇。

當某一區域已經得到充分表示后,附近相似Token的價值會隨之降低,系統會轉而選擇能夠補充文字、目標、數字或空間關系的其他區域。

由此,有限的Token預算可以被分配給多種互補信息,而不是反復集中在同一顯著位置。

2. 群體互補信息傳輸

僅僅選出具有代表性的位置并不能完全解決信息丟失問題,因為未被選中的Token仍然攜帶著細節信息。

GMC因此進一步提出Population Transport群體互補信息傳輸機制,將所有待刪除Token的隱藏狀態傳輸到最合適的代表Token中。

該過程綜合考慮視覺特征相似性和空間鄰近關系,將大量視覺Token聚合為少量緊湊表示。

語義匹配清晰的內容可以被傳輸到相似代表,而容易混淆的局部細節則更傾向于保留在附近位置。

聚合完成后,未選中的視覺Token被刪除,模型隨后在壓縮后的Token序列上繼續執行注意力計算。

與需要重新訓練模型或引入外部工具的方法不同,GMC不需要任務標簽、參數更新、輔助檢測器、OCR模型或額外模型,可以直接應用于已有視覺語言多模態大模型中。

同時,GMC實現的是真實序列壓縮,而不是簡單地通過掩碼隱藏Token,因此能夠實際減少后續解碼層計算和KV Cache占用。

方案核心優勢:零成本適配各類圖文大模型

1、全程免訓練,無額外依賴

無需模型微調、任務標簽、外部OCR / 檢測器、輔助模型,開箱即用,直接兼容Qwen、LLaVA等主流視覺語言大模型;

2、壓縮不降質,自帶去噪增益

過濾無效冗余Token的同時完整留存推理所需視覺證據,多項基準測試中性能持平甚至優于原始完整模型;

3、抑制視覺幻覺,事實一致性更強

在POPE、HallusionBench等幻覺評測集表現突出,大幅減少壓縮后模型錯描述、信息缺失問題;

4、跨模型通用,全場景適配

可遷移至不同架構7B級多模態模型,覆蓋通用圖文問答、圖表解析、長文檔識別全業務場景。

權威實驗結果:超高壓縮率,完美解決Token冗余痛點

團隊基于TextVQA、ChartQA、MME、POPE、MMBench、GQA等多項主流視覺理解基準,在Qwen2.5-VL-7B-Instruct、LLaVA-1.5-7B模型上完成全量驗證。

△GMC在Qwen2.5-VL-7B和LLaVA-1.5-7B上的性能與效率表現

1、在Qwen2.5-VL-7B上,完整模型包含1296個視覺Token。

當視覺Token數量減少80.2%、僅保留256個時,GMC-H2保留了完整模型97.78%的平均能力,當進一步減少90.1%、僅保留128個視覺Token時,GMC-L16仍保持99.11%的平均能力。

2、在LLaVA-1.5-7B上,GMC-L16在分別保留128個和64個視覺Token時,平均性能達到完整模型的99.76%和99.82%,表明該方法能夠遷移到不同視覺語言模型架構。

GMC方法性能與基線模型性能一致甚至略高于基線模型,表明GMC不僅可以減少計算量,甚至可以通過移除無關信息達到去噪效果,進而能夠輕微提升模型的多模態理解能力。

除了常規視覺問答能力,研究團隊還在POPE、AMBER、HallusionBench和CHAIR等基準上評估了模型的視覺幻覺。

實驗結果表明,在相同Token預算下,GMC能夠更加完整地保留事實判斷所需的視覺證據,在顯著壓縮視覺序列的同時減少錯誤描述和信息遺漏。結果如下表所示:

△在相同視覺Token預算下,GMC在多類視覺幻覺評測中保持更好的事

在長文檔問答場景中,面對包含15876個原始視覺Token的輸入,GMC在保持完整模型98.87%問答質量的情況下,實現了1.258倍端到端推理加速,并減少73.94%的提示KV Cache,驗證了該方法在實際部署中的效率優勢。

隨著多模態大模型向高分辨率、長上下文、復雜真實場景演進,Token冗余帶來的算力、顯存成本問題,已經成為產業規模化落地的核心阻礙。

紫東太初GMC不僅是一款全新的核心集剪枝方法,更提供高效、可信的多模態部署新范式:

視覺壓縮的核心不是減少Token數量,而是以更低的計算代價,完整支撐模型精準推理所需的全局視覺信息

未來紫東太初大模型團隊將持續迭代GMC技術體系,適配更多大模型架構與復雜業務場景,持續破解多模態模型「算力成本與推理精度」的核心矛盾,推動國產多模態大模型高效、低成本、規模化落地。

論文地址:https://arxiv.org/abs/2608.02134v1

責任編輯:hn1007

主站蜘蛛池模板: 精品少妇人妻av一区二区| 91精品91久久久久久| 久久九九精品99国产精品| 亚洲国产欧美一区二区三区不卡| 欧美极品在线视频| 亚洲午夜高清视频| 国产精品网红直播| 久久精品在线视频| 色播亚洲婷婷| 国产精品久久久久久婷婷天堂| 美女精品国产| 人人妻人人澡人人爽精品欧美一区| 国产成人精品av在线| 国产精品久久久久久久久婷婷| 激情伊人五月天| 久久人人爽人人爽爽久久| 日韩视频在线一区| 国产成一区二区| 久久精品美女| 国产精品久久久久7777| 99精品视频播放| 精品日本一区二区三区在线观看| 亚洲欧美日韩精品在线| 日韩视频在线观看视频| 国产精品一 二 三| 欧美日韩精品在线一区二区| 在线免费一区| 亚洲午夜精品国产| 亚洲在线欧美| 国产视频99| 免费av在线一区| 亚洲国产日韩欧美| 国产日韩欧美视频| 久精品国产欧美| 精品日韩在线播放| 国产日韩欧美日韩大片| 欧美精品在线第一页| 欧美视频在线第一页| 欧美精品久久久久久久免费观看| 久久精品视频免费播放| 国产专区欧美专区|