[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"doc-detail-82712-en":3,"doc-seo-82712-105":30,"detail-sidebar-cat-0-en-105":91},{"code":4,"msg":5,"data":6},0,"success",{"doc_id":7,"user_id":8,"nickname":9,"user_avatar":10,"doc_module":4,"category_id":11,"category_name":12,"doc_title":13,"doc_description":14,"doc_content":15,"file_id":16,"file_url":17,"file_type":18,"file_size":19,"view_count":20,"is_deleted":4,"is_public":21,"is_downloadable":21,"audit_status":21,"page_count":22,"language":23,"language_code":24,"site_id":25,"html_lang":24,"table_of_contents":26,"faqs":27,"seo_title":13,"seo_description":14,"update_tm":28,"read_time":29},82712,4810365810221,"Aurora","https://ap-avatar.wpscdn.com/davatar_155a257f0dc6eb9ab79c44ca47cae57d",8,"Research & Report","OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models","Omni-modal large language models (OmniLLMs) can process audio and video jointly, but they produce large token sequences under audio-visual inputs, driving high inference cost. Existing token compression for audio-visual data often uses unimodal guidance, ignoring temporal locality of query-relevant evidence and assuming shared temporally aligned information density. OmniFocus introduces training-free, query-guided compression that independently estimates importance for video and audio, achieving modality-symmetric compression and preserving modality-specific salient evidence with alignment. Experiments on Qwen2.5-Omni across four benchmarks validate strong compressed performance, including DailyOmni 25% retention.","arXiv :2607 .03050v 1 [ cs .LG] 3 Jul 2026  \nOmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models  \nShijie Cao1,2 , Qingyu Zhang2 , Boxi Yu3 , Yuzhong Zhang4 , Boxi Cao2 , Yaojie Lu2 , Hongyu Lin2 , Xianpei Han2 , Le Sun2 ,  \n1 School of Advanced Interdisciplinary Sciences,  \nUniversity of Chinese Academy of Sciences,  \n2 Chinese Information Processing Laboratory, Institute of Software,  \nChinese Academy of Sciences  \n3University of Limerick 4 CUHK, Shenzhen  \n{boxi2020, luyaojie, hongyu, xianpei, [sunle}@iscas.ac.cn](sunle}@iscas.ac.cn)[ ](sunle}@iscas.ac.cn)[caoshijie22@mails.ucas.ac.cn boxiyu@link.cuhk.edu.cn](caoshijie22@mails.ucas.ac.cn boxiyu@link.cuhk.edu.cn)[ ](caoshijie22@mails.ucas.ac.cn boxiyu@link.cuhk.edu.cn)[123090848@link.cuhk.edu.cn](123090848@link.cuhk.edu.cn)  \nAbstract  \nOmni modal large language models (OmniLLMs) have attracted wide attention for their ability to jointly process audio and video, but they generate large token sequences under audio-visual inputs, leading to substantial inference cost. Existing audio-visual token compression methods often rely on unimodal guidance, overlooking the temporal locality of query-relevant evidence in audio-visual inputs and implicitly assuming that the two modalities share a temporally aligned information density distribution. We propose OmniFocus, a training-free query-guided token compression method for OmniLLMs that performs independent importance estimation for video and audio, enabling a modality-symmetric compression design that preserves modality-specific salient evidence while maintaining audio-visual alignment, thereby mitigating the modality bias issue that can arise from unimodalguided compression. Experiments on the Qwen2.5-Omni model family across four audio-visual benchmarks show that OmniFocus maintains strong compressed performance at low token retention ratios and outperforms existing baselines on several major benchmark scores at 25% token retention. On DailyOmni with Qwen2.5-Omni-7B at 25% token retention, OmniFocus maintains 59.40 accuracy while delivering up to 1.38 × prefill speedup relative to the full-token baseline, highlighting a favorable practical accuracy-efficiency trade-off.  \n1 Introduction  \nOmni-modal large language models (OmniLLMs) extend language models to joint audio-visual understanding, showing broad potential across tasks such as audio-visual understanding [19], social and empathetic understanding [23, 33, 31], and audio captioning [36, 4] . However, audio-visual inputs generate large token sequences, which limits the applicability of OmniLLMs in long-form audio-visual settings and resource-constrained environments.  \nToken compression as a method to reduce inference cost has been widely used in vision, audio, and long-text settings [39, 24, 28, 15, 22, 26] . By removing redundant tokens while preserving key evidence, token compression can improve inference efficiency and reduce GPU memory usage without sacrificing much performance. Unlike unimodal compression, token compression in OmniLLMs must preserve audio evidence, visual evidence, and cross-modal alignment simultaneously, which poses unique challenges for compression design.  \nPreprint.  \nLLM  \nCompression Module  \nVision Encoder  \nAudio Encoder  \nFigure 1: Illustration of the limitation of unimodal-guided audio-visual token compression. Audioguided compression preserves audio-centric performance relatively well, but degrades more noticeably on visual and joint audio-visual understanding tasks, motivating a query-guided and modalitybalanced compression strategy. The modality-type labeling protocol is described in Appendix B.  \nIn previous work, researchers typically use one modality as a guiding modality to assess the density of event information, and design asymmetric compression strategies for the two modalities based on this signal [29, 7, 18] . This unimodal-guided asymmetric compression strategy has two limitations:  \n(1)","cbCaiqNBwEg9qm0L","https://ap.wps.com/l/cbCaiqNBwEg9qm0L","pdf",943768,3,1,24,"English","en",105,"# Introduction\n## Token compression for OmniLLMs\n## Limitations of unimodal-guided compression\n## Proposed method: OmniFocus\n## Experimental evaluation (overview)","[{\"question\":\"Why do OmniLLMs have high inference cost for audio-visual inputs?\",\"answer\":\"Audio-visual inputs generate large token sequences for OmniLLMs, increasing inference cost and limiting use in long-form or resource-constrained settings.\"},{\"question\":\"What limitations arise from existing unimodal-guided audio-visual token compression?\",\"answer\":\"Unimodal guidance overlooks temporal locality of query-relevant evidence and implicitly assumes temporally aligned information density across modalities, which can cause modality bias.\"},{\"question\":\"How does OmniFocus address modality bias in token compression?\",\"answer\":\"OmniFocus is training-free and query-guided: it performs independent importance estimation for video and audio, producing modality-symmetric compression that preserves modality-specific salient evidence while maintaining audio-visual alignment.\"}]",1784182438,60,{"code":4,"msg":31,"data":32},"ok",{"site_id":25,"language":24,"slug":33,"title":13,"keywords":34,"description":14,"schema_data":35,"social_meta":86,"head_meta":88,"extra_data":90,"updated_unix":28},"omnifocus-query-guided-modality-balanced-token-compression-for-omni-modal-large-language-models","",{"@graph":36,"@context":85},[37,53,68],{"@type":38,"itemListElement":39},"BreadcrumbList",[40,44,48,50],{"item":41,"name":42,"@type":43,"position":21},"https://docshare.wps.com","Home","ListItem",{"item":45,"name":46,"@type":43,"position":47},"https://docshare.wps.com/document/","Document",2,{"item":49,"name":12,"@type":43,"position":20},"https://docshare.wps.com/document/research-report/",{"item":51,"name":13,"@type":43,"position":52},"https://docshare.wps.com/document/omnifocus-query-guided-modality-balanced-token-compression-for-omni-modal-large-language-models/82712/",4,{"url":51,"name":13,"@type":54,"author":55,"headline":13,"publisher":57,"fileFormat":60,"inLanguage":24,"description":14,"dateModified":61,"datePublished":62,"encodingFormat":60,"isAccessibleForFree":63,"interactionStatistic":64},"DigitalDocument",{"name":9,"@type":56},"Person",{"url":41,"name":58,"@type":59},"DocShare","Organization","application/pdf","2026-07-24","2026-07-16",true,{"@type":65,"interactionType":66,"userInteractionCount":20},"InteractionCounter",{"@type":67},"ViewAction",{"@type":69,"mainEntity":70},"FAQPage",[71,77,81],{"name":72,"@type":73,"acceptedAnswer":74},"Why do OmniLLMs have high inference cost for audio-visual inputs?","Question",{"text":75,"@type":76},"Audio-visual inputs generate large token sequences for OmniLLMs, increasing inference cost and limiting use in long-form or resource-constrained settings.","Answer",{"name":78,"@type":73,"acceptedAnswer":79},"What limitations arise from existing unimodal-guided audio-visual token compression?",{"text":80,"@type":76},"Unimodal guidance overlooks temporal locality of query-relevant evidence and implicitly assumes temporally aligned information density across modalities, which can cause modality bias.",{"name":82,"@type":73,"acceptedAnswer":83},"How does OmniFocus address modality bias in token compression?",{"text":84,"@type":76},"OmniFocus is training-free and query-guided: it performs independent importance estimation for video and audio, producing modality-symmetric compression that preserves modality-specific salient evidence while maintaining audio-visual alignment.","https://schema.org",{"og:url":51,"og:type":87,"og:title":13,"og:site_name":58,"og:description":14},"article",{"robots":89,"canonical":51},"index,follow",{"doc_id":7,"site_id":25},{"code":4,"msg":5,"data":92},[93,97,101,105,109,114,119,122,127,130,134],{"id":21,"doc_module":4,"doc_module_name":46,"category_name":94,"show_sort_weight":95,"slug":96},"Story & Novel",90,"story-novel",{"id":47,"doc_module":4,"doc_module_name":46,"category_name":98,"show_sort_weight":99,"slug":100},"Literature",80,"literature",{"id":52,"doc_module":4,"doc_module_name":46,"category_name":102,"show_sort_weight":103,"slug":104},"Exam",70,"exam",{"id":106,"doc_module":4,"doc_module_name":46,"category_name":107,"show_sort_weight":29,"slug":108},5,"Comic","comic",{"id":110,"doc_module":4,"doc_module_name":46,"category_name":111,"show_sort_weight":112,"slug":113},6,"Technology",50,"technology",{"id":115,"doc_module":4,"doc_module_name":46,"category_name":116,"show_sort_weight":117,"slug":118},7,"Healthcare",40,"healthcare",{"id":11,"doc_module":4,"doc_module_name":46,"category_name":12,"show_sort_weight":120,"slug":121},30,"research-report",{"id":123,"doc_module":4,"doc_module_name":46,"category_name":124,"show_sort_weight":125,"slug":126},9,"Religion & Spirituality",20,"religion-spirituality",{"id":125,"doc_module":4,"doc_module_name":46,"category_name":128,"show_sort_weight":125,"slug":129},"World Cup","world-cup",{"id":131,"doc_module":4,"doc_module_name":46,"category_name":132,"show_sort_weight":131,"slug":133},10,"Lifestyle","lifestyle",{"id":135,"doc_module":4,"doc_module_name":46,"category_name":136,"show_sort_weight":106,"slug":137},19,"General","general"]