arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-10 至 2026-08-10 共收录 16 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 16 篇

2608.07435 2026-08-10 cs.CV cs.AI cs.CL 新提交 89%

SABRE: Scalable and Automated Benchmarking of VLMs under Stress

SABRE:压力场景下视觉语言模型(VLM)的可扩展自动化基准测试

Zixuan Lan, Luzhe Sun, Matthew R. Walter, Jiawei Zhou

机构 * University of Chicago(芝加哥大学) Toyota Technological Institute at Chicago(芝加哥丰田技术学院) Stony Brook University(石溪大学)

专题命中 VLM训练与架构 :VLM(title_cn,summary_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 SABRE是可扩展自动化VLM压力测试框架,可生成多维度测试样本,经实验验证其能有效评估VLMs对视觉证据与世界先验的依赖程度,支持多种压力测试场景。

Comments 22 pages, 10 figures. Code and resources will be available at https://zesearch.github.io/vlm-SABRE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07193 2026-08-10 cs.LG cs.CV 新提交 85%

An AI4AI Framework for Visual Token Pruning

用于视觉令牌剪枝的AI4AI框架

Zhen Liu, Wenli Huang, Wei Song, Yuhan Liu, Zhiqin Yang, Jingwen Fu

专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 本研究提出AutoPrune框架,通过TPDSL让LLM自动设计视觉令牌剪枝策略,在14个多模态基准和3个MLLM主干上,剪枝94.4%视觉令牌仍保留超99%性能,大幅降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07279 2026-08-10 eess.SP 新提交 85%

Token Communication for Multimodal Large Language Model

多模态大语言模型的令牌通信

Jingkai Ying, Zhijin Qin, Yuan Shen, Khaled B. Letaief

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn)

AI总结 本文针对多模态大语言模型(MLLMs)的令牌传输问题,提出适配MLLMs的令牌通信框架,通过集成神经编解码器、两阶段语义对齐训练及自适应适配器,在相同传输数据量下实现更优任务性能。

Comments 13 pages, 11 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12756 2026-08-10 cs.CV 版本更新 84%

VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression

VisCo:利用大语言模型作为视觉令牌压缩的内在编码器

Yupeng Zheng, Kai Zou, Bin Liu, Nenghai Yu

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 研究针对视觉语言模型处理视觉令牌时的高成本问题,提出训练高效的自压缩框架VisCo,将预训练VLM用作内在压缩器,通过参数共享自动编码器压缩视觉信息,实验证明其在压缩率上超先前方法,还能捕获互补表示改进基础模型。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11240 2026-08-10 cs.CV 版本更新 83%

Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models

解耦相似性用于大视觉-语言模型中的任务感知token剪枝

Kexin Ma, Jing Xiao, Chaofeng Chen, Geyong Min, Guibo Zhu, Jinqiao Wang, Liang Liao

机构 * Wuhan University(武汉大学) University of Exeter(埃克塞特大学) Chinese Academy of Sciences(中国科学院) Xi'an University of Electronic Science and Technology(西安电子科技大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文提出DeSAP方法,通过解耦相似性实现精准任务感知token剪枝,提升大视觉-语言模型的效率与性能,实验表明在不同基准和架构上均优于现有方法。

Comments Accepted at ACM Multimedia 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07088 2026-08-10 cs.CV cs.AI 新提交 79%

RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs

RoRA:面向角色的区域分配,用于多模态大语言模型中的视觉令牌剪枝

Qiyanhui Lu, Han Wu, Rongjian Xu, Tingzhang Luo, Cheng Fan, Xinghao Chen, Minjing Dong, Jufeng Yang, Jianyuan Guo

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对多模态大语言模型视觉令牌剪枝的高开销问题,提出无训练框架RoRA,通过角色导向的区域分配实现高效剪枝,在多个模型系列上优于基线,大幅降低推理时间且保留高准确率。

Comments 9 pages, 4 figures, 4 tables. Code is available at https://github.com/LukieLuu/RoRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06411 2026-08-10 cs.AI cs.CV 新提交 79%

Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin

学习在多模态大语言模型(MLLMs)中预测中间层注意力以进行视觉token剪枝

Yuyao Sun, Tao Deng, Shuang Li, Deqing Wang, Hao Geng, Minjun Yu

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对MLLMs视觉token剪枝的固定层非最优及计算成本高的问题,提出MAP方法,实现仅保留5.56%视觉token时维持97.5%性能,获3.09倍端到端加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06745 2026-08-10 cs.AI 新提交 77%

MemPrism: Task-Conditioned Relational Memory Views for Long-Horizon Agents

MemPrism:面向长程智能体的任务条件关系记忆视图

Zhisheng Chen, Bingfan Zeng, Bangde Cao, Zhengwei Xie, Yuxuan Li, Jinhan Li, Zheng Lu, Xiangchen Guan, Zikai Xiao, Rui Qian, Jingwei Song

机构 * Nanyang Technological University(南洋理工大学) South China University of Technology(华南理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Zhejiang University(浙江大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 该研究针对长程智能体记忆系统的表示不匹配问题,提出MemPrism任务条件关系记忆框架,经实验验证可提升长程任务性能、减少记忆消耗且视图策略可跨VLM迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06722 2026-08-10 cs.HC 新提交 75%

CustomDance: Customized 3D Dance Generation with Coarse-to-Fine Human-Centered Interactive Control

CustomDance:基于以人为中心的粗到细交互式控制的定制化3D舞蹈生成

Xulong Tang, Kaixing Yang, Xiaohu Guo, Prabhakaran Balakrishnan, Rawan Alghofaili

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract)

AI总结 CustomDance是基于粗到细交互式控制的定制化3D舞蹈生成系统,通过三阶段流程实现AI辅助编舞,在定量和定性比较中优于基线,为用户提供全面控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07141 2026-08-10 cs.CV 新提交 70%

Human-AI Perceptual Alignment by Playing Hues and Cues

通过玩Hues and Cues游戏实现人类与AI的感知对齐

Nuria Alabau-Bosque, Jorge Vila-Tomás, Paula Daudén-Oliver, Pablo Hernández-Cámara, Valero Laparra, Jesús Malo

机构 * Universitat de València(瓦伦西亚大学) Image Processing Lab(图像处理实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本研究提出基于Hues and Cues游戏的评估框架,对比162个CVLMs与人类的颜色感知对齐,发现其在抽象领域偏离人类基线,筛选的预训练数据集可缓解错位。

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06429 2026-08-10 cs.CL cs.LG 新提交 70%

Recovering Lesion Parameters from Aphasic Picture Naming Error Profiles in Large Language Models

从大型语言模型中失语症图片命名错误轮廓中恢复损伤参数

Yong Yang, Roger Newman-Norlund, Xiang Guan, Saeed Ahmadi, Regan Willis, Nadra Salman, Kalil Warren, Sophie Arheix-Parras, Srihari Nelakuditi, Leonardo Bonilha, Christopher Rorden, Rutvik H. Desai, Julius Fridriksson

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.LG

AI总结 该研究针对LLM的失语症图片命名错误轮廓,训练多任务神经网络恢复损伤参数,发现除层索引仅邻域可恢复外,修改百分比和噪声sigma可恢复,反事实验证达81.4%,还能泛化到中风幸存者数据,揭示Transformer层功能冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22251 2026-08-10 cs.LG cs.AI 版本更新 62%

IFCLoRA: Topology-Aware Rank Allocation for Parameter-Efficient Fine-Tuning

IFCLoRA:用于参数高效微调的拓扑感知秩分配

Wei Zhang, Xinwu Liu, Yihang Cheng

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究针对LoRA方法中秩分配问题,提出IFCLoRA拓扑感知秩分配方法,利用小校准集和冻结模型构建交互图,结合全局拓扑先验与局部梯度敏感性计算得分来分配秩,在多场景下优于其他方法,还揭示了任务依赖的秩分布特点。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27581 2026-08-10 cs.LG 版本更新 57%

MUGEN: A Unified Framework for Efficient Motion Understanding and Generation

MUGEN:用于高效运动理解与生成的统一框架

Zhankai Ye, Yukai Jin, Bingyang Wei, Bofan Li, Yusen Wu, Fangyi Li, Shangqian Gao, Xin Liu

机构 * Florida State University(佛罗里达州立大学) Texas Christian University(得克萨斯基督教大学) University of Miami(迈阿密大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 MUGEN是一个无码本的统一运动-语言框架,通过自适应长度自编码器实现高效运动压缩,在HumanML3D和SnapMoGen数据集上的生成、检索与对齐指标均表现优异,兼顾效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08260 2026-08-10 cs.CV 版本更新 57%

TIDE: Task-Isolated Diffusion for Unified Video Editing and Generation

TIDE: 任务隔离扩散模型用于统一视频编辑与生成

Qi Liu, Gang Yue, Mingyu Yin, Lisai Zhang, Yidi Wu, Yaole Wang, Yaohui Wang, Chang Yao, Jingyuan Chen, Lin Ma

机构 * Zhejiang University(浙江大学) Bilibili Inc.(哔哩哔哩股份有限公司)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 提出TIDE统一框架,通过逐token任务嵌入和双路径条件机制,实现指令编辑、参考编辑和多参考生成,在多任务渐进训练下达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18816 2026-08-10 cs.CV 版本更新 57%

Grad-ECLIP: Gradient-based Visual and Textual Explanations for CLIP

Grad-ECLIP: 基于梯度的CLIP视觉与文本解释

Chenyang Zhao, Kun Wang, Janet H. Hsiao, Antoni B. Chan

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Division of Social Science and Department of Computer Science & Engineering, Hong Kong University of Science & Technology(香港科学与技术大学社会科学学院及计算机科学与工程系) SenseTime Group Ltd(时光集团有限公司)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出Grad-ECLIP方法,通过分解CLIP编码器架构并分析匹配相似度与中间空间特征的关系,生成有效热图以解释CLIP匹配结果。通过通道和空间权重提升视觉解释质量,并通过定性定量评估验证其有效性。

Journal ref Zhao C, Wang K, Hsiao J H, et al. Grad-eclip: Gradient-based visual and textual explanations for clip[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06672 2026-08-10 cs.CL 新提交 50%

TA-RAG: Tone Awareness as a Design Imperative for Retrieval-Augmented Generation

TA-RAG:将语气感知作为检索增强生成的设计要务

Yong-Bin Kang, Anthony McCosker

机构 * Swinburne University of Technology(斯威本科技大学)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 该研究针对标准RAG系统存在的语境脱耦问题,提出TA-RAG框架,将交流对齐与事实准确性并列为核心设计目标,明确语气感知是高风险语境下RAG系统的设计要务。

详情

展开后加载摘要…

URL PDF HTML 收藏