arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-17 至 2026-04-17 共收录 52 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 17 篇

2604.14386 2026-04-17 cs.GT cs.AI 57%

Coalition Formation in LLM Agent Networks: Stability Analysis and Convergence Guarantees

在LLM代理网络中的联盟形成:稳定性分析与收敛保证

Dongxin Guo, Jikun Wu, Siu-Ming Yiu

机构 * Department of Compute Science, The University of Hong Kong(香港大学计算机科学系) Brain Investing Limited(Brain Investing有限公司) Stellaris AI Limited(Stellaris AI有限公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出首个基于享乐博弈理论的LLM联盟形成框架,分析了LLM代理的有限理性特性,并通过实验验证了CoalT协议在联盟稳定性上的优越性。

Comments 15 pages including supplementary material, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14261 2026-04-17 cs.CL cs.AI 57%

ReviewGrounder: Improving Review Substantiveness with Rubric-Guided, Tool-Integrated Agents

ReviewGrounder:通过规则引导和工具集成代理提升评审的实质内容

Zhuofeng Li, Yi Lu, Dongfu Jiang, Haoxiang Zhang, Yuyang Bai, Chuan Li, Yu Wang, Shuiwang Ji, Jianwen Xie, Yu Zhang

机构 * Texas A&M University(德克萨斯A&M大学) University of Waterloo(滑铁卢大学) UC San Diego(南加州大学) Lambda University of Oregon(俄勒冈大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出ReviewGrounder框架,通过规则引导和工具集成提升AI会议评审的实质内容,实验表明其在8个维度上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14222 2026-04-17 cs.IR cs.AI 57%

Adaptive Query Routing: A Tier-Based Framework for Hybrid Retrieval Across Financial, Legal, and Medical Documents

自适应查询路由:一种分层框架,用于金融、法律和医疗文档的混合检索

Afshan Hashmi

机构 * TRDC, Tuwaiq Academy(TRDC,图瓦伊克学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种分层框架,通过比较三种检索架构在金融、法律和医疗领域的表现,揭示了不同检索方法在不同复杂度层级上的性能差异,强调了树状推理和混合检索在跨参考和多段查询中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 1 篇

2604.14198 2026-04-17 cs.LG cs.AI cs.CL 62%

MixAtlas: Uncertainty-aware Data Mixture Optimization for Multimodal LLM Midtraining

MixAtlas: 多模态大语言模型中训练过程中的数据混合优化方法

Bingbing Wen, Sirajul Salekin, Feiyang Kang, Bill Howe, Lucy Lu Wang, Javier Movellan, Manjot Bilkhu

机构 * Apple(苹果公司) University of Washington(华盛顿大学) Virginia Tech(弗吉尼亚理工学院)

专题命中 文档图表理解 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 MixAtlas通过双轴分解训练语料,结合小代理模型与高斯过程代理,优化多模态大语言模型的训练混合策略,提升性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 1 篇

2604.15093 2026-04-17 cs.AI cs.CL cs.CV cs.HC 62%

OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis

OpenMobile: 通过任务和轨迹合成构建开放移动代理

Kanzhi Cheng, Zehao Li, Zheng Ma, Nuo Chen, Jialin Cao, Qiushi Sun, Zichen Ding, Fangzhi Xu, Hang Yan, Jiajun Chen, Anh Tuan Luu, Jianbing Zhang, Lewei Lu, Dahua Lin

机构 * Nanjing University(南京大学) SenseTime(秒速) Nanyang Technological University(南洋理工大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Xi’an Jiaotong University(西安交通大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出OpenMobile框架,通过可扩展的任务合成管道和策略切换策略生成高质量任务指令和轨迹,实现移动代理在AndroidWorld等基准测试中取得显著成绩。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 6 篇

2512.07222 2026-04-17 cs.LG cs.CL 85%

Pay Less Attention to Function Words for Free Robustness of Vision-Language Models

减少对功能词的关注以实现视觉语言模型的自由鲁棒性

Qiwei Tian, Chenhao Lin, Zhengyu Zhao, Chao Shen

机构 * School of Cyber Science and Engineering, Xi’an Jiaotong University, Xi’an 710049, China(西安交通大学计算机科学与工程学院,西安 710049,中国)

专题命中 幻觉与鲁棒性 :vision-language model(title);VLM(abstract,abstract_cn);grounding(abstract);分类 cs.LG

AI总结 本文提出FDA方法,通过减少功能词的注意力影响,提升视觉语言模型在跨模态对抗攻击下的鲁棒性,实验显示在检索任务中ASR下降18%/13%/53%,性能损失极小。

Comments The paper has been accepted by ICLR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03416 2026-04-17 cs.CV 79%

GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models

GAMBIT:一种用于多模态大语言模型的游戏化突破框架

Xiangdong Hu, Yangyang Jiang, Qin Hu, Xiaojun Jia

机构 * Georgia State University(佐治亚州立大学) Shandong University(山东大学) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文提出GAMBIT框架,通过分解重组有害视觉语义并构建游戏化场景,使模型在探索和重建意图中主动完成突破,提升攻击成功率。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20122 2026-04-17 cs.CV 79%

MEBench: A Novel Benchmark for Understanding Mutual Exclusivity Bias in Vision-Language Models

MEBench:一种新的评估视觉-语言模型互斥偏差的基准

Anh Thai, Stefan Stojanov, Zixuan Huang, Bikram Boote, James M. Rehg

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 MEBench通过引入空间推理提升评估难度,评估视觉-语言模型对互斥偏差的处理能力,发现模型存在弱互斥偏差但能利用额外空间上下文解决歧义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14399 2026-04-17 cs.RO cs.AI cs.SY eess.SY 77%

SpaceMind: A Modular and Self-Evolving Embodied Vision-Language Agent Framework for Autonomous On-orbit Servicing

SpaceMind:一种模块化且自我进化的具身视觉-语言代理框架,用于自主在轨服务

Aodi Wu, Haodong Han, Xubo Luo, Ruisuo Wang, Shan He, Xue Wan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与工程中心)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 本文提出SpaceMind框架,通过模块化和自我进化机制,实现自主在轨服务中的视觉感知、三维空间推理和多阶段任务执行,验证了其在不同环境下的鲁棒性和适应性。

Comments 23 pages, 6 figures, 7 tables. Code available at https://github.com/wuaodi/SpaceMind

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14920 2026-04-17 cs.AI 57%

Dual-Axis Generative Reward Model Toward Semantic and Turn-taking Robustness in Interactive Spoken Dialogue Models

双轴生成奖励模型:面向交互口语对话模型中语义和轮流鲁棒性的研究

Yifu Chen, Shengpeng Ji, Zhengqing Liu, Qian Chen, Wen Wang, Ziqing Wang, Yangzhuo Li, Tianle Liang, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tongyi Fun Team, Alibaba Group(通义Fun团队,阿里巴巴集团) Beijing University of Technology(北京理工大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出双轴生成奖励模型,通过详细分类和标注数据集理解复杂交互动态,提供语义质量和交互时间的独立评估,提升口语对话模型的鲁棒性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14227 2026-04-17 cs.IR cs.AI 57%

FRESCO: Benchmarking and Optimizing Re-rankers for Evolving Semantic Conflict in Retrieval-Augmented Generation

FRESCO:用于检索增强生成中动态语义冲突的重排序器基准测试与优化

Sohyun An, Hayeon Lee, Shuibenyang Yuan, Chun-cheng Jason Chen, Cho-Jui Hsieh, Vijai Mohan, Alexander Min

机构 * Meta Superintelligence Labs(Meta超智能实验室)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 FRESCO针对检索增强生成中动态语义冲突问题,评估重排序器在时间动态场景下的性能,发现现有重排序器对较旧文档存在偏见,通过指令优化框架改进了27%的动态知识任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 10 篇

2604.15188 2026-04-17 cs.CV cs.AI 89%

VisPCO: Visual Token Pruning Configuration Optimization via Budget-Aware Pareto-Frontier Learning for Vision-Language Models

VisPCO:通过预算感知的帕累托前沿学习实现视觉令牌修剪配置优化

Huawei Ji, Yuanhao Sun, Yuan Jin, Cheng Deng, Jiaxin Ding, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Edinburgh(爱丁堡大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出VisPCO框架,通过将视觉令牌修剪问题建模为帕累托配置优化问题,自动识别最优配置。实验表明,该方法在8个视觉基准上有效逼近帕累托前沿,并在不同修剪方法和VLM架构中泛化良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14474 2026-04-17 cs.LG 87%

Scouting By Reward: VLM-TO-IRL-Driven Player Selection For Esports

通过奖励进行 scouting:由 VLM-TO-IRL 驱动的电子竞技玩家选拔

Qing Yan, Wenyu Yang, Yufei Wang, Wenhao Ma, Linchong Hu, Yifei Jin, Anton Dahbura

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Pennsylvania(宾夕法尼亚大学) Cornell University(康奈尔大学)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出一种基于逆强化学习的电子竞技玩家选拔框架,通过学习专业选手的奖励函数,利用多模态双分支架构和 GAIL 目标实现玩家风格匹配评估,提升人才发现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11176 2026-04-17 cs.CV 85%

Precision Synthesis of Multi-Tracer PET via VLM-Modulated Rectified Flow for Stratifying Mild Cognitive Impairment

多示踪PET的高精度合成通过VLM调制的校正流用于区分轻度认知障碍

Tuo Liu, Shuijin Lin, Shaozhen Yan, Haifeng Wang, Jie Lu, Jianhua Ma, Chunfeng Lian

机构 * School of Mathematics and Statistics, Xi'an Jiaotong University(西安交通大学数学与统计学学院) Key Laboratory of Biomedical Information Engineering of Ministry of Education, School of Life Science and Technology, Xi'an Jiaotong University(教育部生物医学信息工程重点实验室,西安交通大学生命科学与技术学院) Department of Radiology and Nuclear Medicine, Xuanwu Hospital, Capital Medical University(首都医科大学宣武医院放射科与核医学科) Research Center for Intelligent Medical Equipment and Devices (IMED), Xi'an Jiaotong University(智能医疗设备与器件研究中心(IMED),西安交通大学)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出DIReCT$++$模型,结合MRI和临床信息,通过校正流和视觉语言模型生成高保真多示踪PET图像,实现轻度认知障碍的精准分层。

Comments Added supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11496 2026-04-17 cs.CV cs.CL cs.LG 81%

Revisiting Compositionality in Dual-Encoder Vision-Language Models: The Role of Inference

重新审视双编码视觉-语言模型中的组合性:推断的作用

Imanol Miranda, Ander Salaberria, Eneko Agirre, Gorka Azkune

机构 * HiTZ Center – Ixa, University of the Basque Country (UPV/EHU)(希茨中心–Ixa,巴斯克国家大学(UPV/EHU))

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文探讨了双编码视觉-语言模型中组合性问题的根源,提出通过改进推断协议提升组合性能,引入轻量级变压器学习局部对齐,优于全微调和端到端训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14629 2026-04-17 cs.CV 79%

Switch-KD: Visual-Switch Knowledge Distillation for Vision-Language Models

Switch-KD:视觉切换知识蒸馏用于视觉-语言模型

Haoyi Sun, Xiaoxiao Wang, Ning Mao, Qian Wang, Lifu Mu, Wen Zheng, Tao Wei, Wei Chen

机构 * Li Auto Inc(利-auto公司)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 Switch-KD通过统一视觉-语言知识转移,解决多模态对齐问题,使小模型高效蒸馏大模型的多模态知识。

Comments 11 pages, 3 figures

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14149 2026-04-17 cs.CV 77%

One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding

每个高度选择性帧一个标记:朝着长视频理解的极端压缩

Zheyu Zhang, Ziqi Pang, Shixing Chen, Xiang Hao, Vimal Bhat, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon Prime Video(亚马逊Prime视频)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出XComp模型,通过极端视频标记压缩提升长视频理解性能,结合标记级和帧级压缩,实现更高的压缩比和更密集的帧采样。

Comments Appear in the proceedings of NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10410 2026-04-17 cs.AI 70%

CWCD: Category-Wise Contrastive Decoding for Structured Medical Report Generation

CWCD:用于结构化医学报告生成的类别级对比解码

Shantam Srivastava, Mahesh Bhosale, David Doermann, Mingchen Gao

机构 * The Department of Computer Science and Engineering(计算机科学与工程系) University at Buffalo, The State University of New York, NY, USA(布法罗大学,纽约州立大学)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出CWCD框架,通过类别特定参数化和对比正常与遮蔽X光片生成结构化放射报告,提升临床效果和生成质量。

Comments Accepted to MIDL 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03295 2026-04-17 cs.CL cs.AI cs.CV 62%

POP: Prefill-Only Pruning for Efficient Large Model Inference

POP:仅预填充剪枝用于高效大模型推理

Junhui He, Zhihui Fu, Jun Wang, Qingan Li

机构 * Wuhan University(武汉大学) OPPO Research Institute(OPPO研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出POP剪枝方法,通过区分预填充和解码阶段,仅剪枝深度层以提升预填充效率,保留完整模型用于解码,实现1.37倍的预填充延迟提升且性能损失小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15090 2026-04-17 cs.CV 57%

Beyond Visual Cues: Semantic-Driven Token Filtering and Expert Routing for Anytime Person ReID

超越视觉线索:基于语义的标记过滤和专家路由用于即时人物重识别

Jiaxuan Li, Xin Wen, Zhihang Li

机构 * Tsinghua University(清华大学) Independent Researcher(独立研究者) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出STFER框架,利用大视觉-语言模型生成身份一致的文本,提升对服装变化和模态转换的鲁棒性,通过语义驱动的标记过滤和专家路由实现多场景鲁棒性,实验表明模型在AT-USTC数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21262 2026-04-17 cs.CL 50%

CausalEmbed: Auto-Regressive Multi-Vector Generation in Latent Space for Visual Document Embedding

CausalEmbed: 在潜在空间中实现自动回归多向量生成用于视觉文档嵌入

Jiahao Huo, Yu Huang, Yibo Yan, Ye Pan, Kening Zheng, Wei-Chieh Huang, Yi Cao, Mingdong Ou, Philip S. Yu, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Cloud Computing(阿里云计算) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 本文提出CausalEmbed方法,通过对比训练中的迭代边际损失生成紧凑且结构良好的多向量嵌入,实现高效的视觉文档检索,减少30-155倍的token数量同时保持高性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他VLM 1 篇

2604.14710 2026-04-17 cs.CV 57%

G-MIXER: Geodesic Mixup-based Implicit Semantic Expansion and Explicit Semantic Re-ranking for Zero-Shot Composed Image Retrieval

G-MIXER:基于测地混合的隐式语义扩展和显式语义重新排序用于零样本复合图像检索

Jiyoung Lim, Heejae Yang, Jee-Hyong Lee

机构 * Sungkyunkwan University(顺天大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 G-MIXER通过测地混合生成隐式语义特征并重新排序显式语义,提升零样本复合图像检索的多样性和准确性,实现跨多个基准的最优性能。

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏