arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-23 至 2026-03-23 共收录 51 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 2 篇

2602.02142 2026-03-23 cs.RO cs.CV 57%

FD-VLA: Force-Distilled Vision-Language-Action Model for Contact-Rich Manipulation

FD-VLA:力感知的视觉-语言-动作模型用于接触密集的 manipulation

Ruiteng Zhao, Wenshuo Wang, Yicheng Ma, Xiaocong Li, Francis E. H. Tay, Marcelo H. Ang, Haiyue Zhu

机构 * Advanced Robotics Centre, National University of Singapore(新加坡国立大学先进机器人中心) School of Electrical & Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) College of Information Science and Technology, Eastern Institute of Technology(东部技术学院信息科学与技术学院) John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院) Advanced Robotics Centre at National University of Singapore(新加坡国立大学先进机器人中心) Singapore Institute of Manufacturing Technology, Agency for Science, Technology and Research (A*STAR)(新加坡制造技术研究所,科技研究局(A*STAR))

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV

AI总结 本文提出FD-VLA模型,通过力蒸馏模块在不依赖物理力传感器的情况下实现接触密集任务的力感知,提升机器人视觉-语言-动作的鲁棒性与实用性。

Comments ICRA 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与鲁棒性 6 篇

2603.20162 2026-03-23 cs.CL 71%

Evaluating Evidence Grounding Under User Pressure in Instruction-Tuned Language Models

评估在用户压力下指令调优语言模型的证据基础

Sai Koneru, Elphin Joe, Christine Kirchhoff, Jian Wu, Sarah Rajtmajer

机构 * College of Information Sciences and Technology, Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院) Department of Computer Science, Old Dominion University(老 Dominion 大学计算机科学系)

专题命中 幻觉与鲁棒性 :grounding(title)

AI总结 研究探讨了在用户压力下指令调优语言模型如何平衡用户对齐压力与上下文证据的忠实性,通过控制的认知冲突框架评估证据一致性准确性及排序表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23571 2026-03-23 cs.RO cs.AI cs.CV cs.LG 67%

RobotArena $\infty$: Scalable Robot Benchmarking via Real-to-Sim Translation

RobotArena ∞:通过现实到模拟的翻译实现可扩展的机器人评估

Yash Jangir, Yidi Zhang, Pang-Chi Lo, Kashu Yamazaki, Chenyu Zhang, Kuan-Hsun Tu, Tsung-Wei Ke, Lei Ke, Yonatan Bisk, Katerina Fragkiadaki

机构 * Carnegie Mellon University(卡内基梅隆大学) National Taiwan University(国立台湾大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出RobotArena Infinity框架,通过模拟环境与在线人类反馈,解决机器人政策评估中的劳动密集型、安全性差等问题,实现可扩展的视觉-语言-动作评估。

Comments Website: https://robotarenainf.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08570 2026-03-23 cs.CV cs.AI cs.LG 67%

Superclass-Guided Representation Disentanglement for Spurious Correlation Mitigation

面向虚假相关性缓解的超类引导的表示解耦

Chenruo Liu, Hongjun Liu, Zeyu Lai, Yiqiu Shen, Chen Zhao, Qi Lei

机构 * New York University(纽约大学) NYU Grossman School of Medicine(纽约大学 Grossman 医学院) Zhejiang University(浙江大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出利用超类引导解耦表示以缓解虚假相关性,通过预训练视觉-语言模型的梯度注意力对齐和理论支持的最小最大最优特征使用策略,提升模型对复杂组结构和虚假相关性的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19765 2026-03-23 cs.CV 57%

FREAK: A Fine-grained Hallucination Evaluation Benchmark for Advanced MLLMs

FREAK:一种用于高级MLLMs细粒度幻觉评估的基准测试

Zhihan Yin, Jianxin Liang, Yueqian Wang, Yifeng Yao, Huishuai Zhang, Dongyan Zhao

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王学苑计算机技术研究所) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出FREAK基准测试,通过高质量图像评估MLLMs在细粒度视觉感知中的幻觉问题,揭示了现有模型在详细视觉感知上的严重幻觉问题。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18048 2026-03-23 cs.AI cs.SD eess.AS 57%

DEAF: A Benchmark for Diagnostic Evaluation of Acoustic Faithfulness in Audio Language Models

DEAF:用于音频语言模型声音忠实度诊断评估的基准

Jiaqi Xiong, Yunjia Qi, Qi Cao, Yu Zheng, Yutong Zhang, Ziteng Wang, Ruofan Liao, Weisheng Xu, Sichen Liu

机构 * University of Oxford(牛津大学) XJTLU HNU(湖南大学) CUHK(SZ)(香港中文大学(深圳)) PKU(北京大学) HKUST(GZ)(香港科技大学(广州))

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 DEAF基准通过2700多个冲突刺激,评估音频语言模型对声音信号的真实处理能力,揭示模型在语音基准测试中的表现与真实声音理解间的差距。

Comments 14 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19251 2026-03-23 cs.CL 50%

Enhancing Legal LLMs through Metadata-Enriched RAG Pipelines and Direct Preference Optimization

通过元数据增强的RAG流水线和直接偏好优化增强法律LLM

Suyash Maniyar, Deepali Singh, Rohith Reddy

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 本文提出元数据增强的RAG和直接偏好优化,解决法律领域长文本检索和生成中的精度问题,提升模型的可靠性与安全性。

Comments 12 pages including Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏

3. VLM训练与架构 12 篇

2511.17885 2026-03-23 cs.CV cs.LG 84%

FastMMoE: Accelerating Multimodal Large Language Models through Dynamic Expert Activation and Routing-Aware Token Pruning

FastMMoE:通过动态专家激活和路由感知的标记剪枝加速多模态大语言模型

Guoyang Xia, Yifeng Ding, Fengfa Li, Lei Ren, Wei Chen, Fangxiang Feng, Xiaojie Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Li Auto(利亚自动化)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出FastMMoE,一种无需训练的加速框架,通过动态专家激活和路由感知标记剪枝,显著降低计算量并保持性能,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24837 2026-03-23 cs.CV 79%

ZOO-Prune: Training-Free Token Pruning via Zeroth-Order Gradient Estimation in Vision-Language Models

ZOO-Prune:基于零阶梯度估计的训练自由token剪枝方法用于视觉-语言模型

Youngeun Kim, Youjia Zhang, Huiling Liu, Aecheon Jung, Sunwoo Lee, Sungeun Hong

机构 * Amazon(亚马逊公司) Sungkyunkwan University(成均馆大学) Inha University(inha大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出ZOO-Prune方法,通过零阶梯度估计在视觉-语言模型中实现无需训练的token剪枝,实验表明其在剪枝94.4%token的同时保持精度,并提升推理效率2.3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18282 2026-03-23 cs.CV 77%

CycleCap: Improving VLMs Captioning Performance via Self-Supervised Cycle Consistency Fine-Tuning

CycleCap: 通过自监督循环一致性微调提升VLMs的描述性能

Marios Krestenitis, Christos Tzelepis, Konstantinos Ioannidis, Stefanos Vrochidis, Ioannis Kompatsiaris, Georgios Tzimiropoulos, Shaogang Gong, Ioannis Patras

机构 * Queen Mary, University of London(伦敦大学玛丽女王学院) Centre for Research and Technology Hellas(希腊研究中心) City St George’s, University of London(伦敦大学圣乔治学院)

专题命中 VLM训练与架构 :VLM(abstract);visual reasoning(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出CycleCap,通过自监督循环一致性训练提升VLMs的图像描述性能,利用GRPO优化策略,基于重建图像与原始图像相似性作为奖励信号,无需标注数据即可提高描述准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19708 2026-03-23 cs.CV 70%

WorldAgents: Can Foundation Image Models be Agents for 3D World Models?

WorldAgents: 2D基础图像模型是否能作为3D世界模型的智能体?

Ziya Erkoç, Angela Dai, Matthias Nießner

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文探讨2D基础图像模型是否具备3D世界生成能力,提出多智能体架构实现3D世界合成,通过实验验证2D模型能生成一致且逼真的3D世界。

Comments Webpage: https://ziyaerkoc.com/worldagents/ Video: https://www.youtube.com/watch?v=Mj2FqqhurdI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19678 2026-03-23 cs.CV 70%

Vision-Language Attribute Disentanglement and Reinforcement for Lifelong Person Re-Identification

视觉-语言属性解耦与强化用于终身人物重识别

Kunlun Xu, Haotong Cheng, Jiangmeng Li, Xu Zou, Jiahuan Zhou

机构 * Wangxuan Institute of Computer Technology, Peking University, Beijing, China(北京大学王轩计算机技术研究院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology, Wuhan, China(华中科技大学人工智能与自动化学院,武汉,中国)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出VLADR方法,通过视觉-语言属性解耦与强化提升跨域知识迁移,增强抗遗忘与泛化能力,实验表明在抗遗忘和泛化能力上优于现有方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17246 2026-03-23 cs.LG 70%

On the Cone Effect and Modality Gap in Medical Vision-Language Embeddings

关于医学视觉-语言嵌入中的锥效应与模态间隙

David Restrepo, Miguel L Martins, Chenwei Wu, Luis Filipe Nakayama, Diego M Lopez, Stergios Christodoulidis, Maria Vakalopoulou, Enzo Ferrante

机构 * CentraleSupélec, Université Paris-Saclay, France(中央理工巴黎高等学院,巴黎萨克雷大学,法国) University of Porto, Portugal(葡萄牙波尔图大学) University of Michigan, USA(美国密歇根大学) Federal University of São Paulo, Brazil(巴西圣保罗联邦大学) Universidad del Cauca, Colombia(哥伦比亚考卡大学) Universidad de Buenos Aires, Argentina(阿根廷布宜诺斯艾利斯大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.LG

AI总结 本文研究了视觉语言模型中的锥效应及其对多模态性能的影响,通过轻量级机制调控模态间隙,发现医学数据集对间隙调节更敏感,但过度消除间隙并非最优,任务相关分离更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20192 2026-03-23 cs.CV cs.AI 62%

LumosX: Relate Any Identities with Their Attributes for Personalized Video Generation

LumosX:通过身份与属性的关系实现个性化视频生成

Jiazheng Xing, Fei Du, Hangjie Yuan, Pengwei Liu, Hongbin Xu, Hai Ci, Ruigang Niu, Weihua Chen, Fan Wang, Yong Liu

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎斑实验室) National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 LumosX通过结合身份与属性关系,提升多主体个性化视频生成的精细度和一致性,采用数据与模型双改进策略,构建了全面的基准测试平台。

Comments ICLR 2026 Camera Ready Version. Code and Models: https://jiazheng-xing.github.io/lumosx-home/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19807 2026-03-23 cs.CV cs.AI 62%

Enhancing Alignment for Unified Multimodal Models via Semantically-Grounded Supervision

通过语义引导监督增强统一多模态模型的对齐

Jiyeong Kim, Yerim So, Hyesong Choi, Uiwon Hwang, Dongbo Min

机构 * Ewha Womans University(成均馆大学) Soongsil University(顺天大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Semantically-Grounded Supervision方法,通过构建视觉接地图和语义引导的破坏输入,解决统一多模态模型中的粒度不匹配和监督冗余问题,提升生成质量和跨模态对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15164 2026-03-23 cs.CV 57%

Multimodal Continual Instruction Tuning with Dynamic Gradient Guidance

多模态持续指令微调与动态梯度指导

Songze Li, Mingyu Gao, Tonghua Su, Xu-Yao Zhang, Zhongjie Wang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济发展实验室) Chongqing Research Institute of HIT(重庆哈工大研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出通过几何参数空间方向向量近似缺失梯度,结合有限回放缓冲区和伯努利采样策略,有效缓解多模态持续指令微调中的灾难性遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19571 2026-03-23 cs.CV 57%

CurveStream: Boosting Streaming Video Understanding in MLLMs via Curvature-Aware Hierarchical Visual Memory Management

CurveStream: 通过曲率感知的层次视觉记忆管理提升MLLMs在流媒体视频理解中的性能

Chao Wang, Xudong Tan, Jianjian Cao, Kangcong Li, Tao Chen

机构 * College of Future Information Technology, Fudan University(未来信息科技学院,复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 CurveStream通过曲率感知的层次视觉记忆管理框架,在流媒体视频理解中实现显著性能提升,实验表明其在多个基准测试中均优于现有方法,达到新状态-of-the-art结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19533 2026-03-23 cs.CV cs.RO 57%

Pedestrian Crossing Intent Prediction via Psychological Features and Transformer Fusion

通过心理特征和Transformer融合进行行人过街意图预测

Sima Ashayer, Hoang H. Nguyen, Yu Liang, Mina Sartipi

机构 * The University of Tennessee at Chattanooga(田纳西大学查塔努加分校)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

AI总结 本文提出一种轻量级社交感知架构,通过融合四种行为流实现行人意图预测,采用高效Transformer结构和不确定性量化方法,在PSI 1.0和PSI 2.0数据集上取得优异性能。

Comments Accepted to IEEE Intelligent Vehicles Symposium (IV) 2026. 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19771 2026-03-23 cs.CL 50%

Neither Here Nor There: Cross-Lingual Representation Dynamics of Code-Mixed Text in Multilingual Encoders

既非此处亦非彼处:多语言编码器中混合语言文本的跨语言表示动态

Debajyoti Mazumder, Divyansh Pathak, Prashant Kodali, Jasabanta Patro

机构 * Indian Institute of Science Education and Research(印度科学教育与研究学院) Microsoft Corporation(微软公司)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 研究探讨多语言编码器对混合语言文本的内部表示,发现标准模型在英语和印地语间表现良好,但混合文本与任一语言连接松散。通过训练混合数据可提升英语混合文本对齐,但损害英语-印地语对齐。引入三语后训练目标,使混合文本表示更接近构成语言,提升跨语言理解。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他VLM 2 篇

2603.19744 2026-03-23 cs.CL 82%

Rethinking Ground Truth: A Case Study on Human Label Variation in MLLM Benchmarking

重新审视真实标签:在大语言模型基准测试中的人类标签变异案例研究

Tomas Ruiz, Tanalp Agustoslu, Carsten Schwemmer

机构 * Bavarian Research Institute for Digital Transformation(巴伐利亚数字转型研究所)

专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract)

AI总结 研究探讨了人类标注差异对大语言模型基准测试的影响,发现大模型在高一致性子集表现最佳,但在高分歧情况下表现不佳,表明参数数量不决定对模糊性和主观性的敏感度。

Comments 6 pages, 3 tables, 1 figure

Journal ref 2025 IEEE International Conference on Big Data (BigData), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09833 2026-03-23 cs.LG 74%

ACT as Human: Multimodal Large Language Model Data Annotation with Critical Thinking

ACT作为人类:多模态大语言模型数据标注中的批判性思维

Lequan Lin, Dai Shi, Andi Han, Feng Chen, Qiuzheng Chen, Jiawen Li, Zhaoyang Li, Jiyuan Li, Zhenbang Sun, Junbin Gao

机构 * University of Sydney(悉尼大学) University of Cambridge(剑桥大学) Riken AIP(理化学研究所AIP分所) University of Adelaide(阿德莱德大学) ByteDance Australia(字节跳动澳大利亚)

专题命中 其他VLM :multimodal large language model(title);分类 cs.LG

AI总结 本文提出ACT标注框架,利用大语言模型作为评判者提高标注效率,通过批判性思维识别潜在错误,减少人工成本,提升标注质量。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏