arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2246 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2246 篇

2504.13690 2025-04-22 cs.CV 70%

Analysing the Robustness of Vision-Language-Models to Common Corruptions

Muhammad Usama, Syeda Aishah Asim, Syed Bilal Ali, Syed Talal Wasim, Umair Bin Mansoor

机构 * Department of Electrical Engineering, DHA Suffa University Karachi(电气工程系,达哈萨夫大学卡拉奇) Department of Computer Science, University of Bonn(计算机科学系,波恩大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2304.10592, arXiv:2301.12597 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23715 2025-04-01 cs.CV 70%

HOIGen-1M: A Large-scale Dataset for Human-Object Interaction Video Generation

Kun Liu, Qi Liu, Xinchen Liu, Jie Li, Yongdong Zhang, Jiebo Luo, Xiaodong He, Wu Liu

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14882 2025-03-26 cs.CV 70%

CalibQuant: 1-Bit KV Cache Quantization for Multimodal LLMs

Insu Han, Zeliang Zhang, Zhiyuan Wang, Yifan Zhu, Susan Liang, Jiani Liu, Haiting Lin, Mingjie Zhao, Chenliang Xu, Kun Wan, Wentian Zhao

专题命中 幻觉与鲁棒性 :InternVL(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14189 2025-03-19 cs.CL cs.CV 70%

Towards Harmless Multimodal Assistants with Blind Preference Optimization

Yongqi Li, Lu Yang, Jian Wang, Runyang You, Wenjie Li, Liqiang Nie

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10613 2025-03-14 cs.CV 70%

CoSTA$\ast$: Cost-Sensitive Toolpath Agent for Multi-turn Image Editing

Advait Gupta, NandaKiran Velaga, Dang Nguyen, Tianyi Zhou

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07216 2025-03-12 cs.LG 70%

FedRand: Enhancing Privacy in Federated Learning with Randomized LoRA Subparameter Updates

Sangwoo Park, Seanie Lee, Byungjoo Kim, Sung Ju Hwang

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19164 2025-02-24 cs.CV 70%

Poison as Cure: Visual Noise for Mitigating Object Hallucinations in LVMs

Kejia Zhang, Keda Tao, Jiasheng Tang, Huan Wang

专题命中 幻觉与鲁棒性 :vision-language model(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14486 2025-02-21 cs.CR cs.AI cs.CL 70%

How Jailbreak Defenses Work and Ensemble? A Mechanistic Investigation

Zhuohang Long, Siyuan Wang, Shujun Liu, Yuhang Lai, Xuanjing Huang, Zhongyu Wei

专题命中 幻觉与鲁棒性 :vision-language model(abstract);LLaVA(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09818 2025-02-17 cs.CV 70%

On the robustness of multimodal language model towards distractions

Ming Liu, Hao Chen, Jindong Wang, Wensheng Zhang

专题命中 幻觉与鲁棒性 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06390 2025-02-12 cs.CV 70%

When Data Manipulation Meets Attack Goals: An In-depth Survey of Attacks for VLMs

Aobotao Dai, Xinyu Ma, Lei Chen, Songze Li, Lin Wang

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02438 2025-02-05 cs.CR cs.AI 70%

Medical Multimodal Model Stealing Attacks via Adversarial Domain Alignment

Yaling Shen, Zhixiong Zhuang, Kun Yuan, Maria-Irina Nicolae, Nassir Navab, Nicolas Padoy, Mario Fritz

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

Comments Accepted at AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04947 2025-01-10 cs.CV 70%

Seeing with Partial Certainty: Conformal Prediction for Robotic Scene Recognition in Built Environments

Yifan Xu, Vineet Kamat, Carol Menassa

专题命中 幻觉与鲁棒性 :vision language model(abstract);VLM(abstract);分类 cs.CV

Comments 10 pages, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12222 2024-12-18 cs.CV 70%

Endangered Alert: A Field-Validated Self-Training Scheme for Detecting and Protecting Threatened Wildlife on Roads and Roadsides

Kunming Li, Mao Shan, Stephany Berrio Perez, Katie Luo, Stewart Worrall

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14674 2024-09-24 cs.RO cs.CL cs.CV 70%

RACER: Rich Language-Guided Failure Recovery Policies for Imitation Learning

Yinpei Dai, Jayjun Lee, Nima Fazeli, Joyce Chai

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Project Website: https://rich-language-failure-recovery.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12255 2024-05-24 eess.IV cs.CV 70%

Mammo-CLIP: A Vision Language Foundation Model to Enhance Data Efficiency and Robustness in Mammography

Shantanu Ghosh, Clare B. Poynton, Shyam Visweswaran, Kayhan Batmanghelich

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments MICCAI 2024, early accept, top 11%

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11864 2024-04-25 cs.CV 70%

Progressive Multi-modal Conditional Prompt Tuning

Xiaoyu Qiu, Hao Feng, Yuechen Wang, Wengang Zhou, Houqiang Li

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10450 2024-03-12 cs.CV 70%

COCA: Classifier-Oriented Calibration via Textual Prototype for Source-Free Universal Domain Adaptation

Xinghong Liu, Yi Zhou, Tao Zhou, Chun-Mei Feng, Ling Shao

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.05335 2023-07-21 cs.CV cs.CL cs.MM 70%

MAP: Multimodal Uncertainty-Aware Vision-Language Pre-training Model

Yatai Ji, Junjie Wang, Yuan Gong, Lin Zhang, Yanru Zhu, Hongfa Wang, Jiaxing Zhang, Tetsuya Sakai, Yujiu Yang

专题命中 幻觉与鲁棒性 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV

Comments CVPR 2023 Main Track Long Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19362 2025-12-02 cs.CV cs.AI cs.CL cs.CY cs.LG 69%

LOTUS: A Leaderboard for Detailed Image Captioning from Quality to Societal Bias and User Preferences

LOTUS: 一种用于从质量到社会偏见和用户偏好的详细图像描述的排行榜

Yusuke Hirota, Boyi Li, Ryo Hachiuma, Yueh-Hua Wu, Boris Ivanovic, Yuta Nakashima, Marco Pavone, Yejin Choi, Yu-Chiang Frank Wang, Chao-Han Huck Yang

机构 * NVIDIA Research(NVIDIA研究)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG;VLM(comments)

AI总结 LOTUS是一种用于评估详细图像描述质量、偏见和社会偏见的排行榜,通过定制标准满足不同用户偏好,揭示了模型在不同评估标准上的表现差异。

Comments Accepted to ACL 2025. Leaderboard: huggingface.co/spaces/nvidia/lotus-vlm-bias-leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16173 2026-08-12 cs.RO 版本更新 67%

Vision-Language-Motion Maps: An Open-Vocabulary, Uncertainty-Aware, Queryable Motion Attribute for 3D Scene Maps

视觉-语言-运动地图:用于3D场景地图的开放词汇、不确定性感知、可查询运动属性

Dibyendu Ghosh, Ayushi Shakya

机构 * Rekise Marine(瑞基斯海洋)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn)

AI总结 研究针对开放词汇3D地图无法处理场景元素运动查询的问题,提出视觉-语言-运动地图(VLMM),其元素有融合运动属性及不确定性。通过实验验证模式字段不可替代,在真实数据集上该方法提升精度、减少错误标志且对噪声姿态鲁棒。

Comments 8 pages, 5 figures, 3 tables. v2: corrected Eq. (7) (residual covariance;implementation unaffected), added the persistent-map update rule, the query-parser grammar, and an aggregation-quantile ablation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04034 2026-08-06 cs.CR 新提交 67%

A Multimodal Automatic Redteaming Evaluation based on Atomic Jailbreak Strategy Decoupling and Combination

基于原子越狱策略解耦与组合的多模态自动红队评估

Shiji Zhao, Yuxuan Zhou, Chen Xiong, Dongxian Wu, Yang Bai, Xun Chen

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract,abstract_cn)

AI总结 针对现有多模态越狱攻击的两大挑战,本文提出HACA方法,构建多模态原子越狱策略空间,对5种主流MLLMs平均攻击成功率达95.48%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14047 2026-07-23 cs.RO cs.HC cs.SY eess.SY 版本更新 67%

Zero2Skill: Bootstrapping Robot Skills through Autonomous Data Collection, Training, and Deployment

PhysClaw-0:一种通过语言修正实现机器人自主的共生智能体系统

Boyuan Wang, Zhenyuan Zhang, Zhiqin Yang, Peijun Gu, Shuya Wang, Xiaofeng Wang, Xianghui Ze, Yifan Chang, Guosheng Zhao, Jiangnan Shao, Guan Huang, Hengyu Liu, Yonggang Zhang, Wei Xue, Chunyuan Guan, Chenglin Pu, Yike Guo, Xingang Wang, Zheng Zhu

机构 * GigaAI(字节跳动人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学) Hong Kong University of Science and Technology(香港科技大学) University of Leeds(利兹大学) Cornell University(康奈尔大学) Tsinghua University(清华大学) Nanjing University of Science and Technology(南京理工大学) The Chinese University of Hong Kong(香港中文大学) FAWTD(一汽技术开发部)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn)

AI总结 研究针对自主数据收集问题,提出PhysClaw-0共生智能体系统,通过跨轮保留和重用修正、自主收集验证等方式,在真实机器人测试中减少人力时间,提高成功率,并提升验证者与人类一致性。

Comments WebPage: https://open-gigaai.github.io/Zero2Skill

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06196 2026-07-08 cs.CL cs.CY 新提交 67%

Pluralis v0.1: Towards a Multicultural, Multimodal, Multilingual Benchmark for AI Risk and Reliability

Pluralis v0.1:迈向用于人工智能风险与可靠性的多元文化、多模态、多语言基准测试

Alicia Parrish, Rajat Shinde, Sanket Badhe, Xinyi Bai, Sree Bhargavi Balija, Hua-Rong Chu, Emilio Ferrara, Armstrong Foundjem, Rajat Ghosh, Aakash Gupta, Xuanli He, Ong Chen Hui, Minji Jung, Madhangi Karimanal, Faiza Khan Khattak, Boryoung Kim, Eugenia Kim, Liliya Lavitas, Seok Min Lim, Victor Lu, Jim Moirangthem, Dhivya Nagasubramanian, Deepak Pandita, Sita Rajagopal, Geetha Raju, Evgeniia Razumovskaia, Aravind Reddy, Federico Ricciuti, Nobin Sarwar, Sungpil Shin, Sunayana Sitaram, Snehal Thorat, Tharindu Cyril Weerasooriya, Jasmijn Bastings, Joachim Baumann, Kongtao Chen, Murali Emani, Mariya Hendriksen, Jiho Jin, Jun Seong Kim, Younghoon Ko, Alicja Kwasniewska, Minjae Lee, Tom Wei-cyuan Lin Kashyap Ramanandula Manjusha, Junho Myung, Junyeong Park, Roma Patel, Shyam Ratan, Sudarsun Santhiappan, Priyanka Suresh, Tuesday, Ksheeraj Sai Vepuri Laura Amortegui-Ordonez, Claire Dennis, Minsuk Kahng, Chris Knotz, Alice Oh, Balaraman Ravindran, Soojung Ryu William Bartholomew, Hiwot Tesfaye, Lora Aroyo

机构 * Google DeepMind(谷歌DeepMind) University of Alabama in Huntsville(阿拉巴马大学亨茨维尔分校) Google(谷歌) University of Missouri Columbia(密苏里大学哥伦比亚分校) Chunghwa Telecom Laboratories(春木电信实验室) University of Southern California(南加州大学) Polytechnique Montreal(蒙特利尔理工学院) Nutanix ThinkEvolve Labs(ThinkEvolve实验室) UCL(伦敦大学学院) Infocomm Media Development Authority(信息通信媒体发展局) Monark Health(Monark健康) Seoul National University(首尔国立大学) Microsoft(微软) Centre for Responsible AI (CeRAI), Wadhwani School of Data Science and AI (WSAI), Indian Institute of Technology Madras(负责任人工智能中心(CeRAI)、瓦达威人工智能学校(WSAI)、印度理工学院马德拉斯分校) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Microsoft Research India(微软印度研究院) Stanford University(斯坦福大学) Argonne National Laboratory(阿贡国家实验室) University of Oxford(牛津大学) KAIST(韩国科学技术院) Yonsei University(延世大学) Amazon(亚马逊) UIUC(伊利诺伊大学香槟分校) Rochester Institute of Technology(罗切斯特理工学院) Xenoscube Inc.(Xenoscube公司) Korea AI Safety Institute (K-AISI)(韩国人工智能安全研究所(K-AISI)) MLCommons CommonGround Artifex Labs(Artifex实验室)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract)

AI总结 研究针对现有AI安全评估框架忽视文化差异问题,构建多语言多模态数据集Pluralis v0.1,从文化优先视角引入新评估范式,提出Judge - Pluralis集成,揭示特定地区失败模式,为多语言多元文化评估提供基础和创新起点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05396 2026-07-07 cs.CV cs.AI cs.LG cs.RO 新提交 67%

From Fixed to Free Cameras: Calibration-Free View-Robust Vision-Language-Action Model

从固定相机到自由相机:无需标定的视图鲁棒视觉-语言-动作模型

Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Shijian Lu, Gongjie Zhang, Ran Xu

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) HuPan Lab(湖畔实验室) Alibaba Group(阿里巴巴集团)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对真实机器人部署中相机位姿变动问题,提出CamVLA模型,解耦操控控制与相机几何,实现无标定视图鲁棒的机器人任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30875 2026-07-01 cs.CV cs.AI cs.LG 新提交 67%

The Label Imitation Game: Turing Test Network for Zero-Shot Pseudo-Label Pruning

标签模仿游戏:用于零样本伪标签剪枝的图灵测试网络

Brent A. Griffin, Jason J. Corso

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出图灵测试网络(TTN)作为任务无关的“裁判”,通过对抗性交互在数据集上下文中评估伪标签,无需监督或重训练即可提升标签准确性,并实现零样本任务迁移。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27527 2026-06-29 cs.CV cs.AI cs.LG 新提交 67%

Large Language Model Teaches Visual Students: Cross-Modality Transfer of Fine-Grained Conceptual Knowledge

大型语言模型教授视觉学生:细粒度概念知识的跨模态迁移

Thomas Shih-Chao Liang, Zhuoran Yu, Yong Jae Lee

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出LaViD框架,利用语言模型生成多选题来蒸馏细粒度视觉概念,无需多模态数据,在多个基准上超越现有方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19598 2026-06-19 cs.RO 新提交 67%

Fail-RAG : A Retrieval Augmented Generation Informed Framework for Robot Failure Identification

Fail-RAG:一种基于检索增强生成的机器人故障识别框架

Ameya Salvi, Jie Hu

机构 * Hitachi America, Ltd.(日立美国有限公司)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract_cn)

AI总结 提出Fail-RAG框架,利用检索增强生成和视觉语言模型,通过嵌入故障图像和上下文信息并查询数据库,实现机器人操作故障的高效检测,在仓库自动化任务中平均检测准确率提升25个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09595 2026-06-09 cs.IR 新提交 67%

Popcorn: A Configurable Benchmark for Visual Evidence in Multimodal Movie Recommendation

Popcorn: 多模态电影推荐中视觉证据的可配置基准

Ali Tourani, Fatemeh Nazary, Yashar Deldjoo, Tommaso Di Noia

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract_cn)

AI总结 提出Popcorn基准,通过配置合同标准化多模态电影推荐中的视觉证据(全片、预告片、缩略图)的嵌入、融合与评估,实验表明视觉源不可互换且影响推荐性能。

Comments 8 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06140 2026-06-05 cs.CR 67%

RedEdit: Agentic Red-Teaming of Image Safety Classifiers via MCTS-Guided Photo-Editing

RedEdit: 基于MCTS引导的照片编辑的图像安全分类器智能红队测试

Weilin Lin, Ziqi Lin, Zhenxing Zhou, Jianze Li, Tong Zhang, Hui Xiong, Li Liu

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn)

AI总结 提出RedEdit,一种基于视觉语言模型提议和蒙特卡洛树搜索规划的黑盒红队代理,通过组合编辑工具序列使不安全图像逃避检测,平均不到两次编辑即可使76.2%的不安全图像绕过分类器,同时保留93.0%的恶意语义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29956 2026-05-29 cs.IR 67%

Uncertainty Quantification for Multimodal Retrieval Augmented Generation

多模态检索增强生成的不确定性量化

Simon Binz, Heydar Soudani, Faegheh Hasibi

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract_cn)

AI总结 提出 LeMUQ 方法,通过多模态和检索感知的概率信号建模不确定性,提升多模态 RAG 系统的可靠性,AUROC 平均提升 3.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏