arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2246 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2246 篇

2509.20792 2025-09-26 cs.CV cs.AI cs.LG 67%

DAC-LoRA: Dynamic Adversarial Curriculum for Efficient and Robust Few-Shot Adaptation

Ved Umrajkar

机构 * Indian Institute of Technology, Roorkee(印度理工学院拉胡尔分校)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at ICCV2025 Workshop on Safe and Trustworthy Multimodal AI Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16611 2025-09-23 cs.RO 67%

Video-to-BT: Generating Reactive Behavior Trees from Human Demonstration Videos for Robotic Assembly

Xiwei Zhao, Yiwei Wang, Yansong Wu, Fan Wu, Teng Sun, Zhonghua Miao, Sami Haddadin, Alois Knoll

机构 * Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑机器人与机器智能研究所) Technical University of Munich(慕尼黑技术大学) Aalto University(艾尔沃斯大学) Shanghai University(上海大学) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16146 2025-09-16 cs.CV cs.AI cs.CL cs.LG 67%

Steering LVLMs via Sparse Autoencoder for Hallucination Mitigation

Zhenglin Hua, Jinghan He, Zijun Yao, Tianxu Han, Haiyun Guo, Yuheng Jia, Junfeng Fang

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University)(东南大学新一代人工智能技术及其交叉应用关键实验室) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Wuhan University of Technology(武汉理工大学) National University of Singapore(新加坡国立大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08820 2025-09-11 cs.RO 67%

RoboChemist: Long-Horizon and Safety-Compliant Robotic Chemical Experimentation

Zongzheng Zhang, Chenghao Yue, Haobo Xu, Minwen Liao, Xianglin Qi, Huan-ang Gao, Ziwei Wang, Hao Zhao

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract)

Comments Accepted to CoRL 2025, Project Page: https://zzongzheng0918.github.io/RoboChemist.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09846 2025-08-14 cs.RO 67%

Whole-Body Bilateral Teleoperation with Multi-Stage Object Parameter Estimation for Wheeled Humanoid Locomanipulation

Donghoon Baek, Amartya Purushottam, Jason J. Choi, Joao Ramos

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19054 2025-07-28 cs.CV cs.AI cs.CL cs.IR cs.LG 67%

Closing the Modality Gap for Mixed Modality Search

Binxu Li, Yuhui Zhang, Xiaohan Wang, Weixin Liang, Ludwig Schmidt, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Project page: https://yuhui-zh15.github.io/MixedModalitySearch/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08030 2025-07-14 cs.CL cs.CE cs.HC 67%

A Systematic Analysis of Declining Medical Safety Messaging in Generative AI Models

Sonali Sharma, Ahmed M. Alaa, Roxana Daneshjou

机构 * Department of Medicine, University of British Columbia(英属哥伦比亚大学医学系) Department of Biomedical Data Science, Stanford School of Medicine(斯坦福医学院生物医学数据科学系) University of California, Berkeley(加州大学伯克利分校) University of California, San Francisco(加州大学旧金山分校) Department of Dermatology, Stanford School of Medicine(斯坦福医学院皮肤科)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract)

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05607 2025-07-09 cs.RO 67%

Structured Task Solving via Modular Embodied Intelligence: A Case Study on Rubik's Cube

Chongshan Fan, Shenghai Yuan

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05528 2025-06-02 cs.CV cs.AI cs.CL cs.LG 67%

X-Transfer Attacks: Towards Super Transferable Adversarial Attacks on CLIP

Hanxun Huang, Sarah Erfani, Yige Li, Xingjun Ma, James Bailey

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20578 2025-05-29 cs.CV cs.AI cs.LG 67%

Interpreting CLIP with Hierarchical Sparse Autoencoders

Vladimir Zaigrajew, Hubert Baniecki, Przemyslaw Biecek

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Journal ref Proceedings of the 42st International Conference on Machine Learning (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20361 2025-05-27 cs.CR 67%

From ML to LLM: Evaluating the Robustness of Phishing Webpage Detection Models against Adversarial Attacks

Aditya Kulkarni, Vivek Balachandran, Dinil Mon Divakaran, Tamal Das

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04787 2025-05-12 cs.CV cs.AI cs.LG 67%

Replay to Remember (R2R): An Efficient Uncertainty-driven Unsupervised Continual Learning Framework Using Generative Replay

Sriram Mandalika, Harsha Vardhan, Athira Nambiar

机构 * Department of Computational Intelligence, SRM Institute of Science and Technology(计算智能系,SRM科学与技术学院)

专题命中 幻觉与鲁棒性 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Submitted to the 28th European Conference on Artificial Intelligence (ECAI-2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10000 2025-04-15 cs.CR cs.AI cs.CL cs.CV cs.LG 67%

Do We Really Need Curated Malicious Data for Safety Alignment in Multi-modal Large Language Models?

Yanbo Wang, Jiyang Guan, Jian Liang, Ran He

专题命中 幻觉与鲁棒性 :MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to CVPR 2025, codes in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15166 2025-04-15 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

Machine Unlearning in Hyperbolic vs. Euclidean Multimodal Contrastive Learning: Adapting Alignment Calibration to MERU

Àlex Pujol Vidal, Sergio Escalera, Kamal Nasrollahi, Thomas B. Moeslund

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23388 2025-04-01 cs.CV cs.AI cs.LG cs.MM 67%

COSMIC: Clique-Oriented Semantic Multi-space Integration for Robust CLIP Test-Time Adaptation

Fanding Huang, Jingyan Jiang, Qinting Jiang, Hebei Li, Faisal Nadeem Khan, Zhi Wang

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02479 2025-03-28 cs.CV cs.AI cs.CR cs.LG 67%

OODFace: Benchmarking Robustness of Face Recognition under Common Corruptions and Appearance Variations

Caixin Kang, Yubo Chen, Shouwei Ruan, Shiji Zhao, Ruochen Zhang, Jiayi Wang, Shan Fu, Xingxing Wei

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11360 2025-03-17 cs.CV cs.AI cs.LG 67%

PARIC: Probabilistic Attention Regularization for Language Guided Image Classification from Pre-trained Vison Language Models

Mayank Nautiyal, Stela Arranz Gheorghe, Kristiana Stefa, Li Ju, Ida-Maria Sintorn, Prashant Singh

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08162 2025-03-12 cs.RO cs.CL 67%

FASIONAD++ : Integrating High-Level Instruction and Information Bottleneck in FAt-Slow fusION Systems for Enhanced Safety in Autonomous Driving with Adaptive Feedback

Kangan Qian, Ziang Luo, Sicong Jiang, Zilin Huang, Jinyu Miao, Zhikun Ma, Tianze Zhu, Jiayin Li, Yangfan He, Zheng Fu, Yining Shi, Boyue Wang, Hezhe Lin, Ziyu Chen, Jiangbo Yu, Xinyu Jiao, Mengmeng Yang, Kun Jiang, Diange Yang

专题命中 幻觉与鲁棒性 :vision language model(abstract);VLM(abstract)

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06626 2025-03-11 cs.CV cs.AI cs.LG 67%

DiffCLIP: Differential Attention Meets CLIP

Hasan Abed Al Kader Hammoud, Bernard Ghanem

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02865 2025-03-06 cs.CL 67%

FairSense-AI: Responsible AI Meets Sustainability

Shaina Raza, Mukund Sayeeganesh Chettiar, Matin Yousefabadi, Tahniat Khan, Marcelo Lotif

专题命中 幻觉与鲁棒性 :vision-language model(abstract);vision language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01417 2025-03-04 cs.CV cs.AI cs.CL cs.LG 67%

The Labyrinth of Links: Navigating the Associative Maze of Multi-modal LLMs

Hong Li, Nanxi Li, Yuanjie Chen, Jianbin Zhu, Qinlu Guo, Cewu Lu, Yong-Lu Li

专题命中 幻觉与鲁棒性 :MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by ICLR 2025. Project page: https://mvig-rhos.com/llm_inception

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17710 2025-02-26 cs.AI cs.CL cs.CV cs.LG 67%

Mind the Gesture: Evaluating AI Sensitivity to Culturally Offensive Non-Verbal Gestures

Akhila Yerukola, Saadia Gabriel, Nanyun Peng, Maarten Sap

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 40 pages, 49 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11969 2025-02-18 cs.AI cs.CV cs.LG 67%

Learning Generalizable Prompt for CLIP with Class Similarity Knowledge

Sehun Jung, Hyang-won Lee

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13573 2025-02-13 cs.RO 67%

Learning Manipulation Skills through Robot Chain-of-Thought with Sparse Failure Guidance

Kaifeng Zhang, Zhao-Heng Yin, Weirui Ye, Yang Gao

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07979 2024-12-12 cs.LG cs.AI cs.CV 67%

AmCLR: Unified Augmented Learning for Cross-Modal Representations

Ajay Jagannath, Aayush Upadhyay, Anant Mehta

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03178 2024-12-05 cs.AI cs.CV cs.LG 67%

Towards Understanding and Quantifying Uncertainty for Text-to-Image Generation

Gianni Franchi, Dat Nguyen Trong, Nacim Belkhir, Guoxuan Xia, Andrea Pilzer

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 28 pages and 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00693 2024-11-28 cs.RO cs.CL 67%

Leveraging Large Language Models in Human-Robot Interaction: A Critical Analysis of Potential and Pitfalls

Jesse Atuhurra

专题命中 幻觉与鲁棒性 :vision language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02352 2024-10-30 cs.CL 67%

Pelican: Correcting Hallucination in Vision-LLMs via Claim Decomposition and Program of Thought Verification

Pritish Sahu, Karan Sikka, Ajay Divakaran

专题命中 幻觉与鲁棒性 :visual language model(abstract);grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11302 2024-10-16 cs.CV cs.AI cs.CL cs.LG 67%

Have the VLMs Lost Confidence? A Study of Sycophancy in VLMs

Shuo Li, Tao Ji, Xiaoran Fan, Linsheng Lu, Leyi Yang, Yuming Yang, Zhiheng Xi, Rui Zheng, Yuran Wang, Xiaohui Zhao, Tao Gui, Qi Zhang, Xuanjing Huang

专题命中 幻觉与鲁棒性 :visual language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11229 2024-10-07 cs.CL cs.AI cs.CV cs.HC cs.LG 67%

Unraveling the Truth: Do VLMs really Understand Charts? A Deep Dive into Consistency and Robustness

Srija Mukhopadhyay, Adnan Qidwai, Aparna Garimella, Pritika Ramu, Vivek Gupta, Dan Roth

专题命中 幻觉与鲁棒性 :visual language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 22 pages, 9 Tables, 5 figures, 22 examples

详情

展开后加载摘要…

URL PDF HTML 收藏