arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2251 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2251 篇

2306.16805 2023-09-04 cs.CV cs.CL cs.LG 62%

CLIPAG: Towards Generator-Free Text-to-Image Generation

Roy Ganz, Michael Elad

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.07464 2023-07-25 cs.CV cs.LG 62%

CLIPTER: Looking at the Bigger Picture in Scene Text Recognition

Aviad Aberdam, David Bensaïd, Alona Golts, Roy Ganz, Oren Nuriel, Royee Tichauer, Shai Mazor, Ron Litman

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Accepted for publication by ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14610 2023-06-27 cs.CV cs.CL cs.LG 62%

SugarCrepe: Fixing Hackable Benchmarks for Vision-Language Compositionality

Cheng-Yu Hsieh, Jieyu Zhang, Zixian Ma, Aniruddha Kembhavi, Ranjay Krishna

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.19329 2023-06-01 cs.CV cs.IR cs.LG 62%

Mitigating Test-Time Bias for Fair Image Retrieval

Fanjie Kong, Shuai Yuan, Weituo Hao, Ricardo Henao

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.12252 2023-04-06 cs.CV cs.LG 62%

Boosting Adversarial Transferability using Dynamic Cues

Muzammal Naseer, Ahmad Mahmood, Salman Khan, Fahad Khan

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments International Conference on Learning Representations (ICLR'23), Code:https://bit.ly/3Xd9gRQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02814 2023-03-27 cs.CV cs.CR cs.HC cs.LG 62%

Visual Analytics of Neuron Vulnerability to Adversarial Attacks on Convolutional Neural Networks

Yiran Li, Junpeng Wang, Takanori Fujiwara, Kwan-Liu Ma

专题命中 幻觉与鲁棒性 :visual reasoning(abstract);分类 cs.CV、cs.LG

Comments Accepted by the Special Issue on Human-Centered Explainable AI, ACM Transactions on Interactive Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.10572 2023-01-20 cs.LG cs.CV 62%

General Greedy De-bias Learning

Xinzhe Han, Shuhui Wang, Chi Su, Qingming Huang, Qi Tian

专题命中 幻觉与鲁棒性 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments This work has been accepted by IEEE T-PAMI. Copyright is transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.07183 2022-12-02 cs.CV cs.LG 62%

Visual Classification via Description from Large Language Models

Sachit Menon, Carl Vondrick

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.05844 2022-02-15 cs.LG cs.AI cs.SY eess.SY 62%

Uncertainty Aware System Identification with Universal Policies

Buddhika Laknath Semage, Thommen George Karimpanal, Santu Rana, Svetha Venkatesh

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.08313 2021-09-16 cs.AI cs.CL cs.CV 62%

Does language help generalization in vision models?

Benjamin Devillers, Bhavin Choksi, Romain Bielawski, Rufin VanRullen

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV、cs.AI

Comments Paper accepted at the CoNLL 2021 conference. This version: section added on the performance of the visual and visio-linguistic models on linquistic tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.03856 2020-11-10 cs.LG cs.CL cs.CV 62%

Learning to Model and Ignore Dataset Bias with Mixed Capacity Ensembles

Christopher Clark, Mark Yatskar, Luke Zettlemoyer

专题命中 幻觉与鲁棒性 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments In EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.06195 2020-10-26 cs.CV cs.CL cs.LG 62%

Large-Scale Adversarial Training for Vision-and-Language Representation Learning

Zhe Gan, Yen-Chun Chen, Linjie Li, Chen Zhu, Yu Cheng, Jingjing Liu

专题命中 幻觉与鲁棒性 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments NeurIPS 2020 Spotlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.07613 2017-11-22 cs.CV cs.AI cs.CL 62%

Are You Talking to Me? Reasoned Visual Dialog Generation through Adversarial Learning

Qi Wu, Peng Wang, Chunhua Shen, Ian Reid, Anton van den Hengel

专题命中 幻觉与鲁棒性 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06356 2026-07-08 eess.IV cs.CV 新提交 61%

TMF-RSE: Tri-Modal Fusion with Regional Semantics and Evidential Uncertainty for Lung Severity Scoring

TMF-RSE:用于肺部严重程度评分的具有区域语义和证据不确定性的三模态融合

Fadi Abdeladhim Zidi, Salah Eddine Bekhouche, Abdellah Zakaria Sellam, Gaby Maroun, Fadi Dornaika, Cosimo Distante

机构 * Institute of Applied Sciences and Intelligent Systems (ISASI), CNR(应用科学与智能系统研究所(ISASI),CNR) Department of Computer Science and Artificial Intelligence, University of the Basque Country (UPV/EHU)(巴斯克国家大学计算机科学与人工智能系) University of Salento(萨莱nton大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV;VLM(comments)

AI总结 针对从胸部影像量化肺部疾病严重程度的问题,提出TMF-RSE框架,结合多模态特征,采用互补融合机制和证据回归,在相关数据集实验中性能优于基于Transformer的基线。

Comments 6 pages, 2 figures, 5 tables. IEEE conference format (IEEEtran). Submitted to AVSS 2026. Tri-modal fusion for lung severity scoring using appearance, segmentation, and VLM semantics with evidential uncertainty

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04655 2025-11-07 cs.CV 61%

Benchmark Designers Should "Train on the Test Set" to Expose Exploitable Non-Visual Shortcuts

Ellis Brown, Jihan Yang, Shusheng Yang, Rob Fergus, Saining Xie

机构 * New York University(纽约大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV;MLLM(comments)

Comments Project page: https://cambrian-mllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00171 2025-08-04 cs.CV cs.CL 61%

On the Risk of Misleading Reports: Diagnosing Textual Biases in Multimodal Clinical AI

David Restrepo, Ira Ktena, Maria Vakalopoulou, Stergios Christodoulidis, Enzo Ferrante

机构 * MICS, CentraleSupélec - Université Paris-Saclay, France(MICS,中央圣艾尔布兰大学-巴黎萨克雷大学,法国) Google DeepMind, London, UK(谷歌DeepMind,伦敦,英国) CONICET, Universidad de Buenos Aires, Argentina(CONICET,布宜诺斯艾利斯大学,阿根廷)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV;multimodal large language model(comments)

Comments Accepted to MICCAI 2025 1st Workshop on Multimodal Large Language Models (MLLMs) in Clinical Practice

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15926 2024-10-22 cs.CV cs.CL 61%

Mitigating Object Hallucination via Concentric Causal Attention

Yun Xing, Yiheng Li, Ivan Laptev, Shijian Lu

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.CV;LLaVA(comments)

Comments To appear at NeurIPS 2024. Code is available at https://github.com/xing0047/cca-llava

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03659 2024-04-29 cs.CV 61%

Probing Conceptual Understanding of Large Visual-Language Models

Madeline Schiappa, Raiyaan Abdullah, Shehreen Azad, Jared Claypoole, Michael Cogswell, Ajay Divakaran, Yogesh Rawat

专题命中 幻觉与鲁棒性 :VLM(abstract,comments);分类 cs.CV

Comments All code and dataset is available at: https://tinyurl.com/vlm-robustness. Accepted in CVPRW 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13706 2026-08-19 cs.CL cs.AI 版本更新 57%

CLAIR-Fin: An Adversarial Multi-Agent Framework for Claim-Level Verification and Adaptive Debate in Cross-Modal Financial QA

CLAIR-Fin:用于跨模态金融问答中声明级验证与自适应辩论的对抗性多智能体框架

Fatema Tuj Johora Faria, Mukaffi Bin Moin, Jubayer Al Mahmud, M. F. Mridha, Md. Alam Hossain

机构 * Ahsanullah University of Science and Technology(阿萨努拉科技大学) Jashore University of Science and Technology(杰索尔科技大学) American International University - Bangladesh(孟加拉国美国国际大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本研究提出CLAIR-Fin九智能体框架,针对跨模态金融问答的声明级验证与自适应辩论,在BB-FinQA-X数据集上提升了模型忠实度,且弃权比例合理,优于相关基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16663 2026-08-18 cs.DB cs.AI 新提交 57%

Bounded Semantic Planning and Deterministic Compilation for Reliable Enterprise Text-to-SQL

用于可靠企业级文本到SQL的有界语义规划与确定性编译

Yi Ai

专题命中 幻觉与鲁棒性 :grounding(abstract_cn);分类 cs.AI

AI总结 提出语义路径编译(SPC)系统,在ACME保险基准测试中,其文本到SQL任务正确率达97.4%,显著优于基线系统,且鲁棒性更强。

Comments 10 sections, 2 figures, 6 tables. Preprint. Code and research artifacts are described in the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15115 2026-08-18 cs.CV 新提交 57%

Perspective-Invariant Attack with Enhanced Transferability of Adversarial Examples

具有增强对抗样本迁移性的视角不变攻击

Kaisheng Liang, Yiming Cao, Bin Xiao

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 针对对抗样本跨模型迁移性带来的安全威胁,提出视角不变攻击(PIA)及其扩展PIA-Mix,通过多自由度顶点采样策略提升对抗样本迁移性,实验显示其性能优于当前最优基于迁移的攻击方法。

Journal ref IEEE Transactions on Information Forensics and Security, vol. 21, pp. 6818-6831, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11603 2026-08-18 cs.CL cs.AI 版本更新 57%

DR.GAP: Mitigating Bias in Large Language Models using Gender-Aware Prompting with Decoupled Reasoning

DR.GAP:采用解耦推理的性别感知提示缓解大语言模型中的偏见

Hongye Qiu, Yue Xu, Yi Wang, Meikang Qiu, Wenjie Wang

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 该研究针对大语言模型的性别偏见问题,提出DR.GAP方法,通过生成无性别推理轨迹作为上下文示例,在不修改模型参数的情况下缓解偏见,且可扩展至视觉语言模型,经多任务多模型实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13969 2026-08-17 cs.CV 新提交 57%

PPOM: Marginalizing Patch-Grid Phase for CLIP-Based Generalizable Vision-Language Prompt Tuning

PPOM:用于基于CLIP的通用视觉-语言提示调优的补丁网格相位边缘化

Liang Wang, Haoyang Li, Chao Wang, Guodong Long, Jing Jiang, Yan Peng

机构 * Shanghai University(上海大学) University of Technology Sydney(悉尼科技大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本研究针对基于CLIP的视觉-语言提示调优对补丁网格对齐敏感的问题,提出无训练的PPOM算子,通过边缘化相位偏移提升宿主性能,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13563 2026-08-17 cs.HC cs.AI cs.SE 新提交 57%

Proxy-Validated LLM UX Micro-Simulations: An Artifact-First Protocol for Early-Stage Decision Support

代理验证的大语言用户体验微模拟:一种用于早期决策支持的工件优先协议

Alexandre Cristovão Maiorano

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 该研究提出代理验证的LLM驱动UX微模拟流程,通过代理语料库验证模拟结果,结合多指标对比基线、消融实验分析智能体策略,提供可复现的早期UX决策支持方案。

Comments 27 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11274 2026-08-13 cs.CR cs.AI 新提交 57%

Agent Safety Should Be a Runtime Contract

智能体安全应成为运行时契约

Albus W. Ng, Yi Han, Jusheng Zhang, Wenhao Wang

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 该研究指出将AI安全仅在训练阶段植入的范式不足,提出智能体安全应是兼具预防与证据层面的运行时契约,通过四类公开证据支撑该立场并给出研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11175 2026-08-13 cs.AI 版本更新 57%

The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy

自我进化临床系统之路:将医疗智能体从辅助扩展到自主

Chunzheng Zhu, Lei Tian, Bohan Tan, Ziqi Zhou, Yuxuan Sun, Yijun Wang, Chengchao Lv, Yilin Wen, Yijun He, Jinghao Lin, Yihang Chen, Chee Wei Tan, Qianshan Wei, Lei Zhao, Bin Pu, Kenli Li, Yuan Xue, Jianxin Lin

机构 * Hunan University(湖南大学) ByteDance(字节跳动) Duke University(杜克大学) Westlake University(西湖大学) The University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Macau(澳门大学) The Ohio State University(俄亥俄州立大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 研究探讨大语言模型等对医疗智能体的重塑,从临床部署出发,将其形式化为决策系统并给出自主性分类。沿统一框架扩展,强调临床环境扩展为关键方向,定位临床自我进化为前沿,还研究了多领域应用及挑战,提供医学成像系统路线图。

Comments Project page: https://github.com/zhcz328/Awesome-Medical-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29055 2026-08-13 cs.AI cs.MA 版本更新 57%

Hallucination Mitigation with Agentic AI, Nested Learning, and AI Sustainability via Semantic Caching

基于智能体AI、嵌套学习与语义缓存的幻觉缓解与AI可持续性

Diego Gosmar, Deborah A. Dahl

机构 * Head of AI, Tesisquare Member, Open Voice Interoperability Initiative Linux Foundation AI & Data(AI负责人,Tesisquare成员,开放语音互操作性倡议Linux基金会AI与数据) Principal, Conversational Technologies Member, Open Voice Interoperability Initiative Linux Foundation AI & Data(首席科学家,对话技术成员,开放语音互操作性倡议Linux基金会AI与数据)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 提出一种HOPE启发的嵌套学习架构,结合连续记忆系统和语义缓存,通过三阶段智能体管道在混合基准上实现幻觉缓解,同时降低能耗并提高可观测性。

Comments 33 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10725 2026-08-12 cs.CV cs.SC 新提交 57%

Rethinking LLM Verification: Evidence Structure, Uncertainty, and Selective Refinement

重新思考大语言模型验证:证据结构、不确定性与选择性优化

Uma Ranjan, Kunal Tilaganji, Aditya Koul, Anurag Mahipal, Dashpreet Singh, Hriday Rana, Manan Jain, Sidharth Gupta, Ajo Babu George, Vineeth Balasubramanian, Nagarajan Natarajan, Amit Sharma

机构 * Indian Institute of Technology Jammu(贾姆穆印度理工学院) Microsoft Research(微软研究院) SCB Dental College and Hospital(SCB牙科学院与医院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV

AI总结 该研究针对LLMs医疗应用的安全问题,提出两阶段框架,利用模型弃权信号优化推理,在GPT-5.5、DeepSeek-R1模型及MedReason、MedQA数据集上显著提升了医疗假设验证的准确率。

Comments Findings Track at the Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28969 2026-08-12 cs.CV 版本更新 57%

SafeNexus: Discovering and Steering Modality-Universal Safety Neurons in MLLMs

SafeNexus:在多模态大语言模型(MLLMs)中发现与调控模态通用安全神经元

Jian Yu, Fei Shen, Cong Wang, Jian Wang, Lu Jin, Xiaoyu Du, Jinhui Tang, Tat-Seng Chua

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 SafeNexus是一种跨模态安全对齐框架,通过定位并调控模态通用安全神经元,提升多模态大语言模型在跨模态威胁下的安全性,且能保留模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09474 2026-08-11 cs.CV 新提交 57%

FaLCon: Facet-Anchored Retrieval with Late Consensus for Sim2Real Text-Based Person Anomaly Search

FaLCon:用于Sim2Real基于文本的行人异常搜索的基于面锚定的后期共识检索

Hieu Dinh Trung Pham, Phuong Huu Vu Tran, Thuan Duc Mai, Son Nguyen Minh Le, Khang Le Minh, Hoang Vo, Minh-Chi Phung, Huy Minh Nhat Nguyen, Cuong Tuan Nguyen

机构 * Vietnamese-German University(越南-德国大学) Ho Chi Minh City University of Technology(胡志明市技术大学) University of Information Technology(信息技术大学) Ho Chi Minh city University of Science(胡志明市科学大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 该研究针对Sim2Real基于文本的行人异常搜索的挑战,提出FaLCon框架,结合全局匹配与细粒度验证,在PAB基准上取得优异性能,代码将开源。

Comments accepted to the ECCV 2026 AI City Challenge Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏