arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-06 至 2026-04-06 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 5 篇

2511.17722 2026-04-06 cs.CV 83%

Can Vision-Language Models Count? A Synthetic Benchmark and Analysis of Attention-Based Interventions

视觉-语言模型能计数吗?一个合成基准和基于注意力的干预分析

Saurav Sengupta, Nazanin Moradinasab, Jiebei Liu, Donald E. Brown

机构 * School of Data Science, University of Virginia(弗吉尼亚大学数据科学学院)

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文通过合成基准和注意力干预分析,探讨了视觉-语言模型在计数任务中的表现,揭示了视觉和语言复杂性对计数准确率的影响,并展示了针对性的注意力重加权对计数行为的改进。

Comments Accepted at COGVL Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02543 2026-04-06 cs.CV cs.LG 82%

Overconfidence and Calibration in Medical VQA: Empirical Findings and Hallucination-Aware Mitigation

过度自信与校准在医学视觉问答中的研究:实证发现与幻觉意识缓解

Ji Young Byun, Young-Jin Park, Jean-Philippe Corbeil, Asma Ben Abacha

机构 * Johns Hopkins University, School of Medicine(约翰霍普金斯大学医学院) Massachusetts Institute of Technology(麻省理工学院) Microsoft Healthcare & Life Sciences(微软医疗健康与生命科学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);LLaVA(abstract);visual question answering(abstract)

AI总结 本文研究了医学VQA中VLMs的过度自信问题,发现校准方法如Platt缩放能有效提升校准精度,但无法提升预测区分度,提出幻觉意识校准方法以提高可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03045 2026-04-06 cs.CV cs.MM 57%

STEAR: Layer-Aware Spatiotemporal Evidence Intervention for Hallucination Mitigation in Video Large Language Models

STEAR:面向视频大语言模型的层感知时空证据干预以缓解幻觉

Linfeng Fan, Yuan Tian, Ziwei Li, Zhiwu Lu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV

AI总结 STEAR通过层感知的时空证据干预框架,缓解视频大语言模型中的空间和时间幻觉,提升解码的准确性与一致性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17714 2026-04-06 cs.AI 57%

From Virtual Environments to Real-World Trials: Emerging Trends in Autonomous Driving

从虚拟环境到现实世界试验:自动驾驶领域新兴趋势

A. Humnabadkar, A. Sikdar, B. Cave, H. Zhang, N. Bessis, A. Behera

机构 * Edge Hill University(埃奇希尔大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 本文综述了自动驾驶、模拟技术和合成数据集的最新发展,探讨了合成数据在感知与规划中的应用、数字孪生模拟系统验证以及领域适应策略,分析了基准设计趋势及关键挑战,旨在推动安全、可推广的自动驾驶系统发展。

Comments Accepted manuscript - Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21584 2026-04-06 cs.CV 57%

TARS: MinMax Token-Adaptive Preference Strategy for Hallucination Reduction in MLLMs

TARS:最小最大令牌自适应偏好策略用于减少多模态大语言模型中的幻觉

Kejia Zhang, Keda Tao, Zhiming Luo, Chang Liu, Jiasheng Tang, Huan Wang

机构 * Xiamen University(厦门大学) Westlake University(西湖大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) AWS AI Lab, Amazon(亚马逊AWS AI实验室) Hupan Laboratory(湖畔实验室)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 TARS通过最小最大优化问题重构直接偏好优化,通过对抗性令牌扰动减少多模态大语言模型中的幻觉,通过频域对齐损失提升隐藏表征,优于标准DPO并超越数据增强方法。

详情

展开后加载摘要…

URL PDF HTML 收藏