HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models
专题命中 幻觉与鲁棒性 :vision-language model(title);LLaVA(abstract);分类 cs.CV
Comments Accepted to CVPR 2024
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 幻觉与鲁棒性 :vision-language model(title);LLaVA(abstract);分类 cs.CV
Comments Accepted to CVPR 2024
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
Comments Accepted by ICLR 2024
专题命中 幻觉与鲁棒性 :grounding(title,abstract);分类 cs.CV
Comments accepted by AAAI 2024
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
专题命中 幻觉与鲁棒性 :visual language model(title);vision language model(abstract);分类 cs.CV
Comments Project page: https://vlf-silkie.github.io
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
Comments MMM 2024
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
Comments Accepted to EMNLP 2023
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
Comments 11 pages, 5 figures, 8 tables
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
Comments Accepted to CVPR'23. Codes and dataset will be released soon
专题命中 幻觉与鲁棒性 :grounding(title,abstract);分类 cs.CV
Comments Accepted by 56th Annual Meeting of the Association for Computational Linguistics (ACL 2018). Hongge Chen and Huan Zhang contribute equally to this work
基于文本引导的层融合缓解多模态大语言模型中的幻觉
机构 * University of Connecticut(康涅狄格大学) ; NVIDIA(NVIDIA公司) ; Stanford University(斯坦福大学)
专题命中 幻觉与鲁棒性 :LLaVA(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 TGIF通过文本引导的层融合方法,有效缓解多模态大语言模型中的幻觉问题,提升视觉接地能力。
Comments Accepted at COLM 2026
像素上的模式:测量多模态代码生成中的模式完成偏差
专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对多模态代码生成中存在的模式完成偏差问题,构建了首个视觉模式完成偏差基准,评估发现前沿MLLMs均存在严重偏差,且偏差与视觉显著性密切相关。
Comments 41st IEEE/ACM International Conference on Automated Software Engineering
VetClaw:一种用于兽医疾病筛查的边缘云多模态智能系统
机构 * Southern Illinois University(南伊利诺伊大学) ; Utah Valley University(犹他谷大学) ; Jazan University(吉赞大学)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 VetClaw是用于兽医疾病筛查的边缘云多模态智能系统,用相机模块采集图像等并发送至视觉语言模型分类。它分离智能体交互与工作流编排,超越静态图像分类,症状引导和多模态输入提升性能,将静态模型转变为多功能安全感知系统。
MELLA:弥合低资源语言多模态大语言模型的语言能力与文化根基
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; East China Normal University(东华大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Institute of High Performance Computing, A*STAR(高性能计算研究所,A*STAR)
专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 研究针对低资源语言MLLMs文化内涵不足问题,提出MELLA数据集,采用双源策略,结合母语网络图像-替代文本对与生成翻译的图像描述进行监督,经实验表明能减轻文化幻觉,强调数据对齐对低资源语言文化基础多模态理解的重要性。
当视觉证据模糊时: pareidolia 作为视觉模型的诊断探针
机构 * Leiden Institute of Advanced Computer Science (LIACS), Leiden University, Leiden, The Netherlands(莱顿高级计算机科学研究所(LIACS)、莱顿大学、莱顿、荷兰)
专题命中 幻觉与鲁棒性 :LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文研究了视觉模型在模糊证据下的行为,通过分析pareidolia现象揭示了不同模型在表示层面的差异,发现语义过激活和不确定性策略等机制,为提升视觉语言系统的语义鲁棒性提供诊断和改进方法。
用于主动具身安全的自进化即时记忆
机构 * Huazhong University of Science and Technology(华中科技大学) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 研究视觉语言模型在闭环交互中应对动态危险的问题,提出自进化即时记忆框架,含RSG、事实记忆和经验记忆,并通过自动测试-验证-写入循环完善元技能,实验证明该框架大幅提升安全成功率且不阻碍任务进展。
面向几何的不确定性聚类用于病理学中鲁棒的视觉上下文学习
机构 * FAU Erlangen-Nürnberg, Erlangen, DE(埃尔兰根-纽伦堡大学) ; Department of Computing, Imperial College London, London, UK(伦敦帝国理工学院计算机系)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出GAUC,一种无需训练的聚类选择方法,直接在预训练的多模态嵌入空间中操作,通过优化三个目标提升视觉上下文学习的鲁棒性、准确性和校准性。
先排序后行动:基于帧序进展的无奖励控制
机构 * T-Tech
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 提出Rank-Then-Act框架,利用视觉语言模型从专家视频中学习进度排序器,通过斯皮尔曼等级相关奖励函数实现无环境奖励的策略学习,在离散和连续控制任务中达到或超越现有方法。
Comments 20 pages, 15 figures
超越“一种语言,一种文字”:用PuMVR量化多语言视觉语言模型中的正字法偏差
机构 * RediMinds Inc.(RediMinds公司) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract_cn);visual reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出PuMVR基准,通过旁遮普语三种文字的图像推理任务,量化多语言视觉语言模型中的文字依赖偏差,发现文字一致性率低至24.8%,视觉输入无法消除偏差。
Comments 22 pages, 4 figures. Accepted to the 4th Workshop on Cross-Cultural Considerations in NLP (C3NLP) @ ACL 2026
多模态大语言模型在农业图像解释与生成任务中的幻觉行为
机构 * Texas A&M University System(德克萨斯大学系统)
专题命中 幻觉与鲁棒性 :LLaVA(abstract,abstract_cn);visual reasoning(abstract);分类 cs.CV、cs.AI
AI总结 本研究系统评估了多模态大语言模型在农业图像解释(图像到文本)和生成(文本到图像)任务中的幻觉行为,发现模型存在生物不一致、上下文不准确和农学不合理等错误模式,并通过少样本提示等方法分析了幻觉的残留影响。
VectorArk: 学习基于圆角多边形表示的实际图像矢量化
机构 * Adobe
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 提出VectorArk模型,采用圆角多边形表示和退化模型,实现鲁棒且实用的图像矢量化,在多个数据集上取得优越的几何完整性和伪影抑制效果。
Comments CVPR 2026. Project page: https://vectorark.github.io/
同鸟同群:通过VLMs中的线性结构实现背景不变表示
机构 * Independent Researcher(独立研究者)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文通过VLMs嵌入空间的高线性可加性,提出一种利用合成数据构建背景不变表示的方法,实现了Waterbirds数据集上90%以上的最差组准确率,并展示了良好的仿真到现实迁移能力。
Comments 36 pages, 7 figures
SemiFA:一种用于自主半导体故障分析报告生成的代理多模态框架
机构 * School of Artificial Intelligence and Data Engineering (SAIDE)(人工智能与数据工程学院) ; Indian Institute of Technology Jodhpur(印度理工学院贾尔普尔)
专题命中 幻觉与鲁棒性 :LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 SemiFA通过多代理语言图框架实现自主生成半导体故障分析报告,利用多模态数据融合提升根因分析精度,首次整合SECS/GEM设备 telemetry 进行自动化报告生成。
Comments 11 pages, 6 figures, 8 tables. Dataset available at https://huggingface.co/datasets/ShivamChand/SemiFA-930. Code available at https://github.com/Shivamckaushik/SemiFA
V-FAT:基于文本偏见的视觉真实性基准测试
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Meituan(美团) ; University of Oxford(牛津大学)
专题命中 幻觉与鲁棒性 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
AI总结 V-FAT通过三级评估框架量化文本偏见对视觉真实性的干扰,揭示多模态大语言模型在高语言主导性下的视觉崩溃问题。
Comments 12 pages, 6 figures
机构 * Nanyang Technological University(南洋理工大学) ; Beijing Jiaotong University(北京交通大学) ; A*STAR Project Page(A*STAR项目页面)
专题命中 幻觉与鲁棒性 :LLaVA(abstract);InternVL(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 幻觉与鲁棒性 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG
Comments ICML 2024
视觉-语言模型中的源模态监控
机构 * Department of Computer Science, Brown University(布朗大学计算机科学系)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)
AI总结 研究探讨了多模态模型追踪并沟通信息来源的能力,分析了语法与语义信号在绑定提示词与输入组件中的作用,发现语义信号在模态分布差异大时更占主导。
Comments Accepted at COLM 2026. All resources will be available at https://github.com/ethahtz/source-modality-monitoring
跨模态对抗扩散:文本、视觉与视觉-语言模型的攻击、防御与评估融合综述
机构 * Information and Computer Science Department, King Fahd University of Petroleum & Minerals(国王法赫德石油矿物大学信息与计算机科学系) ; College of Computer Science and Information Technology, Imam Abdulrahman Bin Faisal University(伊玛目阿卜杜勒拉赫曼·本·法伊塞尔大学计算机科学与信息科技学院) ; SDAIA-KFUPM Joint Research Center for Artificial Intelligence, King Fahd University of Petroleum & Minerals(SDAIA-KFUPM人工智能联合研究中心,国王法赫德石油矿物大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)
AI总结 本文整合了文本、图像分类器和视觉-语言模型上的对抗攻击与防御研究,提出统一分类法和评估框架,并识别了当前文献中的五个常见弱点。