arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 238 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 238 篇

2608.13167 2026-08-14 cs.CV cs.AI cs.CL cs.LG 新提交 87%

TRAPSBench: Vision-Language Models Encode but Fail to Express Epistemic Restraint

TRAPSBench:视觉-语言模型可编码认知约束却无法表达

Fnu Pramono, John Cai, Sourabh Kulkarni

机构 * Meta Superintelligence Labs(元超级智能实验室) Reflection AI(反射人工智能公司)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 研究针对视觉-语言模型的认知约束表达问题,构建TRAPSBench基准并提出PECS指标,发现模型可感知不确定性却难表达,瓶颈在表达,需输出阶段干预。

Comments 10 Pages excluding Reference and Appendix, Published at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05909 2026-08-07 cs.CR 新提交 87%

MMAligner: Safeguarding Multimodal Large Language Models through Representation Calibration

MMAligner:通过表示校准保护多模态大语言模型

Shenyi Zhang, Keyan Guo, Zihao Wang, Xuebin Li, Lingchen Zhao, Hongxin Hu, Chao Shen, Qian Wang

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn)

AI总结 MMAligner通过校准多模态大语言模型的表示,将不安全多模态输入的拒绝率提升至99%,仅造成不足2%的效用下降,显著优化了安全与效用的权衡。

Comments To Appear in the Proceedings of The ACM Conference on Computer and Communications Security (CCS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17423 2026-06-17 q-fin.CP stat.ML 新提交 87%

Martingale Doppelgänger-Eval: An Identification Framework for Auditing Candlestick Understanding in Vision-Language Models

鞅双生评估:审计视觉语言模型对K线图理解的识别框架

Ziyao Wang

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn)

AI总结 提出Martingale Doppelgänger-Eval基准,通过受控实验识别VLM是否基于K线证据而非趋势外推进行判断,发现模型忽略或反向利用K线语义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05560 2026-08-07 cs.CV cs.CL 新提交 86%

From Sports to Safety: Benchmarking Proactive Risk Inference in MLLMs

从运动到安全:多模态大语言模型(MLLM)主动风险推理基准测试

Jiawei Qiu, Yichen Xu, Jianzhe Ma, Mingyang Yu, Wenbin Zhu, Yang Han, Pinzheng Lv, Wenxuan Wang

机构 * School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 幻觉与鲁棒性 :MLLM(title_cn,summary_cn);分类 cs.CV

AI总结 该研究构建了运动主动风险推理基准SPRINT,评估发现当前MLLM危险感知率高但原因识别率低,仅具备表层主动安全能力,缺乏稳定的基于原因的早期预警。

Comments Preprints

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08167 2026-08-11 cs.CV cs.LG 新提交 86%

Wiener Representation Filtering for VLM Hallucination Suppression

用于抑制视觉语言模型幻觉的维纳表示滤波

Ameen Ali, Tamim Zoabi, Lidor Brami, Lior Wolf

机构 * Tel Aviv University(特拉维夫大学)

专题命中 幻觉与鲁棒性 :VLM(title);LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 该研究提出一种无需训练的事后维纳表示滤波技术,通过离线校准校正视觉语言模型深层前馈输出投影,可在保持运行速度的同时降低其对象幻觉,在多类模型及基准上均验证了有效性与通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28696 2026-08-03 cs.LG cs.CV 新提交 86%

Mitigating Class-Tail Undercoverage in Medical Vision-Language Models under Clinical Shift

缓解临床分布偏移下医学视觉-语言模型的类别尾部覆盖不足问题

Mushir Akhtar, M. Tanveer

机构 * Indian Institute of Technology Indore(印度理工学院印多雷分校)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 本文针对临床分布偏移下医学VLMs的类别尾部覆盖不足问题,提出CALCoDe方法,在多个偏移场景和骨干网络上实现了所有设置下边际和最差类别覆盖度均达0.95的最优表现。

Comments 26 pages; supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31577 2026-07-01 cs.CV cs.LG 新提交 86%

Localized Conformal Prediction for Image Classification with Vision-Language Models

基于视觉语言模型的图像分类局部化共形预测

Clément Fuchs, Tim Bary, Benoît Macq

机构 * CÉCI F.R.S.-FNRS(比利时国家科学研究基金会) Walloon Region(瓦隆大区)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 针对图像分类中局部化共形预测未充分探索的问题,提出一种简单的余弦相似度非线性变换,在保持边际覆盖保证的同时显著降低平均集大小。

Comments 7 pages, 2 figures, 3 tables, code availables, accepted to EUVIP 2025

Journal ref 2025 13th European Workshop on Visual Information Processing (EUVIP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18839 2026-06-18 cs.LG cs.CV 新提交 86%

Semantic Robustness Certification for Vision-Language Models

视觉语言模型的语义鲁棒性认证

Peiyu Yang, Paul Montague, Feng Liu, Andrew C. Cullen, Amardeep Kaur, Christopher Leckie, Sarah M. Erfani

机构 * School of Computing \& Information Systems, University of Melbourne, Australia

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 提出首个无需额外数据即可认证视觉语言模型在语义层面(如形状、大小、风格)鲁棒性的框架,通过文本提示作为语义代理并量化决策边界,确保预测类别在语义变换下不变。

Comments Accepted to ICML

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09859 2026-06-10 cs.LG cs.AI 新提交 86%

Mitigating Manifold Departure: Uncertainty-Aware Subspace Rectification for Trustworthy MLLM Decoding

缓解流形偏离:面向可信MLLM解码的不确定性感知子空间校正

Yingxuan Zhuang, Jingxiao Yang, Miao Pan, Cheng Tan, Yuxiang Cai, Siwei Tan, Chen Zhi, Xuhong Zhang, Jianwei Yin, Jintao Chen

机构 * Nanyang Technological University(南洋理工大学)

专题命中 幻觉与鲁棒性 :MLLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出MGAP方法,通过SVD构建语言先验子空间并自适应衰减投影分量,在抑制幻觉的同时保持语义结构,优于现有解码基线。

Comments ICML 2026 regular

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07525 2026-08-11 cs.CL cs.AI 新提交 85%

Unified Hallucination Fuzzing for Multimodal Large Language Models

面向多模态大语言模型的统一幻觉模糊测试

Pengfei Zhou, Jiajun Song, Zhiwei Tang, Yixing Ma, Xiaopeng Peng, Donghui Si, Yuhang Xu, Huiqi Song, Yiyuan Miao, Yichen Qian, Weihua Chen, Wangbo Zhao, Bohan Zhuang, Jiasheng Tang, Yang You

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);grounding(abstract);分类 cs.AI

AI总结 针对多模态大语言模型的幻觉问题,提出含UniHall基准与SAMF自演化模糊测试的评估框架,发现SOTA模型在模糊测试下性能显著下降,存在有用性-幻觉权衡。

Comments 47 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21619 2026-07-27 cs.CL cs.AI 新提交 85%

Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization

对抗风格优化:通过基于GRPO的风格触发优化增强VLM越狱

Bingjun Luo, Jialin Guo, Yue Yao, Xinpeng Ding

机构 * Tsinghua University(清华大学) Harbin Engineering University(哈尔滨工程大学) Shandong University(山东大学) Xidian University(西安电子科技大学)

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 研究MLLMs安全对齐易受越狱攻击问题,提出基于GRPO的对抗风格优化(ASO)方法,通过优化风格触发增强视觉越狱,实验证明该方法显著提高攻击成功率,凸显风格偏差对MLLMs红队测试的作用。

Comments Accepted by CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31976 2026-07-01 cs.AI cs.MA 新提交 85%

TreeAgent: A Generalizable Multi-Agent Framework for Automated Bias Labeling in Forestry via Compiled Expert Rules and Vision-Language Models

TreeAgent: 一种基于编译专家规则和视觉语言模型的通用多智能体框架,用于林业自动化偏差标注

Shiyi Chen, Nicholas Saban, Collin Hargreaves, Huiqi Wang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出TreeAgent多智能体框架,结合专家决策树与视觉语言模型,通过解耦声明式决策实现零修改泛化,在树木偏差分类中超越监督学习基线并降低标注成本。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18325 2026-07-22 cs.CV cs.AI cs.RO 新提交 85%

Hazard or Anomaly? Evaluating VLMs for Understanding Dangers and Discrepancies

危险还是异常?评估用于理解危险和差异的视觉语言模型

Murali Indukuri, Mohammad Eskandari, Sree Nitya Kollu, Stephanie Lukin, Cynthia Matuszek

机构 * Interactive Robotics and Language Lab, University of Maryland Baltimore County(马里兰大学巴尔的摩县分校交互式机器人与语言实验室) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究针对现代安全关键系统中VLM的评估问题,通过明确区分危险和异常,在两个数据集及多种提示策略下评估多个先进VLM,发现其常误判,明确区分能提供更具信息性评估并揭示失败模式。

Comments 8 pages, accepted to RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09544 2026-07-13 cs.CV cs.LG 新提交 85%

The Count Is There, but Misaligned: Understanding and Correcting Counting Failures in VLMs

计数存在但未对齐:理解和纠正视觉语言模型中的计数失败

Ahmed Oumar El-Shangiti, Abzal Nurgazy, Hilal AlQuabeh, Nikolai Rozanov, Kentaro Inui

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Imperial College London(伦敦帝国学院)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 研究视觉语言模型计数失败问题,通过对VLM激活进行探测训练及分析,发现其虽常编码正确计数但输出错误,提出探测器引导的自校正方法,在不更新参数时提高计数准确率,揭示内部知识与模型输出差距并提供改进工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15623 2026-06-24 cs.LG cs.AI 新提交 85%

Surprise-Guided MergeSort: Budget-Efficient Human-in-the-Loop Ranking via Adaptive Comparison Scheduling

惊喜引导的归并排序:通过自适应比较调度实现预算高效的人机协同排名

Yujin Park, Haejun Chung, Ikbeom Jang

机构 * Hanyang University(汉阳大学) Hankuk University of Foreign Studies(韩国外国语大学)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 提出惊喜引导的归并排序(SGS)框架,利用视觉语言模型(VLM)作为问题优先级排序器,通过自适应预算分配将高模糊度比较路由给人类,在六个基准上以相同预算实现Kendall's τ×100提升6-12点。

Comments After submission, we discovered significant issues in the reference and citation information used in the manuscript. Because these issues affect the integrity of the scholarly record and require substantial revision and verification, we request withdrawal of the current submission. A corrected version may be submitted in the future after a comprehensive review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19683 2026-07-23 cs.CR 新提交 85%

GhostPrompt: Cross-Image Adversarial Prompt for Vision-Language Models

GhostPrompt:视觉语言模型的跨图像对抗性提示

Li Zeng, Zeyu Ye, Meng Xie, Hangtao Zhang, Xianlong Wang, Yanchun Li, Zhetao Li

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn)

AI总结 研究视觉语言模型对抗攻击问题,提出GhostPrompt方法,通过联合优化提炼图像不变对抗特征,跨图像引导模型输出,相比现有基线攻击成功率显著提高且计算时间大幅减少。

Comments Accepted to ACM MM 2026. Code: this https://github.com/Ye-ze-yu/GhostPrompt

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10269 2026-07-14 cs.CR 新提交 85%

Devil in the Lens: Analyzing and Defending Physical Prompt Injection Against Vision-Language Models on Wearable Devices

镜头中的恶魔:分析并防御可穿戴设备上针对视觉语言模型的物理提示注入

Yaxin Li, Hao Wang, Yanda Shao, Shuhao Zhang, Yan Long

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn)

AI总结 研究针对可穿戴设备上视觉语言模型的物理提示注入攻击,利用真实环境照片分析出6种威胁向量及对12个模型的影响,攻击成功率高,还提出基于掩码的外部过滤器和基于语义向量的内部检测器两种防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25629 2026-06-26 cs.RO eess.SP 新提交 85%

Event-Adaptive Motion Planning with Distilled Vision-Language Model in Safety-Critical Situations

安全关键场景下基于蒸馏视觉语言模型的事件自适应运动规划

Zhenwei Huang, Changsheng You, Shuai Wang, Chao Zhou, Wei Xu, Yi Gong

机构 * Southern University of Science and Technology(南方科技大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Manifold Tech Limited(曼孚科技股份有限公司)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn)

AI总结 提出事件自适应运动规划(EAMP)框架,通过可配置语义事件触发器、蒸馏视觉语言模型和语义模型预测控制,在安全关键场景中实现高层推理与底层控制的协同,提升动态安全裕度并保持实时性。

Comments 8 pages, 8 figures, 4 tables. Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24440 2026-07-28 cs.CV cs.CL cs.LG 新提交 84%

Bigger or Cheaper? Scale and Quantization Effects on Uncertainty Signals in Vision-Language Models Under Image Degradation

更大还是更便宜?图像退化下视觉语言模型中尺度和量化对不确定性信号的影响

M M Asif Ferdous

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract_cn,comments);分类 cs.CV、cs.LG

AI总结 研究在图像退化下视觉语言模型中尺度和量化对不确定性信号的影响,通过对Qwen2-VL系列模型的实验发现,尺度提升内部不确定性信号,4位量化对准确性影响小但对置信信号影响大,建议固定内存预算下选更大量化模型,如7B-4bit。

Comments 12 pages, 4 figures. Code and data: https://github.com/Asif-Ferdous/vlm-scale-quant

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08077 2026-08-11 cs.AI cs.MA cs.RO 新提交 84%

Explore, Map, Remember, Decide: Are Embodied VLMs Ready for Safety-Critical Scenarios?

探索、建图、记忆、决策:具身视觉语言模型是否已准备好应对安全关键场景?

Gabriele La Malfa, Nitay Alon, Emanuele La Malfa, Reuth Mirsky, Stefan Sarkadi

专题命中 幻觉与鲁棒性 :vision-language model(abstract,abstract_cn);VLM(abstract,abstract_cn);grounding(abstract);分类 cs.AI

AI总结 本文扩展ToS框架为EMRD流程,评估VLMs在安全关键场景下的空间理解与决策能力,发现其决策依赖文本先验、空间推理受低光照影响,且记忆与人类认知存在根本差异,存在对齐风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04604 2026-08-06 cs.CV 新提交 84%

COSMO: Consensus-Driven Shift Modulation for Source-Free Domain Adaptation

COSMO:面向无源域自适应的共识驱动偏移调制

Bo Li, Junjie Peng, Xiaohua Xie, Jianhuang Lai

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 针对无源域自适应的源衍生证据遗忘问题,提出COSMO方法,通过锚定共享共识的协同适配实现样本级可靠性分配,在四个基准上达到最优性能,平衡了源证据保留与VLM互补证据吸收。

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04885 2026-08-06 cs.CV cs.CL 新提交 83%

Evaluating the Diagnostic Robustness of Vision-Language Models Under Visual and Textual Perturbations

评估视觉-语言模型在视觉和文本扰动下的诊断鲁棒性

Ali Khoramfar, Mohammad Javad Dousti, Alireza Mohamadian, Heshaam Faili

机构 * University of Tehran(德黑兰大学) Tehran University of Medical Sciences(德黑兰医科大学) Advanced Diagnostic and Interventional Radiology Research Center (ADIR)(高级诊断与介入放射学研究中心(ADIR))

专题命中 幻觉与鲁棒性 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本研究通过脑部MRI数据集评估四类视觉-语言模型在视觉、文本扰动下的诊断鲁棒性,发现其存在预测翻转、文本选择偏差、诊断过度承诺等问题,指出需采用稳定性指标评估其临床应用可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04244 2026-08-06 cs.CV cs.CL 新提交 83%

SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models

SIGNPOST-Bench:评估多模态大语言模型文本-视觉冲突解决能力的基准

Sirun Li, Minghao Liu, Ling Dai, Yong Li, Haoxin Lyu, Junting Zhou, Fan Zhang

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 本研究推出SIGNPOST-Bench基准,通过包含5111个反事实组的25555个图像变体,评估20个多模态大语言模型的文本-视觉冲突解决能力,发现对抗文本会显著提升定位误差,且模型对冲突文本的鲁棒性无法由干净输入的定位性能完全预测。

Comments 27 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05264 2026-07-07 cs.CV 新提交 83%

SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments

SteelBench:真实工业环境下的视觉语言模型评估基准

Suryanarayana Reddy Yarrabothula, Manisha Chawla, Kunal Sinha, Gagan Raj Gupta, Sashank Lekkala, Ashirvadhan Dosapati, Saikamal Nannuri, Katragadda Ajay RamaSwamy Chowdary Gowtham

机构 * Indian Institute of Technology Bhilai(印度理工学院比莱分校) Steel Authority of India Limited(印度钢铁管理局有限公司) VIT Vellore(维洛尔理工学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 针对现有基准无法适配真实工业监控场景的问题,构建含1345条标注片段的SteelBench基准,评估视觉语言模型的工业活动识别、安全规则推理等能力,发现现有模型性能远低于人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14728 2026-06-16 cs.CV 新提交 83%

FUSE: Quantifying Uncertainty in Vision-Language Models by Bayesian Fusing Epistemic and Aleatoric Uncertainty

FUSE: 通过贝叶斯融合认知不确定性和偶然不确定性来量化视觉语言模型中的不确定性

Harry Zhang, Luca Carlone

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出FUSE概率框架,通过贝叶斯融合视觉语言模型中的偶然不确定性和认知不确定性,生成标量不确定性度量,用于可靠预测输出正确性,实现SOTA不确定性校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11626 2026-06-11 cs.CV 新提交 83%

Adapting Vision-Language Models from Iconic to Inclusive for Multi-Label Recognition Without Labels

将视觉-语言模型从标志性适应到包容性:用于无标签的多标签识别

Cheng Chen, Jingyu Zhou, Yifan Zhao, Jia Li

机构 * State Key Laboratory of Virtual Reality Technology and Systems, SCSE & QRI, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学计算机学院与青岛研究院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出无监督框架,通过“切割”和“缝合”两阶段适应VLMs,实现无标签的多标签图像识别,在四个数据集上超越现有无监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00218 2026-07-02 cs.CV cs.AI 新提交 82%

EgoSafetyBench: A Diagnostic Egocentric Video Benchmark for Evaluating Embodied VLMs as Runtime Safety Guards

EgoSafetyBench:用于评估具身VLM作为运行时安全卫士的诊断性自我中心视频基准

Siddhant Panpatil, Arth Singh, Mijin Koo, Chaeyun Kim, Haon Park, Dasol Choi

机构 * AIM Intelligence(AIM智能研究所) Seoul National University(首尔国立大学)

专题命中 幻觉与鲁棒性 :VLM(title_cn,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出EgoSafetyBench,一个包含1200个机器人视角场景的自我中心视频基准,用于评估视觉语言模型在流式安全监控中的能力,通过情景和视觉通道两个轨道测试模型识别危险和应对误导性文本的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32012 2026-07-01 cs.LG cs.CV 新提交 82%

CoMet: Context and Multiplicity Decomposition for Multimodal Uncertainty Estimation

CoMet:多模态不确定性估计的上下文与多样性分解

Sanghyuk Chun, William Yang, Amaya Dharmasiri, Olga Russakovsky

机构 * Princeton University(普林斯顿大学)

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 提出CoMet方法,将多模态大模型的不确定性分解为上下文项和多样性项,通过轻量级后验模块高效估计,无需自回归生成或重复采样,在多个基准上优于现有方法。

Comments 33 pages, 13.3MB

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07779 2026-06-09 astro-ph.IM astro-ph.GA 新提交 82%

Do Vision-Language Models See Dwarf Galaxies the Way We Do?

视觉语言模型是否像我们一样看待矮星系?

Dimitrios Tanoglidis, Chin Yi Tan, Kate Overdeck, Alex Drlica-Wagner

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract_cn)

AI总结 评估视觉语言模型在识别超暗矮星系候选体任务中的表现,发现零样本模型能复现人类整体校准,但在个体层面存在显著差异,且不确定性估计不可靠。

Comments 8 pages, 4 figures; Accepted at the Conference on Physics and AI at Stanford University (PAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00975 2026-08-04 cs.CV 新提交 81%

MonitorVLM-v2: A Deployed Vision-Language Framework for Real-Time Safety Violation Detection

MonitorVLM-v2:用于实时安全违规检测的已部署视觉-语言框架

Jiang Wu, Sichao Wu, Yinsong Ma, Lifang Zheng, Jingliang Duan

机构 * School of Mechanical Engineering, University of Science and Technology Beijing(北京科技大学机械工程学院) The Laboratory for Computational Sensing and Robotics, Johns Hopkins University(约翰霍普金斯大学计算传感与机器人实验室)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);分类 cs.CV

AI总结 本文提出MonitorVLM-v2框架,将VLM安全评估转化为有限符号空间概率推理,结合SymPO算法与熵驱动分类机制,在地下矿部署中实现19.45倍提速,确认违规量达人工检查的2.78倍,满足实时可审计工业监控需求。

详情

展开后加载摘要…

URL PDF HTML 收藏